本文へスキップ
株式会社オブライト
サービス
私たちについて
会社概要
コラム
用語集
料金
無料ツール
お問い合わせ
English
English
メニューを開く
コラム
ローカルLLM
「ローカルLLM」のコラム
30件の記事
AI
2026-08-17
Needle 2とは?14MBバイナリで動くCactus Compute製オンデバイス・エージェントLLMを解説
Needle 2は45Mパラメータ・単一14MBバイナリで動くCactus Compute製のオンデバイス・エージェント向け小型LLM。tool calling/device use/structured extractionに特化し、Raspberry Pi 5から廉価スマホまで動作。仕組みと導入方法を解説(2026年8月更新)。
Needle 2
Cactus Compute
On-device AI
AI
2026-08-15
Qwen3.8-27B 必要スペック早見表 — VRAM 9〜56GB / Apache-2.0で商用利用可【2026年版】
2026年8月15日にweightsが公開されたQwen3.8-27Bの必要VRAMを、公式配布ファイルの実容量から早見表で解説。Q4_K_Mは17.1GBで16GB GPUには載らず、IQ4_XS(15.7GB)が現実解となる。ライセンスはApache-2.0で商用利用可。
Qwen 3.8
Requirements
VRAM
AI
2026-08-13
ローカルLLM推論エンジン徹底比較 — llama.cpp/Ollama/vLLM/LM Studio/MLX/TensorRT-LLM
ローカルLLMの推論エンジンはどれを選ぶべきか。単機・個人利用はOllamaやllama.cpp、Apple SiliconはMLX、多数同時接続を捌くサーバはvLLM、NVIDIA本番の最適化はTensorRT-LLMが向く傾向を、対応フォーマット・量子化・VRAMやKVキャッシュの扱いの違いまで含めて整理する。
ローカルLLM
ローカルAI
Ollama
AI
2026-08-12
Nemotron 3.5 LightningとNeMo Switchyardとは — 常時稼働エージェント向け新スタック
NVIDIAが発表したNemotron 3.5 Lightningは総パラメータ30B・アクティブ3BのMoEモデルで出力スループット最大4倍を実現する。ルーティングライブラリNeMo Switchyardは精度を保ったまま完了コストを約3分の1に削減。常時稼働エージェント向けの新スタックを解説する。
NVIDIA
Nemotron
ローカルLLM
AI
2026-08-11
Muse Glimmer 30B 必要スペック早見表 — VRAM 20〜64GB/RTX 3090〜・M4 Max対応、Metaのローカルエージェントモデル【2026年版】
Muse Glimmer 30Bは4bit量子化で約20GB、24GBのGPUやMacで動作します。Metaが2026年8月10日に発表したエージェント特化のオープンウェイトモデルの必要VRAM・GPU・Mac対応状況を量子化別の早見表で整理し、RTX 5090やM4 Maxでの動作目安も解説。2026年8月更新。
ローカルLLM
オープンソースLLM
AIエージェント
AI
2026-08-07
LFM2.5-2.6B 徹底解説 — オンデバイス・エージェント特化モデルの必要スペックとVRAM【2026年8月最速レビュー】
Liquid AIが2026年8月公開したオンデバイス・エージェント特化モデル「LFM2.5-2.6B」を解説。パラメータ2.69B、メモリ2.5GB未満、128Kコンテキスト、ToolSandboxでQwen3.5-9Bを上回った公表値、量子化別メモリ目安、実測速度、ライセンス、動かし方まで網羅する。
Liquid AI
LFM2.5
Requirements
AI
2026-08-06
Shieldstral 1.0 3B 徹底解説 — Mistral製オープンウェイト・マルチモーダル安全性審査モデル、VRAM16GB・Apache 2.0で商用利用可【2026年8月最速レビュー】
Shieldstral 1.0 3BはMistral AIが2026年8月4日に公開したApache 2.0のオープンウェイト・マルチモーダル安全性審査モデルだ。BF16推論時のVRAM目安は16GBで、テキストと画像を単一モデルで一括審査できる。入出力フォーマットと動かし方のポイントをまとめて解説する。
Mistral
Requirements
VRAM
AI
2026-08-03
MiniMax H3 必要スペック早見表 — VRAM 12〜80GB・配布ファイル合計42.5〜123.6GBと量子化別の動作条件【2026年8月オープンウェイト動画生成】
MiniMax H3は2026年8月3日にオープンウェイトが公開された、動画と音声を同時生成するモデル。ComfyUI推奨の最小構成なら配布ファイル合計は約42.5GB、VRAMはコミュニティ報告で24GB前後(12GBでも動作しうるとの報告あり)が目安。量子化別の必要スペックとGPU選びをまとめた早見表を示す。
MiniMax
Requirements
VRAM
AI
2026-08-02
WASTE推論エンジン — Kimi K3をRAM29GBで動かす仕組み
WASTEは2.78兆パラメータのKimi K3をRAM29GBのノートPCで動かせるC製推論エンジン。NVMeから専門家重みをストリーミングし先読みルータで計算とI/Oを重ねる仕組みと実測スループット0.45〜0.62 tok/sを解説。ビルド手順やUSB外付けとの速度差、量子化、実用性の限界まで整理する。
Kimi K3
Moonshot AI
MoE
AI
2026-08-01
K-EXAONE 2.0 750B-A37Bとは — 自前で動かす条件とVRAM試算
LG AI Researchが2026年7月31日公開のK-EXAONE 2.0 750B-A37Bは総パラ750B・BF16で重み約1.5TB。FP8で750GB、4bit級でも375〜420GBが必要な条件と、Apache 2.0ライセンス・日本語対応・vLLM/SGLangのカスタムfork事情を整理します。
K-EXAONE
LG AI Research
Open Weight LLM
AI
2026-07-30
Qwen Scribe 徹底解説 — Apple Silicon Macで完全ローカルの文字起こし・音声入力(Qwen3-ASR / MLX)
Apple Silicon Mac上でQwen3-ASRをMLXで動かし、文字起こしとシステム全体の音声入力(ディクテーション)を完全ローカルで行うOSS「Qwen Scribe」を解説。必要メモリは1.7Bで約3.4GB・0.6Bで約1.2GB。動作要件、導入手順、右⌘押しながら話すだけの使い方、SRT出力、必要な3つの権限、Whisper系との違い、業務で使う際の注意点までGitHub公式READMEの一次情報に基づき整理します(2026年7月)。
ローカルLLM
音声入力
音声認識
AI
2026-07-27
Kimi K3 のweightsが公開 — 2.8T MoEを自前で動かす条件(MXFP4・約1.4TB)
Moonshot AI が Kimi K3(2.8兆パラメータMoE)のweightsを2026年7月26日に公開。MXFP4で重みだけ約1.4TB、実質H100 80GB×64基級のクラスタが必要で単体GPUやMacでは動きません。必要ハードと現実的な3択を整理。
Kimi K3
Moonshot AI
Open Weight LLM
AI
2026-07-24
GGUF量子化の選び方 — Q4_K_M / Q5_K_M / Q8_0 / IQ系の違いと使い分け【2026年版】
ローカルLLMを動かすとき、まず選ぶべきは Q4_K_M。VRAMに余裕があれば Q5_K_M / Q6_K で品質が上がります。GGUF量子化の命名規則、各レベルの品質・速度・VRAMのトレードオフ、IQ系(imatrix)との違い、用途別の選び方を解説。Updated July 2026。
GGUF
量子化
ローカルLLM
AI
2026-07-23
Ollama vs LM Studio 徹底比較 — ローカルLLMを動かすツールの選び方【2026年版】
ローカルLLMを動かす二大ツール、Ollama と LM Studio を2026年版で比較。CLI型とGUI型の違い、インストール・使い方・API・対応OS・モデル形式を整理し、用途別の使い分けを解説します。
Ollama
LM Studio
ローカルLLM
AI
2026-07-21
LongCat-2.0 必要スペック早見表 — VRAM 970GB〜/1.6T MoE をどう動かすか【2026年版】
LongCat-2.0はMeituan公開の1.6TパラメータMIT MoEモデル。ローカル実行はBF16で約3,800GB、INT4でも約970GB級のメモリが必要で個人PCでは動かない。必要スペック早見表とAPI料金(入力$0.75/出力$2.95・100万トークンあたり)を2026年7月時点でまとめた。
LongCat-2.0
Requirements
VRAM
AI
2026-07-21
DeepSeek V4 必要スペック早見表 — Flash 約160GB / Pro 約920GB(4-bit)と API 料金・旧モデル廃止(7/24)まとめ【2026年 0731ビルド対応】
DeepSeek V4 をローカルで動かす必要メモリは、V4-Flash(284B)が4-bitで約160GB、V4-Pro(1.6T)が4-bitで約920GB。7月31日公開の V4-Flash-0731 はスペック据え置きで性能のみ向上した。量子化別のVRAM・RAM早見表、API料金、1MコンテキストのKVキャッシュ、旧モデル廃止への移行手順まで。Updated August 2026。
DeepSeek V4
Requirements
VRAM
AI
2026-07-20
NVIDIA Nemotron 3 必要スペック早見表 — Nano/Super/Ultra のVRAM・GPU構成・量子化別メモリ【2026年版オープンウェイト】
Nemotron 3 Nanoは4-bitで約18GB、Superは8×H100-80GB、UltraはNVFP4で4×B200が公式の目安。NVIDIAのオープンウェイトMoE 3モデルの必要VRAM・GPU構成・量子化別メモリを早見表で整理する。2026年7月時点。
Nemotron 3
NVIDIA
Requirements
AI
2026-07-18
GLM-5.2 必要スペック早見表 — VRAM 約180GB〜1.5TB / 量子化別メモリと動作環境【2026年オープンウェイト753B MoE・MIT】
GLM-5.2(Z.ai)を動かす必要メモリは4-bit量子化で約430GB、BF16フル精度なら約1.5TB。753B総パラメータ/約40BアクティブのオープンウェイトMoE(MITライセンス)をローカル実行するためのVRAM・量子化・GPU早見表。2026年7月時点で最強クラスのオープンウェイトモデルの動作環境を整理。
GLM-5.2
Z.ai
Requirements
AI
2026-07-18
Inkling(Thinking Machines)必要スペック早見表 — VRAM 280GB〜1.9TB / 量子化別メモリと動作環境【2026年オープンウェイト975B MoE】
Inklingの必要メモリは最小280GB(1-bit量子化)、4-bitで約600GB、BF16フル精度で1.9TB。975B総パラメータ/41BアクティブのオープンウェイトMoEを動かすVRAM・RAM・ディスク・量子化別要件を早見表で一覧化。2026年7月版。
Inkling
Thinking Machines
Requirements
AI
2026-07-18
Kimi K3(Moonshot AI)とは — 2.8T MoEの実力・API料金・ローカル実行の現実(K2との違い/weights 7/27公開予定)【2026年版】
Kimi K3は2.8兆パラメータのオープンウェイトMoE(weightsは2026年7月27日公開予定)。フロントエンドコードArenaで1位。API料金は入力$3/出力$15(100万トークン)。ローカル実行は推定650GB〜1TBでサーバー級が必要。K2からの違いを解説。
Kimi K3
Moonshot AI
Open Weight LLM
AI
2026-05-05
NVIDIA DGX Spark で「機密コードはローカルLLM、移植本番はクラウドLLM」を実装する — 2026年版・経営承認を通すリスクヘッジ運用ガイド
NVIDIA DGX Spark(GB10 Grace Blackwell Superchip、128GB ユニファイドメモリ、約 1 PFLOPS FP4、$4,699)の主要スペックと、機密性の高いコード資産の解析・移植案件で「ローカルLLMで分析・個人情報分離→他社LLMで移植」というリスクヘッジを組むための具体的な運用パターンを解説します。クラウドAIのオプトアウトでは経営承認が下りないケースをどう乗り越えるか、実務目線で整理。
NVIDIA
DGX Spark
ローカルLLM
AI
2026-04-17
NousResearch Hermes完全ガイド — Hermes 4.3 36B・Function Calling・Hermes Agentの全貌【2026年版】
NousResearch Hermesシリーズの最新版Hermes 4.3 36B(512Kコンテキスト)とエージェントフレームワーク「Hermes Agent」を徹底解説。Function Calling実装例、Ollama対応、ハードウェア要件まで網羅した2026年版完全ガイド。
Hermes
NousResearch
Function Calling
AI
2026-04-10
2026年4月ローカルLLM最新全体像 — 主要10モデル完全比較ガイド【Ollama対応表付き】
2026年4月時点の主要ローカルLLM10モデルを徹底比較。SWE-benchスコア・日本語性能・VRAM要件・Ollamaコマンド・ライセンスを一覧化。Gemma 4、Llama 4、Qwen 3.5、GLM-5.1、Kimi K2.5、MiniMax M2.5など最新モデルを網羅したガイド。
ローカルLLM
オープンソースAI
2026年
AI
2026-04-10
Qwen 3.5 27B Dense&35B-A3B MoE完全ガイド — DFlash高速化で24GB GPUの限界を突破【2026年版】
Qwen 3.5 27B DenseとMoE 35B-A3Bの違い、24GB GPUでの動作要件、DFlash技術による2〜3倍高速化、Ollamaセットアップ手順をわかりやすく解説します。
Qwen 3.5
27B Dense
35B-A3B MoE
AI
2026-04-07
Gemma 4 E4B完全ガイド — エッジデバイスで動く4.5Bパラメータマルチモーダルモデルの実力と活用法【2026年版】
Gemma 4 E4BはGoogleが2026年4月にリリースした4.5BパラメータのエッジAIモデルです。Apple SiliconやRaspberry Piでのローカル動作手順、マルチモーダル機能、量子化設定、ベンチマーク比較まで徹底解説します。
Gemma 4
Gemma 4 E4B
エッジAI
AI
2026-04-04
Claude代替ローカルLLM総合比較2026 — Qwen 3.5・Mistral Small 4・DeepSeek R1・Gemma 4を徹底検証
Anthropic Claude制限変更を受け、Qwen 3.5-9B、Mistral Small 4、DeepSeek R1、Gemma 4、Llama 4などのローカルLLMを徹底比較。日本語性能、ハードウェア要件、用途別おすすめモデルを詳細解説します。
ローカルLLM
Qwen 3.5
Mistral Small 4
AI
2026-04-04
AI API従量課金時代のコスト最適化戦略 — Claude・GPT・Gemini・ローカルLLMの賢い使い分け【2026年版】
AI API従量課金時代のコスト最適化戦略を徹底解説。Claude・GPT・Geminiの料金比較、プロンプトキャッシュ・バッチAPI・ローカルLLMハイブリッド運用など5つの削減テクニック、月間コストシミュレーション、ROI計算方法まで完全網羅。
AI API
コスト最適化
従量課金
AI
2026-04-04
ハイブリッドAI活用ガイド — クラウドAPI+ローカルLLMでコスト50%削減を実現する方法【2026年版】
ハイブリッドAI戦略(クラウドAPI+ローカルLLM)でAI運用コストを50%以上削減する実践ガイド。Qwen 3.5、DeepSeek R1などのローカルモデルとClaude、GPT、Geminiを組み合わせた最適なアーキテクチャ設計と実装手順を解説します。
ハイブリッドAI
ローカルLLM
コスト削減
AI
2026-04-03
Gemma 4入門ガイド — 概要・特徴・Ollamaでの始め方【2026年完全解説】
Googleが2026年4月2日にリリースしたGemma 4の完全ガイド。E2B、E4B、26B MoE、31B Denseの4バリアント、Apache 2.0ライセンス、マルチモーダル対応など最新情報とOllamaでの実行方法を詳しく解説します。
Gemma 4
Ollama
Google
AI
2026-04-03
Gemma 4 vs Llama 4 vs Qwen 3.5徹底比較 — 2026年ローカルLLM選定ガイド
Gemma 4、Llama 4、Qwen 3.5の3大ローカルLLMを徹底比較。ベンチマーク性能、ライセンス、日本語対応、ハードウェア要件、ユースケース別の選定基準を詳しく解説します。
Gemma 4
Llama 4
Qwen 3.5