本文へスキップ
株式会社オブライト

「量子化」のコラム

4件の記事

AI2026-08-20
Unsloth Dynamic 3.0 GGUF量子化とは?2.0からの変更点を解説
Unsloth Dynamic 3.0は学習後量子化(PTQ)のGGUF手法。imatrixキャリブレーションとレイヤー選択方式を刷新し、同じファイルサイズで他プロバイダ比top-1%精度が最大10%向上。2.0からの変更点、量子化ティア早見表、使い方をQwen3.8-27Bの実測値で解説。2026年8月更新。
GGUF量子化ローカルLLM
AI2026-08-13
ローカルLLM推論エンジン徹底比較 — llama.cpp/Ollama/vLLM/LM Studio/MLX/TensorRT-LLM
ローカルLLMの推論エンジンはどれを選ぶべきか。単機・個人利用はOllamaやllama.cpp、Apple SiliconはMLX、多数同時接続を捌くサーバはvLLM、NVIDIA本番の最適化はTensorRT-LLMが向く傾向を、対応フォーマット・量子化・VRAMやKVキャッシュの扱いの違いまで含めて整理する。
ローカルLLMローカルAIOllama
AI2026-07-24
GGUF量子化の選び方 — Q4_K_M / Q5_K_M / Q8_0 / IQ系の違いと使い分け【2026年版】
ローカルLLMを動かすとき、まず選ぶべきは Q4_K_M。VRAMに余裕があれば Q5_K_M / Q6_K で品質が上がります。GGUF量子化の命名規則、各レベルの品質・速度・VRAMのトレードオフ、IQ系(imatrix)との違い、用途別の選び方を解説。Updated July 2026。
GGUF量子化ローカルLLM
AI2026-07-15
PrismML Bonsai 27B 徹底解説 — Qwen3.6-27Bを実効1.71bit/1.125bitに圧縮、「27BクラスがiPhoneで動く」を実現した超低bit量子化(2026-07-14発表)
PrismMLが2026年7月14日に公開したBonsai 27Bを徹底解説。Qwen3.6-27Bを再学習なしでTernary(実効1.71bit・5.9GB・FP16比94.6%)と1-bit(1.125bit・3.9GB・89.5%)に圧縮し、iPhone 17 Proでの動作を実現。量子化の仕組み・ベンチマーク・既存低bit手法との違い・オンデバイスAIへの影響を図解付きで整理します。
PrismMLBonsai 27B量子化