本文へスキップ
株式会社オブライト
サービス
私たちについて
会社概要
コラム
用語集
料金
無料ツール
お問い合わせ
English
English
メニューを開く
コラム
Self-hosted
「Self-hosted」のコラム
2件の記事
AI
2026-06-23
ローカル LLM 2026年6月最新版 — 4月版からの差分整理 GLM-5.2 が OSS 首位(Intelligence Index v4.1 で 51 点)、MiniMax M3 が 1M context + SWE-Bench Pro 59%、NVIDIA Nemotron 3 Ultra 550B Blackwell ネイティブ MXFP4 で RTX 5090 が 30-70B 実用域 日本ではインテック ¥5M〜の SI、リコー オンプレ LLM スターターキットが日経最優秀賞、PFN PLaMo + デジタル庁『源内』採用、EU AI Act 2026-08-02 施行迫る
2026年4月に公開した[ローカル LLM 徹底比較コラム](../columns/local-llm-landscape-2026-april-comprehensive-comparison)から2ヶ月、**何が変わったか** を一次ソース中心に整理した最新版です。 **3つの大変化**: **(1) OSS 性能がクローズドと肉薄** — [GLM-5.2](https://simonwillison.net/2026/Jun/17/glm-52/)(Z.ai、MIT、2026-06-16)が Intelligence Index v4.1 で **51 点**(MiniMax M3 44 / DeepSeek V4 Pro 44 / Kimi K2.6 43 を抜いて OSS 首位)。[MiniMax M3](https://kilo.ai/open-source-models) が **1M context・ネイティブマルチモーダル・SWE-Bench Pro 59.0%・Terminal-Bench 2.1 66.0%・MCP Atlas 74.2%**。[NVIDIA Nemotron 3 Ultra](https://research.nvidia.com/labs/nemotron/Nemotron-3/)(Computex 2026 で Jensen Huang 発表、**550B パラメータ**、米国 OSS 首位)。[VibeThinker-3B](https://arxiv.org/pdf/2606.16140)(WeiboAI、MIT、Qwen2.5-Coder-3B fine-tune、**3B で frontier reasoner 並み**)。 **(2) Blackwell でコンシューマ GPU が 30-70B 実用域** — RTX 5090 は **32GB GDDR7・1,792 GB/s 帯域**(4090 比 +77%)・**ネイティブ MXFP4 で GGUF Q4 を emulation 0** で実行可。Qwen 2.5-Coder-7B で **5,841 tok/s**(batch 8、A100 80GB の 2.6 倍)。RTX PRO 6000 Blackwell は 30B モデルで **~8,425 tok/s**、B200 は **192GB HBM3e・8 TB/s・H100 比 4-5 倍**。 **(3) 日本企業の SI 化が本格化** — **インテック**(TIS グループ)が2026-01-29 から **ローカル LLM 導入支援 SI、最短1ヶ月・参考価格 ¥5,000,000〜**。**リコー**「**RICOH オンプレ LLM スターターキット**」が **2025年日経優秀製品・サービス賞最優秀賞** 受賞(Qwen2.5-VL-32B-Instruct ベース)。PFN [PLaMo 3.0 Prime](../columns/plamo-3-0-prime-pfn-japanese-llm-2026-06) が **デジタル庁『源内』採用**。Mizuho / Lion の Qwen 国内ファインチューン precedent と並ぶ。 さらに [Kimi K2.7-Code](../columns/kimi-k2-7-code-moonshot-ai-2026-06)・[Sakana Fugu](../columns/sakana-fugu-orchestration-model-2026-06)・[DiffusionGemma](../columns/diffusiongemma-google-text-diffusion-2026-06)・[Liquid AI LFM2.5-J](../columns/liquid-ai-lfm25-japanese-models-2026-06) など同時期の動きも整理。 推論エンジン選定(**AWQ + vLLM = GPU 最速、GGUF + llama.cpp = CPU/エッジ、SGLang = エージェント、TensorRT-LLM = NVIDIA クラスタ**)、量子化(BitNet 1.58-bit / MXFP4 / AWQ)、規制動向(**EU AI Act 2026-08-02 施行・systemic risk threshold 10^25 FLOPs**、米輸出規制 [Fable 5 precedent](../columns/claude-fable-5-export-control-suspension-2026-06)、中国系のデータ越境)、典型 GPU 構成、オブライト視点の3ステップ導入論まで。 記事末尾に **ローカル LLM 導入・構築・保守の3つの問い合わせ導線** を設置しています。
Local LLM
Open Weight
Self-hosted
AI
2026-06-15
Kimi K2.7-Code 徹底解説 — Moonshot AI が2026年6月12日に公開したコーディング特化 1T MoE オープン重みモデル、Modified MIT・$0.95/$4.00・256K context、ただし日本企業はデータ越境とベンチ独立検証未確立の2大論点に注意
Moonshot AI(北京)が2026年6月12日に公開したコーディング特化新フラッグシップ **Kimi K2.7-Code** を、[Hugging Face モデルカード](https://huggingface.co/moonshotai/Kimi-K2.7-Code)・[MarkTechPost](https://www.marktechpost.com/2026/06/12/moonshot-ai-releases-kimi-k2-7-code-a-coding-model-reporting-21-8-on-kimi-code-bench-v2-over-k2-6/)・[VentureBeat](https://venturebeat.com/technology/kimi-k2-7-code-cuts-thinking-tokens-30-practitioners-say-benchmarks-dont-check-out)を一次ソースに整理。**1T 総パラメータ / 32B アクティブ MoE**(384 expert / 8 active + 1 shared)、**256K コンテキスト**、MoonViT ビジョンエンコーダ400M、INT4 ネイティブ、思考モード強制有効。**Modified MIT License**(月間1億 MAU または $20M MRR 超でのみ Kimi K2 表示義務)、API は **入力 $0.95 / キャッシュヒット $0.19 / 出力 $4.00 per 1M トークン**(Claude Opus 4.8 の出力単価約1/18)。OpenAI 互換 + Anthropic 互換 API で Claude Code / Cursor / Aider / Cline / cmux に即組込可能。**K2.6 比でベンチ +21.8%、思考トークン -30%** と Moonshot 自社主張、ただし **公式ベンチがすべて自社プロプライエタリで SWE-bench Verified / Pro / FrontierCode の独立検証スコアは2026年6月15日時点で未公開**(VentureBeat 批判)。日本企業視点では **(1) `api.moonshot.cn` および Singapore 子会社経由の `api.moonshot.ai` ともに中国国家情報法第7条の compelled-disclosure リスク(2025年2月 PPC DeepSeek 注意喚起・デジタル庁事務連絡の precedent)、(2) Hugging Face セルフホスト(≥4-8 H100 / INT4 595GB)が Mizuho / Lion の Qwen 国内ファインチューン precedent パターンに沿った唯一の確実解** という2大論点を率直に整理しています。
Moonshot AI
Kimi K2.7-Code
Open Weight LLM