本文へスキップ
株式会社オブライト

「MoE」のコラム

18件の記事

AI2026-08-01
K-EXAONE 2.0 750B-A37Bとは — 自前で動かす条件とVRAM試算
LG AI Researchが2026年7月31日公開のK-EXAONE 2.0 750B-A37Bは総パラ750B・BF16で重み約1.5TB。FP8で750GB、4bit級でも375〜420GBが必要な条件と、Apache 2.0ライセンス・日本語対応・vLLM/SGLangのカスタムfork事情を整理します。
K-EXAONELG AI ResearchOpen Weight LLM
AI2026-07-27
Kimi K3 のweightsが公開 — 2.8T MoEを自前で動かす条件(MXFP4・約1.4TB)
Moonshot AI が Kimi K3(2.8兆パラメータMoE)のweightsを2026年7月26日に公開。MXFP4で重みだけ約1.4TB、実質H100 80GB×64基級のクラスタが必要で単体GPUやMacでは動きません。必要ハードと現実的な3択を整理。
Kimi K3Moonshot AIOpen Weight LLM
AI2026-07-21
LongCat-2.0 必要スペック早見表 — VRAM 970GB〜/1.6T MoE をどう動かすか【2026年版】
LongCat-2.0はMeituan公開の1.6TパラメータMIT MoEモデル。ローカル実行はBF16で約3,800GB、INT4でも約970GB級のメモリが必要で個人PCでは動かない。必要スペック早見表とAPI料金(入力$0.75/出力$2.95・100万トークンあたり)を2026年7月時点でまとめた。
LongCat-2.0RequirementsVRAM
AI2026-07-21
DeepSeek V4 必要スペック早見表 — Flash 約160GB / Pro 約920GB(4-bit)と API 料金・旧モデル廃止(7/24)まとめ【2026年正式版】
DeepSeek V4 をローカルで動かす必要メモリは、V4-Flash(284B)が4-bitで約160GB、V4-Pro(1.6T)が4-bitで約920GB。量子化別のVRAM・RAM早見表、API料金(Flash 出力 $0.28/1M・Pro $0.87/1M)、1Mコンテキスト時のKVキャッシュ、そして2026年7月24日の deepseek-chat / deepseek-reasoner 廃止への移行手順までまとめた。Updated July 2026。
DeepSeek V4RequirementsVRAM
AI2026-07-20
NVIDIA Nemotron 3 必要スペック早見表 — Nano/Super/Ultra のVRAM・GPU構成・量子化別メモリ【2026年版オープンウェイト】
Nemotron 3 Nanoは4-bitで約18GB、Superは8×H100-80GB、UltraはNVFP4で4×B200が公式の目安。NVIDIAのオープンウェイトMoE 3モデルの必要VRAM・GPU構成・量子化別メモリを早見表で整理する。2026年7月時点。
Nemotron 3NVIDIARequirements
AI2026-07-18
GLM-5.2 必要スペック早見表 — VRAM 約180GB〜1.5TB / 量子化別メモリと動作環境【2026年オープンウェイト753B MoE・MIT】
GLM-5.2(Z.ai)を動かす必要メモリは4-bit量子化で約430GB、BF16フル精度なら約1.5TB。753B総パラメータ/約40BアクティブのオープンウェイトMoE(MITライセンス)をローカル実行するためのVRAM・量子化・GPU早見表。2026年7月時点で最強クラスのオープンウェイトモデルの動作環境を整理。
GLM-5.2Z.aiRequirements
AI2026-07-18
Inkling(Thinking Machines)必要スペック早見表 — VRAM 280GB〜1.9TB / 量子化別メモリと動作環境【2026年オープンウェイト975B MoE】
Inklingの必要メモリは最小280GB(1-bit量子化)、4-bitで約600GB、BF16フル精度で1.9TB。975B総パラメータ/41BアクティブのオープンウェイトMoEを動かすVRAM・RAM・ディスク・量子化別要件を早見表で一覧化。2026年7月版。
InklingThinking MachinesRequirements
AI2026-07-18
Kimi K3(Moonshot AI)とは — 2.8T MoEの実力・API料金・ローカル実行の現実(K2との違い/weights 7/27公開予定)【2026年版】
Kimi K3は2.8兆パラメータのオープンウェイトMoE(weightsは2026年7月27日公開予定)。フロントエンドコードArenaで1位。API料金は入力$3/出力$15(100万トークン)。ローカル実行は推定650GB〜1TBでサーバー級が必要。K2からの違いを解説。
Kimi K3Moonshot AIOpen Weight LLM
AI2026-07-08
Gemma 4 Technical Report 徹底解説 — Google DeepMind の 2.3B〜31B オープンウェイト・マルチモーダル LLM、12B は encoder-free 統一設計、reasoning mode 標準搭載 [arXiv:2607.02770](https://arxiv.org/abs/2607.02770) 2026-07-02 公開、300+ 著者、Dense + MoE 両バリアント
**Google DeepMind の Gemma Team が [arXiv:2607.02770](https://arxiv.org/abs/2607.02770) として 2026-07-02 に Gemma 4 Technical Report を公開**。**2.3B / 12B / 31B のパラメータ範囲**、**Dense と MoE の両バリアント**、**text / image / audio ネイティブマルチモーダル**、**12B は encoder-free 統一設計**(raw audio と image patches を追加エンコーダなしで直接処理)、**reasoning mode(thinking mode)標準搭載**、**改良された vision / audio エンコーダ**、**推論速度・メモリ効率・long context の architectural refinement**、**STEM / multimodal / long-context ベンチで上位オープンモデルと競合**。300 名以上の著者による大規模プロジェクト。オープンウェイトのため商用利用可、Hugging Face・Ollama で配布。位置付けは [Qwen 3.6-35B-A3B](../columns/qwen36-35b-a3b-uncensored-abliterated-2026-07)・[ローカル LLM 2026 年 6 月版](../columns/local-llm-landscape-2026-june-update) と並ぶオープンウェイト最前線の新章。**Google の open-weights 戦略の到達点**、encoder-free unified 設計は Qwen / Llama / DeepSeek のマルチモーダル手法(別途 vision encoder + projection)と一線を画す。**reasoning mode** は Anthropic / OpenAI クローズドモデルの extended thinking との対称、オープン側の追随。留保: 商用ライセンスの詳細条件、systemic-risk(EU AI Act 10^25 FLOPs 閾値)該当可能性、Google Cloud Vertex AI との統合エコシステム偏重。
Gemma 4Google DeepMindOpen Weight
AI2026-07-05
Qwen3.6-35B-A3B Uncensored / Abliterated 徹底解説 — 35B MoE / 3B アクティブ / 262K context / hybrid linear+softmax 3:1 / text+image+video 対応、refusal 0/465、コミュニティ製 uncensored 派生の技術と倫理 HauhauCS Aggressive・huihui-ai abliterated・wangzhang abliterated・prithivMLmods など複数バリアント、Hugging Face + Ollama で配布
**Qwen3.6-35B-A3B-Uncensored / Abliterated** は、Alibaba の Qwen 3.6-35B-A3B(MoE、35B 総パラメータ / 3B アクティブ、262K context、hybrid attention)をベースに、**コミュニティ有志が『拒否挙動(refusal)を除去』した派生モデル群**([HackerNoon 解説](https://hackernoon.com/qwen36-35b-a3b-uncensored-a-35b-moe-model-with-262k-context) / [HauhauCS Aggressive](https://huggingface.co/HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive) / [huihui-ai abliterated](https://huggingface.co/huihui-ai/Huihui-Qwen3.6-35B-A3B-abliterated) / [wangzhang abliterated](https://huggingface.co/wangzhang/Qwen3.6-35B-A3B-abliterated) / [prithivMLmods Aggressive](https://huggingface.co/prithivMLmods/Qwen3.6-35B-A3B-Uncensored-Aggressive))。 **ベースモデルの仕様**: **35B 総パラメータ / 3B アクティブ**(MoE、sparse expert 構造)、**40 層**、**hybrid attention**(linear + full softmax の **3:1 比率**)、**262K トークン native context**、**text / image / video** ネイティブマルチモーダル入力。Alibaba のオープンウェイト戦略の中核モデル。 **Abliteration 技術**: **『拒否方向』を LoRA ベースの steering** で attention / MLP projection から除去。追加で **Expert-Granular Abliteration (EGA)**(各層の expert down_proj スライス単位で abliteration)、**MoE router suppression**(safety expert を router 段階で無効化)という MoE 特化技法を組み合わせている。HauhauCS の内部テストでは **465 プロンプトのテストで 0 refusal** と報告。ベース Qwen 3.6-35B の能力は 100% 維持しつつ、refusal のみ除去する設計思想。 **複数バリアント**: - **HauhauCS-Aggressive**([HF](https://huggingface.co/HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive) / [Ollama](https://ollama.com/fredrezones55/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive)): 最も aggressive な refusal 除去 - **huihui-ai Huihui-Qwen3.6-abliterated**([HF](https://huggingface.co/huihui-ai/Huihui-Qwen3.6-35B-A3B-abliterated) / [Ollama](https://ollama.com/huihui_ai/Qwen3.6-abliterated)): 実績ある huihui-ai チームの手法 - **wangzhang abliterated**([HF](https://huggingface.co/wangzhang/Qwen3.6-35B-A3B-abliterated)) - **prithivMLmods Uncensored-Aggressive**([HF](https://huggingface.co/prithivMLmods/Qwen3.6-35B-A3B-Uncensored-Aggressive)) 各バリアントは **量子化オプション**(GGUF Q4 / Q5 / Q8 / FP16 等)を用意しており、コンシューマ GPU(RTX 5090 32GB)から H100 まで幅広いハードウェアで実行可能。 **倫理・法的論点**: Abliterated モデルは **本来 Qwen が拒否すべき有害コンテンツ(違法薬物・攻撃コード・危険物合成等)を生成し得る**。研究目的・脱獄耐性検証・ロールプレイ・成人向けコンテンツ生成等の合法用途は存在するが、**業務利用・エンタープライズ導入では強い法的リスク**。EU AI Act(2026-08 施行)や日本の PPC ガイドラインへの適合も懸念。**責任は完全に利用者側**、Alibaba / Qwen チームは関与せず。 **位置付け**: [ローカル LLM 2026年6月最新版](../columns/local-llm-landscape-2026-june-update)・[Kimi K2.7-Code](../columns/kimi-k2-7-code-moonshot-ai-2026-06)・[Ornith-1.0](../columns/ornith-1-0-deepreinforce-agentic-coding-2026-06) と並ぶオープンウェイト LLM 領域の側面として、**『安全策を後から剥がす技術』が MoE 時代にも成立** している現実を示す事例。
Qwen3.6UncensoredAbliterated
AI2026-06-15
Kimi K2.7-Code 徹底解説 — Moonshot AI が2026年6月12日に公開したコーディング特化 1T MoE オープン重みモデル、Modified MIT・$0.95/$4.00・256K context、ただし日本企業はデータ越境とベンチ独立検証未確立の2大論点に注意
Moonshot AI(北京)が2026年6月12日に公開したコーディング特化新フラッグシップ **Kimi K2.7-Code** を、[Hugging Face モデルカード](https://huggingface.co/moonshotai/Kimi-K2.7-Code)・[MarkTechPost](https://www.marktechpost.com/2026/06/12/moonshot-ai-releases-kimi-k2-7-code-a-coding-model-reporting-21-8-on-kimi-code-bench-v2-over-k2-6/)・[VentureBeat](https://venturebeat.com/technology/kimi-k2-7-code-cuts-thinking-tokens-30-practitioners-say-benchmarks-dont-check-out)を一次ソースに整理。**1T 総パラメータ / 32B アクティブ MoE**(384 expert / 8 active + 1 shared)、**256K コンテキスト**、MoonViT ビジョンエンコーダ400M、INT4 ネイティブ、思考モード強制有効。**Modified MIT License**(月間1億 MAU または $20M MRR 超でのみ Kimi K2 表示義務)、API は **入力 $0.95 / キャッシュヒット $0.19 / 出力 $4.00 per 1M トークン**(Claude Opus 4.8 の出力単価約1/18)。OpenAI 互換 + Anthropic 互換 API で Claude Code / Cursor / Aider / Cline / cmux に即組込可能。**K2.6 比でベンチ +21.8%、思考トークン -30%** と Moonshot 自社主張、ただし **公式ベンチがすべて自社プロプライエタリで SWE-bench Verified / Pro / FrontierCode の独立検証スコアは2026年6月15日時点で未公開**(VentureBeat 批判)。日本企業視点では **(1) `api.moonshot.cn` および Singapore 子会社経由の `api.moonshot.ai` ともに中国国家情報法第7条の compelled-disclosure リスク(2025年2月 PPC DeepSeek 注意喚起・デジタル庁事務連絡の precedent)、(2) Hugging Face セルフホスト(≥4-8 H100 / INT4 595GB)が Mizuho / Lion の Qwen 国内ファインチューン precedent パターンに沿った唯一の確実解** という2大論点を率直に整理しています。
Moonshot AIKimi K2.7-CodeOpen Weight LLM
AI2026-04-24
DeepSeek V4 Preview リリース解説 — 1.6T MoE / 1Mコンテキストのオープン重みを徹底整理【2026年4月版】
DeepSeek が 2026年4月24日に公開した DeepSeek V4 Preview の概要。V4-Pro(1.6Tパラメータ / 49Bアクティブ)と V4-Flash(284B / 13B)の2モデル、100万トークンコンテキスト、Hugging Face でのオープン重み公開、API・チャットでの提供開始など、要点を公式情報ベースで整理します。
DeepSeek V4オープンソースLLMMoE
AI2026-04-10
GLM-5.1完全ガイド — SWE-bench Pro世界1位を達成したオープンソースLLM【2026年4月最新】
Z.aiが2026年4月7日にリリースしたGLM-5.1は、SWE-bench Proで58.4%を達成しGPT-5.4やClaude Opus 4.6を超えた世界初のオープンソースLLM。744Bパラメータ(40Bアクティブ)のMoEアーキテクチャ、MITライセンス、8時間自律タスクなど最新情報を完全解説。
GLM-5.1Z.aiSWE-bench
AI2026-04-10
Kimi K2.5完全ガイド — 1兆パラメータMITライセンスのオープンソースLLMの実力【2026年版】
Moonshot AIが2026年1月27日にリリースしたKimi K2.5は、1兆パラメータ(32Bアクティブ)MoEモデル。SWE-bench 76.8%、HumanEval 99.0%、GPQA Diamond 87.6%を達成しMITライセンスで公開。アーキテクチャ・ハードウェア要件・Ollama導入・ユースケースを完全解説。
Kimi K2.5Moonshot AI1兆パラメータ
AI2026-04-10
Mistral Small 4完全ガイド — 推論×マルチモーダル×コードを統合した119B MoEモデル【2026年版】
2026年3月リリースのMistral Small 4は、推論・マルチモーダル・エージェントコーディングを1モデルに統合した119B MoE。Apache 2.0ライセンスで商用利用可能、日本語を含む11言語対応。スペック・導入手順・比較を完全解説。
Mistral Small 4MoEマルチモーダル
AI2026-04-10
MiniMax M2.5完全ガイド — Lightning AttentionでSWE-bench 80.2%を達成したMoEモデル【2026年版】
MiniMax M2.5は独自のLightning AttentionによりコーディングベンチマークSWE-bench Verifiedで80.2%を達成したオープンMoEモデル。230B総パラメータ・10Bアクティブ。アーキテクチャ・ライセンス・導入手順を完全解説。
MiniMax M2.5SWE-benchLightning Attention
AI2026-03-17
Rakuten AI 3.0の技術アーキテクチャ完全解説:MoEで実現する次世代日本語LLM
楽天が開発した約7000億パラメータのRakuten AI 3.0のMixture of Expertsアーキテクチャを徹底解説。8エキスパート構成、アクティブパラメータ400億の効率性、日本語MT-Benchで8.88を達成した技術的背景を詳しく紹介します。
Rakuten AI 3.0MoEMixture of Experts
AI2026-03-17
NemoClawのNIM推論マイクロサービスとNemotronモデル — エッジからクラウドまでのデプロイ戦略
NemoClawのNIM推論マイクロサービスとNemotronモデルファミリーの技術詳細を解説。コンテナ化APIエンドポイント、エラスティックスケーリング、Nemotron 3 Super(1200億パラメータ、MoE 120億アクティブ)の性能、AWS・Azure・GCP・オンプレでのデプロイ比較、エッジデバイスでの軽量運用、Salesforce・CrowdStrike等パートナー連携の活用事例を詳述します。
NemoClawNIMNemotron