本文へスキップ
株式会社オブライト
AI2026-10-07約15分で読めます

Mistral Large 4 必要スペック早見表

1T MoE(FP8約1TB・4bit約500GB・H200×8〜)

Mistral Large 4(総1T・アクティブ49BのMoE)の必要メモリは推定でFP8約1TB、4bit約500〜580GB。H200×8やMac Studio 2台での可否、API利用との費用比較、他の大型MoEとの違いまで整理。2026年10月更新、重みは10月末公開予定のため数値は推定値だ。


Mistral AIの新フラッグシップ「Mistral Large 4」(愛称Le Chonk)をローカルで動かす場合、重みだけでBF16は約2,000GB、FP8は約1,000GB、4bit級は約500〜580GB、2bit級は約280〜320GBが目安になる(すべて推定値)。総パラメータ1兆(1T)・アクティブ49BのMoEで、テキストと画像を入力できるマルチモーダルモデルだ。個人のPCや一般的なワークステーションで動かす規模ではなく、現実的な選択肢はAPI、またはH200級GPU 8枚前後のサーバーになる。

Mistral Large 4は2026年10月6日に発表され、同日からMistral Studio経由のAPIでパブリックプレビューが始まっている。オープンウェイトは10月末に公開予定とされ、報道では一般提供は10月27日とされている。ライセンスは未発表のため、商用利用の可否は重み公開時に確認が必要だ。本稿では発表済みの事実と当サイトによる推定値を分けて記載する。

必要スペック早見表(推定)

重み容量は「総パラメータ1T × 1パラメータあたりのバイト数」で計算し、実運用の目安にはKVキャッシュとアクティベーション分として約15%を上乗せした(短いコンテキストの場合)。層数・KVヘッド数・コンテキスト長はいずれも未公表のため、KVキャッシュは個別に算出できていない。

精度重みのみ(推定)実運用の目安(推定・短コンテキスト)精度劣化の目安
BF16(フル精度)約2,000GB約2,300GBなし
FP8約1,000GB約1,150GBほぼなし
4bit級(Q4系・INT4)約500〜580GB約575〜670GB小さい(実用範囲)
2bit級(Q2・1.58bit級)約280〜320GB約320〜370GB目に見えて低下

手元のGPU・Macで動くかをすぐ確かめたい場合は、モデル・量子化・コンテキスト長を選ぶだけで必要VRAMを試算できるVRAM計算ツール(無料・登録不要)も用意している。Mistral Large 4もモデル一覧から選択できる。

Mistral Large 4(1T MoE・アクティブ49B)の精度別の重みメモリ推定。BF16は約2,000GB、FP8は約1,000GBで8×H200(1,128GB)に収まり、4bit級は約500〜580GB、2bit級は約280〜320GBでMac Studio 512GBに載る(重みのみ・KVキャッシュ別)。

4bit級に幅があるのは、量子化方式によってブロックごとのスケール係数などのメタデータが加わり、実効ビット数が4.0〜4.6bit程度に変わるためだ。コンテキストを長く使うほど、KVキャッシュがこの表に上乗せされる。KVキャッシュはコンテキスト長にほぼ比例して増える。仕組みはKVキャッシュとコンテキスト長のVRAM解説で整理している。

Mistral Large 4とは — 発表で確認できる事実

Mistral Large 4は、フランスのMistral AIが発表した大規模言語モデルだ。総パラメータ1兆、トークンあたりのアクティブパラメータ49BのMixture of Experts(MoE)で、ネイティブのマルチモーダル(テキスト+画像入力)に対応し、指示応答(instruct)と推論(reasoning)を1つのモデルに統合したハイブリッド型とされている。EU公用語すべてを含む160以上の言語に対応し、学習には欧州内のNVIDIA Grace Blackwell GPU 3,800基が使われたと説明されている。

項目内容状態
総パラメータ1T(1兆)発表済み
アクティブパラメータ49B発表済み
構成MoE、ネイティブマルチモーダル(テキスト+画像入力)、instruct+reasoningのハイブリッド発表済み
対応言語160以上(EU公用語すべてを含む)発表済み
学習環境欧州内のNVIDIA Grace Blackwell GPU 3,800基発表済み
APIMistral Studioでパブリックプレビュー(2026年10月6日〜)提供中
API料金入力 $1.36 / 100万トークン、出力 $4.18 / 100万トークン発表済み
オープンウェイト2026年10月末に公開予定(一般提供は10月27日との報道)未公開
ライセンス未発表(重み公開時に確認が必要)未発表
コンテキスト長未公表未公表
エキスパート数未公表未公表

ベンチマーク(開発元の発表値)

以下は発表で示された数値で、開発元による発表であり、独立した第三者検証は確認できていない。重み公開後に追試が出れば評価は変わりうる。

ベンチマークスコア領域
DeepSWE 1.161.7%ソフトウェアエンジニアリング
Terminal Bench 4.028.3%ターミナル操作・エージェント
AutomationBench59.9%業務自動化
Cybench93%セキュリティ(CTF課題)
脆弱性の再現82%セキュリティ
Dense 20042%視覚的グラウンディング(GPT-6-Astraは41%)

このほか、AA Cyber Indexで世界トップ5に入ったこと、Harvey Legal Agent Benchmarkでオープンモデルとして最高だったことも発表されている。法務や多言語の業務用途を意識した位置づけがうかがえるが、自社の用途で効くかどうかは実際のデータで試すしかない。

なぜ「総パラメータ1T」でメモリを見積もるのか

MoEは1トークンの計算に一部のエキスパートしか使わないが、次にどのエキスパートが選ばれるかは入力ごとに変わる。そのため原則として全エキスパートの重みをメモリ上に置く必要があり、必要容量は総パラメータ数(1T)で決まる。アクティブ49Bが効くのは速度の側だ。1トークンあたりに読み出す重みは4bit級でおおむね25GB前後(49B × 0.5byte)に収まるため、メモリ帯域が足りる環境では、密な1Tモデルよりはるかに高速に動く。計算量としては約49B級のモデルに近いが、メモリの要求は1T級のままという点が、MoEの設計上の特徴だ。

量子化とは — 何bitを選ぶべきか

量子化は、重みを表すビット数を減らしてメモリを圧縮する技術だ。BF16(16bit)を8bitにすれば半分、4bitにすれば約4分の1になる。8bitはほぼ無損失、4bit級は多くの用途で実用範囲とされるが、2bit級まで落とすと出力品質が目に見えて下がる。Mistral Large 4は量子化版がまだ存在しないため、品質への影響は判断できない。推論(reasoning)モードを使う場合は、長い思考過程で誤差が蓄積しやすいため、できるだけ高い精度を選ぶほうが無難だ。

方針としては、品質を優先できるならFP8、ローカル実行の現実解は4bit級、メモリが足りないときの最後の手段が2bit級、という順になる。BF16は重みだけで約2,000GBあり、研究目的でない限り選ぶ理由は薄い。

GPU構成別の目安(推定)

下表は「重みが載るか」を基準にした事前の見積もりだ。実際に動くかどうかは、フレームワークの並列化方式(テンソル並列・エキスパート並列)とコンテキスト長で変わる。

GPU構成合計VRAMBF16FP84bit級2bit級
H100 80GB × 8640GB不可不可載るが余裕は小さい(短コンテキスト)余裕あり
H100 80GB × 161,280GB不可載る(長文は余裕小)余裕あり過剰
H200 141GB × 4564GB不可不可ぎりぎり(下限値のみ)余裕あり
H200 141GB × 5705GB不可不可余裕あり余裕あり
H200 141GB × 81,128GB不可載るが余裕は約128GB(長文は厳しい)余裕あり(長文向き)過剰
B200 192GB × 4768GB不可不可余裕あり過剰
B200 192GB × 81,536GB不可余裕あり過剰過剰

推奨の目安は次のとおりだ。FP8を動かすならH200×8またはB200×8(H200×8は重みを載せた残りが約128GBしかなく、長いコンテキストでは不足しやすい)、4bit級ならH200×4〜5、B200×4、H100×8で収まる。BF16は2TB級となり、B200×8でも総量1,536GBに届かないため、一般的な運用の対象外だ。なお、GPU枚数は並列化方式の制約で2の累乗が前提になることがあり、5枚構成が使えるかはフレームワーク次第だ。

Apple Siliconで動かす場合

Apple Siliconは統合メモリをGPUからも使えるため、大型モデルを手元で動かす選択肢になる。ただしMac Studioの最大構成は512GBで、Mistral Large 4の4bit級(約500〜580GB)は1台には載らない。1台で動かせるのは2bit級(約280〜320GB)で、これは品質低下とのトレードオフになる。

4bit級を狙うなら、Mac Studio 512GBを2台つなぎ、分散推論で合計1,024GBを使う構成が考えられる。この方法で重み約500〜580GBは載るが、台数間の通信速度が律速になり、安定運用のハードルも高い。FP8(約1,000GB)は、OSの使用分を引くと2台でも足りない。さらに、llama.cppのMetalやMLXがMistral Large 4のアーキテクチャに対応するかは未確認で、重み公開後の確認が必要だ。512GB機の考え方はReflection Beamの必要スペック記事でも触れている。

CPU+大容量RAMでのオフロード

アクティブ49Bという性質を活かし、エキスパートを大容量のシステムRAMに置いてGPUに共通部分だけを載せる方法もある。ただしMistral Large 4は4bit級でも約500〜580GBあるため、512GB以上のRAMでは足りず、実質1TB級のサーバーが必要になる。1トークンあたり約25GBを読む計算なので、帯域が約300GB/sのサーバーでも理論上の上限は十数トークン/秒で、実際はその数分の一にとどまる見込みだ(推定)。

RTX 5090(32GB)のような消費者向けGPUは、VRAM単体では到底足りない。512GB超のRAMとの組み合わせで極端なCPUオフロードを行えば動く可能性はあるが、速度は実用に遠い。ローカルで試すだけなら、このモデルの選択は現実的ではなく、同じMistralの小型モデルを使うほうが向いている。小型版の考え方はMistral Small 4の記事を参照してほしい。

API利用とローカル運用の費用比較

Mistral Large 4のAPI料金は、入力が100万トークンあたり$1.36、出力が$4.18だ。たとえば1日に入力100万トークン・出力30万トークンを処理する場合、1日あたり入力$1.36+出力$1.25(0.3 × $4.18)で約$2.6になる。30日で約$78、1年でも約$950にとどまる。

利用量(1日)入力出力1日の費用1か月(30日)
小規模100万トークン30万トークン約$2.6約$78
中規模(10倍)1,000万トークン300万トークン約$26約$780
大規模(100倍)1億トークン3,000万トークン約$261約$7,800

H200×8のようなサーバーは、購入すれば数千万円規模、クラウドで借りても継続的な時間課金が発生する。このため、多くの中小企業ではAPI利用のほうが圧倒的に安い。自前運用を検討するのは、機密データを社外に出せない、データの所在を欧州域内などに限定したい、毎日大量に処理して従量課金がかさむ、といった明確な理由がある場合に絞るのが現実的だ。APIで先に評価してから、必要に応じて重み公開後に自前運用を検討する順序が、投資判断を誤りにくい。

他の大型オープンMoEとの比較

当サイトの既存記事で確認できる数値と並べる。アクティブパラメータに対する総パラメータの比が大きいほど、メモリは重いのに1トークンの計算は軽い、というMoEらしい性格になる。

モデル総パラメータアクティブコンテキスト長ライセンス4bit時のメモリ目安
Mistral Large 41T49B未公表未発表約500〜580GB(推定・重みのみ)
Reflection Beam501B23B1MApache 2.0約250〜290GB(推定・重みのみ)
DeepSeek V4-Pro1.6T49B1MMIT約920GB
GLM-5.2753B約40B1MMIT約430GB
Mistral Small 4119B6.5B256KApache 2.0約60GB(Q4)
Kolibri-178B約3.46B262K(ネイティブ)Apache 2.0約39〜45GB(推定)

Mistral Large 4はアクティブ49BでDeepSeek V4-Proと同じだが、総パラメータは約3分の2で、4bit時のメモリも約半分強になる計算だ。一方でReflection Beamの約2倍のメモリを要する。欧州発のモデルという点では、78BのMoEであるKolibri-1のほうが、はるかに少ないメモリで動く。ベンチマークの優劣は各社の発表値に基づくため、この表では比較していない。

今すぐできること(重み公開前)

- Mistral StudioのAPIで、自社の業務データを使った品質評価を先に行う
- 重み公開に備えて、保存先のディスク空き容量を確保する(FP8で約1TB、4bit級で約500〜580GB)
- 手元の構成が4bit級に届くか、上の表で当たりを付ける(届かなければAPI利用が前提になる)
- 機密データを扱う場合は、ライセンスと提供形態(オンプレミス利用の可否)の発表を待つ
- 長いコンテキストを使う予定なら、コンテキスト長の公式値が出るまでKVキャッシュ分を別枠で見積もる
- 公開後に確認する項目をメモしておく(リポジトリ名、公式量子化版の有無、対応フレームワーク、最小構成)

トラブルシューティング(メモリ不足・OOM)

- 起動時にOOMになる: 重みが載っていない。精度を一段下げる(FP8→4bit級)か、GPU枚数を増やす
- 途中からOOMになる: KVキャッシュが原因の可能性が高い。コンテキスト長の上限を下げる、同時リクエスト数を減らす、KVキャッシュの量子化を検討する
- 画像入力で落ちる: マルチモーダルでは画像のトークン分と視覚部分の重みが加わる。画像の解像度や同時枚数を減らして確認する
- オフロード構成が遅い: メモリ帯域が律速。DDR5のチャネル数を確認し、エキスパート配置を見直す
- GPUは空いているのに載らない: 並列化方式の制約で、均等分割できない枚数だと使い切れないことがある。枚数と並列設定を確認する
- 品質が極端に悪い: 2bit級は劣化が大きい。3bit以上を試す

まとめ

Mistral Large 4は総パラメータ1T・アクティブ49Bのマルチモーダル対応MoEで、ローカル実行の目安は4bit級で約500〜580GB、FP8で約1,000GB、BF16で約2,000GB(いずれも重みのみの推定値)だ。FP8ならH200×8やB200×8、4bit級ならH200×4〜5やB200×4が候補になるが、Mac Studio 512GBは1台では4bit級が載らず、消費者向けGPUは現実的ではない。1日100万トークン規模ならAPIは1日約$2.6で済み、多くの中小企業にはAPIが合理的だ。ライセンスとコンテキスト長が未発表のため、重み公開後に実測値で本稿を更新する。

FAQ

Mistral Large 4を動かすのに必要なVRAMはどれくらいですか。

総パラメータ1Tからの推定で、重みだけならBF16が約2,000GB、FP8が約1,000GB、4bit級が約500〜580GB、2bit級が約280〜320GBです。ここにKVキャッシュとオーバーヘッドが加わります。公式のVRAM値とコンテキスト長は未公表で、重み公開後に確認が必要です。

重みはもう公開されていますか。ライセンスは何ですか。

2026年10月7日時点では未公開です。オープンウェイトは10月末に公開予定とされ、報道では一般提供は10月27日とされています。ライセンスは未発表のため、商用利用の可否は重み公開時に確認が必要です。それまではMistral StudioのAPIで利用できます。

アクティブ49Bなら、49B相当のVRAMで動きますか。

動きません。MoEは次にどのエキスパートが選ばれるか分からないため、原則として全エキスパートの重みをメモリに置く必要があり、必要容量は総パラメータ1Tで決まります。アクティブ49Bは主に生成速度に効きます。

Mac Studio(512GB)やRTX 5090で動きますか。

Mac Studio 512GB 1台には4bit級(約500〜580GB)が載らず、載るのは2bit級(約280〜320GB)までで品質が下がります。2台での分散推論なら4bit級が載る見込みですが、対応は未確認です。RTX 5090(32GB)は、512GB超のRAMによる極端なCPUオフロードでない限り現実的ではなく、速度も実用に遠いです。

ローカルで動かすのとAPIを使うのはどちらが安いですか。

多くの中小企業ではAPIが圧倒的に安いです。料金は入力$1.36・出力$4.18(100万トークンあたり)で、1日に入力100万・出力30万トークンなら約$2.6です。自前運用はH200×8級のサーバーが必要で、機密データを社外に出せない場合や大量処理が続く場合に限って検討する価値があります。

この記事に関連する無料ツール(登録不要・その場で結果)

お気軽にご相談ください

お問い合わせ