Muse Glimmer 30B 必要スペック早見表
VRAM 20〜64GB/RTX 3090〜・M4 Max対応、Metaのローカルエージェントモデル【2026年版】
Muse Glimmer 30Bは4bit量子化で約20GB、24GBのGPUやMacで動作します。Metaが2026年8月10日に発表したエージェント特化のオープンウェイトモデルの必要VRAM・GPU・Mac対応状況を量子化別の早見表で整理し、RTX 5090やM4 Maxでの動作目安も解説。2026年8月更新。
Muse Glimmer 30Bとは?必要VRAMを先に結論
Muse Glimmer 30Bは、Meta Superintelligence Labsが2026年8月10日に発表した300億(30B)パラメータのdenseマルチモーダルモデルです。4ビットK-Quant量子化を使えば約20GB以下に収まり、24GBまたは32GBのメモリを持つGPU・Macで動作します。本記事では量子化レベル別の必要スペックを早見表にまとめ、RTX 5090やMacBook M4 Max/M5 Maxでの動作目安、131Kコンテキスト利用時の注意点まで解説します。詳細はMeta公式ブログでも確認できます。
必要スペック早見表
以下は30B denseモデルに対する量子化ごとの一般的な計算式による目安です。公式が発表しているのは「4bit量子化で約20GB以下・24GBまたは32GBのメモリenvelopeで動作」という点のみで、それ以外の量子化レベルの数値はあくまで目安として参考にしてください。
| 量子化 | モデル重みの目安 | 動くGPU・Macの目安 |
|---|---|---|
| BF16 | 約60GB | A100 80GB級・マルチGPU・Mac Studio 96GB〜 |
| Q8_0 | 約30GB | RTX 5090(32GB)・Mac 48GB〜 |
| Q6_K | 約24GB | RTX 5090・Mac 36GB〜 |
| Q4(公式K-Quant) | 約20GB弱(公式) | RTX 3090/4090(24GB)・Mac 32GB〜 |
Muse Glimmerの特徴 — エージェント特化の8つの能力
Muse Glimmerは「常時稼働するローカルエージェントワークフロー向けに最適化」を公式コンセプトに掲げ、上位モデルのMuse Sparkからの蒸留(SFT+on-policy蒸留+強化学習を一般・推論・コーディング・エージェントの各領域で実施)によって学習されています。公式が挙げる能力は、複数ステップのタスク完遂、確実なツール呼び出し、長い推論チェーン、エラーからの回復、マルチモーダル理解(テキスト+画像)、エージェントスキャフォールド互換性、推論強度(reasoning effort)の調整、100以上の言語対応の8つです。コンテキスト長は131Kトークン、ライセンスはApache 2.0で、weightsはHugging Faceのmeta-models/Muse-Glimmer-30B(GGUF版はmeta-models/Muse-Glimmer-30B-GGUF)として公開されています。
量子化とは — メモリ削減の仕組み
量子化とは、モデル内部の重み(パラメータ)を表現する数値の精度を落とすことでモデルサイズとメモリ使用量を圧縮する技術です。元のBF16(16ビット浮動小数点)に対して、8ビットや6ビット、4ビットへとビット数を減らすほどファイルサイズとVRAM使用量は小さくなりますが、一般的には精度がわずかに低下するトレードオフがあります。Muse Glimmerは公式に4ビットK-Quant量子化で約20GB以下という圧縮結果を示しており、24GB前後のコンシューマー向けGPUやノートPCでも実用的に動作する設計になっています。
Apple Siliconでの動作 — M4 Max/M5 Max
Metaは公式に、MacBook M4 MaxおよびM5 MaxでのMuse Glimmer動作を発表しています。投機的デコーディング(speculative decoding)による高速化倍率も公表されており、M5 Maxで約1.8倍、M4 Maxで約1.5倍の速度向上が確認されています(同様の仕組みでRTX 5090では約3.1倍)。Apple Siliconはユニファイドメモリでモデル重みとシステムメモリを共有するため、4bit量子化(約20GB弱)を動かす場合は32GB以上のメモリを積んだMacが目安になります。MLXやllama.cppはDay-0からMuse Glimmerに対応しており、LM Studioなどのアプリからも利用できます。
NVIDIA/AMD GPU別の目安
NVIDIA GPUでは、4bit量子化であればRTX 3090/4090(24GB)が目安の下限、Q6_K以上の高精度量子化を使うならRTX 5090(32GB)が現実的な選択肢です。投機的デコーディングを組み合わせるとRTX 5090では約3.1倍の高速化が確認されています。AMDはRyzen AI Max APUおよびRadeon GPUでの実行を公式に発表しており、統合GPU環境でもMuse Glimmerの動作が想定されています。
| GPU/環境 | VRAM目安 | 対応する量子化の目安 |
|---|---|---|
| RTX 3090 / 4090 | 24GB | Q4(4bit K-Quant) |
| RTX 5090 | 32GB | Q4〜Q6_K(投機的デコーディングで約3.1倍高速) |
| AMD Radeon GPU | 環境により変動 | 公式にRyzen AI Max APU・Radeon GPUでの実行を発表 |
| Mac(Apple Silicon) | 32GB〜 | Q4(M4 Max/M5 Maxで公式動作確認、投機的デコーディングで1.5〜1.8倍) |
CPUオンリー実行の現実性
GPUやApple Siliconを持たない環境でも、GGUF形式のモデルファイルと十分なRAM(目安として32GB以上)があればCPUのみでMuse Glimmerを動かすこと自体は可能です。ただし、GPUやユニファイドメモリを使う場合と比べて推論速度は大きく低下するため、常時稼働のエージェント用途にはあまり向きません。検証や小規模な用途に限定するのが現実的です。
131Kコンテキストの注意点(KVキャッシュ)
Muse Glimmerの最大コンテキスト長は131Kトークンですが、これをフルに使うとKVキャッシュのために数GB以上の追加メモリが必要になります。24GB級のGPUで4bit量子化のモデル本体(約20GB弱)を載せた場合、フル131Kコンテキストを確保する余裕はほとんど残らないため、実運用では32K程度のコンテキスト長に抑えるのが現実的な目安です。長いコンテキストを活用したい場合は、32GB以上のVRAM・メモリを持つ環境を検討してください。
動かし方 — Ollama / LM Studio / llama.cpp
Muse Glimmerはllama.cpp、MLX、ExecuTorch、Ollama、LM Studio、vLLM、SGLangといった主要な推論エンジン・ツールでDay-0から対応しています。手元でまず試すだけなら、Ollamaでollama runのようなコマンド1つでモデルを取得・起動できる形が一般的です(実際のモデル名・タグは配布ページで確認してください)。GUIで手軽に試したい場合はOllama と LM Studio の比較も参考にしてください。モデル本体はHugging Faceの`meta-models/Muse-Glimmer-30B`(GGUF版もあり)から取得できます。
ollama run muse-glimmer-30b競合比較 — Gemma4-31B・Qwen3.6-27Bとの位置づけ
Muse Glimmerの評価では、DeepSearch QA、MCP-Atlas、τ-Bench、SWE-Benchといったベンチマークが使われ、スキャフォールド内での動作やコード作成・デバッグ、マルチターンでの問題解決力が測定されています。公式が比較対象として挙げているのはGemma4-31BとQwen3.6-27Bで、いずれも同クラスのローカル向けオープンモデルという位置づけです。より詳しいハードウェア要件を知りたい場合はGemma 4 の必要スペック解説も参考にしてください。
| モデル | パラメータ | コンテキスト長 | ライセンス | 特徴 |
|---|---|---|---|---|
| Muse Glimmer 30B | 30B(dense) | 131K | Apache 2.0 | Metaが2026年8月発表。エージェント特化、マルチモーダル対応、Muse Sparkから蒸留 |
| Gemma4-31B | 31B | — | — | 同クラスのローカル向けオープンモデル(Muse Glimmerの公式比較対象) |
| Qwen3.6-27B | 27B | — | — | 同クラスのローカル向けオープンモデル(Muse Glimmerの公式比較対象) |
よくある質問
Muse Glimmer 30Bを動かすには最低何GBのVRAMが必要ですか?
公式発表によると、4ビットK-Quant量子化で約20GB以下に圧縮され、24GBまたは32GBのメモリenvelopeで動作するとされています。RTX 3090/4090のような24GB GPUが目安の下限です(131Kフルコンテキストを使う場合はさらにKVキャッシュ分の余裕が必要)。
MacBookで動きますか?
はい。Metaは公式にMacBook M4 MaxおよびM5 Maxでの動作を発表しており、投機的デコーディングによりM5 Maxで約1.8倍、M4 Maxで約1.5倍の高速化が確認されています。MLXやllama.cpp、LM StudioなどApple Silicon対応ツールでDay-0から利用できます。
無料で商用利用できますか?
Muse GlimmerはApache 2.0ライセンスでweightsが公開されており、商用利用を含め比較的自由に利用できるライセンス形態です(正式な利用条件はHugging Faceのモデルカードやライセンス文を必ず確認してください)。
Llamaシリーズなど既存のMetaモデルとの関係は?
Muse GlimmerはMeta Superintelligence Labsが開発した新しい系統のオープンウェイトモデルで、上位モデルのMuse Sparkから蒸留(SFT+on-policy蒸留+強化学習)して作られています。ファクトシート上ではLlamaシリーズとの直接の系譜は明記されていないため、両者は別ラインのモデルとして扱うのが適切です。
まとめ
Muse Glimmer 30Bは、4ビット量子化で約20GB以下に収まり、24GB〜32GBクラスのGPUやMacで動作するよう設計されたMetaのエージェント特化オープンウェイトモデルです。RTX 3090/4090クラスなら4bit量子化、RTX 5090やメモリに余裕のあるMac Studioなら高精度な量子化や長いコンテキストも視野に入ります。まずは早見表を参考に、手元の環境がどの量子化レベルに対応できるかを確認してみてください。
この記事に関連する無料ツール(登録不要・その場で結果)
お気軽にご相談ください
お問い合わせ