本文へスキップ
株式会社オブライト

「Gemma 4」のコラム

15件の記事

AI2026-07-14
[Cerebras Inference 上のマルチモーダル Gemma 4 31B](https://www.cerebras.ai/blog/gemma-4-on-cerebras-the-fastest-inference-is-now-multimodal) 徹底解説(2026-06-29 発表)— GPU エンドポイントの 35 倍・1,851 tok/s、Cerebras 初のマルチモーダル対応で画像 / スクリーンショット / チャート / UI 状態を投入可能、Google DeepMind 初モデル + Apache 2.0 オープンウェイト、Claude Haiku 4.5 の 18 倍速で Intelligence Index 29 の同等品質 『computer use / 画像駆動エージェント / UI デバッグ / ダッシュボード分析』の実用領域を wafer-scale で解禁
**Cerebras が 2026-06-29 に [Gemma 4 31B を Cerebras Inference で公開](https://www.cerebras.ai/blog/gemma-4-on-cerebras-the-fastest-inference-is-now-multimodal)**、同社プラットフォームで **初のマルチモーダル対応**、Google DeepMind の **初モデル** となる公開プレビュー。**パフォーマンス**: **1,851 output tokens/秒**(一般的な GPU エンドポイントの **35 倍**)、**first token 1.5 秒以下**(推論込み)、[Artificial Analysis Intelligence Index で 29](https://artificialanalysis.ai/) を記録(Claude Haiku 4.5 の 30 と同等)、**Cerebras 上で Haiku の 18 倍速**。**モデル仕様**: **[Gemma 4 31B](../columns/gemma-4-technical-report-2026-07) dense アーキテクチャ**(MoE ではない)、**Apache 2.0 オープンウェイト**、long-context 対応、画像理解(スクリーンショット・チャート・ドキュメント・UI 状態・図面・スキャンページ・フォーム)。**独自価値**: これまで GPU 上では実用不可能だったマルチモーダルワークロード(**computer use / 画像駆動エージェント / UI デバッグ + コードパッチ生成 / ダッシュボードのリアルタイム分析 / 長文ドキュメント要約**)を wafer-scale 速度で解禁。**位置付け**: [Gemma 4 Technical Report](../columns/gemma-4-technical-report-2026-07) で解説した Google DeepMind の open-weights 戦略が、**Cerebras の wafer-scale ハードウェアと組み合わさって『マルチモーダル × 高速推論 × オープンウェイト』の新たなインフラスタック** に到達した事例、[OpenAI GPT-5.6 + ChatGPT Work](../columns/openai-chatgpt-work-launch-2026-07)・[Claude Cowork](../columns/claude-cowork-web-mobile-launch-2026-07) が下地とする **クローズドモデル陣営に対する open-weights + 高速推論陣営の反攻**。[Nous Portal 経由の 300+ モデル中立](../columns/nous-portal-cloud-hermes-agent-2026-07) や [ローカル LLM 展開](../columns/local-llm-landscape-2026-june-update) と組み合わせて **オープンウェイト実用時代の 2026 年後半 AI インフラスタック** を構成。**Cerebras Inference Cloud の公開プレビュー**(期間限定)で提供、[API ドキュメント](https://inference-docs.cerebras.ai/models/gemma-4-31b) 参照。
CerebrasGemma 4Wafer-Scale
Mobile Development2026-07-09
[React Native ExecuTorch の `useLLM` フック](https://docs.swmansion.com/react-native-executorch/docs/hooks/natural-language-processing/useLLM) 徹底解説 — Qwen / Llama 3.2 / Hammer 2.1 / Phi 4 Mini / SmolLM 2 / LFM2.5 / Gemma 4 をオンデバイスで走らせる React Native 用フック、ツール呼び出し・ビジョン / オーディオ・構造化出力対応 Software Mansion 提供、Managed / Functional の 2 モード、Zod スキーマ検証込み
**Software Mansion 提供の [React Native ExecuTorch](https://docs.swmansion.com/react-native-executorch/) が `useLLM` フックを公開**、React Native アプリに **オンデバイス LLM をネイティブに統合**。**対応モデル**: Qwen (2.5 / 3 / 3.5)・Llama 3.2・Hammer 2.1・Phi 4 Mini・SmolLM 2・LFM2.5(ビジョン対応)・**[Gemma 4](../columns/gemma-4-technical-report-2026-07)(ビジョン + オーディオ対応)** の量子化版。**2 つの動作モード**: **Functional/Stateless**(`generate()` メソッドと `response` プロパティで conversation history を自前管理、tool calling とチャット設定は無効)と **Managed/Stateful**(`sendMessage()` でフックが自動的に conversation state 保持・tool call parse・callback 実行)。**キー機能**: token batching(トークンをバッチ化して re-render 削減)、tool calling(tool schema 定義でモデルが外部関数を invoke、自動 parse + callback 実行)、vision-language / audio マルチモーダル入力、生成コントロール(temperature / top-p / repetition penalty / mid-stream 中断)、**JSONSchema または Zod による構造化出力**。**用途**: サーバー依存のないオンデバイスチャットボット、プライバシー重視の会話 UI、カレンダー / フラッシュライト等のアプリ内 function calling、画像解析 / 音声書き起こし。**位置付け**: [Gemma 4 の encoder-free 12B](../columns/gemma-4-technical-report-2026-07) と [Qwen 3.6-35B](../columns/qwen36-35b-a3b-uncensored-abliterated-2026-07) のような最新 open-weight LLM が **iOS / Android アプリでネイティブに動く時代の入り口** を実装レベルで示す React Native 界隈の重要成果。
React NativeExecuTorchOn-Device LLM
AI2026-07-08
Gemma 4 Technical Report 徹底解説 — Google DeepMind の 2.3B〜31B オープンウェイト・マルチモーダル LLM、12B は encoder-free 統一設計、reasoning mode 標準搭載 [arXiv:2607.02770](https://arxiv.org/abs/2607.02770) 2026-07-02 公開、300+ 著者、Dense + MoE 両バリアント
**Google DeepMind の Gemma Team が [arXiv:2607.02770](https://arxiv.org/abs/2607.02770) として 2026-07-02 に Gemma 4 Technical Report を公開**。**2.3B / 12B / 31B のパラメータ範囲**、**Dense と MoE の両バリアント**、**text / image / audio ネイティブマルチモーダル**、**12B は encoder-free 統一設計**(raw audio と image patches を追加エンコーダなしで直接処理)、**reasoning mode(thinking mode)標準搭載**、**改良された vision / audio エンコーダ**、**推論速度・メモリ効率・long context の architectural refinement**、**STEM / multimodal / long-context ベンチで上位オープンモデルと競合**。300 名以上の著者による大規模プロジェクト。オープンウェイトのため商用利用可、Hugging Face・Ollama で配布。位置付けは [Qwen 3.6-35B-A3B](../columns/qwen36-35b-a3b-uncensored-abliterated-2026-07)・[ローカル LLM 2026 年 6 月版](../columns/local-llm-landscape-2026-june-update) と並ぶオープンウェイト最前線の新章。**Google の open-weights 戦略の到達点**、encoder-free unified 設計は Qwen / Llama / DeepSeek のマルチモーダル手法(別途 vision encoder + projection)と一線を画す。**reasoning mode** は Anthropic / OpenAI クローズドモデルの extended thinking との対称、オープン側の追随。留保: 商用ライセンスの詳細条件、systemic-risk(EU AI Act 10^25 FLOPs 閾値)該当可能性、Google Cloud Vertex AI との統合エコシステム偏重。
Gemma 4Google DeepMindOpen Weight
AI2026-06-11
DiffusionGemma 徹底解説 — Google DeepMind が2026年6月10日に公開した『業界初のオープン重み大規模テキスト拡散 LLM』、Gemma 4 26B (A4B MoE) と同バックボーンで AR 版比 最大4倍速、Apache 2.0、品質は AR に劣るという公式明言まで
Google DeepMind が2026年6月10日に NVIDIA との同時アナウンスで公開した **DiffusionGemma**(`google/diffusiongemma-26B-A4B-it`、25.2B 総 / 3.8B アクティブ MoE)を、[Google 公式ブログ](https://blog.google/innovation-and-ai/technology/developers-tools/diffusion-gemma-faster-text-generation/)・[ai.google.dev モデルカード](https://ai.google.dev/gemma/docs/diffusiongemma/model_card)・[Hugging Face](https://huggingface.co/google/diffusiongemma-26B-A4B-it)・[NVIDIA 公式](https://blogs.nvidia.com/blog/rtx-ai-garage-local-gemma-diffusion/) を一次ソースに整理。**自己回帰(AR)モデルが左から右へ1トークンずつ生成するのに対し、Diffusion 言語モデル(DLM)はマスク/ノイズに満たされた256トークンキャンバスを並列に脱ノイズして文章へ変換する**。1 forward あたり15-20トークン確定、最大48 denoising steps、H100 で 1,000+ tok/sec、RTX 5090 で 700+ tok/sec、AR 版 Gemma 4 比 約 3.5-4 倍。一方で **MMLU Pro 77.6 vs 82.6、GPQA 73.2 vs 82.3、MMMU Pro 54.3 vs 73.8** と公式は AR 版に対する **品質劣後を率直に明言**。Apache 2.0、Hugging Face / Vertex AI / NVIDIA NIM 提供、業界初のオープン重み大規模拡散 LLM。日本企業のオンプレ社内エージェント・コード補完・低レイテンシ業務での意義と、Mercury(Inception Labs)/ LLaDA / Gemini Diffusion との位置づけまで整理しています。
Google DeepMindGemma 4DiffusionGemma
AI2026-06-04
Gemma 4 12B 徹底解説 — Vision Encoder と Audio Encoder を捨てた『encoder-free マルチモーダル』、16GBノートPCで動く Apache 2.0 ローカル LLM の正体【2026年6月3日発表】
Google DeepMind が2026年6月3日に公開した Gemma 4 12B を、[公式ブログ](https://blog.google/innovation-and-ai/technology/developers-tools/introducing-gemma-4-12b/) と [Developer Guide](https://developers.googleblog.com/gemma-4-12b-the-developer-guide/) をベースに徹底解説。本モデル最大の特徴は **encoder-free multimodal アーキテクチャ** — Vision Encoder(旧モデルで約5.5億パラメータ)を **35M パラメータの軽量 embedder + 行列乗算1回** に置換し、Audio Encoder(12層 Conformer)は完全削除して raw 音声を直接 LLM の埋め込み空間に投影する設計。16GB VRAM のノート PC(Copilot+ PC / Apple Silicon Mac)で動作、Apache 2.0 ライセンス、Hugging Face / Ollama / LM Studio / MLX / Vertex AI で即利用可能。本コラムは技術的背景、26B MoE に迫るベンチマーク主張、Gemma 4 ファミリー(E2B/E4B/26B/31B)の中での位置づけ、Llama 4 / Qwen 3.5 / Phi-5 との競合関係、日本企業のオンプレ AI / 音声業務 / データ主権要件への適合性までを公式情報ベースで整理しました。
Gemma 4Gemma 4 12BGoogle DeepMind
AI2026-05-25
Gemma 4 必要スペック早見表 — VRAM 5〜62GB / RTX 3060〜H100対応【E2B/E4B/26B/31B 全モデル・2026年版】
Gemma 4 の必要スペックを早見表で公開。VRAM要件は E2B/E4B が5GB、26B MoE が16GB、31B Dense が24GB(Q4)または62GB(FP16)。RTX 3060からH100、Apple Silicon M1〜M4、CPU動作、Mac/Windows/Linux別の推奨スペック・容量・動作環境・推奨GPU・予算別構成まで、2026年Q2時点の最新情報で網羅。
Gemma 4ハードウェアGPU
AI2026-05-25
Gemma 4 性能徹底比較 — Llama 4 / Qwen / Mistral / DeepSeek とベンチマーク・速度・コスパで比べた【2026年版 オープンウェイトLLM決定版】
Gemma 4(E2B / E4B / 26B MoE / 31B Dense)の性能を、同じくオープンウェイトの Llama 4 / Qwen 3.5 / Mistral / DeepSeek と公開ベンチマーク(MMLU-Pro / GPQA / HumanEval / MATH-500 / MT-Bench)で比較。さらに推論速度(tok/s)、メモリ効率(VRAM あたりの精度)、コスト効率(1M トークンあたりの円換算)、日本語性能、function calling 対応、Apache 2.0 / MIT / 商用利用条件まで2026年5月時点の最新情報で整理しました。社内 LLM・エッジ AI・コーディングアシスタント・RAG 用途別の推奨選定マトリクス付き。
Gemma 4Llama 4Qwen
AI2026-05-22
Argent(Software Mansion)× Gemma 4 — オンデバイス AI エージェントが iOS シミュレータを自律操作する潮流を一次ソースで読み解く
Software Mansion が2026年5月8日に公開した **MCPベースの iOS / Android シミュレータ操作ツールキット Argent** と、Google の **Gemma 4 E4B(エッジ向けマルチモーダルモデル)** を組み合わせ、オンデバイスでアプリを自律操作させる潮流について一次ソースを精査しました。Argent の公式仕様(スクリーンショット主軸 + アクセシビリティ + プロファイリング、MCPサーバ実装)、Gemma 4 E4B の要件(約2.5GB / RAM 8GB+ / ネイティブ function calling)、Software Mansion 公式デモが実は **Gemini 3.5 Flash(クラウド)** を使っていた事実、別件で iPhone 17 Pro 上で動作確認された Gemma 4 E2B のデモとの違い、そして日本企業のモバイル QA / 社内アプリ自動化での現実的な適用判断までを公式情報ベースで整理しています。
ArgentSoftware MansionGemma 4
AI2026-05-21
Gemma 4 と Google AI Studio 大型更新 — Google I/O 2026 で再強調されたオープンウェイト LLM の最新仕様と日本企業への実装判断
Google I/O 2026 で再強調された Gemma 4(2B〜31B、256K コンテキスト、140言語、Apache 2.0)と Google AI Studio の大型更新(Kotlin Vibe Coding・Cloud Run ワンクリックデプロイ・Managed Agents API)の全貌を整理します。社内 LLM 導入、データ主権、ローカル実行の判断軸を含め、IT コンサルタントの視点で解説。
GoogleGemma 4Google AI Studio
AI2026-04-17
Gemma 4 完全要件リファレンス — VRAM・RAM・GPU必要スペック早見表【E2B/E4B/26B/31B全バリアント対応】
Gemma 4の最小要件は5GB RAM(E2B Q4量子化版)、推奨は24GB VRAM(31B Dense Q4)。E2B・E4B・26B MoE・31B Dense全バリアントのVRAM/RAM/GPU要件を早見表で一覧化したクイックリファレンス。
Gemma 4RequirementsVRAM
AI2026-04-07
Gemma 4 E4B完全ガイド — エッジデバイスで動く4.5Bパラメータマルチモーダルモデルの実力と活用法【2026年版】
Gemma 4 E4BはGoogleが2026年4月にリリースした4.5BパラメータのエッジAIモデルです。Apple SiliconやRaspberry Piでのローカル動作手順、マルチモーダル機能、量子化設定、ベンチマーク比較まで徹底解説します。
Gemma 4Gemma 4 E4BエッジAI
AI2026-04-03
Gemma 4入門ガイド — 概要・特徴・Ollamaでの始め方【2026年完全解説】
Googleが2026年4月2日にリリースしたGemma 4の完全ガイド。E2B、E4B、26B MoE、31B Denseの4バリアント、Apache 2.0ライセンス、マルチモーダル対応など最新情報とOllamaでの実行方法を詳しく解説します。
Gemma 4OllamaGoogle
AI2026-04-03
Gemma 4 vs Llama 4 vs Qwen 3.5徹底比較 — 2026年ローカルLLM選定ガイド
Gemma 4、Llama 4、Qwen 3.5の3大ローカルLLMを徹底比較。ベンチマーク性能、ライセンス、日本語対応、ハードウェア要件、ユースケース別の選定基準を詳しく解説します。
Gemma 4Llama 4Qwen 3.5
AI2026-04-03
Gemma 4エンタープライズ導入ガイド — セキュリティ・プライバシー・オンプレミス運用【2026年版】
Gemma 4をエンタープライズ環境に導入するための完全ガイド。データ主権、GDPR/HIPAA/PCI DSS対応、オンプレミス運用、セキュリティ対策、コスト比較、監視体制まで詳しく解説します。
Gemma 4エンタープライズセキュリティ
AI2026-04-03
中小企業のためのGemma 4活用ガイド — コスト削減とAI業務自動化の実践【2026年版】
中小企業がGemma 4をローカル環境で活用し、クラウドAPIコストをゼロにする実践的な導入ガイド。投資回収期間わずか25日のコスト削減効果と、顧客対応・文書作成・開発支援など5つの具体的な活用事例を詳しく解説します。
Gemma 4中小企業AI自動化