Ember-1とは — Kimi K3の品質でトークン約40%減、Fireworksの新モデル
Fireworks AI「Ember-1」はKimi K3を後学習し出力トークンを約40%削減した推論モデル。ベンチマーク結果・料金体系・APIコード例・Kimi K3との違い・ローカル実行不可などの注意点までまとめて解説する。現在は研究プレビューとして2週間限定で提供されており、注目度の高い新モデルとなっている。
Ember-1とは、Fireworks AIが2026年9月23日に発表した推論モデルで、Moonshot AIのKimi K3の仕様・料金解説で紹介したKimi K3(2.78兆パラメータのMoEモデル)を後学習(post-training)し、同水準の精度を保ったまま出力トークン数を大幅に減らしたモデルである。9月28日にはHacker Newsのフロントページに462ポイントで掲載され、注目を集めている。
Ember-1が解決する問題
推論モデルは思考の過程(reasoning trace)を長く生成することで精度を高めるが、その分トークン数が増え、APIコストと応答時間が膨らむ。推論の「深さ」を下げれば速くなるが精度も落ちる、というトレードオフが常につきまとっていた。Ember-1はこのトレードオフを崩すことを狙ったモデルで、単に推論努力(reasoning effort)の設定を下げるのではなく、モデル自体を学習し直すことで「短く的確な思考」を生成できるようにした点が特徴だ。Fireworks Researchは50以上の学習実験と200以上の評価を重ね、数学・コーディング・指示追従・会話・検索・ツール利用・ソフトウェアエンジニアリングのタスクで新しい学習アルゴリズムを適用したという。学習には顧客データは使用していない。
トークン削減の実測値
Fireworksの発表によれば、Ember-1はKimi K3に比べて全体で約40%少ないトークンで同等の応答を生成する。7つのベンチマークでは推論トークンが35〜50%削減された。ある本番顧客のA/Bテストでは、1タスクあたりの出力トークンが49,300から29,900へ約39%減少し、タスクスコアはほぼ変わらず(0.753 対 0.751)だった。別の計測では「同等品質でトークン数が約35%減少」という結果も報告されている。

ベンチマーク比較
| ベンチマーク | Ember-1 | Kimi K3 Max | コスト変化 |
|---|---|---|---|
| Terminal Bench 2.1 | 82.0% | 80.9% | -51.9% |
| SWE-bench Verified | 92.2% | 93.2% | -15.5% |
| SWE-Interact | 20.0% | 21.3% | -32.5% |
| DeepSWE 1.1 | 75.2% | 66.4% | -23.7% |
| τ²-Bench Airline | 66% | 64% | -5.9% |
SWE-bench VerifiedとSWE-Interactの2項目ではKimi K3 Maxをわずかに下回るが、その他の項目ではEmber-1が上回り、いずれもコストは大きく下がっている。これらの数値はFireworks自身が公開したベンチマーク結果であり、第三者による再現検証は現時点で確認できていない。
料金と提供状況
Ember-1はAPI経由でのみ利用可能で、Fireworks Serverless上のResearch Preview(研究プレビュー)として当初2週間限定で提供されている。重みや学習コード、学習アルゴリズムの詳細は公開されていないため、Kimi K3のようにローカル環境で自前実行することはできない。料金はKimi K3のAPIと同じ単価(入力$3.00/100万トークン、キャッシュ入力$0.30/100万トークン、出力$15.00/100万トークン)で設計されており、コスト削減はトークン数そのものが減ることによって実現される。前述のA/B事例で計算すると、出力トークン49,300個なら約$0.74、29,900個に減れば約$0.45となり、1タスクあたり約4割のコスト削減になる。
- モデルID: accounts/fireworks/models/ember-1
- コンテキスト長: 約104万トークン(1,040k)
- 入力形式: テキスト+画像
- 対応機能: 関数・ツール呼び出し、暗黙のプロンプトキャッシュ、Zero Data Retention(ゼロデータ保持)/学習への非利用オプション
- 非対応: ファインチューニング、埋め込み(embeddings)、リランキング
- その他の入手経路: OpenRouter(fireworks/ember-1)、Vercel AI Gatewayでも利用が報告されている
APIの使い方
FireworksのエンドポイントはOpenAI互換なので、OpenAIの公式Python SDKからbase_urlとモデルIDを指定するだけで呼び出せる。
```python
from openai import OpenAI
import os
client = OpenAI(
base_url="https://api.fireworks.ai/inference/v1",
api_key=os.environ["FIREWORKS_API_KEY"],
)
response = client.chat.completions.create(
model="accounts/fireworks/models/ember-1",
messages=[
{"role": "user", "content": "次のコードをレビューして改善点を教えて"}
],
)
print(response.choices[0].message.content)
```Kimi K3との違い
Ember-1はKimi K3そのものではなく、K3を土台に後学習を施した派生モデルという位置づけだ。ベースモデルの重みは公開されているKimi K3と共有しているが、Ember-1自体の重みや学習コードはFireworksが独占しており、Kimi K3をセルフホストする方法で解説したようなローカル実行はできない。用途で選ぶなら、コストと速度を優先するタスクや大量のエージェント実行にはEmber-1、自前インフラでの運用やカスタマイズの自由度を重視するならオープンウェイトのKimi K3、という整理になる。また、Fireworksは企業向けに顧客独自データを使ったトークン効率化のカスタム学習も提供しており、Ember-1はその汎用版という位置づけでもある。
利用上の注意点
- 研究プレビュー扱い: 提供条件や利用可否は2週間後に変更される可能性がある
- ベンチマークは自社発表: 独立した第三者検証はまだ行われていない
- 一部指標で微減: SWE-bench VerifiedはKimi K3 Maxよりわずかに低い
- セルフホスト不可: 重み非公開のため自社インフラでの運用はできない
Ember-1はローカルで動かせる?
できない。重みや学習コードが公開されていないため、Fireworks AIのAPI経由での利用のみとなる。ローカルで動かしたい場合はオープンウェイトのKimi K3を検討する必要がある。
料金はKimi K3より安い?
単価(入力$3.00/出力$15.00 per 100万トークン)はKimi K3と同じだが、同じタスクを処理する際のトークン数が約40%少なくなるため、実質的なコストは下がる。
Kimi K3との違いは何?
Ember-1はKimi K3を土台に後学習し、精度を保ちながら思考過程(reasoning trace)を短くしたモデル。ベースのKimi K3自体は変更されておらず、Ember-1はFireworks独自の派生版という位置づけ。
研究プレビュー終了後はどうなる?
当初2週間の期間限定提供とされており、その後の条件や継続提供の有無は未発表。Fireworksの発表を確認する必要がある。
お気軽にご相談ください
お問い合わせ