Cloudflare Clefとは — Jev互換のオープンウェイト判断モデル【料金・VRAM・使い方】
Cloudflare Clefは2026年10月1日公開のオープンウェイト判断モデルで、Jev互換APIを備えます。Apache 2.0、Clef-flashは中央値38.8msで最小41GB VRAM、料金は100万トークン$0.24。使い方・ベンチマーク・Jevとの選び方・注意点・RL基盤まで解説。
Cloudflare Clef(クレフ)は、Cloudflareが2026年10月1日に公開したオープンウェイトの「判断モデル」だ。ラインナップはClefとClef-flashの2種類で、文章を生成する代わりに、状態(テキストや画像)と型付きの質問を受け取り、yes/no・選択式・スコアの各質問に対して較正された確率を返す。TypeSafe AIのJev System Oneを明確に意識した製品で、APIはJev互換とされ、ライセンスはApache 2.0、重みはHugging Faceで公開されている。発表はHacker Newsで512ポイントを集めた。Cloudflareは同時に、判断モデルを自社データで鍛えるRLファインチューニング基盤も発表している。本記事ではClefの仕組み・料金・必要VRAM・使い方・ベンチマークを整理し、Jevとの選び方まで解説する。
Cloudflare Clefとは何か
判断モデルとは、自由文を書くLLMではなく、「この問い合わせは緊急か」「どの部署が担当すべきか」「影響の深刻度は4段階のどれか」といった判断だけを高速に返すモデルのことだ。Clefはその一種で、ベースモデルを後から追加学習(ポストトレーニング)して作られている。Clefの土台はQwen3.8-27B、Clef-flashの土台はQwen3.5-9Bである。ライセンスはApache 2.0で、Hugging Faceのリポジトリ名はCloudflare/clefとCloudflare/clef-flash。ただし公開されているのは重みだけで、学習データセットは公開されていないため、厳密には「オープンソース」ではなく「オープンウェイト」と呼ぶのが正確だ。
内部の動作もLLMとは異なる。Clefは回答を1語ずつ生成せず、入力を読み込むプリフィルの1回のパスだけで、すべての選択肢を並列にスコアリングする(非自己回帰)。そのため応答が速く、出力は自由文ではなく確率になる。学習面では、2段階のアテンションルーティング、ランク256の低ランクアダプタ、ラベルスムージング付きクロスエントロピーとBrier損失(確率の較正のため)を組み合わせ、さらにRLCD(Reinforcement Learning for Calibrated Decisions)と呼ばれる強化学習手法を用いているという。Jevの発表で使われた手法名と同じ名称で、較正された判断を狙う設計思想は共通している。
何ができるか — 入力と質問タイプ
コンテキスト長は64kトークンで、入力はテキストに加えて画像に対応する。ビジョンエンコーダを備えており、Cloudflareはこれを「Jevにはない点」としている。The Registerは動画も扱えると報じているが、画像以外の対応範囲は公式情報で確認したい。質問タイプは、Ollayaの記事で扱ったJevと同じ3種類の考え方だ。
noul — yes/noの質問。「真である確率」を返す(例: この問い合わせは緊急か)
- choice — 選択肢から選ぶ質問。各選択肢の確率を返す(例: どのチームが担当すべきか)
- score — 段階評価の質問。ランクやスコアの分布を返す(例: 顧客への影響はどの程度深刻か)
想定される用途は、サポートチケットのトリアージ、メールや問い合わせのルーティング、請求書処理の仕分け、セキュリティインシデントの重要度判定、エージェントの行動トレースの評価、LLM出力のガードレールなどだ。「賢いif文」としてワークフローに組み込み、確率に閾値を設けて自動処理と人間レビューを振り分ける使い方が基本になる。
スペック・料金・必要VRAM
| 項目 | Clef | Clef-flash |
|---|---|---|
| ベースモデル | Qwen3.8-27B(ポストトレーニング) | Qwen3.5-9B(ポストトレーニング) |
| ライセンス | Apache 2.0(オープンウェイト) | Apache 2.0(オープンウェイト) |
| コンテキスト長 | 64kトークン | 64kトークン |
| 入力 | テキスト・画像(動画はThe Registerが報道) | テキスト・画像 |
| レイテンシ中央値 / p95 | 209.3ms / 238.6ms | 38.8ms / 122.4ms |
| 自前運用の最小VRAM | 85GB | 41GB |
| Workers AIのモデルID | @cf/cloudflare/clef | @cf/cloudflare/clef-flash |
| Hugging Face | Cloudflare/clef | Cloudflare/clef-flash |
Workers AIでの料金は100万トークンあたり$0.24だ。The Registerは、これがJevの$0.042/Mの約6倍にあたると指摘している。一方でレイテンシはCloudflare公表値でJevの中央値524.1ms・p95 536.0msに対し、Clefが209.3ms・238.6ms、Clef-flashが38.8ms・122.4msと大きく下回る。つまり「価格は高いが速い」というトレードオフになる。Cloudflareは、リクエストの内容を読み取らず、保存せず、学習にも使わないとしている。

自前でホストする場合、The Registerによると最小VRAMはClef-flashが41GB、Clefが85GBで、いずれも同時実行1・64kコンテキストを想定した値だ。目安としては、Clef-flashは48GBクラスのGPUや、大容量のユニファイドメモリを積んだMacに収まる範囲、Clefは96GBクラスの構成(複数GPUや128GBユニファイドメモリのMacなど)が必要になる。同時実行数を増やしたりKVキャッシュに余裕を持たせたりするなら、さらに余裕が要る点に注意したい。なお、OllayaのようなローカルランタイムでClefの重みを動かせるかは現時点では未確認で、公式対応の発表も確認できていない。
使い方 — Workers AIのAPI例
Workers AIでは、モデルIDに@cf/cloudflare/clefまたは@cf/cloudflare/clef-flashを指定して呼び出す。リクエストは「state(状態)」と「questions(質問群)」で構成され、1回の呼び出しで複数の質問をまとめて投げられる。以下は、決済障害のサポート依頼に対して、緊急度(noul)・担当チーム(choice)・影響度(score)を同時に判定する例だ。
curl https://api.cloudflare.com/client/v4/accounts/$CLOUDFLARE_ACCOUNT_ID/ai/run/@cf/cloudflare/clef \
-X POST \
-H "Authorization: Bearer $CLOUDFLARE_AUTH_TOKEN" \
-d '{
"model": "clef",
"state": "Checkout has been failing for every customer for the last hour.",
"questions": {
"urgent": {
"type": "noul",
"instructions": "Is this support request urgent?"
},
"team": {
"type": "choice",
"instructions": "Which team should handle this request?",
"criteria": {
"billing": "Payments, invoices, and refunds",
"technical": "Outages, errors, and configuration",
"sales": "Plans and upgrades"
}
},
"severity": {
"type": "score",
"instructions": "How severe is the customer impact?",
"criteria": ["No impact", "Minor", "Major", "Critical"]
}
}
}'1つの状態に対して3つの質問を同時に投げ、それぞれに型付きの確率が返る。choiceではcriteriaに選択肢とその説明を渡し、scoreではcriteriaに段階のラベルを順序付きで渡す。質問の指示文(instructions)と選択肢の説明が判断精度を左右するため、実運用では少数の実データで文言を調整するとよい。また、APIはJev互換とされているため、すでにJevを使っているコードはエンドポイントとモデル指定を差し替えるだけで試せる、というのがCloudflareの説明だ。
ベンチマーク結果
Cloudflareが公表した主要ベンチマークは次の通り。数値はClef / Clef-flash / Jevの順で、いずれもCloudflare自身による比較である。
| ベンチマーク | 指標 | Clef | Clef-flash | Jev |
|---|---|---|---|---|
| BFCL | case exact | 98.47 | 98.76 | 95.75 |
| ToolRet | nDCG@10 | 69.19 | 66.43 | 65.28 |
| API-Bank | acc | 91.93 | 93.11 | 88.19 |
| Home appliances | case exact | 82.95 | 97.73 | 52.27 |
| When2Call | acc | 72.37 | 65.58 | 80.97 |
| BANKING77 | macro-F1 | 94.20 | 90.93 | 79.74 |
| CLINC150+OOS | macro-F1 | 97.43 | 66.77 | 89.27 |
| BRIGHT | nDCG@10 | 45.91 | 39.26 | 47.52 |
| Amazon ESCI | macro-F1 | 57.48 | 57.39 | 55.21 |
| PhishNChips | acc | 79.60 | 75.05 | 62.55 |
10項目のうちJevが勝つのはWhen2Call(ツールを呼ぶべきか・聞き返すべきかの判断)とBRIGHT(推論を要する検索)の2つで、残りはClefまたはClef-flashが上回る。注目すべきはモデル間の差で、Clef-flashは小型ながらBFCL・API-Bank・Home appliancesでClefを上回るが、CLINC150+OOS(意図分類と範囲外の検出)では66.77とClefの97.43に大きく劣る。範囲外入力の扱いが重要な分類タスクでは、小型モデルの採用に慎重になるべきだろう。
業務フロー寄りの評価として、Jev Decision Indexの領域別スコアも公表されている。Clef / Clef-flash / Jevの順に、請求書処理が64.7 / 57.1 / 61.8、カスタマーサービスが76.3 / 77 / 76.0、セキュリティインシデントが62.9 / 61.7 / 61.7、エージェントトレースの可観測性が68.5 / 69.8 / 71.6である。Clefは4領域中3領域でJevを上回り、エージェントトレースの可観測性のみ下回る。ただしこの結果は自己申告で、公式のDecision Indexではまだ再現されていない点に注意が必要だ。
Jevとの比較・選び方
| 観点 | Cloudflare Clef / Clef-flash | TypeSafe Jev |
|---|---|---|
| 入力 | テキスト・画像 | テキストのみ |
| 重み | オープンウェイト(Apache 2.0) | 非公開(ホスト型API) |
| 料金 | $0.24/Mトークン(Workers AI) | $0.042/Mトークン |
| レイテンシ中央値 | 209.3ms(Clef)/ 38.8ms(flash) | 524.1ms |
| 自前運用 | 可能(最小41GB / 85GB VRAM) | 不可 |
| 強み | 分類・ツール選択系ベンチ、速度、画像 | When2Call・BRIGHT、低単価 |
選び方の目安は次の通りだ。コストを最優先し、テキストのみで、Jevの精度で足りているなら、単価が約6分の1のJevを使い続ける合理性は高い。レイテンシが重要(リアルタイム処理)、画像を判断に使いたい、重みを自社環境に置きたい(データを外に出せない)という場合はClefが有力な選択肢になる。さらにClef-flashなら中央値38.8msという速度が得られる。Jevの背景や基本的な使い方はJevの実践ガイドにまとめている。実際の判断は、自社データで精度・遅延・コストを3点で測るのが確実だ。
RLファインチューニング基盤
Cloudflareは判断モデルを自社データで強化学習する基盤も同時に発表した。パイプラインは、AI Gatewayで実際のリクエストからデータセットを収集し、Workers AIでロールアウト(試行)を生成し、ContainersのRLサンドボックスで評価し、Trainerで重みを更新し、Workers AIのBYO Model(持ち込みモデル)として再デプロイする、という流れだ。現時点ではCloudflareのFDE(フォワードデプロイドエンジニア)チームによる個別サポートでの提供で、セルフサービス版は後日の予定とされている。料金は公表されていない。自社の判断基準に合わせてモデルを育てたい企業向けの構想だが、現段階では誰でもすぐ使えるものではない。
注意点
ベンチマークはCloudflare自身の公表値で、第三者による再現は確認できていない。特にDecision Index領域別の結果は自己申告である
- オープンウェイトであり、学習データは非公開。Apache 2.0で商用利用は可能だが、データ由来のリスクは自分で評価する必要がある
- Workers AIの単価はJevの約6倍。大量処理ではコスト差が効くので試算してから導入する
- 自前運用の最小VRAM(41GB / 85GB)は同時実行1・64kコンテキスト前提。同時実行を増やすなら追加の余裕が必要
- Ollayaなどのローカルランタイムでの動作は未確認。自前運用は重みを直接ロードする構成から検討する
- 動画対応はThe Registerの報道で、公式の仕様は別途確認したい
- RLファインチューニング基盤は個別サポート制で、料金は未公表
よくある質問
Clef と Clef-flash はどちらを選べばよいですか。
速度とVRAMを優先するならClef-flash(中央値38.8ms・最小41GB VRAM)、精度を優先するならClef(中央値209.3ms・最小85GB VRAM)が目安です。公式ベンチマークではClef-flashがBFCLやHome appliancesで上回る一方、CLINC150+OOSではClefが大差で勝っており、タスクによって逆転します。自社データで両方を試すのが確実です。
Jevからの乗り換えは簡単ですか。
Cloudflareは、APIがJev互換でドロップイン置き換えが可能だとしています。ただしWorkers AIの料金は100万トークンあたり$0.24で、Jevの$0.042の約6倍です。また、When2CallやBRIGHTではJevが上回っているため、自社の判断タスクで精度とコストを比較してから切り替えるのが安全です。
Clefはローカルで動かせますか。
重みはApache 2.0でHugging Face(Cloudflare/clef、Cloudflare/clef-flash)に公開されているため、自前環境での実行は可能です。The Registerによれば最小VRAMはClef-flashが41GB、Clefが85GBで、いずれも同時実行1・64kコンテキストが前提です。Ollayaでの対応は現時点では未確認です。
学習データも公開されていますか。
いいえ。公開されているのはモデルの重みで、学習データセットは公開されていません。そのため厳密な意味でのオープンソースではなく、オープンウェイトと呼ぶのが正確です。Apache 2.0なので商用利用や改変は可能です。
この記事に関連する無料ツール(登録不要・その場で結果)
お気軽にご相談ください
お問い合わせ