AIエージェントを構築する際、「この問い合わせは緊急か?」「どのツールを実行すべきか?」「このURLはフィッシングか?」といった分岐判断を行う場面が数多くあります。
これまで、こうした処理にも大規模言語モデル(LLM)を使ってプロンプトでJSONを出力させたり、function callingを利用したりするのが一般的でした。しかし、LLMのトークン生成によるレイテンシ(遅延)や出力のゆらぎ(非決定性)に頭を悩ませたエンジニアも多いはずです。

2026年10月1日、Cloudflareはこの課題を解決する意思決定特化型モデル「Clef」および「Clef-flash」を発表しました。あわせて、独自データでモデルを鍛えられる強化学習プラットフォームも登場しています。
1. そもそも「ディシジョンモデル(意思決定モデル)」とは?
ディシジョンモデルとは、LLMのように自由な長文テキストを生成するのではなく、与えられた入力に対して「定義済みの選択肢と確率値」だけを型安全かつ高速に返すモデルです。
Typesafe AIの「Jev (System One)」などが先行して注目を集めていましたが、Cloudflareが発表したClefもこの系譜に連なるモデルです。
従来の分類器や通常LLMとの違い
- 従来の分類モデルとの違い:
あらかじめ決めたカテゴリだけでなく、リクエストごとに任意のスキーマ(質問や選択肢)を渡せます。新しい分類カテゴリを増やすたびに再学習を行う必要がありません。 - 一般的なLLMとの違い:
トークンを1つずつ順番に生成(自己回帰生成)しないため、出力スキーマが壊れる心配がなく、数十〜数百ミリ秒単位という圧倒的な超低レイテンシで確率値を返します。
名前の由来:「Clef(音部記号)」
楽譜の冒頭に置かれる「ト音記号」や「ヘ音記号(Clef)」が後続の音階の文脈を決めるように、エージェントの後続アクションを決定づける存在であること、そして「Cloudflare」の頭文字にちなんで名付けられました。
2. Clefの主な特長
① 圧倒的な低レイテンシ(Clef / Clef-flash)
Cloudflareが公開したベンチマークによると、応答速度の中央値は以下のようになっています。
- Clef-flash: 約 38.8 ms(Jev比で約13倍高速)
- Clef: 約 209.3 ms(Jev比で約2.5倍高速)
- Jev: 約 524.1 ms
ホットパス(ミリ秒単位の応答が求められるクリティカルな処理経路)には軽量・超高速なClef-flash、精度を優先するタスクにはClefという使い分けが可能です。
② 画像も判断できるビジョンエンコーダ搭載
テキストのみに対応していた従来の決定モデルと異なり、Clefは最大4枚までの画像入力に対応するビジョンエンコーダを備えています。Webページのスクリーンショットや伝票画像を入力し、そのまま判断を下すことが可能です。
③ Workers AIでのエッジ展開 & Apache 2.0でオープンソース化
- Workers AI: CloudflareのエッジGPU上で直接ホストされているため、ネットワーク遅延を極小化できます。
- オープンソース: モデルの重みはHugging Face上で Apache 2.0ライセンス として完全公開されており、ローカル環境でも自由に検証・運用できます。
- API互換性: 先行するJevの「System One API」と完全な互換性を持っており、既存コードのエンドポイントを差し替えるだけで試すことができます。
3. なぜそこまで速いのか?そのアーキテクチャ
Clefの高速性の秘密は、推論プロセスにあります。
- ベースモデル:
Clefは Qwen3.8-27B、Clef-flashは Qwen3.5-9B をバックボーンに採用。 - Prefill-only(先頭処理のみ)の非自己回帰設計:
通常のLLMのようにトークンを1つずつ逐次生成(Decode)しません。入力を1回読み込んだ(Prefill)後、定義された選択肢のスコアを内部表現から並列に直接算出します。 - 確率のキャリブレーション(RLCD):
単に選択肢を選ぶだけでなく、確率値の信頼性を高めるために「Reinforcement Learning for Calibrated Decisions(RLCD)」という独自の強化学習手法を導入。これにより、「確信度90%以上なら完全自動化、それ未満なら人間へエスカレーション」といった運用ルールが組みやすくなっています。
4. どんなユースケースに使えるのか?
- サポートチケットの自動ルーティング
ユーザーの投稿が「緊急かどうか」「問い合わせ窓口はどこか」をミリ秒単位で型安全に判定し、適切なチームへ即時振り分け。 - Webサイトの脅威・ドメイン判定
Cloudflareの社内検証では、Browser Runと組み合わせて対象Webサイトを取得・レンダリングし、フィッシングかどうかの分類を 2.2秒 で完了(一般LLMの4.7秒から半減)。 - エージェントのガードレール(事前チェック)
自律型エージェントが外部ツールを呼び出す直前に、「この操作を実行して問題ないか?」を数十ミリ秒で事前判定。 - コンテンツモデレーション / Trust & Safety
投稿規約に基づいたスコアリングを確率付きで即座に算出。
5. 独自データで鍛える「RLファインチューニング基盤」も発表
自社の業務ドメインに特化した判断を行わせたい企業向けに、Clefを強化学習(RL)でファインチューニングできる基盤の提供も開始されます。
まずはCloudflareの専任エンジニアチーム(FDE: Forward-Deployed Engineers)とのパートナーシップからスタートし、将来的にはユーザー自身が自前データで学習・エッジへ再デプロイできるセルフサービス型プラットフォームとして展開される予定です。
まとめ
Clefの登場は、「推論・テキスト生成はLLMに任せ、リアルタイムな判断・ルーティング・分類はディシジョンモデルに任せる」という、実用的なエージェント設計のアーキテクチャ分離を決定づけるニュースと言えます。
「エージェントのツール呼び出し待ちが遅い」「LLMの出力フォーマット崩れでエラーになる」といった課題を感じている方は、Workers AIまたはHugging FaceでClefを試してみてはいかがでしょうか。


コメント