it.xnews.jp
出典: Cloudflare Blog 原文公開: 2026-10-01 生成: 2026-10-02 読了 約 4 分 model: claude-haiku-4-5 原文: https://blog.cloudflare.com/clef-decision-models/ raw.md

Cloudflare、オープンソース決定モデル「Clef」を公開

Cloudflare は、構造化された決定出力を生成するオープンソース決定モデル「Clef」と「Clef-flash」を公開した。Workers AI でホストされ、Hugging Face で Apache 2.0 ライセンスの下で利用可能であり、強化学習によるファインチューニング機能も提供される。

Cloudflare は 2026 年 10 月 1 日、意思決定ワークフロー向けのオープンソース決定モデル「Clef」と「Clef-flash」を発表した。これらのモデルは Workers AI でホストされ、Hugging Face 上で Apache 2.0 ライセンスの下で利用可能である。同社はまた、これらのモデルをファインチューニングするための強化学習プラットフォームを新たに導入した。

モデルの特性と性能

Clef は Jev API との完全互換性を備えており、ビジョンエンコーダを搭載して視覚コンテンツを分類できる。一方、Jev はテキスト分類のみに対応している。Clef のコンテキストウィンドウは 64k トークンであり、Jev の 32k トークンを上回る。

Cloudflare は内部の Threat Intelligence チームで Clef をドメイン分類にて検証し、ウェブサイトの取得、レンダリング、分類に要する時間が 2.2s であることを確認した。同じワークフローで gpt-oss-120b LLM は 4.7s を要した。また、gpt-oss-120b が 2 つの分類結果を返したのに対し、Clef は複数の分類を返した。

Clef のパフォーマンス比較

Typesafe AI の評価スイートでは、Clef は 4 つの領域のうち 3 つで Jev を上回った。BL · case exact ベンチマークで Clef は 98.47、Clef-flash は 98.76、Jev は 95.75 を記録した。ToolRet · nDCG@10 では Clef が 69.19、Clef-flash が 66.43 のスコアを獲得した。API-Bank · accuracy ベンチマークでは Clef が 91.93、Clef-flash が 93.11 を記録した。

ベンチマーク結果の詳細

Home appliances · case exact では Clef が 82.95、Clef-flash が 97.73 を記録した。When2Call · accuracy では Clef が 72.37、Clef-flash が 65.58 であった。BANKING77 · macro-F1 では Clef が 94.20、Clef-flash が 90.93 のスコアを獲得した。CLINC150+OOS · macro-F1 では Clef が 97.43、Clef-flash が 66.77、BRIGHT · nDCG@10 では Clef が 45.91、Clef-flash が 39.26 であった。Amazon ESCI · macro-F1 では両モデルともほぼ同等で、Clef が 57.48、Clef-flash が 57.39 を記録した。PhishNChips · accuracy では Clef が 79.60、Clef-flash が 75.05 を達成した。

計 43 個の評価ベンチマークを実施し、Clef モデルと競合製品を比較した。Invoice processing workflow では Clef が 64.7、Clef-flash が 57.1、Customer service workflow では Clef が 76.3、Clef-flash が 77、Security incidents workflow では Clef が 62.9、Clef-flash が 61.7 を記録した。Agent trace observability workflow では Clef が 68.5、Clef-flash が 69.8 のスコアを達成した。

レイテンシ測定では、Clef の中央値レイテンシが 209.3 ミリ秒、Clef-flash が 38.8 ミリ秒、Jev が 524.1 ミリ秒であった。p95 レイテンシでは、Clef が 238.6 ミリ秒、Clef-flash が 122.4 ミリ秒、Jev が 536.0 ミリ秒を記録した。

技術的な実装

Clef は Qwen をベースモデルとして採用している。Clef は Qwen3.8 の 27B パラメータをベースにしており、Clef-flash は Qwen3.5 の 9B パラメータに基づいている。推論中、Clef は prefill のみのパスを用いて有効なスキーマ選択肢の並列スコアリングを行う。決定ステップは非自己回帰的である。Cloudflare は特殊な 2 段階アテンション・ルーティング処理を採用し、ランク 256 の低ランク適応器をトレーニングに使用した。

ファインチューニングと今後の展開

Cloudflare は Reinforcement Learning for Calibrated Decisions (RLCD) を開発し、15 年以上にわたる異なるドメイン間のネットワークデータを保有している。同社はファインチューニングサービスをフォワード・デプロイされたエンジニアで提供する予定であり、セルフサービスのファインチューニングプラットフォームは後日利用可能となる予定である。加えて、Cloudflare は Replicate を買収した。

決定モデルの応用例

筆者の見立て

この記事は元記事の事実のみに基づいて自動生成されました。

出典

Cloudflare Blog「Introducing Clef: our open-source decision models, and new RL fine-tuning platform」https://blog.cloudflare.com/clef-decision-models/

この記事をシェア