---
source_url: https://blog.cloudflare.com/clef-decision-models/
source_title: "Introducing Clef: our open-source decision models, and new RL fine-tuning platform"
source_site: "Cloudflare Blog"
source_published_at: 2026-10-01T15:34:02.111Z
hero_image: https://blog.cloudflare.com/_emdash/api/media/file/01M3TJV43SPQCPKJ6GBXFCDKNE.01M3TJV53VYDMVNCZDPH1FBFYN.png
tags: decision-models,machine-learning,ai-platform
generated_at: 2026-10-02T00:01:27.397Z
model: claude-haiku-4-5
---
# Cloudflare、オープンソース決定モデル「Clef」を公開

Cloudflare は、構造化された決定出力を生成するオープンソース決定モデル「Clef」と「Clef-flash」を公開した。Workers AI でホストされ、Hugging Face で Apache 2.0 ライセンスの下で利用可能であり、強化学習によるファインチューニング機能も提供される。

Cloudflare は 2026 年 10 月 1 日、意思決定ワークフロー向けのオープンソース決定モデル「Clef」と「Clef-flash」を発表した。これらのモデルは Workers AI でホストされ、Hugging Face 上で Apache 2.0 ライセンスの下で利用可能である。同社はまた、これらのモデルをファインチューニングするための強化学習プラットフォームを新たに導入した。

## モデルの特性と性能

Clef は Jev API との完全互換性を備えており、ビジョンエンコーダを搭載して視覚コンテンツを分類できる。一方、Jev はテキスト分類のみに対応している。Clef のコンテキストウィンドウは 64k トークンであり、Jev の 32k トークンを上回る。

Cloudflare は内部の Threat Intelligence チームで Clef をドメイン分類にて検証し、ウェブサイトの取得、レンダリング、分類に要する時間が 2.2s であることを確認した。同じワークフローで gpt-oss-120b LLM は 4.7s を要した。また、gpt-oss-120b が 2 つの分類結果を返したのに対し、Clef は複数の分類を返した。

![Clef のパフォーマンス比較](https://blog.cloudflare.com/_image?href=https%3A%2F%2Fblog.cloudflare.com%2F_emdash%2Fapi%2Fmedia%2Ffile%2F01M3W09VBACVT4420YA2SDXZE8.01M3W09YK4NRJQNV2S8HMMCQF0.png&w=715&h=294&f=webp&fit=cover&position=center)

Typesafe AI の評価スイートでは、Clef は 4 つの領域のうち 3 つで Jev を上回った。BL · case exact ベンチマークで Clef は 98.47、Clef-flash は 98.76、Jev は 95.75 を記録した。ToolRet · nDCG@10 では Clef が 69.19、Clef-flash が 66.43 のスコアを獲得した。API-Bank · accuracy ベンチマークでは Clef が 91.93、Clef-flash が 93.11 を記録した。

![ベンチマーク結果の詳細](https://blog.cloudflare.com/_image?href=https%3A%2F%2Fblog.cloudflare.com%2F_emdash%2Fapi%2Fmedia%2Ffile%2F01M3TJPNG3PJHDJ88KJZJ7Q29T.png&w=715&h=376&f=webp&fit=cover&position=center)

Home appliances · case exact では Clef が 82.95、Clef-flash が 97.73 を記録した。When2Call · accuracy では Clef が 72.37、Clef-flash が 65.58 であった。BANKING77 · macro-F1 では Clef が 94.20、Clef-flash が 90.93 のスコアを獲得した。CLINC150+OOS · macro-F1 では Clef が 97.43、Clef-flash が 66.77、BRIGHT · nDCG@10 では Clef が 45.91、Clef-flash が 39.26 であった。Amazon ESCI · macro-F1 では両モデルともほぼ同等で、Clef が 57.48、Clef-flash が 57.39 を記録した。PhishNChips · accuracy では Clef が 79.60、Clef-flash が 75.05 を達成した。

計 43 個の評価ベンチマークを実施し、Clef モデルと競合製品を比較した。Invoice processing workflow では Clef が 64.7、Clef-flash が 57.1、Customer service workflow では Clef が 76.3、Clef-flash が 77、Security incidents workflow では Clef が 62.9、Clef-flash が 61.7 を記録した。Agent trace observability workflow では Clef が 68.5、Clef-flash が 69.8 のスコアを達成した。

レイテンシ測定では、Clef の中央値レイテンシが 209.3 ミリ秒、Clef-flash が 38.8 ミリ秒、Jev が 524.1 ミリ秒であった。p95 レイテンシでは、Clef が 238.6 ミリ秒、Clef-flash が 122.4 ミリ秒、Jev が 536.0 ミリ秒を記録した。

## 技術的な実装

Clef は Qwen をベースモデルとして採用している。Clef は Qwen3.8 の 27B パラメータをベースにしており、Clef-flash は Qwen3.5 の 9B パラメータに基づいている。推論中、Clef は prefill のみのパスを用いて有効なスキーマ選択肢の並列スコアリングを行う。決定ステップは非自己回帰的である。Cloudflare は特殊な 2 段階アテンション・ルーティング処理を採用し、ランク 256 の低ランク適応器をトレーニングに使用した。

## ファインチューニングと今後の展開

Cloudflare は Reinforcement Learning for Calibrated Decisions (RLCD) を開発し、15 年以上にわたる異なるドメイン間のネットワークデータを保有している。同社はファインチューニングサービスをフォワード・デプロイされたエンジニアで提供する予定であり、セルフサービスのファインチューニングプラットフォームは後日利用可能となる予定である。加えて、Cloudflare は Replicate を買収した。

![決定モデルの応用例](https://blog.cloudflare.com/_image?href=https%3A%2F%2Fblog.cloudflare.com%2F_emdash%2Fapi%2Fmedia%2Ffile%2F01M3TJPQEG983EA9PS20PQZS6R.png&w=715&h=463&f=webp&fit=cover&position=center)

## 筆者の見立て

- Clef は意思決定ツールの使用方法に破壊的な変化をもたらす可能性を示唆している
- Clef がエージェントクラウドというCloudflare のミッションに自然に適合するものと解釈している

*この記事は元記事の事実のみに基づいて自動生成されました。*

## 出典

Cloudflare Blog「Introducing Clef: our open-source decision models, and new RL fine-tuning platform」https://blog.cloudflare.com/clef-decision-models/
