it.xnews.jp
出典: Another Dev's Two Cents 原文公開: 2026-10-10 生成: 2026-10-11 読了 約 2 分 model: claude-haiku-5-5 原文: https://nishtahir.com/build-your-own-decision-model/ raw.md

小規模言語モデルで独自の意思決定モデルを構築し、CommonsenseQAで評価

Qwen/Qwen3-1.7Bを用いた意思決定モデルの構築手法と、CommonsenseQAによる精度評価、温度スケーリングによる確信度の補正が紹介されている。著者は、固定された選択肢から単一のパスで選ぶモデルを、語彙を選択肢トークンに限定して実装した。CommonsenseQAのランダム抽出ホールドアウトでの正解率は0.5938、マクロF1は0.5844だった。

2026年10月10日付で公開された本記事は、固定された選択肢から単一のパスで選択を行う「意思決定モデル」を、語彙を選択肢トークンに限定する手法で模倣した試みを取り上げている。

構築と評価の方法

著者は、選択肢をA, B, C, D, Eに制限した意思決定モデルをQwen/Qwen3-1.7Bで構築した。評価には、CommonsenseQAからランダムに抽出したホールドアウト1221件が用いられた。出力トークンの確率は、追加の学習がない場合、回答が正しい確率ではなく次のトークンに対するモデルの確信度を反映している可能性がある。著者はデータセットの構築、評価、微調整、キャリブレーションのためのスクリプトをまとめたGitHubリポジトリも公開した。

精度と微調整の結果

ベースモデルの正解率は725/1221 = 0.5938、マクロF1は0.5844だった。著者がデータセットで簡易な微調整を行ったところ、正解率は762/1221 = 0.6241、マクロF1は0.6234に向上した。

確信度と温度スケーリング

「bat」を含む質問では、モデルは選択肢A (Cave) を確率0.9978で出力した。確信度の区間ごとに集計すると、(0.90, 1.00] の区間には809件があり、平均確信度は0.9855に対して正解率は0.7009だった。著者はモデルの正解率に対して温度パラメータを当てはめ、温度の値は3.797280788421631となった。

筆者の見立て

この記事は元記事の事実のみに基づいて自動生成されました。

出典

この記事をシェア