---
source_url: https://nishtahir.com/build-your-own-decision-model/
source_title: "Build your own decision model"
source_site: "Another Dev's Two Cents"
source_published_at: 2026-10-10T21:24:15.000Z
tags: llm,calibration,evaluation,decision-models,machine-learning
generated_at: 2026-10-11T00:01:03.521Z
model: claude-haiku-5-5
---
# 小規模言語モデルで独自の意思決定モデルを構築し、CommonsenseQAで評価

Qwen/Qwen3-1.7Bを用いた意思決定モデルの構築手法と、CommonsenseQAによる精度評価、温度スケーリングによる確信度の補正が紹介されている。著者は、固定された選択肢から単一のパスで選ぶモデルを、語彙を選択肢トークンに限定して実装した。CommonsenseQAのランダム抽出ホールドアウトでの正解率は0.5938、マクロF1は0.5844だった。

2026年10月10日付で公開された本記事は、固定された選択肢から単一のパスで選択を行う「意思決定モデル」を、語彙を選択肢トークンに限定する手法で模倣した試みを取り上げている。

## 構築と評価の方法

著者は、選択肢をA, B, C, D, Eに制限した意思決定モデルをQwen/Qwen3-1.7Bで構築した。評価には、CommonsenseQAからランダムに抽出したホールドアウト1221件が用いられた。出力トークンの確率は、追加の学習がない場合、回答が正しい確率ではなく次のトークンに対するモデルの確信度を反映している可能性がある。著者はデータセットの構築、評価、微調整、キャリブレーションのためのスクリプトをまとめたGitHubリポジトリも公開した。

## 精度と微調整の結果

ベースモデルの正解率は725/1221 = 0.5938、マクロF1は0.5844だった。著者がデータセットで簡易な微調整を行ったところ、正解率は762/1221 = 0.6241、マクロF1は0.6234に向上した。

## 確信度と温度スケーリング

「bat」を含む質問では、モデルは選択肢A (Cave) を確率0.9978で出力した。確信度の区間ごとに集計すると、(0.90, 1.00] の区間には809件があり、平均確信度は0.9855に対して正解率は0.7009だった。著者はモデルの正解率に対して温度パラメータを当てはめ、温度の値は3.797280788421631となった。

## 筆者の見立て

- モデルの確信度と正解率が一致しておらず、キャリブレーションされていないと解釈している。
- 全体として、モデルは予測に対して過信気味であると解釈している。
- 温度スケーリングにより、キャリブレーションが大幅に改善されると論じている。
- 1.7Bモデルとしては悪くない結果だと論じている。
- 読者にリポジトリを取得し、より大きなモデルで試すことを勧めていると論じている。

*この記事は元記事の事実のみに基づいて自動生成されました。*

## 出典

- 媒体: Another Dev's Two Cents
- 原題: Build your own decision model
- URL: https://nishtahir.com/build-your-own-decision-model/
- CommonsenseQA の報道による
