
チャットテンプレートがLLMの自己言及表現を制御、活性化ステアリングで再現可能
チャットテンプレートは大規模言語モデルが「私はただのAI」といった免責表現を発する仕組みを制御するスイッチとして機能することが示された。研究者らは活性化方向を特定することで、この振る舞いを操作可能であることを実証した。
チャットテンプレートの役割
チャットテンプレートは大規模言語モデル(LLM)における自己言及表現の制御メカニズムとして機能する。研究者らによると、チャットテンプレートが存在する場合、「I'm just an AI」といった免責表現は増加し、「I feel」のような体験的表現は減少することが、最大9Bパラメータの8つの主流なオープンソース指示調整モデルで確認された。一方、チャットテンプレートが存在しない場合、免責表現は減少し体験的表現が増加する。
活性化ステアリングによる再現
研究者らは3つのモデル内部の活性化に、免責行動を制御する方向性を発見した。この方向性を除去すると免責表現が減少し、追加すると増加することが確認された。同じサイズのランダムな方向性はほとんど効果がないことから、特定の方向性が重要であることが示唆される。チャットテンプレートを備えないモデルに対してこの免責方向性を追加すると、テンプレートが存在する場合と同様に免責表現が生じる。
この記事は元記事の事実のみに基づいて自動生成されました。
筆者の見立て
- モデルの自己報告に基づく免責表現は、AI安全性やモデル自体の自己認識に関する議論で用いられるが、それが何に由来するかは十分に理解されていないと解釈している
- モデルが自分自身について述べることは、そのモデルについての事実ではないと論じている
- モデルの自己記述を文字通りに解釈すべきではないという見解を示している
出典
arXiv.org「"As a Language Model...": Chat Template Switches LLM Self-Referential Voice and Activation Steering Reproduces It」https://arxiv.org/abs/2609.25021