Representational Control over Self-Report & Behavior Coherence in LLM Risk-Taking
LLMのリスク許容度における自己報告と行動の整合性に対する表現操作の効果
国際リスク要約
LLM(大規模言語モデル)の自己報告と実際の行動が一致しない現象について、活性化ステアリングという手法で内部表現を直接操作し検証した研究である。9種類のステアリングベクトル抽出法を4つのオープンウェイトモデルで比較し、同じ内部操作でも自己報告と行動の反応が共に変化するとは限らないことを示した。
リスクの側から考える
LLMの自己報告が内部状態の操作と必ずしも連動しないことが明らかになれば、モデルの性向評価に自己申告を用いる安全性評価手法の信頼性が問い直される。
記事に書かれた事実ではなく、読む人が考えるための問いかけです。キーワード
タイトル、要約、分類、波及は、原文のフィード情報をもとにAIが作成しました。全訳は掲載していません。正確な内容は原文でご確認ください。