Representational Control over Self-Report & Behavior Coherence in LLM Risk-Taking

LLMのリスク許容度における自己報告と行動の整合性に対する表現操作の効果

発信
arXiv cs.CY(コンピュータと社会)(国際)
原文の言語
英語
公開
2026年10月6日
種類
ウィークシグナル、技術

要約

LLM(大規模言語モデル)の自己報告と実際の行動が一致しない現象について、活性化ステアリングという手法で内部表現を直接操作し検証した研究である。9種類のステアリングベクトル抽出法を4つのオープンウェイトモデルで比較し、同じ内部操作でも自己報告と行動の反応が共に変化するとは限らないことを示した。

リスクの側から考える

LLMの自己報告が内部状態の操作と必ずしも連動しないことが明らかになれば、モデルの性向評価に自己申告を用いる安全性評価手法の信頼性が問い直される。

記事に書かれた事実ではなく、読む人が考えるための問いかけです。
原文を読む(英語) 誤りを報告する

キーワード

タイトル、要約、分類、波及は、原文のフィード情報をもとにAIが作成しました。全訳は掲載していません。正確な内容は原文でご確認ください。