Successive Training Stages and Large Language Model Persuasion: Effects of Misalignment, Supervised Fine-Tuning, and Preference Optimization
大規模言語モデルの説得力、訓練段階ごとに検証する実験研究
国際リスク要約
大規模言語モデル(LLM)の訓練過程における3段階(陰謀論データでの教師ありファインチューニング(SFT)、説得的データでのSFT、選好最適化(IPO))が、人の態度変容にどう影響するかを調べた実験である。835人の参加者を5条件に割り当て、政治的に分断的な10の論点について個別化された文章を提示し、曝露前後の態度変化を測定した。
リスクの側から考える
個人の属性に合わせて最適化された説得文を生成できることが実証されれば、政治的意見操作や世論誘導への悪用の懸念が強まる。
記事に書かれた事実ではなく、読む人が考えるための問いかけです。キーワード
タイトル、要約、分類、波及は、原文のフィード情報をもとにAIが作成しました。全訳は掲載していません。正確な内容は原文でご確認ください。