Right Order, Wrong Scale: Auditing LLM Judges for Occupational AI Measurement
順序は正しいが尺度は誤り:職業別AI測定のためのLLM審判の検証
国際リスク要約
大規模言語モデル(LLM)をAI出力の職務適合性評価の審判として用いる動きが広がっているが、本研究は応答の順位付け一致と受容率・職業集計の一致が別物であることを示した。45,796件の労働者評価を基にしたO*NET-BENCHで33の審判設定を検証した結果、順位付けでは一定の一致を示しつつ、受容可能とされる割合は審判間で3.0〜97.9%と大きく異なり、実際の労働者評価(61.1%)から大きく外れることが分かった。
リスクの側から考える
AIによる職業能力測定を政策や労働市場分析に用いる際、審判モデルの選び方次第で結論が大きく変わり、誤った労働力代替率の推計が政策判断に紛れ込む懸念がある。
記事に書かれた事実ではなく、読む人が考えるための問いかけです。キーワード
タイトル、要約、分類、波及は、原文のフィード情報をもとにAIが作成しました。全訳は掲載していません。正確な内容は原文でご確認ください。