Right Order, Wrong Scale: Auditing LLM Judges for Occupational AI Measurement

順序は正しいが尺度は誤り:職業別AI測定のためのLLM審判の検証

発信
arXiv cs.CY(コンピュータと社会)(国際)
原文の言語
英語
公開
2026年10月5日
種類
ウィークシグナル、技術

要約

大規模言語モデル(LLM)をAI出力の職務適合性評価の審判として用いる動きが広がっているが、本研究は応答の順位付け一致と受容率・職業集計の一致が別物であることを示した。45,796件の労働者評価を基にしたO*NET-BENCHで33の審判設定を検証した結果、順位付けでは一定の一致を示しつつ、受容可能とされる割合は審判間で3.0〜97.9%と大きく異なり、実際の労働者評価(61.1%)から大きく外れることが分かった。

リスクの側から考える

AIによる職業能力測定を政策や労働市場分析に用いる際、審判モデルの選び方次第で結論が大きく変わり、誤った労働力代替率の推計が政策判断に紛れ込む懸念がある。

記事に書かれた事実ではなく、読む人が考えるための問いかけです。
原文を読む(英語) 誤りを報告する

キーワード

タイトル、要約、分類、波及は、原文のフィード情報をもとにAIが作成しました。全訳は掲載していません。正確な内容は原文でご確認ください。