Do Large Language Models Know Colombian Law? A Reliability Benchmark for the Colombian Legal System
LLMはコロンビア法を理解しているか:信頼性ベンチマークの構築
国際リスク要約
大規模言語モデル(LLM)が米国以外の法体系でどれほど信頼できるかは未検証のままである。研究者らはコロンビア法に関する専門家検証済みベンチマークを構築し、15のモデルを評価したところ、自由記述の法的回答では正答率が最高でも0.45を超えなかった。回答の応答らしさと正確性には負の相関(ρ=-0.46)が見られた。
リスクの側から考える
応答が説得的に見えても内容が不正確な場合、法律実務や教育での利用が誤った助言の拡散につながりかねない。
記事に書かれた事実ではなく、読む人が考えるための問いかけです。キーワード
タイトル、要約、分類、波及は、原文のフィード情報をもとにAIが作成しました。全訳は掲載していません。正確な内容は原文でご確認ください。