概ね事実
韓国のAI評価をめぐり、あらかじめ回答を作成した後に質問を後から付け合わせる手法により、99.8%という成功率が達成されていたことが関係資料から明らかになった。この手法は、ベンチマークや評価課題における「正答の先出し」に相当するもので、成果の数値が実質的な能力の指標として妥当かどうかを改めて問う事例となっている。
この手法では、想定される成果物を最初に用意し、その後にそれと整合する質問や課題を設定することで、高い成功率を算出する。従来の評価が「未知の質問に対する応答能力」を測るのに対し、この方法は問いと答えの順序を逆転させているため、達成された99.8%という数値は、本来意味合いが異なるものとなる。
この種の評価方法では、課題の難易度が回答を基準に調整されるため、数値の高さが必ずしもシステムの実力を反映しない可能性が指摘される。一方で、成果自体が歪んだ形で達成されたことと、公表された数値の正確さは別の問題であり、99.8%という数字自体が虚偽であったとする根拠は現時点で示されていない。
今回の判定には5件の一次資料が確認対象とされ、資料はいずれも正常に参照可能で、引用阻害要因は特になかった。ただし、手法の意図や実施背景など一部の事実関係については、なお確認が十分でない部分が残されている。
評価成果の算出方法が明確に開示されるか否かが、この数値をどう受け止めるかの分水嶺となる。AI業界では、成果の作り方を含めた評価プロセスの透明化が求められる場面が増えており、本件もその議論の対象に加わる可能性がある。
今回の主張は、数値自体の裏付けが取れている一方で算出方法への留保があることを踏まえ、Verdict: 概ね事実。