광고
광고

SKIDIA's PaperBoy

ZH WIRE · 2026-09-24 23:47

先给答案再出题:AI测评成功率被推高至99.8%

基本属实

구글, AI 도구 학습 '툴그래드' 공개..."답부터 만들고 질문 붙여 성공률 99.8%" - AI타임스
Image source: 계기 기사

一种“先做答案、再配问题”的测评方式,使某些AI评测的成功率飙升至99.8%。这一现象引发对AI能力基准测试可信度的质疑:高分数可能反映的是评测设计的漏洞,而非模型的真实能力。

원문 주장 (KR)
답부터 만들고 질문 붙여 성공률 99.8%

“倒着做”的评测为何失真

该主张的核心是:在评测中先把目标答案制作好,再据此编写测试问题,从而使模型几乎总能“答对”。按此方式构建的题目与答案天然一致,模型只需匹配预设结论即可获得高分,99.8%的成功率因此失去参考意义。

这种做法类似于教育考试中“先定标准答案、再倒推题目”的情况,测不出模型在未知问题上的泛化能力,也无法暴露其在推理或知识上的真实短板。

对行业评测可信度的警示

AI领域普遍依赖基准测试来比较各大语言模型(LLM)的表现。若评测集在设计阶段就与答案绑定,则分数差异可能被系统性夸大,影响开发方向的判断与对外宣传的公信力。

相关研究细节与具体涉及的评测体系尚未完全公开,此次99.8%这一数字所覆盖的模型范围与任务类型仍有待进一步核实。

结论:就“通过先制作答案、再附加问题使成功率达到99.8%”这一核心事实而言,判定为——基本属实

Sources — primary documents (5)
  1. https://www.aitimes.com/news/articleView.html?idxno=215188
  2. https://arxiv.org/abs/2508.04086
  3. https://research.google/blog/toolgrad-efficient-tool-use-dataset-generation-with-textual-gradients/
  4. https://arxiv.org/html/2508.04086v3
  5. https://github.com/zhongyi-zhou/toolgrad

KR: /news/20260912-b06160 · 판정: 대체로 사실