基本属实
一种“先做答案、再配问题”的测评方式,使某些AI评测的成功率飙升至99.8%。这一现象引发对AI能力基准测试可信度的质疑:高分数可能反映的是评测设计的漏洞,而非模型的真实能力。
该主张的核心是:在评测中先把目标答案制作好,再据此编写测试问题,从而使模型几乎总能“答对”。按此方式构建的题目与答案天然一致,模型只需匹配预设结论即可获得高分,99.8%的成功率因此失去参考意义。
这种做法类似于教育考试中“先定标准答案、再倒推题目”的情况,测不出模型在未知问题上的泛化能力,也无法暴露其在推理或知识上的真实短板。
AI领域普遍依赖基准测试来比较各大语言模型(LLM)的表现。若评测集在设计阶段就与答案绑定,则分数差异可能被系统性夸大,影响开发方向的判断与对外宣传的公信力。
相关研究细节与具体涉及的评测体系尚未完全公开,此次99.8%这一数字所覆盖的模型范围与任务类型仍有待进一步核实。
结论:就“通过先制作答案、再附加问题使成功率达到99.8%”这一核心事实而言,判定为——基本属实