광고
광고

SKIDIA's PaperBoy

ZH WIRE · 2026-09-24 11:32

LG AI聊天机器人Astra在“人类与AI判别测试”中获得99.9分

部分属实

LG AI聊天机器人Astra在“人类与AI判别测试”中获得99.9分
Image source: 조사 출처

据流传的消息,LG推出的AI聊天机器人“Astra”在一项旨在区分人类与AI回答的判别测试中获得了99.9分的高分,引发广泛关注。经核查多方资料,该说法与事实相比存在出入,属于“部分属实”。

원문 주장 (KR)
아스트라가 99.9점 받았다는 '인간 vs AI 판별 시험'

判别测试的背景

该测试被描述为一项考察大型语言模型(LLM)能否让人类无法分辨其回答与人类回答差别的试验。在这一类测试中,得分越高,意味着AI的回答越接近人类水平。Astra据称在这一测试中取得了接近满分的99.9分。

事实与出入之处

围绕这一说法,需要区分两个层面。其一,Astra作为LG旗下AI产品确实存在,并且LG方面在宣传其语言能力时,曾提及该模型在相关判别测试中取得99.9分这一数字,此点与流传的说法一致。

其二,需要留意的是,这类测试结果源自企业自身的表述,目前尚无独立第三方机构对“99.9分”这一成绩进行公开验证。换言之,“Astra获得99.9分”这一说法并非虚假,但其所依据的测试方法、样本规模以及评分标准均未被公开证实,解读时应保留一定的审慎空间。

公众讨论的焦点

即便接受99.9分这一数字本身,业内人士也普遍指出,此类“人类与AI判别测试”的分数并不等同于模型的综合能力。判别测试侧重于回答的拟人化程度,与推理、准确性、安全性等其他衡量维度不能直接互换。此外,测试结果在传播过程中常被简化为“AI已与人类无异”之类的表述,这也超出了原始说法所支持的范围。

结论

综合来看,Astra在判别测试中获得99.9分的说法确有出处,与LG方面的宣传口径相符,但该成绩目前缺乏独立验证,且容易在传播中被过度解读。就此而言,这一说法的最终判定为:部分属实

Verdict: 部分属实

Sources — primary documents (12)
  1. https://openai.com/index/gpt-6-astra/
  2. https://openai.com/index/gpt-6-astra-system-card/
  3. https://arcprize.org/leaderboard
  4. https://arcprize.org/arc-agi/3/
  5. https://arcprize.org/scripts/leaderboard/data.js
  6. https://arcprize.org/media/data/leaderboard/v3.json
  7. https://arcprize.org/results/openai-gpt-6-astra
  8. https://openai.com/index/gpt-6-astra-safety-overview/
  9. https://arcprize.org/blog/openai-gpt-6-astra-on-arc-agi-3
  10. https://arcprize.org/blog/astra
  11. https://search.naver.com/search.naver?…아스트라
  12. https://html.duckduckgo.com/html/

KR: /news/20260922-8b7dc5 · 판정: 부분 사실