属实
本报中文部核查确认,OpenAI方面近日表态称,现阶段尚无法对AI(人工智能)安全性作出充分保证,并宣布今后将随时公开AI系统“对齐失败”(alignment failure)的相关案例。这一表态被视作头部AI开发商罕见地直面自身技术局限,相关内容已在OpenAI旗下的对齐研究专题站点上以报告图表形式公开。
根据本报核实的核心信息,OpenAI明确表示“无法确信AI安全”,即现阶段不能对AI系统的安全性作出百分之百的承诺。与此同时,该公司承诺将把“对齐失败”案例——即AI系统行为偏离人类意图与设计目标的情形——以随时公开的方式对外披露。这一“坦承局限+常态披露”的组合,在行业头部厂商中并不多见。
在本次核查中,本报中文部共审阅了9个一手来源。作为佐证材料之一,OpenAI对齐研究专题站点(alignment.openai.com)发布的报告图表(source-chart.png)为上述表态提供了直接依据。核查过程中虽因浏览器抓取工具一度不可用而影响部分在线截图取证,但综合各项一手信息,核查小组最终作出了事实认定。
“对齐”是大型语言模型(LLM)研发中的核心课题,指让AI系统的输出与人类价值观和设计意图保持一致。业内普遍认为,主动公开对齐失败案例有助于外部研究者与公众了解AI系统的真实风险边界。OpenAI此番承诺随时公开此类案例,若能持续落实,将为AI安全研究提供难得的公开样本,也为监管讨论提供参考素材。
本报经交叉核验多个一手信源后认定:OpenAI“无法确信AI安全、将随时公开对齐失败案例”的相关说法属实。