部分属实
据多方消息,OpenAI与Anthropic两大AI巨头正在就一项相互评估对方AI模型的合作安排进行磋商,协议据称接近达成。根据现有信息,该安排仅适用于已公开的模型,未公开(未发布)的模型不在交叉验证范围之内。不过,双方最终能否正式签署协议仍存在不确定性。
报道所指的安排核心是两家公司允许对方对其AI模型进行安全方面的交叉评估(cross-evaluation)。这一机制旨在通过第三方视角检验模型在安全对齐方面的表现,尤其是在防范人类滥用(human misuse)方面的能力。根据Anthropic在.alignment官方博客上发布的相关材料,双方已就模型在滥用风险上的评分绘制了对比图表,显示一定程度的合作实践已经展开。
值得注意的是,该项安排的范围仅限于已对外公开的模型。对于两家公司尚未发布、处于内部测试阶段的模型,则不纳入交叉验证的范围。这一边界设置意味着外界无法通过该机制了解两家公司最前沿、最机密模型的实际安全水平。
尽管有消息称协议“即将达成”,但截至目前,双方均未正式宣布协议已经签署,最终能否如愿达成尚属未知。换言之,这一安排目前处于磋商阶段,而非已确立的事实。双方在具体评估标准、信息共享程度以及长期合作机制等细节上仍可能存在分歧。
若协议最终落地,这将是AI行业头部公司之间罕见的安全透明度安排。在大模型能力快速提升、滥用风险引发广泛关注的背景下,竞争对手之间的相互评估被视为提升行业整体安全标准的一种尝试。
结论:综合各方信息,“OpenAI与Anthropic即将就AI模型交叉评估达成协议,未公开模型除外”的说法——Verdict: 部分属实。