本报中专栏近日对“AI安全性受提问语言的影响大于地缘政治语境,且以韩语提问时有害性表现偏低”这一说法进行了核查,共审阅9份一手来源。核查显示,提问所用语言本身对大型语言模型(LLM)安全表现的影响,超过了提问者所处的地缘政治背景;以韩语发出提问时,有害性表现偏低。核查过程中还确认,所涉Hugging Face数据集的说明卡与元数据处于公开可查状态,而数据集文件本身则需有条件同意使用条款并登录后方可查阅。
本次核查结论的核心在于:判断一款模型的安全表现,不能仅凭其开发方所在国家或目标市场等“地缘政治标签”来推断,模型在各语言上的安全对齐程度并不一致。以韩语提问时有害性偏低,一方面说明韩语侧的安全护栏相对更牢固,另一方面也提示,同一模型在不同语言上的安全水平可能存在落差,跨语言评估因此成为安全测试中容易被忽视的盲区。
在9份一手来源中,相关Hugging Face数据集的说明卡与元数据可供公众在线查验,构成核查得以推进的基础;数据集文件本体则设置了访问门槛,需先有条件地同意使用条款并登录账号。这种“元数据公开、文件受控”的组合,在数据合规与第三方可验证性之间维持了基本平衡。
对韩国本土开发者与安全评估团队而言,这一结果具有直接参考价值:安全对齐需按语言分别验证,不宜以单一语言的评测结果代表整体。韩语提问有害性偏低固然是积极信号,但若评估体系只覆盖韩语,便可能低估模型在其他语言环境下的风险;面向多语言市场的厂商应将多语言安全测试纳入发布前的标准流程。综合9份一手来源的交叉核验,本报认定上述说法基本属实。