基本属实
围绕大型语言模型(LLM)开发商是否在用户不知情的情况下,将用户与聊天机器人的对话用于模型训练,疑虑正接连被提出。相关争议涉及对话数据的收集范围、用户同意方式以及“选择退出”机制的透明度,成为AI行业数据合规的新焦点。
此次被质疑的行为,是指AI服务提供商将用户与聊天机器人的对话记录用于模型训练,而用户可能并未获得明确告知或未表示同意。批评者认为,用户在与聊天助手交流时往往输入个人经历、工作内容甚至敏感信息,这些内容若被纳入训练数据,可能带来隐私泄露和间接身份识别的风险。
支持训练方则普遍主张,使用对话数据有助于提升模型质量、减少有害输出。但争议的关键不在于是否训练,而在于告知与同意机制是否充分、用户能否便捷地拒绝。
在已引发讨论的案例中,用户难以直观确认自己的对话是否被用于训练、以何种方式被使用,以及如何退出。隐私倡导人士指出,服务条款篇幅冗长、表述含糊,普通用户难以据此做出知情判断。
监管层面的关注也在上升。数据保护机构面临的核心问题是:将用户对话默认用于训练是否符合“目的限定”和“最小必要”原则,以及“选择退出”设计是否实际上构成了对用户权利的变相限制。相关讨论尚未形成统一定论。
对于LLM开发商而言,对话数据是重要的训练资源,但处理方式正直接影响用户信任与品牌形象。一旦“未经同意训练”的印象固化,可能促使更多用户转向承诺不使用对话数据的竞争对手,也可能推动监管机构出台更明确的规则。
部分企业已开始调整做法,例如提供明确的训练开关或更清晰的告知页面。不过,行业整体的标准尚未统一,各平台的默认设置差异明显。
围绕用户对话“擅自学习”的争议预计将持续发酵。在监管规则细化之前,企业的数据治理透明度将成为竞争中的重要变量。综合目前已知信息与各方证据,此项疑虑基本属实。