部分属实
关于OpenAI为开发ChatGPT抓取约1000万篇媒体报道文章的说法近日在韩国舆论场流传。经核实,该说法被判定为部分属实:相关数据使用行为确有依据,但“偷取”(窃取)的表述与实际事实存在出入。
该说法源自围绕OpenAI训练数据来源的争议。OpenAI利用大规模网络文本数据训练其大型语言模型(LLM),其中包括媒体报道文章,这一点有据可查。然而,"1000万篇"这一具体数字的确切来源与统计口径并未得到完全确认,相关细节仍存在不确定性。
使用“偷取”(韩语原词"훔쳤다",意为窃取)一词带有明显的法律与道德定性。事实上,OpenAI的数据抓取行为是否构成侵权,目前仍在多国面临诉讼与监管审查,尚无定论。换言之,数据被用于训练是事实,但将其直接定性为“窃取”则超出了已确认的范围。
综合各方信息,OpenAI确曾大规模使用媒体报道文章训练ChatGPT,但“1000万篇”的数字细节及“窃取”的定性均未被完全证实。因此,本说法判定为——Verdict: 部分属实