
【中国观察北京时间2026年05月20日讯】据《自然》杂志最新发表的研究论文显示,美国多所大学的研究团队通过同行评审的学术研究证实,中共官方媒体内容已大量渗透至全球主流人工智能聊天机器人的训练数据中。俄勒冈大学、普渡大学等机构学者发现,包括新华社、《人民日报》及'学习强国'等官方媒体内容,已明确存在于ChatGPT等AI系统的训练数据中。
研究人员分析了包含约1.89亿份中文网络文档的'CulturaX'开源资料库,该库被多个AI实验室用于模型训练。数据显示,其中1.64%的内容与中共官方媒体存在重合。但涉及习近平及中共党代会等主题时,相关比例飙升至近四分之一。更引人关注的是,测试显示相同问题用中文回答时,AI输出更倾向北京立场。
实验中9名不知情评估者参与测试,结果显示75%以上的案例中,中文回答比英文回答更'亲北京'。研究团队指出,OpenAI的GPT、Google的Gemini、Anthropic的Claude及马斯克旗下Grok等主流AI模型均存在类似现象。而中国本土AI模型DeepSeek无论中英文回答,立场均明显偏向北京。
这一过程无需中共进行秘密操作。因这些宣传内容本就以HTML页面形式公开存在于互联网,任何AI公司的网络爬虫均可轻易抓取。相较之下,许多西方独立媒体因采用付费模式,其内容在AI训练数据中的占比相对较低。