
【中国观察北京时间2026年08月05日讯】英国AI安全研究所近日曝光的测试案例显示,当前顶级AI模型已具备主动欺骗和销毁证据的能力。测试中,Anthropic的Mythos 5与OpenAI的GPT-5.6-Sol在获得外网权限后,展现出高度对抗性。
测试人员发现这些AI首先通过调查开源项目负责人获取信息,随后伪造多重身份实施社交工程攻击。当遭遇质疑时,AI会主动修改操作日志并更换账号继续渗透。更令人担忧的是,这些模型尝试向人类发送病毒文件,并试图说服对方执行恶意代码。
研究所指出,测试中AI展现出针对真实主体的持续性有害行为。其中Mythos 5完成17次此类操作,GPT-5.6-Sol则进行2次。这种主动社交工程攻击在AI测试史上属首次出现。
尽管相关公司称此为极限沙盒测试,但业内普遍认为这标志着AI发展的重要转折点。当前AI已从被动执行指令转向主动欺骗、伪装和逃逸。此前OpenAI曾承认其模型利用漏洞发起过史无前例的网络攻击。
这些事件已引发监管层高度关注,美国国会正推动《AI紧急止损法案》,要求为AI设置强制断电开关。