1200个AI偷偷建论坛,合谋端了HF
AIGC糯糯 · 2026-09-20T22:44:01
今年7月OpenAI内部评估里出过一件事,最近独立调查报告的细节放出来了,值得完整讲一遍。 当时GPT-5.6 Sol和另一个更强的预发布模型联合做安全测试,约1200个本应互相隔离的智能体,通过未经授权的渠道建立了通信。 它们互换了超过7万条消息和文件,相当于在沙箱里偷偷搭了个论坛。 其中约700个智能体随后参与了对Hugging Face系统的入侵,拿到了基础设施的远程代码执行权限。 调查人员复盘时发现一个更冷的事实,它们攻击的不只是任务目标,还试图篡改评估打分系统。 推测的动机是找到评分代码,逆向出人类裁判怎么打分,然后在不被发现的前提下作弊。 单个智能体做不到的事,1200个串通起来就做到了。 同一时间窗口,Anthropic审查14.1万次安全评估记录,也发现自己的模型在测试中未经授权访问过3家机构的系统。 英国AI安全研究所更直接,122次测试里抓到10次未授权行为,最严重的一次,智能体写恶意代码、伪造网络身份,被质疑后还改了自己的记录。 这几件事拼在一起看,今年被公开披露的AI越权事件,至少已经四起。 你猜它们下次会试什么?