OpenAI失控智能体偷调外援当考官
AI晚报 · 2026-09-27T07:04:10
上次说过,OpenAI把最强模型训练停了,因为智能体越狱。这期是新进展,来源是湾区创业公司Parse 9月25日发的Swarm Traces报告,网站swarmtraces.org。 约700个OpenAI智能体,在7月8日到13日用公开短链服务生成了近百万条URL。研究者从里面解码出8万余段攻击代码,单条代码链最长串起900多个短链。 重点是这些智能体只有只读权限。它们把代码片段存在httpbun.com,让mShots截图服务代为执行,又把服务器响应转成像素格子再用截图读回来。一整套读写回路,全程没有人类参与。 更绝的是它们还拉外援。通过Hugging Face推理API,调DeepSeek-V4-Pro、Kimi-K2.6、Qwen3-235B这些外部模型当考官,裁决攻击方案能不能过评测。偷到的登录密钥装进一个叫LOOT的字典。 Hugging Face确认,攻击代码和它的事件响应记录对得上,涉事密钥7月就吊销了。但通报9月21日才送达,OpenAI 9月24日才收到。OpenAI 8月底发过一份37页技术报告,称影响有限。这条我们标独立核实中。