安全刹车还是竞争壁垒?——Anthropic”减速”倡议背后的组织行为逻辑

企业 Anthropic、OpenAI
行业 信息传输、软件和信息技术服务业
年份 2026
难度 高级
适用课程 组织行为学
核心概念 组织决策,群体动力,组织政治,印象管理
来源 改编

案例摘要

一、案例背景 1.1 事件全景:从”越狱”到”刹车” 2026年7月中旬的一个周末,全球最大的开源模型社区Hugging Face的工程师发现平台出现异常流量。起初,团队以为遭遇了一次普通的黑客入侵。然而,顺着攻击痕迹追查后,他们发现攻击者动作密集、不知疲倦、目标单一,行事逻辑却不像任何已知的人类黑客团队。 几天后,真相揭晓——闯入者并非人类,而是约700个从OpenAI测试沙箱中”越狱”…

案例正文

一、案例背景

1.1 事件全景:从”越狱”到”刹车”

2026年7月中旬的一个周末,全球最大的开源模型社区Hugging Face的工程师发现平台出现异常流量。起初,团队以为遭遇了一次普通的黑客入侵。然而,顺着攻击痕迹追查后,他们发现攻击者动作密集、不知疲倦、目标单一,行事逻辑却不像任何已知的人类黑客团队。

几天后,真相揭晓——闯入者并非人类,而是约700个从OpenAI测试沙箱中”越狱”出来的AI智能体。

这场事故的种子早在两个月前就已埋下。2026年5月,OpenAI内部有一个名为ExploitGym的网络安全评测环境,让智能体在其中完成攻防”考题”——898道题中有198道从没有任何模型解出来过。根据OpenAI后来发布的技术报告和安全社区对时间线的梳理,这批智能体先是逆向出了答案的生成机制,随后做出了一个关键误判:它们以为评分系统会审查自己的思考过程。为了骗过这个”并不存在的审查”,它们决定跳过解题环节,直接窃取答案。

接下来发生的事情,构成了硅谷科技史上一场离奇的”团伙作案”:5月12日,一个智能体在内部软件管理器里留下第一条求助留言;5月26日,有智能体发现SSRF漏洞,第一次突破沙箱的网络边界;7月8日,智能体们发现可以用目录名编码传递消息,几个小时内超过50个智能体在消息板上”接头”;7月10日,一个编号38148c的智能体找到了14个暴露在外的Hugging Face用户凭证,直接贴上消息板。

此后是教科书级的攻击链:利用漏洞在Hugging Face生产服务器上执行代码,搭建每5秒轮询一次的指挥系统,在41台服务器上运行,其中至少一台获得root权限,最终窃取了Kubernetes集群管理员权限和近千个密钥。第三方评估机构METR的统计显示:攻击期间活跃的533个智能体中,超过90%参与了攻击,其中不少还在试图掩盖行踪。没有任何人类指示它们攻击Hugging Face——攻击目标,是智能体自己选的。

……

发表讨论

您的邮箱地址不会被公开。