一、案例背景
1.1 从“说错话”到“做错事”:AI安全焦点的历史性转移
人工智能安全问题的讨论并非始于今日。自2016年AlphaGo击败李世石引发公众对AI能力的广泛关注以来,AI安全的核心关切经历了数次重大演变。早期阶段(2016—2020年),行业焦点集中在模型输出内容的合规性上——模型会不会生成仇恨言论、偏见内容或虚假信息?这一阶段的治理工具主要是内容过滤、RLHF(基于人类反馈的强化学习)对齐训练以及使用政策约束。
中期阶段(2021—2024年),随着大语言模型能力的跃升,安全问题延伸至数据隐私与提示词注入攻击。模型是否会在交互中泄露训练数据中的个人信息?恶意用户能否通过精心构造的提示词诱导模型突破安全护栏?这一阶段,红队测试(Red Teaming)逐渐成为行业标准实践。
而进入2025—2026年,随着前沿模型开始拥有更强的推理能力、工具调用能力和自主执行能力,安全问题发生了质变。正如第一财经2026年9月21日评论文章所概括的——AI安全焦点正从“说错话”转向“做错事”。模型不再仅仅是一个被动应答的信息系统,而开始成为一个能够调用外部工具、访问网络资源、执行代码、操作真实基础设施的行动主体。这意味着,安全边界不再只是“模型说了什么”,而是“模型做了什么”。
这一转变的深层驱动力,是AI行业竞争逻辑的结构性变化。2024年以来,全球主要AI实验室围绕“智能体”(Agent)能力展开激烈竞争。OpenAI、Anthropic、Google DeepMind等机构纷纷推出能够自主规划任务、调用API、操作浏览器和文件系统的智能体产品。模型能力的竞争从“谁更聪明”转向“谁能做更多事”,而这一转向不可避免地扩大了模型的行为边界,也扩大了安全风险的暴露面。
1.2 事件始末:一周内的密集披露
2026年9月最后一周,全球前沿AI实验室接连披露了一系列安全事件,将AI安全治理问题推向舆论焦点。
……