一、案例背景
2026年8月,OpenAI宣布扩展其网络安全计划Daybreak,并推出了一款专门面向网络安全场景的模型GPT-5.6-Cyber。该模型将AI网络安全能力划分为两个方向:面向防御工作的Daybreak Blue(蓝队)和面向高级安全研究与攻击模拟的Daybreak Red(红队)。这一“红蓝攻防体系”源自传统网络安全领域的核心演练机制——红队模拟黑客视角主动寻找漏洞,蓝队则根据红方发现进行修复。
OpenAI此次发布最引人注目的地方在于:真正进行专项训练并重点公布量化评测结果的并非防御侧的蓝队模型,而是攻击侧的Daybreak Red所使用的GPT-5.6-Cyber。这一决策与公众对AI安全的主流期待形成了微妙的反差——在AI安全焦虑日益加剧的背景下,OpenAI反而优先强化了AI的“攻击力”。
从量化数据来看,GPT-5.6-Cyber的攻击模拟能力确实实现了质的飞跃。在OpenAI公布的测试中,该模型在内部零日漏洞挖掘评测中表现远超蓝队使用的GPT-5.6 Sol。在真实世界漏洞研究中,GPT-5.6-Cyber在Chrome的V8 JavaScript引擎中发现了两个此前未知的漏洞;在某流行移动操作系统中发现了至少5个漏洞,包括一条从不可信App到本地权限提升的完整漏洞链;在某流行数据库中发现3个Critical级漏洞;在某流行操作系统内核中发现超过400个可能导致权限提升的漏洞。
更值得关注的是,OpenAI主动降低了GPT-5.6-Cyber在高风险安全任务上的拒绝倾向。在涉及漏洞利用链开发、认证绕过、权限提升等任务时,GPT-5.6-Cyber的完成率达到95%,而普通GPT-5.6 Sol的完成率仅为1.5%,上一代GPT-5.5-Cyber也仅为57.3%。这种“有求必应”的能力提升,恰恰触及了平台安全治理中最敏感的神经。
然而,GPT-5.6-Cyber并非在所有安全任务上都全面超越。在“漏洞发现与报告撰写”测试中,由于生成报告更短、细节不足,其成绩反而低于GPT-5.6 Sol;在难度更高的ExploitBench中,在标准300轮限制下,GPT-5.6 Sol表现更好、Token效率更高。这意味着OpenAI并非打造了一个“全知全能的超级黑客”,而是精准强化了红队最需要的几项能力:漏洞发现、攻击路径推演,以及在高风险任务中减少拒答。
……