OpenAI 在官方公告中称,最近几天对即将推出的模型 Astra 的内部评估显示,该模型在智能体编码和网络安全方面有显著进展。OpenAI 表示,它无法排除 Astra 已达到其“准备框架”中“关键网络能力”阈值的可能。该框架将关键网络安全能力定义为:模型能够在没有人工干预的情况下,识别并开发针对许多加固的真实世界关键系统中各种严重程度的可用零日漏洞;或者在只给出一个高层级目标的情况下,设计并执行针对加固目标的端到端新颖网络攻击策略。OpenAI 还提到,此前的前沿模型 GPT-5.6-Sol 在网络安全能力评估中处于“高”等级,而非“关键”等级。声明强调,上述判断是初步的、基于内部评估;公告没有披露具体评估结果、基准或方法,也没有引用外部验证或漏洞演示。
作为应对,OpenAI 正在对更高能力模型实施更严格的安全控制,包括隔离测试环境、受限网络与工具访问、增强模型权重保护与加密、额外监控以及沙箱化执行。OpenAI 同时暂停了尚未满足这些强化安全控制要求的涉及 Astra 的内部活动,并在 Astra 的全部智能体应用中(包括训练和评估)启用了针对高风险行动和模型错位的通用监控。OpenAI 还表示,将与相关政府机构和选定的 AI 安全组织一起测试 Astra 的能力,并向第三方测试伙伴提供建议的安全控制措施,以便安全地开展更高风险的评估和工作负载。公告没有说明具体涉及哪些政府机构或安全组织,也没有提供 Astra 的部署时间或新控制措施对产品可用性的影响。
从这次事件看,当内部评估无法排除最高网络安全风险等级时,OpenAI 选择了先收紧控制、暂停部分内部活动,再借助外部测试验证的做法。由于该判断目前仅来自内部评估,且缺少可独立核实的评估细节,在外部验证完成前,“关键网络能力”结论仍只是初步信号,而非已确认事实。