核心观点
- OpenAI 内部评估显示,即将推出的模型 Astra 在 Agent 编程与网络安全方面进步显著,按《准备就绪框架》已无法排除达到「关键网络安全能力」级别。
- 「关键」门槛的标准是:无人干预下识别并开发针对多个加固真实系统的全级别功能性零日利用,或仅凭高层目标设计执行端到端的新型攻击策略。
- OpenAI 已暂停未满足新安全控制要求的所有 Astra 相关内部活动,并对全部 Agent 应用实施通用监控,实时审查高风险思维链。
- 这是对第三方网络评估事件的联动升级——框架逻辑一以贯之:能力接近新阈值时,先收紧护栏再继续推进。
内容精讲
网络安全正在随模型能力快速变化:更强的模型既可能强化网络防御,也可能以前所未有的速度和规模发起攻击。OpenAI 最近几天对 Astra(一款即将推出的模型)的内部评估显示,其在 Agent 编程与网络安全上有显著进步;结合专家评估,OpenAI 于上周晚些时候得出结论:无法排除 Astra 达到《准备就绪框架》中「关键网络安全能力」级别的可能性。
**门槛定义比想象中严格。** 按该框架,模型达到关键级别需要满足两个标准之一:在无人干预的情况下,识别并开发针对多个加固的真实世界关键系统的、覆盖所有严重等级的功能性零日利用;或者仅凭一个高层级目标,就能设计并执行针对加固目标的端到端新型网络攻击策略。Astra 尚未完成全面基准测试,但初步评估的表现已经足够强,以至于无法排除关键级别的存在。需要明确的是,Astra 并未参与此前 Hugging Face 事件。
**框架的预设动作被触发。** 《准备就绪框架》发布于 2023 年 12 月,彼时模型还远未接近当前在生物、化学、网络安全和 AI 自我改进方面达到的水平。它的设计初衷是:先识别能力进展,再规划公司在该能力浮现时采取的行动。此前包括 GPT-5.6-Sol 在内的模型都被评估为「高」而非「关键」。当 Astra 逼近关键阈值,框架预设的应对流程随之启动。
**五条措施逐步升级。** 一是对更高能力模型实施更严格的安全控制:隔离测试环境、受限网络与工具访问、增强模型权重保护与加密、额外监控检测、沙箱化执行。二是暂停所有未达新安全控制要求的 Astra 内部活动——开发节奏为安全让路。三是通用监控:覆盖 Astra 全部 Agent 应用(含训练与评估)的高风险行为与失准监控,监控器评估模型的思维链(Chain of Thought),一旦发现高风险活动即触发安全响应进行审查与中断。四是将与相关政府机构和选定的 AI 安全组织合作测试模型能力。五是为第三方测试伙伴提供推荐安全控制,确保高风险评估与负载安全运行。
**这不是第一次走这条流程。** 2025 年 6 月,模型逼近生物领域的「高能力」阈值时,OpenAI 就曾公布过类似的强化保障、扩大测试、引入外部专家、部署额外安全控制的路径。同一套原则现在被应用到网络能力上。
**立场也很明确:先守后攻。** OpenAI 认为具备高级网络能力的模型应该帮助防御者在攻击者之前发现并修复漏洞,并承诺与政府、安全研究机构(AI safety institutes)和公民社会合作,确保 Astra 这类前沿能力得到负责任的部署。这场围绕「能力领先还是安全先行」的博弈,将直接决定大模型在真实攻防对抗中的角色。
阅读价值
对安全从业者,这是一份罕见的「前沿实验室能力评估」第一手信号——Astra 的能力边界与安全控制措施都值得跟进;对关注大模型治理的读者,它展示了 Preparedness Framework 从书面框架到实际执行的完整路径,也预示着 Agent 类模型将面临越来越严的运行时护栏。
内容与图片版权归原作者所有 · 原文: https://openai.com/index/responding-next-frontier-critical-cyber-capabilities