中文精炼导读
核心观点
- OpenAI 依据其 Preparedness Framework(预备框架)发布透明声明:对即将推出的新模型 Astra 的最新内部评估显示,其在智能体编程与网络安全方面能力显著提升,目前"不能排除"其达到该框架定义的 Critical(关键级)网络安全能力门槛。
- 关键级网络安全门槛的定义是:无需人工干预即可发现并利用多种高防护真实关键系统中各种严重程度的零日漏洞,或仅凭一个高层级目标就能设计并端到端执行针对高防护目标的新颖网络攻击策略。
- 作为应对,OpenAI 正在把安全护栏与安全控制的鲁棒性测试升级到适配这类能力的部署级别,并暂停不满足新安全控制要求的涉及 Astra 的内部活动。
- 对 Astra 的所有智能体应用(含训练与评估)启用通用监控:监控模型思维链(Chain of Thought)中的高风险行为,触发安全响应以审查并中断高风险活动。
- 官方澄清:Astra 与此前发生的 Hugging Face 安全事件无关;OpenAI 计划与政府机构和精选 AI 安全组织合作测试该模型。
内容精讲
OpenAI 在 2023 年 12 月首次发布 Preparedness Framework,远早于模型接近生物学、化学、网络安全与 AI 自我改进能力的那一天。该框架的目的是为能力进展提供识别指南,并预先规划公司在这种能力出现时的应对步骤。此前包括 GPT-5.6-Sol 在内的模型在接受前沿网络能力评估时,都被判定为 High(高级)而非 Critical 门槛。而这次,基于过去几天对 Astra(一款即将推出的模型)的内部评估——结合专家评估——OpenAI 得出结论:无法排除 Astra 达到 Critical 级别的可能性。
文章详细定义了 Critical 网络能力的判定标准,这是理解整个事件严重性的关键。一个模型达到该门槛,意味着它能够"在无人干预的情况下,识别并开发出针对多个高防护真实世界关键系统的、覆盖所有严重等级的可用零日漏洞",或者"仅凭一个高层级目标,就能设计并端到端执行针对高防护目标的新颖网络攻击策略"。也就是说,判断依据不是模型能完成多少"常见"黑客任务,而是它能否独立发现未知漏洞、并自主完成从目标设定到攻击落地的完整链条。官方同时澄清:Astra 并未参与 Hugging Face 相关事件。
针对这一能力变化,OpenAI 正在把安全护栏与安全控制的鲁棒性测试规模扩大到"适配这类能力部署"的水平,并已采取内部措施确保模型后续开发安全有序。具体措施有五条:其一,对高能力模型及相关活动实施更严格的安全控制,包括隔离的测试环境、受限的网络与工具访问、增强的模型权重保护与加密、额外的监控与检测能力、沙箱化执行;其二,暂停尚未满足这些强化安全控制要求的涉及 Astra 的内部活动;其三,对 Astra 的所有智能体应用(涵盖训练与评估环节)实现高风险行为与错位的通用监控——监控器会评估模型的思维链,一旦发现高风险活动就触发安全响应进行审查与中断;其四,将与相关政府机构和精选 AI 安全组织合作测试该模型的能力;其五,向第三方测试合作伙伴提供推荐的安全控制方案,供其安全运行高风险评估与工作负载。
值得注意的是,OpenAI 强调这并非框架第一次指导能力过渡。2025 年 6 月,当模型在生物学维度接近高能力门槛时,公司曾公布一套类似的应对步骤:强化安全护栏、扩大测试、与外部专家合作、部署额外安全控制。这次对网络能力的应对沿用了同一原则。文章还表达了立场:先进的网络能力模型应当帮助防守方(defenders)赶在攻击者之前识别并修复漏洞——例如 OpenAI 的 Daybreak 项目——并承诺与政府、安全研究所和公民社会合作,确保 Astra 及其后继模型的这类前沿能力以负责任且广泛的方式部署。
阅读价值
适合关注 AI 安全治理、前沿模型风险评估的从业者、政策研究者与安全工程师:这篇文章是 OpenAI 首次就"模型可能接近关键级网络能力"作出的公开披露,详细说明了判定标准、应对措施与后续合作计划;对理解当前前沿实验室在能力跃迁时的风险管控流程(监控思维链、隔离测试、暂停开发、政府协作)有直接的参考价值。
本文为中文精炼导读,由 AI 基于原文整理,内容与图片版权归原作者所有。原文: https://openai.com/index/responding-next-frontier-critical-cyber-capabilities