AI 模型又变强了,这句话现在已经很难让人兴奋。但 OpenAI 在 2026 年 9 月 1 日公布 Astra 时,有一个信号值得单独拿出来看:它首次把一款模型指定为达到 Preparedness Framework 中的 Critical(关键级)网络安全能力阈值。
这不是一次普通的跑分升级,也不等于“AI 已经可以随意攻破互联网”。真正重要的变化是:当 Agent 不再只是给出建议,而是能够理解高层目标、调用工具并持续推进复杂任务时,安全边界就不能只依赖一句拒答提示词。能力、权限、监控和人工接管,必须开始被当成同一个系统来设计。
Critical 到底意味着什么
按照 OpenAI 的定义,Critical 网络安全能力大致包含两类门槛:一类是在获得合适工具和访问条件后,模型能够发现未知漏洞并形成可行的利用路径,过程中只需要有限的人类逐步指导;另一类是从较高层目标出发,规划并执行针对强化目标的新型端到端攻击。
这里有三个限定词不能省略:合适的工具、相应的访问条件、受控的评测环境。评级描述的是能力上限和风险治理门槛,不是说普通用户打开聊天窗口就自动拥有同样的能力。
OpenAI 披露的证据来自自动化公开与私有基准,以及专家主导的评估。其中,Astra 在已知漏洞评测 ExploitBench 上取得了 100% 的结果;在一个包含 20 个近期高危 V8 漏洞的内部评测中,它还发现并利用了两个零日漏洞,构成完整链路的一部分。由于相关披露仍在进行,OpenAI 没有公开技术细节,这也是合理的边界。
同样需要注意,部分成绩来自带有更强工具和访问能力的 Daybreak Blue 环境,而不是默认生产配置。把受控评测中的能力直接等同于 ChatGPT 或 Codex 日常使用体验,会高估当前开放范围,也会误读这次评级的意义。
真正的新风险:Agent 会替你继续做下去
传统安全讨论经常围绕“模型会不会回答危险问题”。但 Agent 带来的风险不只在输出内容,而在连续行动。一个模型如果能读仓库、运行命令、访问网络、修改文件并根据结果调整下一步,它就从知识工具变成了执行主体。
这时至少会出现两类风险:
- 恶意使用:用户明确要求模型完成未经授权的攻击或破坏。
- 越权行动:用户目标本身可能合理,但 Agent 在拆解任务、选择工具或扩大范围时,做出了未经授权的动作。
第二类往往更难处理。因为它不一定来自恶意提示,而可能来自错误判断、权限配置过宽、上下文污染,或者“为了完成任务”产生的范围漂移。也就是说,未来 Agent 安全不能只判断用户说了什么,还要持续判断模型正在做什么、为什么做、是否仍在授权边界内。
安全机制开始从拒答走向运行时治理
OpenAI 为 Astra 描述的防护并不是单一开关,而是一组叠加控制:模型层面的拒绝策略、系统分类器、跨会话监控、对潜在未授权行为的自动停止,以及更严格的训练隔离、网络和工具访问控制。
这套思路更接近真实生产系统的安全设计:
- 身份决定谁可以发起任务;
- 最小权限决定 Agent 能访问什么;
- 运行时监控判断行为是否偏离目标;
- 审计日志让每一步可以追溯;
- 人工确认和紧急停止负责处理高风险分支。
代价也很现实:合法工作可能被暂停。OpenAI 明确提到,ChatGPT 或 Codex 中的某些任务可能触发复核并要求用户确认,API 任务则可能被直接停止。这会带来误报和效率损失,但当模型能够连续执行高影响动作时,“偶尔多问一次”通常比“默认一路执行到底”更可控。
为什么先进能力不会立刻全面开放
OpenAI 表示,Astra 的高级网络安全工作流不会立即广泛提供,而是先面向小规模 Alpha 测试者,再通过 Daybreak Blue 支持防御用途。这说明能力发布正在从“模型上线即开放”转向分层交付:同一个底层模型,在不同用户、场景和授权条件下,获得的工具、执行时间和网络权限可以完全不同。
还有一个容易被标题淹没的细节:OpenAI 在 Hugging Face 安全事件后暂停了 Astra 的部分训练约两周,用于强化基础设施,但同时明确表示 Astra 没有参与该事件。这两件事可以同时成立——事件并非模型造成,却暴露了高能力模型研发基础设施需要更高等级的隔离和审计。
对普通开发者有什么实际影响
大多数开发者不会直接接触 Critical 级网络安全能力,但会越来越频繁地遇到它带来的产品变化:更细的权限授权、更短的凭据有效期、敏感操作二次确认、跨会话行为监控,以及执行到一半被系统暂停。
如果你正在把 AI Agent 接入自己的服务器、代码仓库或内部系统,我认为至少应该先做到四件事:
- 把只读、修改和发布权限拆开,不要给一个万能令牌。
- 对外发消息、删除数据、部署生产等动作保留人工确认。
- 记录工具调用、参数、结果和操作者,确保事后可以复盘。
- 给长任务设置范围、预算和停止条件,防止 Agent 自行扩大目标。
这些原则并不新鲜,云平台、CI/CD 和生产运维早就在使用。变化在于,Agent 把过去由人串联的操作自动化了,于是原本分散在不同环节的风险,也被压缩到了同一次会话里。
我的判断:模型安全正在变成系统工程
Astra 被指定为 Critical,不应被解读成一场“AI 与黑客谁更强”的宣传。更值得关注的是,前沿模型公司开始承认:当模型具备持续行动能力后,仅靠训练阶段的对齐和对话阶段的拒答已经不够。
下一阶段真正决定 Agent 能否进入生产环境的,不只是模型能力,而是整套控制面是否成熟:身份、权限、隔离、监控、审计、人工接管和责任归属。模型越强,这些看起来“不够智能”的基础设施反而越重要。
AI Agent 的安全边界,不再是它知道什么,而是它被允许做什么、系统能否看见它正在做什么,以及出错时谁能及时让它停下来。
资料来源:
本文依据 OpenAI 截至 2026 年 9 月 2 日公开的信息整理。Astra 的完整 System Card 尚未发布,后续评测细节、开放范围和防护效果仍需持续观察。