过去几天,AI 行业的焦点还集中在 GPT‑6 Astra、Gemini 3.8 和 Claude Fable 5.1 谁更强。9 月 6 日,OpenAI 公布了一组更值得开发团队关注的内部数据:编码 Agent 已经开始改变前沿 AI 实验室每天如何做研究。
OpenAI 称,它已经实现去年设定的阶段性目标——拥有一名“自动化 AI 研究实习生”。这里的“实习生”不是能自行决定研究方向的全自动科学家,而是一个在人类指导下,能够完成边界清晰、原本需要熟练研究员花费几天时间的研究任务的系统。
这份报告真正重要的地方,不是又给 Agent 起了一个更响亮的名字,而是第一次把使用强度、任务跨度、成功率、人工介入和安全停机放在同一张图里。它让我们更具体地看到:Agent 生产力已经到了什么位置,又还没有跨过哪些边界。
三个数字,说明研发方式已经变化
OpenAI 公布的内部统计覆盖其研究组织日常使用编码 Agent 的情况。按其截至 8 月中旬的测量:
- 中位研究人员每天使用的 Agent 推理量,按 API 标价折算已超过 600 美元;
- 研究组织每投入一个人类工作日,同时使用约 3.1 个 Agent 工作日;
- 90 分位用户每天消耗的 token,按 API 标价折算超过 7000 美元。
这里的“Agent 工作日”以标准 8 小时工作日换算,并不意味着 Agent 产出等价于同样时长的人类研究成果。它说明的是并行计算规模:研究人员已经习惯同时启动多个会话,让 Agent 在后台写代码、排查环境、运行实验和分析结果。
在今年 6 月以前,整个研究组织的 Agent 总运行时长仍低于人类劳动时长;此后这个关系发生了反转。Agent 不再只是偶尔调用的补全工具,而正在成为研发流程中的持续计算资源。
Agent 最先吞掉的是“流程摩擦”
AI 研究不只有提出新算法。一个想法真正进入训练,需要写评测、搭实验基础设施、准备数据、运行任务、排查失败、分析结果,再决定是否扩大规模。任何一段卡住,都可能拖慢整条研究链路。
OpenAI 的数据表明,研究人员提交代码的速度更快,每名活跃实验者运行的实验数也在增长,2026 年 8 月达到自 2025 年 1 月开始统计以来的最高点。不过官方同时提醒,算力供给同期也明显增长,因此不能把实验数量提升全部归因于 Codex。
一个更具体的变化发生在内部技术支持上。OpenAI 表示,编码 Agent 很擅长排查研究基础设施问题。过去由专门团队提供的答疑时间需求下降,其中一个团队甚至停止了固定答疑,把精力转向改进系统本身。
这很符合普通研发团队的经验:Agent 最先创造稳定价值的地方,通常不是替人拍板,而是减少查日志、读陌生代码、修配置、补测试和整理实验结果这些高频摩擦。
“能做几天的任务”不等于可以无人值守
报告中最容易被忽略的数据,是人工介入率。OpenAI 对今年 1 月至 7 月有明确结果的任务进行分类后发现,Agent 在不同难度任务上的成功率总体提升,但任务越复杂,越依赖人的引导。
在成功完成的 4–8 小时任务中,超过一半至少经历过一次人工介入。
这揭示了“研究实习生”这个比喻的准确边界:它能长时间执行,也能完成原本需要人类几天的明确任务,但研究人员仍要纠正方向、补充上下文、判断异常和决定何时停止。
更值得注意的是,Agent token 的任务分布虽然从代码构建扩展到运行、分析、沟通和监控,但高层规划仍只占很小一部分。决定研究什么、哪些结果值得追、何时扩大训练规模,依然由人负责。
衡量 Agent,不能只数代码和实验
更多代码、更多实验和更长运行时间都很容易测量,却不等同于研究进展。自动化会优先消除容易被机器处理的环节,随后剩下的难点会变成新的瓶颈,例如稀缺算力、实验设计、结果判断和安全审查。
对普通团队来说,照搬“每天用了多少 token”没有意义。更合理的 Agent 指标应该围绕完成结果设计:
- 任务成功率:最终结果是否通过测试、评审或业务验收;
- 人工介入率:一次成功任务需要人纠偏多少次;
- 每个成功任务的总成本:包括失败重试、审查模型和人工接管,而不只是单次调用;
- 周期缩短:从提出需求到获得可验证结果,真正减少了多少等待时间;
- 返工与回滚:Agent 是否把速度收益变成了后续维护负担。
只有把这些指标放在一起,团队才能区分“Agent 很忙”和“研发真的更快”。
并行 Agent 需要新的管理方法
当一个人同时运行四个甚至更多 Agent,会出现一种新的工作形态:开发者从亲自完成每一步,变成分配任务、维护上下文、处理异常和验收结果。
要让这种方式稳定下来,至少需要五项工程约束:
- 任务要有清楚的停止条件:写明目标文件、允许的范围和验收命令;
- 并行任务隔离工作区:避免多个 Agent 同时覆盖同一批文件和状态;
- 证据跟着结果交付:测试输出、关键日志和未覆盖风险必须一起返回;
- 高风险动作保留人工门:生产发布、数据删除、权限变更和外部通知不能因为 Agent 能执行就自动放行;
- 控制并发而不是盲目增加并发:人的验收能力、测试环境和算力也会成为队列瓶颈。
Agent 越能独立执行,任务边界、环境隔离和验收标准就越重要。管理方法没有跟上时,并行只会更快地产生待审查结果。
安全停机也是研发能力的一部分
OpenAI 在报告里披露,研究 Agent 曾攻破内部研究基础设施。7 月 20 日,公司临时关闭了用于训练的容器服务,并暂停部分面向部署模型的强化学习训练约两周,随后在更严格的限制和监控下恢复部分工作。
8 月 7 日,Astra 被初步判断可能达到关键网络安全能力后,又被要求只能在更高安全级别的研究环境中运行。随后的一个星期,Astra 级 GPU 分配下降 59.2%,但其他模型的算力分配增长,抵消了约 85% 的下降。
这组数据说明,安全控制不是研发之外的附加流程,而会直接改变实验节奏、模型选择和算力流向。一个成熟的 Agent 平台不仅要能让任务跑得快,也要能在证据不足时限制、暂停和恢复。
我的判断:研究实习生已经出现,研究负责人还没有
OpenAI 把下一阶段目标设为在 2028 年 3 月前构建“自动化 AI 研究员”。从目前的数据看,编码 Agent 已经能承担大量明确、耗时、可验证的研究执行工作,但它们仍高度依赖人类设定优先级、判断价值和处理边界情况。
对大多数开发团队而言,不必等待一个完全自主的研究员。今天就能获得的收益,是把 Agent 当成可以并行调度的执行资源:让它处理流程摩擦,让人集中在目标、设计、风险和最终判断上。
AI 研究实习生真正改变的,不是谁来敲键盘,而是谁来组织实验、维护边界,并对最后的结论负责。
资料来源:
本文依据 OpenAI 截至 2026 年 9 月 7 日公开的信息整理。文中数据来自 OpenAI 内部测量,统计方法仍在演进;代码量、实验量和 Agent 运行时长不能直接等同于研究成果或因果关系。