wangjx
发布于 2026-09-04 / 12 阅读
0
0

GPT‑6 Astra 发布:三大模型竞赛进入“长程 Agent”阶段

过去四天,三家前沿模型公司几乎把同一个答案摆到了桌面上:Anthropic 在 9 月 1 日发布 Claude Fable 5.1,Google 在 9 月 2 日发布 Gemini 3.8 Flash,OpenAI 又在 9 月 3 日推出 GPT‑6 Astra。

表面上看,这是新一轮模型参数和基准榜单竞争;把三份官方发布说明放在一起,真正发生的变化却更清楚:模型不再只争夺“回答一次问题”的最高分,而是在争夺复杂任务的完整执行权。

浏览网页、操作软件、理解代码库、修改文件、运行测试、恢复失败、生成文档并持续工作数小时,正在成为这一代旗舰模型的共同主战场。GPT‑6 Astra 是今天最值得关注的主角,但 Gemini 3.8 和 Claude Fable 5.1 让我们更容易看清这场竞争的全貌。

GPT‑6 Astra 发布了什么

OpenAI 将 GPT‑6 Astra 定位为面向“最困难端到端工作”的旗舰模型,覆盖复杂推理、编程、计算机操作、研究和文档生成。它提供 105 万 token 上下文、最多 12.8 万 token 输出,API 标准价格为每百万输入 token 10 美元、输出 token 50 美元。

Astra 当前先向 Trusted Access Program 中的企业开放,ChatGPT Plus、Pro、Business、Enterprise 和 API 用户将在随后几天逐步获得访问。换句话说,“已经发布”不等于所有账号今天都能立即选择。

这次升级最有意思的地方,不只是更长上下文或更高分数,而是 OpenAI 把模型的工作方式描述得更像一名能够持续推进项目的执行者:

  • 可以在浏览器和桌面软件中完成表单、研究、数据整理和质量检查;
  • 能够产出遵循既有模板的文档、表格和演示文稿;
  • 遇到普通缺口时自行采用合理假设,遇到关键决策时再请求用户确认;
  • 任务方向发生变化时,继续保留原始目标和之前的约束;
  • 在 Codex 中通过笔记和历史检索跨越上下文窗口,减少长任务压缩后的信息丢失。

模型能力开始围绕“完成一段工作”组织,而不是围绕“生成一段文本”组织。这是 GPT‑6 比版本号更重要的信号。

三款模型其实在争夺不同位置

如果只看厂商发布页,很容易得出“每一家都是最强”的结论。更实用的方式,是看三家公司分别把产品优势押在哪个位置。

GPT‑6 Astra:把复杂工作从头做到尾

OpenAI 强调计算机操作、浏览、专业工作、软件工程和可交付成果之间的连接。其官方评测中,Astra 在 AutomationBench 得到 41.4%,在 Terminal-Bench 4.0 得到 57.9%,DeepSWE v1.1 为 74.1%。这些数据来自 OpenAI 自己的发布评测,适合观察产品方向,不应直接等同于所有真实项目中的胜率。

Astra 的产品逻辑很明确:模型不仅要想出答案,还要操作工具、跟踪状态、处理变化,最终把工作交付出来。

Gemini 3.8 Flash:用更低成本扩大 Agent 规模

Google 对 Gemini 3.8 Flash 的定位,是在 Flash 级速度和价格下提供长程编程与自主 Agent 能力。它的 API 初始价格是每百万输入 token 0.75 美元、输出 token 3.75 美元,远低于另外两款旗舰模型。

Google 明确提到,3.8 Flash 在复杂任务上会执行更多推理步骤并反复调用工具;如果更关心计算效率,可以降低 effort,或者继续选择 3.7 Flash。它争夺的是高频、大规模 Agent 工作负载,而不只是单次最难任务。

Claude Fable 5.1:长时间运行仍然可读、可控

Anthropic 把 Claude Fable 5.1 描述为面向数小时、跨多个应用、长期异步运行的模型。它强调规划、工具使用、失败恢复、过程更新,以及在大型代码库中自行编写测试和用视觉能力核对结果。

Fable 5.1 的 API 价格同样为每百万输入 token 10 美元、输出 token 50 美元;缓存读取降到 0.25 美元。Anthropic 同时明确,默认需要保留 30 天数据用于安全监控,符合条件的企业客户可以通过专门方案获得更严格的数据控制。这是选型时不能被基准分数掩盖的部署条件。

没有一张榜单能给出唯一赢家

OpenAI 在同一份发布材料里列出的交叉结果,本身就说明“最强模型”取决于任务:GPT‑6 Astra 在 AutomationBench 和 Terminal-Bench 4.0 中领先;Gemini 3.8 Flash 在 DeepSWE v1.1 上与 Astra 非常接近;Claude Fable 5.1 在 Artificial Analysis Intelligence Index 和带工具的 Humanity's Last Exam 中高于 Astra。

而且厂商之间的运行环境、提示词、工具、保护措施和评测版本并不完全相同。Anthropic 也特别说明,安全路由会让部分网络安全和生物任务转交给其他模型,进而影响分数。把这些数字精确排列到小数点后一位,并不能消除测试条件不同带来的误差。

因此,团队不应问“哪一个模型绝对最好”,而应该问:

  • 任务失败一次的代价有多高?
  • 模型需要连续运行几分钟、几小时还是几天?
  • 瓶颈是推理上限、执行可靠性,还是每次任务成本?
  • 是否需要操作浏览器、桌面应用和企业内部系统?
  • 数据保留、区域、审计和人工审批有什么要求?

真正的竞争单位已经变成“系统”

长程 Agent 的质量从来不只由基础模型决定。模型很聪明,但没有稳定工具、明确权限和验证闭环,仍然可能在错误方向上高效执行。

生产环境真正需要比较的是整套系统:

  1. 理解:能否从文档、代码和历史记录中恢复真实约束;
  2. 计划:能否把目标拆成可验证、可恢复的步骤;
  3. 执行:能否可靠调用 API、终端、浏览器和业务工具;
  4. 验证:能否运行测试、读取结果,并在证据不足时停止宣称完成;
  5. 治理:能否遵守权限边界,在高风险动作前交给人类决策。

GPT‑6 Astra 强调端到端执行和边界判断,Gemini 3.8 强调规模化 Agent 的成本效率,Claude Fable 5.1 强调长时间任务中的恢复与过程可读性。三条路线最终都会落到同一个工程问题:如何让模型在真实环境里持续完成工作,同时不失去控制。

普通团队现在应该怎么选

最稳妥的方案不是立刻把全部业务切换到最新旗舰,而是建立一个分层模型组合:

  • 高风险、难回滚任务:优先评测旗舰模型,并保留人工审批;
  • 大批量代码整理与知识工作:重点测每个成功任务的总成本,而不是单 token 单价;
  • 长时间无人值守任务:重点观察中途恢复、状态更新和失败后收敛能力;
  • 企业数据任务:把数据保留、部署区域、审计记录与模型能力放在同一张选型表里;
  • 所有 Agent:使用最小权限、隔离环境、可回滚发布和独立验证。

建议拿自己真实的十到二十个任务建立内部评测集,记录成功率、人工接管次数、平均耗时、工具调用量和最终成本。公开榜单决定谁值得进入候选名单,真实任务才决定谁应该进入生产。

我的判断:GPT‑6 是新阶段的发令枪

GPT‑6 Astra 的发布值得关注,但并不是因为一个模型从此赢下所有任务。它更像一声清晰的发令枪:最前沿的 AI 产品正在从“给出更好的答案”升级为“承担更完整的责任”。

接下来真正拉开差距的,不只是谁的模型智力更高,而是谁能把模型、工具、记忆、权限、安全监控、验证和交付组合成可靠系统。对开发者来说,新的核心能力也不只是提示词工程,而是 Agent 工程。

模型竞赛的新问题不再是“它知道多少”,而是“我能把多长、多复杂的一段工作放心交给它”。

资料来源:

本文依据三家公司截至 2026 年 9 月 4 日公开的信息整理。文中性能数据主要来自厂商发布材料,因评测环境与产品保护措施不同,不宜把跨厂商分数视为完全等价的独立测评。


评论