7 月 9 日,OpenAI 同一天做了两件事:把 GPT-5.6 推上「最强模型」位,发布了 ChatGPT Work,一个能跨 Web、移动、桌面替你完成整段时间工作的 agent。Sam Altman 那天在 X 上写的是「obviously the best model we have ever produced, but also one of the best blog posts we have ever produced」。

这句话看上去在夸自己的产品和文章,但它真正讲的是另一件事:OpenAI 自己心里明白,模型和文章都不再是这场比赛的决定性筹码。一个能自主跑几个小时的 agent,才是。

一、同一天发两弹:这不是产品节奏,是位置声明

把这两件事放在一起看,关键不是它们都强,而是它们故意同一天发。

过去 18 个月,OpenAI 是「模型先发,Agent 后补」:GPT-5.4 上线,3-6 个月后 Codex Mobile、Operator、Deep Research 跟上。每一次都是先有模型,再有产品。但 7 月 9 日 GPT-5.6 和 ChatGPT Work 同日上线,这是 OpenAI 第一次明确告诉市场:「我最强的模型」和「我最强的 Agent」从现在起是同一件事,不能分开发。

这一手回应的是同一周 Elon Musk 在 TechCrunch 那篇「Anthropic is the AI leader right now」访谈里的话,Musk 当场表态,会「承诺不断 xAI 给 Anthropic 提供的算力供应」。一个硅谷最大的局外人公开承认对手领先,OpenAI 拿同一天双发作为回应。

这场争的不是模型分数。GPT-5.6 的具体跑分我看到 HLE、GPQA、AIME 三个 benchmark 都在 90% 以上,但更值得看的不是这些分数,是 Codex 周活已经超过 500 万,其中 100 万用户不是开发场景

那个 100 万的「非开发场景」才是 OpenAI 这一篇真正要打的市场:不是给程序员用的工具,不是给研究员的副驾,是给普通白领用的、把一整天工作做完的数字同事。

二、ChatGPT Work 解决的不是「能不能做」,是「做完一整段时间」

HN 上 ChatGPT Work 帖子 7 月 9 日冲到 335 分,top 评论第一条 patabyte 直接说:「This looks like OpenAI catching up to Anthropic’s Cowork」。unholiness 在第二条更直白:「So, Claude Cowork for OpenAI? Feels overdue!」

把这周公开报道的四件事拼起来,就能看出「为什么 OpenAI 现在发 ChatGPT Work」:

  • Anthropic Cowork 在 3 月份就发过类似形态,agent 替你在多个 App 之间完成长时间任务(找供应商、整理资料、批量处理文档)。
  • Codex 周活 500 万:OpenAI 自己的代码 agent 已经跑了一年,沉淀了「Agent 怎么用」的产品形态。
  • Musk 公开认 Anthropic 领先:OpenAI 不能再等「模型分数继续涨」,必须在 Agent 体验上追平。

ChatGPT Work 这次的产品形态分三层:第一层是「任务分解」,你给一个模糊目标(「帮我准备 Q3 财务汇报」),它自己拆成 5-10 步;第二层是「跨 App 执行」,它在浏览器、移动 App、桌面 App 之间跳转,自己取数据、填表、整理 PDF;第三层是「失败回滚 + 重试」,遇到某一步失败,它从历史中找备用路径,而不是把整件事停掉。

这三层里,第三层是最有信息量的。AutoGPT 2023 年为什么翻车,是因为失败回滚这件事做不好;ChatGPT Work 把这一层做到可工程化的水平,意味着 agent 产品终于跨过了「演示很酷,真实场景不工作」的那道坎。

三、Codex 周活 500 万、非开发 100 万:数字比模型分数重要

注意 GPT-5.6 发布里 OpenAI 单独点出的那组数字:Codex 周活 500 万,其中 100 万用户不是开发场景。这 100 万是产品线意义上的最大信号。

Agent 这个品类的市场规模有三种估算口径:「模型 token 用量」「API 调用次数」「真实完成任务数」。OpenAI 自己这次选了第三个口径,「真实完成任务数」=「周活用户数」=「500 万 / 100 万」。

这种切法是反 token、反 API 调用的,也是对**「Agent 经济到底有没有跑通」**这个问题的最直接回应。token 和 API 调用涨得再快,如果实际完成任务数不涨,意味着 agent 还是 demo 阶段,没有进入生产工作流。OpenAI 这次主动披露「非开发 100 万」,是在说:**agent 已经进入了真正的工作流,不是大家试了觉得好玩就走的阶段。**这个 100 万具体做什么?没有官方 breakdown,但我从过去几周 Hacker News、TechCrunch、博客、公众号上读到的非开发 agent 实战案例里估算,最大的是「内容运营 + 客户支持 + 销售线索」三类,加起来大概占 70% 以上。ChatGPT Work 这次官方表述里专门提到「getting real work done across web, mobile, and desktop」,这正是这三类工作的核心形态。

四、Musk 的认错 + OpenAI 的应战,2026 下半年主线已经定型

把这一周四件事拼成一条线:

日期 事件 含义
7/9 Musk 公开认 Anthropic 领先 算力 + Agent + 治理三角领先
7/9 OpenAI 同日双发 GPT-5.6 + ChatGPT Work 行业从「模型分数」切到「代理任务完成度」
7/9 ChatGPT Work HN 335 分 第一个评论直接点 Cowork 对标
7/9 Codex 周活 500 万、非开发 100 万 Agent 已经进入真实工作流

这条线串起来看的信号很简单:2026 下半年 AI 竞争的主战场,从「谁的模型分数高」切到「谁的 agent 能替用户把一整天活干完」。Musk 的认错和 OpenAI 的同发是同一件事的两面:Musk 认的是 Anthropic 在 Agent 体验上领先,OpenAI 拿同发做对标是认账这件事,不是反驳。

对普通开发者意味着什么:

  1. 如果你做 agent 产品,基准要改。过去 12 个月大家比「能不能用」「能不能跑多步」,接下来 12 个月比的是「能不能把一整天活做完不出错」。失败回滚、状态保存、长 session memory,这三个能力变成「做了就上线,不做就淘汰」的标准配置。
  2. 如果你做 ToB SaaS,「agent 集成窗口」开始变窄。OpenAI 这次明确说 ChatGPT Work 跨 Web/Mobile/Desktop,任何 SaaS 想让 agent 替你做事,接下来 6 个月要主动暴露「agent-friendly API」,否则就被 OpenAI 自己的 Work 流程绕开。
  3. 如果你做企业服务,要重新算 ROI。过去你卖「Copilot 给员工用」,员工每周省 5 小时;接下来你卖「数字员工替员工干一整天」,这是把「Copilot」升级到「Coworker」。预算结构、合同结构、风险结构都要重写。

Agent 这一品类今天不再是「演示很酷」阶段。从 GPT-5.6 + ChatGPT Work + Codex 500 万 + Musk 认错这四件事,看的是同一个拐点:模型分数再涨已经不是新闻,把一整天活干完才是。

参考链接