7 月 9 日,OpenAI 同一天做了两件事:把 GPT-5.6 推上「最强模型」位,发布了 ChatGPT Work,一个能跨 Web、移动、桌面替你完成整段时间工作的 agent。Sam Altman 那天在 X 上写的是「obviously the best model we have ever produced, but also one of the best blog posts we have ever produced」。
这句话看上去在夸自己的产品和文章,但它真正讲的是另一件事:OpenAI 自己心里明白,模型和文章都不再是这场比赛的决定性筹码。一个能自主跑几个小时的 agent,才是。
一、同一天发两弹:这不是产品节奏,是位置声明
把这两件事放在一起看,关键不是它们都强,而是它们故意同一天发。
过去 18 个月,OpenAI 是「模型先发,Agent 后补」:GPT-5.4 上线,3-6 个月后 Codex Mobile、Operator、Deep Research 跟上。每一次都是先有模型,再有产品。但 7 月 9 日 GPT-5.6 和 ChatGPT Work 同日上线,这是 OpenAI 第一次明确告诉市场:「我最强的模型」和「我最强的 Agent」从现在起是同一件事,不能分开发。
这一手回应的是同一周 Elon Musk 在 TechCrunch 那篇「Anthropic is the AI leader right now」访谈里的话,Musk 当场表态,会「承诺不断 xAI 给 Anthropic 提供的算力供应」。一个硅谷最大的局外人公开承认对手领先,OpenAI 拿同一天双发作为回应。
这场争的不是模型分数。GPT-5.6 的具体跑分我看到 HLE、GPQA、AIME 三个 benchmark 都在 90% 以上,但更值得看的不是这些分数,是 Codex 周活已经超过 500 万,其中 100 万用户不是开发场景。
那个 100 万的「非开发场景」才是 OpenAI 这一篇真正要打的市场:不是给程序员用的工具,不是给研究员的副驾,是给普通白领用的、把一整天工作做完的数字同事。
二、ChatGPT Work 解决的不是「能不能做」,是「做完一整段时间」
HN 上 ChatGPT Work 帖子 7 月 9 日冲到 335 分,top 评论第一条 patabyte 直接说:「This looks like OpenAI catching up to Anthropic’s Cowork」。unholiness 在第二条更直白:「So, Claude Cowork for OpenAI? Feels overdue!」。
把这周公开报道的四件事拼起来,就能看出「为什么 OpenAI 现在发 ChatGPT Work」:
- Anthropic Cowork 在 3 月份就发过类似形态,agent 替你在多个 App 之间完成长时间任务(找供应商、整理资料、批量处理文档)。
- Codex 周活 500 万:OpenAI 自己的代码 agent 已经跑了一年,沉淀了「Agent 怎么用」的产品形态。
- Musk 公开认 Anthropic 领先:OpenAI 不能再等「模型分数继续涨」,必须在 Agent 体验上追平。
ChatGPT Work 这次的产品形态分三层:第一层是「任务分解」,你给一个模糊目标(「帮我准备 Q3 财务汇报」),它自己拆成 5-10 步;第二层是「跨 App 执行」,它在浏览器、移动 App、桌面 App 之间跳转,自己取数据、填表、整理 PDF;第三层是「失败回滚 + 重试」,遇到某一步失败,它从历史中找备用路径,而不是把整件事停掉。
这三层里,第三层是最有信息量的。AutoGPT 2023 年为什么翻车,是因为失败回滚这件事做不好;ChatGPT Work 把这一层做到可工程化的水平,意味着 agent 产品终于跨过了「演示很酷,真实场景不工作」的那道坎。
三、Codex 周活 500 万、非开发 100 万:数字比模型分数重要
注意 GPT-5.6 发布里 OpenAI 单独点出的那组数字:Codex 周活 500 万,其中 100 万用户不是开发场景。这 100 万是产品线意义上的最大信号。
Agent 这个品类的市场规模有三种估算口径:「模型 token 用量」「API 调用次数」「真实完成任务数」。OpenAI 自己这次选了第三个口径,「真实完成任务数」=「周活用户数」=「500 万 / 100 万」。
这种切法是反 token、反 API 调用的,也是对**「Agent 经济到底有没有跑通」**这个问题的最直接回应。token 和 API 调用涨得再快,如果实际完成任务数不涨,意味着 agent 还是 demo 阶段,没有进入生产工作流。OpenAI 这次主动披露「非开发 100 万」,是在说:**agent 已经进入了真正的工作流,不是大家试了觉得好玩就走的阶段。**这个 100 万具体做什么?没有官方 breakdown,但我从过去几周 Hacker News、TechCrunch、博客、公众号上读到的非开发 agent 实战案例里估算,最大的是「内容运营 + 客户支持 + 销售线索」三类,加起来大概占 70% 以上。ChatGPT Work 这次官方表述里专门提到「getting real work done across web, mobile, and desktop」,这正是这三类工作的核心形态。
四、Musk 的认错 + OpenAI 的应战,2026 下半年主线已经定型
把这一周四件事拼成一条线:
| 日期 | 事件 | 含义 |
|---|---|---|
| 7/9 | Musk 公开认 Anthropic 领先 | 算力 + Agent + 治理三角领先 |
| 7/9 | OpenAI 同日双发 GPT-5.6 + ChatGPT Work | 行业从「模型分数」切到「代理任务完成度」 |
| 7/9 | ChatGPT Work HN 335 分 | 第一个评论直接点 Cowork 对标 |
| 7/9 | Codex 周活 500 万、非开发 100 万 | Agent 已经进入真实工作流 |
这条线串起来看的信号很简单:2026 下半年 AI 竞争的主战场,从「谁的模型分数高」切到「谁的 agent 能替用户把一整天活干完」。Musk 的认错和 OpenAI 的同发是同一件事的两面:Musk 认的是 Anthropic 在 Agent 体验上领先,OpenAI 拿同发做对标是认账这件事,不是反驳。
对普通开发者意味着什么:
- 如果你做 agent 产品,基准要改。过去 12 个月大家比「能不能用」「能不能跑多步」,接下来 12 个月比的是「能不能把一整天活做完不出错」。失败回滚、状态保存、长 session memory,这三个能力变成「做了就上线,不做就淘汰」的标准配置。
- 如果你做 ToB SaaS,「agent 集成窗口」开始变窄。OpenAI 这次明确说 ChatGPT Work 跨 Web/Mobile/Desktop,任何 SaaS 想让 agent 替你做事,接下来 6 个月要主动暴露「agent-friendly API」,否则就被 OpenAI 自己的 Work 流程绕开。
- 如果你做企业服务,要重新算 ROI。过去你卖「Copilot 给员工用」,员工每周省 5 小时;接下来你卖「数字员工替员工干一整天」,这是把「Copilot」升级到「Coworker」。预算结构、合同结构、风险结构都要重写。
Agent 这一品类今天不再是「演示很酷」阶段。从 GPT-5.6 + ChatGPT Work + Codex 500 万 + Musk 认错这四件事,看的是同一个拐点:模型分数再涨已经不是新闻,把一整天活干完才是。
参考链接
- Introducing GPT-5.6 - OpenAI Blog
- ChatGPT for your most ambitious work - OpenAI Blog
- ChatGPT Work - Hacker News 讨论 (335 分)
- OpenAI unveils long-awaited ‘super app’ as rivalry with Anthropic intensifies - Reuters
- Elon Musk praises Anthropic’s Fable, promises not to cut off compute - TechCrunch
- Sam Altman: “obviously the best model we have ever produced…” - X