7 月 24 日,Anthropic 发布 Claude Opus 5。新闻稿最显眼的一句是"提供接近 Claude Fable 5 的能力,价格却只是它的一半"。
我看到很多中文报道把这句话直接转译成了"Opus 5 价格腰斩"。这个表述对了一半,错了一半。
对的一半是,Anthropic 自己的营销话术确实是"frontier intelligence of Claude Fable 5 at half the price"。错的一半是,Anthropic 没有下调 token 价格。Opus 5 的 API 标价依然是输入 $5 / 百万 token、输出 $25 / 百万 token,跟上一代 Opus 4.8 完全一致。Fast mode 也仍然是 base price 的 2 倍。
那"价格腰斩"是哪来的?
它来自 cost per task 这一层。在 CursorBench 3.2 上 max effort 跑下来,Opus 5 距离 Fable 5 的 peak 分数只差 0.5%,但每任务成本只有一半。在 OSWorld 2.0 上,它全面超过 Fable 5 的最好成绩,成本只占 三分之一。在 ARC-AGI 3 上,分数是次优模型的 3 倍,而且这个次优不是 Opus 5 的上一代,是其他家的前沿模型。
换句话说,腰斩的不是 API 报价,是单位智能成本。你为同一份业务产出付的钱变少了,因为模型更会干活、需要的 reasoning token 更少、能一次成功不再二次返工。
真正在变化的是什么
我读完 Anthropic 官方文章和早期客户的引语之后,觉得这个变化被低估了。
第一层,API 价格表冻结,能力价格表松动。这件事在 Opus 4.5 → Opus 4.7 → Opus 4.8 → Opus 5 这四代里反复发生。Anthropic 用的是一种克价的玩法:token 单价不动,把省钱的承诺推到"少推理、更准确、更稳"。早期客户 Box 给的数字是 Opus 5 比 Opus 4.8 在内部评测上高 8%,其中数据分析 +11%,尽职调查 +17%。客户 Lovable 在最难 agentic coding 测试上跑出 +22%。一家律所工作流里,max reasoning 设定下 Opus 5 平均少生成 26% token。一家交易公司直接报"用约七分之一的 reasoning token、不到一半的延迟"。
这些数字拼在一起,意思很清楚:Anthropic 把"模型会更聪明、更便宜"这个本来只能讲故事的承诺,拆成了可以一项一项验证的小指标。
第二层,“half the price” 是相对于 Fable 5,不是相对于 Opus 4.8。这件事很重要。Fable 5 是 Anthropic 的 frontier 旗舰,价格本来就更高,所以"接近 Fable 5 的能力,成本是它一半"是个对 Fable 5 的相对位置,不是普遍降价。但 Anthropic 同时给出了一个对 Opus 4.8 的数字:在 Frontier-Bench v0.1 上,Opus 5 性能超过 Opus 4.8 两倍以上,且每任务成本更低。也就是相对上一代 Opus,Opus 5 的能力是翻倍、单任务成本是压低——这才是行业意义上的"价格下探、能力上探"。
第三层,更话多不等于更划算。AI Pricing Guru 在 launch day 把 Opus 5 跑了一遍实验室的 49 个 reasoning / extraction / coding 任务:准确率 49/49(跟 Opus 4.8 打平),但平均 completion token 是 1989 对 Opus 4.8 的 630。token 单价没变,输出多了 3 倍多,单次调用真实账单反而可能更高。这是一个反直觉的提醒:token 价格没变但实际花费涨了,这种事情只会出现在你直接调 API 而不做任务层统计的时候。
这件事对 builder 意味着什么
我之前写过 Cursor Router 那篇,讲的是 IDE 内部怎么把多模型拼成 cost per commit 更低的执行路径。Cursor Router 解决的是"用什么模型干这件事",Opus 5 这次解决的是"同一件事的账单可以砍到一半"。这两条线看起来不同,其实指向同一个底层变化:模型层的经济指标正在从 per-token 切换到 per-task。
per-task 的好处是不需要赌"模型一定听话"。CursorBench 3.2 max effort 下,Opus 5 完成率高、单次 token 又少,账单和成功率两个数都好看。per-task 的难点是你必须真的去测,光看 API 报价表会得出"Opus 5 没降价"的错误结论。
我给正在用或打算用 Claude 的 builder 三个具体动作。
第一,把 cost per task 写进评估矩阵。在 Claude Code、Cursor、Devin 这种带 harness 的环境里,把 Opus 5 跟 Opus 4.8 跑同一组 accepted-patch / task-completion / review-time 指标。Anthropic 在自动化行为审计里给 Opus 5 的 misaligned behavior 评分是 2.3,是近期模型里最低的之一;这意味着它不容易跑偏,不会因为返工把 per-task 成本悄悄打回去。
第二,给 reasoning effort 设阈值,而不是默认 max。Opus 5 在最低 effort 下已经能通过比任何其他模型更多的任务。这意味着日常任务不必拉满,省下的不是 token 单价,是 reasoning token 总数。Anthropic 给出的数字是 max reasoning 设定下 Opus 5 比 Opus 4.8 少 26% token;如果你本来就跑低 effort,账单改善会更明显。
第三,准备好 Opus 5 的 fallback 路径。Anthropic 在 Claude.ai、Claude Code、Claude Cowork 里默认把被安全分类器拦下的请求 fallback 到 Opus 4.8。这对大部分业务没影响,但如果你的产品里调用了 Opus 5 又绑定了固定成本估算,注意 fallback 会让单次任务的实际账单波动。早期测试里 Box、Lovable、Notion、Cognition、Zapier 这些客户给出的数字都很好,但也都强调"先在你们的真实工作流上跑一遍"。
我看到的拐点
我自己在读 Opus 5 文章和早期客户引语时,最被说服的是两种能力。
一种是 agent 的自检和迭代。Opus 5 被 Anthropic 描述为"much stronger at verifying its work and iterating carefully until it succeeds"。具体例子是,它在 Frontier-Bench 上拿到一张机器零件图纸,自己写了一个 computer vision pipeline 把几何信息从像素里抠出来,再完整重建。Cursor 的早期测试里,Opus 5 在 hardest debugging 和 root-cause 分析上比 Opus 4.8 强得多。
另一种是 judge/判断力。早期客户 Igor Ostrovsky(Co-Founder)直接说"what stands out about Claude Opus 5 is judgment"。另一位客户 Zimu Li 给了一个具体场景:在一次架构重构讨论里,Opus 5 推翻了 ta 提出的设计,ta 坚持后 Opus 5 没有让步。这件事比任何 benchmark 都更说明问题——在 agent 越来越深地进入决策流程的时代,判断力比完成率更值钱,因为错一次比慢一次贵得多。
这两种能力都不在 token 价格表里。它们只能通过 per-task 评估、per-decision 复盘来验证。所以 7 月 24 日真正的变化,不是"Opus 5 比 Opus 4.8 便宜",而是企业里做模型选型的标尺,从"每百万 token 多少钱"切到了"每完成一项业务多少钱"。
这条线往回接 Cursor Router 和更早的 routing 工具,往前接的是 agent harness 的标准化和 per-task 计费的产品化。模型层正在让出 token 经济性的中心位置,把省钱的责任交给 harness 和工具链。这是接下来一年里,所有模型厂商、所有 agent 产品、所有 builder 都要重新算的一笔账。