Claude Opus 5:价格没变,但每任务成本被压进新水位
7 月 24 日,Anthropic 发布 Claude Opus 5。新闻稿最显眼的一句是"提供接近 Claude Fable 5 的能力,价格却只是它的一半"。 我看到很多中文报道把这句话直接转译成了"Opus 5 价格腰斩"。这个表述对了一半,错了一半。 ...
7 月 24 日,Anthropic 发布 Claude Opus 5。新闻稿最显眼的一句是"提供接近 Claude Fable 5 的能力,价格却只是它的一半"。 我看到很多中文报道把这句话直接转译成了"Opus 5 价格腰斩"。这个表述对了一半,错了一半。 ...
7 月 23 日,OpenAI 把 ChatGPT 语音推到桌面版,全球同步给 Plus、Pro、Business、Edu、Enterprise 各档用户。这版语音能直接指挥电脑,并协调在 ChatGPT Work 和 Codex 里运行的多个智能体,背后由 GPT-Live 驱动,几乎是同时说话、同时听、同时分配任务。Anthropic 选了同一个时间窗口,把 Claude 语音模式从 Haiku 扩到 Opus、Sonnet 全系,并正式接上 Gmail、Slack 等工具以及多语言支持。 ...
OpenAI 7/9 把 GPT-5.6 + ChatGPT Work 同日上线后 48 小时,生态在三条线同时重新选边:OpenAI 自己暂时取消了 Plus / Business / Pro 的 5 小时使用限制;Codex 周活冲到 600 万;生产代理侧一家叫 Ploy 的公司,把自己的核心代理(构建营销网站、跨 App 规划、读写代码库、自截图、自判 done)从 Claude Opus 4.8 切到 GPT-5.6 Sol,首次跑就比 Opus 4.8 快 2.17 倍、便宜 27%、视觉分 0.970 vs 0.936。 ...
7 月 9 日,OpenAI 同一天做了两件事:把 GPT-5.6 推上「最强模型」位,发布了 ChatGPT Work,一个能跨 Web、移动、桌面替你完成整段时间工作的 agent。Sam Altman 那天在 X 上写的是「obviously the best model we have ever produced, but also one of the best blog posts we have ever produced」。 ...
我 7 月 2 日到 3 日这两天,在 Hacker News、X、博客、公众号上读到的 5 条工程化 tip,读完后脑子里自己串成了一条线。这条线以前散在不同信源里没被点过,但 24 小时内集中爆出来,让我很难再忽略。 ...
我写这篇的时候是 2026 年 6 月 30 日早上。6 月最后一天。 如果要我用一句话总结 2026 年上半年 AI 圈在工程上最重要的变化,我不会说模型又变强了、上下文又变长了。我会说:agent 周围那圈协议,开始像 1995 年的互联网一样长起来了。 ...
AI agent 已经不是一个品类了。这是我今天看完一周雷达采集后最确定的判断。 截至 6/28,GitHub 月榜(来源:star-history.com 抓取)+ Product Hunt 月榜 + Hacker News 周榜,三源合采后能稳定出现在榜单上的 agent 相关开源项目 / 产品,已经稳定分布在五个相互独立的层:调研层、记忆层、调度层、防 slop 层、评估层。每一层都有自己的冠军项目,自己的增长曲线,自己的用户群。这一篇要做的,就是把这五层地图摊开,然后讲为什么"分得清"比"做得强"更重要。 ...
如果你只看产品对比表,Codex 和 Claude Code 的差异能列三十条:用哪个模型、支不支持浏览器、限额给多少、能不能在手机上续上。但这些都不是今天我想写的。 ...
最近 X 上钉墙频次最高的一条 agent 推文,不是某个新模型发布,也不是哪个 benchmark 破纪录。 它很朴素,但越琢磨越觉得有味道: “Here’s your monthly reminder that you shouldn’t be prompting coding agents anymore. You should be designing loops that prompt your agents.” — @steipete ...
2026 年 6 月 4 日那天,Anthropic 在同一天做了三件事。 第一件,开源了一个叫 defending-code-reference-harness 的漏洞发现框架。Hacker News 当日 242 分、82 条评论。仓库在 GitHub,定位很清楚:让 Claude 在受控环境下对参考代码做差分安全审计,把"模型找漏洞"从一句话描述变成可复现的工程流水线。¹ ...