Agent 工程化实战手册:5 个团队在 7 月初撞到同一面墙
我 7 月 2 日到 3 日这两天,在 Hacker News、X、博客、公众号上读到的 5 条工程化 tip,读完后脑子里自己串成了一条线。这条线以前散在不同信源里没被点过,但 24 小时内集中爆出来,让我很难再忽略。 ...
我 7 月 2 日到 3 日这两天,在 Hacker News、X、博客、公众号上读到的 5 条工程化 tip,读完后脑子里自己串成了一条线。这条线以前散在不同信源里没被点过,但 24 小时内集中爆出来,让我很难再忽略。 ...
先说清楚一件事,我必须先修正自己 6 月 5 日那篇 《Anthropic 一夜三动作:造 agent 的同时,已经在管 agent》 的判断。 那篇文章里我说"Anthropic 是先有护栏、再放开手脚",把 Anthropic 跟 OpenAI 的"边跑边补"对比了一下,结论是 Anthropic 路线在大客户那边会更吃香。当时我手里有三件证据:开源漏洞发现框架、递归自我改进研究、《How we contain Claude》工程博文。三件事摆在一起,我读出来的信号是"双线作战"。 ...
我写这篇的时候是 2026 年 6 月 30 日早上。6 月最后一天。 如果要我用一句话总结 2026 年上半年 AI 圈在工程上最重要的变化,我不会说模型又变强了、上下文又变长了。我会说:agent 周围那圈协议,开始像 1995 年的互联网一样长起来了。 ...
AI agent 已经不是一个品类了。这是我今天看完一周雷达采集后最确定的判断。 截至 6/28,GitHub 月榜(来源:star-history.com 抓取)+ Product Hunt 月榜 + Hacker News 周榜,三源合采后能稳定出现在榜单上的 agent 相关开源项目 / 产品,已经稳定分布在五个相互独立的层:调研层、记忆层、调度层、防 slop 层、评估层。每一层都有自己的冠军项目,自己的增长曲线,自己的用户群。这一篇要做的,就是把这五层地图摊开,然后讲为什么"分得清"比"做得强"更重要。 ...
6 月 26 日下午(美东),OpenAI 在自己博客发了 GPT‑5.6 Sol 的 preview 帖,并把 system card 放在了 deploymentsafety.openai.com。同一天,Washington Post 报道:美国政府会决定哪些用户能用上 GPT‑5.6。同一天,Reuters 报 Anthropic 把 Mythos 限定给 “trusted partners”。 ...
一个跑步 app 写不下去的 bug Karl Tryggvason 写了一个叫 In the Long Run 的 app,让跑者把 Strava 上的累计里程投射到虚拟世界地图上。他想把地图变得有意思:路过的城市、景点、历史遗址,能讲出一段小故事。 ...
昨天(6 月 23 日)Anthropic 在 Newsroom 发了一篇 Introducing Claude Tag。文章不长,但中间藏了一句话,我自己读到的时候停下来看了两遍: Today, 65% of our product team’s code is created by our internal version of Claude Tag. ...
昨天(6 月 22 日)Hacker News 首页第一条挂着《Steam Machine launches today》,24 小时拿下 1201 分、1085 条评论。这个数字放在 HN 历史上不算顶流,但在 2026 年这个「AI 工具刷屏」的环境里,一条硬件帖子抢到第一名,是稀缺事件。 ...
很多人跟我一样,最近被 LLM 的 API 账单吓到过一次。 不是训练侧的成本,是 Agent / RAG 这类"每次调用都要拼一大坨上下文"的场景。一个典型的 Claude Code 会话,过去一个月我把日志翻出来看,工具输出和日志回显占进去的 token 是真问题里最容易被忽略的那块。 ...
如果你只看产品对比表,Codex 和 Claude Code 的差异能列三十条:用哪个模型、支不支持浏览器、限额给多少、能不能在手机上续上。但这些都不是今天我想写的。 ...