我 7 月 2 日到 3 日这两天,在 Hacker News、X、博客、公众号上读到的 5 条工程化 tip,读完后脑子里自己串成了一条线。这条线以前散在不同信源里没被点过,但 24 小时内集中爆出来,让我很难再忽略。

我决定今天这篇不写「Agent 工具盘点」,那种 6 月 28 日我已经写过一篇五层栈(6/28 那篇给的是地图,本文想给路标。这篇想说的是:5 个真正在用 agent 干活的团队,在 7 月初撞到了同一面墙。他们各自给出了解法。我想把这些解法摆在一起,看共同的信号。

一、短绳 AI 编程法:一年多研究浓缩成 7 条规则

okturtles 团队在 《Fable》通关指南 里把一年多的研究压成「短绳方法」。核心就一句话:开发者必须全程在线。

具体 7 条:

  • 先规划并分解任务,从不用 YOLO 模式
  • 每次变更前审查差异,拒绝不想要的更改
  • 每个子任务后 commit,防止 AI 误操作(Opus 4.6/4.7 都有过破坏性行为记录)
  • 人工 + AI 双重 PR 审查,PR 必须注明使用模型
  • 提交者必须亲自审查自己 PR 的代码
  • 拒绝使用 YOLO,不依赖 AI 的自主判断
  • 即便不用前沿模型(Fable 5 旗舰),按此法也能产出超越 Fable 5 的代码质量

关键观察:最后一条才是重点。「短绳」不是「保守」,是把 review 当成主要工具,把 AI 当成执行单元。这把 agent 编程的「人机分工」重新画了一遍,人写规则,AI 执行,人审查。AI 写得再强,这个分工不变。

二、SGLang 团队的 Loop Engineering:把工程流程编码成 SKILL.md

LMSYS 团队在 Agent-Assisted SGLang Development 里给出了一个不太一样的方法:把 LLM 服务、分布式运行时、GPU 内核、扩散管道这些工作流编码成可执行的 SKILL.md 文件、脚本、基准合约和审查循环

他们已经部署的 SKILL 包括:

  • SGLang .claude/skills(CUDA 调试、内核集成、性能分析)
  • SGLang diffusion .claude/skills(扩散模型添加与调优)
  • BBuf/AI-Infra-Auto-Driven-SKILLS(跨框架 SOTA 循环)
  • KDA(MLSys 2026 FlashInfer 内核竞赛获胜方案)
  • BBuf/KDA-Pilot(已合并三个 SGLang 集成 PR)

文章核心提了一个新词叫 「Loop Engineering」,把「追求 SOTA」分解成:公平基准测试 → 差距决策 → 性能分析 → 补丁 → 再验证。Loop Engineering 不是 prompt engineering 升级版,是把工程本身当成可循环的管道。每跑一遍 loop,profile 证据就被收割一次,下一轮的 prompt 和规则都在变。

关键观察:SGLang 团队把「人写 prompt」这件事,升级成了「人写工程流程」。SKILL.md 不是 prompt 模板,是带审查循环的工程规范。prompt 让位给 loop,这件事我 6 月 9 日写过 stop-prompting-design-loops,SGLang 这篇算是把那个论点落到了 GPU 内核这个最硬核的工程场景里。

三、browser-use video-use Skill:让 LLM 看懂视频的 12KB 文本

shao__meng 在 X 上分享 的 video-use Skill 来自 browser-use 团队,做的事是让 LLM 看懂视频

技术流水线是这样的:

  • 音频用 ElevenLabs Scribe 转写,约 12KB 文本(含逐词时间戳、说话人分离、事件标记)
  • 仅在决策点调用 timeline_view.py 生成 PNG 帧图
  • 转写 → 打包 → 生成 JSON 格式 EDL → ffmpeg 渲染 → 最多 3 轮自评估

渲染细节:分段提取 + -c copy 拼接、30ms 音频淡入淡出、PTS 时移、字幕最后叠加、HDR 自动映射、竖屏缩放、两-pass loudnorm。动画支持 HyperFrames、Remotion、Manim 引擎。项目附带 12 条硬规则确保生产正确性。

关键观察:12KB 文本 + 决策点帧图,就是 prompt + image 的极简表达。video-use 没有训练新模型,只重新组织了「模型能消费的输入」。这件事对工具开发者是个信号:让模型看懂长视频,瓶颈不在模型能力,在输入压缩。12KB 的转写文本是 SGLang 那条「Loop Engineering」在多模态场景的对应物,把昂贵的多模态推理,压缩成廉价的 token 流。

四、Claude Fable 5 自主完成一段真实运维工程

公众号「数字生命卡兹克」发了篇 Fable 5 自主完成一个出海网站境外加速 + 运维工程的全过程。这条值得单独看,因为它有完整的过程记录。

事情是这样的:作者让 Fable 5 给一个出海网站做境外加速 + 日常运维。Fable 5 自主启动 22 个 Agent 调研了 40 分钟,发现多个流量来源未被统计等异常。规划境外加速时,它自己否定了 Claude Opus 4.8 给出的 Cloudflare 方案,因为 Cloudflare 无法国内直连/国外分流,且 2025 年起默认拦截 AI 爬虫。Fable 5 改用火山引擎 CDN。

然后是真正让我停下来看的地方:

  • 因需要白名单,Fable 5 自行找到了工单入口,提交了专业工单
  • 22 分钟后开通
  • 它发现工程师漏答了「回源 IP 网段」问题,礼貌追问并补充备选方案
  • 它发现官方方案有安全漏洞,自行加了暗号验证
  • 23:30 切换域名解析,10 分钟后 616 个海外请求走新线路
  • 它最终主动生成运维文档,提醒边缘证书 10 月 2 日到期并附续期步骤

关键观察:Fable 5 在这个任务里没有表现出「AI 在做事」,它表现出的是**「一个懂工程的人在做事」**。自主找到工单、礼貌追问、主动加安全补丁、生成运维文档,这些行为不是 prompt 写出来的,是模型在实战里内化出来的工程直觉。这跟 okturtles 的「短绳法」形成对照:短绳法的核心是「人守在旁边」,Fable 5 这条的核心是「人不在,AI 自己也能守住底线」。

五、千问朱达:Agent Harness 的「多快好省」,Token 消耗仅为海外产品 1/10

千问朱达在公众号分享的 C 端 Agent Harness 实践 给出了中文工程团队对 agent 的另一种回答。

千问团队 2026 年 1 月上线通用复杂任务 Agent(千问 App 胶囊入口),总结出「多快好省」方法论:

  • :支持信息搜集、研究分析等多类型任务
  • :执行时间降至初始 1/3
  • :通过搜索范式与上下文管理优化交付质量
  • Token 消耗仅为海外产品 1/10

团队探索从被动响应转向主动服务,构建 User Memory、Environment、Task System、Assistant 四大组件,指出**「情商」是主动服务最难环节**。朱达提出一个阶段论:

  • Prompt Engineering(写好提示)
  • Harness Engineering(写好工程化外壳)
  • AIWare Engineering(**「低功耗,够用就行」**的下一站)

关键观察:朱达的「1/10 Token」是用工程优化换成本的典型路径。Token 1/10 不是模型变小了,是搜索范式 + 上下文管理 + 任务编排这三层被工程化重写。Harness Engineering 这个词的关键不是 harness 本身,是「工程化重写」,这跟 SGLang 的 SKILL.md、video-use 的 12KB 文本、Fable 5 的运维文档是同一个动作的不同表现:把模型不可控的部分,用工程可控的部分包起来。

跨团队的共同信号:5 件事撞到一起不是巧合

把这 5 件事摆在一起看,我看到 3 个共同信号:

信号 1:工程优化的目标从「让模型更强」变成「让模型更省」。Fable 5 4.44 美元搭出 Rube Goldberg 机器(OpenRouter X 推文)、千问 Token 1/10、video-use 12KB 文本,三个数字指向同一件事:单任务成本正在被工程化压低。模型还是那些模型,钱花得不一样了。

信号 2:Harness / Loop / Skill 这三个词,本质是同一个东西的不同名字。okturtles 的「短绳」、SGLang 的「Loop Engineering」、browser-use 的「Skill」、千问的「Harness」、Fable 5 的「22 个 Agent 调研」,它们都是把人写规则、AI 执行、人/AI 共同审查这件事,给出了不同的工程化包装。我之前 6 月 11 日写的 fable-5-skip-the-model-install-the-loop 提过这个判断,这 5 件事是那个判断的连续验证。

信号 3:「AI 守规矩」正在从「不要做坏事」变成「主动发现漏洞并打补丁」。Fable 5 自行加暗号验证、SGLang 强调「评审重要性提升」、短绳法强制 PR 注明模型,三个团队的共同点是把「审查」从「事后检查」升级到「实时回路」。这是 AI 工程师和传统软件工程师开始合流的地方:以前「review」是上线前的事,现在「review」是 prompt 发出后的每一次循环。

我看到的真正变化

把 5 件事综合起来看,2026 年 7 月初的 agent 工程化出现了三个显式拐点

第一,工具能力飞涨但成本曲线开始被工程化压平。RLI 基准里 Fable 5 已经 16.1% 自动化率(The Decoder 报道),但 Atlassian 月费从 500 万涨到 1500 万美元(IT 之家)。两件事一起看,意思是「能用」和「敢用」是两件事。这 5 个团队的实战恰好在「敢用」这一侧补工程化短板。

第二,工程话语权从 prompt 写作转移到流程编写。okturtles 的 7 条规则、SGLang 的 SKILL.md、千问的 Harness,它们都不是 prompt 模板,是带审查循环的工程规范。写规范的人比写 prompt 的人更稀缺,这是 2026 年下半年的一个暗线。

第三,agent 的「主动服务」从愿景进入工程化落地。千问朱达点出「情商是主动服务最难环节」、Fable 5 主动加安全补丁、SGLang 强调「评审重要性提升」,三个团队都在用工程手段硬扛 agent 自主性的最后一公里。这一公里过不去,agent 还是个玩具;过去了,才是真正的工具。

如果你今晚就想动一下

5 件事不需要你全做。挑一件成本最低的试:

  • 写代码:用 okturtles 的 7 条规则跑一周「短绳法」,PR 里强制加 Model: 字段
  • 做工程化:把团队的一个 PR 流程改写成 SKILL.md(从 prompt template 升级成带 review loop 的规范)
  • 做视频/多模态:装一下 video-use Skill(GitHub 仓库),看看 12KB 文本能不能替代你手动的剪辑脚本
  • 管成本:在你的 agent 调用栈里先算一下每任务 token 数,千问 1/10 不是模型强,是工程强,你能不能也压到 1/3
  • 用 Fable 5:让它自主完成一个真实运维任务(白名单申请、CDN 切换、证书续期),你只做最终审计

**5 件事撞到一起不是巧合。是因为 agent 已经过了「能跑」阶段,正在进入「能守规矩」的阶段。**这个阶段拼的不是模型,是工程化能力。

参考链接