AI agent 已经不是一个品类了。这是我今天看完一周雷达采集后最确定的判断。

截至 6/28,GitHub 月榜(来源:star-history.com 抓取)+ Product Hunt 月榜 + Hacker News 周榜,三源合采后能稳定出现在榜单上的 agent 相关开源项目 / 产品,已经稳定分布在五个相互独立的层:调研层、记忆层、调度层、防 slop 层、评估层。每一层都有自己的冠军项目,自己的增长曲线,自己的用户群。这一篇要做的,就是把这五层地图摊开,然后讲为什么"分得清"比"做得强"更重要。

第一层:调研层,让 agent 看见全网

调研层做的是一件具体的事:给 agent 一双眼睛,能搜、能读、能汇总多个外部数据源。这一层的特征是"输入侧"。

雷达采集到的几个代表性项目(截至 6/28):

  • Panniantong/Agent-Reach,GitHub 月榜第 4,月增 +22,848 stars,总星 ★43,587。描述很直白:「Give your AI agent eyes to see the entire internet. Read & search Twitter, Reddit, YouTube, GitHub, Bilibili, XiaoHongShu, one CLI, zero API fees.」
  • mvanhorn/last30days-skill,GitHub 月榜第 6,月增 +20,777 stars,总星 ★47,179。描述:「AI agent skill that researches any topic across Reddit, X, YouTube, HN.」
  • Fundraisly,Product Hunt 月榜第 1,↑1,468 票。描述:「AI fundraising agent that finds investors and books meetings.」

这一层的共性是:它们都在做"读"这件事,但读的目标完全不同。Agent-Reach 在做"全平台覆盖",last30days-skill 在做"近 30 天时间窗",Fundraisly 在做"垂直场景(融资)"。我的判断是,调研层接下来会继续按"垂直场景"再细分,通用调研工具会被垂直场景工具挤压。

第二层:记忆层,让 agent 跨会话记得住你

记忆层做的是一件更隐蔽的事:让 agent 在跨 session、跨任务、跨工具调用之间,保持对一个用户 / 一个项目的持续理解。这是"上下文侧"。

雷达采集到的:

  • supermemoryai/supermemory,GitHub 月榜第 19,月增 +5,121 stars,总星 ★27,782。描述:「Memory and context engine + app that is extremely fast, scalable, and can be run fully locally. The Memory API for the AI era.」
  • minimi,Product Hunt 月榜第 16,↑552 票。描述:「Your ambient memory for Claude.」

记忆层的技术路径开始分裂。一类是 supermemory 这种"通用记忆 API + 本地部署",另一类是 minimi 这种"绑定特定 agent(Claude)的环境记忆"。我觉得通用记忆层会先变成基础设施层(类似数据库),而垂直记忆层(绑 Claude / 绑 Cursor / 绑 Codex)会留在应用层吃溢价。

第三层:调度层,让 agent 协调多个子任务

调度层解决的是"agent 太长 / 太复杂"的工程问题。agent 一旦超过 20 步工具调用,就开始变成分布式系统。这一层做的是"执行侧"的协调。

雷达采集到的:

  • can1357/oh-my-pi,GitHub 月榜第 15,月增 +7,339 stars,总星 ★14,907。描述:「AI Coding agent for the terminal, hash-anchored edits, optimized tool harness, LSP, Python, browser, subagents.」
  • ogulcancelik/herdr,GitHub 月榜第 16,月增 +5,076 stars,总星 ★7,765。描述:「agent multiplexer that lives in your terminal.」

oh-my-pi 偏"单 agent 内部增强"(LSP、hash-anchored edits、subagents 都在同一个 agent 内部),herdr 偏"多 agent 并发"(multiplexer 这个词本身就是这个词的工程翻译)。我的判断是,2026 下半年 agent 调度层会复制 2023 年 frontend 框架大战的样子,单体增强派 vs 多 agent 编排派会再打一年。

第四层:防 slop 层,让 agent 输出的不是平均产物

防 slop 层做的是"输出侧的质量控制"。这一层的存在本身就说明了一件事:模型能力已经够强,强到默认输出已经够"对",强到品味和判断力变成了新的瓶颈。

雷达采集到的:

  • Leonxlnx/taste-skill,GitHub 月榜第 11,月增 +28,908 stars,总星 ★52,110,本月榜冠军。描述:「Taste-Skill, gives your AI good taste. stops the AI from generating boring, generic slop.」
  • asgeirtj/system_prompts_leaks,GitHub 月榜第 17,月增 +5,827 stars,总星 ★46,628。描述:「Extracted system prompts from Anthropic, Claude Fable 5, Opus 4.8, Cl…」

taste-skill 是本月 GitHub 月榜冠军,月增接近 3 万 stars。这个数字单独看就已经很能说明问题了。system_prompts_leaks 的存在则说明另一件事:大家不只在做"防 slop 输出",还在研究"反向工程优秀 agent 的 system prompt",这本身就是一种"防 slop 的元工具"。

副线案例:@zarazhangrui 6/26 那条 212 赞的推也讲了类似的事,「Btw I used Borumi to create this video, and it’s genuinely the most underrated video recording/editing tool out there. It’s like Screen Studio + Descript + CapCut all in one.」 视频创作的反 slop 工具链也在被同一批人推起来,这条线跟 taste-skill 是同一条藤。

第五层:评估层,让 agent 的失败可被定位

评估层做的是"事后侧的可观测性"。agent 跑完一个任务,你怎么知道哪一步出了问题?

雷达采集到的:

  • AgentX,Product Hunt 月榜第 14,↑580 票。描述:「Evaluate AI agent, pinpoint issues, and fix with one click.」

这一层的项目数量目前还不多,但信号已经够强。@rauchg 6/27 那条 270 赞的推原话:「Agents are particularly hard-to-debug software. For one, and by design, AI models behave in non-deterministic ways. Even two identical prompts don’t always yield the same output. But agents are also complex distributed systems.」 一个 Next.js 的核心维护者公开说 agent 难 debug,这条信号比任何榜单数据都更值得 builder 关注。

三个跨源信号叠在一起看

地图摊完之后,我想把三周以来雷达里最强的三个跨源信号放在一起。三条信号来自三个完全不同的源头,但指向同一件事。

信号一:@rauchg 的"agent 特别难 debug"(6/27,270 赞)。来源是工程圈最严肃的一线观察者,他在讲一件具体的事:agent 是 non-deterministic + distributed system,两个属性叠在一起,传统 debugger 不够用。

信号二:@swyx 的"scaling without slop"(6/26,46 赞)。原话:「we have been scaling without slop by working with aligned domain experts to add coverage.」 来源是 devrel 圈,他在讲另一件具体的事:扩内容规模这件事,没法靠纯 AI 自动化,必须靠"对齐过的领域专家 + AI"。

信号三:@nikunj 在 taste 评论区的那条(6/26,40 赞)。原话:「a lot of people who never have built anything, can’t achieve taste without being in the arena.」 来源是 builder 圈,他在讲第三件具体的事:品味不是在屏幕前看出来的,是在实战里磨出来的。

三条信号,三个人,三个完全不同的立场(工程 / 增长 / 产品),但他们都在讲同一句话:agent 时代的瓶颈不是模型能力,是配套栈的成熟度

佐证还有:HN id 48698188 上 foxmoss 那篇《Running a software jam in a world of slop》拿下 52 分,文章讲的就是"在 slop 时代怎么组织一场软件 jam 才不会被淹没"。他描述的困境,跟 @swyx 描述的扩规模困境,跟 @nikunj 描述的品味困境,是同一种困境的不同面。

普通人 / builder 该怎么选

讲完地图和信号,最后讲一件事:如果你是一个想用 agent 做事的人 / 一个在选 agent 工具栈的 builder,今天该做什么。

我的判断是三步:

第一步,先挑一层,深扎进去。 不要上来就铺五层。我个人会先做"防 slop 层",因为它投入产出比最高,单个 skill 文件就能开始见效。taste-skill 这种项目一个月涨 3 万 stars 不是没原因的。

第二步,挑好一层之后,选"垂直"不选"通用"。 调研层别先用 Agent-Reach 这种全平台覆盖的,先用一个垂直的(融资场景用 Fundraisly,近 30 天热点用 last30days-skill)。通用工具是给"已经知道自己在做什么"的人准备的,新手用通用工具会被淹死。

第三步,把"评估"和"调度"留到第二阶段再做。 这两层有强烈的"前一层成熟度"依赖。没有调研层和防 slop 层,先做评估层是空转。

真正的杠杆位移

最后讲一件事,也是这一篇我想留住的判断。

agent 时代的"杠杆",正在从"谁 prompt 写得好"位移到"谁的工具栈分得清"。这件事的证据不止是 GitHub 月榜的分布,更是我看到的三个跨源信号。

@rauchg 在讲 debug 难,他在告诉你:单 agent 的极限已经到顶了,下一步是栈的工程化。

@swyx 在讲扩规模,他在告诉你:单靠模型的"通用平均输出"扩不动了,下一步是栈里加入"防 slop"那一层。

@nikunj 在讲品味,他在告诉你:在竞技场里磨出来的人,比在屏幕前看评论的人强,下一步是栈里加入"有判断力的人"作为节点。

三句话,三个方向,合在一起是同一件事:agent 时代的赢家,不会是 prompt 写得最花的那个人,会是工具栈分得最清的那个人

参考链接