Hall of Fame
今日趋势综述
今天的信号:从『用哪个模型』转向『怎么把能力装起来』
把今天这几条放在一起看,会发现它们其实在讲同一件事的不同侧面。VoltAgent 的 skills 库冲到 28.5k 星、里面 1400 多个技能来自 Anthropic、Stripe、Vercel 这些一线团队;腾讯的 Agent Memory 用四层记忆把 token 砍掉六成、把角色记忆准确率从 48% 提到 76%;Desktop Commander 让 Claude 真能跑你的终端、改你的文件。它们都不是在造更强的模型,而是在给已经足够强的模型『装外设』——技能、记忆、手脚。当模型本身人人可得,差距就出现在这些外围能力的工程上。
Karpathy 把这层意思说得最直白:意图规范和任务分解,才是新的编程;现在真正在练的技能是判断力——判断什么该交给 agent、怎么把需求讲清楚、怎么快速审查它的产出。HAS-Bench 用实验佐证了同一点:人参与进来确实能显著提升 agent 的完成率和纠错能力,但收益取决于你『在什么时候、以什么方式、以什么身份』介入。换句话说,人的价值没消失,只是从『自己动手写』挪到了『会指挥、会验收』。
落到挣钱和职业上更是如此。物流行业 AI 的 ROI 早被 UPS、亚马逊证明过,但 2026 年真正卡住落地的是『会用的人不够』,高级 AI 供应链岗位需求两年涨了近四倍;一个独立开发者靠把 AI 编排绑死在代理商的获客、外联、运营流程上,4 周做到 3k 刀月收入——不是因为模型强,而是因为他把能力交付成了客户账上能看到的结果。今天该记住的方向只有一句:别再纠结用哪个模型,去练把能力装起来、指挥它、并交付出可验证结果的能力。
VoltAgent/awesome-agent-skills
展开详情
它解决的痛点是:agent skills 这半年爆炸式增长,但市面上大量 skills 是 AI 批量生成的『水货』,质量参差、装了也不好用,开发者很难挑到真正能用的。这个仓库的答案是只收『真团队真在用』的官方技能——来自 Anthropic、Google Labs、Vercel、Stripe、Cloudflare、Netlify、Microsoft、Hugging Face、Figma 等一线工程团队,外加社区精选,目前 1497+ 个技能,明确标注跨工具兼容:Claude Code、Codex、Gemini CLI、Cursor、GitHub Copilot、OpenCode、Windsurf 等。一个技能就是一个带 SKILL.md 的文件夹,写一次到处能用。
周增长:近期在 agent skills 生态里增长很快,具体周增以 GitHub Trending / star-history 实时为准
- **只收真货**:明确拒绝 AI 批量生成的水技能,收录标准是『一线工程团队真实在用』,官方来源含 Anthropic、Google Labs、Vercel、Stripe、Cloudflare、Netlify、Microsoft、Hugging Face、Figma 等
- **一次写好、到处能用**:1497+ 技能标注跨工具兼容 Claude Code / Codex / Gemini CLI / Cursor / GitHub Copilot / OpenCode / Windsurf,skill 就是一个带 SKILL.md 的文件夹
- **规模与势头**:约 2.85 万星、3.1k fork、423 次提交,是当前 agent skills 生态里最受关注的精选库之一
TencentDB-Agent-Memory
展开详情
它解决的痛点是:agent 跑长任务时上下文越滚越长、token 越烧越多,而粗暴压缩又会丢掉关键细节、导致失忆或答非所问。腾讯云数据库团队的答案是一套完全本地、零外部 API 依赖的分层记忆系统:短期记忆分三层(底层存原始工具输出、中层抽步骤摘要、顶层压成一张轻量 Mermaid 画布),长期记忆搭一座语义金字塔(L0 原始对话 → L1 原子事实 → L2 场景块 → L3 用户画像)。关键是它保证『无损可回溯』——任何高层抽象都能确定性地钻取回底层原文证据,不会像普通压缩那样把信息压没。MIT 开源。
周增长:7 月 8 日冲上 GitHub Trending 第 1,近期增长强劲,具体周增以实时榜为准
- **分层记忆不丢细节**:短期三层(原始输出→步骤摘要→Mermaid 画布)、长期四层金字塔(对话→原子事实→场景→用户画像),高层抽象可确定性钻取回底层原文,避免普通压缩的『压没了』
- **数字实打实**:接入 agent 框架后 token 用量最多降 61.38%、任务通过率相对提升 51.52%、PersonaMem 准确率 48%→76%
- **完全本地 + 开源**:零外部 API 依赖、可离线跑,MIT 许可——记忆数据不出本机,适合对隐私和成本敏感的场景
wonderwhy-er/DesktopCommanderMCP
展开详情
它解决的痛点是:Claude 这类模型很会写代码,但默认它只能『说』不能『做』——不能真的跑你的构建、搜你的代码库、改你的文件、盯一个长时间运行的进程。Desktop Commander 是一个 MCP 服务器,把 Claude 接到你本机的终端和文件系统上:搜索/更新/管理文件、执行终端命令、管理长期进程、支持 Excel/PDF/DOCX,还能带搜索替换的代码编辑。等于把一个聊天里的模型变成一个真能在你机器上干活的开发环境。
周增长:持续活跃,最新版 v0.2.44(7 月 9 日),近期增长稳定
- **给模型装手脚**:通过 MCP 让 Claude 真能执行终端命令、搜索和编辑文件、管理长时间运行的进程,实时看到结果,而不只是给你贴一段代码
- **办公文件也能碰**:内置对 Excel / PDF / DOCX 的支持和带搜索替换的代码编辑,覆盖的不只是写代码,也包括日常文档处理
- **活跃在更新**:37 个 release、最新 v0.2.44(7 月 9 日)、550 次提交,还在推出 Desktop Commander App(Beta)
HAS-Bench: Evaluating LLM-Based Human-Agent Systems under Configurable Human Participation
展开详情
- **把人当一等参与者**:用图结构框架给人和 agent 都定义角色、权限、通信路径、行动权,而不是把人简化成『派任务的甲方』
- **测的是过程不只是结果**:除了任务完成率,还量化澄清质量、反馈利用、控制校准、安全、主动性、交互成本等协作行为
- **结论**:跨六个领域,人参与能显著提升完成率和失败恢复,但收益取决于『何时、如何、由谁』介入——盲目多插手未必更好
AI 在物流业的 2026 现实检查:ROI 早被验证,真正卡住落地的是『会用的人不够』
展开详情
- **ROI 早被证明**:UPS ORION 每年省约 1 亿英里、约 4 亿美元;亚马逊 75 万+ 机器人 + AI 需求预测支撑当日/次日达;早期自主供应链项目交付周期缩短约 27%、人效提升约 25%
- **市场在猛涨**:全球供应链 AI 市场 2026 约 198 亿美元,较 2022 年的 65 亿约 45% 年复合增速
- **瓶颈换位**:真正的约束不再是模型或预算,而是技能缺口——高级 AI 供应链岗位需求较 2023 年涨约 387%
一个人 4 周把 AI 编排平台做到 $3k MRR:不做通用工具,绑死代理商的获客与运营流程
展开详情
- **不做通用工具,绑营收流程**:产品直接嵌进代理商/GTM 团队的获客、外联、运营环节,替代具体人工,而不是又一个泛泛的『AI 助手』
- **速度即优势**:靠 AI 把开发和运营环节自动化,一个人 4 周从 0 到约 3k 美元月收入
- **打法可复制**:同期一批 solo 创始人用『垂直 + 绑客户营收流程』的同款思路,半年做到 2 万–6 万美元月收入
Andrej Karpathy
意图规范和任务分解,才是新的编程。现在真正在练的技能是判断力——判断什么该交给 agent、怎么把需求讲清楚、怎么快速审查它的产出。我自己写代码和交给 agent 的比例,已经从 80:20 反转成了 20:80。
Wispr Flow
展开详情
- **说话即输入,无处不在**:在几乎所有 App 里把语音按你的风格转成文字,带自动纠错、命令模式、100+ 语言,把『打字』这个高频动作直接换成『说』
- **增长数字扎眼**:洽谈中估值近 20 亿美元、半年近乎翻三倍;270 家世界 500 强在用(英伟达、亚马逊等);6 月起月环比 +40%、用户同比约 100 倍、12 月留存约 70%
- **赢在体验而非模型**:语音转写模型早已不稀缺,它的护城河是把准确率、延迟、跨应用顺手度和留存打磨到企业愿意付费
今日趋势综述
今天的信号:没有『最强模型』了,只有『这个任务用哪个』——值钱的是选型、集成与分发
把今天几件事连起来,一个和昨天一脉相承、但今天更清晰的判断浮出来了:前沿模型的能力不但在饱和,还在按任务类型『碎片化』——不再有一个全场最优的模型,只有『这个场景该用哪个』。Claude Fable 5 今天(7 月 20 日)开始向 Max/Team 用户放量,可它和一周前发布的 GPT-5.6 Sol 谁强?答案取决于你干什么:在最硬的真实仓库补丁任务 SWE-bench Pro 上,Fable 5 约 80 分明显甩开 GPT-5.6 Sol 的约 64.6(连上一代 Opus 4.8 的约 69.2 都更高);但在终端命令类的 Terminal-Bench 2.1 和长程 Agents' Last Exam 上,反而是又快又便宜(单价只有 Fable 一半)的 GPT-5.6 Sol 领先十几个点。『谁最强』这个问题本身正在失效,取而代之的是『会不会按任务挑模型、按预算配路由』这门手艺。
当能力变成这样一种按任务分布、还越来越便宜的原材料,价值就继续往交付那一层沉。今天四条线都指向同一件事:Skills 从『某家产品的功能』变成了『跨厂商的共享基础设施』——一个为 Claude Code 写的 SKILL.md,如今能不改一行在 Cursor、Copilot、Codex、Gemini CLI 上跑,微软和 OpenAI 在标准发布 48 小时内就接了,agentskills.io 上已有约 40 个兼容产品,你打包一次专长就能到处复用;开源安全 agent Strix 拿了 3.6 万星,靠的不是『我接了最强模型』,而是『每个漏洞都用真实 PoC 证给你看』这个能被验证的结果;给编码 agent 加一层本地优先、事件溯源的记忆与判断层(PROJECTMEM),解决的是『怎么让 agent 记住上下文、少犯重复错误』这种可靠性问题;而在把 AI 变成现金流那头,一个人管 11 个客户、月工具成本仅约 380 美元、按『交付结果』每客户收 2000–4500 美元的经济账已经跑通,真正的坎不再是做不做得出来,而是分发——你能不能持续找到愿意付钱的人。
所以如果你在找方向:别再执着于『追最新最强的那个模型』,那层每周都在洗牌、还在变便宜。把功夫下到四件更耐用的事上——第一,练『按任务选型 + 按预算配路由』,同一件活知道什么时候用贵的、什么时候用便宜的;第二,把你的专长写成可跨工具复用的 skill,一次打包到处能用;第三,盯着『可靠、可验证的结果』做东西(自证的漏洞、记得住的 agent、算得清的挽回),而不是漂亮的 demo;第四,也是最容易被忽略的——把分发当成第一天的事,工具已经不稀缺,稀缺的是能持续把它送到愿意付钱的人面前。当模型能力人人可得,你比别人多赚的那部分,全在『选得准、拼得稳、卖得出去』这几个字里。
Claude Fable 5 今天上线 Max/Team:和 GPT-5.6 Sol 到底谁强?答案取决于你干哪种活
展开详情
- **对比·SWE-bench Pro(真实仓库补丁)**:Claude Fable 5 约 80.0 vs GPT-5.6 Sol 约 64.6 vs 上一代 Opus 4.8 约 69.2——最硬的工程任务 Fable 5 明显领先
- **对比·终端/长程(Sol 反超)**:Terminal-Bench 2.1 Sol 88.8 vs Fable 5 83.4;Agents' Last Exam Sol 53.6,比 Fable 高约 13 分——短平快的终端活 Sol 又快又强
- **对比·价格**:Fable 5 约 \$10/\$50 vs GPT-5.6 Sol 约 \$5/\$30(每百万 token),Sol 约为一半——省钱场景 Sol,正确性优先场景 Fable
法律 AI 遍地都是,但只有 7% 的法务团队真把它用成了——差距不在模型,在执行
展开详情
- **遍地在用 ≠ 用成了**:约 7% 的法务团队真正走完试点、用起来并能衡量成效;约 83% 说不清去年 AI 花费有没有回本——瓶颈是执行不是模型
- **用成的收益很硬**:Rupp Pfalzgraf 86% 律师日用、复杂联邦动议起草缩到约 1/4 时间;合同起草到定稿压到 30 分钟、成本降约 90%;e-discovery 省 40–50%
- **行业平均值**:62% 的法律从业者每周省下 6–20% 工时、一年约 240 小时——省下的时间从例行事务转向更高价值的策略工作
Agent Skills 已从『某家产品的功能』变成跨厂商的开放基础设施:一次写好,Claude/Cursor/Copilot/Codex 通用
展开详情
- **从功能变标准**:2025-12-18 Anthropic 开源 Agent Skills 规范于 agentskills.io,微软与 OpenAI 约 48 小时内接入——这是它从『产品卖点』变成『共享基础设施』的分水岭
- **一次写好到处能跑**:为 Claude Code 写的 SKILL.md 可不改一行在 Cursor/Copilot/Codex/Gemini CLI 上运行;到 2026-06 官方展示页约 40 个兼容产品
- **格式极简、门槛极低**:一个 Skill 就是一个文件夹,最少只需一个 SKILL.md(YAML 头 + Markdown 指令)——不写代码也能把专长打包成可复用模块
PROJECTMEM: A Local-First, Event-Sourced Memory and Judgment Layer for AI Coding Agents
展开详情
- **给编码 agent 装长期记忆**:用事件溯源把项目里的改动、判断、踩坑持久化下来,让 agent 跨会话记住上下文,别每次从零开始、反复犯同样的错
- **本地优先、数据可控**:记忆留在本地而非上传云端,对把代码库当核心资产的团队/个人,隐私与可控性直接决定敢不敢上生产
- **面向可靠性而非能力**:目标不是让 agent 更聪明,而是更皮实、能长期协作——正是 agent 真正接管编码后最该补的一层
『按结果收费』的一人 AI 服务:一个人管 11 个客户、月工具成本约 380 美元,真正的坎是分发不是搭建
展开详情
- **卖结果不卖工具**:不收 \$49/月订阅,按交付结果(文章/落地页/广告素材/线索跟进)每客户收 \$2,000–4,500/月,愿付价对标一个兼职员工而非一个软件
- **经济账极端漂亮**:单人同时管 11 个客户、月工具成本仅约 \$380,毛利 90%+——AI 把交付成本压到近乎为零,规模瓶颈从『产能』变成『获客』
- **真正的坎是分发**:2026 年工具已不稀缺、复制门槛极低,能否持续找到并说服愿为结果付钱的客户,才是决定你到不到得了 \$5–10k MRR 的分水岭
Ethan Mollick
要用好 AI,你得学会分开看三层:模型(models)、应用(apps)和脚手架(harnesses)。脚手架是那套让 AI 能自己调用工具、采取行动、独立走完多步任务的系统——就像马具把马的蛮力变成能拉车耕地的实际产出,是脚手架让模型的能力真正变成干成的活。
今日趋势综述
今天的信号:模型能力在饱和,值钱的是『把它交付成结果』的那一段
把今天几件事连起来看,方向很一致:最上游的『谁家模型最强』这件事,正在快速失去区分度。SWE-bench Verified 上 GPT-5.5、Claude Opus 4.8 已经挤在 88.6–88.7 一线、几乎并列,Gemini 3.1 Pro 也就差几个点——这个曾经用来排座次的基准,如今只能证明『你是前沿级』,排不出高下了。差异被逼到了更难、更没被刷过的 SWE-bench Pro 上(Opus 4.8 约 69.2、GPT-5.5 约 58.6、Gemini 3.1 Pro 约 54.2)。换句话说,raw capability 正在变成一种谁都拿得到的原材料,光靠『我用的是最强模型』已经卖不出溢价。
那什么在升值?是『把这些现成能力,交付成某个具体的人、具体行业愿意付钱的结果』的那一段。今天几条线索都指向同一层:AISAP 把 AI 超声搬进以色列 Sheba 医院的内科和急诊,让没受过超声训练的医生五分钟内完成扫查、超三成病例因此改变了处置,被 WHO 报告收录为真实落地案例——值钱的不是模型,是『在这个科室、这个流程里真的改变了医疗决策』。Forward Deployed Engineer 这个岗位在 OpenAI、AWS、Anthropic 一起抢人(OpenAI 甚至专门成立部署公司、收购 Tomoro 带进约 150 名 FDE),本质是同一件事:模型能力和企业业务之间那道『最后一公里』,正在成为最稀缺、最贵的技能。Agent Skills 生态爆发(各家 marketplace 已经数以千计的技能)则是把这件事产品化——把某个领域的专长,打包成 agent 能反复调用的可复制模块。而最接地气的那条,是失败支付催缴(dunning)这种小工具:Stripe 每月有 5–9% 的扣款会失败、悄悄流失,一个自动发三封催缴邮件的小 SaaS 就能帮商家挽回两三成,70–90% 毛利——它不卖 AI,卖的是『帮你把本该到账的钱追回来』这个结果。
所以如果你在找方向:别再纠结『该用哪个最强模型』,那层正在饱和、正在变便宜、每周洗牌。把注意力放到交付那一段——选一个具体的行业或人群,把你对这个场景的理解,用 skills、用 agent、用一个小工具或一次贴身交付,变成对方能立刻感知到的结果(多约到几个客户、少漏几张单、五分钟出一次诊断、把失败扣款追回来)。今天最该记住的一句话:当能力变成原材料,稀缺的是『你比别人更懂怎么把它交付成某个人愿意为之付钱的结果』。
AISAP 的 AI 超声被 WHO 收录为落地案例:没受过超声训练的医生五分钟出诊,超三成病例改变处置
展开详情
- **门槛被抹平**:没受过超声训练的普通医生,靠 AI 引导也能在 5 分钟内完成心脏超声扫查——把一项原本需要专门训练的技能,变成一线医生随手可用的工具
- **有硬结果不是 demo**:前瞻性研究里超过 30% 的病例因这次扫查改变了治疗/提前出院/转诊,660 名患者的真实临床数据,而非厂商 PR 口径
- **已进日常流程**:截至 2025 Q2 已累计 3000+ 次扫查、覆盖 6 个科室加急诊、150 名医生常态化使用,并被 WHO 报告作为全球落地范例收录
Forward Deployed Engineer 成 2026 最抢手的 AI 岗位:OpenAI 专门成立部署公司、收购 Tomoro 带进约 150 名 FDE
展开详情
- **大厂集体下注**:OpenAI 成立部署公司(超 $40 亿、19 家机构)并收购 Tomoro 带进约 150 名 FDE;AWS 推 Partner-Led FDE、目标『几天而非几个月』交付生产级 agent
- **痛点是落地不是模型**:约 95% 的生成式 AI 项目失败于『部署后价值落差/工作流不对齐』,而非模型能力——这正是 FDE 存在的理由
- **岗位在爆发**:KORE1 的 2026 招聘报告把 forward-deployed engineering 列为企业 AI 里增长最快的三个技术岗位之一,焦点从『卖模型访问权』转向『交付可衡量的业务结果』
顶级编码模型已在 SWE-bench Verified 饱和:Opus 4.8 / GPT-5.5 / Gemini 3.1 Pro 该怎么选
展开详情
- **对比·SWE-bench Verified(已饱和)**:GPT-5.5 88.7 vs Claude Opus 4.8 88.6 vs Gemini 3.1 Pro 80.6——前两名差距在噪声内、几乎并列
- **对比·SWE-bench Pro(更难、更能分高下)**:Claude Opus 4.8 69.2 vs GPT-5.5 58.6 vs Gemini 3.1 Pro 54.2,Claude 在最棘手的多文件工程任务上领先约 10 个点
- **方法论**:Verified 与 Pro 有 20–25 分的落差,反映的是『对基准的熟悉度』而非真实能力;用 Verified 筛前沿级、用 Pro 排座次,才不会被饱和的分数误导
Anthropic 工程博客:给 agent 装上 Agent Skills,让一个通用 agent 靠『技能库』胜过一堆专用 agent
展开详情
- **一个通用 agent + 技能库 > 一堆专用 agent**:Skill 是装着指令/资源/脚本的文件夹,agent 按需动态加载,用『可复用套路』替代『为每个用例造一个 agent』
- **生态已成规模**:多个 marketplace 合计数以千计技能,覆盖编程/营销/产品/合规/研究/运营;claude-skills 等仓库单个就收录 337 技能、30+ agent、70+ 命令,且跨 Codex/Gemini CLI/Cursor 兼容
- **开放规范可迁移**:Skills 沿用了 Anthropic 开源 MCP 的打法,是开放 spec 而非私有格式——你写的技能不被单一产品锁死,能在多个 agent 之间复用
SENTINEL: Failure-Driven Reinforcement Learning for Training Tool-Using Language Model Agents
展开详情
- **把失败当燃料**:不靠海量成功示范、也不只靠稀疏最终奖励,而是把 agent 搞砸的轨迹(调错 API、传错参、流程走乱)系统性转化为训练信号
- **面向工具型 agent**:专门解决『会调用工具的 agent 怎么更省数据地学会正确用工具与多步编排』,对应当下 agent 真正开始接管业务的场景
- **更皮实更省数据**:目标是在更少训练数据下得到更稳、更抗错的工具调用能力,指向 agent 可靠性这个正在升温的工程方向
diegosouzapw/OmniRoute
展开详情
OmniRoute 解决的痛点是:现在能用的编码 agent 和 LLM 应用越来越多,但每家模型的接入方式、价格、限流、稳定性都不一样,切换和兜底很麻烦,token 成本也难控。它的答案是做一个免费的 AI 网关——一个统一端点接入 231+ 家提供商(其中 50+ 家免费),把 Claude Code、Codex、Cursor、Cline、Copilot 等 20 多个编码 agent 一键接到免费的 Claude/GPT/Gemini 上;再叠加 RTK+Caveman 压缩(号称省 15–95% token)、智能自动兜底、MCP/A2A、多模态 API,以及 Desktop/PWA 客户端。本质是把『你用哪个模型、往哪家路由、怎么省钱、怎么兜底』这层控制权,从各家黑箱里抽出来交给你自己。
周增长:近期在开源 AI 网关这一品类里增长较快,具体周增以 GitHub Trending / star-history 实时为准
- **一个端点接 231+ 提供商**:统一 OpenAI 兼容端点、50+ 家免费,把 Claude Code/Codex/Cursor/Cline/Copilot 等 20 多个 agent 一键接到便宜或免费的模型上
- **省钱与兜底**:RTK+Caveman 压缩号称省 15–95% token,叠加智能自动兜底、限流、缓存、可观测性,把成本和稳定性握在自己手里
- **不被单一厂商锁死**:多模态 API、MCP/A2A、Desktop/PWA 客户端,路由策略自己定——正是能力饱和后最该握住的『组合与控制』层
失败支付催缴挽回(dunning recovery)micro-SaaS:帮商家追回悄悄流失的失败扣款
展开详情
- **隐形的钱最好追**:任意时刻约 5–9% 的 Stripe 扣款失败、藏在『正常流失』里没人看见,一个损失 $1000/月的商家,$50–100/月的工具帮他追回两三成就明显划算
- **技术极轻、可复制**:核心就是监听 invoice.payment_failed + 一条 Day1/3/7 催缴邮件序列,扣款成功即停,单人几周可做出 MVP
- **商业模型好**:定价 $49–99/月、毛利 70–90%,收入与客户营收挂钩(挽回越多你赚越多),willingness-to-pay 明确、天然续费
Armin Ronacher
工具必须被设计成能扛住一只『把它彻底用错』的 LLM 混乱猴子(LLM chaos monkey)。