Hall of Fame
今日趋势综述
今天的信号:当模型不再是变量,外围工程和判断力才是
把今天几条放一起看,会发现它们在合力宣布一件事:模型这个变量正在贬值。SWE-bench Verified 已经被刷到 95% 以上、头部几家挤在一两个百分点里,OpenAI 干脆停报 Verified、改推更难的 Pro——一个基准一旦人人满分,它就不再能区分谁强;与此同时开放权重的 Kimi K3、DeepSeek V4、Inkling 把和闭源旗舰的差距压到大约『一代以内』,最强模型不再稀缺。当所有人手里的模型都差不多强、还越来越便宜,光靠『我接了哪个模型』已经拉不开差距了。
差距去哪了?去了模型外面那一圈工程。codebase-memory-mcp 把整个代码库压成一张知识图谱,让编码 agent 用 3400 token 就看清本来要烧 41 万 token 才能理清的结构;Aura 把 AI 写的代码按 AST 逐函数追踪、拿产出和你的原始意图对账,逼它证明任务真做完了才让你提交。它们不造更强的模型,而是给已经足够强的模型装上『看得懂仓库』和『交付可验证』这两样外设——这正是 2026 年最扎实、也最不容易被下一个模型发布抹平的护城河。
落到人身上,答案更直白。TD 银行把房贷审批从平均 15 小时压到 3 分钟以内,靠的不是买了最强模型,而是把 agent 嵌进真实的审贷流程;FDE 成了年薪冲到七十万美元的抢手岗,因为企业 AI 试点 95% 死在『落地』而非『模型不行』。Mollick 说得最透:提示词技巧的时代过去了,现在该练的是把需求写成规格、给 agent 定目标和验收标准、像管一个能干但只会照字面执行的员工那样管它。别再纠结用哪个模型了——去练把能力装起来、落进业务、并指挥它交付出可验证结果的那套本事。
Aura:Agents + Git + Intent(开源 AI 编码 IDE)
展开详情
它解决的痛点是:AI 帮你写了一大堆代码,但你很难确认它到底有没有真把任务做完、改动是否偏离了你最初的意图——传统 Git 只按『文本行』记差异,AI 大改一片时你根本看不清逻辑上发生了什么。Aura 是一个 Git 原生、面向 AI 编码 agent 的 IDE:它把 agent 拆成 Planner(研究+写规格)和 Worker(执行),带仓库感知的上下文(语言感知的代码智能、本地 BM25 搜索、依赖上下文),最关键的是它对代码的 AST 做哈希、按函数和类级别追踪改动,再拿产出和你的『原始意图』对账,能在你提交前证明这个任务是不是真的完成了。
- **按 AST 追踪、不是按行**:哈希抽象语法树而非文本行,逐函数/类级别追踪 AI 改动,给 AI 生成的代码提供逻辑级可溯源,AI 大改一片也看得清到底动了什么
- **Planner/Worker 分工**:Planner 负责研究和写规格、Worker 负责执行,配合仓库感知上下文(语言感知代码智能 + 本地 BM25 搜索 + 依赖上下文),先规划后动手
- **自举造出来**:5–6 月用同一套 harness 循环处理 20+ 亿 DeepSeek token、近 3 万次 API 请求,把自身代码库写了出来——本身就是『指挥 agent 交付』的活样本
TD 银行把房贷审批从 15 小时压到 3 分钟:不是买了最强模型,是把 agent 嵌进了审贷流程
展开详情
- **15 小时 → 3 分钟**:房贷/HELOC 审贷备忘生成从平均 15 小时压到平均不到 3 分钟,约降 99.7%,且宣称结果更准、风险与单件成本同步下降
- **做的是脏活不是炫技**:agent 负责文件分类、信息抽取、收入计算与核验、同意检查、政策比对、矛盾排查,最后产出给人类核保员的摘要——人仍在最终决策位
- **自建团队落地**:由 TD 旗下 Layer 6 AI 实验室联合科技/数据/地产信贷/风控多团队共建,2026-05-21 正式发布,是银行业首批面向房贷全流程的 agentic AI
SWE-bench Verified 被刷穿到 95%+、连 OpenAI 都弃榜转投 Pro:编码榜单还能信吗,该看什么
展开详情
- **对比**:SWE-bench Verified(2026-07)GPT-5.6 Sol 96.2% vs Claude Mythos 5 95.5% vs Claude Fable 5 95.0% vs Kimi K3 93.4% vs Claude Opus 4.8 88.6%——前四名挤在 1 个百分点带里,榜单已基本分不出高下
- **OpenAI 自己弃榜**:OpenAI 停报 SWE-bench Verified、改推更难的 SWE-bench Pro,公开理由是训练集数据泄漏让 Verified 分数越来越不可信
- **饱和≠等价**:分数贴脸不代表体验相同,真实差距转移到了成本/延迟、长程任务稳定性、工具调用与代码库理解上——这些恰恰是单一 Verified 分数量不出来的
更新:FDE『1500 人调查』给出实测画像——一半时间在客户现场,落地卡在人不在模型
展开详情
- **47/31/22 的时间账**:FDE 每周中位 47% 时间面向客户(访谈/驻场/设计评审)、31% 写交付代码、22% 内部协调——一半时间在把模型翻译成业务,不是纯写码岗
- **需求爆炸**:FDE 岗位一年暴涨 729%,Salesforce 公开承诺招 1000 名、EY 4 月起设专岗,Palantir/Databricks/Ramp/Rippling 都在建 FDE 团队
- **钱在落地不在模型**:前沿实验室资深 FDE 中位总包约 48.5 万美元、staff 级过 72.5 万;企业 AI 试点约 95% 失败于『部署断裂』而非模型不行
Agora: Enhancing LLM Agent Reasoning Via Auction-Based Task Allocation
展开详情
- **拍卖式派活**:把子任务当拍卖品,各 agent 按『校准能力 − 成本』出价竞标,系统据此把每段活派给性价比最高的专家,而非固定路由
- **零训练、黑盒友好**:不需要端到端训练、也不需窥探闭源 agent 内部,直接编排一堆现成的专家模型与工具,落地门槛低
- **编排 > 单体**:核心思路是让多个专才协作胜过一个通才独干,把重心从『模型多聪明』移到『任务怎么分配、成本怎么算』的调度工程
2026 年 7 月开放权重大爆发:Kimi K3、DeepSeek V4、Inkling 把和闭源旗舰的差距压到约『一代以内』
展开详情
- **对比**:Artificial Analysis 独立榜上 Kimi K3 已略超 Claude Opus 4.8,拿下 Frontend Code Arena 第 1、AA 智能指数总榜第 3;DeepSeek V4.5、GLM-5.2、Inkling 在推理与编码上与闭源旗舰互有胜负
- **两周五连发**:Kimi K3(2.8T,7/16)、Thinking Machines 的 Inkling(Apache 2.0)、DeepSeek V4(7 月中)、Mistral 新稀疏 MoE、MiniMax M3 Pro(2.7T)密集落地
- **差距只剩一代**:开放 vs 闭源的能力差从『好几代』收窄到约『一代以内』,最强一档能力不再被少数闭源厂商垄断
Ethan Mollick
别再把大模型当成一本咒语书、指望靠某句提示词技巧点石成金了。该把它当成一个能干、但只会照字面执行的员工来管——给它清楚的目标、定义好要什么产出、立下质量标准、配上验收测试。提示词技巧的时代结束了,规格纪律的时代开始了。我们正从『外行用聊天机器人补短板』,走向『专家用 agent 把活干完』。
今日趋势综述
今天的信号:从『用哪个模型』转向『怎么把能力装起来』
把今天这几条放在一起看,会发现它们其实在讲同一件事的不同侧面。VoltAgent 的 skills 库冲到 28.5k 星、里面 1400 多个技能来自 Anthropic、Stripe、Vercel 这些一线团队;腾讯的 Agent Memory 用四层记忆把 token 砍掉六成、把角色记忆准确率从 48% 提到 76%;Desktop Commander 让 Claude 真能跑你的终端、改你的文件。它们都不是在造更强的模型,而是在给已经足够强的模型『装外设』——技能、记忆、手脚。当模型本身人人可得,差距就出现在这些外围能力的工程上。
Karpathy 把这层意思说得最直白:意图规范和任务分解,才是新的编程;现在真正在练的技能是判断力——判断什么该交给 agent、怎么把需求讲清楚、怎么快速审查它的产出。HAS-Bench 用实验佐证了同一点:人参与进来确实能显著提升 agent 的完成率和纠错能力,但收益取决于你『在什么时候、以什么方式、以什么身份』介入。换句话说,人的价值没消失,只是从『自己动手写』挪到了『会指挥、会验收』。
落到挣钱和职业上更是如此。物流行业 AI 的 ROI 早被 UPS、亚马逊证明过,但 2026 年真正卡住落地的是『会用的人不够』,高级 AI 供应链岗位需求两年涨了近四倍;一个独立开发者靠把 AI 编排绑死在代理商的获客、外联、运营流程上,4 周做到 3k 刀月收入——不是因为模型强,而是因为他把能力交付成了客户账上能看到的结果。今天该记住的方向只有一句:别再纠结用哪个模型,去练把能力装起来、指挥它、并交付出可验证结果的能力。
VoltAgent/awesome-agent-skills
展开详情
它解决的痛点是:agent skills 这半年爆炸式增长,但市面上大量 skills 是 AI 批量生成的『水货』,质量参差、装了也不好用,开发者很难挑到真正能用的。这个仓库的答案是只收『真团队真在用』的官方技能——来自 Anthropic、Google Labs、Vercel、Stripe、Cloudflare、Netlify、Microsoft、Hugging Face、Figma 等一线工程团队,外加社区精选,目前 1497+ 个技能,明确标注跨工具兼容:Claude Code、Codex、Gemini CLI、Cursor、GitHub Copilot、OpenCode、Windsurf 等。一个技能就是一个带 SKILL.md 的文件夹,写一次到处能用。
周增长:近期在 agent skills 生态里增长很快,具体周增以 GitHub Trending / star-history 实时为准
- **只收真货**:明确拒绝 AI 批量生成的水技能,收录标准是『一线工程团队真实在用』,官方来源含 Anthropic、Google Labs、Vercel、Stripe、Cloudflare、Netlify、Microsoft、Hugging Face、Figma 等
- **一次写好、到处能用**:1497+ 技能标注跨工具兼容 Claude Code / Codex / Gemini CLI / Cursor / GitHub Copilot / OpenCode / Windsurf,skill 就是一个带 SKILL.md 的文件夹
- **规模与势头**:约 2.85 万星、3.1k fork、423 次提交,是当前 agent skills 生态里最受关注的精选库之一
TencentDB-Agent-Memory
展开详情
它解决的痛点是:agent 跑长任务时上下文越滚越长、token 越烧越多,而粗暴压缩又会丢掉关键细节、导致失忆或答非所问。腾讯云数据库团队的答案是一套完全本地、零外部 API 依赖的分层记忆系统:短期记忆分三层(底层存原始工具输出、中层抽步骤摘要、顶层压成一张轻量 Mermaid 画布),长期记忆搭一座语义金字塔(L0 原始对话 → L1 原子事实 → L2 场景块 → L3 用户画像)。关键是它保证『无损可回溯』——任何高层抽象都能确定性地钻取回底层原文证据,不会像普通压缩那样把信息压没。MIT 开源。
周增长:7 月 8 日冲上 GitHub Trending 第 1,近期增长强劲,具体周增以实时榜为准
- **分层记忆不丢细节**:短期三层(原始输出→步骤摘要→Mermaid 画布)、长期四层金字塔(对话→原子事实→场景→用户画像),高层抽象可确定性钻取回底层原文,避免普通压缩的『压没了』
- **数字实打实**:接入 agent 框架后 token 用量最多降 61.38%、任务通过率相对提升 51.52%、PersonaMem 准确率 48%→76%
- **完全本地 + 开源**:零外部 API 依赖、可离线跑,MIT 许可——记忆数据不出本机,适合对隐私和成本敏感的场景
wonderwhy-er/DesktopCommanderMCP
展开详情
它解决的痛点是:Claude 这类模型很会写代码,但默认它只能『说』不能『做』——不能真的跑你的构建、搜你的代码库、改你的文件、盯一个长时间运行的进程。Desktop Commander 是一个 MCP 服务器,把 Claude 接到你本机的终端和文件系统上:搜索/更新/管理文件、执行终端命令、管理长期进程、支持 Excel/PDF/DOCX,还能带搜索替换的代码编辑。等于把一个聊天里的模型变成一个真能在你机器上干活的开发环境。
周增长:持续活跃,最新版 v0.2.44(7 月 9 日),近期增长稳定
- **给模型装手脚**:通过 MCP 让 Claude 真能执行终端命令、搜索和编辑文件、管理长时间运行的进程,实时看到结果,而不只是给你贴一段代码
- **办公文件也能碰**:内置对 Excel / PDF / DOCX 的支持和带搜索替换的代码编辑,覆盖的不只是写代码,也包括日常文档处理
- **活跃在更新**:37 个 release、最新 v0.2.44(7 月 9 日)、550 次提交,还在推出 Desktop Commander App(Beta)
HAS-Bench: Evaluating LLM-Based Human-Agent Systems under Configurable Human Participation
展开详情
- **把人当一等参与者**:用图结构框架给人和 agent 都定义角色、权限、通信路径、行动权,而不是把人简化成『派任务的甲方』
- **测的是过程不只是结果**:除了任务完成率,还量化澄清质量、反馈利用、控制校准、安全、主动性、交互成本等协作行为
- **结论**:跨六个领域,人参与能显著提升完成率和失败恢复,但收益取决于『何时、如何、由谁』介入——盲目多插手未必更好
AI 在物流业的 2026 现实检查:ROI 早被验证,真正卡住落地的是『会用的人不够』
展开详情
- **ROI 早被证明**:UPS ORION 每年省约 1 亿英里、约 4 亿美元;亚马逊 75 万+ 机器人 + AI 需求预测支撑当日/次日达;早期自主供应链项目交付周期缩短约 27%、人效提升约 25%
- **市场在猛涨**:全球供应链 AI 市场 2026 约 198 亿美元,较 2022 年的 65 亿约 45% 年复合增速
- **瓶颈换位**:真正的约束不再是模型或预算,而是技能缺口——高级 AI 供应链岗位需求较 2023 年涨约 387%
一个人 4 周把 AI 编排平台做到 $3k MRR:不做通用工具,绑死代理商的获客与运营流程
展开详情
- **不做通用工具,绑营收流程**:产品直接嵌进代理商/GTM 团队的获客、外联、运营环节,替代具体人工,而不是又一个泛泛的『AI 助手』
- **速度即优势**:靠 AI 把开发和运营环节自动化,一个人 4 周从 0 到约 3k 美元月收入
- **打法可复制**:同期一批 solo 创始人用『垂直 + 绑客户营收流程』的同款思路,半年做到 2 万–6 万美元月收入
Andrej Karpathy
意图规范和任务分解,才是新的编程。现在真正在练的技能是判断力——判断什么该交给 agent、怎么把需求讲清楚、怎么快速审查它的产出。我自己写代码和交给 agent 的比例,已经从 80:20 反转成了 20:80。
Wispr Flow
展开详情
- **说话即输入,无处不在**:在几乎所有 App 里把语音按你的风格转成文字,带自动纠错、命令模式、100+ 语言,把『打字』这个高频动作直接换成『说』
- **增长数字扎眼**:洽谈中估值近 20 亿美元、半年近乎翻三倍;270 家世界 500 强在用(英伟达、亚马逊等);6 月起月环比 +40%、用户同比约 100 倍、12 月留存约 70%
- **赢在体验而非模型**:语音转写模型早已不稀缺,它的护城河是把准确率、延迟、跨应用顺手度和留存打磨到企业愿意付费
今日趋势综述
今天的信号:没有『最强模型』了,只有『这个任务用哪个』——值钱的是选型、集成与分发
把今天几件事连起来,一个和昨天一脉相承、但今天更清晰的判断浮出来了:前沿模型的能力不但在饱和,还在按任务类型『碎片化』——不再有一个全场最优的模型,只有『这个场景该用哪个』。Claude Fable 5 今天(7 月 20 日)开始向 Max/Team 用户放量,可它和一周前发布的 GPT-5.6 Sol 谁强?答案取决于你干什么:在最硬的真实仓库补丁任务 SWE-bench Pro 上,Fable 5 约 80 分明显甩开 GPT-5.6 Sol 的约 64.6(连上一代 Opus 4.8 的约 69.2 都更高);但在终端命令类的 Terminal-Bench 2.1 和长程 Agents' Last Exam 上,反而是又快又便宜(单价只有 Fable 一半)的 GPT-5.6 Sol 领先十几个点。『谁最强』这个问题本身正在失效,取而代之的是『会不会按任务挑模型、按预算配路由』这门手艺。
当能力变成这样一种按任务分布、还越来越便宜的原材料,价值就继续往交付那一层沉。今天四条线都指向同一件事:Skills 从『某家产品的功能』变成了『跨厂商的共享基础设施』——一个为 Claude Code 写的 SKILL.md,如今能不改一行在 Cursor、Copilot、Codex、Gemini CLI 上跑,微软和 OpenAI 在标准发布 48 小时内就接了,agentskills.io 上已有约 40 个兼容产品,你打包一次专长就能到处复用;开源安全 agent Strix 拿了 3.6 万星,靠的不是『我接了最强模型』,而是『每个漏洞都用真实 PoC 证给你看』这个能被验证的结果;给编码 agent 加一层本地优先、事件溯源的记忆与判断层(PROJECTMEM),解决的是『怎么让 agent 记住上下文、少犯重复错误』这种可靠性问题;而在把 AI 变成现金流那头,一个人管 11 个客户、月工具成本仅约 380 美元、按『交付结果』每客户收 2000–4500 美元的经济账已经跑通,真正的坎不再是做不做得出来,而是分发——你能不能持续找到愿意付钱的人。
所以如果你在找方向:别再执着于『追最新最强的那个模型』,那层每周都在洗牌、还在变便宜。把功夫下到四件更耐用的事上——第一,练『按任务选型 + 按预算配路由』,同一件活知道什么时候用贵的、什么时候用便宜的;第二,把你的专长写成可跨工具复用的 skill,一次打包到处能用;第三,盯着『可靠、可验证的结果』做东西(自证的漏洞、记得住的 agent、算得清的挽回),而不是漂亮的 demo;第四,也是最容易被忽略的——把分发当成第一天的事,工具已经不稀缺,稀缺的是能持续把它送到愿意付钱的人面前。当模型能力人人可得,你比别人多赚的那部分,全在『选得准、拼得稳、卖得出去』这几个字里。
Claude Fable 5 今天上线 Max/Team:和 GPT-5.6 Sol 到底谁强?答案取决于你干哪种活
展开详情
- **对比·SWE-bench Pro(真实仓库补丁)**:Claude Fable 5 约 80.0 vs GPT-5.6 Sol 约 64.6 vs 上一代 Opus 4.8 约 69.2——最硬的工程任务 Fable 5 明显领先
- **对比·终端/长程(Sol 反超)**:Terminal-Bench 2.1 Sol 88.8 vs Fable 5 83.4;Agents' Last Exam Sol 53.6,比 Fable 高约 13 分——短平快的终端活 Sol 又快又强
- **对比·价格**:Fable 5 约 \$10/\$50 vs GPT-5.6 Sol 约 \$5/\$30(每百万 token),Sol 约为一半——省钱场景 Sol,正确性优先场景 Fable
法律 AI 遍地都是,但只有 7% 的法务团队真把它用成了——差距不在模型,在执行
展开详情
- **遍地在用 ≠ 用成了**:约 7% 的法务团队真正走完试点、用起来并能衡量成效;约 83% 说不清去年 AI 花费有没有回本——瓶颈是执行不是模型
- **用成的收益很硬**:Rupp Pfalzgraf 86% 律师日用、复杂联邦动议起草缩到约 1/4 时间;合同起草到定稿压到 30 分钟、成本降约 90%;e-discovery 省 40–50%
- **行业平均值**:62% 的法律从业者每周省下 6–20% 工时、一年约 240 小时——省下的时间从例行事务转向更高价值的策略工作
Agent Skills 已从『某家产品的功能』变成跨厂商的开放基础设施:一次写好,Claude/Cursor/Copilot/Codex 通用
展开详情
- **从功能变标准**:2025-12-18 Anthropic 开源 Agent Skills 规范于 agentskills.io,微软与 OpenAI 约 48 小时内接入——这是它从『产品卖点』变成『共享基础设施』的分水岭
- **一次写好到处能跑**:为 Claude Code 写的 SKILL.md 可不改一行在 Cursor/Copilot/Codex/Gemini CLI 上运行;到 2026-06 官方展示页约 40 个兼容产品
- **格式极简、门槛极低**:一个 Skill 就是一个文件夹,最少只需一个 SKILL.md(YAML 头 + Markdown 指令)——不写代码也能把专长打包成可复用模块
PROJECTMEM: A Local-First, Event-Sourced Memory and Judgment Layer for AI Coding Agents
展开详情
- **给编码 agent 装长期记忆**:用事件溯源把项目里的改动、判断、踩坑持久化下来,让 agent 跨会话记住上下文,别每次从零开始、反复犯同样的错
- **本地优先、数据可控**:记忆留在本地而非上传云端,对把代码库当核心资产的团队/个人,隐私与可控性直接决定敢不敢上生产
- **面向可靠性而非能力**:目标不是让 agent 更聪明,而是更皮实、能长期协作——正是 agent 真正接管编码后最该补的一层
『按结果收费』的一人 AI 服务:一个人管 11 个客户、月工具成本约 380 美元,真正的坎是分发不是搭建
展开详情
- **卖结果不卖工具**:不收 \$49/月订阅,按交付结果(文章/落地页/广告素材/线索跟进)每客户收 \$2,000–4,500/月,愿付价对标一个兼职员工而非一个软件
- **经济账极端漂亮**:单人同时管 11 个客户、月工具成本仅约 \$380,毛利 90%+——AI 把交付成本压到近乎为零,规模瓶颈从『产能』变成『获客』
- **真正的坎是分发**:2026 年工具已不稀缺、复制门槛极低,能否持续找到并说服愿为结果付钱的客户,才是决定你到不到得了 \$5–10k MRR 的分水岭
Ethan Mollick
要用好 AI,你得学会分开看三层:模型(models)、应用(apps)和脚手架(harnesses)。脚手架是那套让 AI 能自己调用工具、采取行动、独立走完多步任务的系统——就像马具把马的蛮力变成能拉车耕地的实际产出,是脚手架让模型的能力真正变成干成的活。