Hall of Fame
今日趋势综述
今天的信号:AI 的价值正从'会生成'转向'管得住、落得下'
今天霸榜的几乎全是'驯服 agent'的工具,而不是又一个更强的模型。Addy Osmani(Google Chrome 资深工程师)的 agent-skills 冲到约 7.7 万星,把资深工程师的纪律(定义→计划→构建→验证→评审→交付)编码成技能让 agent 照做;herdr 两万星,做成'agent 版 tmux',一屏盯住十几个在跑的编码 agent 谁在干活、谁卡住;arXiv 的 IAL-SCAN 首次系统定义并检测'无限 agent 循环'这个会半夜烧光你 API 预算的失败模式(6549 个仓库里确认 68 处、精度 91.9%);前 GitHub CEO Nat Friedman 的 Entire 则赌'谁写的、为什么这么写'的可审计性,而不是生成本身,才是下一个开发者平台。它们指向同一句话:生成这件事正在被解决,真正稀缺的是'管住它'。
钱也在往同一个方向走。微软砸 25 亿美元、6000 名工程师成立'前沿公司',AWS 投 10 亿,OpenAI 完成第二笔部署收购(Northslope)——都在抢'把 AI 落地进企业'的最后一公里,背后是 MIT 那个扎心数字:95% 的企业生成式 AI 试点对利润零贡献,卡点不在模型强不强,而在落不落得下去。Aviva 给出了配方:不是买一个最强大模型,而是 80 个小模型 + 4 万小时员工再培训,换来投诉降 65%、年省 £60M。连评测的记分牌本身都变了——Artificial Analysis 把智能指数 v4.1 整个重构成以 agent 长程任务为主。而 colibri 那种'744B 塞进 25GB 内存的笔记本'虽惊艳,实测冷启动只有 0.05 token/秒、答 100 字要十几分钟,恰恰提醒你:'能跑'不等于'能用'。
对普通人,今年真正该练、也最不容易被下一个模型抹平的能力,不是'会用哪个 AI 工具',而是'能可靠地编排、监督、验证并交付 AI'。具体点:学会同时管一群 agent(herdr 这类),把自己的判断沉淀成 skills 而不是每次重新写 prompt(agent-skills),给成本和循环上护栏(别被无限循环烧钱),审计 agent 到底交付了什么,以及——收入最高的那一档——成为那个能把 AI 真正落地进一门乱糟糟真实生意的人(FDE,$220K–600K)。就连今天的现金流机会也是'监督一个记账 agent,而不是自己录票据'(Receiptor)。生成越来越便宜,判断、监督和最后一公里交付,才是价值和钱正在流向的地方。
ogulcancelik/herdr
展开详情
herdr 是一个'专为 AI 编码 agent 打造的终端多路复用器'——你可以把它理解成'agent 版 tmux'。用过 tmux 会立刻上手,区别在于它会自动感知每个 agent 的状态:正在工作、被卡住、已完成、还是空闲,在侧栏一屏展示,不用装 hook 或插件就能识别 16+ 款编码 agent(Claude Code、Codex、Devin CLI 等)。它还提供一个 socket API,让 agent 之间可以互相 spawn、监控。作者是土耳其独立开发者 Oğuz Çelik,整个东西打包成一个约 10MB 的 Rust 二进制、零依赖,跑在你现有的任何终端里。
周增长:6 月 30 日登顶 GitHub Trending 第一,从 6 月底约 1.2 万星涨到本周约 1.96 万,单人开发
- **agent 版 tmux**:像 tmux 一样管理多路会话,但额外自动标注每个 agent 的工作/卡住/完成/空闲状态,一屏盯住一群 agent
- **零配置感知 16+ agent**:无需 hook 或插件即可识别 Claude Code、Codex、Devin CLI 等 16 款以上编码 agent 的实时状态
- **单文件、零依赖**:约 10MB 的 Rust 二进制、非 Electron,跑在你现有终端里;6 月 30 日登顶 Trending、单人开发做到约 1.96 万星
When Agents Do Not Stop: Uncovering Infinite Agentic Loops in LLM Agents
展开详情
- **烧钱的隐形失败**:IAL 会把一次请求放大成通宵狂跑,直接后果是 API 预算被耗尽、模型被 DoS、上下文爆炸——这正是很多人半夜账单暴涨的元凶
- **规模化实证**:在 6,549 个真实 agent 仓库上扫描,确认 68 处真实无限循环、覆盖 47 个项目,检测精度 91.9%,说明这不是个别 bug 而是普遍隐患
- **给出可用工具**:IAL-SCAN 把异构 agent 代码抽象成框架无关的中间表示、建'agentic 循环依赖图'来找出无界反馈路径,是可落地的护栏起点
Entire:前 GitHub CEO Nat Friedman 的 git 原生 AI agent 平台,本周开放 Git 网络预览、开源 Checkpoints
展开详情
- **押注可审计而非生成**:Checkpoints 把每段 agent 代码与产生它的 prompt / 会话上下文自动配对留痕,解决'这段 AI 代码谁写的、为什么'的信任问题
- **git 原生的 agent 平台**:设想用 git 兼容数据库统一 AI 产出、加语义层让多 agent 协作,把 git 从'人协作'扩展到'人-agent 协作'
- **重量级背书**:前 GitHub CEO 操刀,$60M 种子轮、约 $300M 估值(Felicis 领投,Jerry Yang / Garry Tan 等参投),本周开放 Git 网络预览
云厂商把 FDE 工业化:微软 $2.5B『前沿公司』、AWS $1B、OpenAI 二次收购,抢的都是'把 AI 落进企业'的最后一公里
展开详情
- **三家同时下重注**:微软 $2.5B / 6000 人'前沿公司'、AWS 约 $1B FDE 团队、OpenAI 二次收购(Northslope)扩到数百 FDE——最后一公里被工业化
- **驱动力是 95% 失败率**:MIT Project NANDA 发现 95% 企业 GenAI 试点零 P&L 回报,价值明显从'训练模型'迁移到'把模型落进乱糟糟的真实业务'
- **薪资锚点清晰**:OpenAI FDE 中级约 $220K–280K(旧金山),大盘中级总包约 $300K–450K、staff/principal $600K+,是本季度正在被大量创造的岗位
评测风向变了:Artificial Analysis 把智能指数 v4.1 重构成'以 agent 为主',同一榜单三大模型这样排
展开详情
- **对比(GDPval-AA v2 ELO,人类基准=1000,指数中权重最高的评测)**:Claude Fable 5(含 fallback)1818 vs Claude Opus 4.8 1638 vs GPT-5.5(xhigh)1531——注意 Fable 5 目前尚未开放使用
- **记分牌重心转向 agent**:新权重 Agents 34% / Coding 24% / Scientific 24% / General 18%,回合上限 100→250,专门奖励长程 agentic 能力
- **淘汰饱和基准**:Terminal-Bench 升 2.1、τ²-Telecom 换 τ³-Banking,IFBench 因刷满被移除——评测在主动'换更难的尺子'
Aviva 用 80 个 AI 模型重做车险理赔:复杂案定责少 23 天、投诉降 65%、年省 £60M——赢在'小模型群 + 4 万小时再培训'
展开详情
- **硬数字**:复杂案定责少 23 天、分流准确率 +30%、投诉降 65%、NPS 涨超 7 倍、2024 单年省超 £60M(约 $82M)
- **赢在'小模型群'而非一个大模型**:80 个各司其职的专用模型串起理赔全流程,比押注一个最强大模型更稳、更可控
- **4 万小时再培训是分水岭**:不是自动化替人,而是把理赔员转去做需要人类判断的复杂案,员工敬业度翻倍——落地成败在人不在模型
JustVugg/colibri
展开详情
colibri 是一个纯 C、零依赖的迷你推理引擎,主打一件很炸的事:让 744B 参数的 MoE 大模型 GLM-5.2 跑在只有约 25GB 内存的消费级机器上。原理是'磁盘流式加载专家':MoE 每个 token 只激活约 40B 参数,它把稠密部分(注意力、共享专家、embedding,约 17B)以 int4 常驻内存(约 9.9GB),其余路由专家全放磁盘、按需流式读入。整个运行时就是一个约两千行的 C 文件,可自行编译、指向本地推理,是一次相当极客的工程炫技。
周增长:7 月 10 日发布,约两周涨到 1.8 万星;登上 Hacker News 首页(730+ 分、180+ 评论)
- **工程炫技**:纯 C、零依赖、约两千行单文件,用'磁盘流式加载专家'把 744B 的 GLM-5.2 跑在约 25GB 内存的消费级机器上
- **catch 很大**:实测冷启动仅 0.05–0.1 token/秒(每个冷 token 触发约 11GB 磁盘读),答 100 字要约 17–33 分钟,离日常可用很远
- **热度真实但要清醒**:两周约 1.8 万星、HN 首页 730+ 分,掌声里既有对 hacker 精神的欣赏,也有大量'这到底什么场景才划算'的追问
MCP 2026-07-28 发布候选版:史上最大改版,协议核心转向无状态,从'项目'长成'生产基础设施'
展开详情
- **核心转无状态**:协议元数据改放每个请求的 _meta 字段,去掉会话握手与粘性路由,可直接跑在普通负载均衡后面——为大规模生产部署铺路
- **从项目到基础设施**:据第三方统计 MCP 已有 1 万+ 公开服务器、SDK 月下载约 9700 万,OpenAI/Google/微软/AWS 全部接入,这次是它'长大成人'的一次改版
- **安全与扩展并进**:6 项授权增强对齐 OAuth 2.0/OIDC,新增可沙箱渲染 HTML 的 MCP Apps,扩展框架让能力独立演进;Roots/Sampling/Logging 启动弃用
Receiptor AI:把记账做成'你监督的 agent'——自动从邮箱抓票据、归类、同步 Xero/QuickBooks
展开详情
Receiptor AI 是一个专做'票据/凭证记账'的 AI agent:它自动从邮箱(及其他渠道)里把过去和现在的收据、发票全找出来,按上下文抽取数据、对照你的会计科目自动归类,再同步进 Xero / QuickBooks(也支持 Mercury、云存储、CSV 导出)。今年 7 月初上线的 Agent Mode 把它从'收据抓取器'升级成'一个你监督、而不是亲自做'的记账助手——数据录入和归类交给 agent,人只做复核。
- **监督而非动手**:agent 自动抓票据、按科目归类、同步 Xero/QuickBooks,你从'手工录凭证'变成'复核 + 对客户负责'
- **成本极低、按客户扩**:$29/月起、不限邮箱,14 天试用;给每个 SMB 客户建一套即可,工具成本几乎可忽略
- **真实需求信号**:上线 Product Hunt 的 Agent Mode 约 483 票、评价集中在'省下每月好几个小时',说明小微记账自动化有真实付费意愿
今日趋势综述
今天的信号:别盲信 AI 工具,学会验证它
今天最刺眼的一条,是 xAI 的编码 CLI Grok Build。一位安全研究者用抓包证明:它一边宣称『本地优先』,一边把你整个 Git 仓库(连提交历史里的密钥一起)打包上传到 xAI 的 Google Cloud 桶里——一个只需 192KB 就能完成的小任务,它传了 5.1GB,差了近 2.8 万倍。而那个大家以为是『数据开关』的『改进模型』选项,管的只是训练授权,根本拦不住代码外传。被曝光 72 小时后,xAI 才紧急开源、关闭默认留存、上线漏洞赏金。这不是个别厂商翻车,而是给所有人提了个醒:你往编码 agent 里塞的是公司最核心的源码,工具说什么不重要,它实际往哪发包才重要。
同一天,评测圈也在讲『别盲信数字』。SWE-bench Verified 被头部模型刷到 90%+ 后失去区分度,大家转看更难的 SWE-bench Pro——可同一个 Claude Opus,在 Scale 标准化公开集上是 51.9%,在厂商自报的聚合口径里却是 69.2%,换套脚手架能差十几个点。SkillsBench 更直接:4.7 万个公开 agent skills,平均质量只有 6.2/12,大多数是凑数的;但一套精挑的 skills 能把任务通过率从 33.9% 拉到 50.5%,医疗场景甚至暴涨 51.9 个百分点。数字不会自己说话,得看它怎么测出来的。
把这些串起来,普通人今年真正该练的能力,不是『会用哪个 AI 工具』,而是『会验证 AI 工具』:给编码 agent 上沙箱、抓它的网络出站、看它到底把代码发去哪;读评测先问是哪套基准哪个口径,别被一个漂亮百分比带走;用 skills、agent 前先验它在你的活儿上到底有没有效。会验证的人,才敢把真实业务交给 AI——这恰恰是 Khan Academy 在学校、独立开发者在小生意里真正跑通落地的分水岭。
xai-org/grok-build
展开详情
Grok Build 是 xAI 的终端原生 AI 编码 agent(就是 grok 命令背后那套),2026 年 5 月以 SuperGrok Heavy(每月 $300)内测起步,主打大代码库里的自主编码。它对标 Claude Code / Codex / opencode,含完整的 agent loop、读写代码的工具集、全屏可鼠标交互的 TUI,以及 skills / plugins / hooks / MCP 扩展体系。7 月 15 日 xAI 把它整个开源到 GitHub(Apache 2.0,Simon Willison 数了约 84 万行 Rust),号称可自行编译、指向本地推理、用 config.toml 完全本地运行。但它开源的真正导火索,是一桩安全事故——见下。
周增长:开源公告后一周内新增数千星,具体周增以 GitHub Trending / star-history 实时为准
- **2.8 万倍的数据外传**:12GB 测试仓被上传约 5.1GB,而任务本身只需约 192KB,抓包实锤『本地优先』宣称为假
- **隐私开关是摆设**:多数人以为『改进模型』能拦数据,实际它只管训练授权,代码照样离开你的机器进云桶——连提交历史里的密钥一并外传
- **开源是危机公关**:被曝光约 72 小时后才开源(84 万行 Rust / Apache 2.0)、关默认留存、上赏金;代码可审计,但已上传数据的删除承诺仍未经第三方核实
Verified 刷满之后看 SWE-bench Pro:同一个 Opus 三套分数,编码榜单该怎么读
展开详情
- **对比(同一基准 SWE-bench Pro · Scale 标准化公开集,2026-06-28)**:GPT-5.4 xHigh 59.1% vs Meta Muse Spark 55.0% vs Claude Opus 4.6 thinking 51.9%——头部只差个位数,且都远低于 Verified 的 90%+
- **同模型三套数**:Claude Opus 在 Scale 公开集 51.9% / 厂商聚合口径(llm-stats)Opus 4.8 达 69.2% / Scale 私有商用集另一版本约 47.1%,口径决定结论
- **Verified vs Pro 的落差**:从 Verified 的近乎满分掉到 Pro 的五六成,说明『真实工程任务』这道坎远没被跨过,别被饱和的旧榜误导
Your Agent's Memories Are Not Its Own: Forged Reasoning Attacks on LLM Agent Memory and Defenses
展开详情
- **新攻击面**:污染的是『推理理由(rationale)』而非事实,绕过大多数只查事实一致性的防线
- **放大效应**:被污染的推理被反复检索复用,一次投毒可持续影响后续多轮决策,越用越偏
- **攻防成对给出**:不止提出 FARMA,还给了初步检测/缓解方案,为记忆型 agent 的安全设计提供起点
首个 agent skills 基准 SkillsBench:4.7 万个公开技能,平均分只有 6.2/12
展开详情
- **质量真相**:4.7 万个公开 skills 平均仅 6.2/12,市场繁荣 ≠ 质量繁荣,随手抄一个装上大概率没用
- **对比(有无精选 skills)**:任务通过率 33.9% → 50.5%(+16.6pp);医疗 +51.9pp(34.2%→86.1%)vs 软件工程仅 +4.5pp——领域越专、增益越大
- **元技能缺口**:真正稀缺的是『评估和写好一个 skill』的能力,这正是当前 skills 生态最薄弱、也最值钱的一环
AI 进课堂的真实成绩单:用够时长才有效,Khanmigo 单独效果仍待验证
展开详情
- **用够才有效**:每周约 1 小时的学生末考数学高出对照组 0.44–0.47 个标准差(2026 RCT),核心变量是使用时长与老师督促,不是有没有 AI
- **规模已铺开**:Khanmigo 进入 1.5 万+ 学校、约 500 万用户,1.8× 更快的掌握率——但样本大不等于因果清晰
- **清醒的边界**:截至 2026 年 3 月,无同行评审研究单独证实 Khanmigo(AI 辅导层)提升成绩;别把『平台有效』直接当成『AI 有效』
六周做到 $10k MRR 的 AI 设计工具:一个人、零市场预算的可复制路径
展开详情
- **极致垂直**:不做通用设计工具,只死磕某一类具体设计需求,让潜在用户一眼觉得『这就是给我做的』
- **成本极低、可复制**:月运营成本约 $85–200,AI 承担开发/文档/客服/投放,一个人也能跑起一条产品线
- **自己掌渠道**:从第一天起就自己握住支付和获客,不把命脉外包,才有稳定现金流
buildpipe:给开发者的本地优先 AI 流水线(本地版 Zapier/n8n)
展开详情
- **本地优先**:pipeline 全在你自己机器上执行,数据不出本机——与今天 Grok Build 偷传上云形成鲜明对照
- **开发者专属**:把 shell / AI 调用 / HTTP / 文件操作拼成可复用流水线,替代到处散落、写完就丢的一次性脚本
- **多种触发**:支持定时、文件变动、webhook 触发,适合把重复的 AI + 数据小活儿自动化固化下来
今日趋势综述
今天的信号:当模型不再是变量,外围工程和判断力才是
把今天几条放一起看,会发现它们在合力宣布一件事:模型这个变量正在贬值。SWE-bench Verified 已经被刷到 95% 以上、头部几家挤在一两个百分点里,OpenAI 干脆停报 Verified、改推更难的 Pro——一个基准一旦人人满分,它就不再能区分谁强;与此同时开放权重的 Kimi K3、DeepSeek V4、Inkling 把和闭源旗舰的差距压到大约『一代以内』,最强模型不再稀缺。当所有人手里的模型都差不多强、还越来越便宜,光靠『我接了哪个模型』已经拉不开差距了。
差距去哪了?去了模型外面那一圈工程。codebase-memory-mcp 把整个代码库压成一张知识图谱,让编码 agent 用 3400 token 就看清本来要烧 41 万 token 才能理清的结构;Aura 把 AI 写的代码按 AST 逐函数追踪、拿产出和你的原始意图对账,逼它证明任务真做完了才让你提交。它们不造更强的模型,而是给已经足够强的模型装上『看得懂仓库』和『交付可验证』这两样外设——这正是 2026 年最扎实、也最不容易被下一个模型发布抹平的护城河。
落到人身上,答案更直白。TD 银行把房贷审批从平均 15 小时压到 3 分钟以内,靠的不是买了最强模型,而是把 agent 嵌进真实的审贷流程;FDE 成了年薪冲到七十万美元的抢手岗,因为企业 AI 试点 95% 死在『落地』而非『模型不行』。Mollick 说得最透:提示词技巧的时代过去了,现在该练的是把需求写成规格、给 agent 定目标和验收标准、像管一个能干但只会照字面执行的员工那样管它。别再纠结用哪个模型了——去练把能力装起来、落进业务、并指挥它交付出可验证结果的那套本事。
Aura:Agents + Git + Intent(开源 AI 编码 IDE)
展开详情
它解决的痛点是:AI 帮你写了一大堆代码,但你很难确认它到底有没有真把任务做完、改动是否偏离了你最初的意图——传统 Git 只按『文本行』记差异,AI 大改一片时你根本看不清逻辑上发生了什么。Aura 是一个 Git 原生、面向 AI 编码 agent 的 IDE:它把 agent 拆成 Planner(研究+写规格)和 Worker(执行),带仓库感知的上下文(语言感知的代码智能、本地 BM25 搜索、依赖上下文),最关键的是它对代码的 AST 做哈希、按函数和类级别追踪改动,再拿产出和你的『原始意图』对账,能在你提交前证明这个任务是不是真的完成了。
- **按 AST 追踪、不是按行**:哈希抽象语法树而非文本行,逐函数/类级别追踪 AI 改动,给 AI 生成的代码提供逻辑级可溯源,AI 大改一片也看得清到底动了什么
- **Planner/Worker 分工**:Planner 负责研究和写规格、Worker 负责执行,配合仓库感知上下文(语言感知代码智能 + 本地 BM25 搜索 + 依赖上下文),先规划后动手
- **自举造出来**:5–6 月用同一套 harness 循环处理 20+ 亿 DeepSeek token、近 3 万次 API 请求,把自身代码库写了出来——本身就是『指挥 agent 交付』的活样本
TD 银行把房贷审批从 15 小时压到 3 分钟:不是买了最强模型,是把 agent 嵌进了审贷流程
展开详情
- **15 小时 → 3 分钟**:房贷/HELOC 审贷备忘生成从平均 15 小时压到平均不到 3 分钟,约降 99.7%,且宣称结果更准、风险与单件成本同步下降
- **做的是脏活不是炫技**:agent 负责文件分类、信息抽取、收入计算与核验、同意检查、政策比对、矛盾排查,最后产出给人类核保员的摘要——人仍在最终决策位
- **自建团队落地**:由 TD 旗下 Layer 6 AI 实验室联合科技/数据/地产信贷/风控多团队共建,2026-05-21 正式发布,是银行业首批面向房贷全流程的 agentic AI
SWE-bench Verified 被刷穿到 95%+、连 OpenAI 都弃榜转投 Pro:编码榜单还能信吗,该看什么
展开详情
- **对比**:SWE-bench Verified(2026-07)GPT-5.6 Sol 96.2% vs Claude Mythos 5 95.5% vs Claude Fable 5 95.0% vs Kimi K3 93.4% vs Claude Opus 4.8 88.6%——前四名挤在 1 个百分点带里,榜单已基本分不出高下
- **OpenAI 自己弃榜**:OpenAI 停报 SWE-bench Verified、改推更难的 SWE-bench Pro,公开理由是训练集数据泄漏让 Verified 分数越来越不可信
- **饱和≠等价**:分数贴脸不代表体验相同,真实差距转移到了成本/延迟、长程任务稳定性、工具调用与代码库理解上——这些恰恰是单一 Verified 分数量不出来的
更新:FDE『1500 人调查』给出实测画像——一半时间在客户现场,落地卡在人不在模型
展开详情
- **47/31/22 的时间账**:FDE 每周中位 47% 时间面向客户(访谈/驻场/设计评审)、31% 写交付代码、22% 内部协调——一半时间在把模型翻译成业务,不是纯写码岗
- **需求爆炸**:FDE 岗位一年暴涨 729%,Salesforce 公开承诺招 1000 名、EY 4 月起设专岗,Palantir/Databricks/Ramp/Rippling 都在建 FDE 团队
- **钱在落地不在模型**:前沿实验室资深 FDE 中位总包约 48.5 万美元、staff 级过 72.5 万;企业 AI 试点约 95% 失败于『部署断裂』而非模型不行
Agora: Enhancing LLM Agent Reasoning Via Auction-Based Task Allocation
展开详情
- **拍卖式派活**:把子任务当拍卖品,各 agent 按『校准能力 − 成本』出价竞标,系统据此把每段活派给性价比最高的专家,而非固定路由
- **零训练、黑盒友好**:不需要端到端训练、也不需窥探闭源 agent 内部,直接编排一堆现成的专家模型与工具,落地门槛低
- **编排 > 单体**:核心思路是让多个专才协作胜过一个通才独干,把重心从『模型多聪明』移到『任务怎么分配、成本怎么算』的调度工程
2026 年 7 月开放权重大爆发:Kimi K3、DeepSeek V4、Inkling 把和闭源旗舰的差距压到约『一代以内』
展开详情
- **对比**:Artificial Analysis 独立榜上 Kimi K3 已略超 Claude Opus 4.8,拿下 Frontend Code Arena 第 1、AA 智能指数总榜第 3;DeepSeek V4.5、GLM-5.2、Inkling 在推理与编码上与闭源旗舰互有胜负
- **两周五连发**:Kimi K3(2.8T,7/16)、Thinking Machines 的 Inkling(Apache 2.0)、DeepSeek V4(7 月中)、Mistral 新稀疏 MoE、MiniMax M3 Pro(2.7T)密集落地
- **差距只剩一代**:开放 vs 闭源的能力差从『好几代』收窄到约『一代以内』,最强一档能力不再被少数闭源厂商垄断
Ethan Mollick
别再把大模型当成一本咒语书、指望靠某句提示词技巧点石成金了。该把它当成一个能干、但只会照字面执行的员工来管——给它清楚的目标、定义好要什么产出、立下质量标准、配上验收测试。提示词技巧的时代结束了,规格纪律的时代开始了。我们正从『外行用聊天机器人补短板』,走向『专家用 agent 把活干完』。