📅
Hall of Fame
Hall of Fame
Track
Type
Source
7月24日 周五 · 10 条
今日趋势综述
今天登顶的不是新模型,而是一整套'管住 AI'的工具:Addy Osmani 的 agent-skills 冲到约 7.7 万星、herdr 让你在终端里盯住一群 agent、arXiv 首次给'无限 agent 循环'建检测、Nat Friedman 押注 agent 代码的可审计性;与此同时微软/AWS/OpenAI 正砸数十亿美元把'把 AI 落地进企业'的最后一公里工业化——AI 的稀缺能力正从'会生成'转向'能编排、能监督、能验证、能交付'。
今天的信号:AI 的价值正从'会生成'转向'管得住、落得下'

今天霸榜的几乎全是'驯服 agent'的工具,而不是又一个更强的模型。Addy Osmani(Google Chrome 资深工程师)的 agent-skills 冲到约 7.7 万星,把资深工程师的纪律(定义→计划→构建→验证→评审→交付)编码成技能让 agent 照做;herdr 两万星,做成'agent 版 tmux',一屏盯住十几个在跑的编码 agent 谁在干活、谁卡住;arXiv 的 IAL-SCAN 首次系统定义并检测'无限 agent 循环'这个会半夜烧光你 API 预算的失败模式(6549 个仓库里确认 68 处、精度 91.9%);前 GitHub CEO Nat Friedman 的 Entire 则赌'谁写的、为什么这么写'的可审计性,而不是生成本身,才是下一个开发者平台。它们指向同一句话:生成这件事正在被解决,真正稀缺的是'管住它'。

钱也在往同一个方向走。微软砸 25 亿美元、6000 名工程师成立'前沿公司',AWS 投 10 亿,OpenAI 完成第二笔部署收购(Northslope)——都在抢'把 AI 落地进企业'的最后一公里,背后是 MIT 那个扎心数字:95% 的企业生成式 AI 试点对利润零贡献,卡点不在模型强不强,而在落不落得下去。Aviva 给出了配方:不是买一个最强大模型,而是 80 个小模型 + 4 万小时员工再培训,换来投诉降 65%、年省 £60M。连评测的记分牌本身都变了——Artificial Analysis 把智能指数 v4.1 整个重构成以 agent 长程任务为主。而 colibri 那种'744B 塞进 25GB 内存的笔记本'虽惊艳,实测冷启动只有 0.05 token/秒、答 100 字要十几分钟,恰恰提醒你:'能跑'不等于'能用'。

对普通人,今年真正该练、也最不容易被下一个模型抹平的能力,不是'会用哪个 AI 工具',而是'能可靠地编排、监督、验证并交付 AI'。具体点:学会同时管一群 agent(herdr 这类),把自己的判断沉淀成 skills 而不是每次重新写 prompt(agent-skills),给成本和循环上护栏(别被无限循环烧钱),审计 agent 到底交付了什么,以及——收入最高的那一档——成为那个能把 AI 真正落地进一门乱糟糟真实生意的人(FDE,$220K–600K)。就连今天的现金流机会也是'监督一个记账 agent,而不是自己录票据'(Receiptor)。生成越来越便宜,判断、监督和最后一公里交付,才是价值和钱正在流向的地方。

今日新增 9
#02
GitHub Repo
★ 19,600 NEW

ogulcancelik/herdr

herdr 之所以本周登顶,是因为它精准踩中了一个正在冒头的新痛点:当个人开始同时跑好几个编码 agent,瓶颈就从'agent 能不能写代码'变成了'我能不能盯住这一群 agent'。以前你开一个 Claude Code 就够忙,现在可能同时挂着三四个在改不同分支、跑不同任务,谁卡住了、谁在空转、谁需要你拍板,全靠来回切窗口盯——herdr 把这件事变成一屏可视、状态自动标注的'牧群面板'。它不造模型、不造 agent,只做'监督与编排'这一层,恰恰是 agent 数量变多之后最刚需、也最容易被忽视的一环。
#AI Agent#Rust(单个约 10MB …
另有 2 家信源报道
展开详情

herdr 是一个'专为 AI 编码 agent 打造的终端多路复用器'——你可以把它理解成'agent 版 tmux'。用过 tmux 会立刻上手,区别在于它会自动感知每个 agent 的状态:正在工作、被卡住、已完成、还是空闲,在侧栏一屏展示,不用装 hook 或插件就能识别 16+ 款编码 agent(Claude Code、Codex、Devin CLI 等)。它还提供一个 socket API,让 agent 之间可以互相 spawn、监控。作者是土耳其独立开发者 Oğuz Çelik,整个东西打包成一个约 10MB 的 Rust 二进制、零依赖,跑在你现有的任何终端里。

周增长:6 月 30 日登顶 GitHub Trending 第一,从 6 月底约 1.2 万星涨到本周约 1.96 万,单人开发

  • **agent 版 tmux**:像 tmux 一样管理多路会话,但额外自动标注每个 agent 的工作/卡住/完成/空闲状态,一屏盯住一群 agent
  • **零配置感知 16+ agent**:无需 hook 或插件即可识别 Claude Code、Codex、Devin CLI 等 16 款以上编码 agent 的实时状态
  • **单文件、零依赖**:约 10MB 的 Rust 二进制、非 Electron,跑在你现有终端里;6 月 30 日登顶 Trending、单人开发做到约 1.96 万星
推荐理由:对普通开发者,herdr 代表一个值得早点上手的方向:从'会用一个 agent'升级到'会编排一群 agent'。真正把个人生产力拉开差距的,不是你用的模型多强,而是你能不能像一个小团队 leader 那样,同时让三五个 agent 并行干活、你只做监督和拍板。给你的行动建议:先试着把一个较大的任务拆成几条可并行的子线(比如一个改前端、一个写测试、一个查文档),用 herdr 这类工具同屏管理,练'监督与调度'这块肌肉。这正是当下从'AI 使用者'走向'AI 编排者'的最低门槛入口——而编排能力,比会用某个具体工具更难被下一个模型抹平。
#03
arXiv Paper
NEW

When Agents Do Not Stop: Uncovering Infinite Agentic Loops in LLM Agents

这篇给'管住 agent'补上了最实用的一块:怎么防止 agent 停不下来。作者提出并研究了'无限 agent 循环'(Infinite Agentic Loops, IAL)——当反馈路径没有被有效约束时,agent 会不断重复调用模型、工具、工作流转移或 agent 交接,把一次普通请求放大成长时间的模型与工具狂跑,导致成本耗尽、模型被拒服务(DoS)、上下文无限增长和外部副作用被反复触发。它不是普通的程序死循环,而是 agent 逻辑、框架语义、运行时观测和终止机制交互出来的新物种。团队做了个静态分析工具 IAL-SCAN,在 6,549 个真实 agent 仓库上扫描:报出 74 个可疑点,人工复核确认其中 68 处是真实 IAL 失败、分布在 47 个项目,精度 91.9%。
首次系统定义并可检测'无限 agent 循环'(IAL)这一会烧光预算、触发模型 DoS、上下文爆炸的新失败模式,正撞上人人开始放任 agent 自主长跑的当口
#AI Agent
展开详情
  • **烧钱的隐形失败**:IAL 会把一次请求放大成通宵狂跑,直接后果是 API 预算被耗尽、模型被 DoS、上下文爆炸——这正是很多人半夜账单暴涨的元凶
  • **规模化实证**:在 6,549 个真实 agent 仓库上扫描,确认 68 处真实无限循环、覆盖 47 个项目,检测精度 91.9%,说明这不是个别 bug 而是普遍隐患
  • **给出可用工具**:IAL-SCAN 把异构 agent 代码抽象成框架无关的中间表示、建'agentic 循环依赖图'来找出无界反馈路径,是可落地的护栏起点
推荐理由:对任何在跑自动化 agent 的普通人,这条是最直接的省钱课:给 agent 自主权之前,先给成本和循环上护栏。使用侧——设置最大步数/最大花费/超时上限,别让一个 agent 在你睡觉时无限重试;在隔离环境里先跑一遍、观察它会不会打转。机会侧——'agent 可靠性'正在从论文变成产品需求:谁能做出好用的 agent 护栏、成本熔断、循环检测、可观测面板(就像 herdr 之于监督),谁就卡住了 agent 时代一个又硬又新的位置。别只追更强的模型,学会给它装刹车和仪表盘——这块的稀缺度和护城河,比追模型高得多。
#04
winbuzzer.com Product
NEW

Entire:前 GitHub CEO Nat Friedman 的 git 原生 AI agent 平台,本周开放 Git 网络预览、开源 Checkpoints

前 GitHub CEO Nat Friedman 的新公司 Entire 本周开放了面向 AI 编码 agent 的 Git 网络预览,并开源了首个产品 Checkpoints。它的核心赌注和今天的主线一致:当越来越多代码由 agent 写出,'谁/什么写的、为什么这么写'的可信与可审计,会比生成本身更重要。Checkpoints 会把 agent 提交的每一段代码,自动和产生它的完整上下文(prompt、会话记录)配对留痕,相当于给 AI 写的代码建一条 git 原生的审计轨迹。整个平台设想由三块组成:统一 AI 产出代码的 git 兼容数据库、让多个 agent 协作的语义推理层、以及为'人-agent 协作'设计的原生界面。此前 Entire 拿下 $60M 种子轮、约 $300M 估值(Felicis 领投),投资人名单里有 Jerry Yang、Garry Tan、Gergely Orosz 等。
#DevTools#预览阶段;首个产品 Chec…
另有 2 家信源报道
展开详情
  • **押注可审计而非生成**:Checkpoints 把每段 agent 代码与产生它的 prompt / 会话上下文自动配对留痕,解决'这段 AI 代码谁写的、为什么'的信任问题
  • **git 原生的 agent 平台**:设想用 git 兼容数据库统一 AI 产出、加语义层让多 agent 协作,把 git 从'人协作'扩展到'人-agent 协作'
  • **重量级背书**:前 GitHub CEO 操刀,$60M 种子轮、约 $300M 估值(Felicis 领投,Jerry Yang / Garry Tan 等参投),本周开放 Git 网络预览
推荐理由:对普通开发者,Entire 指向一个正在成形的新层:agent 代码的可信与审计。当你和团队提交的代码里越来越多是 agent 生成的,'能不能追溯每段代码的来龙去脉'会从加分项变成硬需求——尤其在受监管或对质量敏感的团队。机会有两层:使用侧,现在就养成给 agent 产出留痕的习惯(把 prompt、决策记录和代码一起提交),这会让你在协作和排错时比别人清楚得多;建设侧,'agent 代码审计、来源追溯、可信协作'这一层正被顶级玩家下注,谁能在具体行业/团队场景里把它做实做细,就卡住了一个又硬又新的位置。别只盯着让 agent 写更多代码,想想怎么让这些代码可被信任。
#05
geekwire.com Article
NEW

云厂商把 FDE 工业化:微软 $2.5B『前沿公司』、AWS $1B、OpenAI 二次收购,抢的都是'把 AI 落进企业'的最后一公里

这不是重复上周'FDE 是 2026 最抢手岗位'那条旧闻——过去三周里,FDE(Forward Deployed Engineer,前沿部署工程师)从一个稀缺角色,升级成了每家大厂用资本砸出来的一门正式生意。7 月 2 日微软宣布成立'前沿公司'(Frontier Company),投入 25 亿美元、6000 名嵌入式工程师住进客户内部去建、去跑 AI 系统(首批客户含 LSEG、联合利华、诺和诺德);6 月 30 日 AWS 承诺约 10 亿美元组建 FDE 团队,工程师以 5–6 人小队搭配 AI agent 协作(早期客户含 NBA、NFL);7 月 8 日 OpenAI 的部署公司完成第二笔收购(Northslope,继 Tomoro 之后),把部署队伍扩到'数百名'FDE。推动这一切的是 MIT Project NANDA 那个数字:95% 的企业生成式 AI 试点对利润零贡献——卡点从来不在模型强不强,而在落不落得下去。
#FDE
另有 3 家信源报道
展开详情
  • **三家同时下重注**:微软 $2.5B / 6000 人'前沿公司'、AWS 约 $1B FDE 团队、OpenAI 二次收购(Northslope)扩到数百 FDE——最后一公里被工业化
  • **驱动力是 95% 失败率**:MIT Project NANDA 发现 95% 企业 GenAI 试点零 P&L 回报,价值明显从'训练模型'迁移到'把模型落进乱糟糟的真实业务'
  • **薪资锚点清晰**:OpenAI FDE 中级约 $220K–280K(旧金山),大盘中级总包约 $300K–450K、staff/principal $600K+,是本季度正在被大量创造的岗位
推荐理由:对个人,这是今年最值得对齐的职业信号:真正在涨薪、在扩招的,不是'会训模型'的人,而是'能把 AI 落进一门真实生意并跑出结果'的人。这套技能栈现在很明确、也很难速成:生产工程能力 + 评测工程(会搭幻觉/回归测试套件)+ 客户面判断力(是'工程师-外交官',不是售前或客户成功)。想切进去,别只堆算法,去练'能独立扛下 discovery(摸清客户业务)→ 集成 → 60–180 天落地维护'的全流程交付。哪怕你不进大厂,把自己定位成'能帮中小企业把某个 AI 用例真正跑通、并对结果负责'的人,也是当下最稀缺、最值钱的位置之一。
商机信号(加速):谁付钱:大厂(微软/AWS/OpenAI)及其付费企业客户,正为'把 AI 落地进业务'的交付能力开出 $220K–600K 年薪 痛点:95% 企业生成式 AI 试点对利润零贡献,模型能力买了却落不了地、跑不出可衡量的 P&L 结果 切入点:把自己训练成能独立完成'摸清客户业务→集成→60–180 天落地维护'的 FDE 型交付者;起步可从帮 1 家中小企业把一个具体 AI 用例跑通、对结果负责做起,先攒可展示的落地案例
#06
artificialanalysis.ai Article
NEW

评测风向变了:Artificial Analysis 把智能指数 v4.1 重构成'以 agent 为主',同一榜单三大模型这样排

被广泛引用的第三方综合评测 Artificial Analysis 把它的'智能指数'升级到 v4.1,核心是整个重构成以 agent 长程任务为主:新权重为 Agents 34% / Coding 24% / Scientific Reasoning 24% / General 18%,把 Terminal-Bench Hard 升级到 2.1、把 τ²-Bench Telecom 换成更难的 τ³-Bench Banking、把 GDPval-AA 升到 v2,并因'刷饱和'直接砍掉了 IFBench。权重最高的 GDPval-AA v2 还把 ELO 重新以'人类表现=1000'为基准,引入轮换的前沿模型评委,把 agent 轨迹的回合上限从 100 提到 250。这条的意义不在'谁第一',而在'记分牌本身变了':就算没有新模型发布,排名也会因为评测重心转向 agentic 而洗牌——读榜的人得先看它是怎么测出来的。
#评测
另有 2 家信源报道
展开详情
  • **对比(GDPval-AA v2 ELO,人类基准=1000,指数中权重最高的评测)**:Claude Fable 5(含 fallback)1818 vs Claude Opus 4.8 1638 vs GPT-5.5(xhigh)1531——注意 Fable 5 目前尚未开放使用
  • **记分牌重心转向 agent**:新权重 Agents 34% / Coding 24% / Scientific 24% / General 18%,回合上限 100→250,专门奖励长程 agentic 能力
  • **淘汰饱和基准**:Terminal-Bench 升 2.1、τ²-Telecom 换 τ³-Banking,IFBench 因刷满被移除——评测在主动'换更难的尺子'
推荐理由:对开发者,务实的读法不是记住'谁排第一',而是三点:一,看权重——v4.1 已把重心压到 agent 长程任务,若你干的是多步自动化,这个排序比旧的偏知识问答的榜更贴合你的活;二,看口径——同一基准换套评委、换个回合上限,分数就变,别拿不同版本的数字硬比;三,按场景选——GDPval-AA v2 上 Opus 4.8(1638)明显领先可用的 GPT-5.5 xhigh(1531),复杂长程 agent 任务优先 Opus 一档;日常改 bug、跑测试这类饱和区,挑便宜快的即可(Fable 5 虽榜首但还没开放,别把'不可用的第一'当选型依据)。更值钱的能力是:会自己搭一套贴合你业务的小评测集,而不是跟着别人的榜走。
#07
mckinsey.com Article
NEW

Aviva 用 80 个 AI 模型重做车险理赔:复杂案定责少 23 天、投诉降 65%、年省 £60M——赢在'小模型群 + 4 万小时再培训'

今天的垂直行业选保险——这是一个难得有硬数字、也有清醒方法论的一手案例。英国保险巨头 Aviva 联手麦肯锡 QuantumBlack,对车险理赔全流程做了一次彻底的 AI 改造,在理赔各环节部署了 80 多个 AI 模型。结果很硬:复杂案件的定责时间缩短 23 天,理赔分流准确率提升 30%,客户投诉下降 65%,净推荐值(NPS)涨了 7 倍多,公司告诉投资者仅 2024 一年就省下超过 £60M(约 $82M)。但真正的关键不是'模型多',而是它同时投入了 4 万小时做员工再培训:部署 80 个模型没有裁掉员工,而是把理赔员从'数据拼装和常规分流'解放出来,转去处理复杂、有争议、情绪化、真正需要人类判断的案子——员工敬业度因此翻倍。
#行业应用
另有 1 家信源报道
展开详情
  • **硬数字**:复杂案定责少 23 天、分流准确率 +30%、投诉降 65%、NPS 涨超 7 倍、2024 单年省超 £60M(约 $82M)
  • **赢在'小模型群'而非一个大模型**:80 个各司其职的专用模型串起理赔全流程,比押注一个最强大模型更稳、更可控
  • **4 万小时再培训是分水岭**:不是自动化替人,而是把理赔员转去做需要人类判断的复杂案,员工敬业度翻倍——落地成败在人不在模型
推荐理由:对想把 AI 落地进业务的人,Aviva 给了一个反直觉又极务实的模板:别指望一个最强大模型解决一切,把复杂流程拆成一堆'各管一段'的小模型/小 agent,再配上认真的人员再培训,效果反而更稳、员工更买账、投诉更少。这和今天 FDE 的主线是同一件事——落地成败几乎全在'最后一公里的执行与人的配合',而不是模型强弱。给个人的行动建议:如果你在某个传统行业(保险、金融、制造、物流),最值钱的切入点不是去追最新模型,而是把你熟悉的某条冗长流程拆解清楚、找出哪几步能用 AI 各自替一段、并想清楚人该怎么被重新安排——'懂业务流程 + 会拆解落地'的人,正是这类改造里最缺的。
#08
GitHub Repo
★ 18,300 NEW

JustVugg/colibri

这条既是惊艳的工程,也是今天'能跑 ≠ 能用'这条主线的最佳注脚。惊艳在于:单人、纯 C、两千行代码,就把一个 744B 大模型塞进了普通笔记本的内存预算,7 月 10 日发布后两周冲到约 1.8 万星、登上 HN 首页。但'catch'同样刺眼:因为每生成一个冷 token 要从磁盘读约 11GB,实测冷启动速度只有 0.05–0.1 token/秒——也就是十几到二十秒才蹦一个字,答一段 100 字的短回复要约 17–33 分钟。它证明了'技术上可行',但离'日常可用'还差得远。看热闹之外,它提醒你:一个漂亮的 demo 和一个能真正干活的工具,中间隔着实测的鸿沟。
#Infra#C(推理引擎为单个 C 文件…
另有 2 家信源报道
展开详情

colibri 是一个纯 C、零依赖的迷你推理引擎,主打一件很炸的事:让 744B 参数的 MoE 大模型 GLM-5.2 跑在只有约 25GB 内存的消费级机器上。原理是'磁盘流式加载专家':MoE 每个 token 只激活约 40B 参数,它把稠密部分(注意力、共享专家、embedding,约 17B)以 int4 常驻内存(约 9.9GB),其余路由专家全放磁盘、按需流式读入。整个运行时就是一个约两千行的 C 文件,可自行编译、指向本地推理,是一次相当极客的工程炫技。

周增长:7 月 10 日发布,约两周涨到 1.8 万星;登上 Hacker News 首页(730+ 分、180+ 评论)

  • **工程炫技**:纯 C、零依赖、约两千行单文件,用'磁盘流式加载专家'把 744B 的 GLM-5.2 跑在约 25GB 内存的消费级机器上
  • **catch 很大**:实测冷启动仅 0.05–0.1 token/秒(每个冷 token 触发约 11GB 磁盘读),答 100 字要约 17–33 分钟,离日常可用很远
  • **热度真实但要清醒**:两周约 1.8 万星、HN 首页 730+ 分,掌声里既有对 hacker 精神的欣赏,也有大量'这到底什么场景才划算'的追问
推荐理由:对普通人,colibri 是今年很好的一课:别被'惊艳 demo'直接带走,先问'实测能不能干我的活'。同一个能力,'技术上能跑'和'在你的场景下好用'之间常常差着几个数量级(这里是 token 速度差了近千倍)。养成看到新工具先查实测数据、跑一遍真实任务再下结论的习惯,本身就是 AI 时代的基本功——它能帮你省下大量追热点、装完发现没法用的时间。另一层机会:本地跑大模型的需求真实存在(隐私、成本、离线),但当前方案要么慢要么贵,谁能在'消费级硬件上把大模型跑到真正可用'这条路上做出工程突破,就是块难啃但值钱的硬骨头。
#09
modelcontextprotocol.io Article
NEW

MCP 2026-07-28 发布候选版:史上最大改版,协议核心转向无状态,从'项目'长成'生产基础设施'

MCP(模型上下文协议,agent 连接工具与数据的通用接口)发布了 2026-07-28 规范的发布候选版,维护者称这是协议自 2024 年 11 月诞生以来最大的一次改版——标志它从'有前途的项目'毕业成'生产级基础设施'。最重要的变化是协议核心转向无状态:以前客户端要走 initialize/initialized 握手、靠 Mcp-Session-Id 头绑定到特定服务器实例;新架构把协议元数据放进每个请求的 _meta 字段,于是可以直接部署在'普通的轮询负载均衡'后面,不再需要粘性路由或共享会话存储。此外还有 6 项授权安全增强(对齐 OAuth 2.0 / OIDC)、独立演进的扩展框架(Tasks、MCP Apps 用反向 DNS 命名独立版本)、以及让服务器可在沙箱 iframe 里渲染交互式 HTML 的 MCP Apps;Roots、Sampling、Logging 进入至少 12 个月的弃用周期。规范 5 月 21 日锁定,7 月 28 日正式发布。
#Infra
另有 1 家信源报道
展开详情
  • **核心转无状态**:协议元数据改放每个请求的 _meta 字段,去掉会话握手与粘性路由,可直接跑在普通负载均衡后面——为大规模生产部署铺路
  • **从项目到基础设施**:据第三方统计 MCP 已有 1 万+ 公开服务器、SDK 月下载约 9700 万,OpenAI/Google/微软/AWS 全部接入,这次是它'长大成人'的一次改版
  • **安全与扩展并进**:6 项授权增强对齐 OAuth 2.0/OIDC,新增可沙箱渲染 HTML 的 MCP Apps,扩展框架让能力独立演进;Roots/Sampling/Logging 启动弃用
推荐理由:对开发者,MCP 转无状态、走向生产基础设施,是个明确的'该认真学'的信号:agent 连接工具/数据的方式正在标准化并沉淀成底座,价值也在往'连接点'——agent 与工具之间的协议——聚集。给你的行动建议:一,如果你在做 agent 或集成,尽早按无状态、标准授权的新规范设计,别再依赖会话粘性等要被淘汰的老写法;二,'把一个有真实数据/能力的服务包成高质量 MCP server'正成为一种可复用、可分发的资产——就像当年写好一个受欢迎的库。别只当 MCP 的使用者,想想你手上有什么数据或工具,值得包成一个别人都想接的连接点。
#10
receiptor.ai Product 直接可用
NEW

Receiptor AI:把记账做成'你监督的 agent'——自动从邮箱抓票据、归类、同步 Xero/QuickBooks

今天选它做现金流机会,是因为它和主线'监督 agent 而非亲自动手'完全同频,而且是有真实定价、真实 PH 热度的产品,不是画饼。对想挣现金流的普通人,它的价值不在自己省几小时,而在'可被服务化':一个懂点记账的个人 / 虚拟助理 / 会计新手,可以用它给多个小微企业客户做代记账——agent 负责枯燥的票据录入归类,你负责复核和对客户负责。这类'AI 干脏活、人做监督和交付'的服务,成交快、启动成本极低,是当下最接地气的一条 AI 变现路径。
#小微现金流#$29/月起(不限连接邮箱)…
另有 2 家信源报道
展开详情

Receiptor AI 是一个专做'票据/凭证记账'的 AI agent:它自动从邮箱(及其他渠道)里把过去和现在的收据、发票全找出来,按上下文抽取数据、对照你的会计科目自动归类,再同步进 Xero / QuickBooks(也支持 Mercury、云存储、CSV 导出)。今年 7 月初上线的 Agent Mode 把它从'收据抓取器'升级成'一个你监督、而不是亲自做'的记账助手——数据录入和归类交给 agent,人只做复核。

  • **监督而非动手**:agent 自动抓票据、按科目归类、同步 Xero/QuickBooks,你从'手工录凭证'变成'复核 + 对客户负责'
  • **成本极低、按客户扩**:$29/月起、不限邮箱,14 天试用;给每个 SMB 客户建一套即可,工具成本几乎可忽略
  • **真实需求信号**:上线 Product Hunt 的 Agent Mode 约 483 票、评价集中在'省下每月好几个小时',说明小微记账自动化有真实付费意愿
推荐理由:对想挣现金流的普通人,这条给出一个可当天上手的最小切口:把'AI 记账'包成'代记账服务'去卖。小微企业主最讨厌、又不得不做的就是收集归类票据凭证——你用 Receiptor 这类工具把脏活自动化,再以每月固定费用(市面小微记账普遍 $200–500/月)接单,赚的是'监督 + 交付信任'的差价,而工具成本每户才 $29/月。行动建议:先用它把自己或一个熟人的账跑通、验证效果,再从你身边最容易触达的一类小生意(餐馆、工作室、独立商户)里找到第一个愿意付费的客户,用'我来盯、AI 来做'的方式接下来。切记 2026 年真正的坎不是'能不能做',而是分发——把精力压在找到并说服前几个付费客户上。
My Take:评分(5=最优):最快成交 4 / 最低成本 5 / 可复制 4 / 风险安全度 4。适合懂点记账、想用'AI 干活+人监督'的方式做代记账服务、快速接单赚差价的人。
商机信号(加速):谁付钱:小微企业主、独立商户、以及替他们记账的会计/虚拟助理(VA)——已有明确付费意愿,市面小微记账普遍 $200–500/月 痛点:手工收集、归类、录入票据和凭证极其耗时又易错,是小微老板最讨厌又不得不做的例行脏活 切入点:个人用 $29/月/户 的 Receiptor 把票据录入归类自动化,以'我监督、AI 干活'的代记账服务向每个 SMB 客户收 $200–500/月,赚监督与交付信任的差价;从身边一家愿付费的小生意接第一单起步
仍在热榜 1
Repo addyosmani/agent-skills 在榜 5d agent-skills 是 Addy Osmani(Google Chrome 资深工程师)开源的一套'生产级工程技能… Skills · 编程开发
7月23日 周四 · 8 条
今日趋势综述
xAI 被扒出 Grok Build 偷传整个代码仓库后 72 小时紧急开源;SWE-bench Verified 刷满后,同一模型在 SWE-bench Pro 上给出三套不同分数——今天的信号是:AI 工具越强,你越要学会验证它、而不是盲信它。
今天的信号:别盲信 AI 工具,学会验证它

今天最刺眼的一条,是 xAI 的编码 CLI Grok Build。一位安全研究者用抓包证明:它一边宣称『本地优先』,一边把你整个 Git 仓库(连提交历史里的密钥一起)打包上传到 xAI 的 Google Cloud 桶里——一个只需 192KB 就能完成的小任务,它传了 5.1GB,差了近 2.8 万倍。而那个大家以为是『数据开关』的『改进模型』选项,管的只是训练授权,根本拦不住代码外传。被曝光 72 小时后,xAI 才紧急开源、关闭默认留存、上线漏洞赏金。这不是个别厂商翻车,而是给所有人提了个醒:你往编码 agent 里塞的是公司最核心的源码,工具说什么不重要,它实际往哪发包才重要。

同一天,评测圈也在讲『别盲信数字』。SWE-bench Verified 被头部模型刷到 90%+ 后失去区分度,大家转看更难的 SWE-bench Pro——可同一个 Claude Opus,在 Scale 标准化公开集上是 51.9%,在厂商自报的聚合口径里却是 69.2%,换套脚手架能差十几个点。SkillsBench 更直接:4.7 万个公开 agent skills,平均质量只有 6.2/12,大多数是凑数的;但一套精挑的 skills 能把任务通过率从 33.9% 拉到 50.5%,医疗场景甚至暴涨 51.9 个百分点。数字不会自己说话,得看它怎么测出来的。

把这些串起来,普通人今年真正该练的能力,不是『会用哪个 AI 工具』,而是『会验证 AI 工具』:给编码 agent 上沙箱、抓它的网络出站、看它到底把代码发去哪;读评测先问是哪套基准哪个口径,别被一个漂亮百分比带走;用 skills、agent 前先验它在你的活儿上到底有没有效。会验证的人,才敢把真实业务交给 AI——这恰恰是 Khan Academy 在学校、独立开发者在小生意里真正跑通落地的分水岭。

今日新增 7
#01
GitHub Repo
★ 3,900 NEW

xai-org/grok-build

这条不是普通的『大厂开源编码工具』,而是一次被逼出来的信任修复。7 月 13 日,一位安全研究者用 wire-level 抓包证明:宣称『本地优先』的 Grok Build CLI,实际把用户整个被追踪的 Git 仓库(全部文件 + 完整提交历史,连提交进去的密钥一起)打包成 Git bundle,悄悄上传到 xAI 的 grok-code-session-traces Google Cloud 存储桶。在一个 12GB 测试仓上,它传了约 5.1GB / 73 个分块,而当时的任务只需约 192KB——相差约 2.8 万倍。更糟的是那个『改进模型』开关只管训练授权,压根拦不住代码外传。xAI 7 月 13 日服务端悄悄关掉上传、未发声明,直到 7 月 15 日才开源代码、把默认数据留存回溯关闭到 7 月 12 日、承诺删除已留存数据、并上线 HackerOne 赏金($100–$20,000),对外称『提供完整用户隐私』。
#DevTools#Rust(终端原生 TUI …
另有 3 家信源报道
展开详情

Grok Build 是 xAI 的终端原生 AI 编码 agent(就是 grok 命令背后那套),2026 年 5 月以 SuperGrok Heavy(每月 $300)内测起步,主打大代码库里的自主编码。它对标 Claude Code / Codex / opencode,含完整的 agent loop、读写代码的工具集、全屏可鼠标交互的 TUI,以及 skills / plugins / hooks / MCP 扩展体系。7 月 15 日 xAI 把它整个开源到 GitHub(Apache 2.0,Simon Willison 数了约 84 万行 Rust),号称可自行编译、指向本地推理、用 config.toml 完全本地运行。但它开源的真正导火索,是一桩安全事故——见下。

周增长:开源公告后一周内新增数千星,具体周增以 GitHub Trending / star-history 实时为准

  • **2.8 万倍的数据外传**:12GB 测试仓被上传约 5.1GB,而任务本身只需约 192KB,抓包实锤『本地优先』宣称为假
  • **隐私开关是摆设**:多数人以为『改进模型』能拦数据,实际它只管训练授权,代码照样离开你的机器进云桶——连提交历史里的密钥一并外传
  • **开源是危机公关**:被曝光约 72 小时后才开源(84 万行 Rust / Apache 2.0)、关默认留存、上赏金;代码可审计,但已上传数据的删除承诺仍未经第三方核实
推荐理由:对普通人,这是 2026 年最该记住的一课:你往编码 agent 里喂的是公司最核心的源码,工具嘴上说『本地优先』不算数,它实际往哪发包才算数。机会有两层。防守层:养成给 AI CLI 上沙箱、抓网络出站(一个简单的 mitmproxy / Little Snitch 就能看清它到底连了谁)、在隔离仓里先跑一遍再上真项目的习惯——这套『验证 AI 工具』的能力,正在从极客洁癖变成职场基本功。进攻层:企业现在极度缺『能审计 AI 工具数据流向、把 agent 安全落地进合规环境』的人,这类活儿(AI 供应链安全、agent 沙箱与出站管控)需求正在爆发、门槛高、也不容易被下一个模型抹平。别只学怎么用最新工具,学会怎么信任地用它——后者更稀缺、更值钱。
#02
labs.scale.com Article
NEW

Verified 刷满之后看 SWE-bench Pro:同一个 Opus 三套分数,编码榜单该怎么读

SWE-bench Verified 被头部模型刷到 88–95% 后失去区分度(昨天已聊过 OpenAI 干脆弃榜),大家转向更难、更贴近真实工程的 SWE-bench Pro。但 Pro 自己也开始『不可比』:同一个 Claude Opus,在 Scale 标准化公开集上只有约 51.9%,在 llm-stats 的厂商自报聚合口径里却是 69.2%,换套脚手架和数据划分能差十几个点。这篇把不同口径的分数摊开对齐,提醒开发者:一个漂亮百分比脱离了『哪套基准、哪个划分、什么脚手架』就没有意义。
#评测
另有 2 家信源报道
展开详情
  • **对比(同一基准 SWE-bench Pro · Scale 标准化公开集,2026-06-28)**:GPT-5.4 xHigh 59.1% vs Meta Muse Spark 55.0% vs Claude Opus 4.6 thinking 51.9%——头部只差个位数,且都远低于 Verified 的 90%+
  • **同模型三套数**:Claude Opus 在 Scale 公开集 51.9% / 厂商聚合口径(llm-stats)Opus 4.8 达 69.2% / Scale 私有商用集另一版本约 47.1%,口径决定结论
  • **Verified vs Pro 的落差**:从 Verified 的近乎满分掉到 Pro 的五六成,说明『真实工程任务』这道坎远没被跨过,别被饱和的旧榜误导
推荐理由:对开发者,务实的选法不是背排行榜第一名,而是学会问三个问题:这是哪套基准(Verified 已饱和、Pro 更能区分真实工程)?哪个划分(Scale 标准化公开集比厂商自报可比得多)?什么脚手架(换 harness 能差十几个点)?现在选模型,与其纠结谁在某榜领先一两个点,不如按活儿定:日常改 bug、跑测试,饱和区里几家都够用、挑便宜快的(开放权重能进一步压成本);真正长程、跨文件的硬任务,才值得为标准化 Pro 集上领先的那家多付钱。对想进 AI 的人,『会读评测、会自己搭一套贴合自己业务的小评测集』本身就是稀缺技能——比记住榜单值钱得多。
#03
arXiv Paper
NEW

Your Agent's Memories Are Not Its Own: Forged Reasoning Attacks on LLM Agent Memory and Defenses

越来越多 agent 挂上了持久记忆——把过往决策、推理过程、工具使用记录都存下来复用。这篇提出 FARMA(Forged Amplifying Rationale Memory Attack):不去篡改记忆里的事实,而是往里注入『看起来合理的伪造推理』。之后 agent 每次检索记忆做决策,都会被这段被污染的推理链带偏,且因为事实本身没错、很难被常规校验发现。论文同时给出攻击方法和初步防御,把『记忆安全』从理论担忧变成了可复现的实证问题。
首次系统性揭示『污染 agent 的记忆推理链、而非事实知识』这一新攻击面,正撞上编码/办公 agent 大规模挂载持久记忆的当口
#AI Agent
展开详情
  • **新攻击面**:污染的是『推理理由(rationale)』而非事实,绕过大多数只查事实一致性的防线
  • **放大效应**:被污染的推理被反复检索复用,一次投毒可持续影响后续多轮决策,越用越偏
  • **攻防成对给出**:不止提出 FARMA,还给了初步检测/缓解方案,为记忆型 agent 的安全设计提供起点
推荐理由:这条紧接昨天『给 agent 装代码记忆 MCP』的趋势——记忆是 2026 年 agent 的核心外设,但记忆也会被下毒。对普通人有两层意义。一是使用侧:当你给 Claude Code / Cursor 挂上跨会话记忆、共享的团队记忆库时,要意识到那是个新的攻击面,别把来路不明的『记忆包 / 共享上下文』直接灌进去。二是机会侧:agent 记忆的安全、审计、可信检索,正在从论文变成产品需求——谁能做出『可信记忆层』(带来源标注、推理链校验、污染检测),谁就卡住了 agent 时代一个又硬又新的位置。想做深水区的人,记忆安全比追模型更有护城河。
#04
the-decoder.com Article
NEW

首个 agent skills 基准 SkillsBench:4.7 万个公开技能,平均分只有 6.2/12

agent skills(SKILL.md 那套跨工具技能)这半年从一个注册表长到八个市场、号称跨约 40 款产品通用,但质量到底如何一直没人量化。SkillsBench 是首个系统性基准:分析了 47,150 个公开 skills,平均质量分只有 6.2/12——大多数是凑数的。但它也证明了好 skills 的价值:一套精挑细选的 skills 能把 agent 任务通过率从 33.9% 拉到 50.5%(+16.6 个百分点),且效果高度分领域——医疗暴涨 51.9pp(34.2%→86.1%),软件工程只涨约 4.5pp。结论很清醒:skills 有用,但『大部分公开 skills 写得不好』和『会写好 skill 的人很少』同时成立。
#Skills#元技能
另有 2 家信源报道
展开详情
  • **质量真相**:4.7 万个公开 skills 平均仅 6.2/12,市场繁荣 ≠ 质量繁荣,随手抄一个装上大概率没用
  • **对比(有无精选 skills)**:任务通过率 33.9% → 50.5%(+16.6pp);医疗 +51.9pp(34.2%→86.1%)vs 软件工程仅 +4.5pp——领域越专、增益越大
  • **元技能缺口**:真正稀缺的是『评估和写好一个 skill』的能力,这正是当前 skills 生态最薄弱、也最值钱的一环
推荐理由:对想吃到 skills 红利的普通人,这份数据把机会指向了非常具体的地方。第一,别做通用 skills 去挤那 4.7 万个平庸货,去做垂直领域的高质量 skills——医疗、法律、金融这类专业场景增益最大(医疗 +51.9pp),因为通用模型在这些地方最缺结构化的领域知识,而你恰好懂行。第二,『会评估 skill 好坏、会把领域 know-how 写成让 agent 真能用的 SKILL.md』这个元技能,本身就是当下最稀缺的技能——它比会调 prompt 门槛高、也更难被下一个模型抹平。一句话:在 skills 市场里,当那个『把专业知识产品化』的人,而不是又一个搬运工。
#05
khanacademy.org Article
NEW

AI 进课堂的真实成绩单:用够时长才有效,Khanmigo 单独效果仍待验证

教育是被吹得最凶、但落地最慢的 AI 垂直领域之一。今天挑它,是因为难得有带硬数字、也带清醒边界的一手证据。Khan Academy 的 AI 辅导 Khanmigo 已铺进 1.5 万+ 所学校、约 500 万用户;平台层面的效果有真实证据:每周用满约 1 小时的学生,在学年末数学测评上比对照组高 0.44–0.47 个标准差(Oreopoulos 等 2026 RCT);每周用 30 分钟以上、全年累计 18 小时以上,与约 20% 高于预期的学习增益相关(MAP Growth 标准化测评)。但有个关键边界:截至 2026 年 3 月,尚无同行评审研究单独证明『Khanmigo 这个 AI 辅导本身』提升成绩——现有强证据是『Khan Academy 平台 + 保证使用时长』,而非 AI 那一层单独的功劳。
#行业应用
另有 1 家信源报道
展开详情
  • **用够才有效**:每周约 1 小时的学生末考数学高出对照组 0.44–0.47 个标准差(2026 RCT),核心变量是使用时长与老师督促,不是有没有 AI
  • **规模已铺开**:Khanmigo 进入 1.5 万+ 学校、约 500 万用户,1.8× 更快的掌握率——但样本大不等于因果清晰
  • **清醒的边界**:截至 2026 年 3 月,无同行评审研究单独证实 Khanmigo(AI 辅导层)提升成绩;别把『平台有效』直接当成『AI 有效』
推荐理由:对做 AI 教育、或想用 AI 帮孩子/自己学习的人,这份成绩单给了两个务实结论。一,AI 工具的效果几乎全押在『用够时长 + 有人督促』上——买了不用、或没人盯着,再强的 AI 也出不了成绩;真正值钱的产品设计和服务,是把『让人持续用下去』这件事做好(提醒、陪伴、可见进度),而不是堆模型能力。二,别被『AI 让成绩暴涨』的营销带走,要会分辨『平台有效』和『AI 那一层有效』——这种读证据的能力,无论你是家长、老师还是想做教育 AI 的创业者,都是不被割韭菜的底线。想在教育 AI 里挣钱,卖『可验证的效果和坚持』,比卖『最新大模型』靠谱得多。
#06
indiehackers.com Product 值得关注
NEW

六周做到 $10k MRR 的 AI 设计工具:一个人、零市场预算的可复制路径

这周挑一条和近期『AI 语音/自动化服务代运营』完全不同角度的现金流路子:不做代客服务、做自己拥有的小产品(productized micro-SaaS)。一位独立开发者用 AI 快速搭出一个垂直的 AI 设计工具,六周内、零市场预算做到约 $10k MRR。关键动作是三条老掉牙但有效的原则:极致垂直(只做某一类设计,不做通用)、先解决一个具体到疼的痛点、自己掌握支付与获客渠道。2026 年跑这种模式的门槛已经很低——一套 production 级 micro-SaaS 月成本约 $85–200,AI 还能帮你写代码、写文档、接客服、投广告。
#小微现金流#订阅制 micro-SaaS…
另有 1 家信源报道
展开详情
  • **极致垂直**:不做通用设计工具,只死磕某一类具体设计需求,让潜在用户一眼觉得『这就是给我做的』
  • **成本极低、可复制**:月运营成本约 $85–200,AI 承担开发/文档/客服/投放,一个人也能跑起一条产品线
  • **自己掌渠道**:从第一天起就自己握住支付和获客,不把命脉外包,才有稳定现金流
推荐理由:对想挣现金流的普通人,这条和最近几天的『AI 服务代运营』互为镜像,各有取舍:服务代运营成交快、启动几乎零成本,但你在卖时间、天花板是自己的产能;而 productized micro-SaaS 前期要搭产品、慢一点,但一旦跑通就是可复制、能睡后收钱的资产。2026 年真正的坎不是『能不能做出来』——AI 已经把做出来这件事变便宜了——而是分发:你能不能持续找到那群『痛到愿意付费』的垂直用户。给你的行动建议:从你最懂的一个细分场景切入,用 AI 一周内做出能收钱的最小版本,把全部精力压在『找到并说服前 20 个付费用户』上,而不是继续打磨产品。
My Take:评分(5=最优):最快成交 3 / 最低成本 4 / 可复制 4 / 风险安全度 4。适合有点动手能力、想做自己拥有的睡后收入资产、愿意用几周换长期复利的人。
#08
Product Hunt Product
NEW

buildpipe:给开发者的本地优先 AI 流水线(本地版 Zapier/n8n)

buildpipe 是一个面向开发者的本地优先流水线自动化应用:把 shell 命令、AI 调用、HTTP 请求、文件操作串成可复用的 pipeline,然后按计划、按文件变动或经 webhook 触发。它定位成『本地版 Zapier / n8n』,但专为开发者、且完全在你自己机器上跑——作者的动机就是『受够了反复写一次性脚本把 AI 调用和文件操作拼一起、然后弄丢』。在 Grok Build 把整个仓库偷传上云的当口,这种『数据不离开本机』的本地优先工具正好戳中开发者的敏感神经。
#DevTools#本地优先桌面应用,在你自己机…
另有 1 家信源报道
展开详情
  • **本地优先**:pipeline 全在你自己机器上执行,数据不出本机——与今天 Grok Build 偷传上云形成鲜明对照
  • **开发者专属**:把 shell / AI 调用 / HTTP / 文件操作拼成可复用流水线,替代到处散落、写完就丢的一次性脚本
  • **多种触发**:支持定时、文件变动、webhook 触发,适合把重复的 AI + 数据小活儿自动化固化下来
推荐理由:对普通开发者和想用 AI 提效的人,buildpipe 代表一个值得跟的方向:本地优先的 AI 自动化。它的价值不在多花哨,而在把你天天手动重复的『拉数据→喂给 AI→存结果』这类碎活儿固化成一条可复用、可定时、还不上云的流水线。结合今天 Grok Build 的教训,选工具时把『数据是否离开本机』当成一条硬标准会越来越重要。给你的行动建议:先盘一盘自己每天手动重复、又涉及敏感数据的小流程(比如整理日志、批量改文件、定时跑一段 AI 分析),用这类本地优先工具把它们自动化——省时间的同时,也把数据主权留在自己手里。
仍在热榜 1
Repo msitarzewski/agency-agents 在榜 2d agency-agents 是一套社区打磨的『AI 代理公司』人设库——从前端高手、Reddit 社区运营到『现实检查员… AI Agent
7月22日 周三 · 8 条
今日趋势综述
模型和榜单已经卷到饱和又趋同——SWE-bench 被刷穿 95%、开放权重追到只差一代、连 OpenAI 都弃榜——真正的价值正从『用哪个模型』整体转移到外围:给 agent 装上下文、装可验证的交付、把能力落进真实业务,以及会指挥它的判断力。
今天的信号:当模型不再是变量,外围工程和判断力才是

把今天几条放一起看,会发现它们在合力宣布一件事:模型这个变量正在贬值。SWE-bench Verified 已经被刷到 95% 以上、头部几家挤在一两个百分点里,OpenAI 干脆停报 Verified、改推更难的 Pro——一个基准一旦人人满分,它就不再能区分谁强;与此同时开放权重的 Kimi K3、DeepSeek V4、Inkling 把和闭源旗舰的差距压到大约『一代以内』,最强模型不再稀缺。当所有人手里的模型都差不多强、还越来越便宜,光靠『我接了哪个模型』已经拉不开差距了。

差距去哪了?去了模型外面那一圈工程。codebase-memory-mcp 把整个代码库压成一张知识图谱,让编码 agent 用 3400 token 就看清本来要烧 41 万 token 才能理清的结构;Aura 把 AI 写的代码按 AST 逐函数追踪、拿产出和你的原始意图对账,逼它证明任务真做完了才让你提交。它们不造更强的模型,而是给已经足够强的模型装上『看得懂仓库』和『交付可验证』这两样外设——这正是 2026 年最扎实、也最不容易被下一个模型发布抹平的护城河。

落到人身上,答案更直白。TD 银行把房贷审批从平均 15 小时压到 3 分钟以内,靠的不是买了最强模型,而是把 agent 嵌进真实的审贷流程;FDE 成了年薪冲到七十万美元的抢手岗,因为企业 AI 试点 95% 死在『落地』而非『模型不行』。Mollick 说得最透:提示词技巧的时代过去了,现在该练的是把需求写成规格、给 agent 定目标和验收标准、像管一个能干但只会照字面执行的员工那样管它。别再纠结用哪个模型了——去练把能力装起来、落进业务、并指挥它交付出可验证结果的那套本事。

今日新增 7
#02
GitHub Product
NEW

Aura:Agents + Git + Intent(开源 AI 编码 IDE)

Aura 是本周在 Product Hunt 上榜的开源 AI 编码 IDE,主打『可验证的 AI 交付』。它不追文本行差异,而是把你的 AST 哈希后按逻辑单元追踪 AI 的每一处改动,把产物和你最初的意图规格对账,做到对 AI 生成代码的可溯源和完成度校验。有意思的是它大部分代码是自己写自己的——5 到 6 月间跑同一套 harness 循环、处理了 20 多亿 DeepSeek token、近 3 万次 API 请求,把自己这套 IDE 生出来。它和今天的主线是一路货:不造更强模型,而是给 AI 编码这件事补上『交付可验证』这块工程。
#DevTools#开源免费(自带模型接入,示例…
另有 2 家信源报道
展开详情

它解决的痛点是:AI 帮你写了一大堆代码,但你很难确认它到底有没有真把任务做完、改动是否偏离了你最初的意图——传统 Git 只按『文本行』记差异,AI 大改一片时你根本看不清逻辑上发生了什么。Aura 是一个 Git 原生、面向 AI 编码 agent 的 IDE:它把 agent 拆成 Planner(研究+写规格)和 Worker(执行),带仓库感知的上下文(语言感知的代码智能、本地 BM25 搜索、依赖上下文),最关键的是它对代码的 AST 做哈希、按函数和类级别追踪改动,再拿产出和你的『原始意图』对账,能在你提交前证明这个任务是不是真的完成了。

  • **按 AST 追踪、不是按行**:哈希抽象语法树而非文本行,逐函数/类级别追踪 AI 改动,给 AI 生成的代码提供逻辑级可溯源,AI 大改一片也看得清到底动了什么
  • **Planner/Worker 分工**:Planner 负责研究和写规格、Worker 负责执行,配合仓库感知上下文(语言感知代码智能 + 本地 BM25 搜索 + 依赖上下文),先规划后动手
  • **自举造出来**:5–6 月用同一套 harness 循环处理 20+ 亿 DeepSeek token、近 3 万次 API 请求,把自身代码库写了出来——本身就是『指挥 agent 交付』的活样本
推荐理由:对普通人,Aura 演示了一个正在成型的新工种能力:不是自己一行行敲,而是给 agent 定规格、看它执行、再验收它到底做没做到。它把『AI 写完你怎么知道对不对』这个所有人都头疼的问题,变成一个可操作的流程——规格在前,AST 级对账在后。哪怕你不用 Aura,这套思路也值得抄进自己的工作流:先把要做的事写成清楚的验收标准,再让 agent 干,最后拿产出逐条对标。它自举开发的故事更是个直白提示:一个人+一套会自我迭代的 agent 循环,已经能生出一个完整产品;2026 年个人开发者真正的杠杆,是会不会设计并指挥这种循环,而不是打字快不快。
#03
pymnts.com Article
NEW

TD 银行把房贷审批从 15 小时压到 3 分钟:不是买了最强模型,是把 agent 嵌进了审贷流程

加拿大 TD 银行上线了自家第一个用于房贷和 HELOC(房屋净值信贷)处理的 agentic AI 模型:自主 agent 会对客户文件分类、抽取关键信息、计算并核验客户收入、做同意检查、比对政策要求、找出前后矛盾,最后为核保员生成一份简明的申请摘要备忘。早期结果是把这道工序从平均 15 小时压到平均不到 3 分钟(约降 99.7%),同时结果更准、风险和单件审贷成本都更低。它由 TD 的 Layer 6 AI 研发中心联合科技、数据、地产信贷和风控团队一起做。这是一个『真实落地、有硬数字』的金融业案例:价值不来自模型多聪明,而来自把 agent 精确嵌进一条真实业务流程。
#行业应用
另有 2 家信源报道
展开详情
  • **15 小时 → 3 分钟**:房贷/HELOC 审贷备忘生成从平均 15 小时压到平均不到 3 分钟,约降 99.7%,且宣称结果更准、风险与单件成本同步下降
  • **做的是脏活不是炫技**:agent 负责文件分类、信息抽取、收入计算与核验、同意检查、政策比对、矛盾排查,最后产出给人类核保员的摘要——人仍在最终决策位
  • **自建团队落地**:由 TD 旗下 Layer 6 AI 实验室联合科技/数据/地产信贷/风控多团队共建,2026-05-21 正式发布,是银行业首批面向房贷全流程的 agentic AI
推荐理由:对普通人,这条案例的价值不在『银行又用了 AI』,而在它示范了『AI 真正省下 99.7% 时间』长什么样:不是换了个更强模型,而是把 agent 拆进一条具体流程里、让它干分类核验对账这些又累又标准化的脏活,人只守在最终判断上。这正是当下最值钱、也最缺人的能力——把某个行业的真实工作流拆开,找到那段『重复、规则清晰、量大』的环节,用 agent 接管。你不需要造模型,只需要比别人更懂某个业务流程的每一步在干嘛。谁能把这种『流程拆解 + agent 嵌入』的活干利索,谁就是 TD 里 Layer 6 那批人,也是下一条里说的 FDE。想在 AI 时代增值,选一个你熟的行业,去拆它的流程,比追模型榜单实在得多。
#04
codeant.ai Article
NEW

SWE-bench Verified 被刷穿到 95%+、连 OpenAI 都弃榜转投 Pro:编码榜单还能信吗,该看什么

到 2026 年 7 月,SWE-bench Verified 这个曾经最权威的编码基准已经被头部模型刷到饱和,前排挤成一团、彼此只差一两个百分点,区分度基本失效。更值得注意的是 OpenAI 已停报 Verified 分数、转而推荐更难的 SWE-bench Pro,理由是训练集数据泄漏让 Verified 越来越不可信。换句话说:当一个榜人人接近满分,它就不再能告诉你谁更强,反而可能在误导选型。这是一篇关于『榜单饱和与方法论』的提醒,而不是又一次『谁第一』的排名。
#评测
另有 2 家信源报道
展开详情
  • **对比**:SWE-bench Verified(2026-07)GPT-5.6 Sol 96.2% vs Claude Mythos 5 95.5% vs Claude Fable 5 95.0% vs Kimi K3 93.4% vs Claude Opus 4.8 88.6%——前四名挤在 1 个百分点带里,榜单已基本分不出高下
  • **OpenAI 自己弃榜**:OpenAI 停报 SWE-bench Verified、改推更难的 SWE-bench Pro,公开理由是训练集数据泄漏让 Verified 分数越来越不可信
  • **饱和≠等价**:分数贴脸不代表体验相同,真实差距转移到了成本/延迟、长程任务稳定性、工具调用与代码库理解上——这些恰恰是单一 Verified 分数量不出来的
推荐理由:对开发者和普通人,最该改的是选型习惯:别再盯着『SWE-bench 谁 96 谁 95』做决定了。当头部模型都在 95% 上下,Verified 分数对你几乎没有区分意义,OpenAI 自己都不报了。现在该看的是四件量榜量不出来的事——每任务成本与延迟(高频调用时差距被放大很多倍)、长程/多步任务的稳定性、工具调用与仓库理解能力、以及能不能在你的真实代码库上跑通。实操建议:拿你自己 3–5 个最典型的任务,让候选模型各跑一遍,比价格、比稳定、比在你项目里的实际表现,而不是抄榜。会自己设计小规模私测、看穿『饱和榜单』的人,才不会被营销数字牵着走。
#05
getperspective.ai Article
NEW

更新:FDE『1500 人调查』给出实测画像——一半时间在客户现场,落地卡在人不在模型

更新:在本栏此前介绍过『FDE 是 2026 最抢手 AI 岗』之后,这次的增量是一份对 1500 名 FDE 的实测调查,把这个岗位从概念落成了可量化的画像。关键新数据:FDE 每周中位约 47% 的时间是面向客户的(访谈、驻场部署、设计评审),31% 在写交付代码,22% 在内部协调——也就是说,一半时间根本不在敲键盘,而在把模型能力翻译成客户业务。配合此前的行情:FDE 岗位一年暴涨 729%、前沿实验室资深 FDE 中位总包约 48.5 万美元、staff 级可过 72.5 万,企业 AI 试点约 95% 死在『落地』而非模型能力。
#FDE
另有 2 家信源报道
展开详情
  • **47/31/22 的时间账**:FDE 每周中位 47% 时间面向客户(访谈/驻场/设计评审)、31% 写交付代码、22% 内部协调——一半时间在把模型翻译成业务,不是纯写码岗
  • **需求爆炸**:FDE 岗位一年暴涨 729%,Salesforce 公开承诺招 1000 名、EY 4 月起设专岗,Palantir/Databricks/Ramp/Rippling 都在建 FDE 团队
  • **钱在落地不在模型**:前沿实验室资深 FDE 中位总包约 48.5 万美元、staff 级过 72.5 万;企业 AI 试点约 95% 失败于『部署断裂』而非模型不行
推荐理由:对普通人,这份调查把 FDE 这个岗位从『听起来很酷』变成一张可照着练的能力清单。它最反直觉、也最该记住的一点是:这不是一个纯技术岗,一半时间在跟客户打交道、把对方的业务问题翻译成 agent 能执行的规格。也就是说,护城河是『技术 × 沟通 × 懂业务』的组合,而不是单纯代码写得快——这恰恰是很多只练编码的人忽略的方向。可落地的练法:挑一个你能接触到的真实场景(哪怕是帮朋友的小生意、公司某个部门),完整走一遍『搞懂他们的流程 → 设计一个 agent 方案 → 亲手部署跑通 → 拿结果验收』。把这套端到端交付经验攒出几个案例,你就具备了当下最稀缺、薪资最高的能力雏形,而它几乎不受下一个模型发布影响。
#06
arXiv Paper
NEW

Agora: Enhancing LLM Agent Reasoning Via Auction-Based Task Allocation

Agora 提出用『基于拍卖的任务分配』来提升多智能体(多个专家模型/工具协作)的推理能力:把每个子任务当成一件要拍卖的活,按各 agent 的『校准后能力减去成本』来出价竞标,谁性价比高谁接单。它的关键卖点是不需要端到端训练、也不需要访问那些闭源 agent 的内部——你手上一堆现成的专家模型和工具,Agora 负责在它们之间高效派活。这契合今天的主线:与其造一个万能大模型,不如把已有能力更聪明地编排起来。
给多智能体系统一套无需端到端训练、也不需窥探闭源 agent 内部的任务分配机制——用『拍卖』把活派给最合适的那个专家
#AI Agent
展开详情
  • **拍卖式派活**:把子任务当拍卖品,各 agent 按『校准能力 − 成本』出价竞标,系统据此把每段活派给性价比最高的专家,而非固定路由
  • **零训练、黑盒友好**:不需要端到端训练、也不需窥探闭源 agent 内部,直接编排一堆现成的专家模型与工具,落地门槛低
  • **编排 > 单体**:核心思路是让多个专才协作胜过一个通才独干,把重心从『模型多聪明』移到『任务怎么分配、成本怎么算』的调度工程
推荐理由:对普通人,这篇论文给的不是一段代码,而是一个思维框架:AI 时代做事,越来越像当『调度者』而不是『干活的人』。Agora 干的活——把一个复杂任务拆成小块、评估手上每个工具/模型『能力配得上、成本划不划算』、再把每块派给最合适的那个——恰恰是一个人指挥一队 AI 时该有的心智模型。你可以把它直接搬进日常:面对一个复杂任务,先拆解,再想清楚哪段用便宜快的小模型、哪段值得上贵而强的旗舰、哪段干脆自己上手,按『能力减成本』分配,而不是所有事都丢给同一个最贵的模型。这种『拆解 + 按性价比派活』的调度能力,是把 AI 用出杠杆的核心,也和前面 Mollick 说的判断力是同一件事。
#07
digitalapplied.com Article
NEW

2026 年 7 月开放权重大爆发:Kimi K3、DeepSeek V4、Inkling 把和闭源旗舰的差距压到约『一代以内』

2026 年 7 月开放权重模型集中爆发:Moonshot 的 Kimi K3(2.8 万亿参数、原生多模态、100 万 token 上下文)7 月 16 日发布,在 Artificial Analysis 的独立排名上已略微超过 Claude Opus 4.8、拿下 Frontend Code Arena 第 1、AA 智能指数总榜第 3;同一两周窗口里,Thinking Machines 以 Apache 2.0 放出 Inkling、DeepSeek V4 中旬发布、Mistral 开放新稀疏 MoE 家族、MiniMax M3 Pro 传出风声。业内的判断是:开放与闭源的差距现在大约只有『一代』,而不是过去的好几代。对个人而言,最强一档的模型正从稀缺变成随手可得。
#LLM/Model
另有 2 家信源报道
展开详情
  • **对比**:Artificial Analysis 独立榜上 Kimi K3 已略超 Claude Opus 4.8,拿下 Frontend Code Arena 第 1、AA 智能指数总榜第 3;DeepSeek V4.5、GLM-5.2、Inkling 在推理与编码上与闭源旗舰互有胜负
  • **两周五连发**:Kimi K3(2.8T,7/16)、Thinking Machines 的 Inkling(Apache 2.0)、DeepSeek V4(7 月中)、Mistral 新稀疏 MoE、MiniMax M3 Pro(2.7T)密集落地
  • **差距只剩一代**:开放 vs 闭源的能力差从『好几代』收窄到约『一代以内』,最强一档能力不再被少数闭源厂商垄断
推荐理由:对普通人,开放权重追平的最大意义是:顶尖模型能力正在从『向少数几家按 token 付费』变成『你能自己拿到、自己部署、成本可控』。这打开两层机会。第一层是省钱和自主:对隐私或成本敏感的场景,你可以把 Kimi K3、DeepSeek V4 这类开放权重模型跑在自己可控的环境里,不必被单一闭源 API 绑死。第二层更关键——当模型本身人人可得、彼此又差不多强,光有模型已经不值钱了,价值全部转移到你在它外面搭了什么:上下文工程、记忆、工具、把它嵌进业务的能力(也就是今天其它几条讲的事)。所以别把精力花在追『这周谁又第一』,把开放权重当成一个越来越便宜、越来越强的底座,去练在它之上搭系统、解决真实问题的本事。
#08
explainx.ai Opinion
NEW

Ethan Mollick

别再把大模型当成一本咒语书、指望靠某句提示词技巧点石成金了。该把它当成一个能干、但只会照字面执行的员工来管——给它清楚的目标、定义好要什么产出、立下质量标准、配上验收测试。提示词技巧的时代结束了,规格纪律的时代开始了。我们正从『外行用聊天机器人补短板』,走向『专家用 agent 把活干完』。
Mollick 在 2026 年 7 月的多篇文章里反复强调同一判断:随着模型变强,靠零散提示词『技巧』撬动效果的空间在消失,沃顿的受控实验也显示这些技巧在前沿模型上效果微弱且不稳定;真正能把 AI 用出效果的,是把需求写成清晰规格、给 agent 设定目标与验收标准、像管理一个照字面办事的能干下属那样管理它。这和今天其它几条是同一件事的不同侧面——当模型不再是变量,会不会『指挥』它、能不能把要做的事讲清楚并验收,成了新的分水岭。
#AI Agent
另有 2 家信源报道
推荐理由:对普通人,这句话直接指出了 2026 年最该练、也最被低估的能力:不是背更多提示词模板,而是练『把任务讲清楚 + 定验收标准 + 会管一个照字面执行的下属』。它的反直觉之处在于——当模型越来越强,提示词技巧反而越来越不值钱,因为强模型不再需要你哄它;它需要的是你把需求、边界、质量线说明白。这其实是一种管理能力,很多没带过团队的人天然是短板。可落地的练法:下次让 AI 做事,别只写一句话,试着像给新员工派活那样写清楚——目标是什么、产出长什么样、什么算合格、给两个正例两个反例。你会发现产出质量的天花板,几乎完全由你把需求讲清楚的能力决定。这套『写规格、定标准、验收』的判断力,是当下最不容易被下一个模型抹平的个人护城河。
仍在热榜 1
Repo DeusData/codebase-memory-mcp 在榜 3d 它解决的痛点是:AI 编码 agent 想读懂一个大代码库,默认只能一个文件一个文件地翻,上下文瞬间被撑爆、token … DevTools