📅
Hall of Fame
Hall of Fame
Track
Type
Source
7月25日 周六 · 8 条
今日趋势综述
今天最响的信号不是'又一个更强的 agent',而是'怎么管住 agent':史上增长最快的开源 agent OpenClaw 五个月冲到约 35 万星、却也压着 138+ 个 CVE,Alterion 拿出企业级 agent 运行时治理控制面 Draco,arXiv 把 LLM agent 的六大失败模式做成统一分类,连 Simon Willison 这批人都在把'改 harness 而不是改 prompt'讲成方法论——生成越来越便宜,真正稀缺的是让 agent 在生产里可控、可治理、可信;与此同时 GPT-5.6 Sol 用约三分之一成本逼近榜首 Fable 5,模型竞争的重心也从'谁最聪明'转向'谁最划算'。
今天的信号:AI 的下半场,从'造 agent'转向'管住 agent'

把今天的信号连起来看,会发现一条很清晰的主线:agent 能不能干活已经不是问题,能不能在生产里管住它才是问题。史上增长最快的开源项目之一 OpenClaw——一个自托管、能自己写代码给自己加技能的自主 agent——五个月冲到约 35 万星,但同一时间它背上了 138 个以上的已知 CVE,其中 CVE-2026-25253(CVSS 8.8)能通过浏览器远程拿到网关管理员权限,自托管者要靠自己手动追补丁,实测补丁窗口是'几天到几周',攻击就落在这个缝里。这不是个例,而是整个行业的缩影:Alterion(创始人分别是前麦肯锡合伙人和前 Google 工程 VP)本周直接推出企业级 agent 运行时治理控制面 Draco,实时看住每一次 prompt 和动作、在高风险操作前用可编程护栏拦下来,对标的正是 SOC 2、ISO 42001、欧盟 AI 法案这些合规框架;arXiv 的《Beyond the Leaderboard》把 2023–2026 的 27 篇评测/审计论文综合成 LLM agent 的六大失败簇(工具调用错误、规划失败、长程退化、多智能体协调、安全、度量失真);Simon Willison、Martin Fowler、Mitchell Hashimoto 这批人则把结论提炼成一句话——agent = 模型 + harness,agent 犯错时别去改 prompt,去改它周围的系统让这个错误结构上不可能再犯。

模型这条线也在变。GPT-5.6 Sol 落地,在 Artificial Analysis 智能指数上以 58.9 紧咬榜首 Claude Fable 5 的 59.9、领先 Kimi K3 的 57.1,但真正的看点是它用大约三分之一的成本做到——竞争的重心正从'谁的峰值最聪明'转向'同样的活谁最划算'。而产业侧的钱,从来只认'落得下去':BMW 用 AIQX/GenAI4Q 把 AI 质检铺到全球每座工厂、缺陷率降约 37%,靠的不是买最强模型,是把 AI 嵌进质检流程、连微观划痕和装配偏差都盯住。一句话,价值不在'能生成',在'能可靠地跑在真实业务里'。

对普通人,今年最该练、也最不容易被下一个模型抹平的能力,已经不是'会调哪个 AI',而是'能把 agent 治理好、落地好'。具体三条路:一是往'治理/加固'走——会给 agent 上护栏、追 CVE、做可观测和审计的人,正在变成企业刚需(Draco 这类控制面、OpenClaw 的托管加固都是新生意);二是把你的领域纪律产品化——像 tonsofskills 那样带校验流水线的 skills 市场证明,值钱的不是技能数量而是'带质量闸门的判断';三是做那个把 AI 真正落进一门乱糟糟真实生意的人,哪怕小到给本地 HVAC 老板做一个'永不漏接电话'的 AI 前台(NeverMiss,$500/月/门店起)。生成在贬值,管得住、落得下的判断力在升值。

#01
en.wikipedia.org Repo
★ 355,000 NEW

OpenClaw(自托管自主 agent)

把 OpenClaw 放进今天这条主线,它同时代表了 agent 的两面:能力的极致和失控的风险。一面是增长神话——5 个月约 35 万星,NVIDIA、DigitalOcean 都在写它意味着什么;另一面是安全危机——它已被追踪出 138 个以上的 CVE,其中 CVE-2026-25253(CVSS 8.8)能通过一个恶意网页泄露网关鉴权 token、进而拿到完整管理员权限并远程执行代码。自托管者要自己盯 138+ 个 CVE、手动打补丁、审每一个 ClawHub 第三方技能、维护 nginx/SSL,实测补丁窗口是'几天到几周'而非几小时——攻击正落在这个缝里。它几乎是本周所有'治理 agent'话题的现实注脚:一个能自己写代码、全接管你机器的自主 agent 一旦不设防,威力有多大、风险就有多大。
#AI Agent#Python / TypeS…
另有 3 家信源报道
展开详情

OpenClaw 是一个免费开源、自托管的自主 AI agent 运行时:自带记忆、能跨会话记住偏好、能在你机器上真正执行任务,还能'自我改进'——自己写代码给自己新增技能来完成你要的活。它以消息平台(Telegram/Discord/WhatsApp)为主界面,支持接入几乎所有主流大模型(Claude、GPT、Gemini、DeepSeek 等),主打'不把数据经过第三方、全部跑在自己基础设施上'。正是这套'本地自治 + 自我进化 + 全接管你的应用'的组合,让它在 5 个月内冲到约 35 万星,被很多人当成最接近'个人 AGI 助手'的开源项目。

周增长:2026 年 1 月底随 Moltbook 一同爆红后持续高速增长,长期霸占 Trending;本周热度集中在'增长神话 vs 安全危机'的讨论上

  • **增长神话**:自托管、能自我进化的自主 agent,约 5 个月冲到约 35 万星,被多方称为 GitHub 史上增长最快项目之一,接近'个人 AGI 助手'的开源形态
  • **安全危机**:已追踪 138+ 个 CVE,CVE-2026-25253(CVSS 8.8)可经恶意网页泄露网关 token 拿到管理员权限并远程执行代码;自托管补丁窗口实测'几天到几周'
  • **催生新护栏层**:围绕它已长出 NanoClaw(强制 Docker 沙箱 + 权限白名单)、Cisco DefenseClaw(技能扫描 + MCP 流量拦截)、Lakera Guard(<50ms prompt 注入检测)等一整套加固方案
推荐理由:OpenClaw 给普通人的启发不是'快去装一个自主 agent',恰恰相反:它证明了一个正在爆发的新岗位/新生意——'帮别人把 agent 管住'。当一个能自我进化、全接管机器的 agent 有 138 个 CVE、补丁窗口按周算,绝大多数自托管者根本盯不过来。这里的机会很具体:一是做'托管 + 加固'服务(像 OneClaw 那样帮人跑一个持续打补丁、沙箱隔离、技能审查过的实例),面向不愿自己维护安全的中小团队按月收费;二是成为'agent 安全'这个细分方向的懂行人——会做沙箱隔离、CVE 追踪、技能供应链审查、MCP 流量管控,这类技能在企业里正从'加分项'变成'刚需'。一句话:越是自主、越强的 agent,越需要有人替它兜底安全,而这正是稀缺、可收费、且不容易被模型进步抹平的能力。
商机信号(加速):谁付钱:自托管 OpenClaw 却盯不过来 138+ 个 CVE 的中小团队与个人开发者、以及要在合规下用自主 agent 的企业安全团队 痛点:自主 agent 能自己写代码、全接管机器,一旦不设防威力=风险;补丁窗口按'天到周'算,自己维护安全成本高、还容易被 RCE 打穿 切入点:从一个垂直客群切入,提供'持续打补丁 + Docker 沙箱隔离 + ClawHub 技能供应链审查 + MCP 流量管控'的托管加固实例,按月订阅;先做安全,再谈能力
#02
artificialanalysis.ai Article
NEW

GPT-5.6 Sol 落地:以约三分之一成本逼近榜首 Fable 5,模型竞争转向'性价比'

OpenAI 新旗舰 GPT-5.6 Sol 落地,在 Artificial Analysis 智能指数(本轮共测 166 个模型)上排到很高的位置,但真正的看点不是它多聪明,而是它'多划算':它以约三分之一于榜首的成本,做到和顶尖模型几乎同档的智能表现。这把今年模型竞争的重心从'谁的峰值最高'明确推向了'同样一件活,谁的每 token 成本最低、延迟最好'。对绝大多数落地场景,第一名和第三名的智能差距只有一两分,但成本可能差三倍——这时该看的不是排行榜谁第一,而是'在我的任务上,达到够用的质量、谁最便宜'。
#评测
另有 3 家信源报道
展开详情
  • **对比**:Artificial Analysis 智能指数——Claude Fable 5 约 59.9 vs GPT-5.6 Sol 约 58.9 vs Kimi K3 约 57.1(166 个模型同一榜单),头部三家仅差约 1–3 分
  • **成本才是胜负手**:GPT-5.6 Sol 以约榜首三分之一的价格逼近第一名,把竞争从'谁最聪明'拉到'谁最划算';Sol 版本尤其针对最难的数学、科学、网络安全推理调优
  • **怎么选**:追求峰值智能/长程 agent 任务 → Fable 5;要在成本敏感的大规模场景(批量分类、抽取、客服、代码补全)跑得起 → GPT-5.6 Sol;开源自托管/数据不出境 → Kimi K3 这类开放权重
推荐理由:对开发者和想用 AI 的普通人,今天这条评测的实际含义是:别再把'用哪个模型'当成一个'选最强的那个'的问题,而要当成一个'按任务配模型'的成本工程问题。头部三家智能只差一两分、成本却能差三倍,意味着在你 80% 的日常任务(写邮件、抽结构化数据、跑批量分类、辅助编码)上,用便宜的 GPT-5.6 Sol 或开源 Kimi K3 就够,把最贵的 Fable 5 只留给真正需要峰值智能的长程 agent 任务。学会给不同环节配不同性价比的模型(路由/分层),是 2026 年一个能实打实省钱、又不容易过时的硬技能——因为无论谁登顶,'按性价比分配算力'的逻辑都不会变。
#03
GitHub Repo
★ 2,177 NEW

jeremylongshore/claude-code-plugins-plus-skills

把它和上周的 SkillsBench(4.7 万公开技能平均只有 6.2/12)对照看,价值就清楚了:技能生态最大的问题从来不是数量,而是质量参差、没有分发和校验的基建。这个项目最值钱的部分不是那 2,810 个技能本身(数量多反而要警惕注水),而是它带来的两件工程化设施——ccpi 这个技能包管理器(让你像装 npm 包一样装/更新技能),和那条强制所有技能过规范校验、密钥扫描、frontmatter 检查的流水线。它代表 skills 生态正在从'各家往仓库里堆 markdown'走向'有包管理、有质量闸门的软件供应链'。
#Skills#元技能#Markdown(SKILL…
另有 1 家信源报道
展开详情

这是一个面向 Claude Code(及 Codex/Cursor/Gemini CLI 等)的开源插件与技能市场:约 425 个插件、2,810 个技能、200 个 agent,配一个公开站点 tonsofskills.com 和一个命令行包管理器 ccpi。它想解决的不是'技能不够多',而是'技能太多太杂、良莠不齐'——所以每个上架插件都要过一条多层校验流水线:对照 Anthropic 官方规范和 AgentSkills.io 规范做 schema 校验、强制 8 字段企业级 frontmatter、Unicode 卫生检查、密钥扫描、以及机器规格影子校验。它本质上是在给'技能生态'补上包管理和质量闸门这两块基础设施。

周增长:持续更新中(近期版本 v4.33.0);配套 tonsofskills.com 市场与 ccpi 安装器同步迭代

  • **技能也有包管理器了**:ccpi CLI 让你像装依赖一样安装、更新、校验技能,配 tonsofskills.com 市场——把散落的 SKILL.md 变成可分发、可版本化的软件包
  • **质量闸门而非纯堆量**:每个上架插件强制过 schema 校验(对齐 Anthropic + AgentSkills.io 规范)、8 字段企业级 frontmatter、Unicode 卫生、密钥扫描,正面回应'技能泛滥、平均分只有 6.2/12'的行业痛点
  • **跨工具通用**:覆盖 Claude Code、Codex、Cursor、Gemini CLI 等多款 agent,一次上架多处可用,走的是 AgentSkills.io 开放标准
推荐理由:对想吃 skills 红利的普通人,这个项目的启发是'别只想着写技能,想想技能生态缺什么基建'。技能数量已经过剩,稀缺的是分发、校验、可信这三件事——谁能帮别人把技能'装得上、信得过、跟得上更新',谁就站在了价值链更高的位置。可落地的三个方向:一是给你所在垂直领域做一套'带校验、带 frontmatter 规范、密钥扫描过'的高质量技能包,用质量而非数量取胜;二是学会用 ccpi 这类工具把自己反复用的工作流打包成可复用、可分发的技能包,长期复利;三是关注'技能供应链安全'——技能里能藏密钥泄露和恶意指令,会做技能审查/扫描的人正变得抢手。在技能过剩的时代,做那个'管质量'的人,比做那个'堆数量'的人值钱。
#04
press.bmwgroup.com Article
NEW

BMW 用 AIQX/GenAI4Q 把 AI 质检铺到全球每座工厂:缺陷率降约 37%,赢在'把 AI 嵌进流程'而非买最强模型

今天轮到制造业。BMW 的 AIQX 是一套铺到全球每座工厂的 AI 质检平台:在传送带上嵌摄像头和传感器,实时分析图像与信号,当场发现并处理缺陷,缺陷率整体降约 37%。它靠神经网络区分'真缺陷'和'无害的正常波动'来消除误报,还能抓到人眼看不见的微观划痕、细微错位和装配异常;在丁格芬工厂甚至加了声学分析做'听诊式'质检。更值得注意的是雷根斯堡工厂的 GenAI4Q 试点——用生成式 AI 做'按情境定制'的质检,让质量检查能针对任意场景灵活配置。BMW 的配方和上周 TD 银行、Aviva 一脉相承:产业价值不来自买了最强大模型,而来自把 AI 嵌进真实业务流程的每一个环节。
#行业应用
另有 2 家信源报道
展开详情
  • **具体数字**:AIQX 铺到 BMW 全球每座工厂,AI 视觉质检使缺陷率整体降约 37%,并消除误报、抓出人眼不可见的微观缺陷
  • **多模态质检**:不止看——丁格芬工厂加入声学分析做音频质检;雷根斯堡 GenAI4Q 试点用生成式 AI 做按情境定制的柔性质量检查
  • **赢在流程而非模型**:价值来自把 AI 嵌进质检流程、实时拦截缺陷,而不是买一个更强的大模型——和银行/保险业的落地逻辑完全一致
推荐理由:对想在 AI 时代找机会的普通人,BMW 这个案例把'落地才值钱'讲得很直白:真正稀缺的不是'会用最强模型',而是'懂某个具体业务流程、能把 AI 精准嵌进那个环节'的人。制造业尤其如此——它的价值点极度依赖领域知识(什么是缺陷、哪些波动无害、装配公差怎么算),通用模型天然不懂,必须有懂行的人把它'调进'流程。可落地的方向:如果你在制造/质检/供应链一线,别等公司买个大平台,去做那个'把某道工序的质检/预测性维护用 AI 跑起来'的人——这类'既懂业务又会用 AI'的复合能力,正是企业最缺、也最难被外部工具替代的。
#05
arXiv Paper
NEW

Beyond the Leaderboard: A Synthesis of Tool-Use, Planning, and Reasoning Failures in Large Language Model Agents

这篇综述把 2023–2026 年 27 篇关于 LLM agent 的评测、分类和审计论文(覆盖 19 个不同基准)整合成一张统一的'失败地图',第一次把散落各处的证据拼成 agent 局限性的完整分类。它指出 agent 会以六种方式坏掉:(1) 工具调用与参数级错误、(2) 规划与约束满足失败、(3) 因上下文累积导致的长程退化、(4) 多智能体协调失败、(5) 对抗或防护不足下的安全失败、(6) 度量本身失真(榜单分数不等于真实能力)。它的价值在于把'agent 不靠谱'这句模糊的抱怨,拆成六个可定位、可针对性防御的具体故障簇——正好呼应本周 OpenClaw 的安全危机和 Draco 这类治理工具。
首个把 2023–2026 跨 27 篇评测/审计论文、19 个基准整合成统一'agent 失败分类'的综述,给'agent 到底会怎么坏'提供一张系统地图
#AI Agent
另有 1 家信源报道
展开详情
  • **六大失败簇**:工具调用错误 / 规划失败 / 长程退化 / 多智能体协调失败 / 安全失败 / 度量失真——给'agent 会怎么坏'建了一张系统地图
  • **度量失真是重点警示**:榜单高分 ≠ 生产可靠,这一条直接说明为什么本周会同时出现'刷穿的基准'和'138 个 CVE 的明星项目'
  • **从抱怨到工程**:把'agent 不靠谱'拆成可定位、可针对性设护栏的故障类型,是做 harness 工程和 agent 治理的对照清单
推荐理由:对正在搭 agent 的人,这篇论文最实用的用法是当成一张'风控检查清单':搭之前对照六个失败簇逐条问自己——工具调用参数会不会错?规划会不会违反硬约束?跑长了会不会退化?多个 agent 会不会互相踩?防护够不够抗对抗?我拿来验收的指标是不是被刷穿的假榜?普通人从中该学到的元能力是:在 agent 时代,最值钱的不是'让它跑起来',而是'预判它会怎么坏、并提前在系统里堵住'。这正是从'会用 agent'升级到'能把 agent 交付到生产'的分水岭,也是最不容易被下一个模型抹平的能力。
#06
alterion.ai Product
NEW

Alterion Draco:企业级 agent 运行时治理控制面

Alterion 于 7 月 16 日推出 Draco,一个面向企业 AI agent 的运行时治理控制面。它解决的痛点很现实:企业在生产里疯狂上 agent,却没有一个统一的地方看清'这些 agent 在干什么、为什么这么干、怎么在运行时管住它们'。Draco 实时观测每一次 prompt 和动作、给 agent 行为建模,并用可编程护栏在高风险操作发生之前拦下来——而且不需要改代码。它对标的正是传统 APM/安全工具管不到的地方:它们能采日志和指标,却抓不到 agent 的意图和行为,在 SOC 2、ISO 42001、欧盟 AI 法案这些框架下留下治理空白。它是本周'管住 agent'这条主线里最直接的商业化产物。
#DevTools#企业级 SaaS(面向在生产…
另有 1 家信源报道
展开详情
  • **运行时拦截而非事后审计**:实时观测每个 prompt 和动作,在高风险操作执行前用可编程护栏拦下,而不是出事后翻日志
  • **免改代码接入**:跨云、跨厂商、跨端点统一治理,不要求改动 agent 代码,降低企业落地门槛
  • **对齐合规框架**:直指 SOC 2、ISO 42001、欧盟 AI 法案的治理空白——传统 APM/安全工具能采指标却抓不到 agent 意图与行为
推荐理由:Draco 的出现,给普通人指了一个正在成型的高价值方向:'agent 治理/可观测'。当企业把 agent 推进生产,'看得见、管得住、能合规'立刻从锦上添花变成不可回避的刚需——而这块人才和工具都严重稀缺。可落地的启发:一是技能上,学 agent 可观测(每次 prompt/动作的追踪)、护栏设计(高风险动作前的策略拦截)、以及 SOC 2/ISO 42001/欧盟 AI 法案这些合规映射,正在成为企业抢手的复合技能;二是产品上,Draco 走的是'控制面'路子,但更细分的场景(某个行业的 agent 合规、某类高风险动作的护栏模板)仍留着大量给小团队的缝隙。生成 agent 越来越容易,治理 agent 才刚开始,这是个能长期吃的方向。
商机信号(加速):谁付钱:在生产环境跑 AI agent、又要过 SOC 2/ISO 42001/欧盟 AI 法案合规的企业(尤其金融、医疗、保险这类强监管行业) 痛点:agent 已上生产,但看不清它在干什么、为什么这么干,传统 APM/安全工具抓不到 agent 意图,高风险动作没有运行时拦截,留下审计与合规空白 切入点:不与 Draco 拼大而全的控制面,切一个垂直行业或一类高风险动作,做'开箱即用的护栏/合规模板 + 可观测'轻量方案,帮中小团队先满足一个具体合规要求
#07
simonwillison.net Opinion
NEW

Simon Willison(及 Martin Fowler、Mitchell Hashimoto 等)

一个 agent 的本质,就是'在循环里调用工具去达成目标',功力全在你怎么设计那些工具和那个循环。agent 每次犯错,别指望它下次自己变好——去改造它所处的环境,让这个错误结构上不可能再以同样方式发生。
这句话把 2026 年 agent 工程界逐渐达成的共识浓缩成一个词:harness(框架/挽具)。Martin Fowler 把它公式化为'Agent = 模型 + harness'——harness 是模型之外的一切:指令、传感器、工具链管理、记忆系统、生命周期管理;Mitchell Hashimoto 则在 2026 年初把心法讲透:agent 每犯一次错,就去改造环境让它没法再犯同样的错,而不是去改 prompt。放到今天这条主线里,这正是 OpenClaw 安全危机、《Beyond the Leaderboard》六大失败簇、Draco 运行时护栏共同指向的方法论内核:可靠的 agent 不是'调'出来的,是'围'出来的。
#AI Agent
另有 2 家信源报道
推荐理由:对每个想真正把 AI 用出生产力的人,这句话是今年最该内化的一条心法:当 AI 出错时,不要一头扎进'再改改 prompt'的死循环,而要往后退一步问'我怎么改造它周围的系统(工具、约束、校验、反馈回路),让这个错误根本不可能再发生'。这是一次思维方式的升级——从'调教一个不可靠的天才'转向'给它搭一套让它不得不靠谱的脚手架'。具体到练习:给你的 AI 工作流加自动校验(跑不过测试就不算完成)、给高风险动作加确认闸门、把反复出的错固化成规则而不是每次靠提醒。掌握'设计 harness'而非'堆砌 prompt'的人,做出来的 AI 系统才真正可靠、可交付——而这正是把 AI 从玩具用成生产工具的分水岭。
#08
nevermisshq.com Product 值得关注
NEW

NeverMiss:给本地家政/维修生意做'永不漏接电话'的 AI 前台

NeverMiss 是一个很典型、也很可复制的'用 AI 帮小微生意挣现金流'的样本:给 HVAC、水暖、屋顶等家政维修公司做一套 AI 语音前台 + 全流程自动化——AI 电话接听(声音接近真人)、漏接来电捕获、线索跟进、报价催单、CRM 同步、外呼营销,能接 ServiceTitan、Housecall Pro、Jobber、GoHighLevel、Google Sheets 等常见系统。它踩中的痛点非常实在:家政类生意最多会漏接高达 62% 的来电,而一通漏接可能就是 $500–2000 的活飞了。$500/月/门店起、3–5 天上线,让老板算得清账:只要一个月因此多接住一两个活就回本。
#小微现金流#核心自动化(接听 + 跟进 …
另有 1 家信源报道
展开详情
  • **痛点用钱量化**:家政维修生意最多漏接 62% 来电,一通漏接约等于 $500–2000 的订单流失——'永不漏接'直接对应可算清的钱
  • **窄而深才活得下来**:只做家政维修一个垂类、只做'接电话+跟进+同步 CRM'这条链,而不是一个什么都干的通用 agent——production 里能活的都是窄的
  • **接得进现有工具**:对接 ServiceTitan/Housecall Pro/Jobber/GoHighLevel 等行业主流系统,$500/月/门店起、3–5 天上线,老板决策门槛低
推荐理由:对想用 AI 挣现金流的普通人,NeverMiss 给的不是'去买它',而是一张可复制的模板:找一个'漏一单就是几百上千块'的本地生意(家政、维修、诊所、律所、汽修),用现成的语音 agent 工具(Retell、Synthflow、ElevenLabs、Vapi 之类)给它做一个'只干一件事、但干到位'的 AI 前台,按月收费。真正的门槛不在技术——搭一个 demo 一两天就行——而在分发:你得能触达这些还在用 2005 年工作流的老板、讲清楚'一个月多接一个活就回本'。所以现在能切进去的最小切口是:锁定一个你有渠道触达的本地垂类,先给三五家做出'这个月因此多接了 X 单'的实证,再靠口碑复制。窄、实、算得清账,是这类现金流生意能跑起来的关键。
My Take:评分(5=最优):最快成交 4 / 最低成本 4 / 可复制 5 / 风险安全度 4。用现成语音 agent 工具给本地家政生意做'永不漏接电话'的窄前台,按月收费——门槛在分发不在技术。
商机信号(加速):谁付钱:美国/欧洲 6200 万还在用老式工作流的本地小微生意,尤其 HVAC、水暖、屋顶、汽修、诊所这类'漏一通电话就丢几百上千块'的家政/服务业老板 痛点:最多漏接 62% 来电、下班/忙时没人接,一通漏接约 $500–2000 订单流失;请全职前台贵,老板既不懂也没空自己搭 AI 切入点:锁定一个你有渠道触达的本地垂类,用现成语音 agent 工具做'只接电话+跟进+同步 CRM'的窄前台,按月收费;先给三五家做出'本月多接 X 单'的实证再靠口碑复制,重点在分发不在搭建
7月24日 周五 · 10 条
今日趋势综述
今天登顶的不是新模型,而是一整套'管住 AI'的工具:Addy Osmani 的 agent-skills 冲到约 7.7 万星、herdr 让你在终端里盯住一群 agent、arXiv 首次给'无限 agent 循环'建检测、Nat Friedman 押注 agent 代码的可审计性;与此同时微软/AWS/OpenAI 正砸数十亿美元把'把 AI 落地进企业'的最后一公里工业化——AI 的稀缺能力正从'会生成'转向'能编排、能监督、能验证、能交付'。
今天的信号:AI 的价值正从'会生成'转向'管得住、落得下'

今天霸榜的几乎全是'驯服 agent'的工具,而不是又一个更强的模型。Addy Osmani(Google Chrome 资深工程师)的 agent-skills 冲到约 7.7 万星,把资深工程师的纪律(定义→计划→构建→验证→评审→交付)编码成技能让 agent 照做;herdr 两万星,做成'agent 版 tmux',一屏盯住十几个在跑的编码 agent 谁在干活、谁卡住;arXiv 的 IAL-SCAN 首次系统定义并检测'无限 agent 循环'这个会半夜烧光你 API 预算的失败模式(6549 个仓库里确认 68 处、精度 91.9%);前 GitHub CEO Nat Friedman 的 Entire 则赌'谁写的、为什么这么写'的可审计性,而不是生成本身,才是下一个开发者平台。它们指向同一句话:生成这件事正在被解决,真正稀缺的是'管住它'。

钱也在往同一个方向走。微软砸 25 亿美元、6000 名工程师成立'前沿公司',AWS 投 10 亿,OpenAI 完成第二笔部署收购(Northslope)——都在抢'把 AI 落地进企业'的最后一公里,背后是 MIT 那个扎心数字:95% 的企业生成式 AI 试点对利润零贡献,卡点不在模型强不强,而在落不落得下去。Aviva 给出了配方:不是买一个最强大模型,而是 80 个小模型 + 4 万小时员工再培训,换来投诉降 65%、年省 £60M。连评测的记分牌本身都变了——Artificial Analysis 把智能指数 v4.1 整个重构成以 agent 长程任务为主。而 colibri 那种'744B 塞进 25GB 内存的笔记本'虽惊艳,实测冷启动只有 0.05 token/秒、答 100 字要十几分钟,恰恰提醒你:'能跑'不等于'能用'。

对普通人,今年真正该练、也最不容易被下一个模型抹平的能力,不是'会用哪个 AI 工具',而是'能可靠地编排、监督、验证并交付 AI'。具体点:学会同时管一群 agent(herdr 这类),把自己的判断沉淀成 skills 而不是每次重新写 prompt(agent-skills),给成本和循环上护栏(别被无限循环烧钱),审计 agent 到底交付了什么,以及——收入最高的那一档——成为那个能把 AI 真正落地进一门乱糟糟真实生意的人(FDE,$220K–600K)。就连今天的现金流机会也是'监督一个记账 agent,而不是自己录票据'(Receiptor)。生成越来越便宜,判断、监督和最后一公里交付,才是价值和钱正在流向的地方。

今日新增 9
#02
GitHub Repo
★ 19,600 NEW

ogulcancelik/herdr

herdr 之所以本周登顶,是因为它精准踩中了一个正在冒头的新痛点:当个人开始同时跑好几个编码 agent,瓶颈就从'agent 能不能写代码'变成了'我能不能盯住这一群 agent'。以前你开一个 Claude Code 就够忙,现在可能同时挂着三四个在改不同分支、跑不同任务,谁卡住了、谁在空转、谁需要你拍板,全靠来回切窗口盯——herdr 把这件事变成一屏可视、状态自动标注的'牧群面板'。它不造模型、不造 agent,只做'监督与编排'这一层,恰恰是 agent 数量变多之后最刚需、也最容易被忽视的一环。
#AI Agent#Rust(单个约 10MB …
另有 2 家信源报道
展开详情

herdr 是一个'专为 AI 编码 agent 打造的终端多路复用器'——你可以把它理解成'agent 版 tmux'。用过 tmux 会立刻上手,区别在于它会自动感知每个 agent 的状态:正在工作、被卡住、已完成、还是空闲,在侧栏一屏展示,不用装 hook 或插件就能识别 16+ 款编码 agent(Claude Code、Codex、Devin CLI 等)。它还提供一个 socket API,让 agent 之间可以互相 spawn、监控。作者是土耳其独立开发者 Oğuz Çelik,整个东西打包成一个约 10MB 的 Rust 二进制、零依赖,跑在你现有的任何终端里。

周增长:6 月 30 日登顶 GitHub Trending 第一,从 6 月底约 1.2 万星涨到本周约 1.96 万,单人开发

  • **agent 版 tmux**:像 tmux 一样管理多路会话,但额外自动标注每个 agent 的工作/卡住/完成/空闲状态,一屏盯住一群 agent
  • **零配置感知 16+ agent**:无需 hook 或插件即可识别 Claude Code、Codex、Devin CLI 等 16 款以上编码 agent 的实时状态
  • **单文件、零依赖**:约 10MB 的 Rust 二进制、非 Electron,跑在你现有终端里;6 月 30 日登顶 Trending、单人开发做到约 1.96 万星
推荐理由:对普通开发者,herdr 代表一个值得早点上手的方向:从'会用一个 agent'升级到'会编排一群 agent'。真正把个人生产力拉开差距的,不是你用的模型多强,而是你能不能像一个小团队 leader 那样,同时让三五个 agent 并行干活、你只做监督和拍板。给你的行动建议:先试着把一个较大的任务拆成几条可并行的子线(比如一个改前端、一个写测试、一个查文档),用 herdr 这类工具同屏管理,练'监督与调度'这块肌肉。这正是当下从'AI 使用者'走向'AI 编排者'的最低门槛入口——而编排能力,比会用某个具体工具更难被下一个模型抹平。
#03
arXiv Paper
NEW

When Agents Do Not Stop: Uncovering Infinite Agentic Loops in LLM Agents

这篇给'管住 agent'补上了最实用的一块:怎么防止 agent 停不下来。作者提出并研究了'无限 agent 循环'(Infinite Agentic Loops, IAL)——当反馈路径没有被有效约束时,agent 会不断重复调用模型、工具、工作流转移或 agent 交接,把一次普通请求放大成长时间的模型与工具狂跑,导致成本耗尽、模型被拒服务(DoS)、上下文无限增长和外部副作用被反复触发。它不是普通的程序死循环,而是 agent 逻辑、框架语义、运行时观测和终止机制交互出来的新物种。团队做了个静态分析工具 IAL-SCAN,在 6,549 个真实 agent 仓库上扫描:报出 74 个可疑点,人工复核确认其中 68 处是真实 IAL 失败、分布在 47 个项目,精度 91.9%。
首次系统定义并可检测'无限 agent 循环'(IAL)这一会烧光预算、触发模型 DoS、上下文爆炸的新失败模式,正撞上人人开始放任 agent 自主长跑的当口
#AI Agent
展开详情
  • **烧钱的隐形失败**:IAL 会把一次请求放大成通宵狂跑,直接后果是 API 预算被耗尽、模型被 DoS、上下文爆炸——这正是很多人半夜账单暴涨的元凶
  • **规模化实证**:在 6,549 个真实 agent 仓库上扫描,确认 68 处真实无限循环、覆盖 47 个项目,检测精度 91.9%,说明这不是个别 bug 而是普遍隐患
  • **给出可用工具**:IAL-SCAN 把异构 agent 代码抽象成框架无关的中间表示、建'agentic 循环依赖图'来找出无界反馈路径,是可落地的护栏起点
推荐理由:对任何在跑自动化 agent 的普通人,这条是最直接的省钱课:给 agent 自主权之前,先给成本和循环上护栏。使用侧——设置最大步数/最大花费/超时上限,别让一个 agent 在你睡觉时无限重试;在隔离环境里先跑一遍、观察它会不会打转。机会侧——'agent 可靠性'正在从论文变成产品需求:谁能做出好用的 agent 护栏、成本熔断、循环检测、可观测面板(就像 herdr 之于监督),谁就卡住了 agent 时代一个又硬又新的位置。别只追更强的模型,学会给它装刹车和仪表盘——这块的稀缺度和护城河,比追模型高得多。
#04
winbuzzer.com Product
NEW

Entire:前 GitHub CEO Nat Friedman 的 git 原生 AI agent 平台,本周开放 Git 网络预览、开源 Checkpoints

前 GitHub CEO Nat Friedman 的新公司 Entire 本周开放了面向 AI 编码 agent 的 Git 网络预览,并开源了首个产品 Checkpoints。它的核心赌注和今天的主线一致:当越来越多代码由 agent 写出,'谁/什么写的、为什么这么写'的可信与可审计,会比生成本身更重要。Checkpoints 会把 agent 提交的每一段代码,自动和产生它的完整上下文(prompt、会话记录)配对留痕,相当于给 AI 写的代码建一条 git 原生的审计轨迹。整个平台设想由三块组成:统一 AI 产出代码的 git 兼容数据库、让多个 agent 协作的语义推理层、以及为'人-agent 协作'设计的原生界面。此前 Entire 拿下 $60M 种子轮、约 $300M 估值(Felicis 领投),投资人名单里有 Jerry Yang、Garry Tan、Gergely Orosz 等。
#DevTools#预览阶段;首个产品 Chec…
另有 2 家信源报道
展开详情
  • **押注可审计而非生成**:Checkpoints 把每段 agent 代码与产生它的 prompt / 会话上下文自动配对留痕,解决'这段 AI 代码谁写的、为什么'的信任问题
  • **git 原生的 agent 平台**:设想用 git 兼容数据库统一 AI 产出、加语义层让多 agent 协作,把 git 从'人协作'扩展到'人-agent 协作'
  • **重量级背书**:前 GitHub CEO 操刀,$60M 种子轮、约 $300M 估值(Felicis 领投,Jerry Yang / Garry Tan 等参投),本周开放 Git 网络预览
推荐理由:对普通开发者,Entire 指向一个正在成形的新层:agent 代码的可信与审计。当你和团队提交的代码里越来越多是 agent 生成的,'能不能追溯每段代码的来龙去脉'会从加分项变成硬需求——尤其在受监管或对质量敏感的团队。机会有两层:使用侧,现在就养成给 agent 产出留痕的习惯(把 prompt、决策记录和代码一起提交),这会让你在协作和排错时比别人清楚得多;建设侧,'agent 代码审计、来源追溯、可信协作'这一层正被顶级玩家下注,谁能在具体行业/团队场景里把它做实做细,就卡住了一个又硬又新的位置。别只盯着让 agent 写更多代码,想想怎么让这些代码可被信任。
#05
geekwire.com Article
NEW

云厂商把 FDE 工业化:微软 $2.5B『前沿公司』、AWS $1B、OpenAI 二次收购,抢的都是'把 AI 落进企业'的最后一公里

这不是重复上周'FDE 是 2026 最抢手岗位'那条旧闻——过去三周里,FDE(Forward Deployed Engineer,前沿部署工程师)从一个稀缺角色,升级成了每家大厂用资本砸出来的一门正式生意。7 月 2 日微软宣布成立'前沿公司'(Frontier Company),投入 25 亿美元、6000 名嵌入式工程师住进客户内部去建、去跑 AI 系统(首批客户含 LSEG、联合利华、诺和诺德);6 月 30 日 AWS 承诺约 10 亿美元组建 FDE 团队,工程师以 5–6 人小队搭配 AI agent 协作(早期客户含 NBA、NFL);7 月 8 日 OpenAI 的部署公司完成第二笔收购(Northslope,继 Tomoro 之后),把部署队伍扩到'数百名'FDE。推动这一切的是 MIT Project NANDA 那个数字:95% 的企业生成式 AI 试点对利润零贡献——卡点从来不在模型强不强,而在落不落得下去。
#FDE
另有 3 家信源报道
展开详情
  • **三家同时下重注**:微软 $2.5B / 6000 人'前沿公司'、AWS 约 $1B FDE 团队、OpenAI 二次收购(Northslope)扩到数百 FDE——最后一公里被工业化
  • **驱动力是 95% 失败率**:MIT Project NANDA 发现 95% 企业 GenAI 试点零 P&L 回报,价值明显从'训练模型'迁移到'把模型落进乱糟糟的真实业务'
  • **薪资锚点清晰**:OpenAI FDE 中级约 $220K–280K(旧金山),大盘中级总包约 $300K–450K、staff/principal $600K+,是本季度正在被大量创造的岗位
推荐理由:对个人,这是今年最值得对齐的职业信号:真正在涨薪、在扩招的,不是'会训模型'的人,而是'能把 AI 落进一门真实生意并跑出结果'的人。这套技能栈现在很明确、也很难速成:生产工程能力 + 评测工程(会搭幻觉/回归测试套件)+ 客户面判断力(是'工程师-外交官',不是售前或客户成功)。想切进去,别只堆算法,去练'能独立扛下 discovery(摸清客户业务)→ 集成 → 60–180 天落地维护'的全流程交付。哪怕你不进大厂,把自己定位成'能帮中小企业把某个 AI 用例真正跑通、并对结果负责'的人,也是当下最稀缺、最值钱的位置之一。
商机信号(加速):谁付钱:大厂(微软/AWS/OpenAI)及其付费企业客户,正为'把 AI 落地进业务'的交付能力开出 $220K–600K 年薪 痛点:95% 企业生成式 AI 试点对利润零贡献,模型能力买了却落不了地、跑不出可衡量的 P&L 结果 切入点:把自己训练成能独立完成'摸清客户业务→集成→60–180 天落地维护'的 FDE 型交付者;起步可从帮 1 家中小企业把一个具体 AI 用例跑通、对结果负责做起,先攒可展示的落地案例
#06
artificialanalysis.ai Article
NEW

评测风向变了:Artificial Analysis 把智能指数 v4.1 重构成'以 agent 为主',同一榜单三大模型这样排

被广泛引用的第三方综合评测 Artificial Analysis 把它的'智能指数'升级到 v4.1,核心是整个重构成以 agent 长程任务为主:新权重为 Agents 34% / Coding 24% / Scientific Reasoning 24% / General 18%,把 Terminal-Bench Hard 升级到 2.1、把 τ²-Bench Telecom 换成更难的 τ³-Bench Banking、把 GDPval-AA 升到 v2,并因'刷饱和'直接砍掉了 IFBench。权重最高的 GDPval-AA v2 还把 ELO 重新以'人类表现=1000'为基准,引入轮换的前沿模型评委,把 agent 轨迹的回合上限从 100 提到 250。这条的意义不在'谁第一',而在'记分牌本身变了':就算没有新模型发布,排名也会因为评测重心转向 agentic 而洗牌——读榜的人得先看它是怎么测出来的。
#评测
另有 2 家信源报道
展开详情
  • **对比(GDPval-AA v2 ELO,人类基准=1000,指数中权重最高的评测)**:Claude Fable 5(含 fallback)1818 vs Claude Opus 4.8 1638 vs GPT-5.5(xhigh)1531——注意 Fable 5 目前尚未开放使用
  • **记分牌重心转向 agent**:新权重 Agents 34% / Coding 24% / Scientific 24% / General 18%,回合上限 100→250,专门奖励长程 agentic 能力
  • **淘汰饱和基准**:Terminal-Bench 升 2.1、τ²-Telecom 换 τ³-Banking,IFBench 因刷满被移除——评测在主动'换更难的尺子'
推荐理由:对开发者,务实的读法不是记住'谁排第一',而是三点:一,看权重——v4.1 已把重心压到 agent 长程任务,若你干的是多步自动化,这个排序比旧的偏知识问答的榜更贴合你的活;二,看口径——同一基准换套评委、换个回合上限,分数就变,别拿不同版本的数字硬比;三,按场景选——GDPval-AA v2 上 Opus 4.8(1638)明显领先可用的 GPT-5.5 xhigh(1531),复杂长程 agent 任务优先 Opus 一档;日常改 bug、跑测试这类饱和区,挑便宜快的即可(Fable 5 虽榜首但还没开放,别把'不可用的第一'当选型依据)。更值钱的能力是:会自己搭一套贴合你业务的小评测集,而不是跟着别人的榜走。
#07
mckinsey.com Article
NEW

Aviva 用 80 个 AI 模型重做车险理赔:复杂案定责少 23 天、投诉降 65%、年省 £60M——赢在'小模型群 + 4 万小时再培训'

今天的垂直行业选保险——这是一个难得有硬数字、也有清醒方法论的一手案例。英国保险巨头 Aviva 联手麦肯锡 QuantumBlack,对车险理赔全流程做了一次彻底的 AI 改造,在理赔各环节部署了 80 多个 AI 模型。结果很硬:复杂案件的定责时间缩短 23 天,理赔分流准确率提升 30%,客户投诉下降 65%,净推荐值(NPS)涨了 7 倍多,公司告诉投资者仅 2024 一年就省下超过 £60M(约 $82M)。但真正的关键不是'模型多',而是它同时投入了 4 万小时做员工再培训:部署 80 个模型没有裁掉员工,而是把理赔员从'数据拼装和常规分流'解放出来,转去处理复杂、有争议、情绪化、真正需要人类判断的案子——员工敬业度因此翻倍。
#行业应用
另有 1 家信源报道
展开详情
  • **硬数字**:复杂案定责少 23 天、分流准确率 +30%、投诉降 65%、NPS 涨超 7 倍、2024 单年省超 £60M(约 $82M)
  • **赢在'小模型群'而非一个大模型**:80 个各司其职的专用模型串起理赔全流程,比押注一个最强大模型更稳、更可控
  • **4 万小时再培训是分水岭**:不是自动化替人,而是把理赔员转去做需要人类判断的复杂案,员工敬业度翻倍——落地成败在人不在模型
推荐理由:对想把 AI 落地进业务的人,Aviva 给了一个反直觉又极务实的模板:别指望一个最强大模型解决一切,把复杂流程拆成一堆'各管一段'的小模型/小 agent,再配上认真的人员再培训,效果反而更稳、员工更买账、投诉更少。这和今天 FDE 的主线是同一件事——落地成败几乎全在'最后一公里的执行与人的配合',而不是模型强弱。给个人的行动建议:如果你在某个传统行业(保险、金融、制造、物流),最值钱的切入点不是去追最新模型,而是把你熟悉的某条冗长流程拆解清楚、找出哪几步能用 AI 各自替一段、并想清楚人该怎么被重新安排——'懂业务流程 + 会拆解落地'的人,正是这类改造里最缺的。
#08
GitHub Repo
★ 18,300 NEW

JustVugg/colibri

这条既是惊艳的工程,也是今天'能跑 ≠ 能用'这条主线的最佳注脚。惊艳在于:单人、纯 C、两千行代码,就把一个 744B 大模型塞进了普通笔记本的内存预算,7 月 10 日发布后两周冲到约 1.8 万星、登上 HN 首页。但'catch'同样刺眼:因为每生成一个冷 token 要从磁盘读约 11GB,实测冷启动速度只有 0.05–0.1 token/秒——也就是十几到二十秒才蹦一个字,答一段 100 字的短回复要约 17–33 分钟。它证明了'技术上可行',但离'日常可用'还差得远。看热闹之外,它提醒你:一个漂亮的 demo 和一个能真正干活的工具,中间隔着实测的鸿沟。
#Infra#C(推理引擎为单个 C 文件…
另有 2 家信源报道
展开详情

colibri 是一个纯 C、零依赖的迷你推理引擎,主打一件很炸的事:让 744B 参数的 MoE 大模型 GLM-5.2 跑在只有约 25GB 内存的消费级机器上。原理是'磁盘流式加载专家':MoE 每个 token 只激活约 40B 参数,它把稠密部分(注意力、共享专家、embedding,约 17B)以 int4 常驻内存(约 9.9GB),其余路由专家全放磁盘、按需流式读入。整个运行时就是一个约两千行的 C 文件,可自行编译、指向本地推理,是一次相当极客的工程炫技。

周增长:7 月 10 日发布,约两周涨到 1.8 万星;登上 Hacker News 首页(730+ 分、180+ 评论)

  • **工程炫技**:纯 C、零依赖、约两千行单文件,用'磁盘流式加载专家'把 744B 的 GLM-5.2 跑在约 25GB 内存的消费级机器上
  • **catch 很大**:实测冷启动仅 0.05–0.1 token/秒(每个冷 token 触发约 11GB 磁盘读),答 100 字要约 17–33 分钟,离日常可用很远
  • **热度真实但要清醒**:两周约 1.8 万星、HN 首页 730+ 分,掌声里既有对 hacker 精神的欣赏,也有大量'这到底什么场景才划算'的追问
推荐理由:对普通人,colibri 是今年很好的一课:别被'惊艳 demo'直接带走,先问'实测能不能干我的活'。同一个能力,'技术上能跑'和'在你的场景下好用'之间常常差着几个数量级(这里是 token 速度差了近千倍)。养成看到新工具先查实测数据、跑一遍真实任务再下结论的习惯,本身就是 AI 时代的基本功——它能帮你省下大量追热点、装完发现没法用的时间。另一层机会:本地跑大模型的需求真实存在(隐私、成本、离线),但当前方案要么慢要么贵,谁能在'消费级硬件上把大模型跑到真正可用'这条路上做出工程突破,就是块难啃但值钱的硬骨头。
#09
modelcontextprotocol.io Article
NEW

MCP 2026-07-28 发布候选版:史上最大改版,协议核心转向无状态,从'项目'长成'生产基础设施'

MCP(模型上下文协议,agent 连接工具与数据的通用接口)发布了 2026-07-28 规范的发布候选版,维护者称这是协议自 2024 年 11 月诞生以来最大的一次改版——标志它从'有前途的项目'毕业成'生产级基础设施'。最重要的变化是协议核心转向无状态:以前客户端要走 initialize/initialized 握手、靠 Mcp-Session-Id 头绑定到特定服务器实例;新架构把协议元数据放进每个请求的 _meta 字段,于是可以直接部署在'普通的轮询负载均衡'后面,不再需要粘性路由或共享会话存储。此外还有 6 项授权安全增强(对齐 OAuth 2.0 / OIDC)、独立演进的扩展框架(Tasks、MCP Apps 用反向 DNS 命名独立版本)、以及让服务器可在沙箱 iframe 里渲染交互式 HTML 的 MCP Apps;Roots、Sampling、Logging 进入至少 12 个月的弃用周期。规范 5 月 21 日锁定,7 月 28 日正式发布。
#Infra
另有 1 家信源报道
展开详情
  • **核心转无状态**:协议元数据改放每个请求的 _meta 字段,去掉会话握手与粘性路由,可直接跑在普通负载均衡后面——为大规模生产部署铺路
  • **从项目到基础设施**:据第三方统计 MCP 已有 1 万+ 公开服务器、SDK 月下载约 9700 万,OpenAI/Google/微软/AWS 全部接入,这次是它'长大成人'的一次改版
  • **安全与扩展并进**:6 项授权增强对齐 OAuth 2.0/OIDC,新增可沙箱渲染 HTML 的 MCP Apps,扩展框架让能力独立演进;Roots/Sampling/Logging 启动弃用
推荐理由:对开发者,MCP 转无状态、走向生产基础设施,是个明确的'该认真学'的信号:agent 连接工具/数据的方式正在标准化并沉淀成底座,价值也在往'连接点'——agent 与工具之间的协议——聚集。给你的行动建议:一,如果你在做 agent 或集成,尽早按无状态、标准授权的新规范设计,别再依赖会话粘性等要被淘汰的老写法;二,'把一个有真实数据/能力的服务包成高质量 MCP server'正成为一种可复用、可分发的资产——就像当年写好一个受欢迎的库。别只当 MCP 的使用者,想想你手上有什么数据或工具,值得包成一个别人都想接的连接点。
#10
receiptor.ai Product 直接可用
NEW

Receiptor AI:把记账做成'你监督的 agent'——自动从邮箱抓票据、归类、同步 Xero/QuickBooks

今天选它做现金流机会,是因为它和主线'监督 agent 而非亲自动手'完全同频,而且是有真实定价、真实 PH 热度的产品,不是画饼。对想挣现金流的普通人,它的价值不在自己省几小时,而在'可被服务化':一个懂点记账的个人 / 虚拟助理 / 会计新手,可以用它给多个小微企业客户做代记账——agent 负责枯燥的票据录入归类,你负责复核和对客户负责。这类'AI 干脏活、人做监督和交付'的服务,成交快、启动成本极低,是当下最接地气的一条 AI 变现路径。
#小微现金流#$29/月起(不限连接邮箱)…
另有 2 家信源报道
展开详情

Receiptor AI 是一个专做'票据/凭证记账'的 AI agent:它自动从邮箱(及其他渠道)里把过去和现在的收据、发票全找出来,按上下文抽取数据、对照你的会计科目自动归类,再同步进 Xero / QuickBooks(也支持 Mercury、云存储、CSV 导出)。今年 7 月初上线的 Agent Mode 把它从'收据抓取器'升级成'一个你监督、而不是亲自做'的记账助手——数据录入和归类交给 agent,人只做复核。

  • **监督而非动手**:agent 自动抓票据、按科目归类、同步 Xero/QuickBooks,你从'手工录凭证'变成'复核 + 对客户负责'
  • **成本极低、按客户扩**:$29/月起、不限邮箱,14 天试用;给每个 SMB 客户建一套即可,工具成本几乎可忽略
  • **真实需求信号**:上线 Product Hunt 的 Agent Mode 约 483 票、评价集中在'省下每月好几个小时',说明小微记账自动化有真实付费意愿
推荐理由:对想挣现金流的普通人,这条给出一个可当天上手的最小切口:把'AI 记账'包成'代记账服务'去卖。小微企业主最讨厌、又不得不做的就是收集归类票据凭证——你用 Receiptor 这类工具把脏活自动化,再以每月固定费用(市面小微记账普遍 $200–500/月)接单,赚的是'监督 + 交付信任'的差价,而工具成本每户才 $29/月。行动建议:先用它把自己或一个熟人的账跑通、验证效果,再从你身边最容易触达的一类小生意(餐馆、工作室、独立商户)里找到第一个愿意付费的客户,用'我来盯、AI 来做'的方式接下来。切记 2026 年真正的坎不是'能不能做',而是分发——把精力压在找到并说服前几个付费客户上。
My Take:评分(5=最优):最快成交 4 / 最低成本 5 / 可复制 4 / 风险安全度 4。适合懂点记账、想用'AI 干活+人监督'的方式做代记账服务、快速接单赚差价的人。
商机信号(加速):谁付钱:小微企业主、独立商户、以及替他们记账的会计/虚拟助理(VA)——已有明确付费意愿,市面小微记账普遍 $200–500/月 痛点:手工收集、归类、录入票据和凭证极其耗时又易错,是小微老板最讨厌又不得不做的例行脏活 切入点:个人用 $29/月/户 的 Receiptor 把票据录入归类自动化,以'我监督、AI 干活'的代记账服务向每个 SMB 客户收 $200–500/月,赚监督与交付信任的差价;从身边一家愿付费的小生意接第一单起步
仍在热榜 1
Repo addyosmani/agent-skills 在榜 5d agent-skills 是 Addy Osmani(Google Chrome 资深工程师)开源的一套'生产级工程技能… Skills · 编程开发
7月23日 周四 · 8 条
今日趋势综述
xAI 被扒出 Grok Build 偷传整个代码仓库后 72 小时紧急开源;SWE-bench Verified 刷满后,同一模型在 SWE-bench Pro 上给出三套不同分数——今天的信号是:AI 工具越强,你越要学会验证它、而不是盲信它。
今天的信号:别盲信 AI 工具,学会验证它

今天最刺眼的一条,是 xAI 的编码 CLI Grok Build。一位安全研究者用抓包证明:它一边宣称『本地优先』,一边把你整个 Git 仓库(连提交历史里的密钥一起)打包上传到 xAI 的 Google Cloud 桶里——一个只需 192KB 就能完成的小任务,它传了 5.1GB,差了近 2.8 万倍。而那个大家以为是『数据开关』的『改进模型』选项,管的只是训练授权,根本拦不住代码外传。被曝光 72 小时后,xAI 才紧急开源、关闭默认留存、上线漏洞赏金。这不是个别厂商翻车,而是给所有人提了个醒:你往编码 agent 里塞的是公司最核心的源码,工具说什么不重要,它实际往哪发包才重要。

同一天,评测圈也在讲『别盲信数字』。SWE-bench Verified 被头部模型刷到 90%+ 后失去区分度,大家转看更难的 SWE-bench Pro——可同一个 Claude Opus,在 Scale 标准化公开集上是 51.9%,在厂商自报的聚合口径里却是 69.2%,换套脚手架能差十几个点。SkillsBench 更直接:4.7 万个公开 agent skills,平均质量只有 6.2/12,大多数是凑数的;但一套精挑的 skills 能把任务通过率从 33.9% 拉到 50.5%,医疗场景甚至暴涨 51.9 个百分点。数字不会自己说话,得看它怎么测出来的。

把这些串起来,普通人今年真正该练的能力,不是『会用哪个 AI 工具』,而是『会验证 AI 工具』:给编码 agent 上沙箱、抓它的网络出站、看它到底把代码发去哪;读评测先问是哪套基准哪个口径,别被一个漂亮百分比带走;用 skills、agent 前先验它在你的活儿上到底有没有效。会验证的人,才敢把真实业务交给 AI——这恰恰是 Khan Academy 在学校、独立开发者在小生意里真正跑通落地的分水岭。

今日新增 7
#01
GitHub Repo
★ 3,900 NEW

xai-org/grok-build

这条不是普通的『大厂开源编码工具』,而是一次被逼出来的信任修复。7 月 13 日,一位安全研究者用 wire-level 抓包证明:宣称『本地优先』的 Grok Build CLI,实际把用户整个被追踪的 Git 仓库(全部文件 + 完整提交历史,连提交进去的密钥一起)打包成 Git bundle,悄悄上传到 xAI 的 grok-code-session-traces Google Cloud 存储桶。在一个 12GB 测试仓上,它传了约 5.1GB / 73 个分块,而当时的任务只需约 192KB——相差约 2.8 万倍。更糟的是那个『改进模型』开关只管训练授权,压根拦不住代码外传。xAI 7 月 13 日服务端悄悄关掉上传、未发声明,直到 7 月 15 日才开源代码、把默认数据留存回溯关闭到 7 月 12 日、承诺删除已留存数据、并上线 HackerOne 赏金($100–$20,000),对外称『提供完整用户隐私』。
#DevTools#Rust(终端原生 TUI …
另有 3 家信源报道
展开详情

Grok Build 是 xAI 的终端原生 AI 编码 agent(就是 grok 命令背后那套),2026 年 5 月以 SuperGrok Heavy(每月 $300)内测起步,主打大代码库里的自主编码。它对标 Claude Code / Codex / opencode,含完整的 agent loop、读写代码的工具集、全屏可鼠标交互的 TUI,以及 skills / plugins / hooks / MCP 扩展体系。7 月 15 日 xAI 把它整个开源到 GitHub(Apache 2.0,Simon Willison 数了约 84 万行 Rust),号称可自行编译、指向本地推理、用 config.toml 完全本地运行。但它开源的真正导火索,是一桩安全事故——见下。

周增长:开源公告后一周内新增数千星,具体周增以 GitHub Trending / star-history 实时为准

  • **2.8 万倍的数据外传**:12GB 测试仓被上传约 5.1GB,而任务本身只需约 192KB,抓包实锤『本地优先』宣称为假
  • **隐私开关是摆设**:多数人以为『改进模型』能拦数据,实际它只管训练授权,代码照样离开你的机器进云桶——连提交历史里的密钥一并外传
  • **开源是危机公关**:被曝光约 72 小时后才开源(84 万行 Rust / Apache 2.0)、关默认留存、上赏金;代码可审计,但已上传数据的删除承诺仍未经第三方核实
推荐理由:对普通人,这是 2026 年最该记住的一课:你往编码 agent 里喂的是公司最核心的源码,工具嘴上说『本地优先』不算数,它实际往哪发包才算数。机会有两层。防守层:养成给 AI CLI 上沙箱、抓网络出站(一个简单的 mitmproxy / Little Snitch 就能看清它到底连了谁)、在隔离仓里先跑一遍再上真项目的习惯——这套『验证 AI 工具』的能力,正在从极客洁癖变成职场基本功。进攻层:企业现在极度缺『能审计 AI 工具数据流向、把 agent 安全落地进合规环境』的人,这类活儿(AI 供应链安全、agent 沙箱与出站管控)需求正在爆发、门槛高、也不容易被下一个模型抹平。别只学怎么用最新工具,学会怎么信任地用它——后者更稀缺、更值钱。
#02
labs.scale.com Article
NEW

Verified 刷满之后看 SWE-bench Pro:同一个 Opus 三套分数,编码榜单该怎么读

SWE-bench Verified 被头部模型刷到 88–95% 后失去区分度(昨天已聊过 OpenAI 干脆弃榜),大家转向更难、更贴近真实工程的 SWE-bench Pro。但 Pro 自己也开始『不可比』:同一个 Claude Opus,在 Scale 标准化公开集上只有约 51.9%,在 llm-stats 的厂商自报聚合口径里却是 69.2%,换套脚手架和数据划分能差十几个点。这篇把不同口径的分数摊开对齐,提醒开发者:一个漂亮百分比脱离了『哪套基准、哪个划分、什么脚手架』就没有意义。
#评测
另有 2 家信源报道
展开详情
  • **对比(同一基准 SWE-bench Pro · Scale 标准化公开集,2026-06-28)**:GPT-5.4 xHigh 59.1% vs Meta Muse Spark 55.0% vs Claude Opus 4.6 thinking 51.9%——头部只差个位数,且都远低于 Verified 的 90%+
  • **同模型三套数**:Claude Opus 在 Scale 公开集 51.9% / 厂商聚合口径(llm-stats)Opus 4.8 达 69.2% / Scale 私有商用集另一版本约 47.1%,口径决定结论
  • **Verified vs Pro 的落差**:从 Verified 的近乎满分掉到 Pro 的五六成,说明『真实工程任务』这道坎远没被跨过,别被饱和的旧榜误导
推荐理由:对开发者,务实的选法不是背排行榜第一名,而是学会问三个问题:这是哪套基准(Verified 已饱和、Pro 更能区分真实工程)?哪个划分(Scale 标准化公开集比厂商自报可比得多)?什么脚手架(换 harness 能差十几个点)?现在选模型,与其纠结谁在某榜领先一两个点,不如按活儿定:日常改 bug、跑测试,饱和区里几家都够用、挑便宜快的(开放权重能进一步压成本);真正长程、跨文件的硬任务,才值得为标准化 Pro 集上领先的那家多付钱。对想进 AI 的人,『会读评测、会自己搭一套贴合自己业务的小评测集』本身就是稀缺技能——比记住榜单值钱得多。
#03
arXiv Paper
NEW

Your Agent's Memories Are Not Its Own: Forged Reasoning Attacks on LLM Agent Memory and Defenses

越来越多 agent 挂上了持久记忆——把过往决策、推理过程、工具使用记录都存下来复用。这篇提出 FARMA(Forged Amplifying Rationale Memory Attack):不去篡改记忆里的事实,而是往里注入『看起来合理的伪造推理』。之后 agent 每次检索记忆做决策,都会被这段被污染的推理链带偏,且因为事实本身没错、很难被常规校验发现。论文同时给出攻击方法和初步防御,把『记忆安全』从理论担忧变成了可复现的实证问题。
首次系统性揭示『污染 agent 的记忆推理链、而非事实知识』这一新攻击面,正撞上编码/办公 agent 大规模挂载持久记忆的当口
#AI Agent
展开详情
  • **新攻击面**:污染的是『推理理由(rationale)』而非事实,绕过大多数只查事实一致性的防线
  • **放大效应**:被污染的推理被反复检索复用,一次投毒可持续影响后续多轮决策,越用越偏
  • **攻防成对给出**:不止提出 FARMA,还给了初步检测/缓解方案,为记忆型 agent 的安全设计提供起点
推荐理由:这条紧接昨天『给 agent 装代码记忆 MCP』的趋势——记忆是 2026 年 agent 的核心外设,但记忆也会被下毒。对普通人有两层意义。一是使用侧:当你给 Claude Code / Cursor 挂上跨会话记忆、共享的团队记忆库时,要意识到那是个新的攻击面,别把来路不明的『记忆包 / 共享上下文』直接灌进去。二是机会侧:agent 记忆的安全、审计、可信检索,正在从论文变成产品需求——谁能做出『可信记忆层』(带来源标注、推理链校验、污染检测),谁就卡住了 agent 时代一个又硬又新的位置。想做深水区的人,记忆安全比追模型更有护城河。
#04
the-decoder.com Article
NEW

首个 agent skills 基准 SkillsBench:4.7 万个公开技能,平均分只有 6.2/12

agent skills(SKILL.md 那套跨工具技能)这半年从一个注册表长到八个市场、号称跨约 40 款产品通用,但质量到底如何一直没人量化。SkillsBench 是首个系统性基准:分析了 47,150 个公开 skills,平均质量分只有 6.2/12——大多数是凑数的。但它也证明了好 skills 的价值:一套精挑细选的 skills 能把 agent 任务通过率从 33.9% 拉到 50.5%(+16.6 个百分点),且效果高度分领域——医疗暴涨 51.9pp(34.2%→86.1%),软件工程只涨约 4.5pp。结论很清醒:skills 有用,但『大部分公开 skills 写得不好』和『会写好 skill 的人很少』同时成立。
#Skills#元技能
另有 2 家信源报道
展开详情
  • **质量真相**:4.7 万个公开 skills 平均仅 6.2/12,市场繁荣 ≠ 质量繁荣,随手抄一个装上大概率没用
  • **对比(有无精选 skills)**:任务通过率 33.9% → 50.5%(+16.6pp);医疗 +51.9pp(34.2%→86.1%)vs 软件工程仅 +4.5pp——领域越专、增益越大
  • **元技能缺口**:真正稀缺的是『评估和写好一个 skill』的能力,这正是当前 skills 生态最薄弱、也最值钱的一环
推荐理由:对想吃到 skills 红利的普通人,这份数据把机会指向了非常具体的地方。第一,别做通用 skills 去挤那 4.7 万个平庸货,去做垂直领域的高质量 skills——医疗、法律、金融这类专业场景增益最大(医疗 +51.9pp),因为通用模型在这些地方最缺结构化的领域知识,而你恰好懂行。第二,『会评估 skill 好坏、会把领域 know-how 写成让 agent 真能用的 SKILL.md』这个元技能,本身就是当下最稀缺的技能——它比会调 prompt 门槛高、也更难被下一个模型抹平。一句话:在 skills 市场里,当那个『把专业知识产品化』的人,而不是又一个搬运工。
#05
khanacademy.org Article
NEW

AI 进课堂的真实成绩单:用够时长才有效,Khanmigo 单独效果仍待验证

教育是被吹得最凶、但落地最慢的 AI 垂直领域之一。今天挑它,是因为难得有带硬数字、也带清醒边界的一手证据。Khan Academy 的 AI 辅导 Khanmigo 已铺进 1.5 万+ 所学校、约 500 万用户;平台层面的效果有真实证据:每周用满约 1 小时的学生,在学年末数学测评上比对照组高 0.44–0.47 个标准差(Oreopoulos 等 2026 RCT);每周用 30 分钟以上、全年累计 18 小时以上,与约 20% 高于预期的学习增益相关(MAP Growth 标准化测评)。但有个关键边界:截至 2026 年 3 月,尚无同行评审研究单独证明『Khanmigo 这个 AI 辅导本身』提升成绩——现有强证据是『Khan Academy 平台 + 保证使用时长』,而非 AI 那一层单独的功劳。
#行业应用
另有 1 家信源报道
展开详情
  • **用够才有效**:每周约 1 小时的学生末考数学高出对照组 0.44–0.47 个标准差(2026 RCT),核心变量是使用时长与老师督促,不是有没有 AI
  • **规模已铺开**:Khanmigo 进入 1.5 万+ 学校、约 500 万用户,1.8× 更快的掌握率——但样本大不等于因果清晰
  • **清醒的边界**:截至 2026 年 3 月,无同行评审研究单独证实 Khanmigo(AI 辅导层)提升成绩;别把『平台有效』直接当成『AI 有效』
推荐理由:对做 AI 教育、或想用 AI 帮孩子/自己学习的人,这份成绩单给了两个务实结论。一,AI 工具的效果几乎全押在『用够时长 + 有人督促』上——买了不用、或没人盯着,再强的 AI 也出不了成绩;真正值钱的产品设计和服务,是把『让人持续用下去』这件事做好(提醒、陪伴、可见进度),而不是堆模型能力。二,别被『AI 让成绩暴涨』的营销带走,要会分辨『平台有效』和『AI 那一层有效』——这种读证据的能力,无论你是家长、老师还是想做教育 AI 的创业者,都是不被割韭菜的底线。想在教育 AI 里挣钱,卖『可验证的效果和坚持』,比卖『最新大模型』靠谱得多。
#06
indiehackers.com Product 值得关注
NEW

六周做到 $10k MRR 的 AI 设计工具:一个人、零市场预算的可复制路径

这周挑一条和近期『AI 语音/自动化服务代运营』完全不同角度的现金流路子:不做代客服务、做自己拥有的小产品(productized micro-SaaS)。一位独立开发者用 AI 快速搭出一个垂直的 AI 设计工具,六周内、零市场预算做到约 $10k MRR。关键动作是三条老掉牙但有效的原则:极致垂直(只做某一类设计,不做通用)、先解决一个具体到疼的痛点、自己掌握支付与获客渠道。2026 年跑这种模式的门槛已经很低——一套 production 级 micro-SaaS 月成本约 $85–200,AI 还能帮你写代码、写文档、接客服、投广告。
#小微现金流#订阅制 micro-SaaS…
另有 1 家信源报道
展开详情
  • **极致垂直**:不做通用设计工具,只死磕某一类具体设计需求,让潜在用户一眼觉得『这就是给我做的』
  • **成本极低、可复制**:月运营成本约 $85–200,AI 承担开发/文档/客服/投放,一个人也能跑起一条产品线
  • **自己掌渠道**:从第一天起就自己握住支付和获客,不把命脉外包,才有稳定现金流
推荐理由:对想挣现金流的普通人,这条和最近几天的『AI 服务代运营』互为镜像,各有取舍:服务代运营成交快、启动几乎零成本,但你在卖时间、天花板是自己的产能;而 productized micro-SaaS 前期要搭产品、慢一点,但一旦跑通就是可复制、能睡后收钱的资产。2026 年真正的坎不是『能不能做出来』——AI 已经把做出来这件事变便宜了——而是分发:你能不能持续找到那群『痛到愿意付费』的垂直用户。给你的行动建议:从你最懂的一个细分场景切入,用 AI 一周内做出能收钱的最小版本,把全部精力压在『找到并说服前 20 个付费用户』上,而不是继续打磨产品。
My Take:评分(5=最优):最快成交 3 / 最低成本 4 / 可复制 4 / 风险安全度 4。适合有点动手能力、想做自己拥有的睡后收入资产、愿意用几周换长期复利的人。
#08
Product Hunt Product
NEW

buildpipe:给开发者的本地优先 AI 流水线(本地版 Zapier/n8n)

buildpipe 是一个面向开发者的本地优先流水线自动化应用:把 shell 命令、AI 调用、HTTP 请求、文件操作串成可复用的 pipeline,然后按计划、按文件变动或经 webhook 触发。它定位成『本地版 Zapier / n8n』,但专为开发者、且完全在你自己机器上跑——作者的动机就是『受够了反复写一次性脚本把 AI 调用和文件操作拼一起、然后弄丢』。在 Grok Build 把整个仓库偷传上云的当口,这种『数据不离开本机』的本地优先工具正好戳中开发者的敏感神经。
#DevTools#本地优先桌面应用,在你自己机…
另有 1 家信源报道
展开详情
  • **本地优先**:pipeline 全在你自己机器上执行,数据不出本机——与今天 Grok Build 偷传上云形成鲜明对照
  • **开发者专属**:把 shell / AI 调用 / HTTP / 文件操作拼成可复用流水线,替代到处散落、写完就丢的一次性脚本
  • **多种触发**:支持定时、文件变动、webhook 触发,适合把重复的 AI + 数据小活儿自动化固化下来
推荐理由:对普通开发者和想用 AI 提效的人,buildpipe 代表一个值得跟的方向:本地优先的 AI 自动化。它的价值不在多花哨,而在把你天天手动重复的『拉数据→喂给 AI→存结果』这类碎活儿固化成一条可复用、可定时、还不上云的流水线。结合今天 Grok Build 的教训,选工具时把『数据是否离开本机』当成一条硬标准会越来越重要。给你的行动建议:先盘一盘自己每天手动重复、又涉及敏感数据的小流程(比如整理日志、批量改文件、定时跑一段 AI 分析),用这类本地优先工具把它们自动化——省时间的同时,也把数据主权留在自己手里。
仍在热榜 1
Repo msitarzewski/agency-agents 在榜 2d agency-agents 是一套社区打磨的『AI 代理公司』人设库——从前端高手、Reddit 社区运营到『现实检查员… AI Agent