Hall of Fame
今日趋势综述
今天的信号:AI 的下半场,从'造 agent'转向'管住 agent'
把今天的信号连起来看,会发现一条很清晰的主线:agent 能不能干活已经不是问题,能不能在生产里管住它才是问题。史上增长最快的开源项目之一 OpenClaw——一个自托管、能自己写代码给自己加技能的自主 agent——五个月冲到约 35 万星,但同一时间它背上了 138 个以上的已知 CVE,其中 CVE-2026-25253(CVSS 8.8)能通过浏览器远程拿到网关管理员权限,自托管者要靠自己手动追补丁,实测补丁窗口是'几天到几周',攻击就落在这个缝里。这不是个例,而是整个行业的缩影:Alterion(创始人分别是前麦肯锡合伙人和前 Google 工程 VP)本周直接推出企业级 agent 运行时治理控制面 Draco,实时看住每一次 prompt 和动作、在高风险操作前用可编程护栏拦下来,对标的正是 SOC 2、ISO 42001、欧盟 AI 法案这些合规框架;arXiv 的《Beyond the Leaderboard》把 2023–2026 的 27 篇评测/审计论文综合成 LLM agent 的六大失败簇(工具调用错误、规划失败、长程退化、多智能体协调、安全、度量失真);Simon Willison、Martin Fowler、Mitchell Hashimoto 这批人则把结论提炼成一句话——agent = 模型 + harness,agent 犯错时别去改 prompt,去改它周围的系统让这个错误结构上不可能再犯。
模型这条线也在变。GPT-5.6 Sol 落地,在 Artificial Analysis 智能指数上以 58.9 紧咬榜首 Claude Fable 5 的 59.9、领先 Kimi K3 的 57.1,但真正的看点是它用大约三分之一的成本做到——竞争的重心正从'谁的峰值最聪明'转向'同样的活谁最划算'。而产业侧的钱,从来只认'落得下去':BMW 用 AIQX/GenAI4Q 把 AI 质检铺到全球每座工厂、缺陷率降约 37%,靠的不是买最强模型,是把 AI 嵌进质检流程、连微观划痕和装配偏差都盯住。一句话,价值不在'能生成',在'能可靠地跑在真实业务里'。
对普通人,今年最该练、也最不容易被下一个模型抹平的能力,已经不是'会调哪个 AI',而是'能把 agent 治理好、落地好'。具体三条路:一是往'治理/加固'走——会给 agent 上护栏、追 CVE、做可观测和审计的人,正在变成企业刚需(Draco 这类控制面、OpenClaw 的托管加固都是新生意);二是把你的领域纪律产品化——像 tonsofskills 那样带校验流水线的 skills 市场证明,值钱的不是技能数量而是'带质量闸门的判断';三是做那个把 AI 真正落进一门乱糟糟真实生意的人,哪怕小到给本地 HVAC 老板做一个'永不漏接电话'的 AI 前台(NeverMiss,$500/月/门店起)。生成在贬值,管得住、落得下的判断力在升值。
OpenClaw(自托管自主 agent)
展开详情
OpenClaw 是一个免费开源、自托管的自主 AI agent 运行时:自带记忆、能跨会话记住偏好、能在你机器上真正执行任务,还能'自我改进'——自己写代码给自己新增技能来完成你要的活。它以消息平台(Telegram/Discord/WhatsApp)为主界面,支持接入几乎所有主流大模型(Claude、GPT、Gemini、DeepSeek 等),主打'不把数据经过第三方、全部跑在自己基础设施上'。正是这套'本地自治 + 自我进化 + 全接管你的应用'的组合,让它在 5 个月内冲到约 35 万星,被很多人当成最接近'个人 AGI 助手'的开源项目。
周增长:2026 年 1 月底随 Moltbook 一同爆红后持续高速增长,长期霸占 Trending;本周热度集中在'增长神话 vs 安全危机'的讨论上
- **增长神话**:自托管、能自我进化的自主 agent,约 5 个月冲到约 35 万星,被多方称为 GitHub 史上增长最快项目之一,接近'个人 AGI 助手'的开源形态
- **安全危机**:已追踪 138+ 个 CVE,CVE-2026-25253(CVSS 8.8)可经恶意网页泄露网关 token 拿到管理员权限并远程执行代码;自托管补丁窗口实测'几天到几周'
- **催生新护栏层**:围绕它已长出 NanoClaw(强制 Docker 沙箱 + 权限白名单)、Cisco DefenseClaw(技能扫描 + MCP 流量拦截)、Lakera Guard(<50ms prompt 注入检测)等一整套加固方案
GPT-5.6 Sol 落地:以约三分之一成本逼近榜首 Fable 5,模型竞争转向'性价比'
展开详情
- **对比**:Artificial Analysis 智能指数——Claude Fable 5 约 59.9 vs GPT-5.6 Sol 约 58.9 vs Kimi K3 约 57.1(166 个模型同一榜单),头部三家仅差约 1–3 分
- **成本才是胜负手**:GPT-5.6 Sol 以约榜首三分之一的价格逼近第一名,把竞争从'谁最聪明'拉到'谁最划算';Sol 版本尤其针对最难的数学、科学、网络安全推理调优
- **怎么选**:追求峰值智能/长程 agent 任务 → Fable 5;要在成本敏感的大规模场景(批量分类、抽取、客服、代码补全)跑得起 → GPT-5.6 Sol;开源自托管/数据不出境 → Kimi K3 这类开放权重
jeremylongshore/claude-code-plugins-plus-skills
展开详情
这是一个面向 Claude Code(及 Codex/Cursor/Gemini CLI 等)的开源插件与技能市场:约 425 个插件、2,810 个技能、200 个 agent,配一个公开站点 tonsofskills.com 和一个命令行包管理器 ccpi。它想解决的不是'技能不够多',而是'技能太多太杂、良莠不齐'——所以每个上架插件都要过一条多层校验流水线:对照 Anthropic 官方规范和 AgentSkills.io 规范做 schema 校验、强制 8 字段企业级 frontmatter、Unicode 卫生检查、密钥扫描、以及机器规格影子校验。它本质上是在给'技能生态'补上包管理和质量闸门这两块基础设施。
周增长:持续更新中(近期版本 v4.33.0);配套 tonsofskills.com 市场与 ccpi 安装器同步迭代
- **技能也有包管理器了**:ccpi CLI 让你像装依赖一样安装、更新、校验技能,配 tonsofskills.com 市场——把散落的 SKILL.md 变成可分发、可版本化的软件包
- **质量闸门而非纯堆量**:每个上架插件强制过 schema 校验(对齐 Anthropic + AgentSkills.io 规范)、8 字段企业级 frontmatter、Unicode 卫生、密钥扫描,正面回应'技能泛滥、平均分只有 6.2/12'的行业痛点
- **跨工具通用**:覆盖 Claude Code、Codex、Cursor、Gemini CLI 等多款 agent,一次上架多处可用,走的是 AgentSkills.io 开放标准
BMW 用 AIQX/GenAI4Q 把 AI 质检铺到全球每座工厂:缺陷率降约 37%,赢在'把 AI 嵌进流程'而非买最强模型
展开详情
- **具体数字**:AIQX 铺到 BMW 全球每座工厂,AI 视觉质检使缺陷率整体降约 37%,并消除误报、抓出人眼不可见的微观缺陷
- **多模态质检**:不止看——丁格芬工厂加入声学分析做音频质检;雷根斯堡 GenAI4Q 试点用生成式 AI 做按情境定制的柔性质量检查
- **赢在流程而非模型**:价值来自把 AI 嵌进质检流程、实时拦截缺陷,而不是买一个更强的大模型——和银行/保险业的落地逻辑完全一致
Beyond the Leaderboard: A Synthesis of Tool-Use, Planning, and Reasoning Failures in Large Language Model Agents
展开详情
- **六大失败簇**:工具调用错误 / 规划失败 / 长程退化 / 多智能体协调失败 / 安全失败 / 度量失真——给'agent 会怎么坏'建了一张系统地图
- **度量失真是重点警示**:榜单高分 ≠ 生产可靠,这一条直接说明为什么本周会同时出现'刷穿的基准'和'138 个 CVE 的明星项目'
- **从抱怨到工程**:把'agent 不靠谱'拆成可定位、可针对性设护栏的故障类型,是做 harness 工程和 agent 治理的对照清单
Alterion Draco:企业级 agent 运行时治理控制面
展开详情
- **运行时拦截而非事后审计**:实时观测每个 prompt 和动作,在高风险操作执行前用可编程护栏拦下,而不是出事后翻日志
- **免改代码接入**:跨云、跨厂商、跨端点统一治理,不要求改动 agent 代码,降低企业落地门槛
- **对齐合规框架**:直指 SOC 2、ISO 42001、欧盟 AI 法案的治理空白——传统 APM/安全工具能采指标却抓不到 agent 意图与行为
Simon Willison(及 Martin Fowler、Mitchell Hashimoto 等)
一个 agent 的本质,就是'在循环里调用工具去达成目标',功力全在你怎么设计那些工具和那个循环。agent 每次犯错,别指望它下次自己变好——去改造它所处的环境,让这个错误结构上不可能再以同样方式发生。
NeverMiss:给本地家政/维修生意做'永不漏接电话'的 AI 前台
展开详情
- **痛点用钱量化**:家政维修生意最多漏接 62% 来电,一通漏接约等于 $500–2000 的订单流失——'永不漏接'直接对应可算清的钱
- **窄而深才活得下来**:只做家政维修一个垂类、只做'接电话+跟进+同步 CRM'这条链,而不是一个什么都干的通用 agent——production 里能活的都是窄的
- **接得进现有工具**:对接 ServiceTitan/Housecall Pro/Jobber/GoHighLevel 等行业主流系统,$500/月/门店起、3–5 天上线,老板决策门槛低