📅
Hall of Fame
Hall of Fame
Track
Type
Source
9月23日 周三 · 8 条
今日趋势综述
当模型本身不再是稀缺品,今天的信号集中指向同一层东西——模型外面那圈『脚手架』:给 agent 装记忆、把技能做成跨厂商可移植的标准件、给工具调用加上安全与授权、再把这套能力交付进真实行业。谁在搭脚手架、谁在做交付,谁就在拿溢价。
今天的信号:值钱的不是模型,是模型外面那层『脚手架』——记忆、技能、授权与交付

把今天几条串起来看,会发现它们讲的其实是同一件事:模型能力已经过剩,真正在增值的是围绕模型搭的那一圈基础设施。thedotmack/claude-mem 冲到近 9.5 万星,做的就是给 agent 补上『跨会话记忆』这块最缺的地板;alirezarezvani/claude-skills 用 2.6 万星证明,技能正在从『某个工具专属』变成跨 13 个编码 agent 可移植的标准件;UTCP 作为 MCP 的直连替代方案,想砍掉工具调用里的『包装税』;一篇 arXiv 论文(Intent-Governed Tool Authorization)则把『agent 到底能调用哪些工具、能碰哪些数据』这个安全难题,做成了可以工程落地的授权层。记忆、技能、连接、授权——这四块拼起来,就是 2026 年生产级 agent 真正的护城河,而它们没有一块是『模型本身』。

另一半信号讲的是『能力过剩之后,钱从哪来』。Terminal-Bench 4.0 这类更硬的评测提醒我们:在最难的终端自动化任务上,开源模型和前沿模型还差着十几分——所以选型不是追榜首,而是按『任务难度 × 每任务成本』分层。而真正的溢价在交付端:能源行业用 AI 把太阳能预测误差从 16.2% 压到 10.8%、预测性维护省下最高 30% 运维成本;FDE(前沿部署工程师)这类角色火,是因为 95% 的企业 AI 卡在『从 demo 到生产』的最后一公里;连本地小微的记账都在被 AI 重做——机会全在『把过剩的模型能力,稳稳地落到有人愿意付钱的场景里』。

对个人的启示很直接:别再纠结『用哪个最强模型』。2026 年真正值钱的三件事——第一,会搭脚手架(给 agent 补记忆、写可复用可移植的技能、把工具调用和权限管稳);第二,会按成本和任务分层做选型,而不是盲追榜单;第三,会把这套能力交付进一个真实行业或一群真实客户里(能源、诊所、餐饮小微都行)。今天这些冲星的工具和落地的案例,指向的都是同一个市场:谁能把模型外面那层脚手架搭好、把最后一公里交付掉,谁就赢。

今日新增 7
#01
GitHub Repo
★ 94500 NEW

thedotmack/claude-mem

claude-mem 解决的是所有用编码 agent 的人都痛过的问题:每开一个新会话,agent 就『失忆』一次,你得重新解释项目结构、之前的决定、踩过的坑。它把每次会话的操作全captured 下来,用 AI 做智能压缩,再在新会话里按需注入相关上下文,还带一个 mem-search 技能可以用自然语言检索项目历史,配了 Web 端实时查看记忆流的界面,用 `` 标签做隐私控制,底层用 SQLite 全文检索 + Chroma 向量库做语义搜索。它不只支持 Claude Code,还兼容 Cursor、OpenClaw 等多个 IDE。一个记忆插件能冲到近 9.5 万星,说明『让 agent 记住上下文』已经是刚需级的基础设施,而不是锦上添花。
#DevTools#TypeScript
展开详情

给 Claude Code 这类编码 agent 补上最缺的一块地板——跨会话的持久记忆:自动记录你每次会话里 agent 做过什么,用 AI 压缩后,在未来的会话里把相关上下文再喂回去。

周增长:本周高热度项目,星数取自仓库页 WebFetch(约 9.45 万;本会话 GitHub API 仅授权本仓库,未能用 REST 复核,以页面显示为准)

  • **跨会话记忆**:自动记录 + AI 压缩 + 按需注入,让 agent 在新会话里还记得项目历史和之前的决定,告别每次从零解释
  • **渐进式披露 + 成本可见**:注入上下文时展示 token 成本,配 mem-search 技能用自然语言查历史,底层 SQLite 全文检索 + Chroma 向量语义搜索
  • **信号**:近 9.5 万星、TypeScript、支持 Claude Code/Cursor/OpenClaw 多 IDE,证明『agent 记忆层』是刚需地板而非玩具
推荐理由:对普通开发者,这条给的机会有两层。第一层是直接用:把它接上你的编码 agent,长期项目里能立竿见影地少解释、少跑偏、省 token。第二层更值钱——记忆是 agent 的护城河之一,它的价值随使用时间复利增长。你越早在自己的工作流里沉淀『项目记忆』,你和你的 agent 组合就越难被替代。想做 AI 相关副业的人也可以从中读到方向:给某个垂类的 agent 工作流做『记忆/上下文管理』这块地板,正在成为一门真实的生意。
#03
neso.energy Article
NEW

能源行业 AI 落地实测:National Grid ESO 用 AI 做太阳能『分钟级预测』,预测性维护省最高 30% 运维成本、误差从 16.2% 压到 10.8%

今天轮到能源/电力这个垂直领域。多份一手信息拼出一幅清晰图景:英国国家电网系统运营商(National Grid ESO)联手 Open Climate Fix,用机器学习读卫星云图、理解云层相对光伏阵列的移动,把太阳能发电预测从『按天』做到了『分钟到小时级』的 nowcasting,直接服务国家级调度控制室。效果数据也很具体:在案例研究里,太阳能预测误差(MAPE)从 16.2% 降到 10.8%,强化学习驱动的储能调度让利用效率提升 18%,一年因此减少实时购电和弃电损失带来 2200 万–3200 万美元的价值;AI 预测性维护则能把可再生能源系统的运维成本(OPEX)最高砍掉 30%,LSTM 类模型的预测 RMSE 比传统数值天气预报低 27–80% 且秒级出结果。Gartner 判断到 2027 年将有 40% 的电力和公用事业公司在控制室部署 AI 操作员。
#行业应用
另有 2 家信源报道
展开详情
  • **预测精度**:National Grid ESO + Open Climate Fix 用卫星云图做太阳能分钟级 nowcasting;案例中 MAPE 从 16.2% 降到 10.8%,储能调度利用率 +18%
  • **真金白银**:AI 预测性维护把可再生系统 OPEX 最高砍 30%;一个案例靠减少实时购电/弃电,年增 2200 万–3200 万美元价值
  • **趋势**:Gartner 预计 2027 年 40% 电力/公用事业公司在控制室部署 AI 操作员,94% 的相关 CIO 计划加大 AI 投入
推荐理由:对想吃 AI 红利的普通人,能源给的信号是『高门槛、高单价、强数据』的典型代表:这里的 AI 落地不是聊天机器人,而是预测、调度、维护这些能直接省下千万级成本的硬活。机会不在于你去和电网巨头抢单,而在于——能源的方法论(用 AI 做时序预测 + 优化调度 + 预测性维护)几乎可以平移到任何有『设备+能耗+波动需求』的中小场景:工厂用电、冷链、商业楼宇空调、光伏电站运维。谁能把这套『预测-优化-维护』的能力打包成一个中小客户买得起的服务,谁就能在这条高单价赛道上切到自己的那块。
#04
codingfleet.com Article
NEW

Terminal-Bench 4.0 实测:最难的终端自动化任务上,开源模型和前沿还差约 16 分——选型该按『任务难度 × 每任务成本』分层

Terminal-Bench 4.0 是专门衡量 agent 在真实命令行环境里完成任务能力的硬核评测——它比 SWE-bench 那种『改代码通过测试』更接近运维现场:装依赖、跑脚本、排错、多步操作。这一版分数普遍偏低,正说明任务更难、更能拉开差距。它给出的横向对比很有意思:在这条最难的终端自动化赛道上,前沿闭源模型仍然领先,而唯一进榜的开源模型 GLM-5.3 与榜首差着约 16 分。这和上周 SWE-bench Verified、Terminal-Bench 2.1 上『开源已摸到前沿、只低几分』的结论形成了一个重要的补充与反差:任务越难、越接近真实多步运维,开闭源的差距就越会重新拉开。所以『开源已经够用了』这句话,要看你干的是哪一档活。
#评测
另有 2 家信源报道
展开详情
  • **对比**:Terminal-Bench 4.0 榜单 GPT-6 Astra 58.2 vs Claude Fable 5.1 57.9 vs Claude Opus 5 51.8 vs 开源 GLM-5.3 41.8(分越高越好)
  • **反差**:上周 SWE-bench Verified/TB 2.1 上开源只低几分,但到最难的 TB 4.0,开源与前沿差约 16 分——任务越硬差距越大
  • **方法论**:TB 4.0 考的是真实命令行多步任务(装依赖/跑脚本/排错),比『改代码过测试』更贴近运维现场,更能暴露 agent 的稳定性
推荐理由:对开发者,这条直接给选型结论:别用一句『开源够用了』一刀切。写常规业务代码、改 bug 这类活,开源模型(GLM-5.3、DeepSeek、Kimi 等)已经性价比极高,能自托管省钱;但一旦是长链条、多步、真实终端运维这种最难的活,前沿闭源还值那十几分的差价和稳定性。正确姿势是按『任务难度 × 每任务成本』分层:日常高频、容错高的任务交给便宜的开源;关键、复杂、一步错满盘输的任务上前沿。这种『分层调度』的选型能力,本身就是 2026 年比『会调 API』更稀缺的技能。
#05
utcp.io Product
NEW

UTCP(Universal Tool Calling Protocol)

UTCP 是一个正在升温的开放标准,定位是 MCP 的『直连替代方案』。它和 MCP 最大的不同在架构:MCP 要把工具调用代理(proxy)到一个新服务器上,UTCP 则是让 agent 发现工具后直接说话给工具的原生端点——HTTP、gRPC、WebSocket 甚至命令行都行。这样做砍掉了它所谓的『包装税』(wrapper tax):不用为每个工具再包一层 server,延迟更低,而且你现有的认证、计费、安全基础设施可以原样保留,不必为了接 agent 重做一遍权限体系。有意思的是它并不和 MCP 对着干——UTCP 把 MCP 也纳为一种可调用方式,是『收编』而非『替代』。在 MCP 于 2025 年大规模铺开后,UTCP 代表的是『工具调用要不要那么重』这个方向上的一次务实反思。
#Infra#开源免费(开放标准)
另有 3 家信源报道
展开详情
  • **直连不代理**:agent 发现工具后直接调用其原生端点(HTTP/gRPC/WebSocket/CLI),砍掉每个工具外包一层 server 的『包装税』,降延迟
  • **复用现有基建**:认证、计费、安全体系原样保留,不必为接 agent 重做一套权限——对已有大量内部 API 的团队迁移成本极低
  • **不与 MCP 互斥**:UTCP 把 MCP 纳为一种可调用方式,是『收编』而非取代,可与现有 MCP 生态共存
推荐理由:对做 agent 集成的开发者,UTCP 提醒你一件事:给 agent 接工具,未必要走『每个都包一层 MCP server』的重路子。如果你手上已经有一堆带认证和计费的 HTTP/gRPC API,UTCP 这种『直连原生端点』的思路能省掉大量重复封装和运维。更重要的是把握趋势——工具调用协议还在快速演化、远未定型,谁现在就吃透 MCP 与 UTCP 各自的取舍(重代理 vs 轻直连、集中治理 vs 复用现有基建),谁在企业 agent 落地时就有更强的架构话语权。这正是『会搭脚手架』这类能力开始值钱的又一个切口。
#06
arXiv Paper
NEW

Intent-Governed Tool Authorization for AI Agents

这篇论文点出的痛点非常现实:工具型 agent 通常拿着一套『集成凭证』,其静态权限远大于用户当前这一次请求真正需要的范围——这意味着一旦 agent 被诱导(比如被恶意内容注入),它手里的权限足以捅出大篓子。作者提出 Intent-Governed Access Control(IGAC,意图治理访问控制):一个服务端授权层,把可信的用户请求转成一张『短时效的意图证书』,据此把静态授权的工具清单收窄到只匹配这次意图,并在执行前逐一校验每个工具调用和参数是否越界。核心不变量是『单调性』——用户意图只能缩小静态策略授予的权限,永远不能扩大。它明确把模型运行时、规划器、意图分类器、工具选择器和外部内容源都当作『不可信主体』,把安全边界交给网关强制执行。在其确定性运行时对比里,参考实现把综合『暴露/越权路径』指标从 1.0000 压到了 0。
为『agent 用一套超大权限的集成凭证、实际请求却只需一小部分权限』这个真实安全隐患,给出一条可工程落地的解法:把用户意图变成短时效的授权凭证,在执行前逐一收窄和校验 agent 能调用的工具与数据。
#AI Agent
另有 1 家信源报道
展开详情
  • **意图证书**:把可信用户请求转成短时效凭证,据此把 agent 可调用的工具清单收窄到只匹配本次意图,执行前逐调用校验
  • **单调性不变量**:用户意图只能『缩小』静态集成策略授予的权限、永远不能扩大——从原理上堵死『被诱导后越权』
  • **效果**:把模型运行时/规划器/外部内容都视为不可信主体,安全交网关强制;确定性对比中把越权暴露指标从 1.0000 降到 0
推荐理由:对做 agent 的开发者和想进 AI 安全方向的人,这篇是一记提醒也是一个机会:2026 年 agent 大规模进企业,最先炸出来的往往不是『不够聪明』,而是『权限太大、被诱导后乱调用工具』。谁能把『最小权限 + 意图约束 + 执行前校验』这套安全脚手架做进真实 agent,谁就在企业落地时握着一张别人没有的通行证——因为法务和安全团队最怕的就是这个。哪怕不复现论文,光是把『别给 agent 超它当前任务所需的权限』这条原则用进你自己的项目,就能显著降低事故面。agent 安全/授权,正在从论文话题变成一个真实的、缺人的工程方向。
#07
layernext.ai Article 值得关注
NEW

小微记账正在被 AI 重做:Pilot 推出全自主『AI 会计』,AI 记账省 30% 成本、90% 少出错、自动化 80–90% 流水——机会在『AI 跑账 + 人工把关』的托管服务

小微企业的记账正在被 AI 系统性重做。2026 年 2 月,Pilot 推出它称为全球首个『全自主 AI 会计』的产品,宣称能零人工干预地跑完从开户上手到月度结账的整个记账流程。整体上,AI 记账工具能自动化 80–90% 的常规工作(流水录入、分类、对账),帮企业省下约 30% 的运营成本、少出 90% 的错误;LayerNext、Zeni 这类还专攻合规与持续异常检测——重复付款、刚好卡在审批线以下的交易、付款模式异常的新建供应商,这些人工复核常漏掉的欺诈信号,2026 年已是标配而非高级选项。价格从每月 29 美元起,光是省下的人力工时就能让 ROI 在第一个月转正。但清醒的一面是:复杂交易、税务筹划、审计准备仍需人的判断,未来是『AI 干重复活、人做把关和策略』的混合模式。
#小微现金流
另有 2 家信源报道
展开详情
  • **产品信号**:Pilot 2026 年 2 月推出『全自主 AI 会计』,宣称零人工跑完开户到月结全流程,标志小微记账进入自动化临界点
  • **硬数据**:AI 记账自动化 80–90% 常规流水、省约 30% 运营成本、少出 90% 错误;异常/欺诈检测(重复付款、卡审批线以下)已成标配
  • **留给人的缝隙**:复杂交易、税务筹划、审计与最终把关仍需人判断——机会在『AI 跑账 + 人工复核』的混合托管,而非纯 App
推荐理由:对想用 AI 挣现金流的普通人,这里的机会不是去和 Pilot 拼一个通用记账 App,而是吃它吃不到的『信任 + 最后一公里』:很多本地小微、诊所、餐饮连锁根本不敢把账完全交给一个没有人脸的 App,他们要的是『有个懂行的人用 AI 帮我把账跑了、再人工复核、每月给我一份异常和合规报告』。你用现成的 AI 记账工具当引擎,把它包装成某一垂类的月费托管服务,成本极低、可复制、粘性强。切口越窄越好——先只服务一个行业,把这套『AI 跑账 + 人工把关 + 异常监控』的流程跑顺,再复制到下一个垂类。
My Take:评分(5=最优):最快成交 3 / 最低成本 4 / 可复制 4 / 风险安全度 3。定位:给不敢把账全交给纯 App 的本地小微,做『AI 跑账 + 人工复核 + 每月异常/合规报告』的垂类月费托管服务。
商机信号(加速):谁付钱:没有专职会计、又不放心把账完全交给自动化 App 的本地小微:诊所、餐饮/零售连锁小门店、工作室、个体工商户 痛点:记账易错、合规和税务有风险,还容易被重复付款、卡在审批线以下的隐性欺诈钻空子,请专职会计又太贵 切入点:别做通用记账 App,选一个垂类(如餐饮连锁或诊所),用现成 AI 记账工具当引擎,做『AI 自动跑账 + 人工复核 + 每月异常/合规报告』的月费托管,靠信任和垂类 know-how 吃自动化吃不到的最后一公里
#08
medium.com Article
NEW

FDE 落地方法论:把 AI 从 demo 送进 Fortune 500 生产环境的《Shipping Enterprise AI》playbook——个人该补的是『拆用例、评就绪度、做能扛访问控制的 RAG』

这份 playbook 的价值不在于再喊一遍『FDE 很火』,而在于它把 FDE(前沿部署工程师)到底要会哪些具体活儿拆开了讲。作者把 FDE 定义为『站在模型能力与业务价值边界上的那个人』,并给出可操作的技能清单:如何把客户那些含糊的 AI 用例拆成能真正开工的工作流;如何评估客户的数据、权限、身份、治理到底够不够上生产(而不是 demo 一跑就完事);如何设计能在真实访问控制和检索质量挑战下活下来的企业级 RAG。它把这个角色的历史也讲清楚了:Palantir 在 2008 年发明了这个职能,OpenAI 和 Anthropic 在 2023 年为大模型时代重造了它,到 2026 年,几乎每家有六位数客单价的 A 轮 AI 创业公司都至少要招一个 FDE。这条串起了本周反复出现的信号——95% 的企业 AI 卡在『从 demo 到生产』的最后一公里,缺的从来不是模型,是能把它落地的人。
#FDE
另有 1 家信源报道
展开详情
  • **可落地技能清单**:把含糊 AI 用例拆成能开工的工作流;评估数据/权限/身份/治理是否够上生产;设计能扛真实访问控制的企业 RAG
  • **角色定义**:FDE = 站在『模型能力』与『业务价值』边界上的人——Palantir 2008 首创,OpenAI/Anthropic 2023 为大模型重造
  • **市场信号**:2026 年几乎每家六位数客单价的 A 轮 AI 公司都要招至少一个 FDE,因为 95% 的企业 AI 试点死在最后一公里
推荐理由:对想在 AI 时代卡位的普通人,这条给的是一份非常具体的『该补什么』清单。别只练调 prompt、追新模型——真正稀缺且高薪的能力是:把客户一句含糊的『我们想用 AI 提效』翻译成能开工的工作流、判断人家的数据和权限到底能不能上生产、以及把 RAG/agent 做到在真实企业的访问控制和脏数据里还能跑。这些能力偏『交付工程』而非『模型研究』,门槛在于愿不愿意钻进客户又脏又乱的真实环境里把活儿干成。谁补上这块,谁就能吃到那 95% 落地失败率背后最大的溢价。
仍在热榜 1
Repo alirezarezvani/claude-skills 在榜 3d 一个跨 13 个编码 agent 可移植的 Agent Skills 大合集:388 个生产级技能、30+ agent、… Skills · 自动化集成