Hall of Fame
今日趋势综述
今天的信号:模型变便宜变多,稀缺的是『围着模型做东西』的人
今天最硬的一条新闻是 Anthropic 发布 Claude Opus 5——不到两个月里的第四个模型,价格和 Opus 4.8 持平($5/$25 每百万 token),却把前沿智能拉到了 Fable 5 一半的输入价。配合评测那条看:SWE-bench Verified 榜前三名 Opus 5、GPT-5.6 Sol、Fable 5 已经挤在 95–97 分这两分之内,编码这个最被引用的基准正在饱和;而换到 LiveCodeBench,冠军又变成 Gemini 3 Pro Preview。两件事合起来说的是同一句话:最强的模型正在变便宜、变多,单靠『我用了最强模型』或『我榜上第一』越来越不值钱了。Relay-Bench 那篇论文更是当头一棒——同一个前沿模型在单领域任务能拿 82.7%,一旦要把多个领域的推理串起来就掉到 43.3%,说明榜单分数和真实综合能力之间还有一道大裂缝。
Anthropic 发布 Claude Opus 5:前沿智能对折价,$5/$25 不涨价却比 Fable 5 便宜一半
展开详情
- **价格**:$5/$25 每百万 token,与 Opus 4.8 持平不涨价,却把近 Fable 5 级别的智能做到其输入价的一半($5 vs $10)
- **成绩**:官方口径 SWE-bench Pro 约 79.2%、SWE-bench Verified 约 96%,1M 上下文,成为 Claude Max 默认模型
- **节奏**:两个月内第四个模型——前沿模型的发布频率和降价速度,都在把『用最强模型』这件事变成人人可及的日常
编码榜快饱和了:Opus 5 登顶 SWE-bench Verified,但前三挤在两分内,换个榜冠军又变 Gemini
展开详情
- **对比**:SWE-bench Verified(vals.ai,7/22)Claude Opus 5 97.0 vs GPT-5.6 Sol 96.2 vs Claude Fable 5 95.0——前三挤在 2 分内,榜接近饱和
- **换榜换王**:LiveCodeBench(约 7/24)Gemini 3 Pro Preview 91.7 vs Gemini 3 Flash Preview 90.8 vs DeepSeek V3.2 Speciale 89.6——冠军换成了 Gemini
- **方法**:不同榜差异来自评测方法与收题方式(如 LiveCodeBench 持续收新题抗污染),同一模型在不同聚合站分数也有 96–97 的浮动,别把单个小数点当真理
Relay-Bench: Evaluating LLMs on Multi-Domain Reasoning Chains
展开详情
- **落差**:GPT-5.5 单项 agentic 约 82.7%,到 Relay-Bench 跨领域链只剩 43.3%——同一模型掉了近 39 个点
- **设计**:每题由 2–13 个不同领域子问题串成,纯文本、无需多模态输入输出,且明确鼓励用代码执行/联网/工具,考的是『串起来会不会崩』
- **意义**:抗污染、未饱和——正好补上 SWE-bench 这类快饱和榜单的盲区,说明『榜单第一』和『真实综合能力』之间还有一道大裂缝
kvcache-ai/AgentENV
展开详情
一个用于大规模运行 agent 执行环境的分布式平台,主打为 agentic 强化学习训练提供标准化、高吞吐的沙箱/运行时底座。
周增长:7 月 23 日创建,6 天约 2.1k 星(>300/天),周增以 GitHub Trending / star-history 实时为准
- **速度**:7/23 创建、6 天约 2.1k 星(>300/天),KTransformers 原班系统团队背书,可信度高
- **定位**:不是 agent 框架,而是底层——大规模运行 agent 执行环境的分布式平台,专为 agentic RL 训练设计
- **信号**:用 Rust 做高吞吐运行时,说明『怎么把海量 agent 环境跑起来』已经成了独立的基础设施品类
VictorTaelin/OptMem
展开详情
给 AI agent 装『永久记忆』的极简方案:一个 426-token 的提示加一个脚本,即插即用,不需要重型向量数据库。
周增长:7 月 25 日创建,4 天约 869 星(>200/天),周增以 star-history 实时为准
- **极简**:426-token 提示 + 一个脚本即插即用,append-only 日志 + 树状摘要,无需向量库/嵌入服务
- **作者**:Victor Taelin(HVM/Bend 作者)出品,四天约 869 星,本身就是关注度背书
- **取舍**:用最小复杂度换够用的持久记忆——和动辄上一整套 RAG 栈的方案形成鲜明对照
isjiamu/gzh-design-skill
展开详情
一个把 Markdown 一键转成可直接粘进微信公众号编辑器的排版 HTML 的 Agent Skill,自带 6 套主题、主题生成器和双重校验。
周增长:近期登上 Trendshift 趋势榜、增长强劲,具体周增以实时榜为准
- **痛点**:专治『Markdown 粘进公众号排版就崩』,6 套主题 + 主题生成器 + 双重校验,产出即粘即用
- **热度**:约 2.6k 星并登上 Trendshift,是本季最出圈的中文向 Skill 之一
- **范式**:不做大平台,把一个具体动作封成可复用、跨 agent 可移植的技能——这正是 skills 生态跑通的样板
makecindy/cindy
展开详情
一个开箱即用的开源 AI agent 成品应用,跨 iOS/安卓/桌面/浏览器,整合多模型多工具,本地运行,主打『想到就能做到』。
周增长:7 月 22 日创建,约 1.1k 星(>150/天),周增以 GitHub Trending / star-history 实时为准
- **成品化**:开箱即用而非框架,跨 iOS/安卓/桌面/浏览器,本地运行、整合多模型多工具
- **工程**:TypeScript + pnpm monorepo(Electron + React Native),兼容 Claude Code/Codex 等 harness,Apache-2.0 开源
- **热度**:7/22 创建、约 1.1k 星(>150/天),双语、对新手友好,主打『想到就能做到』
gavamedia/deltafin
展开详情
让 2.8 万亿参数的 MoE 大模型 Kimi K3 在单台 Apple Silicon Mac 上跑起来——按需把专家流式载入本地磁盘缓存,配 NEON/Metal 融合算子和 OpenAI 兼容接口。
周增长:7 月 28 日创建,两天约 314 星,周增以 star-history 实时为准
- **壮举**:在单台 M1 Max(64GB)上跑 2.8T 参数的 Kimi K3,靠专家按需流式载入磁盘缓存绕开显存墙
- **工程**:NEON 融合算子 + Metal/MPS 计算 + OpenAI 兼容接口,Mac 与 Linux 都支持
- **方向**:星数虽还不高(7/28 创建两天约 314 星),但把万亿级模型从『只能上云』拉到本地,是值得押注的趋势
物流 AI 落地实测:DHL 全欧铺开 AI 动态选路,关键航线时效压缩 10–15%
展开详情
- **数字**:关键航线运输时效预计压缩 10–15%,燃油消耗与温室气体排放同步下降,首批区域数月内达到正 ROI
- **做法**:实时融合天气/港口拥堵/清关时长/承运商表现,动态选路 + 主动绕瓶颈重规划,而非静态排线
- **打法**:不追大模型,把优化嵌进『每票货怎么走』的具体运营决策——全欧先跑通,再向全球扩展
Superpower ChatGPT:骑在 ChatGPT 流量上的一个 Chrome 插件,做到五位数月收入
展开详情
- **成绩**:单人做到五位数 MRR,插件 42 万+ 下载、15 万周活,配套通讯 35 万订阅
- **打法**:骑在 ChatGPT 的巨大流量上做增强插件,补官方没做的重度用户工作流功能——分发几乎零成本
- **先发**:Chrome 商店第一个 ChatGPT 插件,靠『第一个上 + 死磕一个刚需功能』建立壁垒
今日趋势综述
今天的信号:赢家都在抢『最后一公里』,不是抢模型
把今天的条目连起来看,会发现一条很清楚的主线:几乎没有一条是靠『我们用了最强的模型』赢的。农业里 Church Brothers 用需求预测把短期预测准确率提升 40%,靠的是把 AI 嵌进易腐货的补货流程;企业交付端,Palantir 那套被 Anthropic、OpenAI 抄作业的 FDE 打法,核心是『按管道额度配人、驻场 8–16 周、上线第一天就交东西』;连接层的真正瓶颈,从模型能力变成了『怎么把本地系统安全地接给云端 agent』——MCP gateway 就是冲这个缝隙长出来的一整个品类。评测那条更直白:Terminal-Bench 上 GPT-5.5 领先,可换到 MCP Atlas 工具调用榜,冠军就变成了 Gemini 3.5 Flash。没有哪个模型通吃,选型的功夫全在『你的活到底考哪一项』。
农业需求预测落地实测:Church Brothers 把易腐货短期预测准确率提升 40%,赢在把 AI 嵌进补货流程
展开详情
- **数字**:短期需求预测准确率最高提升 40%,SKU 级需求可见性显著改善,超额库存与损耗一起下降
- **规模**:4 万英亩、5000 万箱/年、400+ SKU、6 万+ 车次的真实体量,不是 demo 级样本
- **打法**:不追大模型,把预测嵌进易腐货补货与路由流程——早一天预测准,就少一车报废
Meerkats.ai:一个人四周做到 $3k MRR 的 AI 增长编排平台,把 SDR/营销/代理的重复活打包成软件
展开详情
- **成绩**:单人、四周、$3k MRR,赛道拥挤仍跑通——不是靠新模型,是靠把一套熟悉的增长流程产品化
- **切口**:替掉 SDR/营销/代理的重复劳动(找线索、补数据、跑触达、跟进),卖给最痛这块的中小团队
- **壁垒**:创始人 20 年 GTM 经验本身就是护城河——他知道每一步该编排成什么,比通用工具更贴业务
评测该看哪一榜:Terminal-Bench 上 GPT-5.5 领先,换到 MCP Atlas 工具调用榜冠军就变成 Gemini 3.5 Flash
展开详情
- **对比**:Terminal-Bench 2.0 上 GPT-5.5 82.7% vs Gemini 3.5 Flash 76.2%;但换到 MCP Atlas 工具调用榜,Gemini 3.5 Flash 83.6% vs Claude Opus 4.7 77.3%
- **分野**:终端掌控(跑命令、修环境)和 MCP 工具调用是两种能力,冠军互不重合,别用一个分数概括『谁更会当 agent』
- **方法**:Scale 今年把 MCP Atlas 评分判官升级、加了瞬时错误重试、把 20 轮上限改成每任务最多 100 次工具调用预算——评测本身也在往真实场景靠
Tool-Making and Self-Evolving LLM Agents in Low-Latency Systems
展开详情
- **问题**:推理时反复即兴写代码的循环,既拖慢延迟又难保证正确性,是生产 agent 的隐性成本大头
- **方法**:把重复的 SOP 步骤离线编译成经验证、带版本的工具,部署前固化,运行时直接调用
- **意义**:给『self-evolving agent』一个工程化定义——不是越跑越玄,而是把跑过的经验沉淀成可复用、可审计的工具库
真正的瓶颈从模型变成了连接:MCP Gateway 正长成 agent 时代的新基础设施品类
展开详情
- **转向**:瓶颈从『模型够不够强』变成『本地系统怎么安全接给云端 agent』——连接成了新的硬骨头
- **品类**:MCP Gateway 把鉴权/工具路由/可观测性/治理收进一层控制面;Gartner 预测多数 API 网关厂商将纳入 MCP 能力
- **落差**:225 位安全/IT 负责人调查——多数组织能监控 agent,却在它出错时拦不住,治理仍是缺口
写 Agent Skills 也能变现:技能市场从 1 家涨到 8 家,创作者拿 80% 分成、按月订阅调用全目录
展开详情
- **格局**:agent skills 市场半年从 1 家扩到 8 家,官方(anthropics/skills)+第三方(Agensi/SkillsMP/Netresearch)并存,生态在快速成型
- **变现**:Agensi 创作者拿 80% 分成、上架先过安全扫描,Pro 用户 $9/月 MCP 实时调用全目录——技能开始有清晰的收费闭环
- **可移植**:Netresearch 市场做成跨 Claude Code/Cursor/Copilot/Codex/Gemini CLI 等 30+ agent 可用,一次写、多端复用
被 Anthropic、OpenAI 抄作业的 Palantir FDE 打法:按管道额度配人、驻场 8–16 周、上线第一天就交东西
展开详情
- **四招**:每 $2–5M 管道配 1 名 FDE、单客户驻场嵌入 8–16 周、上线第一天就交可用东西、持续做对话式客户发现
- **反模式**:拒绝『需求文档表演』——不是先写长文档再开发,而是 day-one 就交东西、在真实反馈里迭代
- **抄作业**:这套原是 Palantir 的打法,如今 Anthropic、OpenAI 都在复制——说明 AI 落地的组织方式正在收敛成一种范式
Andrej Karpathy
在 LLM agent 之上,正在长出新的一层——它把编排、调度、上下文、工具调用和持久化整体抬到下一个台阶。
今日趋势综述
今天的信号:模型已经不是瓶颈,『把 agent 落进业务』才是
今天几条硬信号指向同一个判断——模型强不强已经不再是胜负手。Pinecone 把自己从向量库重命名成『agent 的知识引擎』,Nexus 进入公测,主打『把公司知识预先编译好、让 agent 直接查』;一篇 7 月的论文《Memory as a Controlled Process》给出同样的判断:当模型执行力够强,瓶颈就从『会不会推理』转移到『对的经验有没有在对的时刻被调出来』。Docker 在 AI Engineer World's Fair 的报告更直接:evals、上下文工程、harness 工程、memory、sandbox 正在长成一批 agent 专属的新工种。翻译成一句话:值钱的不再是模型本身,而是模型外围那一整套『让它可靠干活』的工程。
与『喂对知识』并列的另一半,是『管住它能做什么』。Kastra 本周在 Product Hunt 上线,做的就是 agent 的运行时授权层——动作执行前先过确定性策略、亚毫秒级拦截,一套控制面管 Claude Code、Cursor、Codex、OpenClaw。它和前几天的 OpenAI Presence、Alterion Draco 同一命题:2026 下半年,巨头和创业者一起在把 agent 关进『可审计、可约束』的笼子。而这套能力在真实行业里的兑现方式,就是今天的法律 AI 实测和 FDE 需求爆炸——律所赢家赢在『把 AI 卡进某一道工序、用引用准确率 99.2% 这种硬指标说话』;FDE 岗位一年涨 729%、资深年薪冲到 $785K,值钱的正是『翻越集成墙、把模型接进客户烂系统』的最后一公里。
对个人的可执行结论:把注意力从『哪个模型最强』移开,押注三件能复利的事。一是外围工程能力——上下文/记忆管理、eval、harness、agent 授权与护栏,这些是招聘市场正在开的新岗、也是把 demo 做到生产的分水岭;二是行业最后一公里——别做通用大模型,去帮某一类客户把某一道工序真正嵌进去,切口越窄、指标越硬越好成交(法律的合同审查、判例检索都是现成模板);三是可落地的现金流——像 AI 催缴找回失败支付这种『帮别人止血、按止血额分钱』的小生意,痛点硬、ROI 一算就清、客户天然愿付。今天每一条,都在说同一句话:谁能把『能力』翻译成『客户敢用、能算出 ROI 的流程』,谁就掌握了模型进步也抹不平的价值。
Kastra:给 AI agent 装『运行时授权层』——动作执行前先过策略,亚毫秒级拦截
展开详情
- **定位**:不是又一个 agent 框架,而是横在 agent 与工具之间的『授权闸门』,动作执行前先拦一道
- **能力**:亚毫秒级、确定性策略,覆盖工具调用/提示/输入/输出,一套控制面管 Claude Code、Cursor、Codex、OpenClaw、各家 SDK
- **信号**:与 OpenAI Presence、Alterion Draco 落在同一命题——2026 下半年的主战场是『把 agent 关进可审计的笼子』
Pinecone Nexus 公测:把公司知识『编译』成结构层,让 agent 直接查而不是每次重新检索
展开详情
- **思路转变**:从『每次 retrieval』升级到『一次 knowledge compilation』——把推理提前到『编译知识』阶段,而非临场检索
- **数字(厂商自报)**:官方称任务完成率 90%+、速度最高快 30×、token 支出最多降 90%(待第三方复现)
- **同一命题**:2026 的共识是『瓶颈不再是模型,而是让 agent 拿到对的知识』——Nexus、agent 记忆论文都在回答这件事
Memory as a Controlled Process: Learned Adaptive Memory Management for LLM Agents
展开详情
- **核心判断**:模型够强之后,瓶颈不再是推理能力,而是『对的经验有没有在对的时刻被 surface 出来』
- **方法**:把记忆当『被学习控制的过程』,自适应管理记什么/忘什么/何时调用,而非无脑堆历史
- **意义**:与外部知识引擎(如 Nexus)互补,共同指向 2026 的主线——上下文与记忆管理才是 agent 落地的真瓶颈
模型不再是瓶颈:evals、上下文工程、harness 工程正在长成 agent 时代的新工种
展开详情
- **新工种**:Docker 报告点名 evals、上下文工程、harness 工程、memory、sandbox 等 agent 专属学科正在独立成型
- **数字**:70%+ 组织生产里同时跑 3+ 模型;Gartner 预测 2027 年底 40%+ agentic 项目被砍
- **本质**:失败点从『模型会不会』转向『工具调用、分支、重试、交接叠起来的序列级可靠性』
法律 AI 落地实测:赢家不是买了最强模型,而是把 AI 卡进某一个具体工作流
展开详情
- **大盘**:用 AI 的律所两年从 26% 升到 42%;但赢家赢在『嵌进某道工序』,不是『买最强模型』
- **数字(合同/动议)**:合同审查提速约 60%;Rupp Pfalzgraf 86% 采用率、复杂动议起草压到约 1/4 时间
- **数字(检索)**:一家所死磕单一指标『引用准确率』做到 99.2%,6 个月从语料到合伙人采用——单点极致胜过全面平庸
AI 催缴/失败支付找回:一门被低估的小微现金流生意——帮订阅制商家把漏掉的钱捞回来
展开详情
- **痛点(有数字)**:订阅制平均漏 ~9% MRR 于非自愿流失;$10K MRR 每月漏 $900–1000
- **对比(有数字)**:传统催缴找回 30–40%,AI 催缴(读拒付码+择时重试)找回 65–80%
- **已跑通**:Churnkey 约 $30K MRR、平均降 18% 流失——需求被验证过,不是空想
Forward Deployed Engineer 需求爆炸:一年岗位涨 729%,资深年薪冲 $785K,值钱的是『翻越集成墙』
展开详情
- **数字**:FDE 岗位一年涨约 729%(643→5330);资深年薪 $250K–400K,Anthropic/OpenAI 资深岗 $785K+
- **本质**:值钱的不是会调模型,而是翻越『集成墙』——接老旧 SQL、搞定 SAML/OIDC、过数据驻留合规
- **定位**:FDE 是把模型能力变成企业收入的『最后一公里』通道,需求指数增长而供给线性增长
写好 Agent Skill 的第一杠杆:把 description 当『路由规则』写,而不是摘要
展开详情
- **最高杠杆**:启动时模型只看到每个 skill ~100 token 的 description;把它写成『何时触发』的路由规则,而非『是什么』的摘要
- **token 账**:元数据 ~100 token 常驻扫描,完整指令 <5k token 命中才加载——这就是渐进式披露省 context 的逻辑
- **工程规矩**:SKILL.md <500 行、文件引用只下探一层、长文件加目录,别一次性把上下文塞满