Hall of Fame
今日趋势综述
今天的信号:能力过剩,落地稀缺
把今天的几条线索连起来,会看到一个清晰的错位:模型的『纸面能力』在飙,但『真正干活』的天花板低得多。编码榜 SWE-bench Verified 已经逼近饱和(97%),可换到更贴近企业真实仓库的 SWE-bench Pro,最强也才 ~69%——中间那 30 分,就是模型能力和真实交付之间的鸿沟。教育端更直白:Khanmigo 铺进了 1.5 万所学校、5 百万用户,但只有 15% 的人经常用,严谨的随机对照结果还没出来。铺得广,不等于学得好。
真正在赚钱、在涨星的,全是『把能力嵌进一个具体流程』的东西:Strix 不谈通用智能,只干渗透测试这一件脏活,涨到 4.5 万星;PixelRAG 不追更大模型,只把网页当截图去检索,两个月 8 千星;一个独立开发者盯着『物理治疗诊所的保险预授权』这一个无聊到没人想碰的工作流,14 个月做到 $41K MRR。Glaze 则把『描述一句话→生成一个原生 Mac app』做成了产品,软件生产的门槛又降了一截。
对个人的启示很统一:别把注意力放在『哪个模型最强』上,那是实验室的比赛;把注意力放在『哪个具体、脏、无聊、已经有人付钱的工作流,还没被 AI 好好接管』。能力已经过剩,稀缺的是愿意钻进某个垂直缝隙、把最后一公里跑通的人。顺带提醒一句:当 agent 开始拥有持久记忆,记忆本身也成了新的攻击面(见今天的 FARMA 论文)——落地越深,越要把安全一起想进去。
编码榜的另一半真相:SWE-bench Verified 快饱和了,但换到更难的 Pro,天花板骤降到 ~69%
展开详情
- **对比**:SWE-bench Pro 上 Opus 4.8 69.2% vs Gemini 3.1 Pro 62.3% vs GPT-5.5 ~58.6%(活跃模型口径),闭源商业代码档最高仅 ~47%
- **落差**:同一批模型从 Verified 换到 Pro 普遍掉 15–35 分——Verified 的 97% 是『会做的题』,Pro 才更接近『你司真实仓库』
- **怎么选**:日常改 bug、补函数选性价比高的即可;真要它独立啃陌生大仓库/长任务,优先当前 Pro 榜靠前的 Opus 4.8,且务必人工兜底 review
StarTrail-org/PixelRAG
展开详情
像素原生的视觉 RAG:把网页/PDF/图片当截图直接检索,保住表格、图表和版式。
周增长:2026-05 创建,约两个月 8.3k 星(均值 >1k/周),周增以 star-history 实时为准
- **思路**:把文档当截图检索而非先转文本,表格/图表/版式这些『被解析丢掉的信息』被完整保留
- **开箱**:维基 828 万篇预构建索引 + 无需 key 的托管接口 + FAISS 索引 + HF 上的 LoRA 权重,Apache-2.0
- **背书**:Berkeley SkyLab/BAIR/NLP 出品,v0.3.0 已发,属于有论文支撑的一手实现而非包装
Glaze by Raycast:描述一句话,生成一个能进 Dock 的原生 Mac app
展开详情
- **产物**:不是网页壳,而是能进 Dock、可离线、支持快捷键/菜单栏/后台任务的原生 Mac app
- **分发**:公开商店 + 团队私有商店,装现成的再用自然语言微调,Raycast 自家业务已跑在上面
- **门槛**:免费即可搭可用,约 $20/月解锁更多用量与分享,个人做内部工具几乎零成本
教育 AI 落地实测:Khanmigo 铺进 1.5 万所学校、5 百万用户,但只有 15% 常用、严谨结论仍未出
展开详情
- **规模 vs 使用**:5 百万用户、1.5 万+ 学校,但有权限的学生只有约 15% 经常用——铺开 ≠ 用起来
- **证据**:至今无针对 Khanmigo 的同行评审成效研究,J-PAL/多大 RCT 结果要等 2026 年中
- **潜力**:2025 年一项 RCT 显示 AI 辅导相对主动学习效应量 0.73–1.3 个标准差,天花板确实高
一个人盯『物理治疗保险预授权』这件无聊活,14 个月做到 $41K MRR
展开详情
- **数字**:单人 14 个月 $41K MRR,模型成本 <$4K/月,年二目标 $500K ARR,单客户年签约 $11,800
- **克制**:一类客户 + 一个工作流 + 一件无聊事,做到人工成本的十分之一,不铺品类
- **收费**:第 9 月转年签 + 60 天上线条款 + 每月 100 单用量下限,把留存压力变成季度续约
今日趋势综述
今天的信号:模型变便宜变多,稀缺的是『围着模型做东西』的人
今天最硬的一条新闻是 Anthropic 发布 Claude Opus 5——不到两个月里的第四个模型,价格和 Opus 4.8 持平($5/$25 每百万 token),却把前沿智能拉到了 Fable 5 一半的输入价。配合评测那条看:SWE-bench Verified 榜前三名 Opus 5、GPT-5.6 Sol、Fable 5 已经挤在 95–97 分这两分之内,编码这个最被引用的基准正在饱和;而换到 LiveCodeBench,冠军又变成 Gemini 3 Pro Preview。两件事合起来说的是同一句话:最强的模型正在变便宜、变多,单靠『我用了最强模型』或『我榜上第一』越来越不值钱了。Relay-Bench 那篇论文更是当头一棒——同一个前沿模型在单领域任务能拿 82.7%,一旦要把多个领域的推理串起来就掉到 43.3%,说明榜单分数和真实综合能力之间还有一道大裂缝。
Anthropic 发布 Claude Opus 5:前沿智能对折价,$5/$25 不涨价却比 Fable 5 便宜一半
展开详情
- **价格**:$5/$25 每百万 token,与 Opus 4.8 持平不涨价,却把近 Fable 5 级别的智能做到其输入价的一半($5 vs $10)
- **成绩**:官方口径 SWE-bench Pro 约 79.2%、SWE-bench Verified 约 96%,1M 上下文,成为 Claude Max 默认模型
- **节奏**:两个月内第四个模型——前沿模型的发布频率和降价速度,都在把『用最强模型』这件事变成人人可及的日常
编码榜快饱和了:Opus 5 登顶 SWE-bench Verified,但前三挤在两分内,换个榜冠军又变 Gemini
展开详情
- **对比**:SWE-bench Verified(vals.ai,7/22)Claude Opus 5 97.0 vs GPT-5.6 Sol 96.2 vs Claude Fable 5 95.0——前三挤在 2 分内,榜接近饱和
- **换榜换王**:LiveCodeBench(约 7/24)Gemini 3 Pro Preview 91.7 vs Gemini 3 Flash Preview 90.8 vs DeepSeek V3.2 Speciale 89.6——冠军换成了 Gemini
- **方法**:不同榜差异来自评测方法与收题方式(如 LiveCodeBench 持续收新题抗污染),同一模型在不同聚合站分数也有 96–97 的浮动,别把单个小数点当真理
Relay-Bench: Evaluating LLMs on Multi-Domain Reasoning Chains
展开详情
- **落差**:GPT-5.5 单项 agentic 约 82.7%,到 Relay-Bench 跨领域链只剩 43.3%——同一模型掉了近 39 个点
- **设计**:每题由 2–13 个不同领域子问题串成,纯文本、无需多模态输入输出,且明确鼓励用代码执行/联网/工具,考的是『串起来会不会崩』
- **意义**:抗污染、未饱和——正好补上 SWE-bench 这类快饱和榜单的盲区,说明『榜单第一』和『真实综合能力』之间还有一道大裂缝
kvcache-ai/AgentENV
展开详情
一个用于大规模运行 agent 执行环境的分布式平台,主打为 agentic 强化学习训练提供标准化、高吞吐的沙箱/运行时底座。
周增长:7 月 23 日创建,6 天约 2.1k 星(>300/天),周增以 GitHub Trending / star-history 实时为准
- **速度**:7/23 创建、6 天约 2.1k 星(>300/天),KTransformers 原班系统团队背书,可信度高
- **定位**:不是 agent 框架,而是底层——大规模运行 agent 执行环境的分布式平台,专为 agentic RL 训练设计
- **信号**:用 Rust 做高吞吐运行时,说明『怎么把海量 agent 环境跑起来』已经成了独立的基础设施品类
VictorTaelin/OptMem
展开详情
给 AI agent 装『永久记忆』的极简方案:一个 426-token 的提示加一个脚本,即插即用,不需要重型向量数据库。
周增长:7 月 25 日创建,4 天约 869 星(>200/天),周增以 star-history 实时为准
- **极简**:426-token 提示 + 一个脚本即插即用,append-only 日志 + 树状摘要,无需向量库/嵌入服务
- **作者**:Victor Taelin(HVM/Bend 作者)出品,四天约 869 星,本身就是关注度背书
- **取舍**:用最小复杂度换够用的持久记忆——和动辄上一整套 RAG 栈的方案形成鲜明对照
isjiamu/gzh-design-skill
展开详情
一个把 Markdown 一键转成可直接粘进微信公众号编辑器的排版 HTML 的 Agent Skill,自带 6 套主题、主题生成器和双重校验。
周增长:近期登上 Trendshift 趋势榜、增长强劲,具体周增以实时榜为准
- **痛点**:专治『Markdown 粘进公众号排版就崩』,6 套主题 + 主题生成器 + 双重校验,产出即粘即用
- **热度**:约 2.6k 星并登上 Trendshift,是本季最出圈的中文向 Skill 之一
- **范式**:不做大平台,把一个具体动作封成可复用、跨 agent 可移植的技能——这正是 skills 生态跑通的样板
makecindy/cindy
展开详情
一个开箱即用的开源 AI agent 成品应用,跨 iOS/安卓/桌面/浏览器,整合多模型多工具,本地运行,主打『想到就能做到』。
周增长:7 月 22 日创建,约 1.1k 星(>150/天),周增以 GitHub Trending / star-history 实时为准
- **成品化**:开箱即用而非框架,跨 iOS/安卓/桌面/浏览器,本地运行、整合多模型多工具
- **工程**:TypeScript + pnpm monorepo(Electron + React Native),兼容 Claude Code/Codex 等 harness,Apache-2.0 开源
- **热度**:7/22 创建、约 1.1k 星(>150/天),双语、对新手友好,主打『想到就能做到』
gavamedia/deltafin
展开详情
让 2.8 万亿参数的 MoE 大模型 Kimi K3 在单台 Apple Silicon Mac 上跑起来——按需把专家流式载入本地磁盘缓存,配 NEON/Metal 融合算子和 OpenAI 兼容接口。
周增长:7 月 28 日创建,两天约 314 星,周增以 star-history 实时为准
- **壮举**:在单台 M1 Max(64GB)上跑 2.8T 参数的 Kimi K3,靠专家按需流式载入磁盘缓存绕开显存墙
- **工程**:NEON 融合算子 + Metal/MPS 计算 + OpenAI 兼容接口,Mac 与 Linux 都支持
- **方向**:星数虽还不高(7/28 创建两天约 314 星),但把万亿级模型从『只能上云』拉到本地,是值得押注的趋势
物流 AI 落地实测:DHL 全欧铺开 AI 动态选路,关键航线时效压缩 10–15%
展开详情
- **数字**:关键航线运输时效预计压缩 10–15%,燃油消耗与温室气体排放同步下降,首批区域数月内达到正 ROI
- **做法**:实时融合天气/港口拥堵/清关时长/承运商表现,动态选路 + 主动绕瓶颈重规划,而非静态排线
- **打法**:不追大模型,把优化嵌进『每票货怎么走』的具体运营决策——全欧先跑通,再向全球扩展
Superpower ChatGPT:骑在 ChatGPT 流量上的一个 Chrome 插件,做到五位数月收入
展开详情
- **成绩**:单人做到五位数 MRR,插件 42 万+ 下载、15 万周活,配套通讯 35 万订阅
- **打法**:骑在 ChatGPT 的巨大流量上做增强插件,补官方没做的重度用户工作流功能——分发几乎零成本
- **先发**:Chrome 商店第一个 ChatGPT 插件,靠『第一个上 + 死磕一个刚需功能』建立壁垒
今日趋势综述
今天的信号:赢家都在抢『最后一公里』,不是抢模型
把今天的条目连起来看,会发现一条很清楚的主线:几乎没有一条是靠『我们用了最强的模型』赢的。农业里 Church Brothers 用需求预测把短期预测准确率提升 40%,靠的是把 AI 嵌进易腐货的补货流程;企业交付端,Palantir 那套被 Anthropic、OpenAI 抄作业的 FDE 打法,核心是『按管道额度配人、驻场 8–16 周、上线第一天就交东西』;连接层的真正瓶颈,从模型能力变成了『怎么把本地系统安全地接给云端 agent』——MCP gateway 就是冲这个缝隙长出来的一整个品类。评测那条更直白:Terminal-Bench 上 GPT-5.5 领先,可换到 MCP Atlas 工具调用榜,冠军就变成了 Gemini 3.5 Flash。没有哪个模型通吃,选型的功夫全在『你的活到底考哪一项』。
农业需求预测落地实测:Church Brothers 把易腐货短期预测准确率提升 40%,赢在把 AI 嵌进补货流程
展开详情
- **数字**:短期需求预测准确率最高提升 40%,SKU 级需求可见性显著改善,超额库存与损耗一起下降
- **规模**:4 万英亩、5000 万箱/年、400+ SKU、6 万+ 车次的真实体量,不是 demo 级样本
- **打法**:不追大模型,把预测嵌进易腐货补货与路由流程——早一天预测准,就少一车报废
Meerkats.ai:一个人四周做到 $3k MRR 的 AI 增长编排平台,把 SDR/营销/代理的重复活打包成软件
展开详情
- **成绩**:单人、四周、$3k MRR,赛道拥挤仍跑通——不是靠新模型,是靠把一套熟悉的增长流程产品化
- **切口**:替掉 SDR/营销/代理的重复劳动(找线索、补数据、跑触达、跟进),卖给最痛这块的中小团队
- **壁垒**:创始人 20 年 GTM 经验本身就是护城河——他知道每一步该编排成什么,比通用工具更贴业务
评测该看哪一榜:Terminal-Bench 上 GPT-5.5 领先,换到 MCP Atlas 工具调用榜冠军就变成 Gemini 3.5 Flash
展开详情
- **对比**:Terminal-Bench 2.0 上 GPT-5.5 82.7% vs Gemini 3.5 Flash 76.2%;但换到 MCP Atlas 工具调用榜,Gemini 3.5 Flash 83.6% vs Claude Opus 4.7 77.3%
- **分野**:终端掌控(跑命令、修环境)和 MCP 工具调用是两种能力,冠军互不重合,别用一个分数概括『谁更会当 agent』
- **方法**:Scale 今年把 MCP Atlas 评分判官升级、加了瞬时错误重试、把 20 轮上限改成每任务最多 100 次工具调用预算——评测本身也在往真实场景靠
Tool-Making and Self-Evolving LLM Agents in Low-Latency Systems
展开详情
- **问题**:推理时反复即兴写代码的循环,既拖慢延迟又难保证正确性,是生产 agent 的隐性成本大头
- **方法**:把重复的 SOP 步骤离线编译成经验证、带版本的工具,部署前固化,运行时直接调用
- **意义**:给『self-evolving agent』一个工程化定义——不是越跑越玄,而是把跑过的经验沉淀成可复用、可审计的工具库
真正的瓶颈从模型变成了连接:MCP Gateway 正长成 agent 时代的新基础设施品类
展开详情
- **转向**:瓶颈从『模型够不够强』变成『本地系统怎么安全接给云端 agent』——连接成了新的硬骨头
- **品类**:MCP Gateway 把鉴权/工具路由/可观测性/治理收进一层控制面;Gartner 预测多数 API 网关厂商将纳入 MCP 能力
- **落差**:225 位安全/IT 负责人调查——多数组织能监控 agent,却在它出错时拦不住,治理仍是缺口
写 Agent Skills 也能变现:技能市场从 1 家涨到 8 家,创作者拿 80% 分成、按月订阅调用全目录
展开详情
- **格局**:agent skills 市场半年从 1 家扩到 8 家,官方(anthropics/skills)+第三方(Agensi/SkillsMP/Netresearch)并存,生态在快速成型
- **变现**:Agensi 创作者拿 80% 分成、上架先过安全扫描,Pro 用户 $9/月 MCP 实时调用全目录——技能开始有清晰的收费闭环
- **可移植**:Netresearch 市场做成跨 Claude Code/Cursor/Copilot/Codex/Gemini CLI 等 30+ agent 可用,一次写、多端复用
被 Anthropic、OpenAI 抄作业的 Palantir FDE 打法:按管道额度配人、驻场 8–16 周、上线第一天就交东西
展开详情
- **四招**:每 $2–5M 管道配 1 名 FDE、单客户驻场嵌入 8–16 周、上线第一天就交可用东西、持续做对话式客户发现
- **反模式**:拒绝『需求文档表演』——不是先写长文档再开发,而是 day-one 就交东西、在真实反馈里迭代
- **抄作业**:这套原是 Palantir 的打法,如今 Anthropic、OpenAI 都在复制——说明 AI 落地的组织方式正在收敛成一种范式
Andrej Karpathy
在 LLM agent 之上,正在长出新的一层——它把编排、调度、上下文、工具调用和持久化整体抬到下一个台阶。