Hall of Fame
今日趋势综述
今天的信号:模型分数已经不重要,重要的是外面那层「工程」
把今天几条串起来看,会发现一个反复出现的底色:模型本身的分数正在失去区分度,价值正在往「模型外面那一圈」转移。SWE-bench Verified 上,DeepSeek V4 Pro(80.6)、MiniMax M3(80.5)和闭源的 Gemini 3.1 Pro(80.6)几乎踩在同一条线上,开源和闭源在这一档已经分不太出来——离前沿的 Claude Fable 5(95.0)还差约 15 分,但对大多数任务来说,80 分的开源模型已经够用。既然模型拉不开差距,差距就跑到别处去了。
差距去哪了?去了「循环」和「落地」。Bullet 不改模型,只优化 agent 的循环(自动选模型、并行搜索、精准检索而非全量嵌入),就号称比 Claude Code / Codex 快 30-60%、SWE-bench 冲到 95.8%——这说明同一个模型,harness 写得好不好能差出几十秒。oh-my-pi 把 IDE、调试器、LSP、子 agent 全焊进一个 29k 星的编码 agent,也是同一个逻辑:模型是零件,工程是产品。再往产业里看,保险公司(Lemonade 55% 理赔全自动、Aviva 80+ 模型省下 8200 万美元、Allianz 七个 agent 100 天上线)证明真正值钱的是「把能力嵌进业务流程」;FDE 方法论、AI 自动化代运营的定价表($2500 搭建 + $750/月)都在说同一件事——会交付比会调 API 值钱得多。
对想在 AI 时代往上走的个人,今天的方向很清楚:别再纠结「哪个模型分高」,那已经是红海且没有护城河。把精力放到三件更耐用的事上——(1) 磨「循环/harness/工程」的手艺,同样的模型你能榨出更好的结果;(2) 挑一个你懂的垂直业务(保险、法务、某类小企业流程),把 AI 落地成能收钱的工作流;(3) 学会评估——无论是评估模型该选哪个、还是像 ACES 那样把 skill 当可执行工件持续评估,判断力本身正在成为稀缺技能。能力平权之后,护城河在「怎么用」而不是「用什么」。
can1357/oh-my-pi
展开详情
把 IDE 焊进终端里的开源 AI 编码 agent
周增长:本周稳居 AI 编码 agent 类前列,约 2 万+ commit、工程完成度高,是增速较快的项目之一
- **架构**:约 8 万行 Rust 内核 + TypeScript 界面,接入 60+ LLM 供应商、内置 31 个工具,模型可随意换
- **能力**:LSP 语言服务、调试器、子 agent、网页搜索、时间旅行式流规则、带优先级判定的 code review 全都内建
- **热度**:约 29.1k 星、2 万+ commit,是本周编码 agent 里工程完成度最高的一批之一
Bullet
展开详情
- **思路**:不改模型只优化循环——自动选模型/推理档、并行 I/O、定向检索代替全量嵌入
- **对比**:SWE-bench Verified 95.8%(进前三)、约 119 秒/任务,号称比 Claude Code / Codex 快 30-60%
- **复用**:直接挂现有 Claude Code / Codex 订阅或 API key,也能用本地模型,迁移成本低
SWE-bench Verified 开源大堵车:DeepSeek V4 Pro 80.6 / MiniMax M3 80.5 咬平 Gemini 3.1 Pro,但离前沿仍差约 15 分
展开详情
- **对比**:SWE-bench Verified 上 DeepSeek V4 Pro 80.6 vs MiniMax M3 80.5 vs Gemini 3.1 Pro 80.6——三者几乎并列,开源已咬平这档闭源
- **差距**:前沿的 Claude Fable 5 报 95.0%,比 80 分档高出约 15 分,「最强」和「够用」之间仍是断层
- **含义**:80 分档已成红海且无护城河,模型选择正从「谁最强」变成「谁最划算」
保险 AI 落地实测:Lemonade 55% 理赔全自动、2 秒赔付,Aviva 靠 80+ 模型一年省 8200 万美元、投诉降 65%
展开详情
- **Lemonade**:55% 理赔全自动、最快 2 秒赔付,AI Jim 处理 96% 首次报案无需人工
- **Aviva**:80+ 模型,定责时间 -23 天、路由准确率 +30%、投诉 -65%,一年省约 8200 万美元
- **承保**:审核 3 天→3 分钟,直通率 10-15%→70-90%,欺诈识别 +30%,回本周期 6-14 个月
《Shipping Enterprise AI》:FDE 的落地方法论——先拆工作流,再查数据/权限/身份/治理是否 ready,才谈上线
展开详情
- **核心方法**:把 AI 用例拆成可构建的工作流,而不是直接上模型——落地是流程问题不是模型问题
- **落地前提清单**:数据到位 / 权限身份打通 / 治理合规 ready,缺一项就别谈上线
- **定位**:把「贴客户交付」从个人英雄主义变成可复用流程,直击企业 AI 卡在 pilot 的病根
AI 自动化「代运营」的单位经济学:$2500 搭建 + $750/月 retainer,单个线索机器人报价 $5K-15K
展开详情
- **定价**:搭建 $2500-25000/项目 + 月度 retainer $300-800,单个线索机器人可报 $5K-15K
- **模型**:卖系统不卖工时——用 MRR(月度经常性收入)替代一次性项目费,是能滚起来的关键
- **节奏**:3 个客户即约 $2250/月经常性;单人操作者 12-24 个月常爬到 $8K-15K/月一档
Claude Skills 市场对比:SkillsMP 号称 200 万聚合、AI Skill Market 4751 个精选、SkillsLLM 1600 个「安全审过」——但规模≠质量
展开详情
- **规模**:SkillsMP 号称 200 万+ 聚合、Skills Directory 约 9.7 万——但多为自动索引 GitHub,未做审核
- **质量**:AI Skill Market 4751 个精选(30 秒零配置)、SkillsLLM 1600+「安全审过」,走的是策展路线
- **安全**:市场自己都声明不为每个 skill 背书,安装前必须审源码、脚本、权限,别装看不懂的
ACES: Evaluating Skills, Not Just Agents — 把 skill 当可执行工件来持续评估
展开详情
- **颗粒度**:评估对象从「整个 agent」下沉到「单个 skill / 能力包」,定位问题更准
- **工程化**:仓库原生、把 skill 当可执行工件,能像 CI 一样对 skill 库做持续/回归评估
- **补位**:正好接住 skill 市场爆发后的空白——数量已过剩,缺的是「好不好」的度量
Simon Willison
我们已经越过了那个拐点——AI 不再是「会不会成」的问题,而是「多快、落到哪」的问题;接下来是自动化时间表和『暗工厂』的时代。