Hall of Fame
今日趋势综述
今天的信号:能力和分发都过剩了,稀缺的是'做扎实'和'嵌进去'
把今天几条串起来,两个过剩、两个稀缺看得很清楚。过剩的第一是分发:agent skills 已经超过 28 万个公开可用、portable 到约 40 个产品,社区目录甚至索引了近 190 万条——'找不到能力'早就不是问题。过剩的第二是能力本身:Claude Sonnet 5 用近乎 Opus 4.8 的表现、只要 40–60% 的价格,把 agentic 智能做成了便宜大碗;SWE-bench Verified 顶尖模型继续挤在一处。能力和分发都在快速商品化、变便宜。
但便宜的是数量,值钱的是质量与落地。SkillsBench 扒了 47,150 个公开 skill,平均质量只有 6.2/12,一次安全审计在 22,511 个 skill 里揪出 14 万个问题、Snyk 测出 36% 有提示注入——而'经过策展/review 的 skill'能把 agent 通过率平均拉高 16.2 个百分点。这就是全部价值所在:不是又多了一个 skill,而是有人把它做扎实、审干净。落地这一侧同样:保险业把理赔直通率从 10–15% 拉到 70–90%、Aviva 靠 80 个模型省下 6000 万英镑,但赢家都赢在把 AI 卡进'定责、核保、催款'这种具体苦活;企业 95% 的 AI 试点卡在最后一公里的集成,于是 FDE(前置部署工程师)成了真正的交付层。连挣现金流也是这个逻辑:把'挽回失败扣款'这件小而具体的苦活自动化,能稳定收到 70–90% 毛利的月费。
所以想在 AI 时代增值,别把时间花在'再产出一个 skill、再追一个新模型'上——那两层都在变便宜、会被商品化。把复利押在三件越来越值钱的事上:一是质量工程,把 skill、harness、eval 做到能被 review、能被信任;二是落地,走进一个具体行业与流程,把能力嵌进去、量化出结果;三是分销,锁定一个垂类的具体痛点(催款、核保、审材料),搞定前 10 个、前 100 个付费客户。今天每一条,都是这三件事的注脚。
Claude Sonnet 5 第三方横评:用 40–60% 的价格逼近 Opus 4.8,agentic 智能开始'便宜大碗'
展开详情
- **对比**:SWE-bench Verified 上 Sonnet 5 72.7% vs Sonnet 4.6 62.3% vs Opus 4.8 79.4%;SWE-bench Pro 上 Sonnet 5 63.2% vs Opus 4.8 69.2%
- **价格**:Sonnet 5 介绍价 $2/$10(9 月起 $3/$15),Opus 4.8 $5/$25——同代下便宜约 40–60%,agentic 能力被大幅拉低门槛
- **怎么选**:绝大多数 agent/编码流水线用 Sonnet 5 做默认;只有最硬的长程/无工具任务(SWE-bench Pro、Terminal-Bench、OSWorld、HLE)才为 Opus 4.8 多付钱
保险 AI 落地实测:Aviva 靠 80 个模型省 6000 万英镑、Lemonade 55% 理赔全自动,赢家把 AI 卡进'定责+核保+反欺诈'
展开详情
- **理赔**:Aviva 80+ 模型省超 6000 万英镑、复杂定责缩短 23 天;Lemonade 55% 理赔全自动、AI Jim 2 秒结案;Allianz Nemo 7 个 agent、<100 天上线把变质险从几天压到几小时
- **核保/直通率**:理赔直通率从 10–15% 拉到 70–90%,核保从 3 天压到 3 分钟,48% 的边界个险决策已自动化
- **反欺诈**:欺诈检测提升 30%+,中型险企一年少赔 200–700 万英镑;AI 领先险企股东回报是落后者的 6 倍
怎么把 FDE'交付函数'搭起来:95% 企业 AI 试点卡在最后一公里,答案不是更多工具而是前置部署工程
展开详情
- **卡点**:95% 企业 AI 试点到不了生产,瓶颈是最后一公里集成(缺 API、脏数据、workflow 例外),不是模型能力
- **何时招**:跑通 3 个可复制、ACV>约 5 万美元的试点、创始人被集成工作卡住之后再招第一个 FDE——太早没打法可标准化,太晚会输给对手
- **怎么搭**:围绕小 pod、挂产品/工程线、设明确交付门;薪酬种子期约 $200K 全包,C 轮后 $450K–$550K+
把'挽回失败扣款'自动化挣现金流:AI 催款(dunning)微 SaaS,70–90% 毛利、月费绑客户营收
展开详情
- **痛点值钱**:失败扣款吃掉 SaaS 公司 8–15% 的 MRR;AI 催款把挽回率从 30–40% 提到 65–80%,挽回的每一分都是客户净赚
- **收入样本**:Churnkey $30K MRR、平均降 18% 流失;一款催款工具 0→$4,200 MRR/12 个月、120 客户、$29–99/月、月流失仅 3%
- **结构友好**:70–90% 毛利、月费绑客户营收(付费意愿强)、需求跨行业通用,单人也能维护
Agentic Plan Caching:把 agent 的'计划'缓存复用,平均省 50% 成本、27% 延迟
展开详情
- **省钱**:把 agent 规划阶段的产出做成可复用'计划模板',跨相似任务复用,平均降 50.31% 成本、27.28% 延迟且性能不掉
- **思路**:抽取→存储→自适应改写→复用结构化 plan,本质是给 agent 加一层'规划缓存',避开重复的高成本推理
- **定位**:与'换更便宜的模型'互补——从系统侧而非模型侧压成本,是 harness 工程的一块拼图
Agent Skills 生态 2026 全景:28 万+ 公开 skill,但分发已解决、质量与安全没解决
展开详情
- **规模**:28 万+ 公开 skill、portable 到约 40 个产品,社区目录索引约 190 万条——分发彻底解决
- **质量**:SkillsBench 测 47,150 个 skill 平均仅 6.2/12;而策展 skill 能把 agent 通过率平均拉高 16.2 个百分点
- **安全**:22,511 个 skill 审计出 14 万+ 问题,Snyk 测出 36% 含提示注入——数量越多、雷越多
单人做到 $125K MRR 的关键不是多做功能,而是死磕'对的那一个客群'
展开详情
- **数据**:单人 solo,2026 年初约 $1.03M ARR → 6 月约 $125K MRR(约 $1.5M run rate),半年增约 44%
- **关键动作**:不是加功能/加渠道,而是把产品、定价、获客全收窄到'付费意愿强、留存好'的那一个客群
- **趋势**:AI 把做产品门槛拉低后,稀缺的不是能力而是'选对客群 + 服务好前 100 个客户'的聚焦