📅
Hall of Fame
Hall of Fame
Track
Type
Source
8月24日 周一 · 8 条
今日趋势综述
今天的主线是'分发已解决、质量与落地才值钱':skills 数量冲到 28 万+ 但平均质量只有 6.2/12、36% 被测出注入风险,Claude Sonnet 5 用近半价把 agentic 能力做成便宜大碗,而真正稀缺的仍是把能力做扎实、嵌进保险理赔/失败扣款这种具体苦活并被真正用起来。
今天的信号:能力和分发都过剩了,稀缺的是'做扎实'和'嵌进去'

把今天几条串起来,两个过剩、两个稀缺看得很清楚。过剩的第一是分发:agent skills 已经超过 28 万个公开可用、portable 到约 40 个产品,社区目录甚至索引了近 190 万条——'找不到能力'早就不是问题。过剩的第二是能力本身:Claude Sonnet 5 用近乎 Opus 4.8 的表现、只要 40–60% 的价格,把 agentic 智能做成了便宜大碗;SWE-bench Verified 顶尖模型继续挤在一处。能力和分发都在快速商品化、变便宜。

但便宜的是数量,值钱的是质量与落地。SkillsBench 扒了 47,150 个公开 skill,平均质量只有 6.2/12,一次安全审计在 22,511 个 skill 里揪出 14 万个问题、Snyk 测出 36% 有提示注入——而'经过策展/review 的 skill'能把 agent 通过率平均拉高 16.2 个百分点。这就是全部价值所在:不是又多了一个 skill,而是有人把它做扎实、审干净。落地这一侧同样:保险业把理赔直通率从 10–15% 拉到 70–90%、Aviva 靠 80 个模型省下 6000 万英镑,但赢家都赢在把 AI 卡进'定责、核保、催款'这种具体苦活;企业 95% 的 AI 试点卡在最后一公里的集成,于是 FDE(前置部署工程师)成了真正的交付层。连挣现金流也是这个逻辑:把'挽回失败扣款'这件小而具体的苦活自动化,能稳定收到 70–90% 毛利的月费。

所以想在 AI 时代增值,别把时间花在'再产出一个 skill、再追一个新模型'上——那两层都在变便宜、会被商品化。把复利押在三件越来越值钱的事上:一是质量工程,把 skill、harness、eval 做到能被 review、能被信任;二是落地,走进一个具体行业与流程,把能力嵌进去、量化出结果;三是分销,锁定一个垂类的具体痛点(催款、核保、审材料),搞定前 10 个、前 100 个付费客户。今天每一条,都是这三件事的注脚。

今日新增 7
#02
vellum.ai Article
NEW

Claude Sonnet 5 第三方横评:用 40–60% 的价格逼近 Opus 4.8,agentic 智能开始'便宜大碗'

Anthropic 发布 Claude Sonnet 5,主打'最 agentic 的性价比款':能自主用浏览器、终端等工具,表现逼近 Opus 4.8,价格却低一大截。第三方综述给出的对比很清楚——同一 SWE-bench Verified 基准上,Sonnet 5 拿 72.7%,比上一代 Sonnet 4.6 的 62.3% 跳升 10 个点,但仍落后 Opus 4.8 的 79.4%;更难的 SWE-bench Pro 上 Sonnet 5 是 63.2%、Opus 4.8 是 69.2%,差距还在。价格才是它的杀招:8 月 31 日前介绍价 $2/百万输入、$10/百万输出,9 月起转 $3/$15,而 Opus 4.8 是 $5/$25——比 Opus 便宜约 40–60%。结论是:绝大多数 agent 场景,Sonnet 5 是新的默认;只有在 SWE-bench Pro、Terminal-Bench、OSWorld、无工具 HLE 这些最硬的任务上,才值得为 Opus 4.8 多付钱。
#评测
另有 2 家信源报道
展开详情
  • **对比**:SWE-bench Verified 上 Sonnet 5 72.7% vs Sonnet 4.6 62.3% vs Opus 4.8 79.4%;SWE-bench Pro 上 Sonnet 5 63.2% vs Opus 4.8 69.2%
  • **价格**:Sonnet 5 介绍价 $2/$10(9 月起 $3/$15),Opus 4.8 $5/$25——同代下便宜约 40–60%,agentic 能力被大幅拉低门槛
  • **怎么选**:绝大多数 agent/编码流水线用 Sonnet 5 做默认;只有最硬的长程/无工具任务(SWE-bench Pro、Terminal-Bench、OSWorld、HLE)才为 Opus 4.8 多付钱
推荐理由:对个人:这条最直接的机会是'重新算你的 token 账'。如果你在跑 agent 工作流或做 AI 产品,很可能一直在用最贵的旗舰模型兜底——现在把默认档从 Opus 换成 Sonnet 5,同样效果成本能砍近一半,省下的预算可以换成'更多次调用/更长上下文/更多用户'。真正的技能不是追最新模型,而是建立'按任务难度分级选模型'的习惯:便宜档跑 80% 的活,只在硬骨头上调用贵档。谁先把这套分级用熟,谁的单位成本就更低、跑得更久。
#03
aibuzz.blog Article
NEW

保险 AI 落地实测:Aviva 靠 80 个模型省 6000 万英镑、Lemonade 55% 理赔全自动,赢家把 AI 卡进'定责+核保+反欺诈'

保险是今天轮到的垂直行业,信号很硬:AI 已经从试点进了生产,而且赢家都赢在把 AI 卡进'定责、核保、反欺诈'这几件最费人力的苦活。具体案例——Aviva 在理赔域部署 80+ 个 AI 模型、累计省下超 6000 万英镑,复杂案件的定责时间缩短 23 天;Lemonade 的理赔机器人 AI Jim 保持 2 秒结案的世界纪录,截至 2025 年 Q4 已有 55% 的理赔全流程自动化;Allianz 的 Project Nemo 用 7 个 AI agent、不到 100 天上线,把食品变质类理赔从几天压到几小时。行业层面的数字同样直白:理赔直通率(STP)从传统的 10–15% 拉到领先者的 70–90%,核保时效从 3 天压到 3 分钟,欺诈检测准确率提升 30%+,一家中型险企一年因此少赔 200–700 万英镑。麦肯锡测算,AI 领先险企的股东总回报是落后者的 6 倍。
#行业应用
另有 2 家信源报道
展开详情
  • **理赔**:Aviva 80+ 模型省超 6000 万英镑、复杂定责缩短 23 天;Lemonade 55% 理赔全自动、AI Jim 2 秒结案;Allianz Nemo 7 个 agent、<100 天上线把变质险从几天压到几小时
  • **核保/直通率**:理赔直通率从 10–15% 拉到 70–90%,核保从 3 天压到 3 分钟,48% 的边界个险决策已自动化
  • **反欺诈**:欺诈检测提升 30%+,中型险企一年少赔 200–700 万英镑;AI 领先险企股东回报是落后者的 6 倍
推荐理由:对个人:保险是'流程密集 + 数据结构化 + 每个决策都有明确金额'的行业,特别适合把 AI 嵌进具体环节收费。机会不在'做一个保险大模型',而在'把一件苦活自动化'——比如给中小险企/经纪做'理赔材料预审''核保信息抽取''欺诈信号打分'的自动化工具。这些环节 ROI 可量化(省的赔付、省的人天一算就出来),最容易说服客户付费。先挑一个你能拿到数据的细分险种(宠物险、车险、旅行险),把一个环节做深,比做全都强。
商机信号(加速):谁付钱:中小险企、保险经纪与第三方理赔公司——大厂已自研,中小玩家买不起大团队但同样被理赔/核保的人力成本压着,愿意为能量化 ROI 的单点自动化付费 痛点:理赔定责、核保信息抽取、欺诈打分仍高度依赖人工,直通率卡在 10–15%;想上 AI 但缺工程与合规交付能力 切入点:锁定一个细分险种(宠物/车/旅行险),做'理赔材料预审'或'核保信息抽取'这一个环节的自动化交付,按省下的人天/赔付计价,用可量化 ROI 拿下前几个客户再横向复制
#04
getperspective.ai Article
NEW

怎么把 FDE'交付函数'搭起来:95% 企业 AI 试点卡在最后一公里,答案不是更多工具而是前置部署工程

如果说之前讲的是'FDE 这个岗位为什么爆火',这篇讲的是更实操的一层:怎么把 FDE 从'创始人一个人救火'搭成一个能规模化的交付函数。核心判断没变——95% 的企业 AI 试点到不了生产,卡点不是模型能力,而是最后一公里的集成:缺 API、数据脏、workflow 有一堆例外和边角。FDE 就是那个带着'客户判断力'的工程师,住进客户环境 60–180 天,把模糊的企业问题变成能上线的产品。方法论上几条很具体:什么时候招第一个 FDE——在跑通 3 个可复制、ACV 高于约 5 万美元的企业试点、且创始人被集成工作卡住之后;怎么组织——围绕小 pod、挂在产品或工程线下、设明确的交付门(gate),而不是按人头或客户数堆;薪酬——种子期约 $200K 全包,到 C 轮及以后涨到 $450K–$550K+,最大的包在 Anthropic、OpenAI、Databricks、Scale。
#FDE
另有 1 家信源报道
展开详情
  • **卡点**:95% 企业 AI 试点到不了生产,瓶颈是最后一公里集成(缺 API、脏数据、workflow 例外),不是模型能力
  • **何时招**:跑通 3 个可复制、ACV>约 5 万美元的试点、创始人被集成工作卡住之后再招第一个 FDE——太早没打法可标准化,太晚会输给对手
  • **怎么搭**:围绕小 pod、挂产品/工程线、设明确交付门;薪酬种子期约 $200K 全包,C 轮后 $450K–$550K+
推荐理由:对个人:这是'落地'这条最值钱赛道的岗位化答案。模型能力在变便宜、会被商品化,而'把模型能力真正嵌进一家企业的脏数据和例外流程里'的能力极度稀缺、薪酬还在涨。想吃这波红利,别只练模型和提示词——去补三件 FDE 的核心功:一是集成工程(API、数据管道、把脏数据接进来),二是客户判断力(能把模糊业务问题翻译成可交付方案),三是端到端交付(住进客户环境把东西跑起来)。哪怕不进大厂,这套能力也能直接变成给中小企业做 AI 交付的现金流生意。
#05
procindex.com Product 直接可用
NEW

把'挽回失败扣款'自动化挣现金流:AI 催款(dunning)微 SaaS,70–90% 毛利、月费绑客户营收

今天挑到的一条真正合格的现金流路子:给别的 SaaS 做'失败扣款挽回'(dunning)自动化。痛点是硬需求——信用卡过期/余额不足导致的失败订阅扣款,会吃掉 SaaS 公司 8–15% 的 MRR,这是白白流失的钱。AI 催款能把挽回率从传统的 30–40% 提到 65–80%:靠个性化催收话术、按客户行为优化重试时机与升级路径。品类里有可验证的收入样本:Churnkey 做到 $30K MRR、平均帮客户降 18% 流失;另一款催款邮件工具从 0 起步、12 个月做到 $4,200 MRR、120 个客户、月费 $29–99、月流失仅 3%。这门生意的结构特别适合个人:70–90% 毛利、收入直接绑在客户'被挽回的营收'上(客户很愿意付,因为是净赚),且需求跨行业通用。
#小微现金流#面向 SaaS 商家按月订阅…
另有 2 家信源报道
展开详情
  • **痛点值钱**:失败扣款吃掉 SaaS 公司 8–15% 的 MRR;AI 催款把挽回率从 30–40% 提到 65–80%,挽回的每一分都是客户净赚
  • **收入样本**:Churnkey $30K MRR、平均降 18% 流失;一款催款工具 0→$4,200 MRR/12 个月、120 客户、$29–99/月、月流失仅 3%
  • **结构友好**:70–90% 毛利、月费绑客户营收(付费意愿强)、需求跨行业通用,单人也能维护
推荐理由:对想挣现金流的普通人:这是'小而具体的苦活自动化'的样板——不追风口,专治一个能直接算出钱的痛点。切入的最小切口不是做一个大而全的 Churnkey,而是先服务一个你熟的垂类(比如中小 Shopify 商家、某类订阅制工具),把'过期卡挽回'这一个动作做到位、能给客户看到'这个月帮你追回了 X 元'的报表。收入绑客户营收意味着你和客户利益一致、最好谈;70–90% 毛利意味着几十个客户就能养活一个人。
My Take:评分(5=最优):最快成交 4 / 最低成本 4 / 可复制 5 / 风险安全度 4。绑客户营收、痛点可量化,是最容易开单也最容易复制的现金流微 SaaS 之一。
商机信号(加速):谁付钱:有订阅收入、正被失败扣款白白吃掉 8–15% MRR 的中小 SaaS 与订阅制商家——他们清楚这是净损失,付费意愿强 痛点:过期卡/余额不足导致的失败扣款持续流失,自建催款流程费时、传统方式只挽回 30–40% 切入点:先服务一个熟悉的垂类(中小 Shopify/某类订阅工具),把'过期卡挽回'一个动作做深,交付'本月追回 X 元'的可视报表,月费或按挽回金额分成,用 70–90% 毛利跑通前 20–50 个客户
#06
arXiv Paper
NEW

Agentic Plan Caching:把 agent 的'计划'缓存复用,平均省 50% 成本、27% 延迟

这篇提出 Agentic Plan Caching(APC):agent 在处理任务时,规划(planning)阶段往往最烧 token、最慢;APC 把这些规划产出抽取成结构化的'计划模板',存起来、按需自适应地改写,然后在语义相似的新任务上复用,从而跳过重复的规划开销。在多个真实 agent 应用上评测,平均降低 50.31% 成本、27.28% 延迟,同时保持性能不掉。它和今天 Claude Sonnet 5'把能力做便宜'是一体两面:一个从模型侧压价,一个从系统侧压量——真正决定 agent 单位成本的,越来越是外面这层 harness 的工程(缓存、记忆、复用),而不只是底座模型。
在'agent 能力过剩、成本却居高'的当下,给出一条不换模型就把 agent 变便宜的工程路径:从规划阶段抽取可复用的结构化'计划模板'并跨相似任务复用。
#AI Agent
展开详情
  • **省钱**:把 agent 规划阶段的产出做成可复用'计划模板',跨相似任务复用,平均降 50.31% 成本、27.28% 延迟且性能不掉
  • **思路**:抽取→存储→自适应改写→复用结构化 plan,本质是给 agent 加一层'规划缓存',避开重复的高成本推理
  • **定位**:与'换更便宜的模型'互补——从系统侧而非模型侧压成本,是 harness 工程的一块拼图
推荐理由:对个人:这条提醒你,'把 AI 用便宜'本身就是一门稀缺技能,且不依赖你能不能训模型。真正能拉开差距的往往是系统工程——缓存、记忆、复用、按难度分级调用。如果你在做 agent 产品或内部工具,先别急着换模型,把'重复的规划/检索/生成能不能缓存复用'过一遍,常常能几乎零成本砍掉一半开销。把这类'省钱工程'做熟,是能直接体现在账单和产品毛利上的硬本事。
#07
agentman.ai Article
NEW

Agent Skills 生态 2026 全景:28 万+ 公开 skill,但分发已解决、质量与安全没解决

这份报告把 agent skills 生态的家底摸了一遍,结论一句话:分发(distribution)已经解决,质量与安全还没解决。规模侧——截至 2 月已有 28 万+ 公开 skill,绝大多数由去中心化的第三方维护;skill 已可 portable 到约 40 个产品(Cursor、VS Code、Databricks Genie 等),社区目录 SkillsMP 甚至索引了约 190 万条从 GitHub 抓来的 skill。质量侧却很不乐观:SkillsBench 分析 47,150 个公开 skill,平均质量只有 6.2/12;而'经过策展的 skill'能把 agent 通过率平均拉高 16.2 个百分点。安全侧更刺眼:一次对 22,511 个 skill 的审计揪出 140,963 个问题,Snyk 的 ToxicSkills 研究在被测 skill 中检出 36% 含提示注入。报告的落点很清楚:现在真正能推动 agent 性能的,是'策展、经过 review 的 skill 库'这一小块,而不是海量目录。
#Skills#元技能
另有 1 家信源报道
展开详情
  • **规模**:28 万+ 公开 skill、portable 到约 40 个产品,社区目录索引约 190 万条——分发彻底解决
  • **质量**:SkillsBench 测 47,150 个 skill 平均仅 6.2/12;而策展 skill 能把 agent 通过率平均拉高 16.2 个百分点
  • **安全**:22,511 个 skill 审计出 14 万+ 问题,Snyk 测出 36% 含提示注入——数量越多、雷越多
推荐理由:对个人:这份全景图把机会指得很直白——价值正在从'生产 skill'转移到'策展、审计、加固 skill'。当供给过剩(百万级)、质量却只有 6.2/12、三分之一有注入风险时,'会挑好 skill、会审别人 skill、会按团队规范加固'就成了别人还没意识到需要的服务。现在入场做'skill 质检/策展',是趁生态刚意识到问题、标准还没成型的窗口。和昨天讲的 skill'坏味道'checklist 是一脉相承的:先从你熟的垂类切入,把'安全 + 质量'两道关做成可交付、可收费的服务。
#08
indiehackers.com Article 值得关注
NEW

单人做到 $125K MRR 的关键不是多做功能,而是死磕'对的那一个客群'

一位单人创始人复盘:2026 年初约 $1.03M ARR,到 6 月做到约 $125K MRR(约 $1.5M run rate),半年增长约 44%。他归因的关键动作不是猛加功能、也不是砸更多渠道,而是'把资源死磕在对的那一个客群上'——识别出哪一类客户付费意愿强、留存好、扩张空间大,然后把产品、定价、获客全部围绕这个客群收窄重做,砍掉分散注意力的长尾。这条和今天'分发/能力都过剩、聚焦才稀缺'的主线完全一致:在 AI 让做产品的门槛大幅降低、人人都能快速起一个 SaaS 的当下,胜负手已经从'能不能做出来'转移到'能不能选对客群、把前 100 个付费客户服务到极致'。
#小微现金流#SaaS 订阅,靠聚焦高价值…
另有 1 家信源报道
展开详情
  • **数据**:单人 solo,2026 年初约 $1.03M ARR → 6 月约 $125K MRR(约 $1.5M run rate),半年增约 44%
  • **关键动作**:不是加功能/加渠道,而是把产品、定价、获客全收窄到'付费意愿强、留存好'的那一个客群
  • **趋势**:AI 把做产品门槛拉低后,稀缺的不是能力而是'选对客群 + 服务好前 100 个客户'的聚焦
推荐理由:对想挣现金流的普通人:这条是给'什么都想做'的解药。AI 时代起一个 SaaS/工具越来越容易,于是真正的瓶颈从'能不能做'变成'为谁做、服务多深'。别再用功能数量和渠道数量堆增长——先花时间找出你现有用户里哪一类续费最好、扩张最快,然后把整条产品线收窄到只服务他们。宁可把一个客群服务到别人抄不走,也不要把十个客群都做成半吊子。聚焦本身,就是 2026 年最被低估的增长杠杆。
My Take:评分(5=最优):最快成交 3 / 最低成本 4 / 可复制 4 / 风险安全度 4。不是具体项目而是可复用的打法——聚焦对的客群,适合已有一点用户、增长卡住的独立开发者。
仍在热榜 1
Repo mattpocock/skills 在榜 3d 知名 TypeScript 教育者 Matt Pocock 把自己 .agents 目录里给'真正的工程师'用的一整套 … Skills · 编程开发