Hall of Fame
Hall of Fame
Track
Type
Source
9月20日
今日趋势综述
选型的核心变量已经从『谁最强』彻底转向『每单位任务多少钱』,同时 AI 正沿着保险、农业等垂直行业以可量化的 ROI 落地,个人的机会在于把便宜的模型 + 现成的技能/语音基建,做成能收现金的垂类服务。
今天的信号:能力过剩之后,赢家是『把便宜能力装进具体业务』的人
把今天几条线索连起来看,会发现一个一致的方向:模型能力本身已经不再稀缺,甚至过剩了。编码 agent 的评测显示 Cursor Composer 2.5 用 Opus 4.7 约 1/60 的每任务成本,就能拿到只低 4 分的分数;GitHub HydraFusion 靠多模型编排在更低成本下追平旗舰。当『够用的智力』被压到几分钱一单,选型的问题就从『买最强的』变成了『按任务难度 × 每分成本分层』——这也是 Karpathy 说『能外包思考,但不能外包理解』的另一面:会调度、会判断该用哪个模型、该拒绝什么,比会写每一行代码更值钱。
另一条线是价值的落点在往下沉。保险业的核保从 3 天压到 3 分钟、直通率从 10% 冲到 90%,农业里 AI 把产量拉高 15–40%、用水砍掉三成——这些不是 PPT,是有具体数字的真实部署。对个人来说,真正的机会不在于再训一个模型,而在于把这些已经跌到白菜价的能力,装进一个具体行业的具体流程里去收钱:给本地商家搭 2 分钱一分钟的 AI 电话前台、给小农场配 500 美元以内的 AI 决策工具、用被验证过质量的 curated skills 库去接垂类交付。今天的 Skills 生态报告点破了同一件事——190 万个公开技能里平均质量只有 6.2/12,真正抬高 agent 成绩的是被人工筛过的那一小撮。喧嚣的供给里,稀缺的永远是『筛选 + 落地』这件手艺。
#01
artificialanalysis.ai
Article
NEW
编码 agent 选型翻篇:Cursor Composer 2.5 用 Opus 约 1/60 的每任务成本,拿到只低 4 分的分数
Artificial Analysis 的 Coding Agent Index 把『分数』和『每完成一个任务的美元成本』摆在一起看,结论很刺眼:Cursor 的 Composer 2.5 拿到指数 62,每任务约 $0.07;而排在它上面的 Claude Opus 4.7(66)和 GPT-5.5(65)每任务要 $4.10 和 $4.82。也就是说,头部旗舰只比 Composer 高 3–4 分,却贵了近 60 倍。Composer 2.5 Standard 档的每 token 价格约为 Opus 4.7 / GPT-5.5 的 1/10。这条榜单把行业共识钉死了:决定你 AI 账单的是『每任务成本』,不是榜首分数或单价 token。
另有 2 家信源报道
展开详情
- **对比(分数几乎持平)**:Composer 2.5 指数 62 vs GPT-5.5 65 vs Claude Opus 4.7 66(Artificial Analysis Coding Agent Index),头部只领先 3–4 分
- **对比(成本天差地别)**:每完成一个任务 Composer 2.5 约 $0.07 vs GPT-5.5 $4.82 vs Opus 4.7 $4.10——分数只差个位数,账单差近 60 倍
- **含义**:日常写测试、改 bug 这类任务用 Composer 这类 workhorse 模型完全够;只有跨文件重构、长程调试才值得为旗舰多掏 60 倍的钱
推荐理由:对普通开发者,这条榜单是实打实的省钱指南:别再默认所有活都喂给最贵的模型。学会看『Coding Agent Index 分数 ÷ 每任务成本』这个性价比,把任务按难度分层——简单活派便宜的 workhorse,硬活才上旗舰——一个人一个月能省下几百刀,同样的预算能多跑几十倍的实验。会分层调度模型本身,就是 2026 年一项能直接变现的硬技能。
#02
tredence.com
Article
NEW
保险业 AI 落地实测:核保从 3 天压到 3 分钟、直通率 10%→90%,Lemonade 2 秒赔付、Tractable 定损 95% 准确率
保险是 2026 年 AI 落地数字最硬的行业之一,因为它的每个环节都能直接换算成钱。核保侧:时效从 3 天塌缩到 3 分钟,直通处理率(straight-through)从 10–15% 跳到 70–90%,核保准确率提升 40%,商用财险的报价-签单时间砍掉 60–99%、赔付率改善 3–5 个百分点。理赔侧:Lemonade 2 秒完成赔付,Tractable 用照片几秒钟定损、准确率 95%,Decerto 把单件理赔成本从 $50 压到 $0.07、处理时间从 70 分钟降到 5 分钟。反欺诈侧:Shift Technology 每年拦下超 50 亿美元欺诈。最被引用的生产级案例是 AIG 联合 Anthropic 和 Palantir 做的生成式核保助手,Cytora 的 Autopilot(3 月上线)则是首个端到端自动化商险核保平台。
另有 2 家信源报道
展开详情
- **核保提速**:时效 3 天→3 分钟,直通率 10–15%→70–90%,准确率 +40%,报价-签单时间砍 60–99%(商用财险)
- **理赔降本**:单件理赔 $50→$0.07、70 分钟→5 分钟(Decerto);Lemonade 2 秒赔付;Tractable 照片定损 95% 准确率
- **旗舰案例**:AIG × Anthropic × Palantir 的生成式核保助手是最被引用的生产级部署;Shift 每年拦截 50 亿+ 美元欺诈
推荐理由:保险的落地曲线给普通人两个信号:一是『能被结构化的判断类工作』最先被 AI 吃掉(核保、定损、初筛),身处这些岗位的人要尽早往『训练/监督 AI + 处理边缘复杂案例』转;二是垂直行业的 AI 交付(把模型接进核保/理赔工作流)是当下溢价最高的活——你不需要造模型,只要懂一个行业的流程 + 会把现成模型接进去,就能吃到 60–99% 提效背后的预算。选一个你熟的垂直领域深扎,比追新模型更划算。
#03
retellai.com
Product
直接可用
NEW
AI 语音前台正在吃掉小微企业的接线员岗位:年成本 $1.2–6K vs 真人 $28–35K,砍掉 85–90% 话务成本
AI 语音 agent 已经从『能不能用』进到『真能替小微企业接电话、约客、成交』的阶段。Retell AI 据 AssemblyAI 的 Voice AI 2026 报告已做到 4000 万美元+ ARR、半年 MRR 增长 3 倍;Synthflow 则主打拖拽式几小时搭好一个接听客户来电的 AI 前台,不用写代码。对小微企业算账很直接:一个 AI 接线员年成本约 $1,188–5,988,而真人接线员要 $28,000–35,000,话务成本直接砍 85–90%,五年能省下最高 25 万美元;据 Resonate 调研,97% 用了语音 agent 的小微企业报告营收增长。真实案例:Retell 给在线教育公司 TripleTen 每月跑 1.7 万通外呼,接通与转化率提升约 20%,在人工团队接不过来时,AI 的转化率追平了真人招生团队。
另有 2 家信源报道
展开详情
- **降本硬数字**:AI 语音前台年成本 $1.2–6K vs 真人接线员 $28–35K,话务成本砍 85–90%,5 年最高省 25 万美元
- **已在挣钱**:Retell AI 做到 $40M+ ARR、半年 MRR 增长 3 倍;97% 用了语音 agent 的小微企业报告营收增长(Resonate)
- **成交案例**:TripleTen 每月 1.7 万通 AI 外呼,接通/转化 +20%,高峰期转化率追平真人招生团队
推荐理由:对想挣现金流的普通人,这是当下最『能落地、有人买单』的路子之一:本地商家(牙医、诊所、餐厅、房产、汽修)普遍漏接电话 = 漏掉钱,但自己搞不定 AI。你不用做平台,只要在 Retell/Synthflow 这类现成工具上,帮本地商家配好话术、接上日历和 CRM,按月收 $500–2000 的搭建+维护费,就能跑通一个单人可复制的代运营生意。壁垒不在技术,在『懂某个行业的接听流程 + 愿意做脏活对接』。
My Take:评分(5=最优):最快成交 4 / 最低成本 5 / 可复制 4 / 风险安全度 4。给本地商家做 AI 语音前台代运营,工具现成、痛点明确、单人可跑的现金流生意。
商机信号(加速):谁付钱:常漏接来电、又雇不起或留不住前台的本地小微商家:牙科/医美诊所、律所、房产中介、汽修、家政、餐饮 痛点:每月漏接十几到几十通来电,每通可能是几百到几千元的生意;真人接线员贵、流动大、下班就没人接 切入点:不做平台,做『代运营』:在 Retell/Synthflow 上帮一个垂类商家配好话术+日历+CRM 对接,按月收 $500–2000 建置与维护费,跑通一家再横向复制到同行
#04
agentman.ai
Article
NEW
Agent Skills 生态报告:9 个月长成跨厂商标准,但 190 万个公开技能平均质量只有 6.2/12,价值全在 curated 那一小撮
这份生态报告把 Agent Skills 的现状讲得很清醒:从 2025 年 10 月 Anthropic 推出、12 月把规范开放成 agentskills.io 标准算起,不到 9 个月,skills 已从 Claude 的单一功能长成跨厂商标准,被 40+ 客户端集成(Claude Code、OpenAI Codex、Gemini CLI、GitHub Copilot、Cursor、JetBrains Junie、Goose、Databricks 等)。社区目录膨胀到夸张:SkillsMP 一家就索引了约 190 万个从 GitHub 抓来的公开技能。但数量不等于质量——SkillsBench 分析了 47,150 个公开技能,平均质量分只有 6.2/12;而经过人工筛选的 curated 技能库能把 agent 的任务通过率平均拉高 16.2 个百分点。结论:真正推动 agent 表现的,是被审过、被策展的那一小部分,垂直层才是价值沉淀的地方。
另有 2 家信源报道
展开详情
- **规模爆炸**:不到 9 个月长成跨厂商开放标准、40+ 客户端集成;SkillsMP 索引约 190 万个公开技能
- **对比(数量≠质量)**:47,150 个公开技能平均质量仅 6.2/12(SkillsBench);curated 技能库把 agent 通过率平均 +16.2pp
- **价值落点**:通用 skills 已过剩,垂直+被策展的技能库才是真正抬高表现、也最难被复制的部分
推荐理由:对个人,这份报告其实是在指路:往仓库里再堆一个通用 skill 已经没意义(190 万个里质量中位数才一半)。真正稀缺、能变现的是『元技能』——会评估技能好坏、会为某个垂直行业策展一套被验证过的高质量技能库。与其做技能的生产者,不如做技能的『质检员 + 策展人』:为某个行业(法律、电商、SRE)攒一套经过实测、能把 agent 通过率抬高十几个点的私有技能库,这本身就是可以打包卖给企业的资产。
#05
aibuilderclub.com
Opinion
NEW
Andrej Karpathy
你可以外包思考,但你没法外包理解。最好的工程师不再是写下每一行代码的人,而是能指挥 agent、又不让质量崩塌的人——理解,成了新的瓶颈。
Karpathy 到 2025 年 12 月已有 80% 的代码由 AI 生成,并在 2026 年 4 月的 Sequoia AI Ascent 上宣布『vibe coding』已经过时,取而代之的是他称为『agentic engineering』的严肃实践:把 agent 当成一个『可能出错、随机』的协作者,在每一步都保留专业监督,以在规模化交付软件的同时守住安全、可维护性和质量底线。他的框架里,vibe coding 抬高了下限,agentic engineering 抬高的是上限;而在『Software 3.0』里,上下文窗口成了你的程序、LLM 是解释器,所以 prompt 文件、spec、知识库比语法本身更重要。
另有 2 家信源报道
推荐理由:这对普通人是一记提醒:当写代码这件事被 AI 大幅接管,你的护城河不再是『打字快、语法熟』,而是『判断力和理解深度』——知道该问什么、该检查什么、该拒绝什么。可执行的动作是:刻意练习把模糊需求拆成清晰的 spec、给 agent 写好上下文、对它的产出做严格 review 和取舍。把精力从『多写代码』转到『把一件事想透、并能验收 AI 的活』,这是 AI 时代最抗贬值的能力。
#06
dutchstartup.ai
Article
NEW
GitHub 上线 HydraFusion 多模型编排预览:在 Copilot CLI 里追平 Opus 5,token 成本反低 36–67%
GitHub 在 Copilot CLI 里上线了名为 Project HydraFusion 的研究预览,核心思路是『多模型编排』:智能地把一个任务拆给多个不同的语言模型协作,而不是全程押在一个旗舰上。官方给的数据是,它在 TerminalBench 2.1、DeepSWE 和 CheckpointBench 三个基准上做到与 Claude Opus 5 相当甚至更好,而估算的 token 成本反而低 36–67%。所有 Copilot 订阅档的用户都能用 /experimental 命令调用,不额外收费,费用按底层模型的标准价走。这和今天的另一条评测线索指向同一件事:把便宜模型编排起来,正在成为对抗『单一旗舰』的主流打法。
另有 1 家信源报道
展开详情
- **对比(追平旗舰)**:在 TerminalBench 2.1 / DeepSWE / CheckpointBench 上与 Claude Opus 5 相当或更好
- **对比(成本更低)**:估算 token 成本比单用旗舰低 36–67%,靠的是多模型编排而非更强的单一模型
- **可用性**:Copilot CLI 里 /experimental 命令即可调用,全订阅档可用、不额外收费
推荐理由:HydraFusion 把一个趋势摆到了台面上:未来的『能力』越来越是编排出来的,而不是单一模型给的。对普通开发者和创业者,这意味着两件事——一是别再迷信『只用最强那个』,学会搭建『路由/编排』把任务分给合适的模型,是能直接省一半以上成本的工程能力;二是围绕『多模型编排、成本优化』的工具和咨询会是接下来的机会窗口,谁能帮团队把 AI 账单砍下来,谁就有人买单。
#07
aimagicx.com
Article
NEW
农业 AI 落地实测:产量 +15–40%、用水 -35%、农药 -90%,印度 FarmAgain 覆盖 3500 农户年省 40 万方水
精准农业是 2026 年 AI 落地里被低估、但数字很实在的一块。用了 AI 精准农业系统的农户普遍报告产量提升 15–20%、用水最多省 35%、化学投入最多降 90%;更激进的案例里,Agripilot.ai 在商业化规模上做到产量 +40%、用水 -30%。印度 FarmAgain 平台覆盖 3500+ 农户、4000 英亩,每年省下 40 万立方米水和 17.5 万度电,一个椰子种植户用后产量翻倍;一个印度甘蔗项目实现用水 -30% 配产量 +40%;美国俄亥俄一个农场把虫害损失砍半、产量提升 25%。领先的 AI 产量预测模型能在收割前三个月把主要作物的田块级预测误差压到实际的 5–8%。值得注意的是,小农场也够得着:SmartFarmPilot 盘点了 7 个 500 美元以内、能拿到 120% ROI 的 AI 工具。
另有 2 家信源报道
展开详情
- **效果硬数字**:产量 +15–40%、用水 -35%、农药 -90%;Agripilot.ai 商业规模做到产量 +40% / 用水 -30%
- **规模案例**:印度 FarmAgain 覆盖 3500+ 农户 4000 英亩,年省 40 万方水 + 17.5 万度电,椰农产量翻倍
- **小农可及**:AI 产量预测收割前 3 个月误差 5–8%;SmartFarmPilot 列出 7 个 <$500、120% ROI 的小农场 AI 工具
推荐理由:农业 AI 的门槛正在塌到个人和小农场够得着的水平(500 美元以内、120% ROI)。对想在这波里挣钱的普通人,机会不在于开发算法,而在于『把现成的 AI 农业工具,翻译成本地农户听得懂、用得上的服务』——帮县域小农配置灌溉/施肥/病虫害预测方案,按季或按亩收费。农业信息化程度低、痛点具体(省水省药就是真金白银),是一个被大厂忽视、适合本地化落地的现金流洼地。
#08
aitools-catalog.com
Product
值得关注
NEW
ThunderPhone:2 分钱一分钟搭 AI 电话 agent,把语音 AI 从『买服务』降到『按用量自己建』
ThunderPhone 是给开发者/团队自己搭 AI 电话 agent 的平台,最大卖点是把价格打到极致透明:Spark 档只要 2 分钱一分钟(Bolt 5 分、Storm 12 分)。它内置测试、自动质量监控,还能直接从 cURL / OpenAPI / Postman 导入接口来接业务系统。和上面那条『买现成语音前台服务』是同一件事的两个面:一边是本地商家买 done-for-you 的接线服务,另一边是 ThunderPhone 这类基建,让懂点技术的人用极低的边际成本,自己把电话 agent 搭出来、再卖给别人。当每分钟成本压到 2 分钱,语音自动化的经济账彻底翻转。
另有 1 家信源报道
展开详情
- **价格透明**:纯用量计费,Spark 档 $0.02/分钟起,接近把语音 agent 的边际成本打到地板
- **开发者友好**:内置测试 + 自动质量监控,支持从 cURL / OpenAPI / Postman 一键导入接口对接业务系统
- **买 vs 建**:与『买现成语音前台』互补——技术方可用它以极低成本自建电话 agent 再对外交付
推荐理由:对有点技术底子、想做现金流的人,ThunderPhone 这类基建把『做语音 AI 生意』的启动成本降到了几乎为零:2 分钱一分钟意味着你给客户报价 $1–2/分钟也有巨大毛利空间。切入点不是和平台竞争,而是站在它上面做垂类交付——比如专门给某个行业(餐饮预订、诊所改约、催收)做调好的电话 agent,把技术复杂度包起来,按结果或按月收费。基建越便宜,靠『行业 know-how + 落地』赚钱的空间越大。
My Take:评分(5=最优):最快成交 3 / 最低成本 5 / 可复制 4 / 风险安全度 3。语音 agent 基建把边际成本打到 2 分/分钟,适合技术方在其上做垂类电话 agent 交付变现。
商机信号(萌芽):谁付钱:需要外呼/接听自动化但不想自建的中小企业与代运营服务商;以及想低成本起盘做语音 AI 交付的独立开发者 痛点:自建电话 agent 过去要凑齐电话线路+语音+编排,成本高、门槛陡;现成 SaaS 又不够灵活、不好深度对接业务系统 切入点:在 ThunderPhone 这类 2 分/分钟的基建上,为某个垂直场景(诊所改约、餐饮预订、账款催收)做调好的电话 agent,按月或按成交结果收费,用极低边际成本吃行业交付溢价