📅
Hall of Fame
Hall of Fame
Track
Type
Source
9月3日 周四 · 9 条
今日趋势综述
今天的信号集中在「工程」而非「模型」:开源模型在 SWE-bench 上挤成一团(80.5 上下),真正拉开差距的是外面那层 agent 循环与落地方法——从更快的编码 harness、到把 AI 塞进保险理赔、再到给 skill 做可执行评估。
今天的信号:模型分数已经不重要,重要的是外面那层「工程」

把今天几条串起来看,会发现一个反复出现的底色:模型本身的分数正在失去区分度,价值正在往「模型外面那一圈」转移。SWE-bench Verified 上,DeepSeek V4 Pro(80.6)、MiniMax M3(80.5)和闭源的 Gemini 3.1 Pro(80.6)几乎踩在同一条线上,开源和闭源在这一档已经分不太出来——离前沿的 Claude Fable 5(95.0)还差约 15 分,但对大多数任务来说,80 分的开源模型已经够用。既然模型拉不开差距,差距就跑到别处去了。

差距去哪了?去了「循环」和「落地」。Bullet 不改模型,只优化 agent 的循环(自动选模型、并行搜索、精准检索而非全量嵌入),就号称比 Claude Code / Codex 快 30-60%、SWE-bench 冲到 95.8%——这说明同一个模型,harness 写得好不好能差出几十秒。oh-my-pi 把 IDE、调试器、LSP、子 agent 全焊进一个 29k 星的编码 agent,也是同一个逻辑:模型是零件,工程是产品。再往产业里看,保险公司(Lemonade 55% 理赔全自动、Aviva 80+ 模型省下 8200 万美元、Allianz 七个 agent 100 天上线)证明真正值钱的是「把能力嵌进业务流程」;FDE 方法论、AI 自动化代运营的定价表($2500 搭建 + $750/月)都在说同一件事——会交付比会调 API 值钱得多。

对想在 AI 时代往上走的个人,今天的方向很清楚:别再纠结「哪个模型分高」,那已经是红海且没有护城河。把精力放到三件更耐用的事上——(1) 磨「循环/harness/工程」的手艺,同样的模型你能榨出更好的结果;(2) 挑一个你懂的垂直业务(保险、法务、某类小企业流程),把 AI 落地成能收钱的工作流;(3) 学会评估——无论是评估模型该选哪个、还是像 ACES 那样把 skill 当可执行工件持续评估,判断力本身正在成为稀缺技能。能力平权之后,护城河在「怎么用」而不是「用什么」。

#01
GitHub Repo
★ 29.1k 2d streak

can1357/oh-my-pi

oh-my-pi(omp)是从 Mario Zechner 的 Pi 项目 fork 出来的终端编码 agent,核心卖点是「把 IDE 直接接进 agent」:约 8 万行 Rust 写的内核,接入 60+ 个 LLM 供应商、内置 31 个工具,覆盖代码执行、LSP 语言服务、调试器、子 agent 协作、网页搜索和协作式会话。它不是又一个套壳,而是把「一个真正能读能改能调的开发环境」塞进一个交互式终端界面,让 agent 像人一样用工具链干活。
#DevTools#TypeScript / R…
另有 1 家信源报道
展开详情

把 IDE 焊进终端里的开源 AI 编码 agent

周增长:本周稳居 AI 编码 agent 类前列,约 2 万+ commit、工程完成度高,是增速较快的项目之一

  • **架构**:约 8 万行 Rust 内核 + TypeScript 界面,接入 60+ LLM 供应商、内置 31 个工具,模型可随意换
  • **能力**:LSP 语言服务、调试器、子 agent、网页搜索、时间旅行式流规则、带优先级判定的 code review 全都内建
  • **热度**:约 29.1k 星、2 万+ commit,是本周编码 agent 里工程完成度最高的一批之一
推荐理由:对个人开发者,oh-my-pi 是一个免费的「怎么把 agent 工程做扎实」的活教材:它证明差异化不在模型,而在你给 agent 配了多完整的工具链(调试器、LSP、子 agent)。与其等大厂产品,不如现在就用它把自己的开发循环搭起来——同一个模型,工具链齐全的人产出会明显更高,这层「harness 手艺」正在成为新的硬技能。
#02
Product Hunt Product
NEW

Bullet

Bullet 的主张很反直觉:模型没问题,慢的是模型外面那圈循环。它不训练新模型,而是重写 agent loop——按每个 prompt 自动挑模型和推理档位、把搜索/读取/命令并行化、用定向代码检索代替把整个仓库做嵌入。结果是号称比 Claude Code 和 Codex 快 30-60%,同时在 SWE-bench Verified 上做到 95.8%(进前三)、每个任务约 119 秒。它能直接挂在你已有的 Claude Code / Codex 订阅上跑。
#DevTools#复用你现有的 Claude …
另有 1 家信源报道
展开详情
  • **思路**:不改模型只优化循环——自动选模型/推理档、并行 I/O、定向检索代替全量嵌入
  • **对比**:SWE-bench Verified 95.8%(进前三)、约 119 秒/任务,号称比 Claude Code / Codex 快 30-60%
  • **复用**:直接挂现有 Claude Code / Codex 订阅或 API key,也能用本地模型,迁移成本低
推荐理由:Bullet 给个人的启发比产品本身更值钱:同一个模型,「循环」写得好不好能差出几十秒和几十个百分点。这意味着「优化 agent 编排」是一门可以单独修炼、且立刻见效的手艺——学会并行工具调用、按任务选模型、精准而非全量地喂上下文,你手上任何 agent 都能变快变准,这比追新模型划算得多。
#03
llm-stats.com Article
NEW

SWE-bench Verified 开源大堵车:DeepSeek V4 Pro 80.6 / MiniMax M3 80.5 咬平 Gemini 3.1 Pro,但离前沿仍差约 15 分

本周 SWE-bench Verified 的看点不是谁登顶,而是开源模型挤成了一团:DeepSeek V4 Pro 报 80.6%、MiniMax M3 报 80.5%,几乎正好踩平闭源的 Gemini 3.1 Pro(80.6%)——在这一档,开源和闭源已经分不太出来。真正的分水岭在更高处:Claude Fable 5 以 95.0% 领跑前沿,仍比这批 80 分的开源模型高出约 15 个百分点。换句话说,「够用」和「最强」之间隔着一条清晰的鸿沟,但鸿沟以下已经是一片红海。
#评测
另有 2 家信源报道
展开详情
  • **对比**:SWE-bench Verified 上 DeepSeek V4 Pro 80.6 vs MiniMax M3 80.5 vs Gemini 3.1 Pro 80.6——三者几乎并列,开源已咬平这档闭源
  • **差距**:前沿的 Claude Fable 5 报 95.0%,比 80 分档高出约 15 分,「最强」和「够用」之间仍是断层
  • **含义**:80 分档已成红海且无护城河,模型选择正从「谁最强」变成「谁最划算」
推荐理由:对开发者,这张榜直接给出选型答案:日常编码、批量改造、成本敏感的场景,选 80 分档的开源模型(DeepSeek V4 Pro / MiniMax M3)就够,还能本地部署、单价更低;只有最难的长程 agent 任务才值得上 Fable 5 这类前沿闭源。真正该把精力花在「用哪个模型省钱」和「harness 怎么写」上,而不是无脑追最高分——因为 80 分以下,谁也没有护城河。
#04
getperspective.ai Article
NEW

保险 AI 落地实测:Lemonade 55% 理赔全自动、2 秒赔付,Aviva 靠 80+ 模型一年省 8200 万美元、投诉降 65%

保险是这波 AI 落地里案例最硬的行业之一,而且是大机构在生产环境真金白银地跑,不是 demo。Lemonade 到 2025 年底已有 55% 理赔全流程自动,最简单的案子从报案到赔付几秒搞定,理赔 bot「AI Jim」处理 96% 的首次报案无需人工;Aviva 在理赔域部署 80+ 个 AI 模型,把定责时间砍掉 23 天、路由准确率提 30%、客户投诉降 65%,仅 2024 一年就省下超 6000 万英镑(约 8200 万美元);Allianz 的 Project Nemo 用七个 agent 的多 agent 架构、100 天内上线。承保端也在坍缩:审核从 3 天压到 3 分钟,直通率从 10-15% 跳到 70-90%,欺诈识别提升 30% 以上。
#行业应用
另有 2 家信源报道
展开详情
  • **Lemonade**:55% 理赔全自动、最快 2 秒赔付,AI Jim 处理 96% 首次报案无需人工
  • **Aviva**:80+ 模型,定责时间 -23 天、路由准确率 +30%、投诉 -65%,一年省约 8200 万美元
  • **承保**:审核 3 天→3 分钟,直通率 10-15%→70-90%,欺诈识别 +30%,回本周期 6-14 个月
推荐理由:保险和法务一样,机会不在「AI 会不会取代核保/理赔」,而在「谁来帮中小机构把它接上」。大保司已经自研到 80 个模型的规模,但海量的中小保险经纪、TPA、地区性保司还没落地——懂某类险种理赔/核保流程的人,可以做「垂类理赔初审 + 人工复核」的轻服务,或帮它们把现成模型接进业务流。行业越标准化、数据越结构化,个人切进去的杠杆越大。
商机信号(加速):谁付钱:中小保险经纪、第三方理赔公司(TPA)、地区性保司——大保司已自研,中小机构还没落地又急需降本 痛点:理赔/核保人力成本高、处理慢易漏,通用 AI 工具不懂具体险种条款与本地监管,自研又养不起团队 切入点:个人可切「某一类险种(如车险/健康险/中小企业财产险)的理赔初审 + 人工复核」轻服务,或做把现成模型接进理赔流程的落地咨询,避开与大保司自研正面竞争
#05
medium.com Article
NEW

《Shipping Enterprise AI》:FDE 的落地方法论——先拆工作流,再查数据/权限/身份/治理是否 ready,才谈上线

这是一本把 FDE(前置部署工程师)打法系统化的实操手册,核心不讲「模型多强」,只讲「怎么把 AI 系统从 demo 推进 Fortune 500 客户的生产环境」。方法论主线是:先把一个 AI 用例拆解成可构建的工作流,再逐项核查落地前提——数据是否到位、权限与身份怎么打通、治理与合规是否 ready,最后才谈上线。它把 FDE 从一个模糊的「贴着客户干活的工程师」岗位,拆成一套可复用的交付流程,正好回答了「为什么很多企业 AI 卡在 pilot 上不了线」。
#FDE
另有 1 家信源报道
展开详情
  • **核心方法**:把 AI 用例拆成可构建的工作流,而不是直接上模型——落地是流程问题不是模型问题
  • **落地前提清单**:数据到位 / 权限身份打通 / 治理合规 ready,缺一项就别谈上线
  • **定位**:把「贴客户交付」从个人英雄主义变成可复用流程,直击企业 AI 卡在 pilot 的病根
推荐理由:对想吃「AI 落地」这碗饭的个人,这本书给的是一张可以照着练的清单:真正稀缺的不是会调模型,而是会判断「这个用例到底能不能上生产」——数据、权限、治理这些脏活才是分水岭。把这套「拆工作流 + 查落地前提」的方法学会,你就能承接中小企业的 AI 落地(它们请不起大厂 FDE),这是一条比卷模型更稳、更耐用的路。
商机信号(加速):谁付钱:有 AI 预算但落不了地的中小企业与传统行业公司——它们买不起大厂 FDE,又卡在 pilot 上不了线 痛点:模型能力够了,但数据、权限、治理、与现有系统集成这些「脏活」没人会做,AI 项目长期停在演示阶段 切入点:个人可做「独立 FDE / AI 落地交付」——用这套拆工作流 + 查落地前提的方法,按项目(参考 $2500-25000/项目 + 月度支持)承接中小企业的 AI 生产化
#06
superdupr.com Article 直接可用
NEW

AI 自动化「代运营」的单位经济学:$2500 搭建 + $750/月 retainer,单个线索机器人报价 $5K-15K

把 2026 年多家 AI 自动化代运营(AAA,AI automation agency)的真实定价拉到一起看,这门生意的账其实很清楚:给企业搭一个自动化系统(如自动化报表、预测分析、主动运维)通常一次性 $2500-25000,再收 $300-800/月的支持/优化 retainer;一个给律所用的线索资格机器人能报到 $5000-15000。核心打法是「卖系统不卖工时」——用月度经常性收入替代一锤子项目费。三个客户($2500 搭建 + $750/月)就是约 $7500 前期 + $2250/月经常性;很多单人操作者在 12-24 个月内爬到 $8000-15000/月这一档。
#小微现金流
另有 2 家信源报道
展开详情
  • **定价**:搭建 $2500-25000/项目 + 月度 retainer $300-800,单个线索机器人可报 $5K-15K
  • **模型**:卖系统不卖工时——用 MRR(月度经常性收入)替代一次性项目费,是能滚起来的关键
  • **节奏**:3 个客户即约 $2250/月经常性;单人操作者 12-24 个月常爬到 $8K-15K/月一档
推荐理由:对想挣现金流的普通人,这是门槛最低、账最清楚的路子之一:不需要发明产品,只需要「懂某个行业的流程 + 会把现成 AI/自动化工具接起来」。关键不是技术,是找到愿意为「省人力」持续付月费的中小企业。先从一个你熟悉的行业(律所、诊所、电商、房产中介)切入,把一类重复流程做成模板,复制给同行——真正赚钱的是 retainer 的复利,不是那次性搭建费。
My Take:评分(5=最优):最快成交 4 / 最低成本 4 / 可复制 3 / 风险安全度 4。门槛低、现金流清晰,但获客与交付质量是天花板,靠垂类模板化才能规模复制。
商机信号(加速):谁付钱:有重复流程、想省人力的中小企业(律所、诊所、电商、房产中介、本地服务商),愿意为「系统」持续付月费 痛点:人力成本高、重复流程多,但没有技术团队、也不知道怎么把现成 AI/自动化工具接进自己业务 切入点:选一个你熟的行业,把一类重复流程(线索资格审核、自动报表、客服工单)做成可复制模板,按 $2500 搭建 + $500-800/月 retainer 复制给同行
#07
augmentclaude.com Article
NEW

Claude Skills 市场对比:SkillsMP 号称 200 万聚合、AI Skill Market 4751 个精选、SkillsLLM 1600 个「安全审过」——但规模≠质量

Claude / Codex 的 skill 市场今年爆发式增长,但横评点破了一个关键区别:规模和质量是两回事。SkillsMP 号称聚合了 200 万+ 开源 skill(其实是自动索引 GitHub 公开内容),Skills Directory 约 9.7 万、CrossAITools 2.16 万+;而 AI Skill Market 走「精选」路线,4751 个生产就绪、平均 30 秒零配置安装;SkillsLLM 主打 1600+ 个「安全审过」的 skill。横评的结论很直白:自动索引 GitHub ≠ 经过审核的目录,大多数 skill 连排名都没有,社区 skill 要像对待任何开源代码一样——先看源码、审脚本和权限、查最近活跃度,只装你看得懂的。
#Skills#元技能
另有 2 家信源报道
展开详情
  • **规模**:SkillsMP 号称 200 万+ 聚合、Skills Directory 约 9.7 万——但多为自动索引 GitHub,未做审核
  • **质量**:AI Skill Market 4751 个精选(30 秒零配置)、SkillsLLM 1600+「安全审过」,走的是策展路线
  • **安全**:市场自己都声明不为每个 skill 背书,安装前必须审源码、脚本、权限,别装看不懂的
推荐理由:skill 市场从「有没有」进入「怎么挑」的阶段,这本身是个机会。对个人:一是把「审 skill / 选 skill」当成一项元技能来练——会判断一个 skill 是否安全、是否值得装,正在变稀缺;二是与其在百万级噪音里淘,不如围绕某个垂直场景做一套「精选 + 审过」的小型 skill 合集或模板,策展本身就是价值。规模已经不缺,缺的是可信的筛选。
#08
arXiv Paper
NEW

ACES: Evaluating Skills, Not Just Agents — 把 skill 当可执行工件来持续评估

当每个人都在往 agent 里塞 skill,一个被忽略的问题浮出来:你怎么知道某个 skill 到底好不好、改了之后有没有变差?ACES(Agentic Continuous Evaluation of Skills)提出一套「仓库原生」的框架,把 skill 和产品能力包当成可执行的 agent 工件来评估——不是笼统评「这个 agent 行不行」,而是把评估颗粒度下沉到单个 skill,让 skill 库能像代码那样做持续/回归评估。这正好补上了 skill 生态爆发后最缺的一环:可信度的度量。
把评估对象从「整个 agent」下沉到「单个 skill / 能力包」,让 skill 库像代码一样可回归测试
#Skills#元技能
另有 1 家信源报道
展开详情
  • **颗粒度**:评估对象从「整个 agent」下沉到「单个 skill / 能力包」,定位问题更准
  • **工程化**:仓库原生、把 skill 当可执行工件,能像 CI 一样对 skill 库做持续/回归评估
  • **补位**:正好接住 skill 市场爆发后的空白——数量已过剩,缺的是「好不好」的度量
推荐理由:这篇论文其实在告诉个人一个方向:随着人人都在写和用 skill,「怎么评估一个 skill 好不好」会变成一门单独的手艺和岗位。学会用可执行、可回归的方式给 skill/prompt/agent 建评估集,比多写几个 skill 更值钱——因为在噪音过剩的生态里,能给出可信判断的人最稀缺。把「评估能力」当核心技能来修炼,是这波 skill 热潮里更耐用的位置。
#09
lennysnewsletter.com Opinion
NEW

Simon Willison

我们已经越过了那个拐点——AI 不再是「会不会成」的问题,而是「多快、落到哪」的问题;接下来是自动化时间表和『暗工厂』的时代。
Simon Willison 在与 Lenny 的这篇「AI 现状盘点」里给出一个冷静但明确的判断:AI 的能力拐点已经过去,争论「会不会成」已经没意义,真正的问题变成了自动化的速度、边界和落地路径。他一贯反对纯炒作,也反对纯唱衰——这次的定调是「拐点已过,重心转向落地与影响」,和今天其他几条(模型分数趋同、价值转向工程与落地)互为印证。
#LLM/Model
另有 1 家信源报道
推荐理由:当一个以「不吹不黑」著称的观察者都说「拐点已过、该谈落地了」,对个人的信号是:观望期结束了。别再等「AI 到底行不行」的答案,那个答案已经有了;该做的是选一个落点——一个行业、一类流程、一门手艺——开始把 AI 真正用起来、用出结果。犹豫的成本正在快速上升,早落地的人在积累复利。