📅
Hall of Fame
Hall of Fame
Track
Type
Source
9月10日 周四 · 8 条
今日趋势综述
今天的主线是『编码 agent 从拼模型转向拼编排与性价比』:OpenHands 发 1.0 把自主编码 agent 做成能进生产的工程件,GitHub 的 HydraFusion 用多模型协同在 TerminalBench 2.1 上比单打 Opus 5 又省 67% 成本又高 4.9 分,SWE-bench 榜也在提醒『第一名之外还有便宜好几倍的次优解』;与此同时,Monid 把 1800+ API 收成 agent 的一把钥匙、法律行业把合同审查从 90 分钟压到 25 分钟、FDE 这个把模型送进客户业务的岗位被 Palantir/OpenAI 验证成能带 640% 回报的打法、Formula Bot 靠『把大白话变 Excel 公式』一个动作做到约 22.6 万美元月收入——真正赚钱的从来不是最强模型,而是把它编排好、送进某个具体口袋。
今天的信号:编码 agent 的竞争,从『谁最强』变成『谁编排得好、谁更划算』

把今天几条串起来,一个清晰的转折浮出来:在编码这条最卷的赛道上,单纯比『哪个模型分最高』已经不再是重点,重点转向了『怎么把模型编排起来、怎么用更低成本拿到接近前沿的效果』。最直接的证据是 GitHub 刚发布的研究预览 Project HydraFusion——它不押注单一模型,而是在一次任务里让多个模型分工(起草、互相 critique、必要时级联到更强的模型),结果在 TerminalBench 2.1 上比单独用 Claude Opus 5 还高 4.9 个百分点,同时把估算成本砍掉 67%。另一边,开源自主编码 agent OpenHands 直接发布 1.0,把重点放在『能进生产』——Docker 沙箱、安全策略、资源限制、插件系统,自主完成约 68% 的 SWE-bench Verified 任务。信号很一致:值钱的正在从『模型这一层』上移到『编排与工程这一层』。

#01
GitHub Repo
NEW

All-Hands-AI/OpenHands(发布 1.0)

OpenHands(前身 OpenDevin)是开源自主编码 agent 里最有代表性的一个,这次发布 1.0 是一个信号性节点:它不再只强调『我能自动写代码』,而是补齐了进生产要过的那些工程关卡——沙箱隔离让 agent 执行命令不至于祸害宿主环境、内置安全策略与资源限制把『放任 agent 乱跑』的风险框住、插件系统让它能接入团队自己的工具。据公开基准,它能自主完成约 68% 的 SWE-bench Verified 任务。放在今天的主题里,OpenHands 1.0 恰好印证了『编码 agent 的竞争正在从模型能力转向工程可靠性』:当各家模型能力接近,谁能把 agent 做得敢放进真实仓库、真实 CI 里干活,谁才拿到落地的入场券。
#DevTools#Python
另有 2 家信源报道
展开详情

一个开源的自主编码 agent 平台:给它一个目标,它能自己读代码、改文件、跑命令、跑测试、修 bug,端到端完成软件工程任务。1.0 版本把重点从『能跑 demo』推到『能进生产』——加入生产级 Docker 沙箱隔离、内置安全策略、资源限制和插件系统,让企业敢把它放进真实工作流。

周增长:1.0 里程碑发布带动本周关注度明显上升(据多方新闻报道其达到 1.0 正式版)

  • **从 demo 到生产**:1.0 补齐生产级 Docker 沙箱、内置安全策略、资源限制、插件系统——把『敢不敢放进真实仓库』这道关卡过了
  • **能力硬指标**:据公开基准可自主完成约 68% 的 SWE-bench Verified 任务,属于开源自主编码 agent 的第一梯队
  • **开源可自托管**:数据和执行都在自己环境里,适合在意合规、不想把代码交给云 agent 的团队自己搭一套
推荐理由:对普通开发者的机会:别只把自主编码 agent 当『替我写代码的玩具』,把它当成一套可以自己搭、自己调、能进团队生产流程的基础设施来练。OpenHands 这类开源项目让你不花钱就能拥有一个自主 agent——你可以从很小处切入:给自己或团队搭一套带沙箱的 OpenHands,专门用它跑那些重复且低风险的活(批量修 lint、补测试、升级依赖、改一类样板代码),把踩过的坑和配置写成一份『自主编码 agent 落地手册』。会用模型的人很多,能把自主 agent 安全地接进真实仓库、还讲得清风险边界的人稀缺——这份工程能力既是自己的生产力,也能对外做成部署与调优的服务。
#02
github.blog Article
NEW

GitHub 发布 Project HydraFusion:多模型协同,比单打 Opus 5 又高 4.9 分又省 67% 成本

GitHub 于 9 月 4 日在 Copilot CLI 里上线了研究预览 Project HydraFusion,思路是:不押注单一模型,而是在一次任务里做『运行时多模型编排』——先生成一个执行计划,再从跨厂商的多个模型里挑合适的来起草、互相 critique(跨家族评审)、必要时级联到更强的模型收尾,最后把结果融合。它目前有三种模式:Single(选一个模型直接解)、Cascade(带质量闸门的级联)、Critique(跨家族评审)。GitHub 自评在 TerminalBench 2.1 上,HydraFusion 比单独使用 Claude Opus 5 的正确完成率高 4.9 个百分点,同时把估算成本砍掉 67%。它对所有 Copilot 套餐用户开放,走 /experimental 进入,按实际用到的各模型标准费率计费。注意这组对比数字是 GitHub 官方自评、非第三方独立评测,但方向很有信号:编排能同时买到更高质量和更低成本。
#DevTools
另有 3 家信源报道
展开详情
  • **编排>单模型**:一次任务里多模型分工——起草、互评、级联到更强模型,再融合结果;三种模式 Single / Cascade / Critique 按任务自动选
  • **对比**:TerminalBench 2.1 上 HydraFusion 正确完成率比单打 Claude Opus 5 高 4.9 个百分点,估算成本却低 67%(GitHub 官方自评,非第三方)
  • **可用性**:对所有 GitHub Copilot 套餐开放,Copilot CLI 里走 /experimental 试用,按各模型标准费率计费
推荐理由:对普通人的启发:『用多个模型协同』正在从论文走进产品,而这套编排思路你自己也能低成本复刻。不必等 HydraFusion,你今天就能给自己搭一个『廉价起草 + 强模型审校』的双模型流程——用便宜快的模型先出初稿,再让强模型只做 critique 和收尾,多数任务就能拿到接近顶配的效果、成本却低一大截。把这套『按环节选模型、按成本编排』的经验沉淀成模板,本身就是稀缺能力:当模型这层趋同,会算账、会编排的人才拿到差价红利。
#03
benchlm.ai Article
NEW

SWE-bench Verified 性价比读法:Opus 5 约 96% 领跑,但 Opus 4.8 用 88.6% 拿下『第一名 10% 以内最便宜』

SWE-bench Verified 是目前最被认真对待的『真实软件工程任务』基准之一,9 月快照已收录 116 个模型。看榜别只盯第一名:Anthropic 的 Opus 5 以约 96% 领跑,但在『离第一名 10% 分数以内』的那一档里,Opus 4.8 用约 88.6% 的分数、每百万输入 token 仅 5 美元,成为这一档里最便宜的选项——也就是说,你花小得多的钱,就能拿到只差几分的效果。开源阵营里,DeepSeek-V4-Pro-Max 做到约 80.6%(榜上约第 8),是开源第一梯队。把这三个点放一起看,结论很实:从 80.6%(开源、可自托管、成本近乎为零)到 88.6%(便宜的闭源次优)再到 96%(最强但最贵),是一条清晰的性价比阶梯,绝大多数任务并不需要为最后那几分溢价买单。
#评测
另有 2 家信源报道
展开详情
  • **对比**:SWE-bench Verified 上 Opus 5 约 96%(最强) vs Opus 4.8 约 88.6%(每百万输入 token 仅 $5,第一名 10% 内最便宜) vs DeepSeek-V4-Pro-Max 约 80.6%(开源第一梯队)
  • **性价比阶梯**:80.6%(开源可自托管、成本近乎 0)→ 88.6%(便宜闭源次优)→ 96%(最强最贵),差几分、差好几倍价钱
  • **别只看第一名**:9 月快照已 116 个模型,真正该问的是『我这类任务需要多少分』,而不是『谁排第一』
推荐理由:对普通人/开发者最实的机会:把『按任务选模型、按成本算账』练成一项硬本事。多数日常编码任务(改 bug、补测试、写样板)用 80–88 分档的便宜模型完全够用,只有真正难的长链路任务才值得调最强最贵的。你可以给自己建一张『任务难度 × 模型档位 × 单位成本』的对照表,跑几周真实任务把每档的实际通过率和花费记下来——这份『花小钱办大事』的选型经验,在模型能力普遍够用、大家开始比成本的今天,就是能帮团队省钱、也能对外交付的判断力。
#04
Product Hunt Product
NEW

Monid(agent 工具的 OpenRouter)

Monid 把自己定位成『agent 工具版的 OpenRouter』:用一把钥匙、一个统一入口,让你的 AI agent 接上 1800+ 个 API——SEO、找线索、生成视频/音乐、社媒、股票、市场趋势、链上数据、竞品追踪、情绪分析等等,全部免去在各家平台单独注册、单独订阅、单独管密钥的麻烦。它踩中的痛点很实在:现在搭一个能干活的 agent,最烦的往往不是模型,而是『把它接到一堆外部服务上』这件脏活——每个 API 都要单独申请、单独付费、单独维护鉴权。Monid 想做的就是把这层『工具接入』标准化成一个聚合入口,本周在 Product Hunt 上线。
#AI Agent#一把钥匙接入 1800+ A…
展开详情
  • **一把钥匙接 1800+ API**:SEO、线索、视频/音乐生成、社媒、股票、链上数据、竞品与情绪分析等一站式接入,免各家单独订阅与密钥管理
  • **定位类比**:把 OpenRouter『一个入口聚合多模型』的思路搬到『agent 工具』这层——聚合的是能力/API,不是模型
  • **卡位工具层**:当 agent 编排、记忆层陆续被『聚合/标准化』,工具接入这层的聚合器也在成型,Monid 是这波里的早期玩家
推荐理由:对普通人的启发:搭 agent 的门槛正在从『会调模型』下移到『会接工具』,而工具接入正在被聚合器抹平——这既是省事,也是机会。省事在于:你不必再为每个能力单独折腾 API,可以更快拼出一个真能干活的 agent(比如自动做竞品监测 + 生成周报)。机会在于:当接入变简单,比拼就回到『你把这些能力编排成解决谁的什么具体问题』。上手很低:用 Monid 这类聚合器给自己搭一个针对某个细分场景(如小商家的『竞品价格 + 社媒声量周报』)的 agent,跑通一个能复述的价值,就是既可自用也可对外收费的最小产品。
#05
modern-counsel.com Article
NEW

法律 AI 落地实测:HubSpot 用 Harvey 把合同审查从 90 分钟压到 25 分钟,行业侧文书审查普遍提速约 70%

法律是今天挑的垂直行业,它的 AI 账本正在从『炒作』走到『分钟级实测』。最有代表性的是 HubSpot:法务与运营组成跨部门小组评估了多家生成式 AI 平台后选了 Harvey,合同审查最能看出前后差距——一份合同资深律师原来要 90 分钟看完,现在 25 分钟就够,单份省约 65 分钟,且在不加人手的情况下提升了合同处理吞吐。行业侧的数字也在收敛:多份 2026 年的复盘给出文书审查提速约 70%、法律检索成本降约 40% 的量级。工具层面,Harvey 在 2026 年 8 月上线了带 Memory(能学习单个律师起草风格)的新版本,Google 也把 Gemini Enterprise for Legal 推给法务团队做合同审查与合规扫描。合同审查之所以最先跑通,是因为它有最干净的『前/后』可度量口径——这也是判断一个 AI 落地场景值不值得做的关键信号。
#行业应用
另有 3 家信源报道
展开详情
  • **分钟级账本**:HubSpot 用 Harvey,合同审查从 90 分钟→25 分钟,单份省约 65 分钟,不加人手提升吞吐(法务负责人 Sarah Flint 证言)
  • **行业量级**:多份 2026 复盘给出文书审查提速约 70%、法律检索成本降约 40%;合同审查因『前后差距最好量』成为最先落地的工作流
  • **工具进化**:Harvey 8 月上线带 Memory(学个人起草风格)的新版;Google 推 Gemini Enterprise for Legal 做合同审查与合规扫描
推荐理由:对普通人的机会:法律 AI 的落地路径给了一个可迁移的选场景公式——优先做那些『有干净前后对比、单位时间/成本能直接算清』的重复专业活。合同审查跑通不是因为它高深,而是因为它可度量。你不必是律师:任何行业里那种『专业但重复、且能一眼看出省了多少分钟/多少钱』的活(保险条款比对、招投标文件核查、财务合规扫描),都是 AI 落地的好切口。把某一类这样的活用现成 AI 工具跑出一个可复述的效率数字(如『某类审查从 X 分钟到 Y 分钟』),就是既能自用、也能对外做成垂类服务的起点。
#06
mindstudio.ai Article
NEW

FDE 的经济学被验证:Palantir 靠『前向部署』打法带出 640% 级回报,OpenAI 专设 40 亿美元 The Deployment Company

前向部署工程师(FDE)不是一个新词,但今天的信号是它的『经济价值』被真金白银验证了。Palantir 在 2008 年发明了这个岗位——工程师住进客户环境、待上 60–180 天、把模糊的企业问题变成能上线的产品,既在客户环境里写代码、也往自家主产品仓里提交——这套『把能力落成业务』的打法,被分析归因为带来 640% 级别的回报。到 2026 年,OpenAI 和 Anthropic 已把它当作明确的企业 GTM 战略:OpenAI 甚至在 2026 年初专门成立了一家 40 亿美元、由 TPG/高盛/麦肯锡背书的 The Deployment Company;ServiceNow 联手埃森哲、Anthropic、OpenAI 也在 2026 年 5 月的两周内相继把 FDE 项目正式化。薪酬上,2026 年 FDE 全包从种子期约 20 万美元到 C 轮约 45 万–55 万美元不等,普遍高于同级产品工程师。七条组织经验反复出现:招『工程师+外交官』、嵌进客户、第一天就交付、把客户调研当工程活、建客户专属本体、让产品反馈走 FDE、拒绝沦为系统集成商。
#FDE
另有 2 家信源报道
展开详情
  • **打法被验证**:Palantir『工程师住进客户现场把模型落成业务』的 FDE 模式被归因带来约 640% 回报;OpenAI/Anthropic 已把它当明确的企业 GTM
  • **真金投入**:OpenAI 2026 年初设立 40 亿美元的 The Deployment Company(TPG/高盛/麦肯锡背书);ServiceNow+埃森哲+Anthropic+OpenAI 5 月两周内相继把 FDE 正式化
  • **薪酬信号**:2026 FDE 全包从种子期约 $20 万到 C 轮约 $45 万–$55 万,普遍高于同级产品工程师
推荐理由:对普通人的机会:AI 落地最缺的不是会训模型的人,是能把模型送进客户业务、还对结果负责的人——这正是 FDE 的内核,也是一条比『纯算法岗』门槛更友好的高价值路径。你不必进大厂当 FDE,就能练它的核心能力:选一个你熟悉的具体行业/业务,把某个真实痛点用现成 AI 能力端到端做通(懂业务 + 会写集成 + 能量化效果),做出一个能讲清『我把 X 问题落成了 Y 结果』的案例。这种『既懂业务又能交付』的复合能力,在企业 AI 从 demo 走向生产的今天极度稀缺,无论是求职、接单还是自己做垂类服务,都是最硬的筹码。
#07
starterstory.com Product 直接可用
NEW

Formula Bot:不会写代码的作者,靠『大白话生成 Excel 公式』一个动作做到约 22.6 万美元月收入

Formula Bot 是一个把『用大白话描述需求→自动生成 Excel/Google Sheets 公式』做到极致的小工具,作者 David Bressler 本身不是程序员,用无代码平台 Bubble 搭了出来。它的冷启动很有教科书意义:第一站是把这个免费小工具丢进 Reddit 的 r/Excel 版块,面对成千上万天天被公式折磨的 Excel 爱好者,瞬间病毒式传播。如今它累计约 75 万用户、约 5000 付费用户,做到约 22.6 万美元月经常性收入(约合年化 270 万美元级别),并从『写公式』扩展成一个更完整的 AI 数据分析平台。它印证了小微现金流最实的一条路:不追大而全,把一个高频、具体、痛感强的动作(谁没被 VLOOKUP 折磨过?)做透,用免费版精准砸进目标人群聚集的社区,再把一部分转成付费。
#小微现金流#免费工具引流 + 订阅付费(…
另有 3 家信源报道
展开详情
  • **一个动作做透**:只解决『大白话→Excel 公式』这一个高频痛点,作者不会写代码、用 Bubble 无代码搭建,照样跑通
  • **冷启动**:把免费工具丢进 Reddit r/Excel(目标人群密集地)瞬间病毒传播——先有分发、再谈变现
  • **现金流硬数字**:约 75 万用户、约 5000 付费用户,做到约 $22.6 万月经常性收入,并扩展成 AI 数据分析平台
推荐理由:对想挣现金流的普通人:Formula Bot 是『窄而深 + 精准分发』的样板。它给的可复制路径很清晰——先找一个大量人群天天犯难、又能一句话说清的高频小痛点(不必宏大,越具体越好),用现在的 AI + 无代码工具做一个免费就能用的小工具,然后把它精准投进这群人扎堆的社区(对口的 subreddit、群、论坛),靠免费版引爆、再把重度用户转成订阅。你不需要会写代码,也不需要爆款创意,需要的是选对那个『高频 + 痛 + 好描述』的切口,并且知道你的用户在哪扎堆。
My Take:评分(5=最优):最快成交 4 / 最低成本 5 / 可复制 4 / 风险安全度 5。窄工具 + 精准社区分发,无代码可做、成本极低、路径清晰可抄。
商机信号(成熟):谁付钱:天天和 Excel/Google Sheets 打交道、又写不利索复杂公式的职场人、财务、运营、分析师、中小商家 痛点:复杂公式(VLOOKUP、嵌套 IF、数组公式等)难写易错、查文档耗时,一个公式卡半天 切入点:别正面做 Formula Bot 这种通用款(已成熟),去切某个垂直场景的『大白话→结果』小工具:如电商卖家的对账/库存公式、某行业专用报表模板生成、特定 ERP/SaaS 导出数据的清洗公式,用 AI+无代码做出来,精准投进该人群聚集的社区免费引流再转订阅
#08
arXiv Paper
NEW

SWE-Bench Pro: Can AI Agents Solve Long-Horizon Software Engineering Tasks?

SWE-Bench Pro 是 2026 年 9 月出现在 arXiv 上的一个新基准,问题问得很直白:AI agent 到底能不能解决『长链路(long-horizon)』的真实软件工程任务?它的动机指向当前评测的一个公认痛点——原版 SWE-bench Verified 正在被各家模型刷到高位、且被批评更偏『单点、短链路』的修复任务,难以区分顶级 agent 在真正复杂、需要长期规划和多步执行的工程任务上的差距。SWE-Bench Pro 想补的正是这一块:用更贴近真实工程、跨越更长步骤链条的任务,来把『看起来都很强』的 agent 重新拉开档次。(注:本会话代理封禁了 arXiv 直连,无法逐字核对论文内的具体分数与实验细节,此处只依据标题与检索到的框架性描述转述其定位与动机,不复述未经核实的精确数字。)
在原版 SWE-bench 逐渐被刷高、且被批评偏『短链路』之际,提出一个专门衡量 agent 能否完成『长链路、多步骤』真实软件工程任务的新基准,把评测重心从『能不能修一个 bug』推向『能不能扛住一个需要长期规划与多步执行的工程任务』。
#评测
展开详情
  • **补短板**:针对原版 SWE-bench 被刷高、偏短链路的问题,专门衡量『长链路、多步骤』的真实软件工程任务
  • **评测重心上移**:从『能不能修一个 bug』推向『能不能扛住需要长期规划与多步执行的工程任务』,更能区分顶级 agent 的真实差距
  • **时点**:2026 年 9 月上线(arXiv 2509.16941),与 HydraFusion、OpenHands 1.0 同期,共同指向『编码 agent 该怎么被认真评测』这个议题
推荐理由:对普通人的启发:看编码 agent 的能力,别被『XX 在 SWE-bench 上又刷了高分』带节奏——真正决定它能不能替你干重活的,是它在『长链路任务』上的表现(能不能扛住一个跨越很多步骤、需要中途规划和纠错的真实任务)。这给了你一个更实用的自测方法:与其看榜单分数,不如拿你自己工作里一个真正复杂、多步骤的任务去试不同 agent,看谁能一路走到底而不中途跑偏。会用『长链路真实任务』而不是『单点玩具题』来评估工具的人,才不会为营销分数买单,也更能选对真正帮到自己的 agent。