📅
Hall of Fame
Hall of Fame
Track
Type
Source
8月6日 周四 · 8 条
今日趋势综述
本周的信号高度一致:当顶尖模型在 SWE-bench Verified 上已挤到 80–95 分、日常任务几乎无差别时,涨价、涨岗、涨用户的全落在『把 agent 管稳、接住、交付住』的那一层——GitHub 把 skills+MCP 送进代码审查、一篇论文靠给工具调用加校验就把重试搞干净、Simon Willison 说要练的新手艺是『设计 agentic loop』,而法律行业和 FDE 岗位真金白银证明:会把 AI 卡进业务流程的人,才拿走增值。
今天的信号:模型分数拉平了,把它接进业务的手艺才值钱

把今天几条线并排看,会发现它们在讲同一件事。评测那头,SWE-bench Verified 已经饱和到没法拉开差距——Fable 5 95.0、GPT-5.5 88.7、Opus 4.8 88.6、Gemini 3.1 Pro 80.6,普通任务里你几乎感知不到谁更强;真正还能分高下的,是更难的 SWE-bench Pro(多文件、跨模块)和『你能不能把模型稳稳地接进一条真实流程』。

于是钱和注意力全涌向『接口层』和『交付层』。GitHub 把 Agent Skills 和 MCP 正式送进 Copilot 代码审查,意味着『把团队规范和外部上下文喂给 agent』从玩具变成生产设施;arXiv 那篇《Verified Tool Calls》干脆证明:不用换更强的模型,只给工具调用加上后置校验、先验后重试、幂等键,就能把 agent 在真实故障下的重复动作压下去、成功率还不掉——可靠性是工程出来的,不是等来的。Simon Willison 把这层手艺点破成一句话:现在最该练的新技能是『设计 agentic loop』——怎么给 agent 配工具、配验证、配上下文,让它自己跑通一个闭环。而 Murmell、OpenMemory MCP 这些本周的新品,全在补同一块地基:让多个 agent 能并行不打架、能跨工具记得住。

落到会付钱的地方,信号更硬。法律行业 GenAI 个人使用率一年翻倍到 69%,一家律所把 AI 卡进流程后律师起草联邦法院动议只花四分之一时间、86% 律师天天用——但 54% 的所连个使用规范都没有,这道『会用但不会治理』的缝隙就是机会。FDE(驻场交付工程师)被前沿实验室开到七位数、OpenAI 和 Anthropic 专门成立部门,要的正是『能把模型能力落到客户业务里』的那种人。所以对个人的行动很清楚:别再卷『谁会调更强的 API』——那条优势正被拉平;把时间押到三件填不平的手艺上:设计能自我验证的 agentic loop、把某个行业的流程拆成 agent 能一步步跑完的结构、以及把不确定的 AI 能力包装成对某个付费人群『确定的结果』。模型是越来越平价的水,会接管道、能验水质、知道往哪个厨房接的人才收钱。

#01
github.blog Article
NEW

GitHub 把 Agent Skills + MCP 正式送进 Copilot 代码审查(7/29 GA)

7 月 29 日,GitHub 宣布 Copilot 代码审查对 Agent Skills 和 MCP 服务器的支持正式 GA,面向所有 Copilot Pro 与 Enterprise 用户。含义是:以前你只能让 Copilot 用它自己的通用规则审 PR,现在可以把团队的编码规范、内部约定写成 SKILL.md 挂上去,让审查按你们的标准来;还能通过 MCP 把外部工具和上下文(issue 跟踪、内部文档、私有 API)接进审查环节。这把『skills+MCP』从个人玩具正式变成团队级的生产设施——审查这种最讲规范一致性的场景,恰恰是 skills 最能发力的地方。注意这是能力上线,实际提升多少要看你把规范写得多具体、多少团队真去维护这套 skill。
#Skills#编程开发
另有 1 家信源报道
展开详情
  • **上线**:7/29 GA,Copilot 代码审查同时支持 Agent Skills(SKILL.md)与 MCP 服务器,Pro/Enterprise 全量可用
  • **变化**:从『用通用规则审』变成『用你团队的规范审』——把编码约定写成 skill,审查就按你们的标准执行
  • **接口**:MCP 让审查能拉到外部上下文(内部文档、私有 API、issue),不再只看 diff 本身
推荐理由:对个人开发者这是一个清晰的信号:SKILL.md 正在成为跨工具的通用格式,Claude Code、Codex、Copilot 都在收敛到它。与其到处调不同工具,不如现在就练一手『把一套规范/流程沉淀成高质量 skill』的能力——一份写得好的团队规范 skill,既能在你自己的项目里复用,也是未来技能市场里能卖的资产。行动上:挑你最常重复叮嘱同事的那三条编码/审查规矩,试着写成一个 SKILL.md 跑起来,你就摸到了这波接口标准化的入口。
商机信号(萌芽):谁付钱:有代码规范洁癖、想把评审标准自动化的工程团队与技术负责人;以及在技能市场找现成 skill 的开发者 痛点:团队规范全靠人肉在 PR 里反复叮嘱,换人就走样;通用 AI 审查不懂你们的内部约定 切入点:把某类高频规范(如某语言/框架的安全与风格约定、某行业合规检查)打磨成一个开箱即用的高质量审查 skill,先在自己项目验证效果再上架技能市场
#02
benchlm.ai Article
NEW

本周编码榜:SWE-bench Verified 已挤到 80–95 分,真正拉开差距的是更难的 Pro

把本周主流编码模型放到同一把尺子上量:在已接近饱和的 SWE-bench Verified 上,Fable 5(Anthropic)95.0%、GPT-5.5 88.7%、Claude Opus 4.8 88.6%、Gemini 3.1 Pro 80.6%——四家挤在一段窄区间,日常改 bug、写函数你几乎感知不到差别。差距真正打开是在更难的 SWE-bench Pro(多文件、跨模块的『硬活』):Fable 5 拉到 80.3%,Opus 4.8 69.2%,GPT-5.5 58.6%,Gemini 3.1 Pro 54.2%。同一周期看,Pro 的天花板被 Fable 5 从此前的 ~69% 明显往上顶了一截。要留意口径:不同榜的题集与运行档不完全一致,横向比时以同一榜同一列为准。
#评测
另有 2 家信源报道
展开详情
  • **对比**:SWE-bench Pro 上 Fable 5 80.3% vs Opus 4.8 69.2% vs GPT-5.5 58.6% vs Gemini 3.1 Pro 54.2%
  • **对比**:SWE-bench Verified 上 Fable 5 95.0% vs GPT-5.5 88.7% vs Opus 4.8 88.6% vs Gemini 3.1 Pro 80.6%——挤成一团
  • **看点**:Verified 饱和、感知不到差别,能分高下的只剩 Pro 这类多文件硬任务和真实工程场景
推荐理由:对开发者的直接用处是别再按『榜首』无脑选型。日常任务(写函数、补测试、小 bug)四家都在 88+ Verified,选便宜、生态顺手的那个,把省下的钱花在评测和护栏上更划算;只有当你真要啃多文件重构、跨模块联调这种硬活,Pro 榜上 Fable 5 的领先才值得为它多付。普通人能练的手艺,是拿这种同基准横向对比(而不是厂商自测表)当选型依据,并学会看清每个分数背后的『题集/运行档』口径——会看榜,本身就是一种省钱的能力。
#03
simonw.substack.com Opinion
NEW

Simon Willison

现在最该练的新技能是『设计 agentic loop』——编码 agent 之所以是台阶式的跃迁,是因为它能直接运行自己写的代码、纠错、翻查实现细节、跑实验;你的工作,是设计那个让它能自己闭环跑通的循环。
Willison 把这半年 agent 的质变落到一句可操作的话上:模型强不强只是底料,真正决定产出的,是你怎么给 agent 配一个能自我验证的循环——给它哪些工具、怎么让它跑测试拿到真实反馈、怎么喂上下文、在哪一步设人工审核关口。这和本周那篇《Verified Tool Calls》论文、和 GitHub 把 skills+MCP 送进代码审查,其实是同一件事的三个切面:可靠性不是等更强的模型,而是把循环设计好。
#AI Agent
另有 1 家信源报道
推荐理由:这对普通人是一条很实的成长路径:与其焦虑『模型会不会取代我』,不如把『设计 agentic loop』当成新的核心技能来练。具体做法——挑一个你每天重复的小流程(比如整理数据、写周报、处理某类工单),试着给 agent 配好工具+验证步骤+上下文,让它自己跑通一遍并能自查对错。你练的不是提示词,而是『把一件事拆成机器能闭环完成的结构』——这正是 FDE、agent 工程师岗位在反复点名的能力,也是最难被更强模型抹平的手艺。
#04
arXiv Paper
NEW

Verified Tool Calls:不换模型,只给工具调用加校验,就把 agent 在真实故障下的重复动作压下去

这篇 8 月的论文针对一个很现实的坑:真实环境里工具调用不是『要么成功要么失败』,而常常『做了一半就断』(non-atomic failure)——付款扣了但回执没回来、文件写了一半、API 超时但其实已生效。这种情况下 agent 盲目重试,就会重复下单、覆盖数据。作者给工具调用套了一层轻量包装:调用后先跑后置条件校验确认到底成没成、先验证再决定要不要重试、并用幂等键防止同一动作被执行两次。在注入这类半途故障的受控环境里,该方法显著减少了重复动作,同时任务成功率与基线相当。核心价值不在某个新模型,而在一套可以直接抄进你自己 agent 的工程模式。
证明长任务 agent 的可靠性瓶颈常在『工具调用一半失败、状态没对齐就盲目重试』,给调用加上后置校验、先验后重试、幂等键这套轻量包装,就能在不升级模型的前提下显著减少重复/破坏性动作、成功率不掉——可靠性是工程出来的。
#AI Agent
另有 1 家信源报道
展开详情
  • **问题**:真实工具调用会『做一半就断』,agent 盲目重试导致重复下单、覆盖数据等破坏性动作
  • **方法**:后置条件校验(确认到底成没成)+ 先验后重试 + 幂等键,一层轻量包装,不动底层模型
  • **结果**:受控注入故障下重复动作明显下降,任务成功率与基线持平——可靠性靠工程补,不靠换模型
推荐理由:对想做 agent 产品或副业的人,这篇是一份能直接抄的施工图:让 agent 上生产,卡住你的往往不是模型不够聪明,而是这类『半途故障』把动作重复执行、把数据搞脏。你不需要等更强的模型,把『每次动作后校验一次结果、加幂等键、验证通过才重试』这套模式加进去,可靠性就上一个台阶。谁能把这类工程护栏做扎实,谁的 agent 才敢接真实的、会花钱会改数据的活——这正是从 demo 到能收费的分水岭。
#05
lawnext.com Article
NEW

法律行业 AI 落地实测:个人使用率一年翻倍到 69%,一家律所把起草时间压到四分之一,但 54% 的所连规范都没有

法律这个一向保守的行业,AI 落地的分层特别清楚。个人层面已经很热:69% 法律从业者用 GenAI 处理工作,28% 每天用、31% 每周用几次,只有 19% 从不用;94% 的使用者报告有实打实的效率提升,38% 每周省 1–5 小时、25% 省 6 小时以上。真实案例更硬:Rupp Pfalzgraf 律所把 Lexis+ AI 卡进流程,18 个月后 86% 律师日常使用,起草复杂联邦法院动议只花过去四分之一的时间。但机构层面严重滞后——超过一半(54%)的所既没提供任何负责任使用培训、也没打算提供,规范与治理几乎空白。赢家的共性不是买了最强模型,而是把 AI 卡进了具体流程;输在起跑线的,是把它当禁忌或放养。
#行业应用
另有 2 家信源报道
展开详情
  • **采用**:法律从业者 GenAI 个人使用率一年翻倍到 69%,28% 每天用;94% 使用者报告效率提升,1/4 每周省 6 小时以上
  • **案例**:Rupp Pfalzgraf 把 Lexis+ AI 卡进流程,18 个月后 86% 律师日常使用,起草联邦法院动议只花 1/4 时间
  • **缝隙**:54% 律所没有任何使用规范与培训,且无计划——『会用但不会治理』是当下最大的落地风险与机会
推荐理由:对个人这里有两层机会。一是律师/法务本人:这份数据说明现在会把 AI 卡进自己起草、检索、尽调流程的人,实打实每周多出半天到一天产能,抢的是同行还在观望的时间差。二是懂流程的服务者:54% 的所连规范都没有,这道『采用快、治理慢』的缝隙,就是给中小律所做『AI 使用规范 + 流程集成 + 合规护栏』落地服务的切口——不需要你懂多深的模型,需要你懂这个行业的流程和红线。把某个垂直行业的『会用但不会治理』翻译成一套可交付的方案,就是当下最实在的现金流。
商机信号(加速):谁付钱:中小律所与企业法务团队——AI 采用已快但普遍缺使用规范、培训与合规护栏,愿为『落地+治理』付费 痛点:律师个人已在用 AI,但机构层面 54% 没有任何规范,既怕合规踩雷又不会把 AI 系统性卡进业务流程 切入点:面向某一类律所(如做移民/劳动/知产的中小所)提供『AI 使用规范模板 + 检索/起草流程集成 + 保密与引用核查护栏』的打包落地服务,先做透一个细分再复制
#06
getperspective.ai Article
NEW

FDE 组建与薪资段位:前沿实验室开到七位数,OpenAI 与 Anthropic 专设部门抢『能把模型落进客户业务的人』

延续 FDE(Forward Deployed Engineer,驻场交付工程师)这波岗位热,本周的新料是把『薪资段位』和『组织打法』说清楚了。薪酬跨度惊人:Palantir 中位数约 $215K,到前沿实验室(Anthropic、OpenAI)的 L4–L5 段位 $665K–$750K,principal 级破 $1M,且顶部包里股权占 55–70%。组织上,OpenAI 和 Anthropic 都在 2026 年 5 月照着 Palantir 的打法专门成立了 FDE 部门。这个岗位的稀缺在于它要求一个人同时握住三角:生产级工程能力、对 LLM 与系统的通透、以及面对客户的判断力——大多数候选人只强在一两个角,招聘方就死磕那个最难凑齐的第三角、绝不将就。
#FDE
另有 2 家信源报道
展开详情
  • **薪资**:Palantir 中位数约 $215K → 前沿实验室 L4–L5 $665K–$750K → principal 破 $1M,股权占顶部包 55–70%
  • **组织**:OpenAI 与 Anthropic 均于 2026 年 5 月照 Palantir 打法专设 FDE 部门,把交付当核心业务
  • **能力三角**:生产工程 + LLM/系统通透 + 面客判断力三者兼备,稀缺就稀缺在最难凑的第三角
推荐理由:对个人这是这两年最值得盯的职业信号之一:钱和岗位不在『训模型的人』那边,而在『能把模型能力落进客户真实业务』的交付层。你不必是顶尖研究员——把三角里你已有的那一两角(比如扎实的工程或某个行业的业务判断)补上缺的第三角,就能挤进这条七位数赛道。最实际的起步:找一个具体行业的具体流程,用 agent 真正跑通一个能交付的闭环,把『我能把 AI 落到业务里』变成可展示的作品,而不是简历上的形容词。
商机信号(加速):谁付钱:前沿 AI 实验室与做企业 AI 交付的公司——正大规模高薪抢 FDE,愿为『能把模型落进客户业务』的人开到七位数 痛点:会训模型/会调 API 的人过剩,能把能力稳稳交付进客户复杂遗留系统的人极度稀缺 切入点:个人或小团队以『AI 落地交付』接活:挑一个熟悉的行业,做几个把流程用 agent 跑通并能交付的真实案例,从外包/驻场式交付切入积累作品与口碑
#07
Product Hunt Product
NEW

Murmell:一块共享云端画布,让团队和多个编码 agent 在同一个仓库上并行不打架

Murmell 是本周登陆 Product Hunt 的一块浏览器里的共享云端画布:Claude Code、Codex、Kimi、OpenCode 等多个编码 agent 和你的团队在同一台云机、同一个仓库上一起干活。它解决的核心痛点是『多 agent 并行会互相覆盖』——agent 在动手写之前会先『认领』文件,所以人和多个 agent 能同时推进而不打架;你合上笔记本,云上的活继续跑,同房间可实时预览,产出最后落回 git。定位很清楚:不是又一个编码 agent,而是给『一堆 agent 一起干活』这件事补上协调与治理的地基。属于本周一波『为 agent 密集的编码流程做协调/治理』新品中的一个。
#DevTools#上线优惠:前两周免费 + $…
另有 1 家信源报道
展开详情
  • **解决**:多 agent 并行互相覆盖——agent 写前先认领文件,人和多 agent 同时推进不冲突
  • **形态**:浏览器共享云画布,支持 Claude Code/Codex/Kimi/OpenCode,合上笔记本云上继续跑、产出落回 git
  • **定位**:不是又一个 agent,而是给『多 agent 协作』补协调层——本周同类新品扎堆出现
推荐理由:这类产品的出现本身是个信号:行业已经从『找一个更强的 agent』过渡到『怎么同时管好一群 agent』——Karpathy 说他同时指挥 20 个 agent,普通人迟早也要面对这个场景。对个人的机会有两层:一是尽早养成『用多个 agent 并行干活』的工作方式,产能上限比单开一个高一截;二是留意这条『agent 协作/编排』新赛道里还空着的位置——协调、记忆、权限、审计这些地基还远没被填满,做垂类的协作层或治理工具,是个门槛不算高的切入点。
#08
Product Hunt Product
NEW

OpenMemory MCP:给 AI 工具装一块私有共享记忆,治『每个工具各自失忆』的老毛病

OpenMemory MCP 是一个私有记忆服务,通过 MCP 协议接进 Cursor、Claude Desktop、Windsurf 等兼容工具,解决一个被反复吐槽的痛点:再强的 AI 工具今天仍然『失忆』——你在一个工具里定的计划、讲过的偏好,换到另一个工具就没了。它把记忆做成一层跨工具、可自持(私有部署、数据自己掌握)的服务,让多个 agent/工具共享同一份上下文。这条线本周很热:MCP 正在成为 AI 生态的『USB-C』,多款新品都把『MCP 原生』当核心卖点,而记忆是其中最刚需的一块地基。评估时要看它的检索质量与隐私边界,别只被『统一记忆』的概念吸引。
#Infra#免费开源为主,私有部署可选
另有 1 家信源报道
展开详情
  • **痛点**:AI 工具集体失忆——一个工具里的计划/偏好换个工具就丢,跨工具上下文断层
  • **做法**:通过 MCP 给 Cursor/Claude Desktop/Windsurf 等接一层私有、可自持的共享记忆
  • **趋势**:MCP 正成为 AI 生态的 USB-C,本周多款新品主打『MCP 原生』,记忆是最刚需地基之一
推荐理由:对个人有两个用法。一是马上受益:如果你横跨多个 AI 工具干活,给它们接一层共享记忆,能省掉大量重复交代上下文的时间,让 agent 真正记住你的偏好和项目背景。二是看清赛道:记忆、连接器、权限这些『接口层地基』正在被快速标准化到 MCP 上,谁能在某个垂直场景(比如某行业的私有知识记忆、某团队的共享上下文)把 MCP 记忆做扎实、把隐私边界做可信,就卡住了一个高频刚需的位置——这比追最新模型更耐打。