Hall of Fame
今日趋势综述
今天的信号:模型分数拉平了,把它接进业务的手艺才值钱
把今天几条线并排看,会发现它们在讲同一件事。评测那头,SWE-bench Verified 已经饱和到没法拉开差距——Fable 5 95.0、GPT-5.5 88.7、Opus 4.8 88.6、Gemini 3.1 Pro 80.6,普通任务里你几乎感知不到谁更强;真正还能分高下的,是更难的 SWE-bench Pro(多文件、跨模块)和『你能不能把模型稳稳地接进一条真实流程』。
于是钱和注意力全涌向『接口层』和『交付层』。GitHub 把 Agent Skills 和 MCP 正式送进 Copilot 代码审查,意味着『把团队规范和外部上下文喂给 agent』从玩具变成生产设施;arXiv 那篇《Verified Tool Calls》干脆证明:不用换更强的模型,只给工具调用加上后置校验、先验后重试、幂等键,就能把 agent 在真实故障下的重复动作压下去、成功率还不掉——可靠性是工程出来的,不是等来的。Simon Willison 把这层手艺点破成一句话:现在最该练的新技能是『设计 agentic loop』——怎么给 agent 配工具、配验证、配上下文,让它自己跑通一个闭环。而 Murmell、OpenMemory MCP 这些本周的新品,全在补同一块地基:让多个 agent 能并行不打架、能跨工具记得住。
落到会付钱的地方,信号更硬。法律行业 GenAI 个人使用率一年翻倍到 69%,一家律所把 AI 卡进流程后律师起草联邦法院动议只花四分之一时间、86% 律师天天用——但 54% 的所连个使用规范都没有,这道『会用但不会治理』的缝隙就是机会。FDE(驻场交付工程师)被前沿实验室开到七位数、OpenAI 和 Anthropic 专门成立部门,要的正是『能把模型能力落到客户业务里』的那种人。所以对个人的行动很清楚:别再卷『谁会调更强的 API』——那条优势正被拉平;把时间押到三件填不平的手艺上:设计能自我验证的 agentic loop、把某个行业的流程拆成 agent 能一步步跑完的结构、以及把不确定的 AI 能力包装成对某个付费人群『确定的结果』。模型是越来越平价的水,会接管道、能验水质、知道往哪个厨房接的人才收钱。
GitHub 把 Agent Skills + MCP 正式送进 Copilot 代码审查(7/29 GA)
展开详情
- **上线**:7/29 GA,Copilot 代码审查同时支持 Agent Skills(SKILL.md)与 MCP 服务器,Pro/Enterprise 全量可用
- **变化**:从『用通用规则审』变成『用你团队的规范审』——把编码约定写成 skill,审查就按你们的标准执行
- **接口**:MCP 让审查能拉到外部上下文(内部文档、私有 API、issue),不再只看 diff 本身
本周编码榜:SWE-bench Verified 已挤到 80–95 分,真正拉开差距的是更难的 Pro
展开详情
- **对比**:SWE-bench Pro 上 Fable 5 80.3% vs Opus 4.8 69.2% vs GPT-5.5 58.6% vs Gemini 3.1 Pro 54.2%
- **对比**:SWE-bench Verified 上 Fable 5 95.0% vs GPT-5.5 88.7% vs Opus 4.8 88.6% vs Gemini 3.1 Pro 80.6%——挤成一团
- **看点**:Verified 饱和、感知不到差别,能分高下的只剩 Pro 这类多文件硬任务和真实工程场景
Simon Willison
现在最该练的新技能是『设计 agentic loop』——编码 agent 之所以是台阶式的跃迁,是因为它能直接运行自己写的代码、纠错、翻查实现细节、跑实验;你的工作,是设计那个让它能自己闭环跑通的循环。
Verified Tool Calls:不换模型,只给工具调用加校验,就把 agent 在真实故障下的重复动作压下去
展开详情
- **问题**:真实工具调用会『做一半就断』,agent 盲目重试导致重复下单、覆盖数据等破坏性动作
- **方法**:后置条件校验(确认到底成没成)+ 先验后重试 + 幂等键,一层轻量包装,不动底层模型
- **结果**:受控注入故障下重复动作明显下降,任务成功率与基线持平——可靠性靠工程补,不靠换模型
法律行业 AI 落地实测:个人使用率一年翻倍到 69%,一家律所把起草时间压到四分之一,但 54% 的所连规范都没有
展开详情
- **采用**:法律从业者 GenAI 个人使用率一年翻倍到 69%,28% 每天用;94% 使用者报告效率提升,1/4 每周省 6 小时以上
- **案例**:Rupp Pfalzgraf 把 Lexis+ AI 卡进流程,18 个月后 86% 律师日常使用,起草联邦法院动议只花 1/4 时间
- **缝隙**:54% 律所没有任何使用规范与培训,且无计划——『会用但不会治理』是当下最大的落地风险与机会
FDE 组建与薪资段位:前沿实验室开到七位数,OpenAI 与 Anthropic 专设部门抢『能把模型落进客户业务的人』
展开详情
- **薪资**:Palantir 中位数约 $215K → 前沿实验室 L4–L5 $665K–$750K → principal 破 $1M,股权占顶部包 55–70%
- **组织**:OpenAI 与 Anthropic 均于 2026 年 5 月照 Palantir 打法专设 FDE 部门,把交付当核心业务
- **能力三角**:生产工程 + LLM/系统通透 + 面客判断力三者兼备,稀缺就稀缺在最难凑的第三角
Murmell:一块共享云端画布,让团队和多个编码 agent 在同一个仓库上并行不打架
展开详情
- **解决**:多 agent 并行互相覆盖——agent 写前先认领文件,人和多 agent 同时推进不冲突
- **形态**:浏览器共享云画布,支持 Claude Code/Codex/Kimi/OpenCode,合上笔记本云上继续跑、产出落回 git
- **定位**:不是又一个 agent,而是给『多 agent 协作』补协调层——本周同类新品扎堆出现
OpenMemory MCP:给 AI 工具装一块私有共享记忆,治『每个工具各自失忆』的老毛病
展开详情
- **痛点**:AI 工具集体失忆——一个工具里的计划/偏好换个工具就丢,跨工具上下文断层
- **做法**:通过 MCP 给 Cursor/Claude Desktop/Windsurf 等接一层私有、可自持的共享记忆
- **趋势**:MCP 正成为 AI 生态的 USB-C,本周多款新品主打『MCP 原生』,记忆是最刚需地基之一
今日趋势综述
今天的信号:模型越聪明,管它的手艺越值钱
今天最抓眼球的是 OpenAI 8 月 1 日甩出的 Astra——它解开了十道搁置数十年的数学难题,包括自 1999 年就悬着的『非同域群是否存在』,还配上机器可验证的 Lean 4 证明,全部算力成本只花了约 2000 美元。这几乎是在宣告:最前沿的推理能力正在变得又强又便宜。但把今天其余几条线索并排看,你会发现钱和注意力并没有涌向『谁的模型更聪明』,而是涌向一个朴素得多的问题——怎么让这么强的模型在真实任务里不跑偏、能交付。
证据很集中:阿里 DreamX 团队的 LongHorizon-Harness 论文,靠一个『管理-执行-审计』的三角循环,把 Qwen 在长任务基准上从 51.8% 拉到 80.7%,方法全在『把已验证的状态放到执行之外、独立审一遍』,而不是换更强的模型;本周 GitHub 上真正在冲榜的三个仓库——腾讯云的 Agent 记忆中枢、Agent-Reach 的统一信息触达、Orca 的并行 agent 工作台——清一色是『让 agent 记得住、看得见、管得动』的基础设施;Anthropic 把交付制度化成了 Services Track,合作伙伴的段位直接绑定『线上跑着的生产部署』,EPAM 一口气要培养 250 名驻场『黑带』FDE;连一个人做的 Backlinker AI,靠把 AI 外联做成『保证每月拿到几条高质量外链』的确定性服务,就做到了五位数月收入。
对个人的行动因此很清楚:别再把自己训练成『会调最强 API 的人』——那条优势正在被 2000 美元的算力和随处可得的开源权重迅速填平。把时间押到三件填不平的手艺上:一是评测与审计(会设计基准、能在模型更新后抓住回归,这正是 FDE 岗位最被反复点名的差异化能力,也是今天那篇 shortcut hacking 论文的警示——37% 的『正确答案』其实是蒙对的);二是长任务编排(把一个业务流程拆成 agent 能一步步跑完、能被独立审核验收的结构);三是把不确定的 AI 能力包装成对某个付费人群『确定的结果』。模型是越来越聪明的水,会接管道、能验水质、知道往哪个厨房接的人,才拿走增值。
OpenAI Astra 花 2000 美元解开十道数十年数学悬案,附机器可验 Lean 4 证明
展开详情
- **硬突破**:首次显式构造非同域群(Gromov 1999 悬案),外加证伪 Connes 刚性猜想、解 Erdős 三题、球堆积上界近半世纪来首次改进
- **可验证**:不是『相信我』,而是每个结果都带机器可验的 Lean 4 证明证书、公开在 GitHub 上任人复核
- **便宜到反直觉**:找出全部十个解总算力成本按 Sol API 价约 2000 美元——前沿推理能力正在同时变强又变便宜
ARC-AGI-2 榜单(8/4):GPT-5.6 Sol 92.5% 领先,Opus 5 与 GPT-5.5 咬在身后
展开详情
- **对比**:GPT-5.6 Sol 92.5% vs Claude Opus 5 90.4% vs GPT-5.5 85%(ARC-AGI-2,截至 8/4,共约 20 个模型上榜)
- **看点**:顶尖两家只差 2.1 分,这条以『抗背题』著称的抽象推理榜也在往饱和挤
- **别被单分误导**:Opus 5 的 90.4% 是半私有集 + Max 推理档口径,换子集/换推理档分数会动,横向比先对齐条件
LongHorizon-Harness:一个『管理-执行-审计』循环,把长任务通过率从 51.8% 拉到 80.7%
展开详情
- **方法**:Manager 守目标+已验证状态、Executor 每轮清空上下文只做一步、Auditor 独立查文件/日志/测试——把可信状态放到执行之外
- **数据**:Qwen 3.7-Plus 在 WeaveBench 51.8%→80.7%、Terminal-Bench 2.1 69.7%→77.2%、OSWorld 2.0 2.8%→8.3%
- **通用**:套在 Claude Opus 4.7 上,OSWorld 2.0 子集也从 20.0% 提到 34.3%——是框架增益而非换模型
TencentCloud/TencentDB-Agent-Memory
展开详情
周增长:本周 GitHub 冲榜,近日日增约千星,是团队级 agent 记忆方向的当红项目
- **四类记忆资产**:把对话/文档/代码沉淀成 Chat Memory、Skill、LLM-Wiki、Code-Graph,还带 ACL 权限治理
- **跨 agent 共享**:记忆不再锁在单个会话里,而是团队级、跨框架复用——这是从个人 agent 走向团队 agent 的关键件
- **厂商数据**:配 OpenClaw 称 token 降 61%、通过率升 51%(自测口径,迁移前请拿自己任务复测)
Anthropic 把 AI 交付制度化:Services Track 用『线上生产部署』定合作伙伴段位,EPAM 要养 250 名驻场黑带
展开详情
- **成果绑定**:Services Track 段位由『线上跑着的生产部署』决定,掉了活跃生产客户就掉档——把交付而非签单变成硬指标
- **规模化**:EPAM+Anthropic 要养 1 万名 Claude 认证架构师,含 250 名驻场黑带 FDE,Q3 末先认 5000 人
- **核心手艺**:评测工程(证明系统能用 + 模型更新后抓回归)被反复点名为 FDE 最关键差异化,薪资带 30 万–120 万美元+
Backlinker AI:一个人把 AI 外联做成『保证每月拿到高质量外链』的确定性服务,做到五位数月收入
展开详情
- **确定性交付**:不卖『我帮你试试』,卖『每月保证 3+ 条 DR30+ 外链』——把不确定的 AI 能力包装成客户能验收的结果
- **数字**:多个独立追踪站佐证 $12–20K MRR 区间,一年约 $22.7 万营收、$16 万 ARR、同比 +187%、一人运营
- **打法**:AI 自动应答记者提问平台拿编辑外链,价格约为传统外链机构的十分之一,靠成本结构差打出空间
Agent Skills 补上团队层:共享、只用不改、版本回滚、审计治理,定价从免费起
展开详情
- **协作**:像 Google Docs 一样共享技能,配『只用不改』权限——别人能调用但保护你的创作者 IP
- **治理**:版本历史 2.0 + 一键回滚 + 审计日志,技能第一次有了企业级的可追溯与回退能力
- **规模**:Managed Agents 单会话最多挂 500 个技能,配逐 agent 推理档与更多 webhook 事件
医疗 AI 落地实测:环境式 AI 病历跨 7260 名医生、250 万次问诊铺开,日省文书 13–16 分钟、倦怠降 31%
展开详情
- **规模**:Permanente 铺到 7260 名医生、约 257 万次问诊;UCSF 120 万次门诊达 44.6% 采用率——是真规模不是试点
- **效果诚实**:每 8 小时看诊省约 16 分钟、每天省 13–16 分钟文书、自报倦怠降 31%,一年累计省约 1.57 万小时
- **赢在嵌入**:不改医生看诊习惯、把 AI 塞进本来就要走的『看诊-记录』流程,而非要求医生学新系统
今日趋势综述
今天的信号:模型这条护城河正在被填平
把今天几条线索并排看,一个方向很清楚:顶尖模型的『独家优势』正在快速缩水。DeepSeek 上周五甩出 MIT 许可、13B 激活就跑赢自家旗舰的 V4-Flash-0731;在专门防数据污染的 SWE-rebench 上,开源的 GLM-5、GLM-5.1 已经咬到闭源 Opus 4.6 身后 2.6 分以内;xAI 把整套 Grok Build 编码 agent 也开源了。三件事指向同一句话——『用得上的强模型』正在变成随处可取、还能本地跑的公共品,光靠『我接了最强的 API』已经越来越不值钱。
既然模型这层被填平,价值就顺着水管往下游流。今天另外三条恰好是下游:企业为『能把 AI 塞进遗留系统、上线第一天就交东西』的 Forward Deployed Engineer 开出七位数薪水,1000 份岗位分析显示它成了增长最快的技术岗之一;零售业把 AI 卡进补货、定价、推荐的具体环节,个性化点击率 +24%、动态定价毛利 +3–6% 都是真金白银;单人公司 Zigpoll 靠死磕一个细分人群把 MRR 做到 $125k。它们的共同点不是『用了更强的模型』,而是『把某个模型能力精准嵌进了一个愿意付钱的工作流』。
对个人的行动很直接:别再把时间花在追榜首、比谁的模型分高上——那条优势正在归零。把时间投到三件填不平的事上:一是选型判断力(同一基准下便宜/开源模型什么场景够用,见今天的评测),二是交付手艺(把一个具体业务流程拆成 agent 能跑完、能验收的步骤,这正是 FDE 和垂直落地的核心),三是找准一个窄到你能吃透的付费人群。模型越来越像自来水,会接水管、知道往哪个厨房接的人,才拿走增值。
DeepSeek-V4-Flash-0731:13B 激活跑赢自家旗舰,MIT 权重可商用
展开详情
- **反直觉**:激活参数从 49B 砍到 13B,九项 agentic 基准反而全面反超自家 V4-Pro 预览版——赢在后训练不在堆参数
- **可商用**:MIT 许可、ungated,权重能直接私有化部署,企业不用等授权就能落到自己机房
- **别照单全收**:DeepSWE 54.4、Terminal-Bench 2.1 82.7 均为厂商自测、harness 未公开,迁移前务必用自己的任务复测
SWE-rebench 防污染榜:开源 GLM-5 咬到闭源 Opus 4.6 身后 2.6 分内
展开详情
- **对比**:Opus 4.6 65.3% vs GLM-5 62.8% vs GLM-5.1 62.7%(SWE-rebench,防污染滚动榜,截至 8/2)
- **看点**:领先的是闭源,但咬在身后 2.6 分内的两个全是开源权重——干净基准上开源已逼近前沿
- **信号**:前三挤在 2.6 分内,编码榜正逼近饱和,『榜首模型』的边际优势越来越薄
1000 份岗位拆出来的 FDE 真相:增长最快的技术岗之一,前沿实验室开到七位数
展开详情
- **热度**:被 KORE1 列为企业 AI 里增长最快的三个技术岗之一,连 Google 都在大规模招 FDE 铺进 Fortune 500
- **薪酬**:种子期约 $200K 全包 → C 轮 $450K–$550K+;前沿实验室 L4–L5 总包 $665K–$750K,principal 破 $1M
- **筛的能力**:不再只看写代码,而看『需求挖掘 + 产品化』——把客户模糊痛点变成第一天就能交付的上线系统
零售 AI 落地实测:赢家不是买了最强模型,而是把 AI 卡进补货/定价/推荐每个环节
展开详情
- **个性化**:推荐点击率 +24%、客单价 +18%(对比通用推荐)——嵌进商详页/推荐位就能对账
- **定价**:动态定价在铺开品类上毛利 +3–6%,中型零售商增收 €1.8–4.5M;库存持有成本靠 AI 预测砍 20–30%
- **留存**:一家零售商 12 个月自愿流失率 -22%,约留住 18 万客户;NVIDIA 调查 54% 零售商称 AI 提升了员工生产力
Zigpoll:一个人、无融资、无销售团队,靠死磕一个细分人群做到 $125k MRR
展开详情
- **数字**:单人、无融资、无销售,2026 开局约 $1.03M ARR,6 月约 $125k MRR(≈$1.5M 年化)
- **打法**:先只服务电商这一个窄人群,跑通后再扩到 SaaS 团队——聚焦细分而非追热点
- **反常识**:护城河不是 AI 功能,而是『把一个已在付钱的窄人群吃透』——窄和专注才是单人能扛得住的壁垒
Self-Evolving World Models for LLM Agent Planning
展开详情
- **核心**:让 agent 自己演化出预测『动作→环境如何变』的世界模型,用来支撑长程规划,少靠人工监督
- **验证**:既看世界模型对未来观测的预测准不准,也看它能否实打实提升下游规划表现
- **场景**:在 Word2World、ALFWorld、ScienceWorld 等多步决策环境上评估——瞄准长任务而非单轮问答
xAI 把 Grok Build 编码 agent 整套开源:可本地编译、指向自己的推理跑
展开详情
- **开源范围**:agent loop、代码工具、终端 UI、扩展框架全套源码上 GitHub,Apache 2.0,可审计可魔改
- **local-first**:能自己编译、指向本地推理、配置走 config.toml,不必依赖 xAI 云端
- **同一股风**:叠加本周 DeepSeek/GLM 开源权重——编码 agent 的 harness 也在从闭源黑盒变公共件
Kimi K3:Moonshot 开源 2.8T 稀疏 MoE 权重,改良版 MIT 许可
展开详情
- **体量**:2.8 万亿总参稀疏 MoE,Modified MIT 许可,完整权重已上 Hugging Face
- **节奏**:7/16 世界人工智能大会先上 API,10 天后(7/26)放权重——先服务再开源的打法
- **趋势**:与 DeepSeek V4-Flash 同周,构成『开源阵营在参数量级上持续追平闭源』的又一注脚