📅
Hall of Fame
Hall of Fame
Track
Type
Source
8月6日 周四 · 8 条
今日趋势综述
本周的信号高度一致:当顶尖模型在 SWE-bench Verified 上已挤到 80–95 分、日常任务几乎无差别时,涨价、涨岗、涨用户的全落在『把 agent 管稳、接住、交付住』的那一层——GitHub 把 skills+MCP 送进代码审查、一篇论文靠给工具调用加校验就把重试搞干净、Simon Willison 说要练的新手艺是『设计 agentic loop』,而法律行业和 FDE 岗位真金白银证明:会把 AI 卡进业务流程的人,才拿走增值。
今天的信号:模型分数拉平了,把它接进业务的手艺才值钱

把今天几条线并排看,会发现它们在讲同一件事。评测那头,SWE-bench Verified 已经饱和到没法拉开差距——Fable 5 95.0、GPT-5.5 88.7、Opus 4.8 88.6、Gemini 3.1 Pro 80.6,普通任务里你几乎感知不到谁更强;真正还能分高下的,是更难的 SWE-bench Pro(多文件、跨模块)和『你能不能把模型稳稳地接进一条真实流程』。

于是钱和注意力全涌向『接口层』和『交付层』。GitHub 把 Agent Skills 和 MCP 正式送进 Copilot 代码审查,意味着『把团队规范和外部上下文喂给 agent』从玩具变成生产设施;arXiv 那篇《Verified Tool Calls》干脆证明:不用换更强的模型,只给工具调用加上后置校验、先验后重试、幂等键,就能把 agent 在真实故障下的重复动作压下去、成功率还不掉——可靠性是工程出来的,不是等来的。Simon Willison 把这层手艺点破成一句话:现在最该练的新技能是『设计 agentic loop』——怎么给 agent 配工具、配验证、配上下文,让它自己跑通一个闭环。而 Murmell、OpenMemory MCP 这些本周的新品,全在补同一块地基:让多个 agent 能并行不打架、能跨工具记得住。

落到会付钱的地方,信号更硬。法律行业 GenAI 个人使用率一年翻倍到 69%,一家律所把 AI 卡进流程后律师起草联邦法院动议只花四分之一时间、86% 律师天天用——但 54% 的所连个使用规范都没有,这道『会用但不会治理』的缝隙就是机会。FDE(驻场交付工程师)被前沿实验室开到七位数、OpenAI 和 Anthropic 专门成立部门,要的正是『能把模型能力落到客户业务里』的那种人。所以对个人的行动很清楚:别再卷『谁会调更强的 API』——那条优势正被拉平;把时间押到三件填不平的手艺上:设计能自我验证的 agentic loop、把某个行业的流程拆成 agent 能一步步跑完的结构、以及把不确定的 AI 能力包装成对某个付费人群『确定的结果』。模型是越来越平价的水,会接管道、能验水质、知道往哪个厨房接的人才收钱。

#01
github.blog Article
NEW

GitHub 把 Agent Skills + MCP 正式送进 Copilot 代码审查(7/29 GA)

7 月 29 日,GitHub 宣布 Copilot 代码审查对 Agent Skills 和 MCP 服务器的支持正式 GA,面向所有 Copilot Pro 与 Enterprise 用户。含义是:以前你只能让 Copilot 用它自己的通用规则审 PR,现在可以把团队的编码规范、内部约定写成 SKILL.md 挂上去,让审查按你们的标准来;还能通过 MCP 把外部工具和上下文(issue 跟踪、内部文档、私有 API)接进审查环节。这把『skills+MCP』从个人玩具正式变成团队级的生产设施——审查这种最讲规范一致性的场景,恰恰是 skills 最能发力的地方。注意这是能力上线,实际提升多少要看你把规范写得多具体、多少团队真去维护这套 skill。
#Skills#编程开发
另有 1 家信源报道
展开详情
  • **上线**:7/29 GA,Copilot 代码审查同时支持 Agent Skills(SKILL.md)与 MCP 服务器,Pro/Enterprise 全量可用
  • **变化**:从『用通用规则审』变成『用你团队的规范审』——把编码约定写成 skill,审查就按你们的标准执行
  • **接口**:MCP 让审查能拉到外部上下文(内部文档、私有 API、issue),不再只看 diff 本身
推荐理由:对个人开发者这是一个清晰的信号:SKILL.md 正在成为跨工具的通用格式,Claude Code、Codex、Copilot 都在收敛到它。与其到处调不同工具,不如现在就练一手『把一套规范/流程沉淀成高质量 skill』的能力——一份写得好的团队规范 skill,既能在你自己的项目里复用,也是未来技能市场里能卖的资产。行动上:挑你最常重复叮嘱同事的那三条编码/审查规矩,试着写成一个 SKILL.md 跑起来,你就摸到了这波接口标准化的入口。
商机信号(萌芽):谁付钱:有代码规范洁癖、想把评审标准自动化的工程团队与技术负责人;以及在技能市场找现成 skill 的开发者 痛点:团队规范全靠人肉在 PR 里反复叮嘱,换人就走样;通用 AI 审查不懂你们的内部约定 切入点:把某类高频规范(如某语言/框架的安全与风格约定、某行业合规检查)打磨成一个开箱即用的高质量审查 skill,先在自己项目验证效果再上架技能市场
#02
benchlm.ai Article
NEW

本周编码榜:SWE-bench Verified 已挤到 80–95 分,真正拉开差距的是更难的 Pro

把本周主流编码模型放到同一把尺子上量:在已接近饱和的 SWE-bench Verified 上,Fable 5(Anthropic)95.0%、GPT-5.5 88.7%、Claude Opus 4.8 88.6%、Gemini 3.1 Pro 80.6%——四家挤在一段窄区间,日常改 bug、写函数你几乎感知不到差别。差距真正打开是在更难的 SWE-bench Pro(多文件、跨模块的『硬活』):Fable 5 拉到 80.3%,Opus 4.8 69.2%,GPT-5.5 58.6%,Gemini 3.1 Pro 54.2%。同一周期看,Pro 的天花板被 Fable 5 从此前的 ~69% 明显往上顶了一截。要留意口径:不同榜的题集与运行档不完全一致,横向比时以同一榜同一列为准。
#评测
另有 2 家信源报道
展开详情
  • **对比**:SWE-bench Pro 上 Fable 5 80.3% vs Opus 4.8 69.2% vs GPT-5.5 58.6% vs Gemini 3.1 Pro 54.2%
  • **对比**:SWE-bench Verified 上 Fable 5 95.0% vs GPT-5.5 88.7% vs Opus 4.8 88.6% vs Gemini 3.1 Pro 80.6%——挤成一团
  • **看点**:Verified 饱和、感知不到差别,能分高下的只剩 Pro 这类多文件硬任务和真实工程场景
推荐理由:对开发者的直接用处是别再按『榜首』无脑选型。日常任务(写函数、补测试、小 bug)四家都在 88+ Verified,选便宜、生态顺手的那个,把省下的钱花在评测和护栏上更划算;只有当你真要啃多文件重构、跨模块联调这种硬活,Pro 榜上 Fable 5 的领先才值得为它多付。普通人能练的手艺,是拿这种同基准横向对比(而不是厂商自测表)当选型依据,并学会看清每个分数背后的『题集/运行档』口径——会看榜,本身就是一种省钱的能力。
#03
simonw.substack.com Opinion
NEW

Simon Willison

现在最该练的新技能是『设计 agentic loop』——编码 agent 之所以是台阶式的跃迁,是因为它能直接运行自己写的代码、纠错、翻查实现细节、跑实验;你的工作,是设计那个让它能自己闭环跑通的循环。
Willison 把这半年 agent 的质变落到一句可操作的话上:模型强不强只是底料,真正决定产出的,是你怎么给 agent 配一个能自我验证的循环——给它哪些工具、怎么让它跑测试拿到真实反馈、怎么喂上下文、在哪一步设人工审核关口。这和本周那篇《Verified Tool Calls》论文、和 GitHub 把 skills+MCP 送进代码审查,其实是同一件事的三个切面:可靠性不是等更强的模型,而是把循环设计好。
#AI Agent
另有 1 家信源报道
推荐理由:这对普通人是一条很实的成长路径:与其焦虑『模型会不会取代我』,不如把『设计 agentic loop』当成新的核心技能来练。具体做法——挑一个你每天重复的小流程(比如整理数据、写周报、处理某类工单),试着给 agent 配好工具+验证步骤+上下文,让它自己跑通一遍并能自查对错。你练的不是提示词,而是『把一件事拆成机器能闭环完成的结构』——这正是 FDE、agent 工程师岗位在反复点名的能力,也是最难被更强模型抹平的手艺。
#04
arXiv Paper
NEW

Verified Tool Calls:不换模型,只给工具调用加校验,就把 agent 在真实故障下的重复动作压下去

这篇 8 月的论文针对一个很现实的坑:真实环境里工具调用不是『要么成功要么失败』,而常常『做了一半就断』(non-atomic failure)——付款扣了但回执没回来、文件写了一半、API 超时但其实已生效。这种情况下 agent 盲目重试,就会重复下单、覆盖数据。作者给工具调用套了一层轻量包装:调用后先跑后置条件校验确认到底成没成、先验证再决定要不要重试、并用幂等键防止同一动作被执行两次。在注入这类半途故障的受控环境里,该方法显著减少了重复动作,同时任务成功率与基线相当。核心价值不在某个新模型,而在一套可以直接抄进你自己 agent 的工程模式。
证明长任务 agent 的可靠性瓶颈常在『工具调用一半失败、状态没对齐就盲目重试』,给调用加上后置校验、先验后重试、幂等键这套轻量包装,就能在不升级模型的前提下显著减少重复/破坏性动作、成功率不掉——可靠性是工程出来的。
#AI Agent
另有 1 家信源报道
展开详情
  • **问题**:真实工具调用会『做一半就断』,agent 盲目重试导致重复下单、覆盖数据等破坏性动作
  • **方法**:后置条件校验(确认到底成没成)+ 先验后重试 + 幂等键,一层轻量包装,不动底层模型
  • **结果**:受控注入故障下重复动作明显下降,任务成功率与基线持平——可靠性靠工程补,不靠换模型
推荐理由:对想做 agent 产品或副业的人,这篇是一份能直接抄的施工图:让 agent 上生产,卡住你的往往不是模型不够聪明,而是这类『半途故障』把动作重复执行、把数据搞脏。你不需要等更强的模型,把『每次动作后校验一次结果、加幂等键、验证通过才重试』这套模式加进去,可靠性就上一个台阶。谁能把这类工程护栏做扎实,谁的 agent 才敢接真实的、会花钱会改数据的活——这正是从 demo 到能收费的分水岭。
#05
lawnext.com Article
NEW

法律行业 AI 落地实测:个人使用率一年翻倍到 69%,一家律所把起草时间压到四分之一,但 54% 的所连规范都没有

法律这个一向保守的行业,AI 落地的分层特别清楚。个人层面已经很热:69% 法律从业者用 GenAI 处理工作,28% 每天用、31% 每周用几次,只有 19% 从不用;94% 的使用者报告有实打实的效率提升,38% 每周省 1–5 小时、25% 省 6 小时以上。真实案例更硬:Rupp Pfalzgraf 律所把 Lexis+ AI 卡进流程,18 个月后 86% 律师日常使用,起草复杂联邦法院动议只花过去四分之一的时间。但机构层面严重滞后——超过一半(54%)的所既没提供任何负责任使用培训、也没打算提供,规范与治理几乎空白。赢家的共性不是买了最强模型,而是把 AI 卡进了具体流程;输在起跑线的,是把它当禁忌或放养。
#行业应用
另有 2 家信源报道
展开详情
  • **采用**:法律从业者 GenAI 个人使用率一年翻倍到 69%,28% 每天用;94% 使用者报告效率提升,1/4 每周省 6 小时以上
  • **案例**:Rupp Pfalzgraf 把 Lexis+ AI 卡进流程,18 个月后 86% 律师日常使用,起草联邦法院动议只花 1/4 时间
  • **缝隙**:54% 律所没有任何使用规范与培训,且无计划——『会用但不会治理』是当下最大的落地风险与机会
推荐理由:对个人这里有两层机会。一是律师/法务本人:这份数据说明现在会把 AI 卡进自己起草、检索、尽调流程的人,实打实每周多出半天到一天产能,抢的是同行还在观望的时间差。二是懂流程的服务者:54% 的所连规范都没有,这道『采用快、治理慢』的缝隙,就是给中小律所做『AI 使用规范 + 流程集成 + 合规护栏』落地服务的切口——不需要你懂多深的模型,需要你懂这个行业的流程和红线。把某个垂直行业的『会用但不会治理』翻译成一套可交付的方案,就是当下最实在的现金流。
商机信号(加速):谁付钱:中小律所与企业法务团队——AI 采用已快但普遍缺使用规范、培训与合规护栏,愿为『落地+治理』付费 痛点:律师个人已在用 AI,但机构层面 54% 没有任何规范,既怕合规踩雷又不会把 AI 系统性卡进业务流程 切入点:面向某一类律所(如做移民/劳动/知产的中小所)提供『AI 使用规范模板 + 检索/起草流程集成 + 保密与引用核查护栏』的打包落地服务,先做透一个细分再复制
#06
getperspective.ai Article
NEW

FDE 组建与薪资段位:前沿实验室开到七位数,OpenAI 与 Anthropic 专设部门抢『能把模型落进客户业务的人』

延续 FDE(Forward Deployed Engineer,驻场交付工程师)这波岗位热,本周的新料是把『薪资段位』和『组织打法』说清楚了。薪酬跨度惊人:Palantir 中位数约 $215K,到前沿实验室(Anthropic、OpenAI)的 L4–L5 段位 $665K–$750K,principal 级破 $1M,且顶部包里股权占 55–70%。组织上,OpenAI 和 Anthropic 都在 2026 年 5 月照着 Palantir 的打法专门成立了 FDE 部门。这个岗位的稀缺在于它要求一个人同时握住三角:生产级工程能力、对 LLM 与系统的通透、以及面对客户的判断力——大多数候选人只强在一两个角,招聘方就死磕那个最难凑齐的第三角、绝不将就。
#FDE
另有 2 家信源报道
展开详情
  • **薪资**:Palantir 中位数约 $215K → 前沿实验室 L4–L5 $665K–$750K → principal 破 $1M,股权占顶部包 55–70%
  • **组织**:OpenAI 与 Anthropic 均于 2026 年 5 月照 Palantir 打法专设 FDE 部门,把交付当核心业务
  • **能力三角**:生产工程 + LLM/系统通透 + 面客判断力三者兼备,稀缺就稀缺在最难凑的第三角
推荐理由:对个人这是这两年最值得盯的职业信号之一:钱和岗位不在『训模型的人』那边,而在『能把模型能力落进客户真实业务』的交付层。你不必是顶尖研究员——把三角里你已有的那一两角(比如扎实的工程或某个行业的业务判断)补上缺的第三角,就能挤进这条七位数赛道。最实际的起步:找一个具体行业的具体流程,用 agent 真正跑通一个能交付的闭环,把『我能把 AI 落到业务里』变成可展示的作品,而不是简历上的形容词。
商机信号(加速):谁付钱:前沿 AI 实验室与做企业 AI 交付的公司——正大规模高薪抢 FDE,愿为『能把模型落进客户业务』的人开到七位数 痛点:会训模型/会调 API 的人过剩,能把能力稳稳交付进客户复杂遗留系统的人极度稀缺 切入点:个人或小团队以『AI 落地交付』接活:挑一个熟悉的行业,做几个把流程用 agent 跑通并能交付的真实案例,从外包/驻场式交付切入积累作品与口碑
#07
Product Hunt Product
NEW

Murmell:一块共享云端画布,让团队和多个编码 agent 在同一个仓库上并行不打架

Murmell 是本周登陆 Product Hunt 的一块浏览器里的共享云端画布:Claude Code、Codex、Kimi、OpenCode 等多个编码 agent 和你的团队在同一台云机、同一个仓库上一起干活。它解决的核心痛点是『多 agent 并行会互相覆盖』——agent 在动手写之前会先『认领』文件,所以人和多个 agent 能同时推进而不打架;你合上笔记本,云上的活继续跑,同房间可实时预览,产出最后落回 git。定位很清楚:不是又一个编码 agent,而是给『一堆 agent 一起干活』这件事补上协调与治理的地基。属于本周一波『为 agent 密集的编码流程做协调/治理』新品中的一个。
#DevTools#上线优惠:前两周免费 + $…
另有 1 家信源报道
展开详情
  • **解决**:多 agent 并行互相覆盖——agent 写前先认领文件,人和多 agent 同时推进不冲突
  • **形态**:浏览器共享云画布,支持 Claude Code/Codex/Kimi/OpenCode,合上笔记本云上继续跑、产出落回 git
  • **定位**:不是又一个 agent,而是给『多 agent 协作』补协调层——本周同类新品扎堆出现
推荐理由:这类产品的出现本身是个信号:行业已经从『找一个更强的 agent』过渡到『怎么同时管好一群 agent』——Karpathy 说他同时指挥 20 个 agent,普通人迟早也要面对这个场景。对个人的机会有两层:一是尽早养成『用多个 agent 并行干活』的工作方式,产能上限比单开一个高一截;二是留意这条『agent 协作/编排』新赛道里还空着的位置——协调、记忆、权限、审计这些地基还远没被填满,做垂类的协作层或治理工具,是个门槛不算高的切入点。
#08
Product Hunt Product
NEW

OpenMemory MCP:给 AI 工具装一块私有共享记忆,治『每个工具各自失忆』的老毛病

OpenMemory MCP 是一个私有记忆服务,通过 MCP 协议接进 Cursor、Claude Desktop、Windsurf 等兼容工具,解决一个被反复吐槽的痛点:再强的 AI 工具今天仍然『失忆』——你在一个工具里定的计划、讲过的偏好,换到另一个工具就没了。它把记忆做成一层跨工具、可自持(私有部署、数据自己掌握)的服务,让多个 agent/工具共享同一份上下文。这条线本周很热:MCP 正在成为 AI 生态的『USB-C』,多款新品都把『MCP 原生』当核心卖点,而记忆是其中最刚需的一块地基。评估时要看它的检索质量与隐私边界,别只被『统一记忆』的概念吸引。
#Infra#免费开源为主,私有部署可选
另有 1 家信源报道
展开详情
  • **痛点**:AI 工具集体失忆——一个工具里的计划/偏好换个工具就丢,跨工具上下文断层
  • **做法**:通过 MCP 给 Cursor/Claude Desktop/Windsurf 等接一层私有、可自持的共享记忆
  • **趋势**:MCP 正成为 AI 生态的 USB-C,本周多款新品主打『MCP 原生』,记忆是最刚需地基之一
推荐理由:对个人有两个用法。一是马上受益:如果你横跨多个 AI 工具干活,给它们接一层共享记忆,能省掉大量重复交代上下文的时间,让 agent 真正记住你的偏好和项目背景。二是看清赛道:记忆、连接器、权限这些『接口层地基』正在被快速标准化到 MCP 上,谁能在某个垂直场景(比如某行业的私有知识记忆、某团队的共享上下文)把 MCP 记忆做扎实、把隐私边界做可信,就卡住了一个高频刚需的位置——这比追最新模型更耐打。
8月5日 周三 · 10 条
今日趋势综述
OpenAI 用 Astra 花 2000 美元解开十道数十年悬案的同一周,真正在涨钱、涨岗、涨用户的却是把模型能力『管住、审住、交付住』的那一层——顶尖智能越强,能驾驭它的工程和交付手艺越值钱。
今天的信号:模型越聪明,管它的手艺越值钱

今天最抓眼球的是 OpenAI 8 月 1 日甩出的 Astra——它解开了十道搁置数十年的数学难题,包括自 1999 年就悬着的『非同域群是否存在』,还配上机器可验证的 Lean 4 证明,全部算力成本只花了约 2000 美元。这几乎是在宣告:最前沿的推理能力正在变得又强又便宜。但把今天其余几条线索并排看,你会发现钱和注意力并没有涌向『谁的模型更聪明』,而是涌向一个朴素得多的问题——怎么让这么强的模型在真实任务里不跑偏、能交付。

证据很集中:阿里 DreamX 团队的 LongHorizon-Harness 论文,靠一个『管理-执行-审计』的三角循环,把 Qwen 在长任务基准上从 51.8% 拉到 80.7%,方法全在『把已验证的状态放到执行之外、独立审一遍』,而不是换更强的模型;本周 GitHub 上真正在冲榜的三个仓库——腾讯云的 Agent 记忆中枢、Agent-Reach 的统一信息触达、Orca 的并行 agent 工作台——清一色是『让 agent 记得住、看得见、管得动』的基础设施;Anthropic 把交付制度化成了 Services Track,合作伙伴的段位直接绑定『线上跑着的生产部署』,EPAM 一口气要培养 250 名驻场『黑带』FDE;连一个人做的 Backlinker AI,靠把 AI 外联做成『保证每月拿到几条高质量外链』的确定性服务,就做到了五位数月收入。

对个人的行动因此很清楚:别再把自己训练成『会调最强 API 的人』——那条优势正在被 2000 美元的算力和随处可得的开源权重迅速填平。把时间押到三件填不平的手艺上:一是评测与审计(会设计基准、能在模型更新后抓住回归,这正是 FDE 岗位最被反复点名的差异化能力,也是今天那篇 shortcut hacking 论文的警示——37% 的『正确答案』其实是蒙对的);二是长任务编排(把一个业务流程拆成 agent 能一步步跑完、能被独立审核验收的结构);三是把不确定的 AI 能力包装成对某个付费人群『确定的结果』。模型是越来越聪明的水,会接管道、能验水质、知道往哪个厨房接的人,才拿走增值。

今日新增 8
#01
openai.com Article
NEW

OpenAI Astra 花 2000 美元解开十道数十年数学悬案,附机器可验 Lean 4 证明

OpenAI 8 月 1 日发了一份 249 页手稿《数学与理论计算机科学的十项进展》,宣布其下一代模型 Astra 的内部版本解开了十道『至少十年无人推进』的难题。最重磅的是首次显式构造出『非同域群』(non-sofic group)——这个问题自 Gromov 1999 年提出概念以来悬了 27 年。此外 Astra 还证伪了 Connes 关于冯诺依曼代数的刚性猜想、证明了 Ehrhart 体积猜想、解决了 Erdős 名录里的三道题(含第 183 号多色 Ramsey 数)、把 1978 年以来高维球堆积密度上界第一次往前推了一步。关键在于:每个结果都配了机器可验证的 Lean 4 证明证书、放在 GitHub 上任人复核;而找出全部十个解的算力成本,按 Sol API 价算只约 2000 美元。注意这是厂商发布、用未公开发售的内部模型跑出的结果,Lean 证明可独立验证是最硬的一环,但『Astra 有多强』仍要等正式发布与第三方复测。
#LLM/Model
另有 3 家信源报道
展开详情
  • **硬突破**:首次显式构造非同域群(Gromov 1999 悬案),外加证伪 Connes 刚性猜想、解 Erdős 三题、球堆积上界近半世纪来首次改进
  • **可验证**:不是『相信我』,而是每个结果都带机器可验的 Lean 4 证明证书、公开在 GitHub 上任人复核
  • **便宜到反直觉**:找出全部十个解总算力成本按 Sol API 价约 2000 美元——前沿推理能力正在同时变强又变便宜
推荐理由:对普通人最该读到的一层不是『AI 会做数学题了』,而是『强推理 + 可机器验证』这套组合正在成型:模型负责大胆猜、形式化系统负责严格验。这意味着以后在任何『答案对不对可以被机械检查』的领域(代码、合约条款、财务勾稽、工程约束),你都能让 AI 放开跑、再用验证器兜底。行动上:与其惊叹分数,不如现在就练一手『把你的问题变成可自动验收的形式』的能力——谁能把业务判题标准写成机器能跑的检查,谁就能安全地把最强模型用到满格。
#02
benchlm.ai Article
NEW

ARC-AGI-2 榜单(8/4):GPT-5.6 Sol 92.5% 领先,Opus 5 与 GPT-5.5 咬在身后

ARC-AGI-2 是 ARC Prize 出的抽象推理基准,专门考『见所未见的规律归纳』,比刷题型编码榜更难被背题污染。截至 8 月 4 日的这版榜单里,OpenAI 的 GPT-5.6 Sol 以 92.5% 登顶,Anthropic 的 Claude Opus 5(Max 推理档、半私有集)拿 90.4% 紧咬其后,上一代 GPT-5.5 则是 85%。三者之间的差距——顶尖两家只差 2.1 分——说明在这条更硬的推理基准上,前沿模型也已经挤在很小的区间里。要留意口径:Opus 5 的 90.4% 是 ARC-AGI-2 半私有集、开到 Max 推理档跑出来的,不同档位/不同子集分数会变,横向比时要对齐条件。
#评测
另有 1 家信源报道
展开详情
  • **对比**:GPT-5.6 Sol 92.5% vs Claude Opus 5 90.4% vs GPT-5.5 85%(ARC-AGI-2,截至 8/4,共约 20 个模型上榜)
  • **看点**:顶尖两家只差 2.1 分,这条以『抗背题』著称的抽象推理榜也在往饱和挤
  • **别被单分误导**:Opus 5 的 90.4% 是半私有集 + Max 推理档口径,换子集/换推理档分数会动,横向比先对齐条件
推荐理由:对开发者的直接用处是选型别只认榜首:92.5% 与 90.4% 在真实产品里几乎感知不到差别,但两家的价格、延迟、可私有化程度、工具调用生态差得多。真要抠推理天花板(复杂规划、少样本归纳)就上 Sol 或 Opus 5 的高推理档;大多数日常任务,便宜一档的模型开中等推理就够,把省下的预算花在评测和护栏上更划算。普通人能练的手艺,是拿这类第三方抗污染榜(而不是厂商自测表)当选型依据,并学会看清每个分数背后的『子集/推理档』口径。
#03
arXiv Paper
NEW

LongHorizon-Harness:一个『管理-执行-审计』循环,把长任务通过率从 51.8% 拉到 80.7%

阿里 DreamX 团队这篇 8 月初的论文,针对 agent 跑长任务时越跑越偏、忘掉目标的老毛病,提出一个 Manage-Execute-Audit(管理-执行-审计)三角循环:Manager 只负责守住原始目标、记录『已验证的进度』和下一步;Executor 每一轮都拿全新上下文、只专注当前这一小步;Auditor 独立去查文件、接口、日志、测试,判断这步到底做没做对。核心思想是把『可信的任务状态』保存在执行过程之外,不让它被一次次对话污染。效果很硬:Qwen 3.7-Plus 在 WeaveBench(114 个任务)上从 51.8% 提到 80.7%,Terminal-Bench 2.1 从 69.7% 到 77.2%,OSWorld 2.0 二值完成率从 2.8% 翻到 8.3%;连 Claude Opus 4.7 在 OSWorld 2.0 子集上也从 20.0% 提到 34.3%。代码已开源。
证明长任务 agent 的瓶颈不在模型强弱,而在『状态会漂移』——把已验证的任务状态放到执行之外、由独立审计者复核,就能大幅提通过率
#AI Agent
另有 1 家信源报道
展开详情
  • **方法**:Manager 守目标+已验证状态、Executor 每轮清空上下文只做一步、Auditor 独立查文件/日志/测试——把可信状态放到执行之外
  • **数据**:Qwen 3.7-Plus 在 WeaveBench 51.8%→80.7%、Terminal-Bench 2.1 69.7%→77.2%、OSWorld 2.0 2.8%→8.3%
  • **通用**:套在 Claude Opus 4.7 上,OSWorld 2.0 子集也从 20.0% 提到 34.3%——是框架增益而非换模型
推荐理由:这篇对个人开发者是可以直接抄的工程模板:你不需要最强的模型,也不用等更聪明的模型,只要把长流程拆成『一个守目标的管理者 + 每步清空重来的执行者 + 一个独立审计者』,就能显著降低 agent 跑偏。尤其那个 Auditor——独立、不带执行历史地复核每一步,正是把 demo 级 agent 变成能验收、能交付的关键。想在 AI 落地上有手艺的人,值得把这套三角循环变成自己的默认架构,而不是把所有希望寄托在一个越堆越长的 prompt 上。
#04
GitHub Repo
★ 13.5k NEW

TencentCloud/TencentDB-Agent-Memory

腾讯云开源的『团队级 Agent 记忆中枢』,本周在 GitHub 冲榜(星数约 1.35 万、这几天日增上千)。它把对话、文档、代码沉淀成四类可复用的记忆资产——Chat Memory(对话记忆)、Skill(技能)、LLM-Wiki(知识)、Code-Graph(代码图),并用 ACL 权限治理,让这些记忆能跨 agent、跨框架共享和调用。短期记忆用 Mermaid 符号压缩,长期记忆分层管理。官方给的一个数据是:搭配 OpenClaw 使用时 token 降 61%、通过率升 51%(厂商口径,建议自测)。定位不是又一个向量库,而是让一个团队/一群 agent 共享同一套『可治理的记忆』。星数为 GitHub 页面快照,增速为近期趋势估计。
#AI Agent#Python
另有 1 家信源报道
展开详情

周增长:本周 GitHub 冲榜,近日日增约千星,是团队级 agent 记忆方向的当红项目

  • **四类记忆资产**:把对话/文档/代码沉淀成 Chat Memory、Skill、LLM-Wiki、Code-Graph,还带 ACL 权限治理
  • **跨 agent 共享**:记忆不再锁在单个会话里,而是团队级、跨框架复用——这是从个人 agent 走向团队 agent 的关键件
  • **厂商数据**:配 OpenClaw 称 token 降 61%、通过率升 51%(自测口径,迁移前请拿自己任务复测)
推荐理由:记忆正在成为 agent 时代的新基础设施品类——去重清单里这几天已经出现过好几个记忆/上下文项目,说明这是条正在拥挤的赛道。对个人的机会有两层:一是应用层,学会给自己的 agent 接一套结构化记忆(而不是每次从零喂上下文),能立刻拉开可靠性差距;二是这类开源件大多来自大厂、面向团队治理,独立开发者反而可以在『个人/小团队够用的轻量记忆方案』这个缝隙里做产品。先把『agent 记忆怎么组织、怎么权限隔离』搞懂,是接下来做任何多 agent 系统的必修课。
#07
anthropic.com Article
NEW

Anthropic 把 AI 交付制度化:Services Track 用『线上生产部署』定合作伙伴段位,EPAM 要养 250 名驻场黑带

Anthropic 把企业交付这件事做成了正式制度——Services Track + Partner Hub,分 Select / Preferred / Global Premier 三档,段位直接绑『成果』:合作伙伴的等级由手上跑着的『线上生产部署』数量决定,维持不住活跃的生产客户就会掉档。背后是 3 月那笔 1 亿美元合作承诺,晋级评审每年 1 月 1 日、7 月 1 日各一次。配套的落地力量也在铺:EPAM 与 Anthropic 联手要培养 1 万名 Claude 认证架构师,其中 250 名是驻场的『黑带』FDE,目标 Q3 末先认证 5000 人。方法论主线始终是『评测工程』——证明系统真能用、并在模型更新后抓住回归,被反复点名为 FDE 最核心的差异化能力。业内引用的薪资带在 30 万到 120 万美元以上。
#FDE
另有 2 家信源报道
展开详情
  • **成果绑定**:Services Track 段位由『线上跑着的生产部署』决定,掉了活跃生产客户就掉档——把交付而非签单变成硬指标
  • **规模化**:EPAM+Anthropic 要养 1 万名 Claude 认证架构师,含 250 名驻场黑带 FDE,Q3 末先认 5000 人
  • **核心手艺**:评测工程(证明系统能用 + 模型更新后抓回归)被反复点名为 FDE 最关键差异化,薪资带 30 万–120 万美元+
推荐理由:这条把 FDE 从『某几家实验室的打法』变成了『整个生态的制度』——当交付能力被明码标价、被写进合作伙伴段位规则,说明『把模型落进客户业务』正式成了一门独立、稀缺、高薪的手艺。对个人最实的机会:不必进大厂也能吃这波,中小企业遍地是『买了 AI 却落不了地』的 50 万美元部署缺口。现在就补两件事——一是评测/审计能力(会设计验收标准、能在模型换代后守住质量),二是端到端交付经验(哪怕先在一个小客户身上把一个 AI 流程从 0 跑到上线验收)。会交付的人,正在从『加分项』变成企业抢着要的入场券。
商机信号(加速):谁付钱:有真实业务、买了 AI 却落不了地的中大型企业,以及需要驻场交付能力的系统集成商 痛点:模型能力和业务系统之间存在『最后一公里』部署缺口(被称作 50 万美元 gap):光有 API 接不进遗留系统、上不了生产、模型一更新质量就漂 切入点:个人/小团队先在一个具体客户的单一流程上做端到端交付(含验收标准与回归监控),把『评测工程 + 落地交付』做成可复用的方法论和案例,再顺着 Anthropic/EPAM 这类认证与合作网络接活
#08
backlinker.ai Product 直接可用
NEW

Backlinker AI:一个人把 AI 外联做成『保证每月拿到高质量外链』的确定性服务,做到五位数月收入

Backlinker AI 是独立开发者 Bennett Heyn 一个人做的 SEO 工具,主打用 AI 自动做『记者/媒体外联』拿编辑外链:它接进 Featured.com、HelpAB2BWriter 这类记者提问平台,自动扫描相关问题、起草并发送应答式 pitch,帮客户赢得高权重编辑外链。公开的成长故事被多个独立营收追踪站佐证——Starter Story 记为『13 个月做到 $20K MRR』,一年累计约 $22.7 万营收、约 $16 万 ARR、同比增长 187%、churn 约 10%;不同追踪站近期口径在 $12–20K MRR 区间(也有一个 Flippa 挂牌页显示 $12.6K MRR)。卖点是把外链这件贵且不确定的活,做成『每月保证交付 3+ 条 DR30+ 外链、价格约为传统机构十分之一』的确定性服务,代运营档约 $300/月。创始人一人运营、可与全职工作并行。
#小微现金流#SaaS 订阅 + Done…
另有 3 家信源报道
展开详情
  • **确定性交付**:不卖『我帮你试试』,卖『每月保证 3+ 条 DR30+ 外链』——把不确定的 AI 能力包装成客户能验收的结果
  • **数字**:多个独立追踪站佐证 $12–20K MRR 区间,一年约 $22.7 万营收、$16 万 ARR、同比 +187%、一人运营
  • **打法**:AI 自动应答记者提问平台拿编辑外链,价格约为传统外链机构的十分之一,靠成本结构差打出空间
推荐理由:对想挣现金流的普通人,这是一个可抄的范式:选一个『结果可量化、客户愿持续付费、但人工做又贵又烦』的窄活(这里是外链),用 AI 把成本打到十分之一,再用『保证交付 X』的确定性话术卖出去。关键不在技术多炫,而在两点——一是找准一个有明确付费意愿、结果能被验收的细分需求;二是敢于把服务做成『保证结果』而非『按小时』,这样定价权和复购都在你手里。SEO 只是其中一个口子,法务合规、招聘外联、评论回复、客服工单,凡是『重复+可量化+现在靠人工很贵』的活,都能套这个模型。
My Take:评分(5=最优):最快成交 4 / 最低成本 4 / 可复制 4 / 风险安全度 3。把『不确定的 AI 外联』包装成『保证交付的确定结果』,一人可跑、复购稳,风险主要在外链平台政策与 SEO 规则变动。
商机信号(加速):谁付钱:需要 SEO 外链但请不起传统外链机构的中小企业主、SaaS 创始人、独立站/内容站运营者 痛点:高质量编辑外链又贵又慢、传统机构报价高且结果不透明,自己做又极其耗时且难保证权重 切入点:个人可先用 AI 自动化『应答式记者外联』这一个环节,做成『每月保证 N 条 DRxx+ 外链』的固定套餐代运营,先服务 5–10 个细分行业客户跑通确定性交付,再产品化成自助 SaaS
#09
agentman.ai Article
NEW

Agent Skills 补上团队层:共享、只用不改、版本回滚、审计治理,定价从免费起

Agent Skills 生态本周的关键动向不是又出了一个新技能,而是补上了『团队协作与治理』这一层。一次更新里一口气上了:像 Google Docs 那样共享技能、『只用不改』的访问权限(保护创作者 IP,别人能调用但看不到/改不了源)、2.0 版本历史 + 一键回滚、治理与审计日志、把在 Claude 里现做的技能批量导入,以及一个从免费起步的新定价。配套地,Claude Managed Agents 也更新到单会话最多可挂 500 个技能,并加了逐 agent 的推理档位、更多 webhook 事件类型等。合起来看,Skills 正从『个人攒一堆 md 文件』升级成『团队可共享、可治理、可追溯、能商业化』的资产层。
#Skills#元技能
另有 2 家信源报道
展开详情
  • **协作**:像 Google Docs 一样共享技能,配『只用不改』权限——别人能调用但保护你的创作者 IP
  • **治理**:版本历史 2.0 + 一键回滚 + 审计日志,技能第一次有了企业级的可追溯与回退能力
  • **规模**:Managed Agents 单会话最多挂 500 个技能,配逐 agent 推理档与更多 webhook 事件
推荐理由:去重清单里这一周反复出现 skills 相关条目,说明它正从爱好者玩具变成有治理、有定价、能卖钱的资产层——这对个人是明确的窗口期。两个机会:一是做『会被反复调用的高质量单一技能』,趁市场还早、创作者分成还高(多数独立技能市场给创作者约 90%)时占位;二是做『元技能』——管理、评估、组织别人技能的技能,随着一个团队挂几百个技能,怎么筛选、怎么保证质量本身就成了新需求。现在该练的不是多囤技能,而是学会把一个技能做到『单一职责、行为可预测、可被治理』,这正是从玩具走向资产的分界线。
商机信号(萌芽):谁付钱:需要给团队统一 agent 能力的中小团队,以及愿意为高质量、免维护技能付费/订阅的 Claude 重度用户 痛点:技能散在各人手里、质量参差、无法共享治理与回滚;团队想统一 agent 行为却缺可信、可审计的技能来源 切入点:个人可趁创作者分成还高(约 90%)时,做少而精的单一职责技能占位某个垂直场景,或做『元技能』帮团队筛选/评估/组织已有技能
#10
catalyst.nejm.org Article
NEW

医疗 AI 落地实测:环境式 AI 病历跨 7260 名医生、250 万次问诊铺开,日省文书 13–16 分钟、倦怠降 31%

『环境式 AI 病历』(ambient AI scribe,医生看诊时 AI 在旁边自动听写、生成病历)是目前医疗里落地最扎实的一类 AI。NEJM Catalyst 复盘 Permanente 医疗集团一年经验:这套系统已铺到 7260 名医生、覆盖约 257 万次问诊;UCSF 在 120 万次门诊里达到 44.6% 的采用率。效果诚实——多中心研究显示每 8 小时看诊约省 16 分钟、每周多看约 0.49 个号;JAMA 一项研究显示医生每天省 13–16 分钟 EHR 文书、自报倦怠下降 31%,一年累计省下约 1.57 万小时文书时间。赢家的共同点不是买了最强模型,而是把 AI 嵌进了医生本来就要走的看诊-记录流程里,几乎不改工作习惯。注意:最硬的数字多来自 2026 上半年发表的研究,是真实规模化部署而非本周新闻;ROI 类聚合数字(如每投 1 美元回 3.2 美元)建议回溯一手来源再引用。
#行业应用
另有 2 家信源报道
展开详情
  • **规模**:Permanente 铺到 7260 名医生、约 257 万次问诊;UCSF 120 万次门诊达 44.6% 采用率——是真规模不是试点
  • **效果诚实**:每 8 小时看诊省约 16 分钟、每天省 13–16 分钟文书、自报倦怠降 31%,一年累计省约 1.57 万小时
  • **赢在嵌入**:不改医生看诊习惯、把 AI 塞进本来就要走的『看诊-记录』流程,而非要求医生学新系统
推荐理由:医疗 AI 这条线给普通人的最大启示是『别追最炫的诊断 AI,去做最枯燥的流程嵌入』。真正跑出规模和 ROI 的,是把 AI 卡进一个人人都嫌烦、又天天必做的环节(写病历),而且做到用户几乎无感——不用学新东西、不改习惯。这个模式可迁移到任何行业:找一个专业人士每天被迫做、又极其耗时的记录/整理/合规动作,用 AI 在旁边默默替他做掉,价值立刻可感。对想切医疗或其他强监管行业的人,机会也很清楚:难点从来不在模型,而在合规、隐私和把 AI 无缝塞进既有工作流的那份耐心手艺。
仍在热榜 2
Repo Panniantong/Agent-Reach 在榜 4d 本周在 X 上刷屏、GitHub 星数冲到约 6.6 万的一个 CLI/MCP 服务器,主打给 AI agent 装上『… DevTools
Repo stablyai/orca 在榜 3d Stably AI(YC 背景)开源的 ADE(Agent Development Environment,agent … DevTools
8月4日 周二 · 8 条
今日趋势综述
开源权重逼近前沿、编码榜逼近饱和的同一周,钱和岗位却在往『把模型落进具体业务』这头涌——模型不再是护城河,交付才是。
今天的信号:模型这条护城河正在被填平

把今天几条线索并排看,一个方向很清楚:顶尖模型的『独家优势』正在快速缩水。DeepSeek 上周五甩出 MIT 许可、13B 激活就跑赢自家旗舰的 V4-Flash-0731;在专门防数据污染的 SWE-rebench 上,开源的 GLM-5、GLM-5.1 已经咬到闭源 Opus 4.6 身后 2.6 分以内;xAI 把整套 Grok Build 编码 agent 也开源了。三件事指向同一句话——『用得上的强模型』正在变成随处可取、还能本地跑的公共品,光靠『我接了最强的 API』已经越来越不值钱。

既然模型这层被填平,价值就顺着水管往下游流。今天另外三条恰好是下游:企业为『能把 AI 塞进遗留系统、上线第一天就交东西』的 Forward Deployed Engineer 开出七位数薪水,1000 份岗位分析显示它成了增长最快的技术岗之一;零售业把 AI 卡进补货、定价、推荐的具体环节,个性化点击率 +24%、动态定价毛利 +3–6% 都是真金白银;单人公司 Zigpoll 靠死磕一个细分人群把 MRR 做到 $125k。它们的共同点不是『用了更强的模型』,而是『把某个模型能力精准嵌进了一个愿意付钱的工作流』。

对个人的行动很直接:别再把时间花在追榜首、比谁的模型分高上——那条优势正在归零。把时间投到三件填不平的事上:一是选型判断力(同一基准下便宜/开源模型什么场景够用,见今天的评测),二是交付手艺(把一个具体业务流程拆成 agent 能跑完、能验收的步骤,这正是 FDE 和垂直落地的核心),三是找准一个窄到你能吃透的付费人群。模型越来越像自来水,会接水管、知道往哪个厨房接的人,才拿走增值。

#01
Hugging Face Product
NEW

DeepSeek-V4-Flash-0731:13B 激活跑赢自家旗舰,MIT 权重可商用

DeepSeek 7 月 31 日放出 V4-Flash 的正式版 0731,架构和体量不变(284B 总参、约 13B 激活的 MoE),提升全靠重新做的后训练。官方口径是:这颗只激活 13B 的小号,在它们公布的九项 agentic 基准上全面超过激活 49B 的 V4-Pro 预览版——用更低的运行成本换到更强的表现。许可证是 MIT、不设门槛,意味着企业可以直接拉去做私有化、商用部署,不用等授权。注意官方分数(如 DeepSWE 54.4、Terminal-Bench 2.1 上 82.7)都是厂商自测、跑在未公开的 harness 上,迁移前建议拿自己的真实任务在 API 和权重上复测,别把官方表当转移保证。
#LLM/Model#开源权重,MIT 许可、un…
另有 2 家信源报道
展开详情
  • **反直觉**:激活参数从 49B 砍到 13B,九项 agentic 基准反而全面反超自家 V4-Pro 预览版——赢在后训练不在堆参数
  • **可商用**:MIT 许可、ungated,权重能直接私有化部署,企业不用等授权就能落到自己机房
  • **别照单全收**:DeepSWE 54.4、Terminal-Bench 2.1 82.7 均为厂商自测、harness 未公开,迁移前务必用自己的任务复测
推荐理由:对个人最实在的机会是:一颗 MIT、13B 激活的强模型,意味着你现在能用一张消费级/单卡的预算,把过去要付 API 的能力搬到本地跑起来。这对做隐私敏感场景(法律、医疗、企业内数据)的独立开发者尤其关键——你可以承诺『数据不出内网』,这是套壳 API 的人给不了的卖点。行动上:与其纠结哪个闭源模型分高,不如练一手『开源权重私有化部署 + 针对自己业务微调/提示工程』的活,这正在从加分项变成很多 B 端项目的入场券。
#02
benchlm.ai Article
NEW

SWE-rebench 防污染榜:开源 GLM-5 咬到闭源 Opus 4.6 身后 2.6 分内

SWE-rebench 是一条『滚动更新、专防数据污染』的编码基准——它不断从新出现的真实 GitHub issue 里取题,避免模型在训练里见过考题。截至 8 月 2 日的这版榜单里,闭源的 Claude Opus 4.6 以 65.3% 领跑,但紧跟其后的是两个开源权重模型:GLM-5 拿 62.8%、GLM-5.1 拿 62.7%,前三挤在 2.6 分之内。换句话说,在一条『考题模型没背过』的干净基准上,开源模型已经贴到了闭源第一的身后。榜单同时也透出饱和味道——前排差距被压得很小。
#评测
另有 2 家信源报道
展开详情
  • **对比**:Opus 4.6 65.3% vs GLM-5 62.8% vs GLM-5.1 62.7%(SWE-rebench,防污染滚动榜,截至 8/2)
  • **看点**:领先的是闭源,但咬在身后 2.6 分内的两个全是开源权重——干净基准上开源已逼近前沿
  • **信号**:前三挤在 2.6 分内,编码榜正逼近饱和,『榜首模型』的边际优势越来越薄
推荐理由:对开发者的选型建议很具体:如果你的活是『改真实代码库的 issue』这类编码/agentic 任务,现在没必要为那多出来的 2.6 分去锁死最贵的闭源 API——GLM-5 这类开源权重在防污染榜上已经够用,还能本地跑、可商用、成本可控,隐私敏感或量大的场景优先它。把闭源第一留给真正吃那点精度差的关键路径。会看『同一条基准下便宜/开源选项什么场景够用』,比记住谁是榜首更省钱也更值钱。
#03
getperspective.ai Article
NEW

1000 份岗位拆出来的 FDE 真相:增长最快的技术岗之一,前沿实验室开到七位数

这篇拆了 1000 份岗位的分析给 Forward Deployed Engineer(驻场交付工程师)画了张清晰的市场图:它被 KORE1 的 2026 招聘报告点名为企业 AI 里增长最快的三个技术岗之一;连 Google 都在为『把 AI 嵌进 Fortune 500 工作流』大规模招 FDE,说明这个岗位已经从纯前沿实验室扩散到大厂主流。薪酬上,种子期全包约 $200K,到 C 轮冲到 $450K–$550K+;在 Anthropic、OpenAI 这类前沿实验室,L4–L5 区间总包 $665K–$750K,principal 级破 $1M。招聘方现在明确筛的不再只是写代码,而是『需求挖掘 + 产品化』——能把一个客户的模糊痛点变成上线系统。
#FDE
另有 1 家信源报道
展开详情
  • **热度**:被 KORE1 列为企业 AI 里增长最快的三个技术岗之一,连 Google 都在大规模招 FDE 铺进 Fortune 500
  • **薪酬**:种子期约 $200K 全包 → C 轮 $450K–$550K+;前沿实验室 L4–L5 总包 $665K–$750K,principal 破 $1M
  • **筛的能力**:不再只看写代码,而看『需求挖掘 + 产品化』——把客户模糊痛点变成第一天就能交付的上线系统
推荐理由:这是给工程师的明牌转型信号:当模型能力变成公共品,市场最缺、给钱最狠的是能『翻越集成墙』的人——把模型塞进客户遗留系统、和真实业务对齐、上线就交东西。你不必进大厂才能吃这波:把你现有的行业知识 + 拆流程 + 落地交付的能力打包,就是中小企业眼里的『AI 落地工程师』。想入场,练三件事——跟非技术客户做需求挖掘、把模糊需求切成能验收的里程碑、用最短路径交付第一个能用的版本。这套手艺比刷题涨分抗贬值得多。
商机信号(加速):谁付钱:从前沿实验室(Anthropic/OpenAI)到大厂(Google)再到融了钱的 AI 创业公司,都在为『能把 AI 落进客户业务』的人开高薪;付费与增长信号明确 痛点:模型很强但卡在『demo 很惊艳、塞不进客户遗留系统』这道集成墙上,pilot 停在原地无法变成七位数合同 切入点:个人从『会调模型』转向『会交付』:挑一个你懂的行业,练需求挖掘+流程拆解+最短路径上线,先接中小企业的 AI 落地驻场活,用交付案例攒口碑再往上走
#04
mindit.io Article
NEW

零售 AI 落地实测:赢家不是买了最强模型,而是把 AI 卡进补货/定价/推荐每个环节

这份 2026 零售 AI 的 ROI 基准把『AI 到底省了多少钱』拆到具体环节,全是能对账的数字:个性化推荐让点击率 +24%、客单价 +18%(对比通用推荐);动态定价在铺开的品类上带来 3–6% 毛利提升,中型零售商增收 €1.8–4.5M;AI 需求预测把库存持有成本砍 20–30%、预测误差最多减半;一家零售商 12 个月内自愿流失率降 22%(约留住 18 万客户)。共同规律和前几天的法律、保险、制造一样——效果不来自『买了最强模型』,而来自把 AI 精准嵌进补货、定价、推荐、留存这些具体作业流的节拍里。NVIDIA 2026 零售调查里 54% 的零售商报告 AI 直接提升了员工生产力。
#行业应用
另有 2 家信源报道
展开详情
  • **个性化**:推荐点击率 +24%、客单价 +18%(对比通用推荐)——嵌进商详页/推荐位就能对账
  • **定价**:动态定价在铺开品类上毛利 +3–6%,中型零售商增收 €1.8–4.5M;库存持有成本靠 AI 预测砍 20–30%
  • **留存**:一家零售商 12 个月自愿流失率 -22%,约留住 18 万客户;NVIDIA 调查 54% 零售商称 AI 提升了员工生产力
推荐理由:给想切零售 AI 的个人/小团队的提示:别做『又一个零售大模型』,去认领一个能对账的具体环节。上面每个数字背后都是一条可外包的活——帮小商家配个性化推荐位、搭动态定价规则、做补货预测。你需要的不是最强模型,而是懂零售作业流 + 能把 AI 卡进那一步 + 用店家能看懂的指标(客单价、缺货率、毛利)验收。ROI 越具体,越好卖,也越难被通用大厂替掉。
#05
indiehackers.com Article 值得关注
NEW

Zigpoll:一个人、无融资、无销售团队,靠死磕一个细分人群做到 $125k MRR

Zigpoll 是个做问卷/客户反馈的工具,创始人一个人扛:没有联合创始人、没融资、没销售团队。它 2026 年开局约 $1.03M ARR,到 6 月做到约 $125k MRR(约 $1.5M 年化)。它给独立开发者的核心一课不是『用了什么 AI 神器』,而是选对细分人群后『往死里聚焦』:产品最早只服务电商,验证跑通后才扩到 SaaS 团队;不是去追下一个热点,而是把一个已经在付钱、痛点明确的窄人群吃透。这条路径和本周其他现金流案例呼应——赢家赢在窄和专注,不是广。
#小微现金流
另有 1 家信源报道
展开详情
  • **数字**:单人、无融资、无销售,2026 开局约 $1.03M ARR,6 月约 $125k MRR(≈$1.5M 年化)
  • **打法**:先只服务电商这一个窄人群,跑通后再扩到 SaaS 团队——聚焦细分而非追热点
  • **反常识**:护城河不是 AI 功能,而是『把一个已在付钱的窄人群吃透』——窄和专注才是单人能扛得住的壁垒
推荐理由:对想挣现金流的普通人,这是最实在的模板:先找一个已经在为某件事付钱、但被服务得很差的窄人群(Zigpoll 是电商问卷),用 AI 把交付成本压到一个人能扛,再死磕这一群人别乱扩。别一上来就想做『通用 AI 平台』——你没有团队去覆盖广度,但你能在一个窄口子里比大厂更懂客户、响应更快。先窄到能吃透,赚到钱、验证透了再谈扩张。
My Take:评分(5=最优):最快成交 3 / 最低成本 4 / 可复制 4 / 风险安全度 4。单人聚焦细分人群做工具型 SaaS,慢热但复制性强、风险低。
商机信号(加速):谁付钱:有客户反馈/问卷需求的电商与 SaaS 团队,已在为这类轻量工具持续付费(Zigpoll 年化约 $1.5M 验证了付费意愿) 痛点:通用问卷工具不贴细分场景、集成和分析都要自己拼;小团队想要开箱即用、能嵌进现有流程的轻方案 切入点:挑一个你熟的窄行业(如某类电商/某类 SaaS),做一个只服务它、开箱即用的反馈/数据小工具,用 AI 把交付和支持压到单人可扛,先吃透再扩
#06
arXiv Paper
NEW

Self-Evolving World Models for LLM Agent Planning

这篇论文提出让 LLM agent 自己演化出一个『世界模型』——即对环境如何随动作变化的内部预测——并用它来做长程规划,且尽量少依赖人工监督。评估方式是看世界模型对未来观测的预测有多贴合真实,以及它能否带来下游规划能力的提升,测试环境包括 Word2World、ALFWorld、ScienceWorld 这类需要多步决策的任务场景。它属于当下一个明显在升温的研究方向:不只让模型『会回答』,而是让 agent 通过自建、自更新的环境模型学会在长任务里预判后果、自我纠偏。
让 agent 靠自我演化的『世界模型』做长程规划,减少对人工监督的依赖,指向更能自己在环境里试错、纠偏的智能体
#AI Agent
展开详情
  • **核心**:让 agent 自己演化出预测『动作→环境如何变』的世界模型,用来支撑长程规划,少靠人工监督
  • **验证**:既看世界模型对未来观测的预测准不准,也看它能否实打实提升下游规划表现
  • **场景**:在 Word2World、ALFWorld、ScienceWorld 等多步决策环境上评估——瞄准长任务而非单轮问答
推荐理由:对普通人这是一个『往哪押注学习方向』的信号:agent 的下一个能力台阶不在『答得更准』,而在『能不能自己在环境里试错、预判、纠偏地把长任务跑完』。这意味着未来值钱的活会从『写好一个提示词』转向『给 agent 设计好它要面对的环境、反馈和验收信号』。想提前卡位的人,可以开始留意 agent 的环境/反馈设计(怎么给 agent 一个能自我改进的闭环),而不只是提示工程本身。
#07
x.ai Article
NEW

xAI 把 Grok Build 编码 agent 整套开源:可本地编译、指向自己的推理跑

xAI 把它的终端编码 agent Grok Build 整套源码放上了 GitHub,Apache 2.0 许可,等于把 agent loop(上下文组装 + 模型响应解析)、代码工具(读/改/搜/执行命令)、终端 UI(输入处理 + diff 审阅)和扩展框架全部亮出来给人审计和魔改。更关键的是它现在能完全 local-first 跑:自己编译、把它指向你本地的推理服务、所有配置走 config.toml——不必依赖 xAI 云端。它和本周 DeepSeek、GLM 的开源权重是同一股风:编码 agent 这层的 harness 也在从闭源黑盒变成可自托管的公共件。
#DevTools
另有 2 家信源报道
展开详情
  • **开源范围**:agent loop、代码工具、终端 UI、扩展框架全套源码上 GitHub,Apache 2.0,可审计可魔改
  • **local-first**:能自己编译、指向本地推理、配置走 config.toml,不必依赖 xAI 云端
  • **同一股风**:叠加本周 DeepSeek/GLM 开源权重——编码 agent 的 harness 也在从闭源黑盒变公共件
推荐理由:对开发者,这是一份免费的『生产级 agent 是怎么搭的』教材:与其从零猜 agent 的上下文怎么组、工具怎么调、diff 怎么审,不如直接读 Grok Build 这类开源 harness 的源码,把它的结构抄进你自己的项目。会读、会改开源 agent harness,正在成为比『会用某个闭源编码工具』更硬的能力——因为它让你能把 agent 接到自己的本地模型和私有流程上,这正是企业私有化场景最想要的。
#08
Hugging Face Product
NEW

Kimi K3:Moonshot 开源 2.8T 稀疏 MoE 权重,改良版 MIT 许可

Moonshot 在 7 月 26 日把 Kimi K3 的完整权重放上了 Hugging Face——一颗 2.8 万亿总参的稀疏 MoE 模型,采用改良版 MIT 许可。节奏是先在 7 月 16 日的上海世界人工智能大会以 API 形式亮相,十天后再放开权重。它和 DeepSeek V4-Flash 一起,构成本周『中国系开源大模型密集放权重』的又一例:把万亿级模型的权重直接开放出来,进一步压低了『拥有一颗前沿量级模型』的门槛。对多数个人来说 2.8T 无法本地跑,但它进一步夯实了开源阵营在参数量级上追平闭源的态势。
#LLM/Model#开源权重,Modified …
另有 1 家信源报道
展开详情
  • **体量**:2.8 万亿总参稀疏 MoE,Modified MIT 许可,完整权重已上 Hugging Face
  • **节奏**:7/16 世界人工智能大会先上 API,10 天后(7/26)放权重——先服务再开源的打法
  • **趋势**:与 DeepSeek V4-Flash 同周,构成『开源阵营在参数量级上持续追平闭源』的又一注脚
推荐理由:对普通人,Kimi K3 这类万亿级开源权重的直接价值不是拿回家跑(跑不动),而是它压低了整个市场的模型成本曲线:越来越多云厂商、推理平台会托管这些开源权重,你能以更低价格调到接近前沿的能力。机会在于早点摸清『同一个开源模型在哪家平台托管最便宜/最快』,把你的产品成本压下去;以及关注这些模型在中文和特定任务上的实测表现,抢先用在国内场景的应用里。