📅
Hall of Fame
Hall of Fame
Track
Type
Source
9月19日 周六 · 8 条
今日趋势综述
前沿模型分数在 SWE-bench Verified 上挤进 1 分内、卷不动了,价值正在往下沉:一头是『记忆/上下文工程』(mem0、Weighted Memory Tree、Karpathy),一头是『把模型送进真实业务的交付能力』(埃森哲+谷歌 1000 名 FDE、仓储物流 AI)。
今天的信号:模型这层封顶了,机会在它的上下游两端

今天最扎眼的一条是评测:SWE-bench Verified 上 GPT-5.6 Sol 96.2%、Claude Opus 5 96%、Fable 5 95%,前几名挤在 1.2 分内——旗舰模型在这个基准上已经接近满分,谁第一已经不重要了。当模型这层卷不动,价值就会向它的上游和下游两端外溢,而这正是今天其它几条新闻在共同印证的方向。

往上游看,是『记忆与上下文工程』:mem0 冲到 6.5 万星做 agent 的记忆层,一篇新论文(Weighted Memory Tree)在教 agent『记住重要的、忘掉噪声』,Karpathy 也在说『优势属于能持续往抽象层上爬、用对的工具/记忆/方向去编排并行 agent 的人』——同一颗模型,配了好记忆系统的人就是能做得更稳。往下游看,是『交付』:埃森哲和谷歌一口气组建 1000 人的前向部署工程师(FDE)团队专门把 Gemini 送进客户业务,DHL 的仓库机器人完成 10 亿次拣货、单位拣货效率提升 30–180%——真正稀缺的不是模型,是把模型接进真实流程、跑出数字的人。

给普通人的判断很清楚:别再纠结『哪个模型最强』,那条赛道已经封顶且免费红利在消失。把时间投到两端——要么成为『记忆/上下文/skill 工程』的行家,让 agent 更可靠;要么成为『最后一公里交付』的行家,把 AI 能力落到某个具体行业里挣到钱。两端都门槛不高、回报还在涨,现在补正当时。

今日新增 6
#01
benchlm.ai Article
NEW

SWE-bench Verified 挤进 1 分内彻底饱和:GPT-5.6 Sol 96.2 vs Opus 5 96 vs Fable 5 95,选型该看 Pro 榜和成本

截至 9 月,SWE-bench Verified 这个曾经的『试金石』已经被旗舰模型刷到接近天花板——前几名全挤在 1 分出头的区间内,基准本身失去了区分度。真正还能把模型拉开差距的是更难的 SWE-bench Pro:同样一批模型在 Pro 上从 80% 掉到 67%,梯队立刻显形。结论不是『谁更强』,而是『Verified 已经不该作为选型依据』。
#评测
另有 2 家信源报道
展开详情
  • **对比(Verified 已饱和)**:GPT-5.6 Sol 96.2% vs Claude Opus 5 96% vs Claude Fable 5 95%,前三挤在 1.2 分内(SWE-bench Verified)
  • **对比(Pro 才分得开)**:Claude Fable 5.1 81.2% vs Fable 5 / Mythos 5 80.3% vs Opus 5 79.2% vs Qwen3.8 Max 67.7%(SWE-bench Pro)
  • **含义**:一个基准被刷到满分区就失去了选型价值,该换更难的榜 + 把『每分成本』纳入决策
推荐理由:对开发者,实操建议很具体:日常改 bug、补测试这类『Verified 级』任务,主流旗舰已经没有本质差距,直接选最便宜/最快的那个;只有跨文件重构、长程调试这类『Pro 级』硬活,才值得为头部模型多花钱。别再被『第一名』的营销牵着走——学会看『任务难度 × 每分成本』分层选型,本身就是省钱又提效的硬技能。
#02
newsroom.accenture.com Article
NEW

埃森哲+谷歌云组建 1000 人 FDE 军团专攻 Gemini 落地:交付能力正取代模型成为最稀缺资源

9 月 8 日,埃森哲和谷歌云成立『Gemini 企业业务集团』,由谷歌云培训最多 1000 名前向部署工程师(FDE),驻场客户现场把 Gemini 做成能上生产的 AI 应用;埃森哲还计划未来一年再拿 2 万个谷歌云认证。这是继 Palantir、OpenAI、Anthropic 之后,又一个巨头用『真金白银的人头』下注:企业 AI 落地卡的不是模型,是能把模型送进业务的人。
#FDE
另有 2 家信源报道
展开详情
  • **规模**:谷歌云培训最多 1000 名 FDE 驻场交付 Gemini,未来一年再增 2 万谷歌云认证
  • **打法**:FDE 驻客户现场 60–180 天,把模糊的企业问题变成能上线的定制 AI 应用
  • **信号**:咨询巨头从『卖 PPT 战略』转向『派工程师进场落地』,交付层成主战场
推荐理由:这对想在 AI 时代往上走的人是最实在的职业信号:会调 prompt、会跑 demo 已经不值钱,能把模型接进某个真实业务流程、扛住脏数据和边界情况、跑出可验证数字的『落地工程师』才是稀缺项,而且大厂在用上万个岗位真金白银地招。个人路径也清晰——选一个你熟的行业,练『需求拆解 + 集成交付 + 效果度量』这套 FDE 硬功夫,比追新模型的性价比高得多。
商机信号(加速):谁付钱:有 AI 预算但落不了地的中大型企业,以及给它们做交付的咨询/集成公司 痛点:买了模型/平台却卡在最后一公里:脏数据、系统对接、流程改造没人扛,试点大量夭折 切入点:个人或小团队专攻某一垂直行业的『AI 交付外包』,按项目收建置费+按月收维护费,先把一个客户跑通再复制到同行业
#04
arXiv Paper
NEW

Weighted Memory Tree: Remembering What Matters for Long-Horizon LLM Agents

长程任务里,agent 的记忆要么什么都存导致上下文爆炸,要么乱丢关键信息。这篇论文提出『加权记忆树』:每来一个事件就更新树结构,并用选择性衰减机制让不重要的信息自然淡出、重要的保留,从而在 GAIA-Text 等长程基准上更稳。核心思路是把『记什么、忘什么』变成一个可学习、可调的机制,而不是一股脑塞进上下文窗口。
针对长程任务提出『加权记忆树』:用基于事件的更新和选择性衰减,让 agent 主动保留有用信息、淡化噪声——把记忆从『全存下来』升级成『记住重要的』。
#AI Agent
展开详情
  • **机制**:事件驱动更新 + 选择性衰减的树状记忆,主动区分『该记』和『该忘』
  • **场景**:面向 GAIA-Text 这类长程、多步任务,缓解上下文膨胀与关键信息丢失
  • **呼应**:与 mem0、记忆增强推理等一起,把提升点从『换模型』推向『管记忆』
推荐理由:这条和今天的 mem0、Karpathy 是一条线:agent 能力的天花板越来越取决于『记忆管理』而非模型本身。对想做出好用 agent 的人,值得把这类论文的思路吃进去——不是死记算法,而是理解『长任务里什么该留什么该忘』这套判断,它会直接决定你的 agent 在真实长流程里稳不稳。这是一个门槛不高、但很多人还没补的差异化能力。
#06
GitHub Repo
★ 7.53 万 NEW

ComposioHQ/awesome-claude-skills

当 skills 生态爆炸到成千上万个、良莠不齐时,『怎么找到该装哪个』本身成了问题。ComposioHQ 这份精选清单把 1000+ 生产级 skills 按类别(文档处理、开发工具、数据分析、营销自动化、以及 78+ 个接 CRM/邮件/DevOps 的 SaaS 工作流)整理好,还不只覆盖 Claude,也覆盖 Codex、Cursor、Gemini CLI 等编码 agent。它是一层『帮你挑 skill 的 skill』。
#Skills#元技能#Markdown
展开详情

一个覆盖 1000+ 生产级 Claude Skills 的精选目录,按类别和工作流组织,是找 skills 的公认起点。

周增长:skills 发现的默认入口,随 skills 生态爆发持续走高

  • **规模**:1000+ 生产级 skills 分类精选,7.5 万星,成为 skills 发现的默认入口
  • **跨 agent**:不止 Claude,覆盖 Codex / Cursor / Gemini CLI 等主流编码 agent
  • **偏实战**:强调『能执行真实动作』的 skill(如 78+ SaaS 工作流集成)而非纯生成文本
推荐理由:对普通人,这份清单的用法不是『收藏』,而是『拆解』:挑几个高星 skill 打开看它的 SKILL.md 怎么写、怎么把一个具体动作拆成模型能稳定执行的步骤——这就是当下最值钱的『skill 工程』能力。会找、会用、进而会写 skill,正在成为 AI 时代的通用生产力;而当 skills 多到需要有人来筛选和策展时,做『某个垂类的 skills 精选/评测』本身也是一个新机会位。
#07
scmr.com Article
NEW

物流仓储 AI 落地实测:DHL+Locus 完成 10 亿次拣货、单位效率涨 30–180%、培训时间砍 80%,亚马逊仓效率 +20%

物流是今天最能拿出硬数字的 AI 落地场:DHL 与 Locus Robotics 的协作机器人在全球仓网完成 10 亿次拣货,带来单位小时拣货量提升 30–180%、员工培训时间下降 80%;DHL 目前运营 7500+ 台自主仓储机器人、90%+ 仓库至少有一套自动化。亚马逊履约中心效率 +20%。麦肯锡测算 AI 在分销运营可降库存 20–30%、物流成本 5–20%、采购支出 5–15%,行业平均 ROI 约 190%——但 65% 的运营方仍卡在零散试点,被老旧的 TMS/WMS 和人手不足拖住。
#行业应用
另有 2 家信源报道
展开详情
  • **DHL 实测**:与 Locus 完成 10 亿次拣货,单位拣货效率 +30–180%、培训时间 -80%,7500+ 台仓储机器人在跑
  • **成本账**:麦肯锡测算库存降 20–30%、物流成本降 5–20%、采购降 5–15%,行业平均 ROI≈190%
  • **卡点**:65% 运营方仍停在零散试点,瓶颈是老旧 TMS/WMS 系统对接和人员就绪度,而非模型
推荐理由:物流的数字说明一件事:AI 在『高频、重复、异常代价高』的流程里最挣钱,而 65% 的企业卡在集成而非模型——这正是普通人的机会缝隙。你不需要造机器人,只需要会把现成的预测/调度/视觉质检能力接进某家 3PL 或中小仓库的老系统里,把缺货率、拣货效率这些数字跑出来。行业越是『想用但落不了地』,懂落地的人越值钱。
商机信号(加速):谁付钱:中小 3PL、区域仓库、电商履约商——有明确降本需求但没有内部 AI 团队 痛点:想用 AI 降库存/提拣货效率,却被老旧 TMS/WMS 系统对接和缺人挡住,大厂方案又太贵 切入点:个人/小团队做『轻量集成商』:用现成模型+API 给单个仓库做需求预测或拣货优化的 PoC,按效果分成或按月维护收费,跑通一个再复制同区域同行
#08
Twitter/X Opinion
NEW

Andrej Karpathy

优势属于那些能不断沿着抽象层往上爬的人——用对的工具、记忆和方向,去编排一群并行的 agent。你的判断力、品味和想法,正在变成关键。
在『提示工程作为一项独立技能已死、取而代之的是上下文工程』成为共识的 2026 年,Karpathy 的这句话把方向讲得很直白:随着模型能力趋同、编码 agent 已经能扛长任务(Simon Willison 语),人的价值不再是写代码或调 prompt,而是往上一层——决定给 agent 什么工具、什么记忆、什么方向,并把多个 agent 编排起来。这与今天 mem0、加权记忆树、SWE-bench 饱和几条是同一个判断的不同侧面。
#AI Agent
另有 1 家信源报道
推荐理由:把这句话翻译成普通人的行动:不要在『会用某个模型/某个 prompt 技巧』这层停留,那层正在被商品化。往上爬一层——练『编排能力』(把一个大目标拆给多个 agent、给它们配对工具和记忆、判断结果好坏)。这套能力不依赖你会不会写底层代码,靠的是判断力和品味,恰恰是模型短期替代不了、又能随经验积累的东西。现在有意识地训练它,就是在给自己建护城河。
仍在热榜 2
Repo mem0ai/mem0 在榜 3d 给 AI agent 和应用做『即插即用』的记忆层,让上下文跨会话持久保留。 Infra
Repo Kilo-Org/kilocode 在榜 3d 一个『到处都能用』的开源 AI 编码 agent:VS Code、JetBrains、CLI 全覆盖,接 500+ 模型… DevTools