📅
Hall of Fame
Hall of Fame
Track
Type
Source
7月22日 周三 · 8 条
今日趋势综述
模型和榜单已经卷到饱和又趋同——SWE-bench 被刷穿 95%、开放权重追到只差一代、连 OpenAI 都弃榜——真正的价值正从『用哪个模型』整体转移到外围:给 agent 装上下文、装可验证的交付、把能力落进真实业务,以及会指挥它的判断力。
今天的信号:当模型不再是变量,外围工程和判断力才是

把今天几条放一起看,会发现它们在合力宣布一件事:模型这个变量正在贬值。SWE-bench Verified 已经被刷到 95% 以上、头部几家挤在一两个百分点里,OpenAI 干脆停报 Verified、改推更难的 Pro——一个基准一旦人人满分,它就不再能区分谁强;与此同时开放权重的 Kimi K3、DeepSeek V4、Inkling 把和闭源旗舰的差距压到大约『一代以内』,最强模型不再稀缺。当所有人手里的模型都差不多强、还越来越便宜,光靠『我接了哪个模型』已经拉不开差距了。

差距去哪了?去了模型外面那一圈工程。codebase-memory-mcp 把整个代码库压成一张知识图谱,让编码 agent 用 3400 token 就看清本来要烧 41 万 token 才能理清的结构;Aura 把 AI 写的代码按 AST 逐函数追踪、拿产出和你的原始意图对账,逼它证明任务真做完了才让你提交。它们不造更强的模型,而是给已经足够强的模型装上『看得懂仓库』和『交付可验证』这两样外设——这正是 2026 年最扎实、也最不容易被下一个模型发布抹平的护城河。

落到人身上,答案更直白。TD 银行把房贷审批从平均 15 小时压到 3 分钟以内,靠的不是买了最强模型,而是把 agent 嵌进真实的审贷流程;FDE 成了年薪冲到七十万美元的抢手岗,因为企业 AI 试点 95% 死在『落地』而非『模型不行』。Mollick 说得最透:提示词技巧的时代过去了,现在该练的是把需求写成规格、给 agent 定目标和验收标准、像管一个能干但只会照字面执行的员工那样管它。别再纠结用哪个模型了——去练把能力装起来、落进业务、并指挥它交付出可验证结果的那套本事。

今日新增 7
#02
GitHub Product
NEW

Aura:Agents + Git + Intent(开源 AI 编码 IDE)

Aura 是本周在 Product Hunt 上榜的开源 AI 编码 IDE,主打『可验证的 AI 交付』。它不追文本行差异,而是把你的 AST 哈希后按逻辑单元追踪 AI 的每一处改动,把产物和你最初的意图规格对账,做到对 AI 生成代码的可溯源和完成度校验。有意思的是它大部分代码是自己写自己的——5 到 6 月间跑同一套 harness 循环、处理了 20 多亿 DeepSeek token、近 3 万次 API 请求,把自己这套 IDE 生出来。它和今天的主线是一路货:不造更强模型,而是给 AI 编码这件事补上『交付可验证』这块工程。
#DevTools#开源免费(自带模型接入,示例…
另有 2 家信源报道
展开详情

它解决的痛点是:AI 帮你写了一大堆代码,但你很难确认它到底有没有真把任务做完、改动是否偏离了你最初的意图——传统 Git 只按『文本行』记差异,AI 大改一片时你根本看不清逻辑上发生了什么。Aura 是一个 Git 原生、面向 AI 编码 agent 的 IDE:它把 agent 拆成 Planner(研究+写规格)和 Worker(执行),带仓库感知的上下文(语言感知的代码智能、本地 BM25 搜索、依赖上下文),最关键的是它对代码的 AST 做哈希、按函数和类级别追踪改动,再拿产出和你的『原始意图』对账,能在你提交前证明这个任务是不是真的完成了。

  • **按 AST 追踪、不是按行**:哈希抽象语法树而非文本行,逐函数/类级别追踪 AI 改动,给 AI 生成的代码提供逻辑级可溯源,AI 大改一片也看得清到底动了什么
  • **Planner/Worker 分工**:Planner 负责研究和写规格、Worker 负责执行,配合仓库感知上下文(语言感知代码智能 + 本地 BM25 搜索 + 依赖上下文),先规划后动手
  • **自举造出来**:5–6 月用同一套 harness 循环处理 20+ 亿 DeepSeek token、近 3 万次 API 请求,把自身代码库写了出来——本身就是『指挥 agent 交付』的活样本
推荐理由:对普通人,Aura 演示了一个正在成型的新工种能力:不是自己一行行敲,而是给 agent 定规格、看它执行、再验收它到底做没做到。它把『AI 写完你怎么知道对不对』这个所有人都头疼的问题,变成一个可操作的流程——规格在前,AST 级对账在后。哪怕你不用 Aura,这套思路也值得抄进自己的工作流:先把要做的事写成清楚的验收标准,再让 agent 干,最后拿产出逐条对标。它自举开发的故事更是个直白提示:一个人+一套会自我迭代的 agent 循环,已经能生出一个完整产品;2026 年个人开发者真正的杠杆,是会不会设计并指挥这种循环,而不是打字快不快。
#03
pymnts.com Article
NEW

TD 银行把房贷审批从 15 小时压到 3 分钟:不是买了最强模型,是把 agent 嵌进了审贷流程

加拿大 TD 银行上线了自家第一个用于房贷和 HELOC(房屋净值信贷)处理的 agentic AI 模型:自主 agent 会对客户文件分类、抽取关键信息、计算并核验客户收入、做同意检查、比对政策要求、找出前后矛盾,最后为核保员生成一份简明的申请摘要备忘。早期结果是把这道工序从平均 15 小时压到平均不到 3 分钟(约降 99.7%),同时结果更准、风险和单件审贷成本都更低。它由 TD 的 Layer 6 AI 研发中心联合科技、数据、地产信贷和风控团队一起做。这是一个『真实落地、有硬数字』的金融业案例:价值不来自模型多聪明,而来自把 agent 精确嵌进一条真实业务流程。
#行业应用
另有 2 家信源报道
展开详情
  • **15 小时 → 3 分钟**:房贷/HELOC 审贷备忘生成从平均 15 小时压到平均不到 3 分钟,约降 99.7%,且宣称结果更准、风险与单件成本同步下降
  • **做的是脏活不是炫技**:agent 负责文件分类、信息抽取、收入计算与核验、同意检查、政策比对、矛盾排查,最后产出给人类核保员的摘要——人仍在最终决策位
  • **自建团队落地**:由 TD 旗下 Layer 6 AI 实验室联合科技/数据/地产信贷/风控多团队共建,2026-05-21 正式发布,是银行业首批面向房贷全流程的 agentic AI
推荐理由:对普通人,这条案例的价值不在『银行又用了 AI』,而在它示范了『AI 真正省下 99.7% 时间』长什么样:不是换了个更强模型,而是把 agent 拆进一条具体流程里、让它干分类核验对账这些又累又标准化的脏活,人只守在最终判断上。这正是当下最值钱、也最缺人的能力——把某个行业的真实工作流拆开,找到那段『重复、规则清晰、量大』的环节,用 agent 接管。你不需要造模型,只需要比别人更懂某个业务流程的每一步在干嘛。谁能把这种『流程拆解 + agent 嵌入』的活干利索,谁就是 TD 里 Layer 6 那批人,也是下一条里说的 FDE。想在 AI 时代增值,选一个你熟的行业,去拆它的流程,比追模型榜单实在得多。
#04
codeant.ai Article
NEW

SWE-bench Verified 被刷穿到 95%+、连 OpenAI 都弃榜转投 Pro:编码榜单还能信吗,该看什么

到 2026 年 7 月,SWE-bench Verified 这个曾经最权威的编码基准已经被头部模型刷到饱和,前排挤成一团、彼此只差一两个百分点,区分度基本失效。更值得注意的是 OpenAI 已停报 Verified 分数、转而推荐更难的 SWE-bench Pro,理由是训练集数据泄漏让 Verified 越来越不可信。换句话说:当一个榜人人接近满分,它就不再能告诉你谁更强,反而可能在误导选型。这是一篇关于『榜单饱和与方法论』的提醒,而不是又一次『谁第一』的排名。
#评测
另有 2 家信源报道
展开详情
  • **对比**:SWE-bench Verified(2026-07)GPT-5.6 Sol 96.2% vs Claude Mythos 5 95.5% vs Claude Fable 5 95.0% vs Kimi K3 93.4% vs Claude Opus 4.8 88.6%——前四名挤在 1 个百分点带里,榜单已基本分不出高下
  • **OpenAI 自己弃榜**:OpenAI 停报 SWE-bench Verified、改推更难的 SWE-bench Pro,公开理由是训练集数据泄漏让 Verified 分数越来越不可信
  • **饱和≠等价**:分数贴脸不代表体验相同,真实差距转移到了成本/延迟、长程任务稳定性、工具调用与代码库理解上——这些恰恰是单一 Verified 分数量不出来的
推荐理由:对开发者和普通人,最该改的是选型习惯:别再盯着『SWE-bench 谁 96 谁 95』做决定了。当头部模型都在 95% 上下,Verified 分数对你几乎没有区分意义,OpenAI 自己都不报了。现在该看的是四件量榜量不出来的事——每任务成本与延迟(高频调用时差距被放大很多倍)、长程/多步任务的稳定性、工具调用与仓库理解能力、以及能不能在你的真实代码库上跑通。实操建议:拿你自己 3–5 个最典型的任务,让候选模型各跑一遍,比价格、比稳定、比在你项目里的实际表现,而不是抄榜。会自己设计小规模私测、看穿『饱和榜单』的人,才不会被营销数字牵着走。
#05
getperspective.ai Article
NEW

更新:FDE『1500 人调查』给出实测画像——一半时间在客户现场,落地卡在人不在模型

更新:在本栏此前介绍过『FDE 是 2026 最抢手 AI 岗』之后,这次的增量是一份对 1500 名 FDE 的实测调查,把这个岗位从概念落成了可量化的画像。关键新数据:FDE 每周中位约 47% 的时间是面向客户的(访谈、驻场部署、设计评审),31% 在写交付代码,22% 在内部协调——也就是说,一半时间根本不在敲键盘,而在把模型能力翻译成客户业务。配合此前的行情:FDE 岗位一年暴涨 729%、前沿实验室资深 FDE 中位总包约 48.5 万美元、staff 级可过 72.5 万,企业 AI 试点约 95% 死在『落地』而非模型能力。
#FDE
另有 2 家信源报道
展开详情
  • **47/31/22 的时间账**:FDE 每周中位 47% 时间面向客户(访谈/驻场/设计评审)、31% 写交付代码、22% 内部协调——一半时间在把模型翻译成业务,不是纯写码岗
  • **需求爆炸**:FDE 岗位一年暴涨 729%,Salesforce 公开承诺招 1000 名、EY 4 月起设专岗,Palantir/Databricks/Ramp/Rippling 都在建 FDE 团队
  • **钱在落地不在模型**:前沿实验室资深 FDE 中位总包约 48.5 万美元、staff 级过 72.5 万;企业 AI 试点约 95% 失败于『部署断裂』而非模型不行
推荐理由:对普通人,这份调查把 FDE 这个岗位从『听起来很酷』变成一张可照着练的能力清单。它最反直觉、也最该记住的一点是:这不是一个纯技术岗,一半时间在跟客户打交道、把对方的业务问题翻译成 agent 能执行的规格。也就是说,护城河是『技术 × 沟通 × 懂业务』的组合,而不是单纯代码写得快——这恰恰是很多只练编码的人忽略的方向。可落地的练法:挑一个你能接触到的真实场景(哪怕是帮朋友的小生意、公司某个部门),完整走一遍『搞懂他们的流程 → 设计一个 agent 方案 → 亲手部署跑通 → 拿结果验收』。把这套端到端交付经验攒出几个案例,你就具备了当下最稀缺、薪资最高的能力雏形,而它几乎不受下一个模型发布影响。
#06
arXiv Paper
NEW

Agora: Enhancing LLM Agent Reasoning Via Auction-Based Task Allocation

Agora 提出用『基于拍卖的任务分配』来提升多智能体(多个专家模型/工具协作)的推理能力:把每个子任务当成一件要拍卖的活,按各 agent 的『校准后能力减去成本』来出价竞标,谁性价比高谁接单。它的关键卖点是不需要端到端训练、也不需要访问那些闭源 agent 的内部——你手上一堆现成的专家模型和工具,Agora 负责在它们之间高效派活。这契合今天的主线:与其造一个万能大模型,不如把已有能力更聪明地编排起来。
给多智能体系统一套无需端到端训练、也不需窥探闭源 agent 内部的任务分配机制——用『拍卖』把活派给最合适的那个专家
#AI Agent
展开详情
  • **拍卖式派活**:把子任务当拍卖品,各 agent 按『校准能力 − 成本』出价竞标,系统据此把每段活派给性价比最高的专家,而非固定路由
  • **零训练、黑盒友好**:不需要端到端训练、也不需窥探闭源 agent 内部,直接编排一堆现成的专家模型与工具,落地门槛低
  • **编排 > 单体**:核心思路是让多个专才协作胜过一个通才独干,把重心从『模型多聪明』移到『任务怎么分配、成本怎么算』的调度工程
推荐理由:对普通人,这篇论文给的不是一段代码,而是一个思维框架:AI 时代做事,越来越像当『调度者』而不是『干活的人』。Agora 干的活——把一个复杂任务拆成小块、评估手上每个工具/模型『能力配得上、成本划不划算』、再把每块派给最合适的那个——恰恰是一个人指挥一队 AI 时该有的心智模型。你可以把它直接搬进日常:面对一个复杂任务,先拆解,再想清楚哪段用便宜快的小模型、哪段值得上贵而强的旗舰、哪段干脆自己上手,按『能力减成本』分配,而不是所有事都丢给同一个最贵的模型。这种『拆解 + 按性价比派活』的调度能力,是把 AI 用出杠杆的核心,也和前面 Mollick 说的判断力是同一件事。
#07
digitalapplied.com Article
NEW

2026 年 7 月开放权重大爆发:Kimi K3、DeepSeek V4、Inkling 把和闭源旗舰的差距压到约『一代以内』

2026 年 7 月开放权重模型集中爆发:Moonshot 的 Kimi K3(2.8 万亿参数、原生多模态、100 万 token 上下文)7 月 16 日发布,在 Artificial Analysis 的独立排名上已略微超过 Claude Opus 4.8、拿下 Frontend Code Arena 第 1、AA 智能指数总榜第 3;同一两周窗口里,Thinking Machines 以 Apache 2.0 放出 Inkling、DeepSeek V4 中旬发布、Mistral 开放新稀疏 MoE 家族、MiniMax M3 Pro 传出风声。业内的判断是:开放与闭源的差距现在大约只有『一代』,而不是过去的好几代。对个人而言,最强一档的模型正从稀缺变成随手可得。
#LLM/Model
另有 2 家信源报道
展开详情
  • **对比**:Artificial Analysis 独立榜上 Kimi K3 已略超 Claude Opus 4.8,拿下 Frontend Code Arena 第 1、AA 智能指数总榜第 3;DeepSeek V4.5、GLM-5.2、Inkling 在推理与编码上与闭源旗舰互有胜负
  • **两周五连发**:Kimi K3(2.8T,7/16)、Thinking Machines 的 Inkling(Apache 2.0)、DeepSeek V4(7 月中)、Mistral 新稀疏 MoE、MiniMax M3 Pro(2.7T)密集落地
  • **差距只剩一代**:开放 vs 闭源的能力差从『好几代』收窄到约『一代以内』,最强一档能力不再被少数闭源厂商垄断
推荐理由:对普通人,开放权重追平的最大意义是:顶尖模型能力正在从『向少数几家按 token 付费』变成『你能自己拿到、自己部署、成本可控』。这打开两层机会。第一层是省钱和自主:对隐私或成本敏感的场景,你可以把 Kimi K3、DeepSeek V4 这类开放权重模型跑在自己可控的环境里,不必被单一闭源 API 绑死。第二层更关键——当模型本身人人可得、彼此又差不多强,光有模型已经不值钱了,价值全部转移到你在它外面搭了什么:上下文工程、记忆、工具、把它嵌进业务的能力(也就是今天其它几条讲的事)。所以别把精力花在追『这周谁又第一』,把开放权重当成一个越来越便宜、越来越强的底座,去练在它之上搭系统、解决真实问题的本事。
#08
explainx.ai Opinion
NEW

Ethan Mollick

别再把大模型当成一本咒语书、指望靠某句提示词技巧点石成金了。该把它当成一个能干、但只会照字面执行的员工来管——给它清楚的目标、定义好要什么产出、立下质量标准、配上验收测试。提示词技巧的时代结束了,规格纪律的时代开始了。我们正从『外行用聊天机器人补短板』,走向『专家用 agent 把活干完』。
Mollick 在 2026 年 7 月的多篇文章里反复强调同一判断:随着模型变强,靠零散提示词『技巧』撬动效果的空间在消失,沃顿的受控实验也显示这些技巧在前沿模型上效果微弱且不稳定;真正能把 AI 用出效果的,是把需求写成清晰规格、给 agent 设定目标与验收标准、像管理一个照字面办事的能干下属那样管理它。这和今天其它几条是同一件事的不同侧面——当模型不再是变量,会不会『指挥』它、能不能把要做的事讲清楚并验收,成了新的分水岭。
#AI Agent
另有 2 家信源报道
推荐理由:对普通人,这句话直接指出了 2026 年最该练、也最被低估的能力:不是背更多提示词模板,而是练『把任务讲清楚 + 定验收标准 + 会管一个照字面执行的下属』。它的反直觉之处在于——当模型越来越强,提示词技巧反而越来越不值钱,因为强模型不再需要你哄它;它需要的是你把需求、边界、质量线说明白。这其实是一种管理能力,很多没带过团队的人天然是短板。可落地的练法:下次让 AI 做事,别只写一句话,试着像给新员工派活那样写清楚——目标是什么、产出长什么样、什么算合格、给两个正例两个反例。你会发现产出质量的天花板,几乎完全由你把需求讲清楚的能力决定。这套『写规格、定标准、验收』的判断力,是当下最不容易被下一个模型抹平的个人护城河。
仍在热榜 1
Repo DeusData/codebase-memory-mcp 在榜 3d 它解决的痛点是:AI 编码 agent 想读懂一个大代码库,默认只能一个文件一个文件地翻,上下文瞬间被撑爆、token … DevTools