Hall of Fame
今日趋势综述
今天的信号:拼图的重心,从'模型'挪到了'最后一公里'
把今天的条目连起来看,会发现一条清晰的主线:AI 的竞争焦点,正在从'谁的模型更强'悄悄挪到'谁能把能力可靠地装进一个具体场景'。评测这边最能说明问题——SWE-bench Verified 上顶尖模型挤在 96–97% 分不出高下,可一换成更难的 SWE-bench Pro,Claude 家族霸榜的 80% 档和第二梯队之间立刻拉开 15 个点,而 GPT-5.6 Luna 又用 4% 的价格拿到旗舰 97% 的分数。模型能力已经过剩到'旗舰之间的差别,不如你会不会按难度和预算选模型'重要。
真正的价值,长在'最后一公里'。医疗是本期最好的样本:赢家不是搞 AI 诊断的炫技派,而是把 AI 死死卡进医生每天两小时的写病历苦活——Stanford 96% 医生满意、每天省两小时,Cleveland Clinic 15 周铺开 4000 多名医生。这条逻辑在别处反复出现:DepthData 把散落的 AI 账单盘成一张能审计的账(72% 企业过去一年被 AI 账单暴涨吓到),Greplica 给 coding agent 补上会失忆的短板,SkeMex 这篇论文则在研究层面证明'不改权重、只靠一层技能记忆,agent 就能越用越强'。它们干的都是同一件事——不造新模型,而是把现成能力封装进一个真实痛点。
而封装这件事本身,正在被标准化成一门生意:NVIDIA 把'怎么用我们的产品'做成官方 Agent Skills 一键塞进你的 coding agent,Agent Plugins 1.0 则把 Skills 和 MCP 打成一个能跨 ChatGPT/Cursor/Copilot 安装的包。对普通人的启示因此很具体:别去和大厂拼模型,去做最后一公里的封装——技能包、落地服务、支出治理、agent 记忆层,甚至只是把 AI 工具栈做成某个垂类的交付服务(本期那位一人 AI 设计代理,8 个月 $42 万年化,每周只干 25 小时)。今天所有能被买单的机会,都指向同一句话:模型已经够用了,稀缺的是把它可靠地用起来的人。
SWE-bench Pro 横评:编码模型的『难关卡』还没饱和,Claude 家族霸榜 80% 档,但真正的看点是性价比断层
展开详情
- **对比**:Claude Mythos 5 80.3% vs GPT-5.6 Sol 64.6% vs Gemini 3.6 Flash 58.7%(同一 SWE-bench Pro 基准,8/18 读数)——Verified 上看不出的差距,Pro 上拉开了 15+ 个点
- **性价比断层**:GPT-5.6 Luna($0.20/$1.20 每百万 token)拿到旗舰 Sol 约 97% 的分数,只花 4% 的输出价——预算敏感场景的真答案
- **方法论提醒**:多数页面报分不说明用哪套 scaffolding / 数据划分,跨来源数字不可直接横比;认准同一榜单同一口径再比
医疗 AI 落地实测:Stanford 96% 医生满意、每天省 2 小时,Cleveland Clinic 15 周铺开 4000+ 医生——赢在把 AI 卡进'写病历'这一件苦活
展开详情
- **Stanford**:Dragon/DAX Copilot 累计生成 100 万+ 病历、1600+ 医生日用,96% 医生满意、平均每天省约 2 小时
- **Cleveland Clinic**:Ambience AI Scribe 15 周铺开 4000+ 医生/护士、记录 100 万+ 次问诊,每天写改病历时间降 14 分钟;另与 PathAI 合作提升诊断
- **ROI**:可量化机构过半拿到 2X+ 回报(CDI/拒付预测约 70% 达 2X+,环境记录 61% 达 2X+);75% 医疗系统已用/计划用至少一个 AI 应用
Experience Makes Skillful: Enabling Generalizable Medical Agent Reasoning via Self-Evolving Skill Memory
展开详情
- **技能而非日志**:把交互轨迹蒸馏成结构化、可复用的'技能',分通用/任务级/动作级三层,替代'把原始历史一股脑存下来'的旧记忆
- **价值感知治理**:用环境反馈估计每条记忆'依场景的效用',做价值感知检索,并主动提拔有用、删除有害的记忆条目
- **不改权重就进化**:'读-写-评-治'闭环让 agent 部署后靠经验持续变强,避开了重新训练/微调的成本,尤其适合长链条临床推理
NVIDIA/skills
展开详情
英伟达官方的 Agent Skills 目录:把'怎么用 NVIDIA 全家桶'打包成可安装的技能,一条 npx 命令(skills@latest add nvidia/skills)就能塞进 Claude Code、Codex、Cursor 等 coding agent,让 agent 端到端跑通 CUDA-X、RAG Blueprint、NeMo、TAO、cuOpt、Omniverse、Physical AI/机器人仿真、视觉 AI、医疗 AI、GPU 加速数据科学等工作流。技能维护在各产品仓库、每天自动同步镜像到这个目录,标注'NVIDIA-Verified'。
周增长:官方新目录、持续增长(未经 API 核实)
- **厂商官方入场**:NVIDIA 把 CUDA-X、RAG Blueprint、NeMo、Omniverse、Physical AI/机器人、医疗 AI 等做成官方 Agent Skills,npx 一键装进 Claude Code/Codex/Cursor
- **Verified 是卖点**:标注'NVIDIA-Verified'、每天从产品仓库自动同步——在真假难辨的社区技能里,厂商背书的可信技能是稀缺品
- **分发范式变了**:能力不再靠'写文档等人读',而是打包成技能主动塞进 agent 的执行环境——skills 成了厂商的集成通道
Agent Plugins 1.0 发布:一个 plugin.json 把 Skills 和 MCP 打成一个包,ChatGPT/Cursor/Copilot/VS Code 通吃
展开详情
- **一次打包跨端装**:plugin.json + skills/ + mcp.json 一个文件夹,通吃 ChatGPT/Codex/Cursor/Copilot/Kiro/VS Code;受众从单一生态扩到全行业
- **对比 Claude Code**:Claude Code 用自己的 .claude-plugin/plugin.json(结构不同、暂不原生兼容),但官方 CLI 会把可移植格式翻译进 Claude 体系
- **冷静看**:1.0 只是互操作地板——安装/注册表/权限/来源/密钥/OAuth 全留给客户端,'能跨端'不等于'可信任',验证与安全仍是空白
DepthData
展开详情
- **一张可审计的账**:把 ChatGPT/Claude/Copilot/Gemini 等已用工具连成单一支出与采用视图,每个数字标注核实方式,不读取 prompt
- **踩中大盘**:全球 AI 支出 2026 预计 2.52 万亿美元(+44%),98% FinOps 团队要管 AI 支出(两年前仅 31%)
- **真痛点**:72% 组织过去一年遭遇 AI 账单意外暴涨——'影子 AI' 和不透明计费让财务/IT 失控
Greplica
展开详情
- **给 agent 装长期记忆**:从编码会话持续抽取决策/约束/坑点/失败方案/文件级上下文,按任务只检索相关部分,省掉每次重头探索代码库的浪费
- **团队 + agent 共享**:知识跨开发者、agent、克隆、fork 共享,扎根真实仓库、保持新鲜,替代散落的静态文档和各自为政的 agent 记忆
- **开源可自托管**:开源、本地可跑 + 托管共享模式;PH 当日排名第 7(32 upvote、206 评论)
把 AI 工具栈做成'交付服务'挣现金流:一人 AI 设计代理 8 个月做到 $420K ARR、每周只干 25 小时
展开详情
- **全现成工具**:ChatGPT + Canva + Zapier,不造产品、不写代码,把 AI 工具栈打包成垂类交付服务,按项目/结果收费
- **经济账**:全年工具成本约 $3K–12K(比雇人省 95–98%),利润率 60–80% vs 传统生意 10–20%,overhead 近零
- **可复制关键**:赢在选窄垂类 + 快执行 + 稳交付,而非'完美点子';约一半在建的个体创业者仍卡在 $0–1K MRR,差距在执行不在工具