📅
Hall of Fame
Hall of Fame
Track
Type
Source
8月21日 周五 · 8 条
今日趋势综述
本期信号收束到一条主线——AI 的价值正从'模型多强'迁移到'怎么把能力可靠装进具体场景':医疗把 AI 卡进写病历、企业把 AI 账单盘成可审计的账、coding agent 补上记忆层,而 Skills/插件正标准化成能力的分发与集成通道。
今天的信号:拼图的重心,从'模型'挪到了'最后一公里'

把今天的条目连起来看,会发现一条清晰的主线:AI 的竞争焦点,正在从'谁的模型更强'悄悄挪到'谁能把能力可靠地装进一个具体场景'。评测这边最能说明问题——SWE-bench Verified 上顶尖模型挤在 96–97% 分不出高下,可一换成更难的 SWE-bench Pro,Claude 家族霸榜的 80% 档和第二梯队之间立刻拉开 15 个点,而 GPT-5.6 Luna 又用 4% 的价格拿到旗舰 97% 的分数。模型能力已经过剩到'旗舰之间的差别,不如你会不会按难度和预算选模型'重要。

真正的价值,长在'最后一公里'。医疗是本期最好的样本:赢家不是搞 AI 诊断的炫技派,而是把 AI 死死卡进医生每天两小时的写病历苦活——Stanford 96% 医生满意、每天省两小时,Cleveland Clinic 15 周铺开 4000 多名医生。这条逻辑在别处反复出现:DepthData 把散落的 AI 账单盘成一张能审计的账(72% 企业过去一年被 AI 账单暴涨吓到),Greplica 给 coding agent 补上会失忆的短板,SkeMex 这篇论文则在研究层面证明'不改权重、只靠一层技能记忆,agent 就能越用越强'。它们干的都是同一件事——不造新模型,而是把现成能力封装进一个真实痛点。

而封装这件事本身,正在被标准化成一门生意:NVIDIA 把'怎么用我们的产品'做成官方 Agent Skills 一键塞进你的 coding agent,Agent Plugins 1.0 则把 Skills 和 MCP 打成一个能跨 ChatGPT/Cursor/Copilot 安装的包。对普通人的启示因此很具体:别去和大厂拼模型,去做最后一公里的封装——技能包、落地服务、支出治理、agent 记忆层,甚至只是把 AI 工具栈做成某个垂类的交付服务(本期那位一人 AI 设计代理,8 个月 $42 万年化,每周只干 25 小时)。今天所有能被买单的机会,都指向同一句话:模型已经够用了,稀缺的是把它可靠地用起来的人。

#01
benchlm.ai Article
NEW

SWE-bench Pro 横评:编码模型的『难关卡』还没饱和,Claude 家族霸榜 80% 档,但真正的看点是性价比断层

上周我们聊过 SWE-bench Verified 已经卷到 96–97% 的天花板、区分不出高下。这周换个更狠的尺子看:SWE-bench Pro(更难、更贴近真实工程、还没饱和)。截至 8 月 18 日,Claude Mythos 5 以 80.3% 领跑,Claude Fable 5(80%)、Claude Opus 5(79.2%)紧随,Claude 家族包揽了 80% 这一档;再往下是明显的断层——Qwen3.8 Max 67.7%、Grok 4.5 64.7%、GPT-5.6 Sol 64.6%、Gemini 3.6 Flash 58.7%。也就是说,在'真难题'上,顶尖闭源和第二梯队之间还有 15 个点的真实差距,Verified 上那种'大家挤在一起'的假象在 Pro 上被拉开了。但更值得普通开发者记住的是价格维度:GPT-5.6 的廉价档 Luna($0.20/$1.20 每百万 token)能拿到旗舰 Sol 约 97% 的分数,却只花 4% 的输出价。一句忠告:不同页面报的分常常没说清用的是哪套 scaffolding 和数据划分,跨来源的数字别硬比。
#评测
另有 2 家信源报道
展开详情
  • **对比**:Claude Mythos 5 80.3% vs GPT-5.6 Sol 64.6% vs Gemini 3.6 Flash 58.7%(同一 SWE-bench Pro 基准,8/18 读数)——Verified 上看不出的差距,Pro 上拉开了 15+ 个点
  • **性价比断层**:GPT-5.6 Luna($0.20/$1.20 每百万 token)拿到旗舰 Sol 约 97% 的分数,只花 4% 的输出价——预算敏感场景的真答案
  • **方法论提醒**:多数页面报分不说明用哪套 scaffolding / 数据划分,跨来源数字不可直接横比;认准同一榜单同一口径再比
推荐理由:选型不是'谁分最高用谁'。要啃硬骨头(复杂重构、跨文件大改)就上 Claude Mythos/Fable/Opus 5 这档 80% 的旗舰;日常量大、成本敏感的自动化(批量小修、测试、样板代码),GPT-5.6 Luna 或 Gemini 3.6 Flash 用零头的价格就够用。普通人真正该练的能力,是'为不同难度的任务分配不同价位的模型'——一套会按难度和预算路由模型的工作流,比盲目用最贵的省一个数量级的钱,效果几乎不打折。
#02
aha.org Article
NEW

医疗 AI 落地实测:Stanford 96% 医生满意、每天省 2 小时,Cleveland Clinic 15 周铺开 4000+ 医生——赢在把 AI 卡进'写病历'这一件苦活

医疗 AI 这两年的真落地,赢家不是搞'AI 诊断'的炫技派,而是把 AI 死死卡进医生最烦、最耗时的一件事——写病历(ambient scribe,环境语音自动生成病历)。数据很硬:Stanford Health Care 用 Dragon/DAX Copilot 已累计生成超 100 万份临床记录、1600+ 医生每天在用,96% 的医生对 AI 文书工具满意、平均每天省下约 2 小时;Cleveland Clinic 上线 Ambience AI Scribe,15 周内 4000+ 医生和执业护士开始使用、记录了超 100 万次问诊,医生每天写/改病历的时间降了 14 分钟;一项覆盖 5 个学术中心的 2026 年 5 月研究显示,环境记录把单次问诊的文书时间砍了 16 分钟、总 EHR 时间降 13.4 分钟。宏观上,75% 的医疗系统已在用或计划用至少一个 AI 应用,部署 3 个以上方案的机构同比增加 67%,能量化 ROI 的机构里过半拿到了 2 倍以上回报(临床文书改进 CDI 与拒付预测约 70% 达到 2X+,环境记录 61% 达 2X+)。
#行业应用
另有 2 家信源报道
展开详情
  • **Stanford**:Dragon/DAX Copilot 累计生成 100 万+ 病历、1600+ 医生日用,96% 医生满意、平均每天省约 2 小时
  • **Cleveland Clinic**:Ambience AI Scribe 15 周铺开 4000+ 医生/护士、记录 100 万+ 次问诊,每天写改病历时间降 14 分钟;另与 PathAI 合作提升诊断
  • **ROI**:可量化机构过半拿到 2X+ 回报(CDI/拒付预测约 70% 达 2X+,环境记录 61% 达 2X+);75% 医疗系统已用/计划用至少一个 AI 应用
推荐理由:对个人最直接的启示:AI 在专业领域挣钱,靠的不是'替代专家做判断',而是'替专家干那件重复、耗时、没人爱干的苦活'。医生不缺诊断能力,缺的是每天两小时的文书时间——AI 精准卡进这个缺口就能被买单。想进医疗/法律/财务这类高壁垒行业变现的普通人,正确姿势是找到该行业'专家时间被浪费在哪',用 AI 把那段流程自动化,而不是妄图取代专家本身。落地能力(选型、和现有系统对接、让专业人员敢用)比模型本身值钱得多。
商机信号(加速):谁付钱:医院与大型诊所的临床/IT 部门,以及被文书负担和医生倦怠困扰的专科诊所 痛点:医生每天约 2 小时耗在写/改病历上,职业倦怠严重、问诊时间被 EHR 挤占,人手又补不上 切入点:给中小诊所/专科做 ambient scribe 的选型评估 + EHR 对接 + 落地培训的托管服务,按医生席位或月费收——大厂只服务大医院,中小机构的落地缺口是切口
#03
arXiv Paper
NEW

Experience Makes Skillful: Enabling Generalizable Medical Agent Reasoning via Self-Evolving Skill Memory

这篇论文戳中了当下 agent 记忆的通病:现有记忆机制往往把原始历史轨迹一股脑存下来,冗余、嘈杂、难治理,也分不清哪些记忆对未来推理真有用。SkeMex 的做法是——把有信息量的交互轨迹蒸馏成结构化的'技能'(可复用的流程性知识),组织进一个多分支仓库,分为通用、任务级、动作级三层经验;再用环境反馈估计每条记忆'依场景而定的效用',据此做价值感知的检索与仓库治理。整个过程是一个'读-写-评-治'(Read-Write-Assess-Govern)的闭环:写入新技能、更新效用、提拔有用的、删除有害的,从而在不更新权重的前提下持续进化,支撑长链条的临床推理。它和本期另一条'医疗落地'遥相呼应:医疗既是 AI 应用最热的落地场,也是 agent 研究最前沿的试验田。
提出 SkeMex:一个'部署后'自进化框架,不改模型权重、只靠一层'技能记忆'让医疗 agent 越用越强——把智能体从'一次性调好'推向'边干边长本事'。
#AI Agent
展开详情
  • **技能而非日志**:把交互轨迹蒸馏成结构化、可复用的'技能',分通用/任务级/动作级三层,替代'把原始历史一股脑存下来'的旧记忆
  • **价值感知治理**:用环境反馈估计每条记忆'依场景的效用',做价值感知检索,并主动提拔有用、删除有害的记忆条目
  • **不改权重就进化**:'读-写-评-治'闭环让 agent 部署后靠经验持续变强,避开了重新训练/微调的成本,尤其适合长链条临床推理
推荐理由:对个人:未来一两年真正稀缺的不是'会调 API',而是'会给 agent 设计记忆与技能治理层'的人。SkeMex 说明——同一个底座模型,谁的 agent 能把交互沉淀成结构化经验、还会自己淘汰坏记忆,谁就长期领先。这是一条可迁移的能力:拿你所在领域的真实交互数据,设计一套'什么值得记、什么该忘、什么时候调用'的机制,就能造出别人抄不走的差异化 agent。领域经验 + 记忆治理,正在成为通用大模型给不了的护城河。
#04
GitHub Repo
★ 3K 2d streak

NVIDIA/skills

这不是又一个 star farming 的 awesome 列表,而是一个信号:连英伟达都开始把'怎么正确使用我们的产品'做成官方 Agent Skills 直接分发。过去你要让 coding agent 会用 CUDA、跑通 RAG Blueprint 或 Omniverse 仿真,得自己翻文档、反复试错;现在 NVIDIA 把这些踩坑经验打包成'技能',npx 一键装进你的 agent,agent 立刻'懂'怎么端到端操作它们的软件栈。更关键的是它主打'NVIDIA-Verified'——在一堆真假难辨的社区技能里,厂商背书的可信技能正变成稀缺品。这标志着 skills 正在从'个人玩具'升级为'厂商的官方分发与集成通道':谁的能力想被 agent 用起来,谁就得把它做成技能推出去。
#Skills#编程开发#Shell / Markdo…
另有 2 家信源报道
展开详情

英伟达官方的 Agent Skills 目录:把'怎么用 NVIDIA 全家桶'打包成可安装的技能,一条 npx 命令(skills@latest add nvidia/skills)就能塞进 Claude Code、Codex、Cursor 等 coding agent,让 agent 端到端跑通 CUDA-X、RAG Blueprint、NeMo、TAO、cuOpt、Omniverse、Physical AI/机器人仿真、视觉 AI、医疗 AI、GPU 加速数据科学等工作流。技能维护在各产品仓库、每天自动同步镜像到这个目录,标注'NVIDIA-Verified'。

周增长:官方新目录、持续增长(未经 API 核实)

  • **厂商官方入场**:NVIDIA 把 CUDA-X、RAG Blueprint、NeMo、Omniverse、Physical AI/机器人、医疗 AI 等做成官方 Agent Skills,npx 一键装进 Claude Code/Codex/Cursor
  • **Verified 是卖点**:标注'NVIDIA-Verified'、每天从产品仓库自动同步——在真假难辨的社区技能里,厂商背书的可信技能是稀缺品
  • **分发范式变了**:能力不再靠'写文档等人读',而是打包成技能主动塞进 agent 的执行环境——skills 成了厂商的集成通道
推荐理由:对个人:skills 生态正在出现'厂商官方 + 社区海量 + 可信稀缺'的结构,这里有两个真实切口。一是做垂类高质量技能包:挑一个你熟的工具栈或行业流程,做成靠谱、能端到端跑通的技能,受众是所有用 coding agent 的人。二是做'技能的策展与质检':官方 verified 只覆盖大厂产品,海量社区技能鱼龙混杂,帮团队筛选、评测、维护一套可信技能库本身就是服务。会写、会审、会治理技能的人,正站在一个刚成型、竞争者还很少的位置上。
#05
agentpatterns.ai Article
NEW

Agent Plugins 1.0 发布:一个 plugin.json 把 Skills 和 MCP 打成一个包,ChatGPT/Cursor/Copilot/VS Code 通吃

8 月 6 日,一个厂商中立的技术委员会发布了 Agent Plugins 1.0:用一个 plugin.json 清单,把 Agent Skills(skills/ 目录)和 MCP 服务器(mcp.json)打进同一个文件夹,再加上按反向域名命名的子目录放各客户端专属扩展。它注册了 application/agent-plugins+json 这个类型,让目录条目可以直接指向一个 plugin.json。意义在于'一次打包、跨端安装'——同一个插件能装到 ChatGPT、Codex、Cursor、GitHub Copilot、Kiro、VS Code 上。Claude Code 有自己的插件格式(.claude-plugin/plugin.json,结构不同、暂不原生兼容),但官方 plugins CLI 把这套可移植格式翻译进 Claude 自己的体系。要泼一盆冷水:1.0 只是'互操作地板'——安装、注册表、权限、来源、密钥、OAuth 这些语义全部留给各客户端自己管,标准本身不保证信任与安全。
#Skills#自动化集成
另有 2 家信源报道
展开详情
  • **一次打包跨端装**:plugin.json + skills/ + mcp.json 一个文件夹,通吃 ChatGPT/Codex/Cursor/Copilot/Kiro/VS Code;受众从单一生态扩到全行业
  • **对比 Claude Code**:Claude Code 用自己的 .claude-plugin/plugin.json(结构不同、暂不原生兼容),但官方 CLI 会把可移植格式翻译进 Claude 体系
  • **冷静看**:1.0 只是互操作地板——安装/注册表/权限/来源/密钥/OAuth 全留给客户端,'能跨端'不等于'可信任',验证与安全仍是空白
推荐理由:对个人:这是一个'趁早卡位'的窗口。技能/插件正从各家私有格式走向统一打包标准,意味着你现在做一个好插件,未来能一次覆盖几乎所有主流 agent 客户端,而不是给每个生态各写一遍——分发红利在放大。而标准刻意留白的'信任、验证、权限、来源'恰恰是下一个机会:谁能给这些跨端插件补上质检、签名、安全审计和可信目录,谁就在替整个生态补最缺的一环。做插件本身之外,'让插件可信'是更稀缺的活。
#06
Product Hunt Product
NEW

DepthData

DepthData 想解决一个正在爆发的新痛点:企业的 AI 账单和'影子 AI'越来越乱,没人说得清钱花在哪、谁在用。它把公司已经在用的各种 AI 工具(ChatGPT、Claude、Copilot、Gemini 等)连成一张'可审计'的支出与采用视图,每个数字都标注'是怎么核实出来的',并且明确不读取 prompt 内容,还会诚实地告诉你每家厂商的 API 到底能暴露、不能暴露哪些数据。这踩中的是 2026 年的大盘:全球 AI 支出预计达 2.52 万亿美元(同比 +44%);98% 的 FinOps 团队现在要管 AI 支出(两年前只有 31%);72% 的组织过去一年遭遇过意料之外的 AI 账单暴涨或'惊喜账单'。当 AI 从零星试点变成全员在用,'把散落的 AI 订阅盘成一张能审计的账'正从加分项变成刚需。
#Infra#企业 SaaS(定价未公开)
另有 2 家信源报道
展开详情
  • **一张可审计的账**:把 ChatGPT/Claude/Copilot/Gemini 等已用工具连成单一支出与采用视图,每个数字标注核实方式,不读取 prompt
  • **踩中大盘**:全球 AI 支出 2026 预计 2.52 万亿美元(+44%),98% FinOps 团队要管 AI 支出(两年前仅 31%)
  • **真痛点**:72% 组织过去一年遭遇 AI 账单意外暴涨——'影子 AI' 和不透明计费让财务/IT 失控
推荐理由:AI FinOps(给 AI 支出做财务治理)是被 2.52 万亿大盘和 72% 的'账单意外'硬顶出来的新刚需,而且还很早期。对个人:不必造一个 DepthData,可以先做轻的——给中小企业做一次'AI 订阅盘点 + 按团队/项目归集 + 生成可审计报表'的咨询或小工具,就能接到活。会把一堆散落的 AI 花费理成一张清楚、能过审计的账的人,正卡在一个刚被点燃、竞争者还不多的位置。
商机信号(加速):谁付钱:有多个 AI 订阅、被账单暴涨和'影子 AI'困扰的企业财务/IT/FinOps 团队 痛点:AI 支出散落在各工具、计费不透明,72% 企业过去一年遭遇账单意外,看不清谁在花、合规审计拿不出据 切入点:给中小企业做'AI 支出盘点 + 按团队/项目归集 + 可审计报表'的轻量服务或垂类小工具,按月费或按盘点项目收
#07
Product Hunt Product
NEW

Greplica

Greplica 给工程团队和每一个 coding agent 一层'代码库的共享记忆':它持续从编码会话里抽取决策、约束、坑点、失败过的方案、文件级上下文,然后按当前任务只检索真正相关的那部分。它解决的是一个越来越贵的浪费——coding agent 每开一个新会话都要重新把整个代码库探索一遍,既烧 token 又慢,而团队的隐性知识('这里为什么这么写''那条路走不通')又散落在各人脑子里和聊天记录里。和静态文档或各 agent 各自为政的记忆不同,Greplica 始终扎根在真实仓库里、保持知识新鲜,并且跨开发者、agent、克隆和 fork 共享。它开源、能本地跑、也提供托管共享模式,Product Hunt 上以 32 个 upvote、206 条评论排到当日第 7。
#DevTools#开源、可本地运行 + 托管共…
另有 1 家信源报道
展开详情
  • **给 agent 装长期记忆**:从编码会话持续抽取决策/约束/坑点/失败方案/文件级上下文,按任务只检索相关部分,省掉每次重头探索代码库的浪费
  • **团队 + agent 共享**:知识跨开发者、agent、克隆、fork 共享,扎根真实仓库、保持新鲜,替代散落的静态文档和各自为政的 agent 记忆
  • **开源可自托管**:开源、本地可跑 + 托管共享模式;PH 当日排名第 7(32 upvote、206 评论)
推荐理由:对个人:coding agent 的'记忆/上下文层'正在独立成一个产品品类,这里藏着两类机会。一是眼下就能用——把 Greplica 这类工具接进团队,等于给一队 agent 装上不失忆的共享大脑,token 和返工都省。二是可切入——'把代码库/业务的隐性知识沉淀成 agent 能检索的结构化记忆'本身是门手艺,帮团队搭这层记忆、定制检索策略,是比写业务代码更稀缺的活。谁会给 agent 造记忆,谁就掌握了让 agent 真正好用的关键一环。
#08
greyjournal.net Article 直接可用
NEW

把 AI 工具栈做成'交付服务'挣现金流:一人 AI 设计代理 8 个月做到 $420K ARR、每周只干 25 小时

这组 2026 年的个体创业复盘里,最值得普通人抄的不是那些'月入几十万'的明星(如 Danny Postma 用 HeadshotPro 单人做到 $30 万/月),而是一个更朴素、更可复制的路子:Sarah Chen 用 ChatGPT Plus + Canva Pro + Zapier 这套全是现成工具的组合,做一家一人 AI 设计代理,2025 年 1 月起步,8 个月做到 $42 万年化营收,每周只干 25 小时。她没有造产品、没写代码,赢法是把 AI 工具栈打包成'某个垂类的交付服务',按结果和项目收费,overhead 压到近乎为零。这类模式的经济账很硬:2026 年一套完整的个体创业工具栈全年成本约 $3K–12K(相比雇人省 95–98%),经营利润率能到 60–80%(传统人力密集生意只有 10–20%)。核心不是有没有'完美点子',而是选对窄垂类 + 快速执行 + 稳定交付。
#小微现金流
另有 1 家信源报道
展开详情
  • **全现成工具**:ChatGPT + Canva + Zapier,不造产品、不写代码,把 AI 工具栈打包成垂类交付服务,按项目/结果收费
  • **经济账**:全年工具成本约 $3K–12K(比雇人省 95–98%),利润率 60–80% vs 传统生意 10–20%,overhead 近零
  • **可复制关键**:赢在选窄垂类 + 快执行 + 稳交付,而非'完美点子';约一半在建的个体创业者仍卡在 $0–1K MRR,差距在执行不在工具
推荐理由:对想挣现金流的普通人:门槛最低、见钱最快的路,不是造一个 SaaS,而是把'生成 + 模板 + 自动化'这套 AI 工具栈,做成某个垂直行业的产出化交付服务——按结果定价,边际成本几乎为零,第一个客户就是现金流。关键动作有两个:一是把垂类选窄到'一句话能说清你帮谁解决什么',二是把交付标准化到能稳定复制。工具人人都有,能持续、可靠地交付结果的人才收得到钱。
My Take:评分(5=最优):最快成交 4 / 最低成本 5 / 可复制 4 / 风险安全度 4。用现成 AI 工具栈把设计/内容/自动化做成单一垂类的产出化服务,接单即现金流、几乎零启动成本。
商机信号(加速):谁付钱:没有内部设计/内容/自动化团队、又需要持续产出的中小企业与个体商家 痛点:需要设计、内容或流程自动化,但养不起全职、外包又贵又慢、交付不稳定 切入点:用 AI 工具栈(生成 + Canva/模板 + Zapier 自动化)做单一垂类的产出化交付服务,按项目或月费收,先把交付标准化再复制