📅
Hall of Fame
Hall of Fame
Track
Type
Source
7月30日 周四 · 10 条
今日趋势综述
Opus 5 以对折价格把前沿模型拉到人人可用、编码榜单挤在两分内接近饱和;今天真正的机会不在追下一个模型,而在围着便宜的强模型做记忆、技能、落地和现金流的那一层。
今天的信号:模型变便宜变多,稀缺的是『围着模型做东西』的人

今天最硬的一条新闻是 Anthropic 发布 Claude Opus 5——不到两个月里的第四个模型,价格和 Opus 4.8 持平($5/$25 每百万 token),却把前沿智能拉到了 Fable 5 一半的输入价。配合评测那条看:SWE-bench Verified 榜前三名 Opus 5、GPT-5.6 Sol、Fable 5 已经挤在 95–97 分这两分之内,编码这个最被引用的基准正在饱和;而换到 LiveCodeBench,冠军又变成 Gemini 3 Pro Preview。两件事合起来说的是同一句话:最强的模型正在变便宜、变多,单靠『我用了最强模型』或『我榜上第一』越来越不值钱了。Relay-Bench 那篇论文更是当头一棒——同一个前沿模型在单领域任务能拿 82.7%,一旦要把多个领域的推理串起来就掉到 43.3%,说明榜单分数和真实综合能力之间还有一道大裂缝。

#01
anthropic.com Article
NEW

Anthropic 发布 Claude Opus 5:前沿智能对折价,$5/$25 不涨价却比 Fable 5 便宜一半

Anthropic 在 7 月 24 日发布 Claude Opus 5——这是它不到两个月里推出的第四个模型(前面还有 Mythos 5、Fable 5、Sonnet 5)。定位是『会自我验证、反复迭代直到把编码和知识工作做对』的前沿模型,成为 Claude Max 的默认模型、Claude Pro 上最强的可选项,API 名为 claude-opus-5,带 1M 上下文和 low/medium/high 三档 effort 开关。关键不是它又刷新了几个榜,而是价格:$5/百万输入、$25/百万输出,跟上一代 Opus 4.8 持平,却把接近 Fable 5 的前沿智能做到了后者一半的输入价($5 vs $10)。前沿能力正在肉眼可见地变便宜。
#LLM/Model
另有 2 家信源报道
展开详情
  • **价格**:$5/$25 每百万 token,与 Opus 4.8 持平不涨价,却把近 Fable 5 级别的智能做到其输入价的一半($5 vs $10)
  • **成绩**:官方口径 SWE-bench Pro 约 79.2%、SWE-bench Verified 约 96%,1M 上下文,成为 Claude Max 默认模型
  • **节奏**:两个月内第四个模型——前沿模型的发布频率和降价速度,都在把『用最强模型』这件事变成人人可及的日常
推荐理由:对个人:前沿模型正在快速降价,这对你是纯利好——一年前只有大厂用得起的能力,现在几十美元就能大量调用。别再把预算和注意力花在『追哪个模型最强』上,那一层已经商品化了。真正该做的是趁能力变便宜,赶紧把它接进一个你熟悉的具体场景里跑出价值。谁先把便宜的强模型用出真实成果,谁就占了这波红利。
#02
llm-stats.com Article
NEW

编码榜快饱和了:Opus 5 登顶 SWE-bench Verified,但前三挤在两分内,换个榜冠军又变 Gemini

Opus 5 一上线就登顶最常被引用的 agentic 编码基准 SWE-bench Verified,但『登顶』的含金量正在缩水——前三名已经挤在两分之内,榜接近饱和。换一个同样考编码的基准,冠军又完全不同:在 LiveCodeBench(持续收新题、抗训练污染的实时编码榜)上,登顶的是 Gemini 3 Pro Preview,开源的 DeepSeek 也咬得很紧。结论很实在:编码这块已经没有哪个模型通吃,选型要看你的活到底考哪一项,而不是盯着某个总榜第一。
#评测
另有 2 家信源报道
展开详情
  • **对比**:SWE-bench Verified(vals.ai,7/22)Claude Opus 5 97.0 vs GPT-5.6 Sol 96.2 vs Claude Fable 5 95.0——前三挤在 2 分内,榜接近饱和
  • **换榜换王**:LiveCodeBench(约 7/24)Gemini 3 Pro Preview 91.7 vs Gemini 3 Flash Preview 90.8 vs DeepSeek V3.2 Speciale 89.6——冠军换成了 Gemini
  • **方法**:不同榜差异来自评测方法与收题方式(如 LiveCodeBench 持续收新题抗污染),同一模型在不同聚合站分数也有 96–97 的浮动,别把单个小数点当真理
推荐理由:对开发者:当榜首挤在两分之内、还随榜易主时,『追第一』基本没意义了。更聪明的做法是先想清你的活考哪一项——纯改真实仓库 issue,SWE-bench Verified 这类更贴近,Opus 5 目前占优;要抗污染的实时算法/竞赛类编码,看 LiveCodeBench,Gemini 更强、DeepSeek 更便宜。再叠加价格和延迟按场景选型,比迷信总榜第一靠谱得多。
#03
arXiv Paper
NEW

Relay-Bench: Evaluating LLMs on Multi-Domain Reasoning Chains

Relay-Bench 是一个抗污染、尚未饱和的纯文本基准:它把视觉推理、编码、数学、网络检索取信息、问题求解、通用知识、数据分析等不同领域的 2–13 个子问题串成一道组合题,逼模型在一条链里跨领域连续推理,且允许它自由用代码执行、联网搜索和所有工具。结果很扎眼:领跑的 GPT-5.5(xHigh)只拿到 43.3%,而同一模型在主流单项 agentic 测试上能到约 82.7%——一旦要把多个领域的推理接力串起来,能力直接掉了近 39 个百分点。
用『把多个单领域子问题串成一条链』的组合题,暴露出前沿模型『单项很强、串起来就崩』的巨大落差,直接动摇了『榜单登顶=真实综合能力强』的默认叙事。
#AI Agent
另有 1 家信源报道
展开详情
  • **落差**:GPT-5.5 单项 agentic 约 82.7%,到 Relay-Bench 跨领域链只剩 43.3%——同一模型掉了近 39 个点
  • **设计**:每题由 2–13 个不同领域子问题串成,纯文本、无需多模态输入输出,且明确鼓励用代码执行/联网/工具,考的是『串起来会不会崩』
  • **意义**:抗污染、未饱和——正好补上 SWE-bench 这类快饱和榜单的盲区,说明『榜单第一』和『真实综合能力』之间还有一道大裂缝
推荐理由:对个人:这篇给了一个特别值钱的判断——模型在你交给它的单个环节上可能很强,但把一长串跨领域步骤丢给它一次做完,它就容易崩。这正是你搭 agent 时该做的事:别指望一个大提示让模型端到端搞定,而要把复杂任务拆成一个个单领域的可靠环节,中间加校验和交接。会拆链路、会在环节之间做检查的人,能把今天的模型用出远超榜单分数的可靠性。
#04
GitHub Repo
★ 2,100 NEW

kvcache-ai/AgentENV

AgentENV 来自以 KTransformers 出名的 kvcache-ai 团队,7 月 23 日创建,六天冲到约 2.1k 星(>300/天)。它想解决的是 agent 时代一个越来越明显的工程瓶颈:训练和服务成千上万个 agent 时,怎么把它们各自的执行环境(沙箱、工具、状态)标准化地、高吞吐地跑起来。用 Rust 写,定位是 agentic RL 训练的基础设施层,而不是又一个 agent 框架。
#Infra#Rust
展开详情

一个用于大规模运行 agent 执行环境的分布式平台,主打为 agentic 强化学习训练提供标准化、高吞吐的沙箱/运行时底座。

周增长:7 月 23 日创建,6 天约 2.1k 星(>300/天),周增以 GitHub Trending / star-history 实时为准

  • **速度**:7/23 创建、6 天约 2.1k 星(>300/天),KTransformers 原班系统团队背书,可信度高
  • **定位**:不是 agent 框架,而是底层——大规模运行 agent 执行环境的分布式平台,专为 agentic RL 训练设计
  • **信号**:用 Rust 做高吞吐运行时,说明『怎么把海量 agent 环境跑起来』已经成了独立的基础设施品类
推荐理由:对个人:当『训练/服务海量 agent 的环境』都值得单独做一个平台时,说明 agent 的竞争正从模型下沉到基础设施。你不一定要造这层,但要读懂信号——agent 时代的新岗位和新生意,很多藏在『让 agent 能大规模、稳定地跑起来』的工程里。懂分布式、沙箱、运行时的人,在这波里会越来越抢手。
#05
GitHub Repo
★ 869 NEW

VictorTaelin/OptMem

OptMem 出自 HVM/Bend 的作者 Victor Taelin,7 月 25 日发布,四天约 869 星。它的卖点是极端极简:用一个 426-token 的提示 + 一个脚本,就给 agent 加上跨会话的永久记忆,靠 append-only 日志和树状分层摘要来组织,命令就 `memo wake / note / recall` 几个,数据存在本地 `~/.optmem/memory/`。没有向量库、没有嵌入服务、没有一堆基础设施——用最小的东西把『记忆』这件事跑通。
#AI Agent#Python
展开详情

给 AI agent 装『永久记忆』的极简方案:一个 426-token 的提示加一个脚本,即插即用,不需要重型向量数据库。

周增长:7 月 25 日创建,4 天约 869 星(>200/天),周增以 star-history 实时为准

  • **极简**:426-token 提示 + 一个脚本即插即用,append-only 日志 + 树状摘要,无需向量库/嵌入服务
  • **作者**:Victor Taelin(HVM/Bend 作者)出品,四天约 869 星,本身就是关注度背书
  • **取舍**:用最小复杂度换够用的持久记忆——和动辄上一整套 RAG 栈的方案形成鲜明对照
推荐理由:对个人:这是『少即是多』的极好范例——很多人一提 agent 记忆就上向量库、嵌入、检索一整套,OptMem 证明一个精心设计的提示加脚本就能把 80% 的需求跑通。启发在于:动手前先问『最小可行方案是什么』,别一上来就堆基础设施。能用最简单的东西解决真问题,比会搭复杂系统更稀缺、也更容易被人记住。
#06
GitHub Repo
★ 2,600 NEW

isjiamu/gzh-design-skill

gzh-design-skill 精准解决中文创作者的高频痛点:写好的 Markdown 粘进公众号后排版全乱。它把『Markdown → 公众号可直接粘贴的 HTML』这一个具体动作封成 Agent Skill,内置 6 套精选主题、一个主题生成器,还加了双重校验闸门保证产出干净,累计约 2.6k 星,并登上 Trendshift 趋势榜。它没做什么大而全的平台,就是把一件小事做到可靠、可复用、跨 Claude Code/Codex/Cursor 可移植。
#Skills#内容创作#HTML
另有 1 家信源报道
展开详情

一个把 Markdown 一键转成可直接粘进微信公众号编辑器的排版 HTML 的 Agent Skill,自带 6 套主题、主题生成器和双重校验。

周增长:近期登上 Trendshift 趋势榜、增长强劲,具体周增以实时榜为准

  • **痛点**:专治『Markdown 粘进公众号排版就崩』,6 套主题 + 主题生成器 + 双重校验,产出即粘即用
  • **热度**:约 2.6k 星并登上 Trendshift,是本季最出圈的中文向 Skill 之一
  • **范式**:不做大平台,把一个具体动作封成可复用、跨 agent 可移植的技能——这正是 skills 生态跑通的样板
推荐理由:对个人:这是 Skills 变现最接地气的模板——挑一个你所在圈子天天犯、又很烦的小事(公众号排版、某种报告格式、某类数据清洗),把它打磨成一个开箱即用、产出可靠的技能。不需要多前沿的技术,赢在『解决得够专、够干净』。会把细分痛点封成好技能的人,正在 skills 生态里攒下自己的名气和被动收入入口。
商机信号(萌芽):谁付钱:要日更公众号、又被排版反复折磨的自媒体作者、运营和中小团队 痛点:写作在 Markdown、发布在公众号,中间排版反复手工调,既费时产出还不稳定 切入点:锁定一个具体平台/格式的『最后一公里排版』痛点,做成产出即用、跨 agent 可移植的高质量技能,先靠一个场景做深再扩品类
#07
GitHub Repo
★ 1,100 NEW

makecindy/cindy

cindy 走的是和一堆 agent 框架相反的路线——它不是给你搭积木的框架,而是一个装好就能用的成品 App。7 月 22 日创建、约 1.1k 星,用 TypeScript 写成 pnpm monorepo(Electron 桌面 + React Native 移动端),本地运行、整合多模型多工具,还兼容 Claude Code、Codex 等多种 harness,Apache-2.0 开源、双语、对新手友好。定位是一个人人可上手的个人 agent,而不是又一个需要你自己拼装的开发者玩具。
#AI App#TypeScript
展开详情

一个开箱即用的开源 AI agent 成品应用,跨 iOS/安卓/桌面/浏览器,整合多模型多工具,本地运行,主打『想到就能做到』。

周增长:7 月 22 日创建,约 1.1k 星(>150/天),周增以 GitHub Trending / star-history 实时为准

  • **成品化**:开箱即用而非框架,跨 iOS/安卓/桌面/浏览器,本地运行、整合多模型多工具
  • **工程**:TypeScript + pnpm monorepo(Electron + React Native),兼容 Claude Code/Codex 等 harness,Apache-2.0 开源
  • **热度**:7/22 创建、约 1.1k 星(>150/天),双语、对新手友好,主打『想到就能做到』
推荐理由:对个人:agent 正在从『开发者拼积木的框架』走向『普通人下载就能用的成品 App』——这中间的产品化能力是巨大机会。能把复杂的 agent 能力包装成一个跨平台、装好即用、对小白友好的东西,比又写一个框架有价值得多。想做 AI 产品的人,重点该放在『把能力做成人人能用的成品』这件事上。
#08
GitHub Repo
★ 314 NEW

gavamedia/deltafin

deltafin 干了件看着不可能的事:在一台 Apple Silicon Mac(参考机是 64GB 的 M1 Max)上跑 2.8T 参数的 Kimi K3。做法是把 MoE 的专家按需流式载入本地磁盘缓存,配上 NEON 融合算子、Metal/MPS 计算,并暴露一个 OpenAI 兼容的服务端;也支持 x86-64/aarch64 Linux。7 月 28 日创建,两天约 314 星。星数还不高,但它代表的方向很硬——把万亿级前沿模型从『只能上云』拉到『你自己的笔记本上就能跑』。
#DevTools#Python
展开详情

让 2.8 万亿参数的 MoE 大模型 Kimi K3 在单台 Apple Silicon Mac 上跑起来——按需把专家流式载入本地磁盘缓存,配 NEON/Metal 融合算子和 OpenAI 兼容接口。

周增长:7 月 28 日创建,两天约 314 星,周增以 star-history 实时为准

  • **壮举**:在单台 M1 Max(64GB)上跑 2.8T 参数的 Kimi K3,靠专家按需流式载入磁盘缓存绕开显存墙
  • **工程**:NEON 融合算子 + Metal/MPS 计算 + OpenAI 兼容接口,Mac 与 Linux 都支持
  • **方向**:星数虽还不高(7/28 创建两天约 314 星),但把万亿级模型从『只能上云』拉到本地,是值得押注的趋势
推荐理由:对个人:本地跑大模型的门槛在被一点点砸开——今天能在一台 Mac 上跑万亿参数模型,意味着数据隐私敏感、想省 API 费、或要离线用的人,很快有真正可行的本地方案。懂量化、懂专家流式加载、懂在消费级硬件上榨性能的人会越来越值钱。盯住『本地推理』这条线,它是绕开云端成本和隐私顾虑的一整片机会。
#09
ports.marinelink.com Article
NEW

物流 AI 落地实测:DHL 全欧铺开 AI 动态选路,关键航线时效压缩 10–15%

2026 年 1 月,DHL Global Forwarding 宣布其自研的 AI 动态选路平台已在全欧网络铺开。系统实时吃进天气、港口拥堵、清关时长、承运商表现等数据,动态为空运/海运货挑最优且更省的路线,并主动绕开瓶颈重新规划。官方口径是关键航线时效可压缩 10–15%,同时明显降低燃油消耗与温室气体排放,提升服务可靠性;下一步计划年内向全球扩展。它赢的不是用了最强模型,而是把优化能力嵌进了『每一票货今天到底该怎么走』这个具体决策里。
#行业应用
另有 1 家信源报道
展开详情
  • **数字**:关键航线运输时效预计压缩 10–15%,燃油消耗与温室气体排放同步下降,首批区域数月内达到正 ROI
  • **做法**:实时融合天气/港口拥堵/清关时长/承运商表现,动态选路 + 主动绕瓶颈重规划,而非静态排线
  • **打法**:不追大模型,把优化嵌进『每票货怎么走』的具体运营决策——全欧先跑通,再向全球扩展
推荐理由:对个人:物流、货代、供应链这类『不性感』的传统行业,恰恰是 AI 见真金白银最快的地方——时效和油耗省下的都是硬钱。你不需要会训模型,需要懂这个行业的数据长什么样、卡在选路/清关/排箱哪一步。会把现成的优化/预测能力接进某个具体物流环节的人,比会跑 benchmark 的人稀缺得多,也更好变现。
#10
indiehackers.com Product 直接可用
NEW

Superpower ChatGPT:骑在 ChatGPT 流量上的一个 Chrome 插件,做到五位数月收入

ChatGPT 刚火时,Saeed Ezzati 花一个周末给自己做了个 Chrome 插件,补上 ChatGPT 原生缺的那些工作流功能(提示管理、文件夹、导出等),成了 Chrome 商店里第一个 ChatGPT 插件。此后靠『骑在别人流量上』把它滚成一整套生意:Superpower ChatGPT 累计 42 万+ 下载、15 万周活,配套的 Superpower Daily 邮件通讯 35 万订阅,整体做到五位数月收入。一个人、几天起步,护城河就是『第一个上、且死磕 ChatGPT 重度用户缺的那一个功能』。
#小微现金流#免费增值 Chrome 插件…
另有 2 家信源报道
展开详情
  • **成绩**:单人做到五位数 MRR,插件 42 万+ 下载、15 万周活,配套通讯 35 万订阅
  • **打法**:骑在 ChatGPT 的巨大流量上做增强插件,补官方没做的重度用户工作流功能——分发几乎零成本
  • **先发**:Chrome 商店第一个 ChatGPT 插件,靠『第一个上 + 死磕一个刚需功能』建立壁垒
推荐理由:对想挣现金流的普通人:最快的分发不是自己从零拉用户,而是骑在一个已经有海量用户的 AI 平台上,补它没做好的那一个高频功能。ChatGPT、Claude、各类 AI App 的原生体验都有缺口,一个小插件、一个月费几美元,就可能滚成一门实打实的生意。关键是先发 + 死磕一个刚需,别贪大。
My Take:评分(5=最优):最快成交 4 / 最低成本 5 / 可复制 3 / 风险安全度 3。骑在成熟平台流量上补刚需功能,是单人零预算起量最快的路径之一;风险在平台政策与被官方吸收。
商机信号(加速):谁付钱:每天重度使用 ChatGPT 的写作者、营销、开发者等,愿意为官方没做的效率功能付月费 痛点:原生 ChatGPT 缺提示管理、文件夹、导出等工作流工具,重度用户天天被这些缺口卡住 切入点:挑一个有海量用户的 AI 平台,做一个补齐其某项高频缺失功能的浏览器插件,先免费获量再转付费订阅,靠先发和分发红利起量
7月29日 周三 · 8 条
今日趋势综述
从农田到企业交付,今天的信号都指向同一件事:AI 的胜负手不在模型本身,而在把它接进真实流程、真实数据、真实客户的『最后一公里』。
今天的信号:赢家都在抢『最后一公里』,不是抢模型

把今天的条目连起来看,会发现一条很清楚的主线:几乎没有一条是靠『我们用了最强的模型』赢的。农业里 Church Brothers 用需求预测把短期预测准确率提升 40%,靠的是把 AI 嵌进易腐货的补货流程;企业交付端,Palantir 那套被 Anthropic、OpenAI 抄作业的 FDE 打法,核心是『按管道额度配人、驻场 8–16 周、上线第一天就交东西』;连接层的真正瓶颈,从模型能力变成了『怎么把本地系统安全地接给云端 agent』——MCP gateway 就是冲这个缝隙长出来的一整个品类。评测那条更直白:Terminal-Bench 上 GPT-5.5 领先,可换到 MCP Atlas 工具调用榜,冠军就变成了 Gemini 3.5 Flash。没有哪个模型通吃,选型的功夫全在『你的活到底考哪一项』。

#01
info.throughput.world Article
NEW

农业需求预测落地实测:Church Brothers 把易腐货短期预测准确率提升 40%,赢在把 AI 嵌进补货流程

美国家族农业公司 Church Brothers Farms(年种 4 万英亩、发运 5000 万箱、400+ SKU、6 万+ 车次)用 ThroughPut AI 的需求预测软件,把易腐蔬菜的短期需求预测准确率提升最高 40%,并在订单履约时效、路由决策上同步改善,明显压低了超额库存与损耗。它没有换什么最强大模型,赢点是把预测能力接进『今天该给哪个客户备多少货』这个具体环节——对易腐品,早一天预测准就少一车烂菜。
#行业应用
另有 2 家信源报道
展开详情
  • **数字**:短期需求预测准确率最高提升 40%,SKU 级需求可见性显著改善,超额库存与损耗一起下降
  • **规模**:4 万英亩、5000 万箱/年、400+ SKU、6 万+ 车次的真实体量,不是 demo 级样本
  • **打法**:不追大模型,把预测嵌进易腐货补货与路由流程——早一天预测准,就少一车报废
推荐理由:对个人:农业、生鲜、冷链这类『不性感』的行业,恰恰是 AI 落地最容易见到真金白银的地方——损耗和库存就是白花花的钱。你不需要会训模型,需要懂这个行业的数据长什么样、卡在补货/排产/路由哪一步。会把现成预测/优化能力接进某个具体行业流程的人,比会跑 benchmark 的人更稀缺,也更好变现。
#02
indiehackers.com Product 直接可用
NEW

Meerkats.ai:一个人四周做到 $3k MRR 的 AI 增长编排平台,把 SDR/营销/代理的重复活打包成软件

有 20 年 SaaS go-to-market 经验的 Santanu Dasgupta,做了个叫 Meerkats.ai 的『AI 增长编排平台』——把 SDR、营销和外包代理常干的重复活(抓取和补全关系数据、找线索、跑触达、跟进)用软件替掉,相当于把一间数字增长代理公司塞进一个订阅产品里。一个人、在拥挤的赛道里,发布四周就做到 $3k MRR。它的样本价值不在技术多新,而在证明:把你最懂的那套业务流程编排成 AI 产品,是当下最快的现金流路径之一。
#小微现金流#订阅制 SaaS,具体档位见…
另有 1 家信源报道
展开详情
  • **成绩**:单人、四周、$3k MRR,赛道拥挤仍跑通——不是靠新模型,是靠把一套熟悉的增长流程产品化
  • **切口**:替掉 SDR/营销/代理的重复劳动(找线索、补数据、跑触达、跟进),卖给最痛这块的中小团队
  • **壁垒**:创始人 20 年 GTM 经验本身就是护城河——他知道每一步该编排成什么,比通用工具更贴业务
推荐理由:对想挣现金流的普通人:最快变现的不是最新技术,是『你已经很懂的那套流程 + AI 编排 + 订阅收费』。找一个你亲手做过、别人还在手动重复的工作流(招聘、催收、排班、外联……),把它做成一个能自己跑的小产品,一个人四周就可能起量。领域知识是你相对大厂的真壁垒。
My Take:评分(5=最优):最快成交 4 / 最低成本 4 / 可复制 3 / 风险安全度 4。用你最懂的业务流程做 AI 编排,是单人变现最快的路径之一。
商机信号(加速):谁付钱:没钱养整支 SDR/营销团队、又要持续找线索跑增长的中小 SaaS 与服务型创业者 痛点:增长动作全是重复手工活(找人、补数据、发触达、跟进),外包代理贵、内部又雇不起团队 切入点:挑一个你自己做过的细分增长流程(如某垂类的冷启动外联),做成能自动跑的订阅小工具,靠领域 know-how 做出比通用工具更准的编排
#03
llm-stats.com Article
NEW

评测该看哪一榜:Terminal-Bench 上 GPT-5.5 领先,换到 MCP Atlas 工具调用榜冠军就变成 Gemini 3.5 Flash

同样是『考 agent 会不会干活』,不同基准给出的冠军完全不同。Stanford + Laude 的 Terminal-Bench 2.0 考命令行终端掌控力,GPT-5.5 以 82.7% 登顶;而 Scale 的 MCP Atlas 考通过 MCP 协议做真实工具调用,冠军换成了 Gemini 3.5 Flash(83.6%),Claude Opus 4.7 在这一项是 77.3%。结论很实在:没有一个模型在所有『agent 能力』维度上通吃,选型前得先弄清你的活到底考哪一项。
#评测
另有 2 家信源报道
展开详情
  • **对比**:Terminal-Bench 2.0 上 GPT-5.5 82.7% vs Gemini 3.5 Flash 76.2%;但换到 MCP Atlas 工具调用榜,Gemini 3.5 Flash 83.6% vs Claude Opus 4.7 77.3%
  • **分野**:终端掌控(跑命令、修环境)和 MCP 工具调用是两种能力,冠军互不重合,别用一个分数概括『谁更会当 agent』
  • **方法**:Scale 今年把 MCP Atlas 评分判官升级、加了瞬时错误重试、把 20 轮上限改成每任务最多 100 次工具调用预算——评测本身也在往真实场景靠
推荐理由:对开发者:选 agent 底座别只看一个总榜。如果你的场景是命令行/CI/环境操作,优先看 Terminal-Bench 类分数,GPT-5.5 目前占优;如果核心是走 MCP 调一堆外部工具、长链路任务,Gemini 3.5 Flash 在 MCP Atlas 上更强且便宜。先想清『我的活考哪一项』,再按那一项的榜单选,比追总榜首靠谱得多。
#04
arXiv Paper
NEW

Tool-Making and Self-Evolving LLM Agents in Low-Latency Systems

这篇论文针对一个很实际的痛点:agent 在推理时反复即兴写代码(inference-time coding loop)既慢又不稳。它提出一条『造工具』的流水线——把反复出现的标准操作步骤(SOP)提前编译成经过验证、带版本的工具,部署前就固化好,运行时直接调用而不是每次重新生成。本质是把 agent 从『每次现编』升级成『会沉淀可复用工具的自进化系统』,特别适合对延迟敏感的生产环境。
把『agent 每次都临场写代码』换成『提前把重复步骤编译成可复用工具』,为低延迟场景下的 agent 工程给出一条可落地的路子。
#AI Agent
展开详情
  • **问题**:推理时反复即兴写代码的循环,既拖慢延迟又难保证正确性,是生产 agent 的隐性成本大头
  • **方法**:把重复的 SOP 步骤离线编译成经验证、带版本的工具,部署前固化,运行时直接调用
  • **意义**:给『self-evolving agent』一个工程化定义——不是越跑越玄,而是把跑过的经验沉淀成可复用、可审计的工具库
推荐理由:对个人:这篇给了一个可迁移的工程直觉——好的 agent 不该每次都从零现编,而该把做过的事沉淀成可复用工具。你自己搭 agent 时也一样:与其堆更长的提示,不如把高频动作固化成稳定的工具/脚本,既快又可控。『把经验编译成工具』的能力,正在成为 agent 工程的核心手艺。
#05
getmaxim.ai Article
NEW

真正的瓶颈从模型变成了连接:MCP Gateway 正长成 agent 时代的新基础设施品类

2026 是『AI 真正动手干活』的一年,而动手就需要把云端的 agent 大脑安全地接到本地数据库、脚本、CI/CD。业内的共识是:真正的瓶颈已经从模型能力,变成了连接——怎么把本地 MCP server 稳定暴露给云端 agent,不掉会话、不留鉴权口子。MCP Gateway 就是冲这个缝隙长出来的品类:把鉴权、工具路由、可观测性、治理收进 agent 与工具之间的一层控制面。Gartner 甚至预测多数 API 网关厂商会把 MCP 能力纳进来。与此同时治理落差仍在——一份 225 位安全/IT 负责人的调查显示,多数组织能看到 agent 在干什么,却在出事时拦不住它。
#Infra
另有 2 家信源报道
展开详情
  • **转向**:瓶颈从『模型够不够强』变成『本地系统怎么安全接给云端 agent』——连接成了新的硬骨头
  • **品类**:MCP Gateway 把鉴权/工具路由/可观测性/治理收进一层控制面;Gartner 预测多数 API 网关厂商将纳入 MCP 能力
  • **落差**:225 位安全/IT 负责人调查——多数组织能监控 agent,却在它出错时拦不住,治理仍是缺口
推荐理由:对个人:agent 从『会聊天』走向『会动手』,中间的连接层和治理层正在批量创造新岗位和新生意。学会用 MCP 把系统安全地接给 agent、并给它加上审计和熔断,是比调提示更抢手的新技能;而大厂的 gateway 往往只服务头部客户,帮中小团队『安全地把 agent 接进业务』这件事,个人和小团队完全切得进去。
商机信号(加速):谁付钱:想让 agent 碰内部系统、又怕鉴权失控和出事拦不住的中小企业与开发团队 痛点:把本地系统接给云端 agent 时会话易断、鉴权有口子,且缺少『出错能立刻拦停』的统一控制面 切入点:为某个垂类(如财务/客服系统)做轻量 MCP 接入 + 审计熔断的落地服务,帮买不起大厂 gateway 的团队安全上线 agent
#06
agensi.io Article
NEW

写 Agent Skills 也能变现:技能市场从 1 家涨到 8 家,创作者拿 80% 分成、按月订阅调用全目录

Agent skills 生态在半年里从『一个注册表』长成了八家主流市场。变现路径正在成型:以 Agensi 为例——每个 skill 上架前先过安全扫描,创作者拿 80% 分成,Pro 订阅用户 $9/月即可 MCP 实时调用整个目录;还有 SkillsMP 汇聚了 GitHub 上 200 万+ 公开技能、Netresearch 的市场则做成跨 Claude Code / Cursor / Copilot / Codex / Gemini CLI 等 30+ agent 可移植。信号很明确:『写一个好用、可复用的技能』本身正在成为一门能收费的手艺,而不只是自用脚本。
#Skills#元技能
另有 1 家信源报道
展开详情
  • **格局**:agent skills 市场半年从 1 家扩到 8 家,官方(anthropics/skills)+第三方(Agensi/SkillsMP/Netresearch)并存,生态在快速成型
  • **变现**:Agensi 创作者拿 80% 分成、上架先过安全扫描,Pro 用户 $9/月 MCP 实时调用全目录——技能开始有清晰的收费闭环
  • **可移植**:Netresearch 市场做成跨 Claude Code/Cursor/Copilot/Codex/Gemini CLI 等 30+ agent 可用,一次写、多端复用
推荐理由:对个人:写 Skills 正从『自用脚本』变成一门能卖钱的手艺。如果你在某个细分场景(某行业的取数、某种格式的文档处理)积累了可靠的工作流,把它打磨成一个安全、可复用、跨 agent 可移植的 skill 上架市场,就有了被动收入的入口。会把 know-how 封装成好技能的人,现在有了明确的变现渠道。
商机信号(萌芽):谁付钱:想省事、愿意为现成可靠技能付月费的 agent 重度用户与中小团队,以及靠分成变现的技能创作者 痛点:自己从零写和维护高质量 skill 成本高、质量参差,市场又缺乏安全审核与可移植标准 切入点:锁定一个你有真实 know-how 的细分场景,做几个安全、可复用、跨 agent 的高质量 skill 上架分成市场,先靠垂类深度而非数量取胜
#07
getperspective.ai Article
NEW

被 Anthropic、OpenAI 抄作业的 Palantir FDE 打法:按管道额度配人、驻场 8–16 周、上线第一天就交东西

这篇把 Palantir 那套被 Anthropic、OpenAI 直接抄作业的 FDE 打法压成了四条动作:每 200–500 万美元企业管道配 1 名 FDE、在单一客户处驻场嵌入 8–16 周、要求上线第一天就交付可用东西(拒绝需求文档表演)、并持续做对话式客户发现。它讲的不是『FDE 很缺人』这个结论,而是把『怎么组织和跑一支 FDE 队伍』的方法论掰开揉碎——核心是用交付节奏和贴身驻场,把模型能力真正压进客户的混乱业务里。
#FDE
另有 2 家信源报道
展开详情
  • **四招**:每 $2–5M 管道配 1 名 FDE、单客户驻场嵌入 8–16 周、上线第一天就交可用东西、持续做对话式客户发现
  • **反模式**:拒绝『需求文档表演』——不是先写长文档再开发,而是 day-one 就交东西、在真实反馈里迭代
  • **抄作业**:这套原是 Palantir 的打法,如今 Anthropic、OpenAI 都在复制——说明 AI 落地的组织方式正在收敛成一种范式
推荐理由:对个人:AI 落地最值钱的能力不是训模型,是『把模型能力压进客户混乱业务』的交付手艺。这套 FDE 方法论其实是一份可自学的清单——学会拆用例、评估数据/权限/治理就绪度、day-one 交付、贴身迭代。哪怕你不进大厂,把这套打法用在自己的外包/咨询/落地项目上,也能显著提高成单和交付质量。
#08
aiacceleratorinstitute.com Opinion
NEW

Andrej Karpathy

在 LLM agent 之上,正在长出新的一层——它把编排、调度、上下文、工具调用和持久化整体抬到下一个台阶。
据 AI Accelerator Institute 整理,Karpathy 近期用一段短文表达了对这层新抽象的兴奋:模型本身已不是最有意思的部分,真正的新战场是模型之上的编排与持久化层——谁来调度多个 agent、怎么管上下文、工具调用如何被组织、状态如何跨会话持久化。这和今天其他条目(MCP gateway、tool-making 论文、FDE 交付)其实指向同一件事:AI 的价值正在从『单个模型多聪明』转移到『模型之上那层系统工程做得多好』。
#AI Agent
另有 1 家信源报道
推荐理由:对个人:如果你还在纠结『该学哪个模型』,方向可能错了。真正在长出机会的是模型之上的编排层——多 agent 调度、上下文工程、工具组织、状态持久化。把精力投在『怎么把一堆 agent 和工具编排成一个可靠系统』上,比追逐每一次模型更新更有复利。这层能力今天还稀缺,正是普通人能建立优势的窗口。
7月28日 周二 · 8 条
今日趋势综述
2026 下半年的主线已经很清楚:模型能力过剩,真正的瓶颈和机会都在『让 agent 可靠地落进真实业务』——给它对的知识(Pinecone Nexus)、管住它能做什么(Kastra)、让它记住该记的(记忆论文),个人的机会全在这『最后一公里』。
今天的信号:模型已经不是瓶颈,『把 agent 落进业务』才是

今天几条硬信号指向同一个判断——模型强不强已经不再是胜负手。Pinecone 把自己从向量库重命名成『agent 的知识引擎』,Nexus 进入公测,主打『把公司知识预先编译好、让 agent 直接查』;一篇 7 月的论文《Memory as a Controlled Process》给出同样的判断:当模型执行力够强,瓶颈就从『会不会推理』转移到『对的经验有没有在对的时刻被调出来』。Docker 在 AI Engineer World's Fair 的报告更直接:evals、上下文工程、harness 工程、memory、sandbox 正在长成一批 agent 专属的新工种。翻译成一句话:值钱的不再是模型本身,而是模型外围那一整套『让它可靠干活』的工程。

与『喂对知识』并列的另一半,是『管住它能做什么』。Kastra 本周在 Product Hunt 上线,做的就是 agent 的运行时授权层——动作执行前先过确定性策略、亚毫秒级拦截,一套控制面管 Claude Code、Cursor、Codex、OpenClaw。它和前几天的 OpenAI Presence、Alterion Draco 同一命题:2026 下半年,巨头和创业者一起在把 agent 关进『可审计、可约束』的笼子。而这套能力在真实行业里的兑现方式,就是今天的法律 AI 实测和 FDE 需求爆炸——律所赢家赢在『把 AI 卡进某一道工序、用引用准确率 99.2% 这种硬指标说话』;FDE 岗位一年涨 729%、资深年薪冲到 $785K,值钱的正是『翻越集成墙、把模型接进客户烂系统』的最后一公里。

对个人的可执行结论:把注意力从『哪个模型最强』移开,押注三件能复利的事。一是外围工程能力——上下文/记忆管理、eval、harness、agent 授权与护栏,这些是招聘市场正在开的新岗、也是把 demo 做到生产的分水岭;二是行业最后一公里——别做通用大模型,去帮某一类客户把某一道工序真正嵌进去,切口越窄、指标越硬越好成交(法律的合同审查、判例检索都是现成模板);三是可落地的现金流——像 AI 催缴找回失败支付这种『帮别人止血、按止血额分钱』的小生意,痛点硬、ROI 一算就清、客户天然愿付。今天每一条,都在说同一句话:谁能把『能力』翻译成『客户敢用、能算出 ROI 的流程』,谁就掌握了模型进步也抹不平的价值。

#01
kastra.ai Product
NEW

Kastra:给 AI agent 装『运行时授权层』——动作执行前先过策略,亚毫秒级拦截

Kastra 是一个 agent 运行时授权层:在 agent(Claude Code、Cursor、Codex、OpenClaw,以及 Anthropic/OpenAI SDK 等)真正执行工具调用之前,先用确定性策略判断『这个动作能不能做』,据称亚毫秒级延迟,覆盖工具、提示、输入、输出四个层面,一套控制面统一治理。它解决的不是 agent 聪不聪明,而是『敢不敢放它动手、出了事怎么兜底』。
#Infra#面向开发者/企业,本周在 P…
另有 2 家信源报道
展开详情
  • **定位**:不是又一个 agent 框架,而是横在 agent 与工具之间的『授权闸门』,动作执行前先拦一道
  • **能力**:亚毫秒级、确定性策略,覆盖工具调用/提示/输入/输出,一套控制面管 Claude Code、Cursor、Codex、OpenClaw、各家 SDK
  • **信号**:与 OpenAI Presence、Alterion Draco 落在同一命题——2026 下半年的主战场是『把 agent 关进可审计的笼子』
推荐理由:对个人:agent 的『会做事』已经不稀缺,『能被信任地放它做事』才稀缺。学会给 agent 设计策略、护栏、审批与授权,是比调提示更抢手的新技能;而这类治理平台往往只服务头部大客户,中小团队照样需要有人帮他们『安全地放 agent 进业务』——这正是个人和小团队能切进去的缝隙。
商机信号(加速):谁付钱:已经在用 Claude Code/Cursor/Codex 让 agent 碰生产系统、但怕它误删误改的开发团队与中小企业 痛点:agent 能跑 shell、改代码、调 API,一旦越权后果严重,却没有统一的『执行前拦一道』的机制 切入点:个人可先做垂直场景的策略模板与集成服务(如给某类 SaaS 团队配好 agent 授权规则),按月收治理配置费,不必自己造平台
#02
pinecone.io Product
NEW

Pinecone Nexus 公测:把公司知识『编译』成结构层,让 agent 直接查而不是每次重新检索

Pinecone 把自己从『向量数据库』重新定位成『agent 的知识引擎』:Nexus 用 Context Compiler 把组织里散落的文档预先编译成结构化知识层,配一套声明式查询语言 KnowQL,让 agent 直接查询『已经整理好的上下文』,而不是每次调用都重新检索原始文档。官方给的数字很激进:任务完成率 90%+、完成速度最高快 30 倍、token 花费最多降 90%。5 月推出,7 月 1 日进入公开预览。
#Infra#公开预览(Public Pr…
另有 2 家信源报道
展开详情
  • **思路转变**:从『每次 retrieval』升级到『一次 knowledge compilation』——把推理提前到『编译知识』阶段,而非临场检索
  • **数字(厂商自报)**:官方称任务完成率 90%+、速度最高快 30×、token 支出最多降 90%(待第三方复现)
  • **同一命题**:2026 的共识是『瓶颈不再是模型,而是让 agent 拿到对的知识』——Nexus、agent 记忆论文都在回答这件事
推荐理由:对个人:这条印证了一个可下注的方向——模型能力过剩之后,『把知识整理成 agent 能高效消费的形态』成了新的价值点。你不必造向量库,但可以学会『上下文工程』:帮某个行业/某家公司把杂乱文档、SOP、案例编译成结构化知识层,喂给他们的 agent。这是介于『懂业务』和『懂 AI』之间的一块高价值缝隙。
#03
arXiv Paper
NEW

Memory as a Controlled Process: Learned Adaptive Memory Management for LLM Agents

这篇 7 月的论文提出一个反直觉但重要的判断:当底层 LLM 的执行能力越来越强,agent 的约束瓶颈就从『会不会推理』转移到了『能不能在对的时刻把对的经验/记忆调出来』。作者把记忆当成一个『被学习控制的过程』来管理——自适应地决定什么该记、什么该忘、什么时候该调用,而不是简单地把所有历史堆进上下文。它和 Pinecone Nexus 是同一枚硬币的两面:一个从外部知识入手,一个从 agent 自身记忆入手,都在解『让 agent 拿到对的上下文』。
把 agent 记忆从『存了就行』升级为『学着管理』:当模型执行力够强后,瓶颈从推理转移到——该在对的时刻把对的经验捞出来。
#AI Agent
展开详情
  • **核心判断**:模型够强之后,瓶颈不再是推理能力,而是『对的经验有没有在对的时刻被 surface 出来』
  • **方法**:把记忆当『被学习控制的过程』,自适应管理记什么/忘什么/何时调用,而非无脑堆历史
  • **意义**:与外部知识引擎(如 Nexus)互补,共同指向 2026 的主线——上下文与记忆管理才是 agent 落地的真瓶颈
推荐理由:对个人:如果你在搭 agent,别再一股脑把所有历史塞进上下文——学会『记忆管理』(压缩、选择性召回、及时清理工具结果)会直接决定 agent 在长任务里的可靠性和成本。这套『上下文/记忆工程』正在从论文变成一线工程师的必备手艺,越早练越值钱。
#04
develeap.com Article
NEW

模型不再是瓶颈:evals、上下文工程、harness 工程正在长成 agent 时代的新工种

2026 的一个共识正在成型:agent 落地失败,多半不是模型不行,而是把模型接进真实系统的那一整套『外围工程』没做好。Docker 在 AI Engineer World's Fair 2026 的报告里,把一批 agent 专属的新学科单独拎了出来:evals(评测)、上下文工程、harness 工程、memory、sandbox、平台工程、推理优化。与此同时,超过 70% 的组织已在生产里同时用 3 个以上模型,Gartner 预测到 2027 年底超 40% 的 agentic AI 项目会被砍掉——不是因为模型差,而是每多一步就叠加一层可靠性风险,demo 级成功率掩盖了序列级失败。
#AI Agent
另有 2 家信源报道
展开详情
  • **新工种**:Docker 报告点名 evals、上下文工程、harness 工程、memory、sandbox 等 agent 专属学科正在独立成型
  • **数字**:70%+ 组织生产里同时跑 3+ 模型;Gartner 预测 2027 年底 40%+ agentic 项目被砍
  • **本质**:失败点从『模型会不会』转向『工具调用、分支、重试、交接叠起来的序列级可靠性』
推荐理由:对个人:这是一张很清晰的技能地图。别再只盯着『哪个模型最强』,去补 agent 的外围工程——怎么写 eval、怎么做上下文/记忆管理、怎么搭 harness 和 sandbox。这些是招聘市场正在开出的新岗位,也是把 agent 从 demo 做到生产的分水岭,现在入场还是蓝海。
#05
attorneyatwork.com Article
NEW

法律 AI 落地实测:赢家不是买了最强模型,而是把 AI 卡进某一个具体工作流

法律是今年 AI 落地最真实的赛道之一,但一手数据同样『温和且看流程』:用 AI 的律所从 2024 年 26% 涨到 2026 年 42%。真正跑出效果的都不是『上了个通用法律大模型』,而是把 AI 卡进某一道具体工序——一家中型所把合同审查时间砍掉约 60%;Rupp Pfalzgraf 经 18 个月推广做到 86% 律师使用率,复杂联邦法院动议起草时间压到原来的约 1/4;一家法律检索公司做 RAG,只死磕一个指标『引用准确率』,做到 99.2%,从语料设计到合伙人采用花了 6 个月。共同点:从单一工作流的小试点起步,用可量化的『省了多少时间/准了多少』说话。
#行业应用
另有 2 家信源报道
展开详情
  • **大盘**:用 AI 的律所两年从 26% 升到 42%;但赢家赢在『嵌进某道工序』,不是『买最强模型』
  • **数字(合同/动议)**:合同审查提速约 60%;Rupp Pfalzgraf 86% 采用率、复杂动议起草压到约 1/4 时间
  • **数字(检索)**:一家所死磕单一指标『引用准确率』做到 99.2%,6 个月从语料到合伙人采用——单点极致胜过全面平庸
推荐理由:对想吃行业 AI 红利的人:法律再次验证了那条落地铁律——别做『通用法律 AI』,去帮某一类律所把某一道工序(合同审查、动议起草、判例检索)真正嵌进去,并用『每单省几小时、引用准到几个 9』这种可量化结果说话。切口越窄、指标越硬,越容易成交和续费。
商机信号(加速):谁付钱:中小律所与企业法务团队——预算有限、但对『省律师工时』和『引用不能出错』愿意付费 痛点:通用 AI 会一本正经编造判例(幻觉),而律师最不能容忍引用出错;同时合同审查、动议起草这些重复工序极耗工时 切入点:个人可切一道最窄的工序(如某类合同的审查或某州法院的动议模板),用 RAG+引用校验做到『引用准确率』可验证,按所或按案收费
#06
slickerhq.com Product 直接可用
NEW

AI 催缴/失败支付找回:一门被低估的小微现金流生意——帮订阅制商家把漏掉的钱捞回来

订阅制生意平均因『非自愿流失』(卡过期、余额不足、发卡行拦截)损失约 9% 的 MRR——一个 $10K MRR 的公司每月白白漏掉 $900–1000。传统催缴用死板的重试和通用邮件只能找回 30–40%,而 AI 催缴会读拒付码、发卡行规律、地区发薪周期,挑对的时间和话术重试,把找回率拉到 65–80%。已有真实产品跑通:Churnkey 做到约 $30K MRR、平均帮客户降 18% 流失。对一个每月漏 $1000 的商家,一个 $50–100/月、能捞回两三成的工具是『显然该买』。
#小微现金流#典型 $50–$299/月,…
另有 2 家信源报道
展开详情
  • **痛点(有数字)**:订阅制平均漏 ~9% MRR 于非自愿流失;$10K MRR 每月漏 $900–1000
  • **对比(有数字)**:传统催缴找回 30–40%,AI 催缴(读拒付码+择时重试)找回 65–80%
  • **已跑通**:Churnkey 约 $30K MRR、平均降 18% 流失——需求被验证过,不是空想
推荐理由:对想挣现金流的普通人:这是一门『帮别人止血、按止血额分钱』的好生意——痛点明确、ROI 一算就清、客户天然愿意付费,且技术门槛不高(读 Stripe 拒付码 + AI 择时择话术)。切口:盯某一类用 Stripe 的中小订阅商家,做一个轻量的失败支付找回工具或代运营服务,按月费或按找回分成收费。
My Take:评分(5=最优):最快成交 4 / 最低成本 4 / 可复制 4 / 风险安全度 4。痛点硬、ROI 可算、按找回分成低阻力,适合个人切入的现金流生意。
商机信号(加速):谁付钱:用 Stripe 的中小订阅制 SaaS/会员制商家——已经在漏钱、也知道在漏,只是没优先去修 痛点:每月 ~9% MRR 因卡过期/余额不足悄悄流失,通用催缴邮件找回率低,老板往往没精力管 切入点:个人可做一个专攻某类商家的轻量催缴工具或代运营,读拒付码智能重试,按『找回金额分成』收费,ROI 对客户一目了然
#07
paraform.com Article
NEW

Forward Deployed Engineer 需求爆炸:一年岗位涨 729%,资深年薪冲 $785K,值钱的是『翻越集成墙』

FDE(前沿部署工程师)的需求在 2026 继续井喷:岗位从 2025 年 4 月的 643 个涨到 2026 年 4 月的 5330 个,同比约 729%;资深 FDE 薪酬普遍 $250K–400K,Anthropic/OpenAI 的资深岗能到 $785K+。为什么这么贵?因为大多数 AI 项目不是死于模型差,而是死于『集成墙』——模型接不上客户的老旧 SQL、搞不定 OIDC/SAML 认证、过不了数据驻留合规。FDE 就是那个『把模型能力翻译成能跑在客户真实系统里』的人,是前沿实验室把模型能力变成企业收入的主要通道。
#FDE
另有 2 家信源报道
展开详情
  • **数字**:FDE 岗位一年涨约 729%(643→5330);资深年薪 $250K–400K,Anthropic/OpenAI 资深岗 $785K+
  • **本质**:值钱的不是会调模型,而是翻越『集成墙』——接老旧 SQL、搞定 SAML/OIDC、过数据驻留合规
  • **定位**:FDE 是把模型能力变成企业收入的『最后一公里』通道,需求指数增长而供给线性增长
推荐理由:对个人:这是最直白的一条『往哪走』信号——纯调模型/写提示的价值在被商品化,而『把 AI 真正接进企业烂系统并跑通』的能力在暴涨溢价。想涨薪的工程师,补的不是又一个模型 API,而是企业集成那套硬功夫:认证、数据管道、合规、和客户业务流的对接。这块供给远跟不上需求,是当下确定性最高的加薪路径之一。
#08
platform.claude.com Article
NEW

写好 Agent Skill 的第一杠杆:把 description 当『路由规则』写,而不是摘要

随着 skills 生态爆发,『怎么写好一个 skill』的官方与社区共识在收敛,而最被低估的一条是:description 才是最高杠杆的一行字。因为启动时模型唯一看到的就是每个 skill 约 100 token 的元数据(完整指令 <5k token,命中才加载),所以 description 不该写成『这个 skill 是干嘛的』摘要,而要写成一条路由规则——回答『什么时候该触发我』。配套的工程共识:SKILL.md 控制在 500 行内、文件引用只下探一层、长参考文件加目录——本质都是『渐进式披露』,别让上下文一次性被撑爆。
#Skills#元技能
另有 2 家信源报道
展开详情
  • **最高杠杆**:启动时模型只看到每个 skill ~100 token 的 description;把它写成『何时触发』的路由规则,而非『是什么』的摘要
  • **token 账**:元数据 ~100 token 常驻扫描,完整指令 <5k token 命中才加载——这就是渐进式披露省 context 的逻辑
  • **工程规矩**:SKILL.md <500 行、文件引用只下探一层、长文件加目录,别一次性把上下文塞满
推荐理由:对个人:skills 正在成为 AI 时代的『可复利资产』,而写好它的门槛其实很低、回报很高。记住这条最省力的心法——先把 description 打磨成精准的触发规则(它决定 skill 会不会被用起来),再用渐进式披露把内容分层。练熟这套『元技能』,你攒下的每个 skill 都能被反复调用,越用越值钱。