Hall of Fame
Hall of Fame
Track
Type
Source
8月11日
今日趋势综述
今天的信号高度一致:顶部模型的『纯智力』已打成平手,价值正整体迁移到把 AI 接进真实流程的接口层、工程层与交付层——赢家是做管道、写 skill、卡进流程、控成本的人。
今天的信号:模型追平之后,钱在『接口、工程和交付』这三层
把今天几条串起来看,一条主线特别清楚:模型的『纯对话智力』已经追平了。LMArena 8 月文本榜上,Claude Fable 5、Opus 4.8、GPT-5.5 Pro、Gemini 3.1 挤在 20 分内,第一名统计上已不重要。当能力本身不再是差异,价值就往两头跑——往下沉到工程与成本(投机执行让 agent 提速 2–5 倍、Anthropic 的 effort 档位让你为『该想多久』精细付费),往上浮到接口与交付(Tabstack 把『读网页』做成按量付费 API、OpenCode 用不锁定的开源底座滚出 750 万月活)。
而真正把钱赚到手的,是把这些能力装进一个具体流程的人。银行把 agent 卡进 KYC/AML 合规流水线,开户时间砍 90%、误报降 60%,赢的不是买了最强模型,而是嵌得够深、够可审计。FDE(前沿部署工程师)成了全行业收敛的交付模型、开到七位数薪资,稀缺的正是『懂业务 + 能把 demo 变成生产系统』的人。就连 PostHog 那篇写 skill 的文章也是同一件事的微观版:把你脑子里的 know-how 结构化地交给 agent。
对个人来说,方向很明确:别再追『哪个模型最强』——那场仗顶部几家已经打平了。把精力押在连接组织(会用 agent 基础设施 API 拼出垂类应用)、工程手艺(会用并行/投机执行让 agent 又快又省、会按任务调算力档位控成本)、和落地交付(懂一个具体行业流程、能把 agent 接进去并做到可审计)上。会写 skill、会接管道、会卡进流程的人,等于把自己的经验批量复制——这才是模型追平之后,普通人还能拉开差距的地方。
#01
tabstack.ai
Product
NEW
Tabstack by Mozilla:给 AI agent 一个『读网页』的干净 API,用无障碍树替代截图
Mozilla 出的一套面向 agent 的网页访问 API:一个 /extract 把网页转成 Markdown 或按你给的 schema 抽成结构化 JSON,/generate 在线改写内容,/automate 让 agent 点击/滚动/填表。核心差异是用页面的无障碍树(accessibility tree)而不是截图来理解页面,官方称比截图式 agent 少用 60–80% token,还能稳住 JS 重的动态页面。7 月初上线时是 Product Hunt 当日第 3、388 个赞。
另有 1 家信源报道
展开详情
- **省 token**:无障碍树替代截图,官方称同任务少烧 60–80% token,动态/JS 页面也能稳定解析
- **三件套**:/extract 抽数据、/generate 改内容、/automate 执行操作,一个 API 覆盖『读网页』全链路
- **门槛低**:免费 5 万 credits/月起步,$1/千次 Markdown,个人开发者用 Starter $49/月基本够跑
推荐理由:agent 落地最脏最烦的一环就是『可靠地读网页』——自己搭 Playwright + 反爬 + 截图识别,维护成本高还经常崩。把这一层外包给一个按量付费的 API,你就能把精力放在业务逻辑上。对个人开发者的机会:不必自己造轮子,用这类『agent 基础设施 API』快速拼出一个能真跑的垂类 agent(如自动比价、自动填表、竞品监控),成本从几百刀降到几十刀。
商机信号(加速):谁付钱:在做垂类 agent、需要稳定抓网页/填表却不想自建爬虫栈的独立开发者和小团队 痛点:自建浏览器自动化要处理反爬、动态渲染、截图识别,token 贵、易崩、维护重 切入点:用它做『某个具体场景的网页 agent 即服务』——比如帮电商卖家自动监控竞品价格/库存,按月订阅收费,底层网页访问全外包给 Tabstack
#02
localaimaster.com
Article
NEW
LMArena 8 月文本榜:Claude Fable 5 登顶,但前四挤在 20 分内——第一名已经不重要了
LMArena(原 Chatbot Arena)7 月 12 日重新基准化后,8 月文本榜第一是 Claude Fable 5(约 1525 ELO),但紧随其后的 Claude Opus 4.8、GPT-5.5 Pro、Gemini 3.1 Pro Preview 全挤在它身后约 20 分内、置信区间大面积重叠。GPT-5.6 家族 7 月 31 日才进主文本榜,Grok 4.5 主要在 Agent/Vision/Document 分榜发力。信号很清楚:顶部几家的『纯对话智力』已经拉不开差距。
另有 2 家信源报道
展开详情
- **对比**:Claude Fable 5 ~1525 vs Claude Opus 4.8 ~1510 vs GPT-5.5 Pro ~1510(LMArena 文本榜 8 月,前四置信区间重叠)
- **分榜分化**:GPT-5.6(Luna/Terra/Sol)7/31 才进主榜,Grok 4.5 在 Agent/Vision/Document 分榜更强——看总榜第一会误导
- **方法论**:Arena 7/12 重新基准化、只算 7/1 恢复后的票,读榜要看『用哪版分数、哪个时间切片』
推荐理由:当前四名在综合对话上打成平手,『用哪个模型』就不该再看总榜第一,而要看你的具体场景:写代码看编码分榜、跑 agent 看 Agent 分榜、要长文档看 Document 分榜;同分段就转而比价格和延迟。对普通人的机会:别为『榜一』的品牌溢价买单,学会按任务选分榜、按预算选便宜够用的那个,一个月能省下真金白银的 API 账单。
#03
newsletter.posthog.com
Article
NEW
PostHog:没人告诉你的『写 agent skill』真相——不触发几乎都是 description 的锅,不是指令的锅
PostHog 把内部写 skill 的经验掏出来,最反直觉的一条:skill 不触发,几乎从来不是正文指令写得不好,而是 description 没写对——要用第三人称、明确写清什么时候用、并写进用户真会敲的关键词而非同义改写。另一条:skill 应该像『有经验的人怎么干这件事』的模板,而不是一串死命令;只写 agent 不知道的东西(数据在哪、用哪个工具、schema 长啥样),塞太多上下文反而降低表现——5 行代码片段胜过 5 段解释。
另有 1 家信源报道
展开详情
- **触发靠描述**:skill 不激活 99% 是 description 的问题——用第三人称、写清触发时机、放用户真会敲的关键词
- **像模板不像脚本**:写『有经验的人怎么做这件事』+ 为什么这么做 + 注意什么,别写死命令,否则换场景就崩
- **少即是多**:只补 agent 推不出来的信息(数据位置/该用的工具/schema),5 行代码胜过 5 段解释,塞太多反而拉低表现
推荐理由:skill / prompt 工程正在变成 AI 时代的一项通用可迁移技能——它本质是『把你脑子里的 know-how 结构化地交给 agent』。普通人的机会:从你最熟的那件事(报销流程、周报、竞品分析)开始写成 skill,先自用提效,写熟了这套『description 定触发、模板定行为、精简定质量』的方法论后,还能给团队/客户做 skill 库外包。会写 skill 的人,等于会把自己的经验批量复制。
#04
lyzr.ai
Article
NEW
银行 AI agent 落地实测:某荷兰银行 KYC 开户时间砍 90%、AML 单案调查省 50%,赢在把 agent 卡进合规流水线
2026 年银行业把 agent 从『聊天机器人表演』推进到真自动化:某荷兰金融机构用 AI 把 KYC 开户时间压缩 90%、合规人力减 30%;EY 数据显示 AML 单案调查平均省 50% 时间;成熟部署的反欺诈 agent 把误报率降 60% 以上。共性不是买了最强模型,而是把 agent 精确嵌进 KYC/AML/反欺诈这些既有合规工作流的每个环节。IDC 称 agentic AI 平均 13 个月内 2.3 倍回报。
另有 2 家信源报道
展开详情
- **KYC**:荷兰某行开户时间 -90%、合规人力 -30%——瓶颈环节被 agent 端到端接管
- **对比**:AML 单案调查省 50% 时间(EY)、反欺诈误报率降 60%+(成熟部署)、整体 13 个月 2.3x ROI(IDC)
- **赢法**:不是换最强模型,而是把 agent 卡进合规流水线的每个具体步骤,可审计、可回溯是前提
推荐理由:金融是强监管、流程密、人力贵的典型行业,恰恰是 agent 落地 ROI 最高的地方——但价值在『把 agent 接进合规流程并做到可审计』,而非模型本身。对个人的机会:懂某个具体合规环节(KYC 尽调、AML 可疑交易复核)的人,加上会搭 agent,就能做区域性银行/持牌机构的落地集成,这类『懂业务 + 会接 agent』的交付角色正在高价抢人。
商机信号(加速):谁付钱:中小银行、持牌支付/消费金融机构的合规与风控团队,正被 KYC/AML 人力成本和监管压力逼着买单 痛点:KYC/AML/反欺诈全靠人海堆,慢、贵、误报高,还要经得起监管审计 切入点:帮一家区域性银行/持牌机构做单一环节的 agent 落地(如 KYC 尽调自动化),按项目交付 + 可审计报表收费,跑通一个再复制到同类机构
#05
essamamdani.com
Article
NEW
OpenCode 破 16 万星、月活 750 万:终端里的开源编码 agent 正在吃下 2026
SST 团队做的终端原生编码 agent OpenCode(Go 写的)据报已冲过 16 万 GitHub star、月活约 750 万开发者,被称为 GitHub 史上增长最快的开发工具之一。卖点是彻底模型无关、终端优先、完全免费:自带 API key 即可接 Anthropic Claude、OpenAI、Gemini、Bedrock、Groq、Azure,或用 Ollama/LM Studio 跑本地模型。它的爆发说明开发者要的不是又一个封闭 IDE 插件,而是一个不锁定、能自由换模型的开源底座。
另有 1 家信源报道
展开详情
- **不锁定**:模型无关,Claude/GPT/Gemini/本地 Ollama 随意换,自带 key、完全免费
- **增长**:据报超 16 万 star、月活 ~750 万,被称 GitHub 史上增长最快的开发工具之一
- **终端优先**:Go 写的终端原生 agent,贴合真实开发工作流而非演示 demo
推荐理由:编码 agent 的竞争正从『哪家模型强』转向『谁的开源底座更自由』——不锁定模型、白嫖也能用,是它能滚起社区飞轮的关键。对开发者的机会:现在就该把这类终端 agent 纳入日常工作流,用它把重复编码/重构/写测试自动化;更进一步,围绕这种开源底座做插件、skill 或垂类配置,是一个门槛不高、社区流量现成的切入点。
#06
arXiv
Paper
NEW
投机执行把 agent 提速 2–5 倍:从 Act While Thinking 到 SpecBox 的一条研究主线
2026 年一批论文集中攻 agent 最大的效率痛点——顺序执行:模型要『想一步→调一次工具→拿到结果再想下一步』,工具越多越慢。主线是三类思路:并行工具调用、异步解耦、投机执行(先猜可能要调的工具并提前跑,猜错就丢弃)。代表作里 SpecBox 做投机沙箱调度提升 agent serving 效率,Act While Thinking 让模式预测+调度的额外延迟 <100ms;整条线普遍报出 2–5 倍延迟下降且不牺牲正确性。
把 agent 的顺序瓶颈(想一步、调一次工具、再想一步)用并行/异步/投机执行打散,在保持正确性的前提下把端到端延迟压 2–5 倍、成本降数倍
展开详情
- **痛点**:agent 的『想-调-再想』顺序链是主要延迟来源,工具越多越卡
- **三招**:并行工具调用 / 异步解耦 / 投机执行(提前猜着跑、错了丢弃),普遍拿到 2–5x 延迟下降
- **代表作**:SpecBox 投机沙箱调度提效 agent serving;Act While Thinking 调度额外开销 <100ms
推荐理由:agent 好不好用,除了『聪明』还得『快和省』——延迟和成本正在成为决定 agent 产品能否落地的隐形门槛。对开发者的机会:不必等大厂,现成的并行/异步工具调用技巧(把可并行的工具调用一次性发出、把慢工具异步化)就能立刻让你的 agent 快一截、账单降一截;理解这条投机执行主线,是做出『体验能打』的 agent 产品的加分项。
#07
axios.com
Article
NEW
Anthropic 给 Opus 5 装了个『用力档位』:你开始为模型『该想多久』单独付费
Anthropic 7 月底发布 Opus 5,定价 $5/百万输入、$25/百万输出(与 Opus 4.8 持平),号称多数任务上逼近旗舰 Fable 的表现但价格减半。更值得注意的是它给了用户一个 effort『用力档位』——你可以决定模型为一个任务投入多少算力。这把『测试时算力(test-time compute)』从模型内部的黑箱,变成用户能按需拨动、按需付费的一个显式旋钮。
另有 1 家信源报道
展开详情
- **降价**:Opus 5 多数任务逼近旗舰 Fable,价格约为其一半,$5/$25 每百万 token
- **用力档位**:effort dial 让你决定单个任务投入多少算力——简单任务省钱、难任务加码
- **范式**:test-time compute 从黑箱变成显式旋钮,『该想多久』成了你要主动决策的成本项
推荐理由:模型能力趋同后,厂商的竞争点转向『让你更精细地控制算力和成本』。对普通人和开发者的机会:学会看任务给算力——批量简单活开低档省钱、少数硬骨头开高档保质量,同一预算下产出更划算。会调档、会按任务分配算力的人,用同样的钱能榨出更多价值,这本身就是一项新的省钱/提效技能。
#08
thevccorner.com
Opinion
NEW
Srinivas Bommena
另有 2 家信源报道
推荐理由:模型能力已经过剩,真正稀缺的是『把模型能力落进真实业务』的人。对个人的机会:这可能是 AI 时代最被低估的高薪路径——它要的不是最会调模型的人,而是懂客户业务 + 能搞定脏数据和权限 + 能把 demo 变成生产系统的复合型工程师。如果你既能写代码又坐得住客户现场、扛得住落地的脏活,FDE 是当下性价比极高的方向。