Hall of Fame
今日趋势综述
今天的信号:底座在'变小变便宜',钱在'更省'和'更垂直'两端
把今天几条串起来,一条清晰的主线是'中间在塌陷、两端在长钱'。先看底座:Vercel 开源的 fx 把一个编码 agent 压成约 6.4MB 的单文件、冷启动 10 微秒;Cloudflare 的 Kitesurf 把 agent 用的浏览器运行时做到比 Chromium 省 3–7 倍算力;AWS 把带引用的联网搜索直接做成 Bedrock 托管件;xAI 的 Grok CLI 开箱就带子 agent、plan 模式、skills、插件市集和 MCP。这些都在说同一件事:'能跑 agent 的地基'正在被大厂和开源快速商品化、快速变便宜,谁都能用,于是它本身不再是壁垒。
再看榜单这一端:SWE-bench Verified 上 Claude Opus 5(约 96–97%)、GPT-5.6 Sol(96.2%)、Claude Fable 5(95%)挤在 4 分之内,已经基本测不出谁强谁弱,战场被迫挪到更难的 SWE-bench Pro(标准化 SEAL harness 也就 61.5% 上下)。分数在饱和,意味着'我用的模型比你分高'这句话越来越不值钱——就像底座一样,模型能力也在被商品化。两端都在变便宜、都在被抹平,这恰恰告诉你:别把时间押在'追最新模型、拼榜单名次'上。
那钱在哪儿?在两端之外的两件具体事上。一是'更省':当底座和模型都白菜价,谁能把同样的活跑得更省(更小的运行时、更便宜的模型分级、更少的 token),谁的单位成本就更低、跑得更久——这是工程红利。二是'更垂直':今天能源电网把需求预测准度提 20% 就等于一年省 500 万–1500 万美元、E.ON 靠预测性维护把停电砍 30%;合规审阅这种'读密集文档、按规则出可审计结论'的苦活,恰好是 LLM 最擅长、监管买家又肯付溢价、嵌进去就极难被替换的。所以想在 AI 时代增值,别在中间层内卷,往两端走:要么把'省'做到极致(把 agent 当可组合的 Unix 原语、按任务分级选模型),要么锁定一个有明确金额的垂直苦活,把 AI 卡进去、量化出结果、拿下前 10 个付费客户。
vercel-labs/fx
展开详情
Vercel Labs 把内部用的编码 agent「fx」开源了:一个用 Zig 写的 harness + CLI,整个 agent 只有约 6.4 MiB 的单文件原生二进制,冷启动约 10 微秒、内存基线单位 MB,装完即用、不需要先装任何运行时。设计上它更像一个'会说话的 Unix 工具'而不是终端里的重型 IDE,模型无关、本地或云推理都行,可以用 skills、plugins、MCP 扩展,也能直接嵌进你自己的 agent 系统里。许可证 Apache-2.0。
周增长:本周窜红:8 月 17 日 Vercel Labs 开源后迅速登上 dev tools 讨论与 GitHub Trending,是本周编码 agent 方向最抢眼的新库之一
- **极致轻量**:整包约 6.4 MiB 单文件原生二进制,Zig 提前编译、冷启动约 10 微秒、内存基线单位 MB,装完即用、零运行时依赖
- **Unix 哲学**:CLI 输出风格贴近 shell 管道而非重型 TUI,可组合、可脚本化、可嵌入更大系统;Apache-2.0 开源、模型无关
- **可扩展**:支持 skills、plugins、MCP,本地或云端模型都能跑,定位明确是'给研究与嵌入用'而不是又一个聊天式助手
SWE-bench Verified 已经饱和:Opus 5 与 Fable 5 领跑,但顶部五名只差 4 分,战场被迫挪到 SWE-bench Pro
展开详情
- **对比**:SWE-bench Verified 上 Opus 5 96.0%(vals.ai 复跑 97.0%) vs GPT-5.6 Sol 96.2% vs Fable 5 95.0% vs Kimi K3 93.4% vs Opus 4.8 88.6% vs Grok 4.5 86.6%——前五名只差约 4 分
- **饱和信号**:同一基准顶部已挤成一团,Gemini 3.1 Pro 在标准化测里落到约 75%,差距主要靠更难的 SWE-bench Pro 才拉得开
- **口径陷阱**:SWE-bench Pro 上 Fable 5 自家 scaffold 约 80%,但 Scale SEAL 标准化 harness 只到约 61.5%——同一模型不同 scaffold 能差近 20 分,别只看厂商裸分
能源 AI 落地实测:需求预测提准 20% 一年省 500 万–1500 万美元、E.ON 预测性维护把停电砍 30%,赢家把 AI 卡进'电网调度+并网消纳'
展开详情
- **调度/消纳**:AI 电网管理让网损降 3–8%、可再生能源弃电减少 15–25%;需求预测提准 20% = 中型公用事业一年省 500 万–1500 万美元
- **成本/预测**:AI 优化选址与储能把 LCOE 压低 10–20%,短时发电预测误差降 15–25%,动态电价把账单砍最多 20%
- **运维/可靠性**:E.ON 预测性维护把停电减少最多 30%、运维开支降 15–25%,大电网年节省可达 5 亿–12 亿美元,IEA 估现有线路可再挤出最多 175 GW 输电容量
Build with Claude 市集上线:一条命令装齐 82 插件+155 skills+117 子 agent,把'配置地狱'压成一次 add source
展开详情
8 月 23 日,社区版 Claude Code agent 市集「Build with Claude」公开上线:它把 82 个插件、155 个 skills、117 个子 agent、177 个命令、33 个 hooks 聚成一个可一键添加的来源,全部 MIT 开源。用户只要加一个 marketplace source、再用一条命令,就能装上别人预配好的 agent——不用再手动拼 prompt、配工具、调设置,而'配置太麻烦'恰恰是很多人半途放弃 Claude Code 的主因。
- **一键装齐**:82 插件 + 155 skills + 117 子 agent + 177 命令 + 33 hooks,加一个 source、一条命令即装,全部 MIT 开源、免费
- **解决的是分发**:主打把'手动拼 prompt/配工具/调设置'的配置地狱压成一次操作,直击很多人放弃 Claude Code 的真实痛点
- **没解决的是质量与安全**:一次请进上百个能读代码、执行命令的组件,质量参差与提示注入风险并未随'一键化'消失,反而被放大
本周 agent 基础设施集中开闸:Cloudflare Kitesurf 把 agent 浏览器算力砍到 Chromium 的 1/3–1/7,AWS 把联网搜索做成 Bedrock 托管件
展开详情
- **Kitesurf**:Cloudflare 为 AI agent 造的浏览器运行时,跑在 Workers 上,官方称比 Chromium 省 3–7 倍 CPU/内存,直接压低'agent 会上网操作'的算力成本
- **AgentCore Web Search GA**:AWS 8 月 21 日把带引用的服务端联网搜索做成 Bedrock 托管件,数据不出客户 AWS 账户,先上美东区
- **Binance Agent OS**:8 月 20 日上线,让 agent 直接接入金融基础设施做交易,但风控主要靠用户自管——能力开闸的同时,安全责任被甩给使用方
Grok CLI(Grok Build):xAI 的全功能编码 agent CLI,开箱带子 agent、plan 模式、skills、插件市集和 MCP
展开详情
- **开箱全功能**:Grok 4.6 驱动,子 agent、plan 模式、skills、插件市集、MCP 一次给齐,框架覆盖面对标 Claude Code / OpenCode
- **品类标配化**:编码 agent CLI 从头部专利变成人人都做的标配,竞争加剧、能力趋同、价格承压
- **与 fx 互为镜像**:一个'大而全对标头部'、一个'极小可嵌入',共同印证'终端编码 agent'已成红海底座
把'合规审阅'做成垂类 AI micro-SaaS 挣现金流:SOC2/HIPAA/合同审查这类苦活,监管买家肯付溢价、嵌进去就极难替换
展开详情
- **谁肯付**:合规密集行业(法务、SOC2、HIPAA、核保、财报)的中小机构——出错有法律后果,愿为准确+可审计付溢价
- **为什么稳**:自动化的正是'读密集文档 vs 规则手册'这件 LLM 最擅长的活,且嵌进合规流程后切换成本极高、流失率极低
- **收入与门槛**:单人做到 K–0K MRR 已有案例;AI 砍掉 70%+ 开发时间,真正的瓶颈从'能不能建'变成'能不能拿下前 100 个付费客户'