📅
Hall of Fame
Hall of Fame
Track
Type
Source
8月25日 周二 · 8 条
今日趋势综述
今天的主线是'底座在快速商品化、榜单在饱和,值钱的东西正从模型/分数两端挤向中间的两件事——更省的运行时和更垂直的落地':Vercel fx 把编码 agent 压到约 6MB、Cloudflare Kitesurf 把 agent 浏览器算力砍到 Chromium 的 1/3–1/7,SWE-bench Verified 顶部五名只差 4 分已经测不出差距,而真正能收到钱的仍是把 AI 卡进能源电网调度、合规审阅这种有明确金额的苦活。
今天的信号:底座在'变小变便宜',钱在'更省'和'更垂直'两端

把今天几条串起来,一条清晰的主线是'中间在塌陷、两端在长钱'。先看底座:Vercel 开源的 fx 把一个编码 agent 压成约 6.4MB 的单文件、冷启动 10 微秒;Cloudflare 的 Kitesurf 把 agent 用的浏览器运行时做到比 Chromium 省 3–7 倍算力;AWS 把带引用的联网搜索直接做成 Bedrock 托管件;xAI 的 Grok CLI 开箱就带子 agent、plan 模式、skills、插件市集和 MCP。这些都在说同一件事:'能跑 agent 的地基'正在被大厂和开源快速商品化、快速变便宜,谁都能用,于是它本身不再是壁垒。

再看榜单这一端:SWE-bench Verified 上 Claude Opus 5(约 96–97%)、GPT-5.6 Sol(96.2%)、Claude Fable 5(95%)挤在 4 分之内,已经基本测不出谁强谁弱,战场被迫挪到更难的 SWE-bench Pro(标准化 SEAL harness 也就 61.5% 上下)。分数在饱和,意味着'我用的模型比你分高'这句话越来越不值钱——就像底座一样,模型能力也在被商品化。两端都在变便宜、都在被抹平,这恰恰告诉你:别把时间押在'追最新模型、拼榜单名次'上。

那钱在哪儿?在两端之外的两件具体事上。一是'更省':当底座和模型都白菜价,谁能把同样的活跑得更省(更小的运行时、更便宜的模型分级、更少的 token),谁的单位成本就更低、跑得更久——这是工程红利。二是'更垂直':今天能源电网把需求预测准度提 20% 就等于一年省 500 万–1500 万美元、E.ON 靠预测性维护把停电砍 30%;合规审阅这种'读密集文档、按规则出可审计结论'的苦活,恰好是 LLM 最擅长、监管买家又肯付溢价、嵌进去就极难被替换的。所以想在 AI 时代增值,别在中间层内卷,往两端走:要么把'省'做到极致(把 agent 当可组合的 Unix 原语、按任务分级选模型),要么锁定一个有明确金额的垂直苦活,把 AI 卡进去、量化出结果、拿下前 10 个付费客户。

今日新增 7
#01
GitHub Repo
★ 2.3k NEW

vercel-labs/fx

把它选进来是因为它代表了一个明确的方向反转:编码 agent 正从'越做越重的终端 IDE'往'越做越小的 Unix 原语'走。过去一年大家比的是谁的终端 agent 功能更全、界面更花,fx 反着来——它赌的是'小、快、可组合、可嵌入'。6.4MB 单文件、10 微秒冷启动这种指标,意味着你可以把它塞进 CI、塞进脚本管道、塞进另一个更大的 agent 里当子模块,而不是只能当一个人机对话的黑箱。这跟今天整条主线('底座在商品化、要省')完全咬合:当模型和算力都变便宜,能把 agent 做成轻量、可编排原语的人,单位成本和灵活度都更高。
#DevTools#Zig
另有 2 家信源报道
展开详情

Vercel Labs 把内部用的编码 agent「fx」开源了:一个用 Zig 写的 harness + CLI,整个 agent 只有约 6.4 MiB 的单文件原生二进制,冷启动约 10 微秒、内存基线单位 MB,装完即用、不需要先装任何运行时。设计上它更像一个'会说话的 Unix 工具'而不是终端里的重型 IDE,模型无关、本地或云推理都行,可以用 skills、plugins、MCP 扩展,也能直接嵌进你自己的 agent 系统里。许可证 Apache-2.0。

周增长:本周窜红:8 月 17 日 Vercel Labs 开源后迅速登上 dev tools 讨论与 GitHub Trending,是本周编码 agent 方向最抢眼的新库之一

  • **极致轻量**:整包约 6.4 MiB 单文件原生二进制,Zig 提前编译、冷启动约 10 微秒、内存基线单位 MB,装完即用、零运行时依赖
  • **Unix 哲学**:CLI 输出风格贴近 shell 管道而非重型 TUI,可组合、可脚本化、可嵌入更大系统;Apache-2.0 开源、模型无关
  • **可扩展**:支持 skills、plugins、MCP,本地或云端模型都能跑,定位明确是'给研究与嵌入用'而不是又一个聊天式助手
推荐理由:对个人:与其追'功能最全的终端 agent',不如学会把 AI 能力做成'能被管道、被脚本、被嵌入的小工具'。fx 示范的是一种更有杠杆的姿势——把 agent 当可组合的 Unix 原语,而不是不可拆的大黑箱。你能落地的动作:挑一个你每天重复的小流程(跑测试、清日志、批量改文件),用 fx 这类轻量 harness 把它做成一条能塞进 CI/脚本的命令;当底座越来越便宜,'会把 agent 拆小、串起来、嵌进现有系统'的工程能力,比会用某个大而全的 IDE 更保值。
#02
localaimaster.com Article
NEW

SWE-bench Verified 已经饱和:Opus 5 与 Fable 5 领跑,但顶部五名只差 4 分,战场被迫挪到 SWE-bench Pro

今天的评测信号很直白:编码榜里最出名的 SWE-bench Verified 已经测不出差距了。截至 8 月,SWE-bench Verified 上 Claude Opus 5 报 96.0%(Anthropic 官方数)、vals.ai 复跑到 97.0%;GPT-5.6 Sol 96.2%、Claude Fable 5 95.0% 紧咬,Kimi K3 93.4%、GPT-5.6 Luna 93.0% 排在后面,再往下才是 Claude Opus 4.8 88.6%、Grok 4.5 86.6%;Gemini 3.1 Pro 在标准化第三方测里明显落后(3 月快照约 75%,Google 自报 80.6%)。换句话说,前五名挤在 4 个百分点之内——这个榜已经饱和,再拿它比高低意义不大。真正的看点是战场往更难的 SWE-bench Pro 挪:那里 Fable 5 用自家 scaffold 能到约 80%,但 Scale 的标准化 SEAL harness(唯一真正苹果对苹果的口径)顶格也就 61.5% 上下——难题还远没被解决,而且不同 scaffold 的数差异巨大,'裸分'越来越不能信。
#评测
另有 2 家信源报道
展开详情
  • **对比**:SWE-bench Verified 上 Opus 5 96.0%(vals.ai 复跑 97.0%) vs GPT-5.6 Sol 96.2% vs Fable 5 95.0% vs Kimi K3 93.4% vs Opus 4.8 88.6% vs Grok 4.5 86.6%——前五名只差约 4 分
  • **饱和信号**:同一基准顶部已挤成一团,Gemini 3.1 Pro 在标准化测里落到约 75%,差距主要靠更难的 SWE-bench Pro 才拉得开
  • **口径陷阱**:SWE-bench Pro 上 Fable 5 自家 scaffold 约 80%,但 Scale SEAL 标准化 harness 只到约 61.5%——同一模型不同 scaffold 能差近 20 分,别只看厂商裸分
推荐理由:对开发者/普通人:现在'选哪个模型'的答案已经不该看 SWE-bench Verified 的裸分了——顶部五名基本平手,拿它做决策等于抛硬币。实用的选法是按'任务难度 + 单位成本'分级:日常改 bug、写常规代码,选性价比高的那一档(Fable 5、Kimi K3、Sonnet 系都在 90+ 且更便宜)完全够用;只有最硬的长程/工程化任务,才值得上 Opus 5 这种旗舰、并且要看 SWE-bench Pro 的标准化口径而非自家 scaffold。真正的技能不是追榜首,而是养成'看同一基准、认标准化 harness、按难度选模型'的习惯——底座和模型都在饱和变便宜,谁会分级用,谁的单位成本就更低。
#03
startus-insights.com Article
NEW

能源 AI 落地实测:需求预测提准 20% 一年省 500 万–1500 万美元、E.ON 预测性维护把停电砍 30%,赢家把 AI 卡进'电网调度+并网消纳'

能源/电网是今天轮到的垂直行业,信号很硬:AI 已经从'节能口号'变成能算清账的调度工具,而且赢家都赢在把 AI 卡进电网调度、并网消纳、预测性维护这几件有明确金额的事上。具体数字——部署 AI 电网管理的公用事业公司,网损降低 3–8%、被弃掉的可再生能源(curtailment)减少 15–25%;对一家管区域电网的中型公用事业,把需求预测准度提升 20%,一年就能省下 500 万–1500 万美元(靠更优的机组调度、更低的备用容量和平衡成本)。再往上:AI 优化选址与储能可把度电成本(LCEO)压低 10–20%,短时(1–72 小时)发电预测误差比传统方法低 15–25%,动态电价优化能把账单砍最多 20%;E.ON 的研究显示预测性维护相比定期检修可把电网停电减少最多 30%,运维开支普遍降 15–25%,大电网靠 AI 优化的年节省可达 5 亿–12 亿美元。IEA 还测算 AI 有望在现有线路上再挤出最多 175 GW 输电容量。
#行业应用
另有 2 家信源报道
展开详情
  • **调度/消纳**:AI 电网管理让网损降 3–8%、可再生能源弃电减少 15–25%;需求预测提准 20% = 中型公用事业一年省 500 万–1500 万美元
  • **成本/预测**:AI 优化选址与储能把 LCOE 压低 10–20%,短时发电预测误差降 15–25%,动态电价把账单砍最多 20%
  • **运维/可靠性**:E.ON 预测性维护把停电减少最多 30%、运维开支降 15–25%,大电网年节省可达 5 亿–12 亿美元,IEA 估现有线路可再挤出最多 175 GW 输电容量
推荐理由:对个人:能源是'每个决策都有明确金额、数据高度结构化'的行业,特别适合把 AI 嵌进单个环节收费。机会不在'做一个能源大模型',而在'把一件苦活自动化'——比如给中小配电/工商业储能/光伏电站做'短时发电预测''负荷预测''设备故障预警'这类可量化 ROI 的小工具:省下的备用容量、避免的停电损失、少弃的电,一算就出数,最容易说服客户付费。先挑一个你能拿到数据的细分场景(工商业储能、分布式光伏、充电站负荷),把一个环节做深、把节省金额算给客户看,比什么都强。
#04
blockchain.news Article
NEW

Build with Claude 市集上线:一条命令装齐 82 插件+155 skills+117 子 agent,把'配置地狱'压成一次 add source

把它放进来,是想标记 skills 生态一个关键拐点:分发这一层正在被彻底'一键化'。昨天我们才说过'skills 数量冲到 28 万+、分发已解决、质量与安全没解决',Build with Claude 正是'分发已解决'的最新注脚——它不再让你一个个找、一个个装,而是把一整套预配 agent 打成可一键接入的市集。好处很直接:新手上手成本骤降。但也把昨天那个隐忧放得更大——当一条命令就能装进 82 个插件、117 个子 agent、33 个 hooks,你其实是在把一堆'别人写的、能读你代码和执行命令的东西'一次性请进环境,而这些组件的质量与安全并没有随分发一起被解决。方便和风险是同一枚硬币的两面。
#Skills#元技能
另有 1 家信源报道
展开详情

8 月 23 日,社区版 Claude Code agent 市集「Build with Claude」公开上线:它把 82 个插件、155 个 skills、117 个子 agent、177 个命令、33 个 hooks 聚成一个可一键添加的来源,全部 MIT 开源。用户只要加一个 marketplace source、再用一条命令,就能装上别人预配好的 agent——不用再手动拼 prompt、配工具、调设置,而'配置太麻烦'恰恰是很多人半途放弃 Claude Code 的主因。

  • **一键装齐**:82 插件 + 155 skills + 117 子 agent + 177 命令 + 33 hooks,加一个 source、一条命令即装,全部 MIT 开源、免费
  • **解决的是分发**:主打把'手动拼 prompt/配工具/调设置'的配置地狱压成一次操作,直击很多人放弃 Claude Code 的真实痛点
  • **没解决的是质量与安全**:一次请进上百个能读代码、执行命令的组件,质量参差与提示注入风险并未随'一键化'消失,反而被放大
推荐理由:对个人:市集越'一键',你越要建立'装之前先审'的习惯——这本身就是一种越来越值钱的元技能。别看到 82 个插件、117 个子 agent 就全量 add source,先只装你真正要用的那几个、读一眼它能碰哪些文件和命令。反过来,机会也在这里:当人人都能一键装、但没人保证质量与安全,'帮团队挑好、审好、按规范裁剪一套可信 skill/插件包'就是一门能收费的手艺——尤其面向有合规要求、不敢乱装社区组件的企业。
#05
logrocket.com Article
NEW

本周 agent 基础设施集中开闸:Cloudflare Kitesurf 把 agent 浏览器算力砍到 Chromium 的 1/3–1/7,AWS 把联网搜索做成 Bedrock 托管件

本周大厂在'给 agent 铺地基'上密集出手,合起来看是一个清晰的商品化信号——跑 agent 的底座正在变得又便宜又标准。Cloudflare 上了 Kitesurf:一个专为 AI agent 设计、跑在 Workers 上的浏览器运行时,官方称比 Chromium 省 3–7 倍 CPU 与内存——这直接砍掉'让 agent 会用浏览器'这件事的算力成本。AWS 把 Bedrock AgentCore 的 Web Search 推到 GA(8 月 21 日):一个托管的服务端联网搜索,能给 agent 带回带引用的实时知识,且数据不出客户自己的 AWS 账户,先在美东区上线。此外 Binance 在 8 月 20 日开了 Agent OS,让开发者把 AI 应用接进它的金融基础设施——agent 能直接交易,但风控'基本靠用户自己盯'。把这几条并排看:浏览器、联网搜索、执行环境这些 agent 的'手和眼',都在被做成开箱即用的托管件,门槛和成本一起往下掉。
#Infra
另有 1 家信源报道
展开详情
  • **Kitesurf**:Cloudflare 为 AI agent 造的浏览器运行时,跑在 Workers 上,官方称比 Chromium 省 3–7 倍 CPU/内存,直接压低'agent 会上网操作'的算力成本
  • **AgentCore Web Search GA**:AWS 8 月 21 日把带引用的服务端联网搜索做成 Bedrock 托管件,数据不出客户 AWS 账户,先上美东区
  • **Binance Agent OS**:8 月 20 日上线,让 agent 直接接入金融基础设施做交易,但风控主要靠用户自管——能力开闸的同时,安全责任被甩给使用方
推荐理由:对个人:当浏览器、联网搜索、执行沙箱这些 agent'手和眼'都变成大厂托管件,你不用再自己造轮子——省下的时间应该花在'编排'和'安全'上。实操建议:能用托管件(Kitesurf 跑浏览器、AgentCore 做联网搜索)就别自建,把精力放到把这些能力串成解决具体业务的流程;同时把'风控/权限'当成一等公民——Binance 那句'风控靠用户自己盯'是所有 agent 基础设施的通病,谁能在便宜的底座上把'可控、可审计'做扎实,谁的方案才敢被企业用。
#06
logrocket.com Product
NEW

Grok CLI(Grok Build):xAI 的全功能编码 agent CLI,开箱带子 agent、plan 模式、skills、插件市集和 MCP

xAI 推出 Grok CLI(Grok Build),一上来就是'全家桶':一个由 Grok 4.6 驱动的全功能命令行编码 agent,在框架覆盖面上对标 Claude Code 和 OpenCode,开箱即带子 agent、plan 模式、skills、插件市集和 MCP server 支持。放在今天的主线里,它和 fx 是一枚硬币的两面——fx 走'极小、可嵌入的 Unix 原语'路线,Grok CLI 走'大而全、对标头部'路线,但两者共同说明:'终端里的编码 agent'这个品类已经从少数几家的专利,变成人人都在做的标配。对开发者来说,好消息是选择更多、竞争压价;坏消息是,单纯'会用某一个 CLI'不再是壁垒。
#DevTools#随 Grok 4.6 订阅/…
另有 1 家信源报道
展开详情
  • **开箱全功能**:Grok 4.6 驱动,子 agent、plan 模式、skills、插件市集、MCP 一次给齐,框架覆盖面对标 Claude Code / OpenCode
  • **品类标配化**:编码 agent CLI 从头部专利变成人人都做的标配,竞争加剧、能力趋同、价格承压
  • **与 fx 互为镜像**:一个'大而全对标头部'、一个'极小可嵌入',共同印证'终端编码 agent'已成红海底座
推荐理由:对个人:编码 agent CLI 正在同质化,别把身家押在'精通某一个工具'上——今天你熟 Claude Code、明天冒出 Grok CLL、OpenCode,底层能力和用法高度趋同。真正保值的是可迁移的东西:清晰拆任务、写好 plan、设计能被复用的 skill、把 MCP/子 agent 编排成解决具体问题的流程。把这些沉淀成'跟哪个 CLI 无关'的方法论,换工具时你几乎零成本;只会点某一家按钮的人,才会被下一次工具更替淘汰。
#07
lootr.io Product 值得关注
NEW

把'合规审阅'做成垂类 AI micro-SaaS 挣现金流:SOC2/HIPAA/合同审查这类苦活,监管买家肯付溢价、嵌进去就极难替换

今天这条合格的现金流机会,聚焦在'合规审阅'这类垂类苦活:让 AI agent 在合规密集的领域(合同/法务审查、SOC 2 证据收集、HIPAA 审计准备、核保、财报)里读文档、按规则出一份人类能签字的可审计结论。为什么它比一般 AI 套壳更能挣钱且更稳:一是监管买家肯付溢价——出错有法律后果,他们愿意为准确性和可审计性掏钱;二是被自动化的活(拿一本规则手册去读密集文档)恰好是 LLM 最擅长的;三是一旦 agent 嵌进合规流程,切换成本极高、流失率极低。收入侧,单人靠无代码/AI 栈把这类垂类工具做到 K–0K MRR 已有多个案例,而 AI 把开发时间砍掉 70%+,'能不能建'不再是瓶颈,'能不能拿下前 100 个付费客户'才是。对个人的关键提醒:别贪大市场,锁定一个'问题紧急、够得着'的细分,把一个环节做深、做出可审计输出,比做全能合规平台现实得多。
#小微现金流#典型垂类合规工具 K–0K …
另有 2 家信源报道
展开详情
  • **谁肯付**:合规密集行业(法务、SOC2、HIPAA、核保、财报)的中小机构——出错有法律后果,愿为准确+可审计付溢价
  • **为什么稳**:自动化的正是'读密集文档 vs 规则手册'这件 LLM 最擅长的活,且嵌进合规流程后切换成本极高、流失率极低
  • **收入与门槛**:单人做到 K–0K MRR 已有案例;AI 砍掉 70%+ 开发时间,真正的瓶颈从'能不能建'变成'能不能拿下前 100 个付费客户'
推荐理由:对想挣现金流的普通人:合规审阅是难得的'高付费意愿 + 高黏性 + LLM 强项'三合一赛道,而且不需要大市场,只要一个够垂直、够紧急的细分。可落地的最小切口:选一个你能接触到规则和样本的窄场景(比如某类租赁合同审查、某行业的 SOC2 证据整理、某地医疗机构的 HIPAA 自查),做一个'读文档→按 checklist 出可审计报告→人类签字'的工具,先服务 5–10 个客户跑通,再横向复制。切忌一上来做全能合规平台——把一个环节做到客户敢签字,比做十个半成品值钱得多。
My Take:评分(5=最优):最快成交 3 / 最低成本 4 / 可复制 4 / 风险安全度 3。定位:高付费意愿的垂类合规审阅,黏性强但对准确性与合规责任要求高,适合先窄后宽。
商机信号(加速):谁付钱:合规密集行业(法务/会计/医疗/金融/SaaS)的中小机构与团队——被合同审查、SOC2 证据、HIPAA 自查、核保这类重复文档苦活压着,买不起大厂方案但同样有强合规刚需,愿为'能出可审计结论'的垂类工具按月付溢价 痛点:合规审阅高度依赖人工读密集文档、逐条对规则,慢、贵、易漏且出错有法律后果;通用 AI 工具不敢用在合规场景,缺'可审计、可签字'的垂类闭环 切入点:锁定一个你拿得到规则与样本的窄场景(某类合同/某行业 SOC2/某地 HIPAA 自查),做'读文档→按 checklist 出可审计报告→人类签字'的最小闭环,按机构月费收,先跑 5–10 家再横向复制到相邻细分
仍在热榜 1
Repo firecrawl/firecrawl 在榜 3d firecrawl 是给 AI agent 用的'网页数据层':一套 context API,能大规模地搜索、抓取、并与… AI Agent