Hall of Fame
今日趋势综述
今天的信号:能力过剩,稀缺的是‘管得住、落得下、收得回’
把今天的条目连起来看,会发现一条清晰的主线:模型能力已经不是瓶颈了。SWE-bench Pro 榜上前几名咬得死死的,Claude 系列 79–80 分、阿里 Qwen 68 分、开源 GLM/Kimi 也追到 60 分上下——真正拉开差距的不是模型本身,而是‘同一套脚手架裸跑’和‘厂商调好的 agent harness’之间那 10–30 分的工程差。这意味着,普通人能拿到的‘原材料’其实和大厂差不多,差距全在你怎么把它组织起来。
于是今天最值钱的三件事全指向‘工程化’:一是‘管得住’——Block 开源 Berd 把多模型、多 agent、多会话收进一个桌面台,安全论文 CAITLYN 则在研究怎么让 agent 自己合成防注入的防线;二是‘写得好’——一批 agent skills 工程实践把‘怎么写一个不臃肿、能复用的 SKILL.md’讲透了,UC Irvine 扒了 238 个真实 skill,99% 至少有一个能被例行审查抓出来的毛病;三是‘落得下、收得回’——金融业 AI 的 KPMG 数据显示 13 个月平均 2.3 倍回报、头部每投 1 美元收 8 美元,而语音前台代运营已经跑出 $300–600/月的成熟报价单。
给个人的启示很直接:别再追‘哪个模型最强’的跑分了,那已经是同质化的红海。真正的机会在‘中间层’——把现成模型的能力,通过约束(skills)、编排(Berd 这类台子)、安全(防注入)、和垂类落地(金融、语音前台)变成一个具体的、有人肯付钱的结果。会写规则、会搭台、会把 demo 变成生产、会把生产变成账单的人,正在成为这一波里最稀缺的角色。
block/berd
展开详情
Berd 是 Block 开源(Apache 2.0)的一款桌面 AI agent 工作台,用 Tauri 2 + React 19 写成,跑在 Block 自家的 Goose agent 框架之上——Goose 作为 sidecar 进程处理 agent 循环,Berd 负责把项目、会话、上下文、模型、skills、扩展、自动化统一到一个原生桌面界面里。它支持 macOS/Windows/Linux,能在多个模型供应商之间自由切换,本质是‘给认真用 agent 干活的人的一个常驻工作台’。
周增长:8 月 19 日前后由 Block(Jack Dorsey 的公司)开源上线,数天内登上 AI agent 类新仓热议榜,是本周‘agent 工作台’方向最受关注的新项目之一
- **统一工作台**:把多模型、多 agent、多会话、skills、扩展、自动化收进一个原生桌面界面,替代命令行/浏览器标签的碎片化操作
- **站在 Goose 肩上**:Goose 作为 sidecar 处理 agent 循环,Berd 只管编排与上下文,复用了 4.5 万星、500+ 贡献者的成熟内核
- **大厂自用后开源**:Block 先给内部员工用、再以 Apache 2.0 开源,跨三平台可下载,是‘真实生产需求’而非演示项目
SWE-bench Pro 最新榜:Claude 系列 79–80 分领跑、Qwen3.8 Max 68 分、开源 GLM/Kimi 追到 60 分上下,但真正的差距藏在‘脚手架’里
展开详情
- **对比**:SWE-bench Pro 上 Claude Mythos 5 约 80.3 vs Qwen3.8 Max 约 67.7 vs GLM-5.2 约 62.1 vs GPT-5.4(xHigh) 约 59.1(同基准,注意各站口径与更新日略有差异)
- **顶部咬得很紧**:Claude 三兄弟 79–80 分几乎并列,前沿闭源之间的‘智力差’已被压缩到 1 分内,差异更多体现在价格与延迟
- **脚手架 > 模型**:Scale 统一脚手架裸跑 vs 厂商调优 harness 差 10–30 分,说明‘怎么用’比‘用哪个’对最终效果影响更大
金融业 AI 落地实测:KPMG 记录 13 个月平均 2.3 倍回报、头部每投 1 美元收 8 美元,欺诈误报砍 60%、放贷审核提速 40–60%
展开详情
- **回报数字**:KPMG 记录 13 个月平均 2.3 倍回报、头部每 1 美元收 8 美元,行政/客服类 6–13 个月见 ROI,最快落地的是客服与反欺诈
- **硬效果**:欺诈检测误报率降 60%+,放贷审核提速 40–60%(几天→几分钟),JPMorgan 投行材料生成从数小时→30 秒
- **渗透率**:Cambridge CCAF 2026 调查——21% 金融机构已投产 agent、52% 在试点或更后阶段,落地速度快于多数行业
把 agent skill 写好的工程实践:三层渐进披露省约 40% token、准确率升 15–20%,而 238 个真实 skill 里 99% 至少有一个能被审查抓出的毛病
展开详情
- **渐进披露**:SKILL.md 控制在约 500 行/5000 token,细节下沉到 reference 文件并写明‘何时加载’,三层结构省约 40% token、准确率升 15–20%
- **一个 skill 一个动词**:单一职责、可发现的描述、版本化、拿真实任务测试,是可靠 skill 的通用准则
- **先审后写**:UC Irvine 扒 238 个真实 skill,99% 至少有一处例行审查能抓的缺陷——审计在用的比再造新的更值
CAITLYN: Can LLM Agents Autonomously Synthesize Defenses against Emerging Injection Attacks?
展开详情
- **问题真实**:agent 一旦能联网、调工具、执行代码,输入即攻击面——提示注入与工具调用劫持是当下最主流的两类威胁
- **新思路**:不再靠人工穷举规则,而是让 agent 自主合成针对新型注入攻击的防御(System II 式方法),在多环境显著降低攻击成功率
- **落地含义**:防御端也要能‘自我进化’,才追得上不断变形的攻击——这对任何要把 agent 放进生产的人都是必修课
Aloud
展开详情
- **降低指令成本**:口头反馈实时转成 coding agent 能直接执行的任务,省去边 review 边敲长指令的中断
- **踩中新瓶颈**:模型能力过剩后,‘人给 agent 下指令的带宽’成了新瓶颈,语音是提高这一带宽的自然解法
- **小而聚焦**:不做大而全的 IDE,只把‘说→任务→执行’这条链路做顺,是典型的‘薄工具解真痛点’
AI 语音前台‘代运营’的单位经济学:代理商普遍 $300–600/月一套,底层成本约 $0.07/分钟,替掉一个 $3–4.5 万/年的人工前台
展开详情
- **报价单**:代理商标准套餐 $300–600/月,底层成本约 $0.07/分钟,毛利空间清晰;对手是 $3–4.5 万/年的人工前台
- **买家账好算**:语音 agent 把电话处理成本压 85–90%,调查中 97% 使用的小微商户报告营收增长,成交阻力低
- **机会转移**:从‘搭白标平台’挪向‘垂类代运营+按月服务费’,定价与成本结构透明、可复制,适合个人/小团队起步
Perspective AI
AI 演示很容易,AI 落地很残酷——OpenAI、Anthropic、Google 现在照抄的,正是 Palantir 那套‘工程师钻进客户大楼、用客户的烂数据、解客户的真问题’的前置部署打法。