📅
Hall of Fame
Hall of Fame
Track
Type
Source
9月1日 周二 · 8 条
今日趋势综述
今天的信号集中在一个词——‘可控’:从 Block 开源的 agent 管理台、评测榜上被拉开的‘裸跑分 vs 调好脚手架’差距,到把 agent 攻击面写清楚的安全论文,行业开始从‘让 agent 更能干’转向‘让 agent 更靠谱、更好管、更能落到业务里挣钱’。
今天的信号:能力过剩,稀缺的是‘管得住、落得下、收得回’

把今天的条目连起来看,会发现一条清晰的主线:模型能力已经不是瓶颈了。SWE-bench Pro 榜上前几名咬得死死的,Claude 系列 79–80 分、阿里 Qwen 68 分、开源 GLM/Kimi 也追到 60 分上下——真正拉开差距的不是模型本身,而是‘同一套脚手架裸跑’和‘厂商调好的 agent harness’之间那 10–30 分的工程差。这意味着,普通人能拿到的‘原材料’其实和大厂差不多,差距全在你怎么把它组织起来。

于是今天最值钱的三件事全指向‘工程化’:一是‘管得住’——Block 开源 Berd 把多模型、多 agent、多会话收进一个桌面台,安全论文 CAITLYN 则在研究怎么让 agent 自己合成防注入的防线;二是‘写得好’——一批 agent skills 工程实践把‘怎么写一个不臃肿、能复用的 SKILL.md’讲透了,UC Irvine 扒了 238 个真实 skill,99% 至少有一个能被例行审查抓出来的毛病;三是‘落得下、收得回’——金融业 AI 的 KPMG 数据显示 13 个月平均 2.3 倍回报、头部每投 1 美元收 8 美元,而语音前台代运营已经跑出 $300–600/月的成熟报价单。

给个人的启示很直接:别再追‘哪个模型最强’的跑分了,那已经是同质化的红海。真正的机会在‘中间层’——把现成模型的能力,通过约束(skills)、编排(Berd 这类台子)、安全(防注入)、和垂类落地(金融、语音前台)变成一个具体的、有人肯付钱的结果。会写规则、会搭台、会把 demo 变成生产、会把生产变成账单的人,正在成为这一波里最稀缺的角色。

#01
GitHub Repo
NEW

block/berd

Berd 的意义不在于它多炫,而在于它把‘用 agent 干活’这件事从命令行/浏览器标签的碎片状态,收敛成一个像 IDE 一样的持久工作空间:一个界面里管所有模型、所有 agent、所有项目和 skill。这正是行业从‘能不能让 agent 跑起来’转向‘怎么把一屋子 agent 管明白’的信号。而且它出自 Block——一家把它先给自己员工内部用、再开源出来的公司,说明这不是玩具而是真实生产需求打磨出来的。它建立在已积累 4.5 万星、500+ 贡献者的 Goose 之上,等于把一个成熟 agent 内核配上了一个好用的壳。
#AI Agent#Rust / TypeScr…
另有 1 家信源报道
展开详情

Berd 是 Block 开源(Apache 2.0)的一款桌面 AI agent 工作台,用 Tauri 2 + React 19 写成,跑在 Block 自家的 Goose agent 框架之上——Goose 作为 sidecar 进程处理 agent 循环,Berd 负责把项目、会话、上下文、模型、skills、扩展、自动化统一到一个原生桌面界面里。它支持 macOS/Windows/Linux,能在多个模型供应商之间自由切换,本质是‘给认真用 agent 干活的人的一个常驻工作台’。

周增长:8 月 19 日前后由 Block(Jack Dorsey 的公司)开源上线,数天内登上 AI agent 类新仓热议榜,是本周‘agent 工作台’方向最受关注的新项目之一

  • **统一工作台**:把多模型、多 agent、多会话、skills、扩展、自动化收进一个原生桌面界面,替代命令行/浏览器标签的碎片化操作
  • **站在 Goose 肩上**:Goose 作为 sidecar 处理 agent 循环,Berd 只管编排与上下文,复用了 4.5 万星、500+ 贡献者的成熟内核
  • **大厂自用后开源**:Block 先给内部员工用、再以 Apache 2.0 开源,跨三平台可下载,是‘真实生产需求’而非演示项目
推荐理由:对普通人的机会:agent 的‘管理层’正在成为一个新的产品品类,而且现在还很空。你不必自己造 agent 内核(Goose 这类开源框架已经够好),机会在于‘壳’和‘工作流’——怎么把多个 agent、多个项目、多套 skill 组织得让人愿意每天用。研究 Berd 这类工作台的交互设计和信息架构,比追某个模型的跑分更有长期价值;哪怕只是给某个垂直人群(律师、财务、运营)做一个‘懂他们工作流的 agent 台子’,都是一个清晰的切入点。
#02
morphllm.com Article
NEW

SWE-bench Pro 最新榜:Claude 系列 79–80 分领跑、Qwen3.8 Max 68 分、开源 GLM/Kimi 追到 60 分上下,但真正的差距藏在‘脚手架’里

SWE-bench Pro(比 Verified 更难、更贴近真实工程的编码基准)8 月底的榜单显示:顶部被 Claude 系列包圆——Mythos 5 约 80.3%、Fable 5 约 80.0%、Opus 5 约 79.2%;阿里 Qwen3.8 Max 约 67.7%、Qwen3.8-Flash-Next 约 62.5%;开源阵营 GLM-5.2 约 62.1%、Kimi K2.6 约 58.6%;OpenAI GPT-5.4(xHigh)在 Scale 公开集上约 59.1%。但最关键的一条是方法论提醒:Scale 用‘同一套脚手架’跑所有模型,而厂商官方数字用的是各自调优过的 agent harness,两者差距高达 10–30 分,大部分来自上下文检索和工具调用的质量,而非模型智力本身。
#评测
另有 2 家信源报道
展开详情
  • **对比**:SWE-bench Pro 上 Claude Mythos 5 约 80.3 vs Qwen3.8 Max 约 67.7 vs GLM-5.2 约 62.1 vs GPT-5.4(xHigh) 约 59.1(同基准,注意各站口径与更新日略有差异)
  • **顶部咬得很紧**:Claude 三兄弟 79–80 分几乎并列,前沿闭源之间的‘智力差’已被压缩到 1 分内,差异更多体现在价格与延迟
  • **脚手架 > 模型**:Scale 统一脚手架裸跑 vs 厂商调优 harness 差 10–30 分,说明‘怎么用’比‘用哪个’对最终效果影响更大
推荐理由:对开发者的选型建议:如果你要的是最高的一次成功率、且预算够,Claude 系列(Opus/Fable/Mythos)在难基准上仍是稳的第一梯队;要性价比和可自托管,GLM-5.2/Kimi 这种 60 分档已经能扛下大量常规工程任务,配好脚手架能把体感差距进一步抹平。但真正该记住的是那 10–30 分的‘脚手架差’:与其纠结换模型,不如把你的上下文检索、工具调用、prompt 组织打磨好——这才是普通人能自己掌控、且回报最高的部分。
#03
kore.ai Article
NEW

金融业 AI 落地实测:KPMG 记录 13 个月平均 2.3 倍回报、头部每投 1 美元收 8 美元,欺诈误报砍 60%、放贷审核提速 40–60%

把银行/金融业本周的多份落地数据汇总,能看到一个比消费级更硬的 ROI 画像:KPMG 记录 agentic AI 投资在 13 个月内平均带来 2.3 倍回报,头部机构做到每投入 1 美元收回 8 美元;欺诈检测 agent 在成熟部署里把误报率压低 60% 以上;放贷审核类 agent 把处理时间砍掉 40–60%,从‘几天’压到‘几分钟’;JPMorgan 用 agent 把投行演示材料生成从数小时压到 30 秒。Cambridge CCAF 2026 调查显示,21% 的金融机构已把 AI agent 投入生产、52% 在试点或更靠后阶段——渗透速度明显快于多数行业。
#行业应用
另有 2 家信源报道
展开详情
  • **回报数字**:KPMG 记录 13 个月平均 2.3 倍回报、头部每 1 美元收 8 美元,行政/客服类 6–13 个月见 ROI,最快落地的是客服与反欺诈
  • **硬效果**:欺诈检测误报率降 60%+,放贷审核提速 40–60%(几天→几分钟),JPMorgan 投行材料生成从数小时→30 秒
  • **渗透率**:Cambridge CCAF 2026 调查——21% 金融机构已投产 agent、52% 在试点或更后阶段,落地速度快于多数行业
推荐理由:对个人的机会:金融是‘错一步就赔钱、合规又硬’的行业,恰恰是 AI 落地咨询/交付溢价最高的地方之一。你不需要懂全部金融,选一个具体环节(反欺诈规则、放贷材料审核、合规文书、KYC 数据核对)深挖,把‘模型能力’翻译成‘这家机构能少赔多少、少花多少工时’,就是可收费的价值。数字已经证明买家肯付钱、回本也快——缺的是把模型嵌进他们既有系统和合规流程的人。
商机信号(加速):谁付钱:银行、消费金融、支付与保险机构的风控/合规/信贷部门,以及服务它们的金融科技集成商 痛点:反欺诈误报太高拖垮体验、放贷审核太慢流失客户、合规文书与 KYC 消耗大量人工,且每一步都受强监管约束、不敢乱上 切入点:个人/小团队先做一个极窄环节的‘可验证 ROI’交付(如放贷材料自动核对或反欺诈规则辅助),用一家机构的真实省钱数字做背书,再复制到同类机构
#04
posthog.com Article
NEW

把 agent skill 写好的工程实践:三层渐进披露省约 40% token、准确率升 15–20%,而 238 个真实 skill 里 99% 至少有一个能被审查抓出的毛病

随着 skills 生态爆发,‘怎么写一个好 skill’本身正在成为一门元技能。本周几篇工程实践把要点讲透了:核心是‘渐进披露(progressive disclosure)’——SKILL.md 主文件控制在约 500 行 /5000 token 以内,只放导航和主流程,细节推到 reference 文件,并告诉 agent‘什么时候才去读哪个文件’。实测三层披露(启动时约 100 token 的名字+描述 / 激活时的主体 / 按需的引用文件)相比单一大 prompt 能省约 40% token、任务完成准确率升 15–20%。另一条反直觉的建议是‘先审后写’:一项 UC Irvine 对 238 个真实 skill 的研究发现,99% 至少带一个例行审查就能抓出来的缺陷——审计你已经在用的 skill,往往比再写一个新的更划算。
#Skills#元技能
另有 2 家信源报道
展开详情
  • **渐进披露**:SKILL.md 控制在约 500 行/5000 token,细节下沉到 reference 文件并写明‘何时加载’,三层结构省约 40% token、准确率升 15–20%
  • **一个 skill 一个动词**:单一职责、可发现的描述、版本化、拿真实任务测试,是可靠 skill 的通用准则
  • **先审后写**:UC Irvine 扒 238 个真实 skill,99% 至少有一处例行审查能抓的缺陷——审计在用的比再造新的更值
推荐理由:对普通人的机会:skills 是这一波里门槛最低、复用性最高的一种‘AI 资产’——它跨模型、跨项目,还直接省你的 token 账单。而写好它靠的不是编程天赋,是‘把一件事讲清楚、讲精简’的工程素养。花半天把渐进披露、单一职责、按需加载这几条吃透,你就能把自己最熟的一套工作流固化成一个高质量 skill;再往前一步,‘帮别人审 skill、优化 skill’本身就是一门能收费的元技能,因为 99% 的存量 skill 都有毛病可修。
#05
arXiv Paper
NEW

CAITLYN: Can LLM Agents Autonomously Synthesize Defenses against Emerging Injection Attacks?

CAITLYN(8 月 28 日提交 arXiv)研究一个很实际的问题:当新的提示注入攻击不断冒出来、人工写防御规则永远追不上时,能不能让 LLM agent 自己去合成针对新攻击的防御?它提出的‘System II’式方法在多种 agent 环境里显著降低了攻击成功率。这切中了当前 agent 落地最大的软肋:一旦 agent 能读网页、调工具、跑代码,它的输入面就成了攻击面——一段藏在网页或文档里的指令,就可能让它删数据、泄密、乱花钱。与其被动打补丁,不如让防御端也具备‘自我进化’的能力。
把‘agent 安全’从‘人工写规则堵漏’推向‘让 agent 自己合成防御’,回应了 agent 大规模落地后最现实的风险——提示注入与工具调用被劫持。
#Infra
展开详情
  • **问题真实**:agent 一旦能联网、调工具、执行代码,输入即攻击面——提示注入与工具调用劫持是当下最主流的两类威胁
  • **新思路**:不再靠人工穷举规则,而是让 agent 自主合成针对新型注入攻击的防御(System II 式方法),在多环境显著降低攻击成功率
  • **落地含义**:防御端也要能‘自我进化’,才追得上不断变形的攻击——这对任何要把 agent 放进生产的人都是必修课
推荐理由:对普通人的机会:几乎所有关于 agent 的教程都在教‘怎么让它更能干’,很少有人教‘怎么让它别被人骗着干坏事’——而这恰恰是企业把 agent 投产前最担心、最愿意付钱解决的问题。你现在就该养成把‘安全’当默认项的习惯:给你的 agent 加输入校验、限制工具权限、隔离不可信内容。懂‘agent 安全’的人在市场上极稀缺,哪怕只是能帮团队做一次‘提示注入自查’,都是一个清晰的差异化技能。
#06
Product Hunt Product
NEW

Aloud

Aloud 把一件很小但很痛的事做顺了:让你‘对着说’来指挥编码 agent。它把口头反馈实时转成结构化任务,直接交给你的 coding agent 去执行——你在 review 代码或界面时,不用停下来敲一大段指令,说出来就行。看起来只是个语音层,但它踩中了 agent 时代一个新的交互瓶颈:模型越来越能干,人给它下指令的‘带宽’反而成了瓶颈。语音是把‘人的意图’更快灌进 agent 的一种自然方式。
#DevTools#上线初期以免费/试用为主(以…
展开详情
  • **降低指令成本**:口头反馈实时转成 coding agent 能直接执行的任务,省去边 review 边敲长指令的中断
  • **踩中新瓶颈**:模型能力过剩后,‘人给 agent 下指令的带宽’成了新瓶颈,语音是提高这一带宽的自然解法
  • **小而聚焦**:不做大而全的 IDE,只把‘说→任务→执行’这条链路做顺,是典型的‘薄工具解真痛点’
推荐理由:对普通人的机会:agent 时代最被低估的一类产品,是‘人机交互层’的小工具——不改变模型能力,只让人更省力地把意图传给 agent。Aloud 证明了哪怕只做‘语音→任务’这一薄薄一层,也能立住。如果你在观察自己每天用 agent 时‘最别扭的那 30 秒’是什么,把它做成一个薄工具,很可能就是一个能立刻上手、也能立刻验证的小产品切口。
#07
trillet.ai Article 值得关注
NEW

AI 语音前台‘代运营’的单位经济学:代理商普遍 $300–600/月一套,底层成本约 $0.07/分钟,替掉一个 $3–4.5 万/年的人工前台

把本周语音前台赛道的报价单摊开算账,机会点很具体:代理商给小微商户的标准 AI 前台套餐(7×24 接听、预约、线索筛选、通话摘要)普遍报 $300–600/月,而底层平台成本低到 Retell 约 $0.07/分钟,语音 agent 相比人工能把电话处理成本压 85–90%——对比一个 $3–4.5 万/年的人工前台,商户账立刻算得过来,行业调查里 97% 用了语音 agent 的小微商户报告营收有增长。昨天我们聊过‘白标平台自助窗口在收窄’,今天这条补的是另一半:机会正从‘卖平台’清晰地挪向‘按垂类代运营+按月收服务费’,而后者的定价和成本结构现在是透明的、可复制的。
#小微现金流
另有 2 家信源报道
展开详情
  • **报价单**:代理商标准套餐 $300–600/月,底层成本约 $0.07/分钟,毛利空间清晰;对手是 $3–4.5 万/年的人工前台
  • **买家账好算**:语音 agent 把电话处理成本压 85–90%,调查中 97% 使用的小微商户报告营收增长,成交阻力低
  • **机会转移**:从‘搭白标平台’挪向‘垂类代运营+按月服务费’,定价与成本结构透明、可复制,适合个人/小团队起步
推荐理由:对想挣现金流的普通人:这是当下少数‘定价透明、成本明确、买家肯付’的可落地路子。别去卷做平台(大厂在收窄自助窗口),去做‘某一个垂类的语音前台代运营’——比如只服务牙科诊所、只服务房产中介、只服务本地维修——把话术、预约流程、常见问答针对这一行调到位,按 $300–600/月收服务费。壁垒不在技术(平台现成),在于你对某一行业务流程的理解和交付口碑。
My Take:评分(5=最优):最快成交 4 / 最低成本 4 / 可复制 4 / 风险安全度 3。定价成本透明、买家账好算,适合选一个垂类做代运营起步。
商机信号(加速):谁付钱:本地小微商户(诊所、房产中介、维修/家政、餐饮预约类),以及想加一条服务线的营销/自动化代理商 痛点:漏接电话=漏掉订单,但雇专职前台一年 $3–4.5 万太贵、还只覆盖上班时间;老板既没时间也没技术自己搭语音 agent 切入点:锁定一个垂类,把该行业的话术/预约/常见问答在现成平台上调到位,按 $300–600/月做‘代运营+按月服务费’,用一两家标杆客户的口碑复制到同行
#08
getperspective.ai Opinion
NEW

Perspective AI

AI 演示很容易,AI 落地很残酷——OpenAI、Anthropic、Google 现在照抄的,正是 Palantir 那套‘工程师钻进客户大楼、用客户的烂数据、解客户的真问题’的前置部署打法。
这篇复盘拆解了为什么‘前置部署工程师(FDE)’突然成了顶级 AI 公司的标配角色:不是因为工具不够好,而是因为‘把一个强能力变成一个客户真正能用的业务结果’这件事,无法靠产品团队远程交付。FDE 的核心打法是‘第一天就上线’——不写长篇需求文档,而是钻进客户现场、用客户的真实(往往很脏的)数据,把 demo 直接变成生产,再扶着客户到能自己跑。文章指出 Palantir 是这套模式的原始模板,如今 OpenAI(2024 年底组建)、Anthropic(放在 Applied AI 组下)、Google Cloud 都在照抄,薪酬也水涨船高:中级 FDE 总包 $30–45 万、资深 $45–55 万、staff/principal 冲到 $60 万+。
#FDE
另有 1 家信源报道
推荐理由:对个人的机会:FDE 是当下 AI 领域‘供给最短缺、溢价最高’的岗位,而它稀缺不是因为技术门槛高得离谱,而是因为它要的是一种罕见组合——工程能力 + 直接面对客户脏数据和真业务的耐心和同理心。如果你是工程师,想在这波里拿到最高溢价,方向很明确:别只练‘写更好的代码’,去练‘把模型能力嵌进别人真实业务、并对最终业务结果负责’。哪怕从帮一家小公司把 AI 真正跑起来开始,这种‘交付到业务结果’的经验,就是 FDE 履历的起点。