Hall of Fame
今日趋势综述
今天的信号:能力不缺,缺的是把 agent『管起来、验起来、托起来』的那层
把今天几条串起来,主线是从『造更强的 agent』转向『管好已有的 agent』。微软 agent-governance-toolkit 一个多月冲到近 6000 星,做的不是模型而是护栏——在工具调用真正执行前拦下来,用 YAML 规则把危险动作变成『结构上不可能』,还对齐了 OWASP Agentic Top 10、NIST、欧盟 AI 法案。Cloudflare 给 agent 一台跑在 Durable Object 里的『电脑』(文件系统+shell+JS 执行),Theo 的 T3 Code 干脆把一群编码 agent(Codex/Claude/Cursor/Grok/OpenCode)收进一个手机+网页+桌面的统一控制台,18 万星。方向一致:agent 数量在爆炸,价值转移到『怎么统一指挥、约束、观测它们』。
第二条线是『验证』开始变得可量化、可证伪。SkillsBench 是第一个系统评测 agent skill 到底有没有用的基准:curated skill 把平均通过率从 33.9% 抬到 50.5%(+16.6 个百分点),但按领域差异极大——软件工程只涨 4.5pp,医疗能涨 51.9pp,84 个任务里还有 16 个是负收益。翻译成人话:技能不是越多越好,配错场景会拖后腿。同一天,医疗 ambient scribe 的五医院两年实测也在做『祛魅』——每天真正省下的是 13 分钟 EHR、16 分钟文书(相对降 3% 和 10%),远没有厂商 PR 稿说的那么神,但医生的倦怠率和幸福感改善是真的。信号很一致:这一年值钱的不是喊数字,而是拿得出可复现、带正负两面的实测。
对个人的机会因此很具体:一是别再只堆能力,去补『治理/观测/验证』这类稀缺工程位——会给 agent 加护栏、会用 SkillsBench 式方法证明『我这套配置真的更好』的人,正在变贵;二是接落地单要挑对场景,医疗实测告诉你同一个工具在不同科室/流程收益能差十倍,先验证再铺开;三是最快的现金流仍在『把成熟能力拼成一个具体服务卖出去』——今天这条 AI 语音前台代运营,用现成平台给本地小商家堵住每天流失的漏接电话,单客户 $300–800/月、两三周见钱,就是这个逻辑的最新样本。
cloudflare/computer
展开详情
给 agent 一台真正的『电脑』:在 Cloudflare 的 Durable Object 里跑一个持久虚拟文件系统(SQLite 落盘),并暴露三种可插拔执行后端——容器化 Linux(FUSE 挂载)、Worker 里的 bash shell、以及 JS 模块执行,让 agent 能像人一样读写文件、跑命令、保存状态。
周增长:本周登上 GitHub Trending / OSSInsight AI 分类前列(具体周增未经 API 核实)
- **给 agent 一台电脑**:持久虚拟文件系统 + 三种执行后端(容器 / Worker shell / JS),状态跨会话保留
- **边缘原生**:跑在 Durable Object 上、SQLite 落盘,天然分布式、无需自建沙箱基础设施
- **定位诚实**:官方标注 preview、不建议上生产,适合实验与原型——是趋势信号而非成品
microsoft/agent-governance-toolkit
展开详情
给自主 agent 装一层『确定性护栏』:不靠 prompt 里写『请不要删库』,而是在工具调用真正执行前用中间件拦截,用 YAML 规则决定放行/拒绝,把危险动作在结构上变成不可能,并留下防篡改的审计日志。
周增长:本周登上 GitHub Trending AI 分类(具体周增未经 API 核实)
- **确定性护栏**:在工具调用执行前拦截,用 YAML 规则把危险动作变『结构上不可能』,不靠模型自觉
- **合规现成对齐**:OWASP Agentic Top 10 / NIST AI RMF / 欧盟 AI 法案,附 992 项一致性测试
- **生产件齐全**:零信任身份、执行沙箱特权分级、kill switch、SLO 监控,多语言 SDK 可接主流框架
pingdotgg/t3code
展开详情
把散落各处的编码 agent 收进一个统一控制台:一个『agent harness 控制面』,让你从 iOS/Android 手机、网页和桌面端同时指挥、切换、监督多个编码 agent(支持 Codex、Claude、Cursor、Grok Build、OpenCode),随时随地看它们干到哪了。
周增长:本周高居 GitHub Trending(具体周增未经 API 核实)
- **多 agent 驾驶舱**:一个控制面统管 Codex/Claude/Cursor/Grok/OpenCode,手机/网页/桌面三端同步
- **范式转移**:从『单 agent 自动补全』到『并行监督一群 agent』,控制台成了新的开发主界面
- **信誉背书**:Theo(ping.gg / T3 生态)出品、18 万星、MIT 开源、明确不卖钱,纯为开发体验
医疗 AI 落地实测:五医院两年数据把 ambient scribe 拉回真实——每天省 13–16 分钟,但医生倦怠率降 21%
展开详情
- **祛魅数字**:五医院两年实测,日均仅省 13 分钟 EHR + 16 分钟文书(相对降 3% / 10%),非厂商宣称的翻倍神效
- **另一面是真的**:MGB 84 天后倦怠率降 21.2%、Emory 幸福感升 30.7%、Intermountain 高频用户记录时间降 27%
- **收益看深度**:省时高度依赖科室和使用频次,用得浅几乎无感、用得深才见效——铺开前必须先验证场景
编码评测本周格局:SWE-bench Pro 上 Claude Fable 5 独走 80.0,商用第二档 64.6,开源天花板 62.1
展开详情
- **对比**:Claude Fable 5 ~80.0 vs GPT-5.6 Sol ~64.6 vs GLM-5.2 ~62.1(SWE-bench Pro,越难越能拉开差距)
- **梯队**:第一名断层领先,但商用第二档到开源天花板全挤在 60–65 分的一小段,选谁看性价比不看名次
- **尺子变了**:原版 SWE-bench Verified 普遍 90%+ 已难分高下,加难的 Pro 才是当下有区分度的评测
SkillsBench: Benchmarking How Well Agent Skills Work Across Diverse Tasks
展开详情
- **首个尺子**:87 任务 / 8 领域 / 7308 条轨迹,第一次把『技能有没有用』做成可复现、可比较的量化基准
- **收益真实但不均**:curated 技能平均通过率 33.9%→50.5%(+16.6pp),但软件工程仅 +4.5pp、医疗高达 +51.9pp
- **技能不是越多越好**:84 个任务中 16 个出现负收益,用错场景的技能会反向拖累 agent
AI 语音前台代运营:给本地小商家堵住每天流失的漏接电话,单客户 $300–800/月
展开详情
- **痛点具体到钱**:6200 万+ 小商家高峰接不过电话,每个漏接损失 $500–2K,AI 前台直接把这部分收入接住
- **拼装即可交付**:Callin.io(白标语音)+ n8n + Cal.com,无需自研,2–3 周上线第一个客户
- **单位经济健康**:$1–2K 搭建 + $300–800/月/客户、~80% 毛利,3–5 客户即 $5–15K MRR、一人可扛
AMP by CanyonTechs:让 AI 盯着生产日志,出故障自动开一个可审阅的修复 PR
展开详情
- **无人值守修故障**:自动盯日志→分析根因→开可审阅 PR,全程无需 prompt,人只做最终 review
- **声称 80%+ 修复率**:已认证 Java / Python / TypeScript / Node.js / Rust,覆盖主流后端栈
- **方向延伸**:agent 从『写新代码』走向『守旧系统』,AI SRE / 自动事故修复成新战场