Hall of Fame
今日趋势综述
今天的信号:会用模型不稀缺,能把它『安全地编排进生产』才稀缺
把今天几条串起来,一条主线很清楚:模型本身越来越不是护城河,真正在被抢的是它外面那一圈——技能怎么分发、动作怎么留痕、上下文怎么喂、agent 怎么进真实业务。最有代表性的是英伟达把自家 650+ 个 skill 收进一个官方目录,签名可验、日更同步,能一键装进 Claude Code、Codex、Cursor 等多个 agent;这不是在发一个模型,而是在铺一条『把厂商能力标准化地送进任意 agent』的分发管道。CopilotKit 的 OpenBot 则给每个 agent 配一台独立电脑(浏览器、文件、工具),关键是『每个动作先决策、后记录』——它押的是治理和可审计,而不是又一个更聪明的 agent。
第二条线是『工程细节决定成败』。arXiv 上的 Agent Zero Memory 把 agent 记忆拆成三套各司其职的结构、还要求每条事实都带来源证据,在 LongMemEval 拿到 95.60%、LoCoMo 93.60% 的新高,同时把单次查询成本压到最多 1/20——记忆这种『看不见的地基』做扎实,效果和成本能同时改善。开发圈这半年最热的词『上下文工程』说的也是同一件事:模型再强,只要上下文喂错、喂满,性能就会『腐烂』(context rot),一篇做了 9649 组实验的论文把这点摆上了台面。连 Vercel 都反其道而行,开源了一个用 Zig 写、只有 6MB、冷启动约 10 微秒的编码 agent fx,专为『嵌进别的系统里』设计——轻、可嵌、可审计,正在取代『又大又全』成为新审美。
所以对个人最实的一句话:别再纠结『该用哪个最强模型』,去练那圈更稀缺的工程手艺——把技能打包成能复用的 skill、把上下文喂对、给 agent 的动作留下可审计的痕迹、把这套东西塞进一个愿意付钱的具体场景。今天的两个落地样本正好是这句话的两端:DHL 把 AI 铺进整个欧洲货运网,把关键航线的时效压掉 10–15%、末端成本降 15–20%,是大厂把 AI 编排进真实物流的账本;而在小生意这头,一个用 Retell/Synthflow 白牌搭的『AI 电话前台』,按店按月收 $200–500,就能替下一年三四万美元的真人前台、帮牙科理疗律所这类靠电话接单的小店堵住漏接的漏单——同一套逻辑,大到跨国物流,小到街角门店,值钱的都是那份把模型落到具体业务里的编排力。
CopilotKit/OpenBot
展开详情
一个开源框架:给每个 AI『同事』配一台自己的电脑——独立的浏览器、文件系统和工具,让它在隔离环境里干活。它最特别的地方是治理模型:agent 的每一个动作都『先决策、经校验、再执行,事后完整记录』,天生可审计。而且它不绑定任何 agent 框架——只要说 AG-UI 这个开放协议,LangGraph、Mastra、CrewAI、Pydantic AI、Google ADK 或手写的 agent 都能一样接入,治理跟着协议走而不是跟着框架走。
周增长:据第三方榜单,上线约三周累计 4400+ 星、动量分 92.4,属近期新开源 agent 里增速靠前的一个
- **独立沙箱**:每个 agent 拥有自己的浏览器/文件/工具环境,隔离执行、互不干扰宿主系统
- **动作留痕**:每个动作『先决策、后记录』,可审计、可回溯——把放任 agent 乱跑的风险框住
- **框架无关**:基于开放协议 AG-UI,LangGraph/CrewAI/Mastra/Google ADK/手写 agent 都能同样接入,治理跟着协议走
fx (by Vercel)
展开详情
Vercel 开源的一个极小编码 agent:用 Zig 写、编译成约 6MB 的原生二进制,冷启动约 10 微秒、内存基线只有个位数 MB——小到可以嵌进别的系统里。它不做全屏 TUI,而是把自己当成 Unix shell 里的一个命令,输出随终端滚动、和你其它命令组合使用。支持 MCP、Git、多文件编辑、沙箱权限、多模态输入、Web 搜索和本地模型;还能直接跑、暴露 ACP server,或编译成 WebAssembly 塞进浏览器/JS 宿主。
周增长:作为 Vercel 内部工具转开源,发布即被多家媒体报道,属本阶段关注度较高的轻量编码 agent
- **极轻**:Zig 写成、约 6MB 原生二进制,冷启动约 10 微秒、内存基线个位数 MB,小到能嵌进别的系统
- **可组合**:界面是 Unix shell 而非全屏 TUI,能和你其它命令拼在一起用;支持 MCP/ACP/WebAssembly 多种接入方式
- **开源免费**:Apache-2.0,本体不收费,只按你用的模型推理计费——适合拿来做 agent 基础设施的底层零件
Agent Zero Memory: 三套并行、带来源证据的长期记忆架构
展开详情
- **硬指标**:LongMemEval 95.60%、LoCoMo 93.60%,两个长期记忆基准双双刷新纪录
- **降本**:单次查询成本最多降到 1/20,效果与成本同时改善,而非二选一
- **带证据**:每条事实携带来源证据(provenance),既提升检索质量,又让 agent 的回答可追溯、可审计
物流 AI 落地实测:DHL 把 AI 路径优化铺进整个欧洲货运网,关键航线时效压 10–15%、末端成本降 15–20%
展开详情
- **时效**:关键航线运输时间压缩 10–15%,末端部分场景配送时间最多缩短 20%
- **成本**:最后一公里成本降 15–20%,燃油与碳排随路径优化明显下降
- **行业账本**:物流 AI 部署普遍 3–18 个月回本,路径优化首年 ROI 150–400%、预测性维护 200–500%,但中位实现 ROI 仅约 10%——落地执行拉开差距
AI 电话前台:用 Retell/Synthflow 白牌给小店做『不漏接』的接线员,月费 $200–500 替下三四万美元的真人前台
展开详情
- **成本差**:AI 前台 $200–500/月 vs 真人前台 $3,000–4,500/月,还 7×24 无限并发接听
- **付费信号硬**:Retell 据报道 $40M+ ARR、半年 MRR 增长 3 倍;97% 用了语音 agent 的小微企业反馈营收增加
- **上手快**:用 Retell/Synthflow 一个人几小时就能给一家店搭出能预约/答疑/转接的入站 agent,可模板化复制到同行业其它店
『上下文工程』正在取代提示词工程:模型再强,喂错上下文照样『腐烂』
展开详情
- **换词**:从『提示词工程(怎么问)』转向『上下文工程(周围放什么信息)』——schema、文件、检索架构成了成败关键
- **context rot**:上下文越长模型性能越差,远在窗口填满前就开始『腐烂』,是可测量的真实现象(一篇 9649 组实验论文佐证)
- **贵且更差**:百万 token 窗口下,无脑把一切塞进上下文既烧钱又降质,精心裁剪与检索才是正解
MagiCrew(Magic)
展开详情
- **一体化**:通用 agent + 工作流引擎 + 团队 IM + 协作办公套件揉进一个开源项目,可自托管
- **场景实**:竞品情报、文档/PPT 生成、流程自动化、数据分析、脚本执行——都是办公室里的真活
- **开源可自托管**:底层 Magic 项目开源、数据可留在自己环境,适合在意数据主权、想自建 AI 办公台的团队