Hall of Fame
今日趋势综述
今天的信号:模型已经不是瓶颈,『把 agent 落进业务』才是
今天几条硬信号指向同一个判断——模型强不强已经不再是胜负手。Pinecone 把自己从向量库重命名成『agent 的知识引擎』,Nexus 进入公测,主打『把公司知识预先编译好、让 agent 直接查』;一篇 7 月的论文《Memory as a Controlled Process》给出同样的判断:当模型执行力够强,瓶颈就从『会不会推理』转移到『对的经验有没有在对的时刻被调出来』。Docker 在 AI Engineer World's Fair 的报告更直接:evals、上下文工程、harness 工程、memory、sandbox 正在长成一批 agent 专属的新工种。翻译成一句话:值钱的不再是模型本身,而是模型外围那一整套『让它可靠干活』的工程。
与『喂对知识』并列的另一半,是『管住它能做什么』。Kastra 本周在 Product Hunt 上线,做的就是 agent 的运行时授权层——动作执行前先过确定性策略、亚毫秒级拦截,一套控制面管 Claude Code、Cursor、Codex、OpenClaw。它和前几天的 OpenAI Presence、Alterion Draco 同一命题:2026 下半年,巨头和创业者一起在把 agent 关进『可审计、可约束』的笼子。而这套能力在真实行业里的兑现方式,就是今天的法律 AI 实测和 FDE 需求爆炸——律所赢家赢在『把 AI 卡进某一道工序、用引用准确率 99.2% 这种硬指标说话』;FDE 岗位一年涨 729%、资深年薪冲到 $785K,值钱的正是『翻越集成墙、把模型接进客户烂系统』的最后一公里。
对个人的可执行结论:把注意力从『哪个模型最强』移开,押注三件能复利的事。一是外围工程能力——上下文/记忆管理、eval、harness、agent 授权与护栏,这些是招聘市场正在开的新岗、也是把 demo 做到生产的分水岭;二是行业最后一公里——别做通用大模型,去帮某一类客户把某一道工序真正嵌进去,切口越窄、指标越硬越好成交(法律的合同审查、判例检索都是现成模板);三是可落地的现金流——像 AI 催缴找回失败支付这种『帮别人止血、按止血额分钱』的小生意,痛点硬、ROI 一算就清、客户天然愿付。今天每一条,都在说同一句话:谁能把『能力』翻译成『客户敢用、能算出 ROI 的流程』,谁就掌握了模型进步也抹不平的价值。
Kastra:给 AI agent 装『运行时授权层』——动作执行前先过策略,亚毫秒级拦截
展开详情
- **定位**:不是又一个 agent 框架,而是横在 agent 与工具之间的『授权闸门』,动作执行前先拦一道
- **能力**:亚毫秒级、确定性策略,覆盖工具调用/提示/输入/输出,一套控制面管 Claude Code、Cursor、Codex、OpenClaw、各家 SDK
- **信号**:与 OpenAI Presence、Alterion Draco 落在同一命题——2026 下半年的主战场是『把 agent 关进可审计的笼子』
Pinecone Nexus 公测:把公司知识『编译』成结构层,让 agent 直接查而不是每次重新检索
展开详情
- **思路转变**:从『每次 retrieval』升级到『一次 knowledge compilation』——把推理提前到『编译知识』阶段,而非临场检索
- **数字(厂商自报)**:官方称任务完成率 90%+、速度最高快 30×、token 支出最多降 90%(待第三方复现)
- **同一命题**:2026 的共识是『瓶颈不再是模型,而是让 agent 拿到对的知识』——Nexus、agent 记忆论文都在回答这件事
Memory as a Controlled Process: Learned Adaptive Memory Management for LLM Agents
展开详情
- **核心判断**:模型够强之后,瓶颈不再是推理能力,而是『对的经验有没有在对的时刻被 surface 出来』
- **方法**:把记忆当『被学习控制的过程』,自适应管理记什么/忘什么/何时调用,而非无脑堆历史
- **意义**:与外部知识引擎(如 Nexus)互补,共同指向 2026 的主线——上下文与记忆管理才是 agent 落地的真瓶颈
模型不再是瓶颈:evals、上下文工程、harness 工程正在长成 agent 时代的新工种
展开详情
- **新工种**:Docker 报告点名 evals、上下文工程、harness 工程、memory、sandbox 等 agent 专属学科正在独立成型
- **数字**:70%+ 组织生产里同时跑 3+ 模型;Gartner 预测 2027 年底 40%+ agentic 项目被砍
- **本质**:失败点从『模型会不会』转向『工具调用、分支、重试、交接叠起来的序列级可靠性』
法律 AI 落地实测:赢家不是买了最强模型,而是把 AI 卡进某一个具体工作流
展开详情
- **大盘**:用 AI 的律所两年从 26% 升到 42%;但赢家赢在『嵌进某道工序』,不是『买最强模型』
- **数字(合同/动议)**:合同审查提速约 60%;Rupp Pfalzgraf 86% 采用率、复杂动议起草压到约 1/4 时间
- **数字(检索)**:一家所死磕单一指标『引用准确率』做到 99.2%,6 个月从语料到合伙人采用——单点极致胜过全面平庸
AI 催缴/失败支付找回:一门被低估的小微现金流生意——帮订阅制商家把漏掉的钱捞回来
展开详情
- **痛点(有数字)**:订阅制平均漏 ~9% MRR 于非自愿流失;$10K MRR 每月漏 $900–1000
- **对比(有数字)**:传统催缴找回 30–40%,AI 催缴(读拒付码+择时重试)找回 65–80%
- **已跑通**:Churnkey 约 $30K MRR、平均降 18% 流失——需求被验证过,不是空想
Forward Deployed Engineer 需求爆炸:一年岗位涨 729%,资深年薪冲 $785K,值钱的是『翻越集成墙』
展开详情
- **数字**:FDE 岗位一年涨约 729%(643→5330);资深年薪 $250K–400K,Anthropic/OpenAI 资深岗 $785K+
- **本质**:值钱的不是会调模型,而是翻越『集成墙』——接老旧 SQL、搞定 SAML/OIDC、过数据驻留合规
- **定位**:FDE 是把模型能力变成企业收入的『最后一公里』通道,需求指数增长而供给线性增长
写好 Agent Skill 的第一杠杆:把 description 当『路由规则』写,而不是摘要
展开详情
- **最高杠杆**:启动时模型只看到每个 skill ~100 token 的 description;把它写成『何时触发』的路由规则,而非『是什么』的摘要
- **token 账**:元数据 ~100 token 常驻扫描,完整指令 <5k token 命中才加载——这就是渐进式披露省 context 的逻辑
- **工程规矩**:SKILL.md <500 行、文件引用只下探一层、长文件加目录,别一次性把上下文塞满