Hall of Fame
今日趋势综述
今天的信号:模型已经不是瓶颈,『把 agent 落进业务』才是
今天几条硬信号指向同一个判断——模型强不强已经不再是胜负手。Pinecone 把自己从向量库重命名成『agent 的知识引擎』,Nexus 进入公测,主打『把公司知识预先编译好、让 agent 直接查』;一篇 7 月的论文《Memory as a Controlled Process》给出同样的判断:当模型执行力够强,瓶颈就从『会不会推理』转移到『对的经验有没有在对的时刻被调出来』。Docker 在 AI Engineer World's Fair 的报告更直接:evals、上下文工程、harness 工程、memory、sandbox 正在长成一批 agent 专属的新工种。翻译成一句话:值钱的不再是模型本身,而是模型外围那一整套『让它可靠干活』的工程。
与『喂对知识』并列的另一半,是『管住它能做什么』。Kastra 本周在 Product Hunt 上线,做的就是 agent 的运行时授权层——动作执行前先过确定性策略、亚毫秒级拦截,一套控制面管 Claude Code、Cursor、Codex、OpenClaw。它和前几天的 OpenAI Presence、Alterion Draco 同一命题:2026 下半年,巨头和创业者一起在把 agent 关进『可审计、可约束』的笼子。而这套能力在真实行业里的兑现方式,就是今天的法律 AI 实测和 FDE 需求爆炸——律所赢家赢在『把 AI 卡进某一道工序、用引用准确率 99.2% 这种硬指标说话』;FDE 岗位一年涨 729%、资深年薪冲到 $785K,值钱的正是『翻越集成墙、把模型接进客户烂系统』的最后一公里。
对个人的可执行结论:把注意力从『哪个模型最强』移开,押注三件能复利的事。一是外围工程能力——上下文/记忆管理、eval、harness、agent 授权与护栏,这些是招聘市场正在开的新岗、也是把 demo 做到生产的分水岭;二是行业最后一公里——别做通用大模型,去帮某一类客户把某一道工序真正嵌进去,切口越窄、指标越硬越好成交(法律的合同审查、判例检索都是现成模板);三是可落地的现金流——像 AI 催缴找回失败支付这种『帮别人止血、按止血额分钱』的小生意,痛点硬、ROI 一算就清、客户天然愿付。今天每一条,都在说同一句话:谁能把『能力』翻译成『客户敢用、能算出 ROI 的流程』,谁就掌握了模型进步也抹不平的价值。
Kastra:给 AI agent 装『运行时授权层』——动作执行前先过策略,亚毫秒级拦截
展开详情
- **定位**:不是又一个 agent 框架,而是横在 agent 与工具之间的『授权闸门』,动作执行前先拦一道
- **能力**:亚毫秒级、确定性策略,覆盖工具调用/提示/输入/输出,一套控制面管 Claude Code、Cursor、Codex、OpenClaw、各家 SDK
- **信号**:与 OpenAI Presence、Alterion Draco 落在同一命题——2026 下半年的主战场是『把 agent 关进可审计的笼子』
Pinecone Nexus 公测:把公司知识『编译』成结构层,让 agent 直接查而不是每次重新检索
展开详情
- **思路转变**:从『每次 retrieval』升级到『一次 knowledge compilation』——把推理提前到『编译知识』阶段,而非临场检索
- **数字(厂商自报)**:官方称任务完成率 90%+、速度最高快 30×、token 支出最多降 90%(待第三方复现)
- **同一命题**:2026 的共识是『瓶颈不再是模型,而是让 agent 拿到对的知识』——Nexus、agent 记忆论文都在回答这件事
Memory as a Controlled Process: Learned Adaptive Memory Management for LLM Agents
展开详情
- **核心判断**:模型够强之后,瓶颈不再是推理能力,而是『对的经验有没有在对的时刻被 surface 出来』
- **方法**:把记忆当『被学习控制的过程』,自适应管理记什么/忘什么/何时调用,而非无脑堆历史
- **意义**:与外部知识引擎(如 Nexus)互补,共同指向 2026 的主线——上下文与记忆管理才是 agent 落地的真瓶颈
模型不再是瓶颈:evals、上下文工程、harness 工程正在长成 agent 时代的新工种
展开详情
- **新工种**:Docker 报告点名 evals、上下文工程、harness 工程、memory、sandbox 等 agent 专属学科正在独立成型
- **数字**:70%+ 组织生产里同时跑 3+ 模型;Gartner 预测 2027 年底 40%+ agentic 项目被砍
- **本质**:失败点从『模型会不会』转向『工具调用、分支、重试、交接叠起来的序列级可靠性』
法律 AI 落地实测:赢家不是买了最强模型,而是把 AI 卡进某一个具体工作流
展开详情
- **大盘**:用 AI 的律所两年从 26% 升到 42%;但赢家赢在『嵌进某道工序』,不是『买最强模型』
- **数字(合同/动议)**:合同审查提速约 60%;Rupp Pfalzgraf 86% 采用率、复杂动议起草压到约 1/4 时间
- **数字(检索)**:一家所死磕单一指标『引用准确率』做到 99.2%,6 个月从语料到合伙人采用——单点极致胜过全面平庸
AI 催缴/失败支付找回:一门被低估的小微现金流生意——帮订阅制商家把漏掉的钱捞回来
展开详情
- **痛点(有数字)**:订阅制平均漏 ~9% MRR 于非自愿流失;$10K MRR 每月漏 $900–1000
- **对比(有数字)**:传统催缴找回 30–40%,AI 催缴(读拒付码+择时重试)找回 65–80%
- **已跑通**:Churnkey 约 $30K MRR、平均降 18% 流失——需求被验证过,不是空想
Forward Deployed Engineer 需求爆炸:一年岗位涨 729%,资深年薪冲 $785K,值钱的是『翻越集成墙』
展开详情
- **数字**:FDE 岗位一年涨约 729%(643→5330);资深年薪 $250K–400K,Anthropic/OpenAI 资深岗 $785K+
- **本质**:值钱的不是会调模型,而是翻越『集成墙』——接老旧 SQL、搞定 SAML/OIDC、过数据驻留合规
- **定位**:FDE 是把模型能力变成企业收入的『最后一公里』通道,需求指数增长而供给线性增长
写好 Agent Skill 的第一杠杆:把 description 当『路由规则』写,而不是摘要
展开详情
- **最高杠杆**:启动时模型只看到每个 skill ~100 token 的 description;把它写成『何时触发』的路由规则,而非『是什么』的摘要
- **token 账**:元数据 ~100 token 常驻扫描,完整指令 <5k token 命中才加载——这就是渐进式披露省 context 的逻辑
- **工程规矩**:SKILL.md <500 行、文件引用只下探一层、长文件加目录,别一次性把上下文塞满
今日趋势综述
今天的信号:agent 的竞争从『更聪明』转向『能被企业信任地用起来』
今天最硬的信号来自巨头:OpenAI 推出 Presence——一个把 AI agent 装进企业语音/聊天、且自带策略、护栏、模拟、评测和『已审批动作』的部署级产品;Anthropic 同期上线面向财务/工程/设计的企业 agent 插件。注意它们卖的都不再是『更强的脑子』,而是『让企业敢把 agent 接进真实业务流程』的那一整套治理与交付能力。与此呼应,学术界冒出 FORCE-Bench 这类专门衡量『企业财务场景端到端可用性』的基准——大家开始认真回答『这玩意儿在真实工作流里到底靠不靠谱』。
另一条主线是『别再迷信榜首』。今天的评测现实是:排行榜已经碎成一张矩阵——SWE-bench 上 DeepSeek V4 领先、MMLU/LMArena 是 GPT-5.4、GPQA/Aider 又换 Opus 领跑,没有一个模型通吃。医疗一线的实测同样清醒:环境记录(ambient scribe)已是落地最广的临床 AI,但大型研究发现真实省时『温和且不稳定』,赢家赢在把 AI 嵌进流程、把人再培训好,而不是买了最强模型。
对个人的可执行结论就一句:模型能力正在被商品化,稀缺的是『把 agent 可靠地落进某个具体场景』的能力。无论你是想在某个行业做落地、把常用 skill 打磨成可复利资产、还是一个人做微 SaaS 挣现金流——今天的每一条都在指向同一个方向:谁能把『能力』翻译成『客户敢用、能算出 ROI 的流程』,谁就掌握了模型进步也抹不平的价值。
OpenAI Presence:把 AI agent 做成『受治理的企业产品』,横跨语音与聊天
展开详情
- **产品定位**:不是又一个聊天机器人,而是把 agent 装进企业语音+聊天工作流的部署平台,主打『可治理』
- **治理五件套**:策略、护栏、模拟、评测、已审批动作——把『敢不敢让 agent 动真格』这道企业级门槛做成了产品能力
- **同期呼应**:Anthropic 上线面向财务/工程/设计的企业 agent 插件,两大巨头同一周押注『企业级受控 agent』
别再迷信榜首:2026 年的 LLM 排行榜已经碎成一张矩阵,不同基准各有王者
展开详情
- **对比(编码)**:SWE-bench Verified 上 DeepSeek V4 ≈81% 领先,但前四名相差不到 3 分——编码这一列几乎并列,别为零点几分溢价买单
- **对比(分项王者)**:SWE-bench/LiveCodeBench 看 DeepSeek V4;MMLU/LMArena 看 GPT-5.4;GPQA/Aider 看 Claude Opus——同一批模型在不同基准上排名完全洗牌
- **对比(人类偏好)**:LMArena 上 Opus 4.8 ≈1510 ELO 居首,GPT-5.5 Pro / Gemini 3.1 Pro / Opus 4.7 / GPT-5.5 全在 55 ELO 内,差距小到用体感根本分不出
医疗 AI 落地实测:最普及的『AI 病历助手』真实省时其实温和又不稳定,赢家赢在流程
展开详情
- **大盘**:约 80% 医院已用 AI、FDA 授权 AI 医疗设备超 1357 个,环境记录是最普及的临床落地场景
- **一手数字(斯坦福试点)**:48 名医生,96% 觉得好用、78% 认为加快写病历,但仅约 2/3 真正报告省时;全院累计 AI 病历破百万份
- **现实检查**:大型研究显示真实省时『温和且不稳定』——差距不在模型强弱,在有没有嵌进流程、有没有把人训练到真正用起来
写 Agent Skills 的手艺正在成型:少装、装好、装可复用——2026 的 skills 工程共识
展开详情
- **选取原则**:好 skill = 把每周重复的一件活做得更可靠的操作规程;策略是『少装、装好、范围清晰』而非堆量
- **可移植**:同一份 SKILL.md 跨 Claude Code / Cursor / Gemini CLI / Codex CLI / Antigravity 通用,写一次到处能跑
- **工程实践**:加『反思钩子』——每次调用后让 agent 自评是否有用、没用就自动改进 SKILL.md,让技能自我进化
一个人做 AI 微 SaaS 的现金流打法:盯『新行为催生的监控层』,整套工具栈月成本压到 200 美元内
展开详情
- **成本账**:单人生产级 AI SaaS 工具栈月成本约 85–200 美元(Next.js+Supabase+Stripe+Vercel+LLM API),启动门槛低到咖啡钱
- **选题公式**:盯『新技术→新行为→需要监控/审计层』——例如 AI 编码普及催生的 PR 审查类工具,被验证有 1 万–5 万美元 MRR 空间
- **可复制路径**:多位单干者近半年做到 2 万–6 万美元 MRR,共性是窄场景+高付费意愿+公开构建+重留存,而非做通用大工具
FORCE-Bench: A Benchmark, Dataset, and Evaluation Harness for Agentic AI in Enterprise Finance
展开详情
- **评测对象**:端到端运营型财务工作流,需融合企业内部 ERP 记录与外部财务数据——直接对标真实企业场景,而非玩具题
- **质量维度**:按准确性、可追溯引用、清晰度、深度、依据扎实度、时效性、相关性、结构性八个维度打分,超越『答对即可』
- **风向意义**:与 OpenAI Presence、Anthropic 企业 agent 插件同频——评测正从『智商测试』转向『企业可信度测试』
volcengine/OpenViking
展开详情
OpenViking 是字节火山引擎开源的『AI Agent 上下文数据库』:它把 agent 需要的记忆(memory)、资源(resources)和技能(skills)统一成一个虚拟文件系统,挂在 viking:// 协议下——于是 agent 是用 ls、tree、find 去『浏览自己的上下文』,而不是去查一个看不见内部的黑箱向量库。内容被切成 L0 摘要 / L1 概览 / L2 细节三档按需加载,既省 token 又让每一次检索都留下可观察、可调试的轨迹;还能自动压缩对话、抽取长期记忆,让 agent 越用越『懂你』。一句话:它想做的是 agent 记忆这一层的开放标准。
周增长:字节火山引擎出品,2026 上半年开源后曾登顶 GitHub Trending(3 月中);作为 agent 的标准记忆/上下文层被越来越多项目(含 openclaw 生态)采用,热度持续
- **核心范式**:用文件系统(viking://)而非黑箱向量库管理 agent 的记忆/资源/技能,agent 用 ls/tree/find 浏览自己的上下文
- **省 token**:内容分 L0 摘要 / L1 概览 / L2 细节三档按需加载,每次检索留下可观察、可调试的轨迹
- **可演化**:自动压缩对话、抽取长期记忆,agent 越用越懂你;字节火山引擎出品,约 2.7 万 stars,被 openclaw 等生态采用
面向大型代码库的 Agentic Coding 实战指南:把 agent 当会跑循环的工程师,而不是自动补全
展开详情
- **分水岭**:vibe coding(不看 diff、催到能跑)在大仓必翻车;agentic coding 是『模型接工具、跑循环、人对照 DoD 评审』的架构
- **能力配置**:给 agent 配好代码检索、测试运行、多文件改动编排,它才能在真实大代码库里自己定位-修改-验证
- **新界面**:上下文窗口成了新的编程界面——你编排的是上下文/工具/记忆/验证,而非单条 prompt
今日趋势综述
今天的信号:模型见顶,杠杆在『会用』的人手里
把今天几条放一起看,会发现它们指向同一件事:光有强模型已经不够了,真正拉开差距的是怎么把它用出来。微软 SkillOpt 把『技能文档』当成可训练的状态来优化,一个冻结不动的模型靠一份被反复迭代的 skill,就能在 GPT-5.5 上平均涨 23.5 分——这说明『会写、会调技能』本身正在变成一种可积累、可复利的能力;一位地球物理学家被裁员后用 Claude Code 搭的 ai-job-search 三周冲到近两万星,则是最朴素的证明:普通人把 agent 编排成一条完整流水线,就能替自己干真正有价值的活。
另一头是『把 agent 管住、跑稳』的基础设施在补齐:Sim 让不写代码的人也能拖拽出 agent 工作流,LangChain 的 OpenWiki 专门给 agent 造一份它读得懂的代码文档,而 AgenticSTS 这篇论文直指长跑 agent 最要命的软肋——记忆一旦无界就会崩。能力的天花板不再是模型,而是可靠性和工程。
最后是『把 AI 变现』这一端越来越具体:中端模型(Sonnet 5 / GPT-5.6 Sol / Gemini 3.1 Pro)价格差到两三倍,会按场景选型的人直接省下真金白银;零售靠一个购物 agent 就能把转化拉到 3 倍;连『帮小店永不漏接电话』都能做成按月收费的白标生意。给个人的行动建议只有一句:别再追下一个榜首模型,去练那些模型进步抹不平的能力——编排技能、按价选型、把 AI 落进一门具体的生意。
langchain-ai/openwiki
展开详情
- **为 agent 写文档**:不是给人扫读的 README,而是为大模型结构化的 wiki,让编码 agent 更懂你的代码库
- **自动画图**:在能讲清楚概念处自动嵌 Mermaid——时序图(请求流)、ER 图(数据模型)、状态图(生命周期)、流程图(控制流)
- **保持不过期**:CLI 接进你的编码 agent,随仓库变化自动维护更新,多后端(OpenRouter/Fireworks/Baseten/OpenAI/Anthropic)开箱即用
AgenticSTS: A Bounded-Memory Testbed for Long-Horizon LLM Agents
展开详情
- **问题定位**:长跑 agent 把历史原样拼进上下文会导致 prompt 无界膨胀、表现退化——这是很多 agent『跑着跑着就变笨』的根因之一
- **替代契约**:每步决策从全新用户消息出发,用带类型的检索按需组装信息,不 append 原始跨决策对话流,让上下文始终有界
- **可复现测试床**:给『记忆该看什么、看多少』提供了统一的评测环境,把记忆管理从手感调参推向可度量对比
中端模型三选一:Sonnet 5 / GPT-5.6 Sol / Gemini 3.1 Pro,价格差到两三倍,怎么选才不亏
展开详情
- **对比(能力)**:SWE-bench Pro 上 GPT-5.6 Sol ≈64.6% vs Sonnet 5 ≈63.2%(旗舰参照:Fable 5 ≈80.3%、Opus 4.8 现役 ≈69.2%)——中端两家几乎打平
- **对比(价格/百万 token)**:Sonnet 5 ≈$2/$10(引入期至 8/31)vs Gemini 3.1 Pro ≈$2/$12(>200K 涨到 $4/$18)vs GPT-5.6 Sol ≈$5/$30——最贵的是 Sol
- **方法论提醒**:OpenAI 7/8 审计指出 SWE-bench Pro 约 30% 任务存在缺陷(测试过严/描述不全),Gemini 3.1 在不同评测集上从 46% 到 80% 波动大,分数要结合基准来源看
零售的『代理式电商』落地实测:一个购物 agent 把转化拉到 3 倍、AOV 高 38%——Tatcha 的数字与 BCG 的大盘
展开详情
- **一手数字(Tatcha)**:AI 辅助购物者转化 ≈站点平均 3 倍、AOV 高 ≈38%、全站营收 ≈11.4% 可归因于 AI 对话,82% 问题无需真人、CSAT 81%
- **大盘对比(BCG)**:部署第一方 AI agent 的零售商普遍 5%–15% 转化提升;AI 增强搜索最高 +20% 转化、发现引擎 +12% AOV
- **赢点不在模型**:效果来自把 agent 嵌进搜索—推荐—答疑—下单的完整转化链路,而非采购了最强旗舰
白标 AI 语音前台『转售』模式:帮小店永不漏接电话,做成按月收费的现金流生意
展开详情
- **客户的痛点值钱**:小企业年均因漏接电话损失约 $12.6 万;AI 前台年成本 $1,188–$5,988 vs 真人前台 $2.8 万–$3.5 万,客户 2–3 周回本
- **转售成本极低**:Retell ≈$0.07/分钟、Synthflow ≈$0.15–$0.24/分钟,Trillet 白标 Studio ≈$99/月含 3 个子账户——一次搭好、多客户复用
- **可复制**:按行业做模板(诊所/餐馆/家政/维修/律所各一套话术与预约流程),复制到同类商家即可,边际成本趋近于零