Hall of Fame
今日趋势综述
今天的信号:赢家不是买了最强模型,而是把上下文和交付管明白的人
把今天这几条串起来看,会发现它们其实在讲同一个故事。一篇 arXiv 论文(Constant-Context Skill Learning)证明:把重复的 agent 流程从『每次塞进历史』变成『固化成技能 + 只看当前状态』,能在 ALFWorld、WebShop 这些基准上保持性能却大幅砍掉推理上下文;Anthropic 官方把『上下文工程』摆上台面,说它正取代提示工程成为生产级 agent 的核心技能;而 Morph 的成本拆解直接给出结论——编码 agent 账单的大头不是它写的代码,而是系统提示、仓库映射这些 context overhead。三条来自研究、厂商、成本三个方向,却都指向『上下文是新瓶颈』。
另一半信号讲的是『能力过剩之后拼什么』。开源可自托管的编码模型(Kimi K3、DeepSeek-V4.1-Flash、GLM-5.3)已经在 Terminal-Bench、SWE-bench 上摸到前沿,闭源模型只低几分——这意味着选型不再是『谁最强』,而是『同样的活儿,谁的每任务成本更低、能不能自己托管省钱』。零售业的落地数据也说明同样的道理:AI 导流的购物流量同比暴涨、转化更高,但麦肯锡说不到四分之一的部署第一年达标——差距全在实施,不在模型。
对个人的启示很直接:2026 年值钱的能力,不是『会调最强的 API』,而是三件事——会给模型精准喂上下文(context engineering)、会按『任务×成本』做选型而不是盲追榜首、会把这套能力交付进一个真实的行业场景里(哪怕只是帮本地水暖店接住漏掉的电话)。今天的 Agent-Reach 冲到 8 万多星、本地服务自动化能收月费,都是同一个市场信号:谁能把过剩的模型能力『用对、用省、用到人家愿意付钱的地方』,谁就赢。
From History to State: Constant-Context Skill Learning for LLM Agents
展开详情
- **核心机制**:可复用流程学进任务族模块,推理只条件于『当前观测 + 紧凑状态块』,不再反复塞历史轨迹
- **对比**:在 ALFWorld/WebShop/SciWorld 上任务表现与 ReAct 式提示持平,但推理上下文显著更少
- **意义**:把『技能』从提示词里的文字升级为可沉淀、可调用的状态结构,直击 agent 长跑的成本与稳定性
零售业 AI agent 落地实测:AI 导流的购物流量同比暴涨 393%、转化高 42%,但麦肯锡说不到四分之一部署第一年达标
展开详情
- **流量转折**:2026 Q1 AI 导流的零售流量同比 +393%,且转化率比普通流量高 42%,AI 推荐成真实进店入口
- **效果区间**:BCG 测得自有 AI agent 带来 5–15% 转化提升;推荐场景最高 +288% 转化,动态定价 +20% 营收/+22% 利润
- **冷水**:麦肯锡称不到 1/4 的零售 AI 部署首年达标 ROI——瓶颈是实施与运营,不是模型能力
开源可自托管的编码模型摸到前沿:DeepSeek-V4.1-Flash 90.6 vs Kimi K3 88.3(Terminal-Bench 2.1),选型该看『每任务成本 + 能否自托管』
展开详情
- **对比**:DeepSeek-V4.1-Flash 90.6 vs Kimi K3 88.3(Terminal-Bench 2.1);DeepSeek V4 SWE-bench Verified 80.6% 领跑可下载权重
- **成本**:DeepSeek Flash 变体 $0.14/$0.28、MIT 可自托管,对照闭源顶配只低几分却便宜一个数量级
- **该选哪个**:要极致省钱/数据不出内网选 DeepSeek-V4.1-Flash 或 GLM-5.3-Flash;要长上下文和综合能力上 Kimi K3;追最后几分再考虑闭源
本地服务业(水暖/家政/med spa)漏接来电自动化:50 万家美国家政商每年因漏接损失 $5–20 万,med spa 90% 代运营做到 $3K+/月留存
展开详情
- **痛点有价**:50 万家美国家政商每年漏接损失 $5–20 万,这是实打实、可量化、老板已经在流血的现金缺口
- **留存模型**:med spa 90% 代运营做到 $3K+/月留存;典型『建置费 $2.5K–15K + 月费 $2K–8K』的混合收费已跑通
- **复制路径**:先在一个垂类做到 $3–5 万 MRR 再横扩,靠『免费给一家做出案例』撬动整条同行
编码 agent 的账单大头是 context overhead,不是它写的代码:按『每任务成本』而非 token 单价选型
展开详情
- **账单真相**:大头是系统提示 + 仓库映射等 context overhead,不是模型生成的代码本身
- **数字**:单任务 $0.03(Gemini)–$0.13(GPT-5 高推理);Claude Code 企业均 $13/人/活跃日、90% 用户 <$30/日
- **选型法**:便宜 token ≠ 便宜任务——弱模型靠更多提示和 review 队列把每任务成本反推高,该比『每完成任务成本』
上下文工程正取代提示工程,成为生产级 agent 的核心技能(Anthropic 官方)
展开详情
- **范式转移**:上下文工程接棒提示工程,成为生产级 agent 的核心技能——重点是设计『每次推理模型看到什么』
- **为什么**:研究显示模型随上下文变长会可测量地变笨,且远在窗口填满前就开始退化,所以少即是多
- **落地**:Agent Skills 开放标准按需加载相关上下文,把 token 开销压到最低——与今天的技能学习论文同一逻辑
不会写代码也能搭 agent:可视化低代码搭建器占据 GitHub 前列(Langflow 146k / Dify 136k / Flowise 51k)
展开详情
- **格局**:GitHub 前五 agent 框架里三个是可视化低代码搭建器——Langflow 14.6 万 / Dify 13.6 万 / Flowise 5.1 万星
- **为什么火**:拖拽即可原型和部署 agent,承接『想用 agent 但不写工程代码』的业务人和创业者
- **大盘**:GitHub AI 相关仓库超 430 万、LLM 项目同比 +178%,低代码是非工程人群的主要入口