📅
Hall of Fame
Hall of Fame
Track
Type
Source
9月22日 周二 · 8 条
今日趋势综述
当模型能力普遍过剩,今天的信号集中指向同一件事——真正的瓶颈从『模型多强』转向『上下文喂得多准、成本压得多低、活儿交付得多稳』,会管上下文、会做选型、会把 AI 塞进真实业务的人,正在拿走大部分溢价。
今天的信号:赢家不是买了最强模型,而是把上下文和交付管明白的人

把今天这几条串起来看,会发现它们其实在讲同一个故事。一篇 arXiv 论文(Constant-Context Skill Learning)证明:把重复的 agent 流程从『每次塞进历史』变成『固化成技能 + 只看当前状态』,能在 ALFWorld、WebShop 这些基准上保持性能却大幅砍掉推理上下文;Anthropic 官方把『上下文工程』摆上台面,说它正取代提示工程成为生产级 agent 的核心技能;而 Morph 的成本拆解直接给出结论——编码 agent 账单的大头不是它写的代码,而是系统提示、仓库映射这些 context overhead。三条来自研究、厂商、成本三个方向,却都指向『上下文是新瓶颈』。

另一半信号讲的是『能力过剩之后拼什么』。开源可自托管的编码模型(Kimi K3、DeepSeek-V4.1-Flash、GLM-5.3)已经在 Terminal-Bench、SWE-bench 上摸到前沿,闭源模型只低几分——这意味着选型不再是『谁最强』,而是『同样的活儿,谁的每任务成本更低、能不能自己托管省钱』。零售业的落地数据也说明同样的道理:AI 导流的购物流量同比暴涨、转化更高,但麦肯锡说不到四分之一的部署第一年达标——差距全在实施,不在模型。

对个人的启示很直接:2026 年值钱的能力,不是『会调最强的 API』,而是三件事——会给模型精准喂上下文(context engineering)、会按『任务×成本』做选型而不是盲追榜首、会把这套能力交付进一个真实的行业场景里(哪怕只是帮本地水暖店接住漏掉的电话)。今天的 Agent-Reach 冲到 8 万多星、本地服务自动化能收月费,都是同一个市场信号:谁能把过剩的模型能力『用对、用省、用到人家愿意付钱的地方』,谁就赢。

今日新增 7
#02
arXiv Paper
NEW

From History to State: Constant-Context Skill Learning for LLM Agents

这篇论文提出『常量上下文技能学习』(Constant-Context Skill Learning):对那些反复出现的 agent 工作流,把可复用的操作步骤学习进轻量的『任务族模块』里,推理时 agent 只需要看到当前观测 + 一小块紧凑的状态信息,而不用像 ReAct 那样把越来越长的历史轨迹一遍遍喂进上下文。在 ALFWorld、WebShop、SciWorld 三个基准上,这样训练出来的 agent 任务表现与主流方法持平,但推理时消耗的上下文大幅下降。它的价值在于把『技能』从『写在提示词里的一段话』变成『沉淀进模块、按需调用的状态机』,直接对准了 agent 长期运行时的成本和稳定性痛点。
为『agent 越用上下文越长、越长越贵越笨』这个老问题给出一条工程可落地的解法:把重复流程固化成技能模块,推理时只看当前状态,而不是把整段历史反复塞进上下文。
#Skills#元技能
展开详情
  • **核心机制**:可复用流程学进任务族模块,推理只条件于『当前观测 + 紧凑状态块』,不再反复塞历史轨迹
  • **对比**:在 ALFWorld/WebShop/SciWorld 上任务表现与 ReAct 式提示持平,但推理上下文显著更少
  • **意义**:把『技能』从提示词里的文字升级为可沉淀、可调用的状态结构,直击 agent 长跑的成本与稳定性
推荐理由:对做 agent 的普通开发者,这篇论文给的是一个可以现在就照做的思路:不要把所有逻辑都堆在越来越长的提示词里,而是把『重复干的那几套流程』抽成独立的、只依赖当前状态的技能。这样做的直接回报是——上下文更短意味着更便宜、更快、更不容易在长任务里跑偏。哪怕你不复现论文,光是把这个『状态化技能』的思维用到自己的 agent 里,就能立竿见影地降本增稳,这正是 2026 年最值钱的那类『元技能』。
#03
kore.ai Article
NEW

零售业 AI agent 落地实测:AI 导流的购物流量同比暴涨 393%、转化高 42%,但麦肯锡说不到四分之一部署第一年达标

今天轮到零售这个垂直领域。多份行业数据拼出一幅清晰图景:2026 年第一季度,AI 导流到美国零售网站的购物流量同比暴涨 393%,而且这批流量的转化率比普通流量高 42%——AI 推荐正在成为真实的进店入口。BCG 的研究显示,部署了自有 AI agent 的零售商,购物体验带来 5–15% 的转化提升;分场景看,推荐驱动的转化最高能涨 288%,动态定价能带来 20% 营收、22% 利润的提升。一个全球电商平台用 AI agent 做到 75% 的语音自助解决率、每周自动处理超 90 万次自助会话。但清醒的一面是:麦肯锡 2025 年报告发现,零售业不到四分之一的 AI 部署在第一年达到了目标 ROI——差距不在模型,在实施。
#行业应用
另有 2 家信源报道
展开详情
  • **流量转折**:2026 Q1 AI 导流的零售流量同比 +393%,且转化率比普通流量高 42%,AI 推荐成真实进店入口
  • **效果区间**:BCG 测得自有 AI agent 带来 5–15% 转化提升;推荐场景最高 +288% 转化,动态定价 +20% 营收/+22% 利润
  • **冷水**:麦肯锡称不到 1/4 的零售 AI 部署首年达标 ROI——瓶颈是实施与运营,不是模型能力
推荐理由:对想吃 AI 红利的普通人,零售给了一个明确的『机会与陷阱并存』信号:机会是 AI 导流和推荐已经被证明能真金白银提转化,需求真实存在;陷阱是四分之三的部署第一年不达标,说明市场极度缺『能把 AI 真正落地跑出 ROI 的人』而不是『会接 API 的人』。所以别急着追最新模型,去补『怎么把 AI agent 嵌进一家零售商的真实流程、并对结果负责』这块能力——谁能把达标率从 25% 提上去,谁就是稀缺项。
#04
morphllm.com Article
NEW

开源可自托管的编码模型摸到前沿:DeepSeek-V4.1-Flash 90.6 vs Kimi K3 88.3(Terminal-Bench 2.1),选型该看『每任务成本 + 能否自托管』

开源权重的编码模型今年集体逼近前沿,而且关键是——它们可以自己托管。截至 9 月的横评显示:9 月 10 日发布的 DeepSeek-V4.1-Flash(MIT 协议、552B 总参 / 8–16B 激活)在 Terminal-Bench 2.1 上拿到 90.6,Kimi K3(2.8T 总参 / 104B 激活、1M 上下文)为 88.3、FrontierSWE 81.2;DeepSeek V4 在可下载权重里领跑原始 SWE-bench Verified 达 80.6%,还有近乎免费的 Flash 变体($0.14/$0.28);GLM-5.3 升级了 753B 的 GLM-5.2 底座,GLM-5.3-Flash 是最强的纯 MIT 发布。对照闭源顶配只低几分,但价格和可自托管性差出一个数量级。
#评测
另有 1 家信源报道
展开详情
  • **对比**:DeepSeek-V4.1-Flash 90.6 vs Kimi K3 88.3(Terminal-Bench 2.1);DeepSeek V4 SWE-bench Verified 80.6% 领跑可下载权重
  • **成本**:DeepSeek Flash 变体 $0.14/$0.28、MIT 可自托管,对照闭源顶配只低几分却便宜一个数量级
  • **该选哪个**:要极致省钱/数据不出内网选 DeepSeek-V4.1-Flash 或 GLM-5.3-Flash;要长上下文和综合能力上 Kimi K3;追最后几分再考虑闭源
推荐理由:对个人开发者和小团队,这条的机会是『把编码 AI 的账单打下来』。以前默认闭源顶配,现在开源可自托管的模型只低几分、成本却低一个数量级——你完全可以在自己的机器/云上跑 DeepSeek-V4.1-Flash 或 GLM-5.3-Flash 处理大部分编码任务,把闭源额度只留给最难的几分之差。会做『任务分层选型』(简单活用开源省钱、硬骨头才上闭源)的人,能用同样预算干几倍的活,这本身就是一种可变现的工程能力。
商机信号(加速):谁付钱:对数据合规敏感、又想控住 AI 编码/推理成本的中小软件团队、外包工作室、做私有化部署的服务商 痛点:闭源 API 长期用下来贵、且代码/数据要出内网,合规和成本两头受制 切入点:帮这类团队做『开源编码模型私有化部署 + 任务分层路由』的落地:按项目收建置费 + 按月维护费,卖点是数据不出内网、账单直降一个数量级
#05
ciela.ai Product 直接可用
NEW

本地服务业(水暖/家政/med spa)漏接来电自动化:50 万家美国家政商每年因漏接损失 $5–20 万,med spa 90% 代运营做到 $3K+/月留存

继牙科、语音前台之后,AI 自动化代运营正在向更多本地服务垂类扩散,而且付费信号清晰。数据显示:全美超 50 万家家政类企业(水暖 HVAC、管道等)光是漏接电话每年就损失 $5 万–20 万;med spa 这个垂类坐在赚钱榜前列,90% 的代运营能拿到 $3,000+/月的留存费,行业规模超 180 亿美元、单店年营收 100 万–300 万美元;保险代理接入 AI 自动化后续保和交叉销售营收涨 25–40%。主流打法是『先在一个垂类做到 $3 万–5 万 MRR 再横向复制』,用『先免费给一家做出真实案例』撬动同行。
#小微现金流#典型『建置费 $2,500–…
另有 2 家信源报道
展开详情
  • **痛点有价**:50 万家美国家政商每年漏接损失 $5–20 万,这是实打实、可量化、老板已经在流血的现金缺口
  • **留存模型**:med spa 90% 代运营做到 $3K+/月留存;典型『建置费 $2.5K–15K + 月费 $2K–8K』的混合收费已跑通
  • **复制路径**:先在一个垂类做到 $3–5 万 MRR 再横扩,靠『免费给一家做出案例』撬动整条同行
推荐理由:对想挣现金流的普通人,这是目前门槛最低、路径最清晰的一类活:不需要你发明技术,只要把现成的 AI 接听/预约/跟单工具,配好话术和日历,塞进一个本地服务老板已经在为之流血的环节(漏接的电话、没跟上的续保)。关键动作是『选一个垂类 + 免费给一家做出可量化的案例(比如帮某水暖店一个月多接住 X 通电话)』,用这个案例去收同行的月费。宁可深耕一个垂类做到 $3–5 万 MRR,也别一上来做全行业。
My Take:评分(5=最优):最快成交 4 / 最低成本 4 / 可复制 5 / 风险安全度 4。选一个本地服务垂类,把漏接来电这个已在流血的环节自动化,先做出一个可量化案例再横向复制同行。
商机信号(加速):谁付钱:常漏接来电/漏跟单的本地服务小商家:水暖 HVAC、家政、med spa 医美、保险代理、房产中介 痛点:漏接电话和没跟上的续保就是直接流走的钱,单店一年可损失几万到几十万美元,又雇不起稳定前台 切入点:选一个垂类,用现成 AI 接听/预约/跟单工具配好话术+日历+CRM,先免费给一家做出『多接住 X 通电话』的量化案例,再按月费复制到同行
#06
morphllm.com Article
NEW

编码 agent 的账单大头是 context overhead,不是它写的代码:按『每任务成本』而非 token 单价选型

Morph 的成本拆解给出一个反直觉但很实用的结论:编码 agent 账单的大头,不是它最终写出来的那几行代码,而是系统提示、仓库映射这些『上下文开销』(context overhead)。数据上,单个编码任务成本从 $0.03(Gemini)到 $0.13(GPT-5 高推理)不等;Claude Code 企业部署平均每人每活跃日 $13、约 $150–250/月,90% 用户日均低于 $30。核心提醒是:一个 token 单价更便宜的模型,如果代码更弱、需要更多提示、制造出没人计划的 review 队列,最终每个『完成的任务』反而更贵。所以真正该比的是『每个完成任务的总成本』,不是 token 单价。
#DevTools
另有 1 家信源报道
展开详情
  • **账单真相**:大头是系统提示 + 仓库映射等 context overhead,不是模型生成的代码本身
  • **数字**:单任务 $0.03(Gemini)–$0.13(GPT-5 高推理);Claude Code 企业均 $13/人/活跃日、90% 用户 <$30/日
  • **选型法**:便宜 token ≠ 便宜任务——弱模型靠更多提示和 review 队列把每任务成本反推高,该比『每完成任务成本』
推荐理由:对每天用编码 agent 的人,这条能直接帮你省钱:与其纠结哪个模型 token 单价低,不如做两件事——一是压 context overhead(精简系统提示、别把整个仓库无脑塞进上下文、用检索只喂相关文件),二是按任务难度分层选模型(简单活用便宜模型、硬骨头才上贵的)。会算『每个完成任务的真实成本』并据此调度模型的人,能在同样产出下把 AI 开支砍掉一大截——这在团队里就是可量化的价值。
#07
anthropic.com Article
NEW

上下文工程正取代提示工程,成为生产级 agent 的核心技能(Anthropic 官方)

Anthropic 把『上下文工程』(context engineering)正式摆上台面,称它是提示工程之后的自然下一步,也是生产级 agent 的核心技能。所谓上下文工程,就是刻意设计模型在每一次推理时到底看到什么——系统提示、用户输入、检索到的文档、相关的对话历史、工具定义,以及 agent 在会话之间存进长期记忆的东西。之所以关键,是因为 2025–2026 的研究反复显示:每个前沿模型都会随着上下文变长而『可测量地变笨』,而且远在上下文窗口填满之前就开始退化。配套的 Agent Skills 开放标准正是这套思路的落地——只在需要时加载相关上下文,让 token 开销保持精简。
#Skills#元技能
展开详情
  • **范式转移**:上下文工程接棒提示工程,成为生产级 agent 的核心技能——重点是设计『每次推理模型看到什么』
  • **为什么**:研究显示模型随上下文变长会可测量地变笨,且远在窗口填满前就开始退化,所以少即是多
  • **落地**:Agent Skills 开放标准按需加载相关上下文,把 token 开销压到最低——与今天的技能学习论文同一逻辑
推荐理由:这条和今天的论文、成本拆解是同一枚硬币的三面,指向一个非常明确的个人成长方向:2026 年最该练的不是『写更花哨的提示词』,而是『上下文工程』——学会精准控制模型每次看到什么、把可复用的东西沉淀成技能按需加载、把无关历史挡在外面。这是一项通用、可迁移、且直接决定 agent 好不好用又贵不贵的元技能。照着 Anthropic 这篇官方指南把它系统学一遍,比追逐下一个新模型的性价比高得多。
#08
fungies.io Article
NEW

不会写代码也能搭 agent:可视化低代码搭建器占据 GitHub 前列(Langflow 146k / Dify 136k / Flowise 51k)

在 GitHub 最受欢迎的 AI agent 框架里,前五名有三个是可视化低代码搭建器:Langflow(约 14.6 万星)、Dify(约 13.6 万星)、Flowise(约 5.1 万星)。它们的共同点是让人用拖拽的方式,不写大量代码就能原型和部署 AI agent。这背后是一个很实在的趋势——2026 年 agent 已经走进主流,大量需求来自『想用 agent 但不想或不会写工程代码』的业务人员和创业者。GitHub 上 AI 相关仓库已超 430 万个、LLM 相关项目同比增长 178%,低代码搭建器正是承接这波非工程人群需求的入口。
#AI App
另有 1 家信源报道
展开详情
  • **格局**:GitHub 前五 agent 框架里三个是可视化低代码搭建器——Langflow 14.6 万 / Dify 13.6 万 / Flowise 5.1 万星
  • **为什么火**:拖拽即可原型和部署 agent,承接『想用 agent 但不写工程代码』的业务人和创业者
  • **大盘**:GitHub AI 相关仓库超 430 万、LLM 项目同比 +178%,低代码是非工程人群的主要入口
推荐理由:对不是程序员、但想在 AI 时代做点东西的人,这是一条极低门槛的入场路:用 Langflow 或 Dify 这类拖拽式工具,你不用啃代码就能把一个真实工作流(客服问答、内容分拣、销售跟进)搭成可跑的 agent。真正的机会不在『会不会用工具』,而在『你比工具厂商更懂哪个行业的哪个流程该被自动化』——把你的行业 know-how 用低代码搭成能交付给客户的 agent,这条路对非技术背景的人尤其友好。
仍在热榜 1
Repo Panniantong/Agent-Reach 在榜 6d 给 AI agent 装一双『能看整个互联网的眼睛』:用一个 CLI 让 agent 读取和搜索 Twitter、Red… AI Agent