Hall of Fame
Hall of Fame
Track
Type
Source
9月6日
今日趋势综述
本周信号收敛到同一句话:模型这层已经卷不出差距,真正的价值全挪到了『把模型组织好、送进业务、还能验收』的那一层——从 agent 运行时、skills 工程,到评测选型和企业落地。
今天的信号:值钱的不再是模型,是模型和业务之间那层『管道工』
把今天几条串起来看,一个主线特别清楚:模型本身正在快速商品化。评测榜上 Fable 5.1、Opus 5、GPT-5.6、Grok 4.6 挤在 61–66 分的一格里,彼此差几个百分点;开源和闭源、这家和那家,普通场景里已经很难拉开体感差距。于是钱和注意力都在往『上层』和『下层』跑——上层是 NousResearch/hermes-agent 这种 agent 运行时(靠日均 token 用量冲到 OpenRouter 第一,而不是靠跑分),下层是 skills 工程(把一个技能的上下文成本从 20 万 token 压到 2.5 万)和企业落地(Gartner 说 89% 的 agent 试点根本进不了生产,但活下来的那 11% 能做到 171% 的 ROI)。
今日新增 7
#02
startupcorners.com
Repo
NEW
Gitlawb/openclaude
在 hermes、deepseek-harness 这类重型运行时之外,openclaude 走的是相反路线:足够轻、足够中立,你可以把它接到任何模型(本地或云端)上,塞进任何环境。这类『轻量 + 模型无关』的编码 agent 之所以持续有人涨星,是因为大量开发者不想被单一厂商锁死,想要一个能自己换模型、自己控成本的口子。
另有 1 家信源报道
展开详情
一个轻量编码 agent,主打『到哪都能跑、接任何模型』——不绑定某家闭源模型,也不依赖重型 IDE,追求最小依赖、随处可用的编码助手。
周增长:约 +451 星/日(9/4 快照),本周稳定在 GitHub 趋势榜的编码 agent 分区
- **模型无关**:可接任意模型(含本地/开源),不被单一闭源厂商锁定
- **随处可运行**:最小依赖、不依赖重型 IDE,命令行即可用
- **轻量路线**:与重型 agent 运行时形成互补,主打可控与低负担
推荐理由:给普通开发者的机会:与其为某个闭源编码工具付月费、还被锁死,不如学会用这类『模型无关』的轻量 agent,把后端模型换成便宜的开源模型,自己掌控成本和数据。会『组装自己的编码 agent 工具链』本身正在成为一项加分技能。
#03
artificialanalysis.ai
Article
NEW
AI 智能榜挤成一格:Fable 5.1 拿 66 分登顶,Opus 5 / GPT-5.6 / Grok 4.6 全咬在 61–63,模型这层已经卷不动了
Artificial Analysis 最新一版智能指数(v4.1.1,max effort)里,头部模型的分差小到几乎可以忽略:这条『前沿一格』越来越挤,说明在通用智能这个维度上,谁比谁强几分已经不太影响日常体感——真正决定你选谁的,是价格、速度和它在你具体任务上的表现,而不是榜单名次。
另有 2 家信源报道
展开详情
- **对比**:Fable 5.1 66 vs Claude Opus 5 63 vs Fable 5 62 vs GPT-5.6 Sol 61 vs Grok 4.6 61(Artificial Analysis 智能指数 v4.1.1,max effort)
- **差距收敛**:头部 5 个模型挤在 61–66 的 5 分区间内,通用智能维度已高度同质化
- **选型逻辑变了**:名次趋同后,价格/延迟/在你任务上的实测才是分水岭,而不是榜单排名
推荐理由:对开发者:别再为『榜首』多付钱。日常写代码、做总结、跑 agent,这几个头部模型体感差不多,选便宜快的那个(很多场景开源/中等价位模型就够);只有在最难的推理/长任务上,才值得为最强的那一两分买单。学会『按任务分级选模型』,一年能省下可观的 API 账单。
#04
endearhq.com
Article
NEW
零售 AI 落地实测:个性化推荐把转化拉高 15–25%、动态定价加 20% 营收,沃尔玛靠 AI 把缺货砍 30%、物流成本降 15%
零售是今年 AI 落地数据最扎实的行业之一:不是『会不会用』,而是『用了赚多少』。综合多份 2026 案例,个性化推荐普遍带来 15–25%(个别高到 288%)的转化提升,动态定价加约 20% 营收、22% 利润,AI 分群让营销 ROI 提升 20–25%;沃尔玛把缺货率降 30%、物流成本降 15%。整体上,用 AI 的零售商报告 5–15% 年营收增长、10–30% 成本节省,综合 ROI 落在 200–400%。
另有 1 家信源报道
展开详情
- **转化**:个性化推荐把转化率拉高 15–25%,头部案例高达 288%
- **营收/利润**:动态定价约 +20% 营收、+22% 利润;AI 分群营销 ROI +20–25%
- **沃尔玛实测**:缺货率 -30%、物流成本 -15%,库存持有成本最高降 40%
推荐理由:机会不在『再造一个推荐大模型』,而在把这些成熟能力送进那些还没用上的中小零售商——89% 大零售商在用,但海量夫妻店、垂类品牌还是一片空白。会把开源推荐/动态定价方案打包成『按门店交付、拿转化数字说话』的服务,就是一门现成的现金流生意。
商机信号(加速):谁付钱:中小零售商、垂类电商品牌、连锁门店运营方——他们已经看到大厂靠 AI 提转化,但没有内部团队能落地 痛点:转化率上不去、库存和定价靠拍脑袋,市面方案要么太贵(面向大企业)要么太玄(纯 SaaS 自己不会配) 切入点:选一个细分品类(如美妆/家居/生鲜),用开源推荐+动态定价模型做成『按店交付、按转化提升分成』的代运营,先跑通 3–5 家出数字再复制
#05
agentpatterns.ai
Article
NEW
把 agent skill 写好=一门省钱工程:SKILL.md 压到 5000 token 内、渐进披露把单技能上下文从 20 万 token 砍到 2.5 万
当 skill 从『新鲜玩具』变成日常干活的基本单元,怎么写就成了实打实的工程问题。核心方法叫『渐进披露』:agent 分三层加载——启动时只读名字+描述(每个约 100 token),激活时才读 SKILL.md 正文(建议压到 5000 token 内),细节全部塞进按需加载的引用文件。效果很具体:Claude Code 自带的 claude-api skill 靠这招把上下文成本从 20 万 token 压到约 2.5 万;整体可省约 63% token。
另有 2 家信源报道
展开详情
- **三层加载**:名字+描述(~100 token) → SKILL.md 正文(<5000 token) → 引用文件按需读,别一次性全塞
- **真实收益**:claude-api skill 上下文成本从 200k→25k token;渐进披露整体省约 63%
- **六条铁律**:渐进披露、描述可被发现、单一职责、版本化、拿真实任务测、校验数据是否新鲜且属你
推荐理由:这是当下最容易上手、又最被低估的一项 AI 工程技能:写一个 token 省、职责清、能被审查的 skill,门槛不高但极其吃香。普通开发者完全可以从把自己重复的工作流(比如周报、代码审查、取数)写成一个规范 skill 开始,既省自己的 token,也能作为作品放进简历——『会写高质量 skill』正在成为一个可标价的能力。
#06
arXiv
Paper
NEW
Multi-Layered Memory Architectures for LLM Agents: An Experimental Evaluation of Long-Term Context Retention
这篇实验性论文把对话/交互历史拆成三层来管理:工作记忆(当下正在用的)、情节记忆(发生过的具体事件)、语义记忆(提炼出的稳定知识),并系统评测这种分层结构在长周期上下文保持上的表现,结论是相比把历史一股脑塞进上下文,分层管理在多个基准上都更稳、更省。它和本周另一篇《Memory for Autonomous LLM Agents》一起,标志着『agent 记忆』正从零散技巧走向有章法的架构学科。
把 agent 记忆从『一锅塞进上下文』升级成分层架构,是让 agent 能跨多轮、长周期稳定干活的关键一步——直接关系到 agent 能不能记住你上周说过的事。
展开详情
- **三层记忆**:工作/情节/语义分层,各管一段,别把所有历史塞进一个上下文窗口
- **长周期更稳**:在长期上下文保持的多个基准上优于『全量塞入』的朴素做法
- **学科化信号**:与同期综述一起,把 agent 记忆从技巧变成可复用的架构范式
推荐理由:对做 agent 应用的个人开发者:别再纠结『上下文窗口不够大』,真正的杠杆是学会分层管理记忆——什么该常驻、什么该按需检索、什么该提炼成长期知识。掌握这套记忆架构,是让你的 agent 从『聊两句就失忆』进化到『能长期陪你干活』的分水岭,也是当前很多产品的真实护城河。
#07
grove.publishstudio.one
Product
NEW
Grove
Grove 是一个『你和你的 AI agent 共用同一个终端』的工具:内置 MCP server 和 CLI,你和编码 agent 控制的是同一组终端进程,而不是各开一个窗口互相看不见。它切中了当下人机协作的一个真实痛点——agent 在它自己的沙箱里跑、你在你的终端里跑,两边状态经常对不上;Grove 让两者站在同一个终端里并肩干活。
另有 1 家信源报道
展开详情
- **共用终端**:人和 agent 控制同一组进程,不再各跑各的、状态割裂
- **MCP 原生**:内置 MCP server + CLI,agent 能直接操作真实终端环境
- **协作范式**:从『把任务丢给 agent』转向『和 agent 同屏并肩』,便于随时接管纠偏
推荐理由:值得关注的信号:agent 工具的下一站是『人机同屏协作』,而不是全自动黑箱。对个人开发者,早点习惯这种『我和 agent 共用工作台、随时接管』的工作方式,比幻想全自动更实际;这类协作型工具也给了独立开发者一个新赛道——做垂直场景的『人机协作工作台』。
#08
joget.com
Article
NEW
Gartner 泼冷水:89% 的 AI agent 试点根本进不了生产,但活下来的 11% 做到了 171% ROI——落地能力才是真稀缺
热闹背后是一盆冷水:Gartner 口径下 89% 的 agent 试点无法走到生产,Gartner 还预测到 2027 年底超过 40% 的 agentic AI 项目会被取消。但硬币的另一面很诱人——真正跑到生产的那 11% 平均做到了 171% 的 ROI。卡点不在模型能力,而在『能不能验收、能不能治理、够不够可靠』:64% 的负责人卡在评测缺口、57% 卡在治理摩擦、51% 卡在模型可靠性。目前也只有约 31% 的企业有至少一个 agent 真的在生产里。
另有 2 家信源报道
展开详情
- **对比**:89% 试点进不了生产 vs 活下来的 11% 平均 171% ROI——差距全在『落地』这道坎
- **真正的卡点**:评测缺口 64% / 治理摩擦 57% / 模型可靠性 51%,都不是『模型不够强』
- **现状**:约 31% 企业有 ≥1 个 agent 在生产;银行保险领先(47%)、医疗政府垫底(18%/14%)
推荐理由:这组数字其实是给个人的路标:市场最缺的不是又一个 demo,而是能把 agent 从 demo 推过评测、治理、可靠性这三道坎、并拿出验收数据的人。与其追模型发布会,不如专攻『agent 评测 harness』『agent 治理与权限』这类没人愿意干的脏活——它正是那 89% 失败项目最缺、也最愿意付钱的能力。
商机信号(加速):谁付钱:已经砸钱做了 agent 试点、却卡在进不了生产的中大型企业(尤其银行、保险、零售) 痛点:demo 很惊艳,但没法证明它靠谱、没法治理和审计、没法向老板交出可验收的数字,于是项目被砍 切入点:做『agent 落地验收』的小切口服务:给客户搭一套评测 harness + 治理/权限清单 + 上线 runbook,按『帮你把试点推进生产』收费,而不是再卖一个模型
仍在热榜 1
Repo
NousResearch/hermes-agent
在榜 6d
NousResearch 推出的通用 agent 框架,主打『随用户工作流一起成长』——不是一个固定 agent,而是一…
AI Agent