Hall of Fame
今日趋势综述
今天的信号:护城河从『用哪个模型』挪到『怎么喂上下文』
把今天几条串起来看,一条主线很清楚:2026 下半年,agent 的差距不再主要来自模型本身,而来自你怎么给它「记忆」和「可复用的技能」。字节火山引擎开源的 OpenViking 一周冲到 3 万多星,做的就是把 agent 的记忆、知识 RAG 和 skills 统一成一个可以用 ls/tree/find 浏览的上下文数据库;OSSInsight 统计出一季度就有 5 个「agent 记忆」仓库合揽 8 万多星、MemPalace 一天涨 7000 星——大家在同一个痛点上下注:agent 一关会话就失忆。与此同时,TauricResearch 的 TradingAgents 冲到 10 万星,靠的也不是某个更强的模型,而是把「分析师—研究员—交易员—风控」拆成多个 agent 协作的结构。
另一条线是开源权重继续贴脸追前沿:阿里 Qwen3.8 Max 以 60.9 挤进 Artificial Analysis 智能指数第一梯队,逼平 Grok 4.6、离 Claude Opus 5 只差 2 分。这意味着「模型选型」这件事的答案越来越取决于场景而非绝对强弱——要自托管和数据不出门就选开源大模,要最强 agentic 就上 Opus 5,要高频编码的性价比就用 Grok。模型层在快速商品化,真正稀缺的是上层工程。
对个人的启示很直接:别再把时间只花在追新模型的跑分上。今天更值钱的能力是三样——会给 agent 搭记忆/上下文(OpenViking 这类工具正把它变成可落地的工程)、会把重复工作沉淀成可复用的 skill(SoK 那篇论文已经把技能层的全生命周期梳理清楚了)、以及把这套能力嵌进一个具体行业或人群的真实工作流去收钱(医疗文书、Upwork 接单都有人已经跑通)。会喂上下文、会攒技能、会落地的人,正在从『用模型的人』变成『造 agent 的人』。
TauricResearch/TradingAgents
展开详情
TradingAgents 是一个「多智能体交易框架」,用一群各司其职的 LLM agent 去模拟一家真实交易公司的运作:分析师团队分别看基本面、情绪、新闻和技术面,研究员团队分多头/空头两方辩论,交易员 agent 拍板下单,再由风控和组合经理评估风险、批准交易。它把「投资决策」这件高度依赖团队协作与流程的事,拆成可编排的 agent 角色链,让每个环节都有专门的 agent 负责,而不是让单个模型一口气给出结论。
周增长:从 2026 年 3 月约 9.3k 一路涨到 8 月约 101.6k,近期高速上升,已超过 ai-hedge-fund 成为最多星的 AI 交易类仓库
- **角色分工**:把交易拆成分析师/研究员/交易员/风控/组合经理多个 agent,每个只管一段,逼近真实交易公司的流水线
- **多空辩论**:研究员团队分多头与空头两方对同一标的互相挑刺,用『对抗式讨论』压低单模型的一厢情愿
- **可复用模板**:Apache-2.0 开源、Python 实现,框架本身就是一套『多智能体如何协作』的教学样板,可迁移到交易之外的场景
医疗 AI 落地实测:斯坦福 96% 医生满意临床文书 AI、每天省 2 小时,行政类 AI 12 个月 ROI 达 200–400%,但临床类要 2 年才回本
展开详情
- **行政 vs 临床**:行政类 AI(排班/计费/预授权)4–8 个月回本、12 个月 ROI 200–400%;临床类(影像/预警)要 12–24 个月、ROI 80–200%——先啃行政苦活最划算
- **文书是甜点**:斯坦福 96% 医生满意 AI 病历工具、每天省 2 小时;300 床医院临床文书 AI 一年创造 300 万–500 万美元价值
- **渗透率**:约 80% 医院已在至少一个功能用 AI,63% 从业者在实际使用、31% 在试点,平均每 1 美元投入回收约 3.2 美元
阿里 Qwen3.8 Max 独立横评:以 60.9 挤进 AA 智能指数第一梯队,逼平 Grok 4.6、离 Claude Opus 5 仅差 2 分
展开详情
- **对比**:Qwen3.8 Max 60.9 vs Grok 4.6 60.9 vs Claude Fable 5 62.1 vs Claude Opus 5 63.0(Artificial Analysis 智能指数,共 181 个模型同尺横评)
- **发布节奏**:8 月 20 天内 5+ 厂商发 11 个模型,独立评测的验证速度已经追不上模型发布速度,跑分普遍滞后
- **格局**:Opus 5 领跑 agentic 与编码、Gemini 3.1 Pro 强在推理、Grok 4.6 主打性价比,头部差距收窄到个位数
从卖掉代理公司到 60 天做到 $10K MRR:一个 Upwork AI agent 如何靠『挠自己的痒』挣现金流
展开详情
- **窄到极致**:不做『通用 AI 助手』,只做『Upwork 规模化接单』这一个工作流——挠自己当年的痒,需求真、付费意愿强
- **速度**:上线 60 天 $10K MRR,现约 $20K MRR、团队仅 2 人,验证了『极窄切口 + 自身痛点』的老配方在 2026 依然有效
- **对照**:同期 Indie Hackers 上多个 AI 产品(AI 营销工具 $30K MRR 等)走的都是同一条路——瞄准一个被忽视的细分工作流、月费 $20–99、把一个问题解决到极致
SoK: Agentic Skills — Beyond Tool Use in LLM Agents(系统梳理『技能层』:从发现、练习、蒸馏到存储、组合、评估的全生命周期)
展开详情
- **技能≠工具**:技能是打包了适用条件/执行策略/终止判据/复用接口的可调用模块,能跨任务复用,而非一次性计划或单个 tool call
- **全生命周期**:把技能层拆成发现→练习→蒸馏→存储→组合→评估→更新七个阶段,指出每个阶段各自的工程问题
- **7 种设计模式**:从元数据驱动的渐进式披露、可执行代码技能,到自进化技能库与技能市集,对应当下 Claude Skills 等真实生态的做法
2026 的『agent 记忆』竞赛:5 个仓库、4 种架构、一个还没解决的问题
展开详情
- **规模**:一季度 5 个 agent 记忆仓库合揽 8 万+ 星,MemPalace 5 天约 3.6 万星(约 7199 星/天),是最快的开发者工具增速之一
- **4 种架构**:持久化记忆、透明上下文数据库、多 agent 协作记忆等路线并存,尚未收敛出标准答案
- **未解难题**:存储和分发在被快速解决,但『记什么、怎么遗忘、怎么避免记忆污染让 agent 跑偏』仍是公开问题
GitNexus
展开详情
- **先看图再动手**:把代码库索引成含依赖/调用链/执行流的知识图谱,让 agent 改代码前先有架构感知,减少『改一处崩三处』
- **零服务端 + MCP**:本地零服务端运行,通过标准 MCP 工具接入 Claude Code、Codex 等各种 AI 编辑器/agent
- **开源起步、企业变现**:OSS 免费、4→6 月从约 1.2k 涨到约 42k 星,企业版加 PR 审查、自更新 wiki、多仓图谱做商业化