Hall of Fame
今日趋势综述
今天的信号:agent 的竞争从『更聪明』转向『能被企业信任地用起来』
今天最硬的信号来自巨头:OpenAI 推出 Presence——一个把 AI agent 装进企业语音/聊天、且自带策略、护栏、模拟、评测和『已审批动作』的部署级产品;Anthropic 同期上线面向财务/工程/设计的企业 agent 插件。注意它们卖的都不再是『更强的脑子』,而是『让企业敢把 agent 接进真实业务流程』的那一整套治理与交付能力。与此呼应,学术界冒出 FORCE-Bench 这类专门衡量『企业财务场景端到端可用性』的基准——大家开始认真回答『这玩意儿在真实工作流里到底靠不靠谱』。
另一条主线是『别再迷信榜首』。今天的评测现实是:排行榜已经碎成一张矩阵——SWE-bench 上 DeepSeek V4 领先、MMLU/LMArena 是 GPT-5.4、GPQA/Aider 又换 Opus 领跑,没有一个模型通吃。医疗一线的实测同样清醒:环境记录(ambient scribe)已是落地最广的临床 AI,但大型研究发现真实省时『温和且不稳定』,赢家赢在把 AI 嵌进流程、把人再培训好,而不是买了最强模型。
对个人的可执行结论就一句:模型能力正在被商品化,稀缺的是『把 agent 可靠地落进某个具体场景』的能力。无论你是想在某个行业做落地、把常用 skill 打磨成可复利资产、还是一个人做微 SaaS 挣现金流——今天的每一条都在指向同一个方向:谁能把『能力』翻译成『客户敢用、能算出 ROI 的流程』,谁就掌握了模型进步也抹不平的价值。
OpenAI Presence:把 AI agent 做成『受治理的企业产品』,横跨语音与聊天
展开详情
- **产品定位**:不是又一个聊天机器人,而是把 agent 装进企业语音+聊天工作流的部署平台,主打『可治理』
- **治理五件套**:策略、护栏、模拟、评测、已审批动作——把『敢不敢让 agent 动真格』这道企业级门槛做成了产品能力
- **同期呼应**:Anthropic 上线面向财务/工程/设计的企业 agent 插件,两大巨头同一周押注『企业级受控 agent』
别再迷信榜首:2026 年的 LLM 排行榜已经碎成一张矩阵,不同基准各有王者
展开详情
- **对比(编码)**:SWE-bench Verified 上 DeepSeek V4 ≈81% 领先,但前四名相差不到 3 分——编码这一列几乎并列,别为零点几分溢价买单
- **对比(分项王者)**:SWE-bench/LiveCodeBench 看 DeepSeek V4;MMLU/LMArena 看 GPT-5.4;GPQA/Aider 看 Claude Opus——同一批模型在不同基准上排名完全洗牌
- **对比(人类偏好)**:LMArena 上 Opus 4.8 ≈1510 ELO 居首,GPT-5.5 Pro / Gemini 3.1 Pro / Opus 4.7 / GPT-5.5 全在 55 ELO 内,差距小到用体感根本分不出
医疗 AI 落地实测:最普及的『AI 病历助手』真实省时其实温和又不稳定,赢家赢在流程
展开详情
- **大盘**:约 80% 医院已用 AI、FDA 授权 AI 医疗设备超 1357 个,环境记录是最普及的临床落地场景
- **一手数字(斯坦福试点)**:48 名医生,96% 觉得好用、78% 认为加快写病历,但仅约 2/3 真正报告省时;全院累计 AI 病历破百万份
- **现实检查**:大型研究显示真实省时『温和且不稳定』——差距不在模型强弱,在有没有嵌进流程、有没有把人训练到真正用起来
写 Agent Skills 的手艺正在成型:少装、装好、装可复用——2026 的 skills 工程共识
展开详情
- **选取原则**:好 skill = 把每周重复的一件活做得更可靠的操作规程;策略是『少装、装好、范围清晰』而非堆量
- **可移植**:同一份 SKILL.md 跨 Claude Code / Cursor / Gemini CLI / Codex CLI / Antigravity 通用,写一次到处能跑
- **工程实践**:加『反思钩子』——每次调用后让 agent 自评是否有用、没用就自动改进 SKILL.md,让技能自我进化
一个人做 AI 微 SaaS 的现金流打法:盯『新行为催生的监控层』,整套工具栈月成本压到 200 美元内
展开详情
- **成本账**:单人生产级 AI SaaS 工具栈月成本约 85–200 美元(Next.js+Supabase+Stripe+Vercel+LLM API),启动门槛低到咖啡钱
- **选题公式**:盯『新技术→新行为→需要监控/审计层』——例如 AI 编码普及催生的 PR 审查类工具,被验证有 1 万–5 万美元 MRR 空间
- **可复制路径**:多位单干者近半年做到 2 万–6 万美元 MRR,共性是窄场景+高付费意愿+公开构建+重留存,而非做通用大工具
FORCE-Bench: A Benchmark, Dataset, and Evaluation Harness for Agentic AI in Enterprise Finance
展开详情
- **评测对象**:端到端运营型财务工作流,需融合企业内部 ERP 记录与外部财务数据——直接对标真实企业场景,而非玩具题
- **质量维度**:按准确性、可追溯引用、清晰度、深度、依据扎实度、时效性、相关性、结构性八个维度打分,超越『答对即可』
- **风向意义**:与 OpenAI Presence、Anthropic 企业 agent 插件同频——评测正从『智商测试』转向『企业可信度测试』
volcengine/OpenViking
展开详情
OpenViking 是字节火山引擎开源的『AI Agent 上下文数据库』:它把 agent 需要的记忆(memory)、资源(resources)和技能(skills)统一成一个虚拟文件系统,挂在 viking:// 协议下——于是 agent 是用 ls、tree、find 去『浏览自己的上下文』,而不是去查一个看不见内部的黑箱向量库。内容被切成 L0 摘要 / L1 概览 / L2 细节三档按需加载,既省 token 又让每一次检索都留下可观察、可调试的轨迹;还能自动压缩对话、抽取长期记忆,让 agent 越用越『懂你』。一句话:它想做的是 agent 记忆这一层的开放标准。
周增长:字节火山引擎出品,2026 上半年开源后曾登顶 GitHub Trending(3 月中);作为 agent 的标准记忆/上下文层被越来越多项目(含 openclaw 生态)采用,热度持续
- **核心范式**:用文件系统(viking://)而非黑箱向量库管理 agent 的记忆/资源/技能,agent 用 ls/tree/find 浏览自己的上下文
- **省 token**:内容分 L0 摘要 / L1 概览 / L2 细节三档按需加载,每次检索留下可观察、可调试的轨迹
- **可演化**:自动压缩对话、抽取长期记忆,agent 越用越懂你;字节火山引擎出品,约 2.7 万 stars,被 openclaw 等生态采用
面向大型代码库的 Agentic Coding 实战指南:把 agent 当会跑循环的工程师,而不是自动补全
展开详情
- **分水岭**:vibe coding(不看 diff、催到能跑)在大仓必翻车;agentic coding 是『模型接工具、跑循环、人对照 DoD 评审』的架构
- **能力配置**:给 agent 配好代码检索、测试运行、多文件改动编排,它才能在真实大代码库里自己定位-修改-验证
- **新界面**:上下文窗口成了新的编程界面——你编排的是上下文/工具/记忆/验证,而非单条 prompt