Hall of Fame
今日趋势综述
今天的信号:AI 的下半场不比谁更聪明,比谁交付得稳、跑得起、接得住
把今天几件事连起来看,它们朝同一个方向使劲,而且明显偏离了过去两年『追最新最大模型』的惯性。普林斯顿 Arvind Narayanan 团队的《Towards a Science of AI Agent Reliability》把『可靠』拆成一致性、鲁棒性、可预测性、安全四个维度共 12 个可量化指标——等于承认:benchmark 分数再高,agent 在真实场景照样翻车,行业缺的是一套能测『它到底靠不靠谱』的科学。H Company 的 Holo3.1 把这件事落到硬件:一个能在本地 12GB 显卡上跑、每步约 140ms、OSWorld 逼近 GPT-5.4 的开源电脑操作 agent,意味着『用 agent 自动操作电脑』不再必须联网上云、按次付费。headroom 用压 60–95% 的 token 让长任务在经济上跑得起,deer-flow 给你一套开源的长程超级 agent 基座,MinerU 把 PDF/Office 这些脏数据变成模型能吃的干净输入——三者合起来,就是把 agent 从 demo 推到能真干活的全套管道。
一句话总结今天的主线:竞争重心正从『能不能生成』转向『能不能稳定、私有、低成本地交付』。这对个人反而是更友好的信号——可靠性、私有化、把数据和流程打通,这些活不需要你去炼更大的模型,靠的是工程手艺和对某个具体场景的理解,而这正是普通人能积累、能长期收费的东西。今天连 GEO/AEO(帮品牌在 AI 答案里被引用)都能成一门月费几千美元的生意,本质也是同一逻辑:谁能把『在 AI 时代被看见、被稳定交付』这件确定性卖给具体的人,谁就有现金流。
Towards a Science of AI Agent Reliability:把『agent 靠不靠谱』拆成 4 维度 12 指标的可量化科学
展开详情
- **四维度框架**:把抽象的『可靠』拆成一致性 / 鲁棒性 / 可预测性 / 安全四个可测维度、共 12 个指标,第一次让『agent 靠不靠谱』能被量化对比
- **戳破 benchmark 幻觉**:明确指出高分不等于可靠——跑一次成功 ≠ 十次都成功,换措辞、换环境就崩,真实部署缺的正是『稳定性与可预测性』这把尺
- **可复现、能上手**:66 页方法 + 交互式结果面板 + 开源代码,出自普林斯顿 Narayanan(《AI Snake Oil》)团队,工程与学术都能直接借用
Holo3.1:能打的电脑操作 agent 塞进本地 12GB 显卡——open-weights、每步约 140ms、OSWorld 逼近 GPT-5.4
展开详情
- **本地就能跑**:Q4 量化的 35B-A3B 旗舰在 12GB 显卡上每步约 140ms,Windows/Mac 本地可跑,数据不出本机——隐私与成本一次解决
- **开源且能打**:open-weights、四档尺寸(0.8B~35B-A3B),OSWorld 达 74.2% 逼近 GPT-5.4 Computer Use,是当前最强的可本地部署开源电脑操作 agent
- **跨端覆盖**:网页 / 桌面 / 安卓通吃,AndroidWorld 旗舰 67%→79.3%,浏览器自动化、业务软件操作都能接
headroomlabs-ai/headroom
展开详情
headroom 自称『AI agent 的上下文压缩层(context compression layer)』,专治长任务里最烧钱、最拖慢的痛点:塞给大模型的东西太多。它在数据进模型之前先做内容感知压缩——把工具输出、日志、RAG 检索块、文件、对话历史压掉 60~95% 的 token,同时尽量保持答案质量不变。工程上做得很实用:可作为 Python/TypeScript 库、HTTP 代理、或 MCP server 三种形态接入,本地优先(local-first)、压缩可逆(reversible),能直接对接 Claude Code、Cursor、Aider 这些编码 agent;还能通过 verbosity steering / effort routing 顺带压输出 token。一句话,它解决的是『agent 越跑越长、context 越堆越贵』这个人人都撞上的经济性瓶颈。
周增长:本周 Trendshift 周榜(2026-06-22~28)领跑的 AI 仓库之一,热度陡增
- **压掉 60~95% token**:进模型前对工具输出/日志/RAG 块/文件/历史做内容感知压缩,答案质量尽量不变——直接砍长任务的成本与延迟
- **三种形态、无缝接入**:可作 Python/TS 库、HTTP 代理或 MCP server,本地优先、压缩可逆,直连 Claude Code / Cursor / Aider 等现成 agent
- **踩中真痛点**:本周 Trendshift 周榜领跑,v0.28.0(2026-06-29)持续高频迭代——印证『agent context 太贵』是普遍且紧迫的需求
opendatalab/MinerU
展开详情
MinerU 干的是 agent 落地里最不起眼、却最卡脖子的『最后一公里』:把复杂文档变成大模型/RAG 能直接吃的干净数据。它能把 PDF、Word、PPT、Excel、图片乃至网页,转成结构化的 markdown / JSON——自动去页眉页脚、保留文档结构、抽取图片和表格、公式转 LaTeX、表格转 HTML,支持 109 种语言 OCR,还能处理扫描件、手写、多栏排版。工程上是 VLM+OCR 双引擎,CPU/GPU 都能跑,形态给足了 Web 应用、桌面端、Python/Go/TS SDK、CLI、API、Docker,并通过 MCP Server 直连 LangChain、Dify、FastGPT 等 RAG 框架。一句话:agent 再聪明,也得先有人把脏数据喂顺,MinerU 就是那把顺数据的铲子。
周增长:v3.4.0 发布于 2026-06-18,持续活跃、稳居 AI 文档处理头部
- **脏文档→干净数据**:PDF/Word/PPT/Excel/图片/网页 转结构化 markdown/JSON,自动去页眉页脚、留结构、抽表格图片、公式转 LaTeX、109 语种 OCR,扫描件手写多栏都扛
- **接得进现成栈**:VLM+OCR 双引擎,CPU/GPU 皆可,Web/桌面/SDK/CLI/API/Docker 全形态,经 MCP Server 直连 LangChain/Dify/FastGPT 等 RAG 框架
- **又土又硬的刚需**:约 7.3 万星、2026-06-18 仍在发 v3.4.0——印证『把数据喂顺』是 agent 落地绕不开的一环
AEO/GEO 服务:帮小生意『在 AI 答案里被引用』,聚焦细分月费约 $2K–5K 起——但 10 家里 8 家只是把 SEO 换个壳
展开详情
- **新获客战场**:用户从『搜 Google』转向『问 AI』,品牌能不能被 ChatGPT/Perplexity/Gemini/Claude 引用成了新生死线——AEO/GEO 就是帮它被引用
- **真实单元经济**:小型聚焦试点约 $2K–5K/月、成熟方案 $10K–25K+/月,服务型按月订阅、上来即正现金流,个人可从单一细分做起
- **门槛在真本事不在名词**:Indie Hackers 实测 10 家有 8 家只是给 SEO 换壳——真懂『让内容被 AI 抽取引用+监测 AI 曝光』的人稀缺,正是个人切入的缝隙