Hall of Fame
今日趋势综述
今天的信号:agent 从『会聊天』变成『交活』,而交活的底座你现在就能捡
把今天的几条串起来,方向很清楚:AI 的价值正在从『模型多聪明』转向『agent 能不能把一件事从头做完并交付成品』。OpenAI 的 ChatGPT Work 让 agent 接管整条工作流、几个小时后甩回做好的表格/幻灯片/网页;美国银行、摩根大通已经把上百到近千个 AI 用例塞进生产线,20 万员工每天几十万次调用。这已经不是试点,是把 agent 当员工在用。
但真正对个人友好的信号,藏在『底座』这一层。MCP 这次 2026-07-28 大改把协议从有状态改成无状态请求/响应——初始化握手、会话 ID 全砍掉,任何一台服务器都能被普通负载均衡随手转发,agent 后端第一次能像普通 Web 服务一样部署到 serverless/边缘。配上单端点接 290+ 模型的 OmniRoute、把扫描件和文本 PDF 秒级分流的 pdf-inspector,你会发现:搭一套能跑活的 agent 管道,门槛正在被逐块拆掉。
给普通人的一句话:别只盯着『哪个模型登顶』,去盯『交活链路』里还缺哪块砖。会把无状态 MCP + 模型网关 + 文档清洗拼成一条能交付成品的流水线的人,既能像 last30days 作者那样把一个技能做到 5 万星,也能像那些做 AI 语音前台的独立开发者那样,一个客户收 $300–800/月、两三周就见现金流。今天所有信号的共同点是:能力在变成基础设施,而基础设施是可以被个人捡起来变现的。
ChatGPT Work(OpenAI workspace agents)
展开详情
- **范式**:从『答问题』到『交成品』——给一个 outcome,agent 自己跨应用取数、拆步骤、后台跑数小时,交回表格/幻灯片/网页
- **打包**:一次发布捆了三件套——workspace agent + 内置 Codex 的桌面端 + 托管站点服务,等于把『造 + 部署』连成一条线
- **信号**:巨头把 agent 明确做成『企业工作流的拥有者』并能团队共享,agent 产品的战场从单机能力转向组织级交付
MCP 2026-07-28 大改:协议从『有状态』变『无状态』,agent 后端第一次能像普通 Web 服务那样部署
展开详情
- **核心变化**:有状态→无状态请求/响应,砍掉初始化握手和会话 ID,任何服务器实例都能被普通轮询 LB 转发
- **部署红利**:不再需要粘性会话/共享会话存储,MCP 服务器可以像普通 HTTP 服务一样上 serverless、边缘、自动扩缩
- **治理**:新增版本化扩展框架 + OAuth/OIDC 授权加固,把『加新能力』和『不破坏兼容』这两件事制度化
银行把 AI 跑成了生产线:美国银行上百个用例、摩根大通近千个,20 万员工每天几十万次调用
展开详情
- **规模**:美国银行 300+ 已批用例 / 114 个生成式 / 34 个完整落地,20 万员工每天 40 万+ 次调用
- **广度**:摩根大通近 1,000 个在跑用例,覆盖风控/反欺诈/营销/文档,企业 ML 平台服务每天约 $10 万亿交易
- **转折**:CEO 把『AI 用例数量』写进财报口径本身就是信号——AI 从成本项变成了要对投资人交代的战略资产
AI 语音前台代运营:一个人给本地生意接漏掉的电话,单客户 $300–800/月、约 80% 毛利
展开详情
- **现成拼装**:Callin.io(语音)+ n8n(编排)+ Cal.com(预约),不碰模型训练,两三周上线第一个客户
- **单位经济**:$1–2K 搭建 + $300–800/月订阅、约 80% 毛利;3–5 个客户即 $5–15K MRR,一人可运营
- **痛点硬**:6,200 万+ 小微企业每漏一个电话损失 $500–2K,需求是『正在流血的现金』而不是想象出来的
firecrawl/pdf-inspector
展开详情
一个高性能 Rust 库:先把 PDF 分类成文本型/扫描型/图片型/混合型,再据此智能路由——文本型直接快速抽取转干净 Markdown,扫描型才交给 OCR,避免无脑全跑 OCR。
周增长:2026-02 创建,近 7 天约 +510 星(约 +32%),基准结果 2026-07-31 刷新到 v0.2.6,属于持续有动量的文档处理工具
- **智能分流**:先判 PDF 是文本还是扫描(约 10–50ms、带置信度),文本型免 OCR 直转 Markdown,只把扫描件交给 OCR
- **性能对比**:200 文档 0.470s / 总分 0.875,对比 PyMuPDF4LLM 17.117s / 0.735——快约 36 倍且分更高
- **易接入**:纯 Rust 仅依赖 lopdf,提供 Python / Node.js / 浏览器 WASM 绑定,适合塞进任意文档预处理管道
Jamie Dimon
今日趋势综述
今天的信号:会搭脚手架的人,正在接管 agent 时代
把今天的条目连起来看,一条主线非常清楚:值钱的地方正在从『模型本身』外移到『围着模型搭的那圈东西』。yc-software 的 qm 是个多人协作的 agent harness、lopopolo 把 harness engineering 直接写成了一本工程手册、arXiv 上的 OrchBench 开始专门评测『多 agent 编排方案』好不好——这三件事指向同一个判断:模型能力已经过剩,真正的瓶颈是上下文怎么给、工具怎么接、多个 agent 怎么协同、以及怎么把这套编排『评』出好坏。谁会搭这套脚手架,谁的产出就高一个数量级。
另一半信号是『能力下沉 + 落地变现』:turbo-fieldfare 用流式加载把 Gemma 4 26B 塞进 8GB Mac、约 2GB 常驻内存就能跑,前沿模型的推理成本正在被压到个人设备上;video-shotcraft 让 Claude Code 直接产出电影级产品短片、qwen-audio-agent 用开源实时语音让 agent 边聊边干活——agent 已经不只是写代码,而是在做视频、接电话、跑工厂质检这些能直接换钱的活。Kleo 三个月做到 $62k MRR(虽然赢在创始人自带 LinkedIn 流量)、制造业视觉质检普遍跑到 200% ROI,都是同一个逻辑的下游。
对个人的启示很直接:别再追每周换一次的新模型榜。把时间花在两件会复利的事上——第一,练『给 agent 搭环境』的手艺(写好上下文、接好工具、设计编排、会评测),这是 harness engineering 正在成型的新工种;第二,盯一个能用 agent 直接产出可交付物、且有人已经在付钱的具体场景(做片、接电话、质检、写社媒),把开源能力接成现金流。模型是租来的,脚手架和场景才是你自己的。
yc-software/qm
展开详情
一个面向创业团队的『多人协作 agent harness』:每个员工有自己的沙盒工作区,又能通过 Slack 和 Web 一起协作,让 agent 从个人工具变成团队操作系统。
周增长:2026-07-29 创建,约 3 天冲到 4.8k+ 星(均值 >1.5k/天),是本周最猛的 agent 基础设施黑马
- **定位**:不是又一个 coding agent,而是把 agent 拉到团队层的协作 harness——个人沙盒 + 共享作用域 + Slack/Web 统一身份
- **能力**:接内部笔记/邮件/文档/数据库/网络,支持定时任务、收件箱分诊、临时内部应用一键部署
- **安全**:Strict/Auto/Dangerous 三档执行姿态 + 管理员按人分权,把『放开 agent』的风险做成可配置的旋钮
drumih/turbo-fieldfare
展开详情
用 Swift + Metal 写的推理运行时,让 Google 的 Gemma 4 26B-A4B 这个 260 亿参数模型,在只有 8GB 内存的 Apple Silicon Mac 上、约 2GB 常驻内存就能跑起来。
周增长:2026-07-17 创建,约两周冲到 3.6k 星,是本周本地大模型方向的高热项目
- **反直觉**:26B 模型不再需要 26GB 内存——靠 SSD 流式加载专家权重,2GB 常驻内存就能跑
- **数字**:M2 Air(8GB)5.1–6.3 tok/s、M5 Pro 31–35 tok/s;4-bit 量化 + LFU 专家缓存 + chunked prefill 128 token
- **工程**:全套自定义 Metal kernel(量化算子/注意力/MoE 路由/采样)+ 流式安装器,边下边重打包不落地完整 checkpoint
lopopolo/harness-engineering
展开详情
一本关于『harness engineering』的工程文集与实操手册:把模型和 coding agent 当成固定不变的,转而系统性地优化围绕它的两根外部杠杆——上下文和工具。
周增长:2026-07-18 创建,两周冲到 2.4k 星,踩中『harness/上下文工程正在成为新工种』的风口
- **范式**:把模型/agent 当常量,只优化『上下文 + 工具』两根外部杠杆——这就是 harness engineering 的定义
- **金句**:『让 agent 读你的写作、推文、播客、演讲,产出就能提升 100 倍』——知识资产比提示词更值钱
- **落地**:核心是『最后一公里』——把组织隐性流程知识变成可检索、可执行的上下文与约束,靠反馈循环累积判断力
OrchBench: Evaluating Multi-Agent Orchestration Plans in Isolation via Deterministic Simulation
展开详情
- **问题**:多 agent 产出差,分不清是编排烂还是模型弱——评测把两者混在一起,无法定位
- **方法**:把编排方案抽象成『子任务分派 + 跨 agent 信息传递』,用确定性模拟隔离评测编排本身
- **趋势**:与 UniClawBench 等一起,标志 agent 评测从『测模型』分化出『测编排/测框架』的新方向
Vincentwei1021/video-shotcraft
展开详情
一个给 Claude Code / Codex 用的『电影级产品短片』agent skill:基于 Remotion(React 视频框架),让 agent 直接把产品截图变成有分镜、有运镜、有音效的成片。
周增长:2026-07-19 创建,两周冲到 3.1k 星,是本周 Skills 生态里最出圈的创作类技能
- **能力**:agent 直接产出电影级产品片——真实页面截图 + 2.5D 运镜 + 卡点剪辑 + 影视级音效
- **素材**:104 张分镜配方卡(拆自 Figma/Notion/Slack 的专业片)+ 161 种运镜 + 149 个音效 + 5 首 BGM
- **模板**:开箱即用的 36 秒 promo 模板(10 镜头 + 转场 + 混音),换截图换品牌即可出片
QwenAudio/qwen-audio-agent
展开详情
阿里 Qwen 团队开源的实时语音运行时,让 AI agent 能『边聊边干活』:前台对话和后台任务并行,全双工语音、可自然打断,结果算完自动回到对话里。
周增长:2026-07-27 创建,几天内到 1.2k 星,来自阿里 Qwen 团队的开源实时语音运行时
- **体验**:全双工实时语音 + 自然打断,前台对话与后台任务并行——不用干等执行
- **协议**:兼容 OpenCode/OpenClaw/Qoder/Claude Code,WebUI + TUI + macOS 悬浮球三种界面,带跨会话记忆
- **开源**:Apache 2.0,npm 可装,三平台;背后是阿里 Qwen 团队 + DashScope + ACP 架构
制造业 AI 视觉质检落地实测:普遍跑到 200% ROI,Intel 单条产线年省 $2M,赢家赢在把 AI 卡进产线节拍
展开详情
- **对比**:Intel 单条晶圆检测产线年省 $2M;电子厂漏检率 2.3%→0.1%、消掉 $1.8M 保修敞口;汽车件缺陷降 37%、OEE +22%
- **大盘**:AI 质检普遍 200–300% ROI,产线速度下缺陷检出率 99%+,废品率砍约 30%
- **赢法**:不是买最强模型,而是把 AI 嵌进产线实时节拍——线速下自动判定、直接触发处置
Kleo:三个月 0 → $62k MRR 的 LinkedIn 内容插件,靠 Claude + Claude Memory 学你的写作风格
展开详情
- **数字**:Chrome 插件,3 个月 0 → $62k MRR;同团队并行的 Mentions 做到 $20k MRR
- **技术**:用 Claude 做生成 + Claude Memory 学写作风格,越用越贴近你的嗓音
- **真相**:暴涨主因是创始人自带数十万 LinkedIn 目标粉丝——分发力比产品本身更决定速度
今日趋势综述
今天的信号:给 agent 做减法,比给它加马力更值钱
把今天几条线索连起来,能看到一个越来越清楚的转向:能力不再稀缺,稀缺的是『让能力老老实实干对活』。最戏剧的样本是 ponytail——一个专门让 AI 编码 agent『变懒』、能不写代码就不写的插件,7 周涨到 9.3 万星,实测平均少写 54% 的代码、省 20% 成本还不牺牲安全。它火的原因很反直觉:大家发现 agent 最大的问题不是不够聪明,而是太爱过度设计。给它装个刹车,比给它换更强的引擎更立竿见影。
另一半信号是『搭管道』。Xiaomi 的 MiMo-Code 把持久记忆和 subagent 编排做进终端,让 agent 跨会话越用越懂你的项目;open-connector 把 1000+ SaaS 的授权和动作打包成一层网关,让 agent 不碰密钥就能调工具;ktx 则专治 agent 查数据库时『每次重新瞎猜指标』的老毛病,把公司的口径和知识沉淀成可复用的上下文层。就连今天的论文也在同一条线上:把 agent 的长期记忆当成一个『文件系统』来组织、演化和维护。模型是发动机,这些是变速箱、油路和方向盘——车能不能真上路,全看它们。
对个人的启示很直接:别只盯着『哪个模型最强』(今天的评测也显示前三名智能指数只差 2 分,价格却差三倍)。真正的机会在两个缝隙里——一是学会给 agent 做减法、接数据、连工具这类『落地手艺』,它正在变成新工种;二是像那位用 AI 快速造产品、靠 $20/天投放做到 $6.7K 月收入的独立开发者那样,把 AI 当成压低成本的杠杆,去啃一个具体、无聊、有人付钱的活(保险的核保理赔就是个 30-40% 成本能被 AI 砍掉的现成战场)。能力已经够用,剩下的是谁愿意把最后一公里跑通。
XiaomiMiMo/MiMo-Code
展开详情
小米开源的终端原生 AI 编码 agent,主打持久记忆与『模型和 agent 共同进化』。
周增长:2026-06-10 创建,约 7.5 周 1.26 万星(均值 >1.6k/周)
- **记性**:SQLite 持久化项目知识+检查点,逼近上下文上限自动重建,长任务不断线
- **分工**:Build/Plan/Compose 三种 agent + 并行 subagent + 独立裁判模型验收停止条件
- **进化**:`/dream` `/distill` 把每次会话的经验蒸馏成可复用技能和项目记忆,越用越懂你的仓库
oomol-lab/open-connector
展开详情
开源的 AI agent 连接器网关(Composio 的开源替代):一次授权账号,把 1000+ SaaS 的动作分发给多个 agent。
周增长:2026-06-29 创建,约 4.5 周 3.9k 星(均值 >800/周)
- **规模**:1000+ 服务商、10000+ 预建动作,一次授权多 agent 共用一套集成目录
- **安全**:厂商密钥留在运行时边界内,agent 只拿元数据和执行结果,从不接触真凭证
- **多接入**:MCP / SDK / CLI / HTTP-OpenAPI 四路齐全,可自托管(Docker/Fly/CF Workers)也可托管
Kaelio/ktx
展开详情
给数据/分析类 AI agent 的可执行上下文层:让 agent 用公司认可的指标口径准确查数仓,而不是每次自己瞎编 SQL。
周增长:2026-05-10 创建,约 11.5 周 1.5k 星,随『数据 agent』话题稳步增长
- **痛点**:通用 agent 查数每次瞎猜口径、返回对不上的数字——ktx 把公司指标定义固化成只读 SQL 语义层
- **自建上下文**:自动吸收 dbt/Looker/Metabase/文档进可搜索 wiki,识别 join 陷阱、标出来源间矛盾
- **易接入**:CLI + MCP 接 Claude/Codex/Cursor,支持 PG/Snowflake/BigQuery 等十种库,一行 npm 装好
Filesystem-Based Memory for LLM Agents: Organization, Evolution, and Sustainability
展开详情
- **新视角**:把 agent 长期记忆抽象成『文件系统』——可组织、可演化、可维护,而非只进不出的向量堆
- **三角色**:管理 agent 整理归类、检索 agent 带来源引用地答、执行 agent 落动作,分工清晰
- **真问题**:直指记忆工程的两个现实痛点——组织(可查、结构化)与可持续(不腐化、不膨胀)
保险 AI 落地实测:核保从 3-5 天压到 12 分钟、理赔成本降 30-40%,赢家赢在把 AI 卡进直通流程
展开详情
- **核保**:自动直通核保率从 10-15% → 70-90%,周期从 3-5 天压到约 12 分钟(领先险企)
- **理赔**:AI 理赔自动化普遍快 75%、成本降 30-40%;Lemonade『AI Jim』2 秒结案、55% 理赔全自动
- **大盘**:用 AI 的险企普遍处理快 50-75%、成本降约 20%,且欺诈识别更准——已是产线级而非试点
选模型别只看榜首:智能指数前三只差 2 分,价格却差三倍,agentic 榜上便宜的反而更划算
展开详情
- **对比**:智能指数 Opus 5 61 vs Fable 5 60 vs GPT-5.6 Sol 59(差仅 2 分,Artificial Analysis v4.1,9 项评测综合)
- **Agentic 榜**:Opus 5 55.3 vs GPT-5.6 Sol 54.0 vs Fable 5 52.8——最便宜的 Sol 在 agent 场景反超更贵的 Fable 5
- **价格**:Opus 5 $5/$25、Fable 5 约翻倍($10/$50 档)、GPT-5.6 Sol 约为 Fable 5 的三分之一——2 分差,3 倍价
用 AI 快速造产品 + $20/天投放:一个独立开发者 21 周做到 $6,772 MRR 的现金流打法
展开详情
- **数字**:单人约 21 周做到 $6,772 MRR,靠一个 AI 电商应用 + 一个 B2B 安全工具的产品组合
- **打法**:AI 压低造产品成本 + $20/天 Meta 广告压低获客试错成本,跑通一个再复制下一个
- **心法**:不押一个爆款,用小额投放快速验证『哪个产品/受众真愿付钱』,再把预算加到验证过的那条线上
Firecrawl:把整个网站变成 LLM 可用数据的 API,新版本本周登陆 Product Hunt
展开详情
- **做什么**:把网页/整站 scrape / crawl / search / extract 成干净 markdown 或结构化 JSON,几行 API 搞定
- **省什么**:替你处理 JS 渲染、翻页、去噪、按需抽字段,不用再自己维护一套动不动就坏的爬虫
- **用在哪**:给 RAG 供料、给 agent 做联网检索、给数据管道持续喂结构化数据,是 AI 应用的数据入口