Hall of Fame
Hall of Fame
Track
Type
Source
7月29日
今日趋势综述
从农田到企业交付,今天的信号都指向同一件事:AI 的胜负手不在模型本身,而在把它接进真实流程、真实数据、真实客户的『最后一公里』。
今天的信号:赢家都在抢『最后一公里』,不是抢模型
把今天的条目连起来看,会发现一条很清楚的主线:几乎没有一条是靠『我们用了最强的模型』赢的。农业里 Church Brothers 用需求预测把短期预测准确率提升 40%,靠的是把 AI 嵌进易腐货的补货流程;企业交付端,Palantir 那套被 Anthropic、OpenAI 抄作业的 FDE 打法,核心是『按管道额度配人、驻场 8–16 周、上线第一天就交东西』;连接层的真正瓶颈,从模型能力变成了『怎么把本地系统安全地接给云端 agent』——MCP gateway 就是冲这个缝隙长出来的一整个品类。评测那条更直白:Terminal-Bench 上 GPT-5.5 领先,可换到 MCP Atlas 工具调用榜,冠军就变成了 Gemini 3.5 Flash。没有哪个模型通吃,选型的功夫全在『你的活到底考哪一项』。
#01
info.throughput.world
Article
NEW
农业需求预测落地实测:Church Brothers 把易腐货短期预测准确率提升 40%,赢在把 AI 嵌进补货流程
美国家族农业公司 Church Brothers Farms(年种 4 万英亩、发运 5000 万箱、400+ SKU、6 万+ 车次)用 ThroughPut AI 的需求预测软件,把易腐蔬菜的短期需求预测准确率提升最高 40%,并在订单履约时效、路由决策上同步改善,明显压低了超额库存与损耗。它没有换什么最强大模型,赢点是把预测能力接进『今天该给哪个客户备多少货』这个具体环节——对易腐品,早一天预测准就少一车烂菜。
另有 2 家信源报道
展开详情
- **数字**:短期需求预测准确率最高提升 40%,SKU 级需求可见性显著改善,超额库存与损耗一起下降
- **规模**:4 万英亩、5000 万箱/年、400+ SKU、6 万+ 车次的真实体量,不是 demo 级样本
- **打法**:不追大模型,把预测嵌进易腐货补货与路由流程——早一天预测准,就少一车报废
推荐理由:对个人:农业、生鲜、冷链这类『不性感』的行业,恰恰是 AI 落地最容易见到真金白银的地方——损耗和库存就是白花花的钱。你不需要会训模型,需要懂这个行业的数据长什么样、卡在补货/排产/路由哪一步。会把现成预测/优化能力接进某个具体行业流程的人,比会跑 benchmark 的人更稀缺,也更好变现。
#02
indiehackers.com
Product
直接可用
NEW
Meerkats.ai:一个人四周做到 $3k MRR 的 AI 增长编排平台,把 SDR/营销/代理的重复活打包成软件
有 20 年 SaaS go-to-market 经验的 Santanu Dasgupta,做了个叫 Meerkats.ai 的『AI 增长编排平台』——把 SDR、营销和外包代理常干的重复活(抓取和补全关系数据、找线索、跑触达、跟进)用软件替掉,相当于把一间数字增长代理公司塞进一个订阅产品里。一个人、在拥挤的赛道里,发布四周就做到 $3k MRR。它的样本价值不在技术多新,而在证明:把你最懂的那套业务流程编排成 AI 产品,是当下最快的现金流路径之一。
另有 1 家信源报道
展开详情
- **成绩**:单人、四周、$3k MRR,赛道拥挤仍跑通——不是靠新模型,是靠把一套熟悉的增长流程产品化
- **切口**:替掉 SDR/营销/代理的重复劳动(找线索、补数据、跑触达、跟进),卖给最痛这块的中小团队
- **壁垒**:创始人 20 年 GTM 经验本身就是护城河——他知道每一步该编排成什么,比通用工具更贴业务
推荐理由:对想挣现金流的普通人:最快变现的不是最新技术,是『你已经很懂的那套流程 + AI 编排 + 订阅收费』。找一个你亲手做过、别人还在手动重复的工作流(招聘、催收、排班、外联……),把它做成一个能自己跑的小产品,一个人四周就可能起量。领域知识是你相对大厂的真壁垒。
My Take:评分(5=最优):最快成交 4 / 最低成本 4 / 可复制 3 / 风险安全度 4。用你最懂的业务流程做 AI 编排,是单人变现最快的路径之一。
商机信号(加速):谁付钱:没钱养整支 SDR/营销团队、又要持续找线索跑增长的中小 SaaS 与服务型创业者 痛点:增长动作全是重复手工活(找人、补数据、发触达、跟进),外包代理贵、内部又雇不起团队 切入点:挑一个你自己做过的细分增长流程(如某垂类的冷启动外联),做成能自动跑的订阅小工具,靠领域 know-how 做出比通用工具更准的编排
#03
llm-stats.com
Article
NEW
评测该看哪一榜:Terminal-Bench 上 GPT-5.5 领先,换到 MCP Atlas 工具调用榜冠军就变成 Gemini 3.5 Flash
同样是『考 agent 会不会干活』,不同基准给出的冠军完全不同。Stanford + Laude 的 Terminal-Bench 2.0 考命令行终端掌控力,GPT-5.5 以 82.7% 登顶;而 Scale 的 MCP Atlas 考通过 MCP 协议做真实工具调用,冠军换成了 Gemini 3.5 Flash(83.6%),Claude Opus 4.7 在这一项是 77.3%。结论很实在:没有一个模型在所有『agent 能力』维度上通吃,选型前得先弄清你的活到底考哪一项。
另有 2 家信源报道
展开详情
- **对比**:Terminal-Bench 2.0 上 GPT-5.5 82.7% vs Gemini 3.5 Flash 76.2%;但换到 MCP Atlas 工具调用榜,Gemini 3.5 Flash 83.6% vs Claude Opus 4.7 77.3%
- **分野**:终端掌控(跑命令、修环境)和 MCP 工具调用是两种能力,冠军互不重合,别用一个分数概括『谁更会当 agent』
- **方法**:Scale 今年把 MCP Atlas 评分判官升级、加了瞬时错误重试、把 20 轮上限改成每任务最多 100 次工具调用预算——评测本身也在往真实场景靠
推荐理由:对开发者:选 agent 底座别只看一个总榜。如果你的场景是命令行/CI/环境操作,优先看 Terminal-Bench 类分数,GPT-5.5 目前占优;如果核心是走 MCP 调一堆外部工具、长链路任务,Gemini 3.5 Flash 在 MCP Atlas 上更强且便宜。先想清『我的活考哪一项』,再按那一项的榜单选,比追总榜首靠谱得多。
#04
arXiv
Paper
NEW
Tool-Making and Self-Evolving LLM Agents in Low-Latency Systems
这篇论文针对一个很实际的痛点:agent 在推理时反复即兴写代码(inference-time coding loop)既慢又不稳。它提出一条『造工具』的流水线——把反复出现的标准操作步骤(SOP)提前编译成经过验证、带版本的工具,部署前就固化好,运行时直接调用而不是每次重新生成。本质是把 agent 从『每次现编』升级成『会沉淀可复用工具的自进化系统』,特别适合对延迟敏感的生产环境。
把『agent 每次都临场写代码』换成『提前把重复步骤编译成可复用工具』,为低延迟场景下的 agent 工程给出一条可落地的路子。
展开详情
- **问题**:推理时反复即兴写代码的循环,既拖慢延迟又难保证正确性,是生产 agent 的隐性成本大头
- **方法**:把重复的 SOP 步骤离线编译成经验证、带版本的工具,部署前固化,运行时直接调用
- **意义**:给『self-evolving agent』一个工程化定义——不是越跑越玄,而是把跑过的经验沉淀成可复用、可审计的工具库
推荐理由:对个人:这篇给了一个可迁移的工程直觉——好的 agent 不该每次都从零现编,而该把做过的事沉淀成可复用工具。你自己搭 agent 时也一样:与其堆更长的提示,不如把高频动作固化成稳定的工具/脚本,既快又可控。『把经验编译成工具』的能力,正在成为 agent 工程的核心手艺。
#05
getmaxim.ai
Article
NEW
真正的瓶颈从模型变成了连接:MCP Gateway 正长成 agent 时代的新基础设施品类
2026 是『AI 真正动手干活』的一年,而动手就需要把云端的 agent 大脑安全地接到本地数据库、脚本、CI/CD。业内的共识是:真正的瓶颈已经从模型能力,变成了连接——怎么把本地 MCP server 稳定暴露给云端 agent,不掉会话、不留鉴权口子。MCP Gateway 就是冲这个缝隙长出来的品类:把鉴权、工具路由、可观测性、治理收进 agent 与工具之间的一层控制面。Gartner 甚至预测多数 API 网关厂商会把 MCP 能力纳进来。与此同时治理落差仍在——一份 225 位安全/IT 负责人的调查显示,多数组织能看到 agent 在干什么,却在出事时拦不住它。
另有 2 家信源报道
展开详情
- **转向**:瓶颈从『模型够不够强』变成『本地系统怎么安全接给云端 agent』——连接成了新的硬骨头
- **品类**:MCP Gateway 把鉴权/工具路由/可观测性/治理收进一层控制面;Gartner 预测多数 API 网关厂商将纳入 MCP 能力
- **落差**:225 位安全/IT 负责人调查——多数组织能监控 agent,却在它出错时拦不住,治理仍是缺口
推荐理由:对个人:agent 从『会聊天』走向『会动手』,中间的连接层和治理层正在批量创造新岗位和新生意。学会用 MCP 把系统安全地接给 agent、并给它加上审计和熔断,是比调提示更抢手的新技能;而大厂的 gateway 往往只服务头部客户,帮中小团队『安全地把 agent 接进业务』这件事,个人和小团队完全切得进去。
商机信号(加速):谁付钱:想让 agent 碰内部系统、又怕鉴权失控和出事拦不住的中小企业与开发团队 痛点:把本地系统接给云端 agent 时会话易断、鉴权有口子,且缺少『出错能立刻拦停』的统一控制面 切入点:为某个垂类(如财务/客服系统)做轻量 MCP 接入 + 审计熔断的落地服务,帮买不起大厂 gateway 的团队安全上线 agent
#06
agensi.io
Article
NEW
写 Agent Skills 也能变现:技能市场从 1 家涨到 8 家,创作者拿 80% 分成、按月订阅调用全目录
Agent skills 生态在半年里从『一个注册表』长成了八家主流市场。变现路径正在成型:以 Agensi 为例——每个 skill 上架前先过安全扫描,创作者拿 80% 分成,Pro 订阅用户 $9/月即可 MCP 实时调用整个目录;还有 SkillsMP 汇聚了 GitHub 上 200 万+ 公开技能、Netresearch 的市场则做成跨 Claude Code / Cursor / Copilot / Codex / Gemini CLI 等 30+ agent 可移植。信号很明确:『写一个好用、可复用的技能』本身正在成为一门能收费的手艺,而不只是自用脚本。
另有 1 家信源报道
展开详情
- **格局**:agent skills 市场半年从 1 家扩到 8 家,官方(anthropics/skills)+第三方(Agensi/SkillsMP/Netresearch)并存,生态在快速成型
- **变现**:Agensi 创作者拿 80% 分成、上架先过安全扫描,Pro 用户 $9/月 MCP 实时调用全目录——技能开始有清晰的收费闭环
- **可移植**:Netresearch 市场做成跨 Claude Code/Cursor/Copilot/Codex/Gemini CLI 等 30+ agent 可用,一次写、多端复用
推荐理由:对个人:写 Skills 正从『自用脚本』变成一门能卖钱的手艺。如果你在某个细分场景(某行业的取数、某种格式的文档处理)积累了可靠的工作流,把它打磨成一个安全、可复用、跨 agent 可移植的 skill 上架市场,就有了被动收入的入口。会把 know-how 封装成好技能的人,现在有了明确的变现渠道。
商机信号(萌芽):谁付钱:想省事、愿意为现成可靠技能付月费的 agent 重度用户与中小团队,以及靠分成变现的技能创作者 痛点:自己从零写和维护高质量 skill 成本高、质量参差,市场又缺乏安全审核与可移植标准 切入点:锁定一个你有真实 know-how 的细分场景,做几个安全、可复用、跨 agent 的高质量 skill 上架分成市场,先靠垂类深度而非数量取胜
#07
getperspective.ai
Article
NEW
被 Anthropic、OpenAI 抄作业的 Palantir FDE 打法:按管道额度配人、驻场 8–16 周、上线第一天就交东西
这篇把 Palantir 那套被 Anthropic、OpenAI 直接抄作业的 FDE 打法压成了四条动作:每 200–500 万美元企业管道配 1 名 FDE、在单一客户处驻场嵌入 8–16 周、要求上线第一天就交付可用东西(拒绝需求文档表演)、并持续做对话式客户发现。它讲的不是『FDE 很缺人』这个结论,而是把『怎么组织和跑一支 FDE 队伍』的方法论掰开揉碎——核心是用交付节奏和贴身驻场,把模型能力真正压进客户的混乱业务里。
另有 2 家信源报道
展开详情
- **四招**:每 $2–5M 管道配 1 名 FDE、单客户驻场嵌入 8–16 周、上线第一天就交可用东西、持续做对话式客户发现
- **反模式**:拒绝『需求文档表演』——不是先写长文档再开发,而是 day-one 就交东西、在真实反馈里迭代
- **抄作业**:这套原是 Palantir 的打法,如今 Anthropic、OpenAI 都在复制——说明 AI 落地的组织方式正在收敛成一种范式
推荐理由:对个人:AI 落地最值钱的能力不是训模型,是『把模型能力压进客户混乱业务』的交付手艺。这套 FDE 方法论其实是一份可自学的清单——学会拆用例、评估数据/权限/治理就绪度、day-one 交付、贴身迭代。哪怕你不进大厂,把这套打法用在自己的外包/咨询/落地项目上,也能显著提高成单和交付质量。
#08
aiacceleratorinstitute.com
Opinion
NEW
Andrej Karpathy
在 LLM agent 之上,正在长出新的一层——它把编排、调度、上下文、工具调用和持久化整体抬到下一个台阶。
据 AI Accelerator Institute 整理,Karpathy 近期用一段短文表达了对这层新抽象的兴奋:模型本身已不是最有意思的部分,真正的新战场是模型之上的编排与持久化层——谁来调度多个 agent、怎么管上下文、工具调用如何被组织、状态如何跨会话持久化。这和今天其他条目(MCP gateway、tool-making 论文、FDE 交付)其实指向同一件事:AI 的价值正在从『单个模型多聪明』转移到『模型之上那层系统工程做得多好』。
另有 1 家信源报道
推荐理由:对个人:如果你还在纠结『该学哪个模型』,方向可能错了。真正在长出机会的是模型之上的编排层——多 agent 调度、上下文工程、工具组织、状态持久化。把精力投在『怎么把一堆 agent 和工具编排成一个可靠系统』上,比追逐每一次模型更新更有复利。这层能力今天还稀缺,正是普通人能建立优势的窗口。