📅
Hall of Fame
Hall of Fame
Track
Type
Source
7月31日 周五 · 8 条
今日趋势综述
前沿模型能力开始『下沉』到具体、无聊、垂直的真实活儿里——今天的信号是:价值不在追榜首,而在把能力嵌进某个具体工作流。
今天的信号:能力过剩,落地稀缺

把今天的几条线索连起来,会看到一个清晰的错位:模型的『纸面能力』在飙,但『真正干活』的天花板低得多。编码榜 SWE-bench Verified 已经逼近饱和(97%),可换到更贴近企业真实仓库的 SWE-bench Pro,最强也才 ~69%——中间那 30 分,就是模型能力和真实交付之间的鸿沟。教育端更直白:Khanmigo 铺进了 1.5 万所学校、5 百万用户,但只有 15% 的人经常用,严谨的随机对照结果还没出来。铺得广,不等于学得好。

真正在赚钱、在涨星的,全是『把能力嵌进一个具体流程』的东西:Strix 不谈通用智能,只干渗透测试这一件脏活,涨到 4.5 万星;PixelRAG 不追更大模型,只把网页当截图去检索,两个月 8 千星;一个独立开发者盯着『物理治疗诊所的保险预授权』这一个无聊到没人想碰的工作流,14 个月做到 $41K MRR。Glaze 则把『描述一句话→生成一个原生 Mac app』做成了产品,软件生产的门槛又降了一截。

对个人的启示很统一:别把注意力放在『哪个模型最强』上,那是实验室的比赛;把注意力放在『哪个具体、脏、无聊、已经有人付钱的工作流,还没被 AI 好好接管』。能力已经过剩,稀缺的是愿意钻进某个垂直缝隙、把最后一公里跑通的人。顺带提醒一句:当 agent 开始拥有持久记忆,记忆本身也成了新的攻击面(见今天的 FARMA 论文)——落地越深,越要把安全一起想进去。

今日新增 5
#01
morphllm.com Article
NEW

编码榜的另一半真相:SWE-bench Verified 快饱和了,但换到更难的 Pro,天花板骤降到 ~69%

昨天的信号是 Opus 5 把 SWE-bench Verified 刷到 97%、前三挤在两分内——榜快饱和了。但饱和的只是『Verified』这一档。SWE-bench Pro 用的是更长、更真实、还带商业闭源仓库的任务,同一批模型换到这里,成绩集体跳水 15–35 分:Opus 4.8 以 69.2% 领跑活跃模型,Gemini 3.1 Pro 62.3%(落后约 6.9 分),GPT-5.5 掉到约 58.6%;到了纯闭源商业代码那一档,没有任何模型超过 ~47%。同一批『接近满分』的模型,一碰真实企业代码就露馅。这提醒我们:看单一榜单选模型会严重高估它的真实交付能力。
#评测
另有 2 家信源报道
展开详情
  • **对比**:SWE-bench Pro 上 Opus 4.8 69.2% vs Gemini 3.1 Pro 62.3% vs GPT-5.5 ~58.6%(活跃模型口径),闭源商业代码档最高仅 ~47%
  • **落差**:同一批模型从 Verified 换到 Pro 普遍掉 15–35 分——Verified 的 97% 是『会做的题』,Pro 才更接近『你司真实仓库』
  • **怎么选**:日常改 bug、补函数选性价比高的即可;真要它独立啃陌生大仓库/长任务,优先当前 Pro 榜靠前的 Opus 4.8,且务必人工兜底 review
推荐理由:对普通开发者最实用的一课:别拿 Verified 榜首的 97% 去想象它在你项目里的表现。选模型时,找一个和你真实工作最像的基准(长任务、多文件、闭源风格)去看排名,甚至用自己仓库里几个真 issue 手动实测三家——这套『按场景挑基准』的判断力,比记住谁是榜首值钱得多。
#03
GitHub Repo
★ 8.3k NEW

StarTrail-org/PixelRAG

PixelRAG 出自 Berkeley SkyLab / BAIR / Berkeley NLP,是论文《Web Screenshots Beat Text for RAG》的官方实现,两个月涨到约 8.3k 星。它的核心反直觉:不再把网页解析成文本再检索,而是把文档(网页、PDF、图片)整页渲染成截图,直接在图像上做检索——那些被 HTML 解析丢掉的表格、图表、信息图和版式关系,在截图里全都留住了。项目 Apache-2.0 全开源,还给了个诚意十足的开箱包:把维基百科 828 万篇文章做成预构建索引、提供无需 API key 的托管公开接口、附上 FAISS 索引和 Hugging Face 上的 LoRA 适配权重。对『文档结构一复杂 RAG 就失真』的老问题,是个换角度的解法。
#Infra#Python
另有 2 家信源报道
展开详情

像素原生的视觉 RAG:把网页/PDF/图片当截图直接检索,保住表格、图表和版式。

周增长:2026-05 创建,约两个月 8.3k 星(均值 >1k/周),周增以 star-history 实时为准

  • **思路**:把文档当截图检索而非先转文本,表格/图表/版式这些『被解析丢掉的信息』被完整保留
  • **开箱**:维基 828 万篇预构建索引 + 无需 key 的托管接口 + FAISS 索引 + HF 上的 LoRA 权重,Apache-2.0
  • **背书**:Berkeley SkyLab/BAIR/NLP 出品,v0.3.0 已发,属于有论文支撑的一手实现而非包装
推荐理由:如果你在做知识库问答、企业文档检索,值得亲手比一次:同一批带复杂表格/图表的 PDF,文本 RAG vs PixelRAG 的召回差多少。视觉检索正在成为 RAG 的一条新主线,早点上手『多模态检索』这个技能点,比继续在纯文本切块调参上内卷更有杠杆。
#05
raycast.com Product
NEW

Glaze by Raycast:描述一句话,生成一个能进 Dock 的原生 Mac app

Raycast 在 7 月初把 Glaze 正式放出(3 月起内测),上线即拿下 Product Hunt 当日第一(24 小时 574 赞)。它把『描述→原生桌面 app』做成了产品:你用大白话说想要什么,它生成一个真正能进 Dock、秒开、可离线、能用键盘快捷键/菜单栏/后台任务的原生 Mac 应用,之后还能继续用自然语言实时改。更有意思的是它带商店——公开商店加团队私有商店,找到接近的直接装、再微调;Raycast 自己的支持和销售就跑在用 Glaze 搭出来的 app 上。它代表的方向很明确:内部小工具、个人效率 app 的生产成本,正在被压到『说句话』的量级。
#AI App#免费档可建可用;付费约 $2…
另有 2 家信源报道
展开详情
  • **产物**:不是网页壳,而是能进 Dock、可离线、支持快捷键/菜单栏/后台任务的原生 Mac app
  • **分发**:公开商店 + 团队私有商店,装现成的再用自然语言微调,Raycast 自家业务已跑在上面
  • **门槛**:免费即可搭可用,约 $20/月解锁更多用量与分享,个人做内部工具几乎零成本
推荐理由:过去『做个小工具』要会写代码、要打包、要维护,现在门槛塌到一句话。对普通人这是实打实的机会:把你团队里那些还在用 Excel + 手工凑合的小流程,一个个变成顺手的原生小 app。会把『真实痛点』翻译成『一句清晰的 app 描述』的人,正在获得不写代码也能造工具的能力。
#06
skillademia.com Article
NEW

教育 AI 落地实测:Khanmigo 铺进 1.5 万所学校、5 百万用户,但只有 15% 常用、严谨结论仍未出

把教育 AI 最出圈的样本 Khanmigo 拉出来看真实数据,会比宣传冷静很多。规模确实大:2025 年已达 5 百万用户、铺进 1.5 万+ 所学校。但两个数字值得盯:一是使用率——有权限的学生里只有约 15% 经常用;二是证据——截至 2026 年,仍没有针对 Khanmigo 的同行评审研究能证明它切实提升学习成果,由 J-PAL 和多伦多大学在加拿大 6–8 年级课堂做的随机对照实验,结果预计 2026 年中才出。小样本测试有正向信号(12 人的小测里数学 +23%、科学 +18%,另有 Stanford 背书的 1.8 倍掌握速度),但样本太小只能当参考;更靠谱的是 2025 年一项 RCT 显示 AI 辅导相对课堂主动学习效应量达 0.73–1.3 个标准差——潜力真实,但『铺得广』和『学得好』之间隔着使用率和流程设计。
#行业应用
另有 2 家信源报道
展开详情
  • **规模 vs 使用**:5 百万用户、1.5 万+ 学校,但有权限的学生只有约 15% 经常用——铺开 ≠ 用起来
  • **证据**:至今无针对 Khanmigo 的同行评审成效研究,J-PAL/多大 RCT 结果要等 2026 年中
  • **潜力**:2025 年一项 RCT 显示 AI 辅导相对主动学习效应量 0.73–1.3 个标准差,天花板确实高
推荐理由:教育 AI 的赢点,和其他行业一样,不在『用了多强的模型』,而在『有没有解决使用率和融入流程』。对做教育产品或想在教培里用 AI 的人,真正的护城河是把 AI 卡进老师和学生每天已有的动作里、让人愿意反复用,而不是发一个没人打开的强大工具。别被『铺了多少学校』的大数字带偏,盯『日活和留存』。
#07
foundra.ai Article 值得关注
NEW

一个人盯『物理治疗保险预授权』这件无聊活,14 个月做到 $41K MRR

一个首次创业的独立开发者,没有合伙人、没融资,只做一件事:给物理治疗诊所自动化『保险预授权提交』这个又琐碎又必须做的活。14 个月做到 $41K MRR,年二有望冲 $500K ARR,而模型账单每月压在 $4K 以内。打法极度克制——只服务一类客户(PT 诊所)、只干一个工作流、把一件无聊事做到人工十分之一的成本。商业模式也做实了:第 9 个月起转 12 个月年签,带 60 天上线条款和每月 100 单的用量下限,单个客户年合同约 $11,800,把『天天要防流失』的拉扯变成『每季度续约』的节奏。它是『垂直无聊工作流 + 单人运营』这条现金流路子的教科书案例。
#小微现金流
另有 1 家信源报道
展开详情
  • **数字**:单人 14 个月 $41K MRR,模型成本 <$4K/月,年二目标 $500K ARR,单客户年签约 $11,800
  • **克制**:一类客户 + 一个工作流 + 一件无聊事,做到人工成本的十分之一,不铺品类
  • **收费**:第 9 月转年签 + 60 天上线条款 + 每月 100 单用量下限,把留存压力变成季度续约
推荐理由:对想靠 AI 挣现金流的普通人,这是最实在的模板:不要做通用工具,去找一个『合规/保险/行政』里被手工拖累、又天天必须做的垂直工作流,把它自动化到人工十分之一成本。这类活无聊、没人想碰、切换成本高,恰恰最适合单人长期收租。关键动作——先锁死一类客户和一个流程,跑通再谈扩张。
My Take:评分(5=最优):最快成交 3 / 最低成本 4 / 可复制 3 / 风险安全度 3。医疗合规垂类,慢热但粘性极高、年签续费稳,适合能沉住气啃一个流程的单人玩家。
商机信号(加速):谁付钱:被保险预授权手工提交拖垮的物理治疗/康复类诊所(可推广到牙科、影像、专科门诊等所有吃保险流程的小诊所) 痛点:预授权提交琐碎、重复、还必须做,人工慢且贵,漏一单就影响收款,诊所前台被这类行政活占满 切入点:挑一个被保险/合规流程拖垮的具体诊所类目,先只做『一个流程』做到人工十分之一成本,用年签+用量下限锁定现金流,跑通一个类目再横向复制到相邻科室
仍在热榜 3
Repo usestrix/strix 在榜 3d 开源的 AI 渗透测试 agent:像真人安全研究员一样动态测应用、验证漏洞并给出 PoC。 DevTools
Paper Your Agent's Memories Are Not Its Own: Forged Reasoning Attacks on LLM Agent Memory and Defenses 在榜 2d 持久记忆让 agent 能存下事实、历史决策、推理过程和工具使用记录,但这篇论文指出:记忆也因此成了投毒目标。作者提出 … AI Agent
Repo obra/superpowers 在榜 4d 用一叠 Markdown 技能把整套软件开发方法论固化下来,让 agent 像资深工程师那样按流程干活。 Skills · 编程开发
7月30日 周四 · 10 条
今日趋势综述
Opus 5 以对折价格把前沿模型拉到人人可用、编码榜单挤在两分内接近饱和;今天真正的机会不在追下一个模型,而在围着便宜的强模型做记忆、技能、落地和现金流的那一层。
今天的信号:模型变便宜变多,稀缺的是『围着模型做东西』的人

今天最硬的一条新闻是 Anthropic 发布 Claude Opus 5——不到两个月里的第四个模型,价格和 Opus 4.8 持平($5/$25 每百万 token),却把前沿智能拉到了 Fable 5 一半的输入价。配合评测那条看:SWE-bench Verified 榜前三名 Opus 5、GPT-5.6 Sol、Fable 5 已经挤在 95–97 分这两分之内,编码这个最被引用的基准正在饱和;而换到 LiveCodeBench,冠军又变成 Gemini 3 Pro Preview。两件事合起来说的是同一句话:最强的模型正在变便宜、变多,单靠『我用了最强模型』或『我榜上第一』越来越不值钱了。Relay-Bench 那篇论文更是当头一棒——同一个前沿模型在单领域任务能拿 82.7%,一旦要把多个领域的推理串起来就掉到 43.3%,说明榜单分数和真实综合能力之间还有一道大裂缝。

#01
anthropic.com Article
NEW

Anthropic 发布 Claude Opus 5:前沿智能对折价,$5/$25 不涨价却比 Fable 5 便宜一半

Anthropic 在 7 月 24 日发布 Claude Opus 5——这是它不到两个月里推出的第四个模型(前面还有 Mythos 5、Fable 5、Sonnet 5)。定位是『会自我验证、反复迭代直到把编码和知识工作做对』的前沿模型,成为 Claude Max 的默认模型、Claude Pro 上最强的可选项,API 名为 claude-opus-5,带 1M 上下文和 low/medium/high 三档 effort 开关。关键不是它又刷新了几个榜,而是价格:$5/百万输入、$25/百万输出,跟上一代 Opus 4.8 持平,却把接近 Fable 5 的前沿智能做到了后者一半的输入价($5 vs $10)。前沿能力正在肉眼可见地变便宜。
#LLM/Model
另有 2 家信源报道
展开详情
  • **价格**:$5/$25 每百万 token,与 Opus 4.8 持平不涨价,却把近 Fable 5 级别的智能做到其输入价的一半($5 vs $10)
  • **成绩**:官方口径 SWE-bench Pro 约 79.2%、SWE-bench Verified 约 96%,1M 上下文,成为 Claude Max 默认模型
  • **节奏**:两个月内第四个模型——前沿模型的发布频率和降价速度,都在把『用最强模型』这件事变成人人可及的日常
推荐理由:对个人:前沿模型正在快速降价,这对你是纯利好——一年前只有大厂用得起的能力,现在几十美元就能大量调用。别再把预算和注意力花在『追哪个模型最强』上,那一层已经商品化了。真正该做的是趁能力变便宜,赶紧把它接进一个你熟悉的具体场景里跑出价值。谁先把便宜的强模型用出真实成果,谁就占了这波红利。
#02
llm-stats.com Article
NEW

编码榜快饱和了:Opus 5 登顶 SWE-bench Verified,但前三挤在两分内,换个榜冠军又变 Gemini

Opus 5 一上线就登顶最常被引用的 agentic 编码基准 SWE-bench Verified,但『登顶』的含金量正在缩水——前三名已经挤在两分之内,榜接近饱和。换一个同样考编码的基准,冠军又完全不同:在 LiveCodeBench(持续收新题、抗训练污染的实时编码榜)上,登顶的是 Gemini 3 Pro Preview,开源的 DeepSeek 也咬得很紧。结论很实在:编码这块已经没有哪个模型通吃,选型要看你的活到底考哪一项,而不是盯着某个总榜第一。
#评测
另有 2 家信源报道
展开详情
  • **对比**:SWE-bench Verified(vals.ai,7/22)Claude Opus 5 97.0 vs GPT-5.6 Sol 96.2 vs Claude Fable 5 95.0——前三挤在 2 分内,榜接近饱和
  • **换榜换王**:LiveCodeBench(约 7/24)Gemini 3 Pro Preview 91.7 vs Gemini 3 Flash Preview 90.8 vs DeepSeek V3.2 Speciale 89.6——冠军换成了 Gemini
  • **方法**:不同榜差异来自评测方法与收题方式(如 LiveCodeBench 持续收新题抗污染),同一模型在不同聚合站分数也有 96–97 的浮动,别把单个小数点当真理
推荐理由:对开发者:当榜首挤在两分之内、还随榜易主时,『追第一』基本没意义了。更聪明的做法是先想清你的活考哪一项——纯改真实仓库 issue,SWE-bench Verified 这类更贴近,Opus 5 目前占优;要抗污染的实时算法/竞赛类编码,看 LiveCodeBench,Gemini 更强、DeepSeek 更便宜。再叠加价格和延迟按场景选型,比迷信总榜第一靠谱得多。
#03
arXiv Paper
NEW

Relay-Bench: Evaluating LLMs on Multi-Domain Reasoning Chains

Relay-Bench 是一个抗污染、尚未饱和的纯文本基准:它把视觉推理、编码、数学、网络检索取信息、问题求解、通用知识、数据分析等不同领域的 2–13 个子问题串成一道组合题,逼模型在一条链里跨领域连续推理,且允许它自由用代码执行、联网搜索和所有工具。结果很扎眼:领跑的 GPT-5.5(xHigh)只拿到 43.3%,而同一模型在主流单项 agentic 测试上能到约 82.7%——一旦要把多个领域的推理接力串起来,能力直接掉了近 39 个百分点。
用『把多个单领域子问题串成一条链』的组合题,暴露出前沿模型『单项很强、串起来就崩』的巨大落差,直接动摇了『榜单登顶=真实综合能力强』的默认叙事。
#AI Agent
另有 1 家信源报道
展开详情
  • **落差**:GPT-5.5 单项 agentic 约 82.7%,到 Relay-Bench 跨领域链只剩 43.3%——同一模型掉了近 39 个点
  • **设计**:每题由 2–13 个不同领域子问题串成,纯文本、无需多模态输入输出,且明确鼓励用代码执行/联网/工具,考的是『串起来会不会崩』
  • **意义**:抗污染、未饱和——正好补上 SWE-bench 这类快饱和榜单的盲区,说明『榜单第一』和『真实综合能力』之间还有一道大裂缝
推荐理由:对个人:这篇给了一个特别值钱的判断——模型在你交给它的单个环节上可能很强,但把一长串跨领域步骤丢给它一次做完,它就容易崩。这正是你搭 agent 时该做的事:别指望一个大提示让模型端到端搞定,而要把复杂任务拆成一个个单领域的可靠环节,中间加校验和交接。会拆链路、会在环节之间做检查的人,能把今天的模型用出远超榜单分数的可靠性。
#04
GitHub Repo
★ 2,100 NEW

kvcache-ai/AgentENV

AgentENV 来自以 KTransformers 出名的 kvcache-ai 团队,7 月 23 日创建,六天冲到约 2.1k 星(>300/天)。它想解决的是 agent 时代一个越来越明显的工程瓶颈:训练和服务成千上万个 agent 时,怎么把它们各自的执行环境(沙箱、工具、状态)标准化地、高吞吐地跑起来。用 Rust 写,定位是 agentic RL 训练的基础设施层,而不是又一个 agent 框架。
#Infra#Rust
展开详情

一个用于大规模运行 agent 执行环境的分布式平台,主打为 agentic 强化学习训练提供标准化、高吞吐的沙箱/运行时底座。

周增长:7 月 23 日创建,6 天约 2.1k 星(>300/天),周增以 GitHub Trending / star-history 实时为准

  • **速度**:7/23 创建、6 天约 2.1k 星(>300/天),KTransformers 原班系统团队背书,可信度高
  • **定位**:不是 agent 框架,而是底层——大规模运行 agent 执行环境的分布式平台,专为 agentic RL 训练设计
  • **信号**:用 Rust 做高吞吐运行时,说明『怎么把海量 agent 环境跑起来』已经成了独立的基础设施品类
推荐理由:对个人:当『训练/服务海量 agent 的环境』都值得单独做一个平台时,说明 agent 的竞争正从模型下沉到基础设施。你不一定要造这层,但要读懂信号——agent 时代的新岗位和新生意,很多藏在『让 agent 能大规模、稳定地跑起来』的工程里。懂分布式、沙箱、运行时的人,在这波里会越来越抢手。
#05
GitHub Repo
★ 869 NEW

VictorTaelin/OptMem

OptMem 出自 HVM/Bend 的作者 Victor Taelin,7 月 25 日发布,四天约 869 星。它的卖点是极端极简:用一个 426-token 的提示 + 一个脚本,就给 agent 加上跨会话的永久记忆,靠 append-only 日志和树状分层摘要来组织,命令就 `memo wake / note / recall` 几个,数据存在本地 `~/.optmem/memory/`。没有向量库、没有嵌入服务、没有一堆基础设施——用最小的东西把『记忆』这件事跑通。
#AI Agent#Python
展开详情

给 AI agent 装『永久记忆』的极简方案:一个 426-token 的提示加一个脚本,即插即用,不需要重型向量数据库。

周增长:7 月 25 日创建,4 天约 869 星(>200/天),周增以 star-history 实时为准

  • **极简**:426-token 提示 + 一个脚本即插即用,append-only 日志 + 树状摘要,无需向量库/嵌入服务
  • **作者**:Victor Taelin(HVM/Bend 作者)出品,四天约 869 星,本身就是关注度背书
  • **取舍**:用最小复杂度换够用的持久记忆——和动辄上一整套 RAG 栈的方案形成鲜明对照
推荐理由:对个人:这是『少即是多』的极好范例——很多人一提 agent 记忆就上向量库、嵌入、检索一整套,OptMem 证明一个精心设计的提示加脚本就能把 80% 的需求跑通。启发在于:动手前先问『最小可行方案是什么』,别一上来就堆基础设施。能用最简单的东西解决真问题,比会搭复杂系统更稀缺、也更容易被人记住。
#06
GitHub Repo
★ 2,600 NEW

isjiamu/gzh-design-skill

gzh-design-skill 精准解决中文创作者的高频痛点:写好的 Markdown 粘进公众号后排版全乱。它把『Markdown → 公众号可直接粘贴的 HTML』这一个具体动作封成 Agent Skill,内置 6 套精选主题、一个主题生成器,还加了双重校验闸门保证产出干净,累计约 2.6k 星,并登上 Trendshift 趋势榜。它没做什么大而全的平台,就是把一件小事做到可靠、可复用、跨 Claude Code/Codex/Cursor 可移植。
#Skills#内容创作#HTML
另有 1 家信源报道
展开详情

一个把 Markdown 一键转成可直接粘进微信公众号编辑器的排版 HTML 的 Agent Skill,自带 6 套主题、主题生成器和双重校验。

周增长:近期登上 Trendshift 趋势榜、增长强劲,具体周增以实时榜为准

  • **痛点**:专治『Markdown 粘进公众号排版就崩』,6 套主题 + 主题生成器 + 双重校验,产出即粘即用
  • **热度**:约 2.6k 星并登上 Trendshift,是本季最出圈的中文向 Skill 之一
  • **范式**:不做大平台,把一个具体动作封成可复用、跨 agent 可移植的技能——这正是 skills 生态跑通的样板
推荐理由:对个人:这是 Skills 变现最接地气的模板——挑一个你所在圈子天天犯、又很烦的小事(公众号排版、某种报告格式、某类数据清洗),把它打磨成一个开箱即用、产出可靠的技能。不需要多前沿的技术,赢在『解决得够专、够干净』。会把细分痛点封成好技能的人,正在 skills 生态里攒下自己的名气和被动收入入口。
商机信号(萌芽):谁付钱:要日更公众号、又被排版反复折磨的自媒体作者、运营和中小团队 痛点:写作在 Markdown、发布在公众号,中间排版反复手工调,既费时产出还不稳定 切入点:锁定一个具体平台/格式的『最后一公里排版』痛点,做成产出即用、跨 agent 可移植的高质量技能,先靠一个场景做深再扩品类
#07
GitHub Repo
★ 1,100 NEW

makecindy/cindy

cindy 走的是和一堆 agent 框架相反的路线——它不是给你搭积木的框架,而是一个装好就能用的成品 App。7 月 22 日创建、约 1.1k 星,用 TypeScript 写成 pnpm monorepo(Electron 桌面 + React Native 移动端),本地运行、整合多模型多工具,还兼容 Claude Code、Codex 等多种 harness,Apache-2.0 开源、双语、对新手友好。定位是一个人人可上手的个人 agent,而不是又一个需要你自己拼装的开发者玩具。
#AI App#TypeScript
展开详情

一个开箱即用的开源 AI agent 成品应用,跨 iOS/安卓/桌面/浏览器,整合多模型多工具,本地运行,主打『想到就能做到』。

周增长:7 月 22 日创建,约 1.1k 星(>150/天),周增以 GitHub Trending / star-history 实时为准

  • **成品化**:开箱即用而非框架,跨 iOS/安卓/桌面/浏览器,本地运行、整合多模型多工具
  • **工程**:TypeScript + pnpm monorepo(Electron + React Native),兼容 Claude Code/Codex 等 harness,Apache-2.0 开源
  • **热度**:7/22 创建、约 1.1k 星(>150/天),双语、对新手友好,主打『想到就能做到』
推荐理由:对个人:agent 正在从『开发者拼积木的框架』走向『普通人下载就能用的成品 App』——这中间的产品化能力是巨大机会。能把复杂的 agent 能力包装成一个跨平台、装好即用、对小白友好的东西,比又写一个框架有价值得多。想做 AI 产品的人,重点该放在『把能力做成人人能用的成品』这件事上。
#08
GitHub Repo
★ 314 NEW

gavamedia/deltafin

deltafin 干了件看着不可能的事:在一台 Apple Silicon Mac(参考机是 64GB 的 M1 Max)上跑 2.8T 参数的 Kimi K3。做法是把 MoE 的专家按需流式载入本地磁盘缓存,配上 NEON 融合算子、Metal/MPS 计算,并暴露一个 OpenAI 兼容的服务端;也支持 x86-64/aarch64 Linux。7 月 28 日创建,两天约 314 星。星数还不高,但它代表的方向很硬——把万亿级前沿模型从『只能上云』拉到『你自己的笔记本上就能跑』。
#DevTools#Python
展开详情

让 2.8 万亿参数的 MoE 大模型 Kimi K3 在单台 Apple Silicon Mac 上跑起来——按需把专家流式载入本地磁盘缓存,配 NEON/Metal 融合算子和 OpenAI 兼容接口。

周增长:7 月 28 日创建,两天约 314 星,周增以 star-history 实时为准

  • **壮举**:在单台 M1 Max(64GB)上跑 2.8T 参数的 Kimi K3,靠专家按需流式载入磁盘缓存绕开显存墙
  • **工程**:NEON 融合算子 + Metal/MPS 计算 + OpenAI 兼容接口,Mac 与 Linux 都支持
  • **方向**:星数虽还不高(7/28 创建两天约 314 星),但把万亿级模型从『只能上云』拉到本地,是值得押注的趋势
推荐理由:对个人:本地跑大模型的门槛在被一点点砸开——今天能在一台 Mac 上跑万亿参数模型,意味着数据隐私敏感、想省 API 费、或要离线用的人,很快有真正可行的本地方案。懂量化、懂专家流式加载、懂在消费级硬件上榨性能的人会越来越值钱。盯住『本地推理』这条线,它是绕开云端成本和隐私顾虑的一整片机会。
#09
ports.marinelink.com Article
NEW

物流 AI 落地实测:DHL 全欧铺开 AI 动态选路,关键航线时效压缩 10–15%

2026 年 1 月,DHL Global Forwarding 宣布其自研的 AI 动态选路平台已在全欧网络铺开。系统实时吃进天气、港口拥堵、清关时长、承运商表现等数据,动态为空运/海运货挑最优且更省的路线,并主动绕开瓶颈重新规划。官方口径是关键航线时效可压缩 10–15%,同时明显降低燃油消耗与温室气体排放,提升服务可靠性;下一步计划年内向全球扩展。它赢的不是用了最强模型,而是把优化能力嵌进了『每一票货今天到底该怎么走』这个具体决策里。
#行业应用
另有 1 家信源报道
展开详情
  • **数字**:关键航线运输时效预计压缩 10–15%,燃油消耗与温室气体排放同步下降,首批区域数月内达到正 ROI
  • **做法**:实时融合天气/港口拥堵/清关时长/承运商表现,动态选路 + 主动绕瓶颈重规划,而非静态排线
  • **打法**:不追大模型,把优化嵌进『每票货怎么走』的具体运营决策——全欧先跑通,再向全球扩展
推荐理由:对个人:物流、货代、供应链这类『不性感』的传统行业,恰恰是 AI 见真金白银最快的地方——时效和油耗省下的都是硬钱。你不需要会训模型,需要懂这个行业的数据长什么样、卡在选路/清关/排箱哪一步。会把现成的优化/预测能力接进某个具体物流环节的人,比会跑 benchmark 的人稀缺得多,也更好变现。
#10
indiehackers.com Product 直接可用
NEW

Superpower ChatGPT:骑在 ChatGPT 流量上的一个 Chrome 插件,做到五位数月收入

ChatGPT 刚火时,Saeed Ezzati 花一个周末给自己做了个 Chrome 插件,补上 ChatGPT 原生缺的那些工作流功能(提示管理、文件夹、导出等),成了 Chrome 商店里第一个 ChatGPT 插件。此后靠『骑在别人流量上』把它滚成一整套生意:Superpower ChatGPT 累计 42 万+ 下载、15 万周活,配套的 Superpower Daily 邮件通讯 35 万订阅,整体做到五位数月收入。一个人、几天起步,护城河就是『第一个上、且死磕 ChatGPT 重度用户缺的那一个功能』。
#小微现金流#免费增值 Chrome 插件…
另有 2 家信源报道
展开详情
  • **成绩**:单人做到五位数 MRR,插件 42 万+ 下载、15 万周活,配套通讯 35 万订阅
  • **打法**:骑在 ChatGPT 的巨大流量上做增强插件,补官方没做的重度用户工作流功能——分发几乎零成本
  • **先发**:Chrome 商店第一个 ChatGPT 插件,靠『第一个上 + 死磕一个刚需功能』建立壁垒
推荐理由:对想挣现金流的普通人:最快的分发不是自己从零拉用户,而是骑在一个已经有海量用户的 AI 平台上,补它没做好的那一个高频功能。ChatGPT、Claude、各类 AI App 的原生体验都有缺口,一个小插件、一个月费几美元,就可能滚成一门实打实的生意。关键是先发 + 死磕一个刚需,别贪大。
My Take:评分(5=最优):最快成交 4 / 最低成本 5 / 可复制 3 / 风险安全度 3。骑在成熟平台流量上补刚需功能,是单人零预算起量最快的路径之一;风险在平台政策与被官方吸收。
商机信号(加速):谁付钱:每天重度使用 ChatGPT 的写作者、营销、开发者等,愿意为官方没做的效率功能付月费 痛点:原生 ChatGPT 缺提示管理、文件夹、导出等工作流工具,重度用户天天被这些缺口卡住 切入点:挑一个有海量用户的 AI 平台,做一个补齐其某项高频缺失功能的浏览器插件,先免费获量再转付费订阅,靠先发和分发红利起量
7月29日 周三 · 8 条
今日趋势综述
从农田到企业交付,今天的信号都指向同一件事:AI 的胜负手不在模型本身,而在把它接进真实流程、真实数据、真实客户的『最后一公里』。
今天的信号:赢家都在抢『最后一公里』,不是抢模型

把今天的条目连起来看,会发现一条很清楚的主线:几乎没有一条是靠『我们用了最强的模型』赢的。农业里 Church Brothers 用需求预测把短期预测准确率提升 40%,靠的是把 AI 嵌进易腐货的补货流程;企业交付端,Palantir 那套被 Anthropic、OpenAI 抄作业的 FDE 打法,核心是『按管道额度配人、驻场 8–16 周、上线第一天就交东西』;连接层的真正瓶颈,从模型能力变成了『怎么把本地系统安全地接给云端 agent』——MCP gateway 就是冲这个缝隙长出来的一整个品类。评测那条更直白:Terminal-Bench 上 GPT-5.5 领先,可换到 MCP Atlas 工具调用榜,冠军就变成了 Gemini 3.5 Flash。没有哪个模型通吃,选型的功夫全在『你的活到底考哪一项』。

#01
info.throughput.world Article
NEW

农业需求预测落地实测:Church Brothers 把易腐货短期预测准确率提升 40%,赢在把 AI 嵌进补货流程

美国家族农业公司 Church Brothers Farms(年种 4 万英亩、发运 5000 万箱、400+ SKU、6 万+ 车次)用 ThroughPut AI 的需求预测软件,把易腐蔬菜的短期需求预测准确率提升最高 40%,并在订单履约时效、路由决策上同步改善,明显压低了超额库存与损耗。它没有换什么最强大模型,赢点是把预测能力接进『今天该给哪个客户备多少货』这个具体环节——对易腐品,早一天预测准就少一车烂菜。
#行业应用
另有 2 家信源报道
展开详情
  • **数字**:短期需求预测准确率最高提升 40%,SKU 级需求可见性显著改善,超额库存与损耗一起下降
  • **规模**:4 万英亩、5000 万箱/年、400+ SKU、6 万+ 车次的真实体量,不是 demo 级样本
  • **打法**:不追大模型,把预测嵌进易腐货补货与路由流程——早一天预测准,就少一车报废
推荐理由:对个人:农业、生鲜、冷链这类『不性感』的行业,恰恰是 AI 落地最容易见到真金白银的地方——损耗和库存就是白花花的钱。你不需要会训模型,需要懂这个行业的数据长什么样、卡在补货/排产/路由哪一步。会把现成预测/优化能力接进某个具体行业流程的人,比会跑 benchmark 的人更稀缺,也更好变现。
#02
indiehackers.com Product 直接可用
NEW

Meerkats.ai:一个人四周做到 $3k MRR 的 AI 增长编排平台,把 SDR/营销/代理的重复活打包成软件

有 20 年 SaaS go-to-market 经验的 Santanu Dasgupta,做了个叫 Meerkats.ai 的『AI 增长编排平台』——把 SDR、营销和外包代理常干的重复活(抓取和补全关系数据、找线索、跑触达、跟进)用软件替掉,相当于把一间数字增长代理公司塞进一个订阅产品里。一个人、在拥挤的赛道里,发布四周就做到 $3k MRR。它的样本价值不在技术多新,而在证明:把你最懂的那套业务流程编排成 AI 产品,是当下最快的现金流路径之一。
#小微现金流#订阅制 SaaS,具体档位见…
另有 1 家信源报道
展开详情
  • **成绩**:单人、四周、$3k MRR,赛道拥挤仍跑通——不是靠新模型,是靠把一套熟悉的增长流程产品化
  • **切口**:替掉 SDR/营销/代理的重复劳动(找线索、补数据、跑触达、跟进),卖给最痛这块的中小团队
  • **壁垒**:创始人 20 年 GTM 经验本身就是护城河——他知道每一步该编排成什么,比通用工具更贴业务
推荐理由:对想挣现金流的普通人:最快变现的不是最新技术,是『你已经很懂的那套流程 + AI 编排 + 订阅收费』。找一个你亲手做过、别人还在手动重复的工作流(招聘、催收、排班、外联……),把它做成一个能自己跑的小产品,一个人四周就可能起量。领域知识是你相对大厂的真壁垒。
My Take:评分(5=最优):最快成交 4 / 最低成本 4 / 可复制 3 / 风险安全度 4。用你最懂的业务流程做 AI 编排,是单人变现最快的路径之一。
商机信号(加速):谁付钱:没钱养整支 SDR/营销团队、又要持续找线索跑增长的中小 SaaS 与服务型创业者 痛点:增长动作全是重复手工活(找人、补数据、发触达、跟进),外包代理贵、内部又雇不起团队 切入点:挑一个你自己做过的细分增长流程(如某垂类的冷启动外联),做成能自动跑的订阅小工具,靠领域 know-how 做出比通用工具更准的编排
#03
llm-stats.com Article
NEW

评测该看哪一榜:Terminal-Bench 上 GPT-5.5 领先,换到 MCP Atlas 工具调用榜冠军就变成 Gemini 3.5 Flash

同样是『考 agent 会不会干活』,不同基准给出的冠军完全不同。Stanford + Laude 的 Terminal-Bench 2.0 考命令行终端掌控力,GPT-5.5 以 82.7% 登顶;而 Scale 的 MCP Atlas 考通过 MCP 协议做真实工具调用,冠军换成了 Gemini 3.5 Flash(83.6%),Claude Opus 4.7 在这一项是 77.3%。结论很实在:没有一个模型在所有『agent 能力』维度上通吃,选型前得先弄清你的活到底考哪一项。
#评测
另有 2 家信源报道
展开详情
  • **对比**:Terminal-Bench 2.0 上 GPT-5.5 82.7% vs Gemini 3.5 Flash 76.2%;但换到 MCP Atlas 工具调用榜,Gemini 3.5 Flash 83.6% vs Claude Opus 4.7 77.3%
  • **分野**:终端掌控(跑命令、修环境)和 MCP 工具调用是两种能力,冠军互不重合,别用一个分数概括『谁更会当 agent』
  • **方法**:Scale 今年把 MCP Atlas 评分判官升级、加了瞬时错误重试、把 20 轮上限改成每任务最多 100 次工具调用预算——评测本身也在往真实场景靠
推荐理由:对开发者:选 agent 底座别只看一个总榜。如果你的场景是命令行/CI/环境操作,优先看 Terminal-Bench 类分数,GPT-5.5 目前占优;如果核心是走 MCP 调一堆外部工具、长链路任务,Gemini 3.5 Flash 在 MCP Atlas 上更强且便宜。先想清『我的活考哪一项』,再按那一项的榜单选,比追总榜首靠谱得多。
#04
arXiv Paper
NEW

Tool-Making and Self-Evolving LLM Agents in Low-Latency Systems

这篇论文针对一个很实际的痛点:agent 在推理时反复即兴写代码(inference-time coding loop)既慢又不稳。它提出一条『造工具』的流水线——把反复出现的标准操作步骤(SOP)提前编译成经过验证、带版本的工具,部署前就固化好,运行时直接调用而不是每次重新生成。本质是把 agent 从『每次现编』升级成『会沉淀可复用工具的自进化系统』,特别适合对延迟敏感的生产环境。
把『agent 每次都临场写代码』换成『提前把重复步骤编译成可复用工具』,为低延迟场景下的 agent 工程给出一条可落地的路子。
#AI Agent
展开详情
  • **问题**:推理时反复即兴写代码的循环,既拖慢延迟又难保证正确性,是生产 agent 的隐性成本大头
  • **方法**:把重复的 SOP 步骤离线编译成经验证、带版本的工具,部署前固化,运行时直接调用
  • **意义**:给『self-evolving agent』一个工程化定义——不是越跑越玄,而是把跑过的经验沉淀成可复用、可审计的工具库
推荐理由:对个人:这篇给了一个可迁移的工程直觉——好的 agent 不该每次都从零现编,而该把做过的事沉淀成可复用工具。你自己搭 agent 时也一样:与其堆更长的提示,不如把高频动作固化成稳定的工具/脚本,既快又可控。『把经验编译成工具』的能力,正在成为 agent 工程的核心手艺。
#05
getmaxim.ai Article
NEW

真正的瓶颈从模型变成了连接:MCP Gateway 正长成 agent 时代的新基础设施品类

2026 是『AI 真正动手干活』的一年,而动手就需要把云端的 agent 大脑安全地接到本地数据库、脚本、CI/CD。业内的共识是:真正的瓶颈已经从模型能力,变成了连接——怎么把本地 MCP server 稳定暴露给云端 agent,不掉会话、不留鉴权口子。MCP Gateway 就是冲这个缝隙长出来的品类:把鉴权、工具路由、可观测性、治理收进 agent 与工具之间的一层控制面。Gartner 甚至预测多数 API 网关厂商会把 MCP 能力纳进来。与此同时治理落差仍在——一份 225 位安全/IT 负责人的调查显示,多数组织能看到 agent 在干什么,却在出事时拦不住它。
#Infra
另有 2 家信源报道
展开详情
  • **转向**:瓶颈从『模型够不够强』变成『本地系统怎么安全接给云端 agent』——连接成了新的硬骨头
  • **品类**:MCP Gateway 把鉴权/工具路由/可观测性/治理收进一层控制面;Gartner 预测多数 API 网关厂商将纳入 MCP 能力
  • **落差**:225 位安全/IT 负责人调查——多数组织能监控 agent,却在它出错时拦不住,治理仍是缺口
推荐理由:对个人:agent 从『会聊天』走向『会动手』,中间的连接层和治理层正在批量创造新岗位和新生意。学会用 MCP 把系统安全地接给 agent、并给它加上审计和熔断,是比调提示更抢手的新技能;而大厂的 gateway 往往只服务头部客户,帮中小团队『安全地把 agent 接进业务』这件事,个人和小团队完全切得进去。
商机信号(加速):谁付钱:想让 agent 碰内部系统、又怕鉴权失控和出事拦不住的中小企业与开发团队 痛点:把本地系统接给云端 agent 时会话易断、鉴权有口子,且缺少『出错能立刻拦停』的统一控制面 切入点:为某个垂类(如财务/客服系统)做轻量 MCP 接入 + 审计熔断的落地服务,帮买不起大厂 gateway 的团队安全上线 agent
#06
agensi.io Article
NEW

写 Agent Skills 也能变现:技能市场从 1 家涨到 8 家,创作者拿 80% 分成、按月订阅调用全目录

Agent skills 生态在半年里从『一个注册表』长成了八家主流市场。变现路径正在成型:以 Agensi 为例——每个 skill 上架前先过安全扫描,创作者拿 80% 分成,Pro 订阅用户 $9/月即可 MCP 实时调用整个目录;还有 SkillsMP 汇聚了 GitHub 上 200 万+ 公开技能、Netresearch 的市场则做成跨 Claude Code / Cursor / Copilot / Codex / Gemini CLI 等 30+ agent 可移植。信号很明确:『写一个好用、可复用的技能』本身正在成为一门能收费的手艺,而不只是自用脚本。
#Skills#元技能
另有 1 家信源报道
展开详情
  • **格局**:agent skills 市场半年从 1 家扩到 8 家,官方(anthropics/skills)+第三方(Agensi/SkillsMP/Netresearch)并存,生态在快速成型
  • **变现**:Agensi 创作者拿 80% 分成、上架先过安全扫描,Pro 用户 $9/月 MCP 实时调用全目录——技能开始有清晰的收费闭环
  • **可移植**:Netresearch 市场做成跨 Claude Code/Cursor/Copilot/Codex/Gemini CLI 等 30+ agent 可用,一次写、多端复用
推荐理由:对个人:写 Skills 正从『自用脚本』变成一门能卖钱的手艺。如果你在某个细分场景(某行业的取数、某种格式的文档处理)积累了可靠的工作流,把它打磨成一个安全、可复用、跨 agent 可移植的 skill 上架市场,就有了被动收入的入口。会把 know-how 封装成好技能的人,现在有了明确的变现渠道。
商机信号(萌芽):谁付钱:想省事、愿意为现成可靠技能付月费的 agent 重度用户与中小团队,以及靠分成变现的技能创作者 痛点:自己从零写和维护高质量 skill 成本高、质量参差,市场又缺乏安全审核与可移植标准 切入点:锁定一个你有真实 know-how 的细分场景,做几个安全、可复用、跨 agent 的高质量 skill 上架分成市场,先靠垂类深度而非数量取胜
#07
getperspective.ai Article
NEW

被 Anthropic、OpenAI 抄作业的 Palantir FDE 打法:按管道额度配人、驻场 8–16 周、上线第一天就交东西

这篇把 Palantir 那套被 Anthropic、OpenAI 直接抄作业的 FDE 打法压成了四条动作:每 200–500 万美元企业管道配 1 名 FDE、在单一客户处驻场嵌入 8–16 周、要求上线第一天就交付可用东西(拒绝需求文档表演)、并持续做对话式客户发现。它讲的不是『FDE 很缺人』这个结论,而是把『怎么组织和跑一支 FDE 队伍』的方法论掰开揉碎——核心是用交付节奏和贴身驻场,把模型能力真正压进客户的混乱业务里。
#FDE
另有 2 家信源报道
展开详情
  • **四招**:每 $2–5M 管道配 1 名 FDE、单客户驻场嵌入 8–16 周、上线第一天就交可用东西、持续做对话式客户发现
  • **反模式**:拒绝『需求文档表演』——不是先写长文档再开发,而是 day-one 就交东西、在真实反馈里迭代
  • **抄作业**:这套原是 Palantir 的打法,如今 Anthropic、OpenAI 都在复制——说明 AI 落地的组织方式正在收敛成一种范式
推荐理由:对个人:AI 落地最值钱的能力不是训模型,是『把模型能力压进客户混乱业务』的交付手艺。这套 FDE 方法论其实是一份可自学的清单——学会拆用例、评估数据/权限/治理就绪度、day-one 交付、贴身迭代。哪怕你不进大厂,把这套打法用在自己的外包/咨询/落地项目上,也能显著提高成单和交付质量。
#08
aiacceleratorinstitute.com Opinion
NEW

Andrej Karpathy

在 LLM agent 之上,正在长出新的一层——它把编排、调度、上下文、工具调用和持久化整体抬到下一个台阶。
据 AI Accelerator Institute 整理,Karpathy 近期用一段短文表达了对这层新抽象的兴奋:模型本身已不是最有意思的部分,真正的新战场是模型之上的编排与持久化层——谁来调度多个 agent、怎么管上下文、工具调用如何被组织、状态如何跨会话持久化。这和今天其他条目(MCP gateway、tool-making 论文、FDE 交付)其实指向同一件事:AI 的价值正在从『单个模型多聪明』转移到『模型之上那层系统工程做得多好』。
#AI Agent
另有 1 家信源报道
推荐理由:对个人:如果你还在纠结『该学哪个模型』,方向可能错了。真正在长出机会的是模型之上的编排层——多 agent 调度、上下文工程、工具组织、状态持久化。把精力投在『怎么把一堆 agent 和工具编排成一个可靠系统』上,比追逐每一次模型更新更有复利。这层能力今天还稀缺,正是普通人能建立优势的窗口。