📅
Hall of Fame
Hall of Fame
Track
Type
Source
7月30日 周四 · 10 条
今日趋势综述
Opus 5 以对折价格把前沿模型拉到人人可用、编码榜单挤在两分内接近饱和;今天真正的机会不在追下一个模型,而在围着便宜的强模型做记忆、技能、落地和现金流的那一层。
今天的信号:模型变便宜变多,稀缺的是『围着模型做东西』的人

今天最硬的一条新闻是 Anthropic 发布 Claude Opus 5——不到两个月里的第四个模型,价格和 Opus 4.8 持平($5/$25 每百万 token),却把前沿智能拉到了 Fable 5 一半的输入价。配合评测那条看:SWE-bench Verified 榜前三名 Opus 5、GPT-5.6 Sol、Fable 5 已经挤在 95–97 分这两分之内,编码这个最被引用的基准正在饱和;而换到 LiveCodeBench,冠军又变成 Gemini 3 Pro Preview。两件事合起来说的是同一句话:最强的模型正在变便宜、变多,单靠『我用了最强模型』或『我榜上第一』越来越不值钱了。Relay-Bench 那篇论文更是当头一棒——同一个前沿模型在单领域任务能拿 82.7%,一旦要把多个领域的推理串起来就掉到 43.3%,说明榜单分数和真实综合能力之间还有一道大裂缝。

#01
anthropic.com Article
NEW

Anthropic 发布 Claude Opus 5:前沿智能对折价,$5/$25 不涨价却比 Fable 5 便宜一半

Anthropic 在 7 月 24 日发布 Claude Opus 5——这是它不到两个月里推出的第四个模型(前面还有 Mythos 5、Fable 5、Sonnet 5)。定位是『会自我验证、反复迭代直到把编码和知识工作做对』的前沿模型,成为 Claude Max 的默认模型、Claude Pro 上最强的可选项,API 名为 claude-opus-5,带 1M 上下文和 low/medium/high 三档 effort 开关。关键不是它又刷新了几个榜,而是价格:$5/百万输入、$25/百万输出,跟上一代 Opus 4.8 持平,却把接近 Fable 5 的前沿智能做到了后者一半的输入价($5 vs $10)。前沿能力正在肉眼可见地变便宜。
#LLM/Model
另有 2 家信源报道
展开详情
  • **价格**:$5/$25 每百万 token,与 Opus 4.8 持平不涨价,却把近 Fable 5 级别的智能做到其输入价的一半($5 vs $10)
  • **成绩**:官方口径 SWE-bench Pro 约 79.2%、SWE-bench Verified 约 96%,1M 上下文,成为 Claude Max 默认模型
  • **节奏**:两个月内第四个模型——前沿模型的发布频率和降价速度,都在把『用最强模型』这件事变成人人可及的日常
推荐理由:对个人:前沿模型正在快速降价,这对你是纯利好——一年前只有大厂用得起的能力,现在几十美元就能大量调用。别再把预算和注意力花在『追哪个模型最强』上,那一层已经商品化了。真正该做的是趁能力变便宜,赶紧把它接进一个你熟悉的具体场景里跑出价值。谁先把便宜的强模型用出真实成果,谁就占了这波红利。
#02
llm-stats.com Article
NEW

编码榜快饱和了:Opus 5 登顶 SWE-bench Verified,但前三挤在两分内,换个榜冠军又变 Gemini

Opus 5 一上线就登顶最常被引用的 agentic 编码基准 SWE-bench Verified,但『登顶』的含金量正在缩水——前三名已经挤在两分之内,榜接近饱和。换一个同样考编码的基准,冠军又完全不同:在 LiveCodeBench(持续收新题、抗训练污染的实时编码榜)上,登顶的是 Gemini 3 Pro Preview,开源的 DeepSeek 也咬得很紧。结论很实在:编码这块已经没有哪个模型通吃,选型要看你的活到底考哪一项,而不是盯着某个总榜第一。
#评测
另有 2 家信源报道
展开详情
  • **对比**:SWE-bench Verified(vals.ai,7/22)Claude Opus 5 97.0 vs GPT-5.6 Sol 96.2 vs Claude Fable 5 95.0——前三挤在 2 分内,榜接近饱和
  • **换榜换王**:LiveCodeBench(约 7/24)Gemini 3 Pro Preview 91.7 vs Gemini 3 Flash Preview 90.8 vs DeepSeek V3.2 Speciale 89.6——冠军换成了 Gemini
  • **方法**:不同榜差异来自评测方法与收题方式(如 LiveCodeBench 持续收新题抗污染),同一模型在不同聚合站分数也有 96–97 的浮动,别把单个小数点当真理
推荐理由:对开发者:当榜首挤在两分之内、还随榜易主时,『追第一』基本没意义了。更聪明的做法是先想清你的活考哪一项——纯改真实仓库 issue,SWE-bench Verified 这类更贴近,Opus 5 目前占优;要抗污染的实时算法/竞赛类编码,看 LiveCodeBench,Gemini 更强、DeepSeek 更便宜。再叠加价格和延迟按场景选型,比迷信总榜第一靠谱得多。
#03
arXiv Paper
NEW

Relay-Bench: Evaluating LLMs on Multi-Domain Reasoning Chains

Relay-Bench 是一个抗污染、尚未饱和的纯文本基准:它把视觉推理、编码、数学、网络检索取信息、问题求解、通用知识、数据分析等不同领域的 2–13 个子问题串成一道组合题,逼模型在一条链里跨领域连续推理,且允许它自由用代码执行、联网搜索和所有工具。结果很扎眼:领跑的 GPT-5.5(xHigh)只拿到 43.3%,而同一模型在主流单项 agentic 测试上能到约 82.7%——一旦要把多个领域的推理接力串起来,能力直接掉了近 39 个百分点。
用『把多个单领域子问题串成一条链』的组合题,暴露出前沿模型『单项很强、串起来就崩』的巨大落差,直接动摇了『榜单登顶=真实综合能力强』的默认叙事。
#AI Agent
另有 1 家信源报道
展开详情
  • **落差**:GPT-5.5 单项 agentic 约 82.7%,到 Relay-Bench 跨领域链只剩 43.3%——同一模型掉了近 39 个点
  • **设计**:每题由 2–13 个不同领域子问题串成,纯文本、无需多模态输入输出,且明确鼓励用代码执行/联网/工具,考的是『串起来会不会崩』
  • **意义**:抗污染、未饱和——正好补上 SWE-bench 这类快饱和榜单的盲区,说明『榜单第一』和『真实综合能力』之间还有一道大裂缝
推荐理由:对个人:这篇给了一个特别值钱的判断——模型在你交给它的单个环节上可能很强,但把一长串跨领域步骤丢给它一次做完,它就容易崩。这正是你搭 agent 时该做的事:别指望一个大提示让模型端到端搞定,而要把复杂任务拆成一个个单领域的可靠环节,中间加校验和交接。会拆链路、会在环节之间做检查的人,能把今天的模型用出远超榜单分数的可靠性。
#04
GitHub Repo
★ 2,100 NEW

kvcache-ai/AgentENV

AgentENV 来自以 KTransformers 出名的 kvcache-ai 团队,7 月 23 日创建,六天冲到约 2.1k 星(>300/天)。它想解决的是 agent 时代一个越来越明显的工程瓶颈:训练和服务成千上万个 agent 时,怎么把它们各自的执行环境(沙箱、工具、状态)标准化地、高吞吐地跑起来。用 Rust 写,定位是 agentic RL 训练的基础设施层,而不是又一个 agent 框架。
#Infra#Rust
展开详情

一个用于大规模运行 agent 执行环境的分布式平台,主打为 agentic 强化学习训练提供标准化、高吞吐的沙箱/运行时底座。

周增长:7 月 23 日创建,6 天约 2.1k 星(>300/天),周增以 GitHub Trending / star-history 实时为准

  • **速度**:7/23 创建、6 天约 2.1k 星(>300/天),KTransformers 原班系统团队背书,可信度高
  • **定位**:不是 agent 框架,而是底层——大规模运行 agent 执行环境的分布式平台,专为 agentic RL 训练设计
  • **信号**:用 Rust 做高吞吐运行时,说明『怎么把海量 agent 环境跑起来』已经成了独立的基础设施品类
推荐理由:对个人:当『训练/服务海量 agent 的环境』都值得单独做一个平台时,说明 agent 的竞争正从模型下沉到基础设施。你不一定要造这层,但要读懂信号——agent 时代的新岗位和新生意,很多藏在『让 agent 能大规模、稳定地跑起来』的工程里。懂分布式、沙箱、运行时的人,在这波里会越来越抢手。
#05
GitHub Repo
★ 869 NEW

VictorTaelin/OptMem

OptMem 出自 HVM/Bend 的作者 Victor Taelin,7 月 25 日发布,四天约 869 星。它的卖点是极端极简:用一个 426-token 的提示 + 一个脚本,就给 agent 加上跨会话的永久记忆,靠 append-only 日志和树状分层摘要来组织,命令就 `memo wake / note / recall` 几个,数据存在本地 `~/.optmem/memory/`。没有向量库、没有嵌入服务、没有一堆基础设施——用最小的东西把『记忆』这件事跑通。
#AI Agent#Python
展开详情

给 AI agent 装『永久记忆』的极简方案:一个 426-token 的提示加一个脚本,即插即用,不需要重型向量数据库。

周增长:7 月 25 日创建,4 天约 869 星(>200/天),周增以 star-history 实时为准

  • **极简**:426-token 提示 + 一个脚本即插即用,append-only 日志 + 树状摘要,无需向量库/嵌入服务
  • **作者**:Victor Taelin(HVM/Bend 作者)出品,四天约 869 星,本身就是关注度背书
  • **取舍**:用最小复杂度换够用的持久记忆——和动辄上一整套 RAG 栈的方案形成鲜明对照
推荐理由:对个人:这是『少即是多』的极好范例——很多人一提 agent 记忆就上向量库、嵌入、检索一整套,OptMem 证明一个精心设计的提示加脚本就能把 80% 的需求跑通。启发在于:动手前先问『最小可行方案是什么』,别一上来就堆基础设施。能用最简单的东西解决真问题,比会搭复杂系统更稀缺、也更容易被人记住。
#06
GitHub Repo
★ 2,600 NEW

isjiamu/gzh-design-skill

gzh-design-skill 精准解决中文创作者的高频痛点:写好的 Markdown 粘进公众号后排版全乱。它把『Markdown → 公众号可直接粘贴的 HTML』这一个具体动作封成 Agent Skill,内置 6 套精选主题、一个主题生成器,还加了双重校验闸门保证产出干净,累计约 2.6k 星,并登上 Trendshift 趋势榜。它没做什么大而全的平台,就是把一件小事做到可靠、可复用、跨 Claude Code/Codex/Cursor 可移植。
#Skills#内容创作#HTML
另有 1 家信源报道
展开详情

一个把 Markdown 一键转成可直接粘进微信公众号编辑器的排版 HTML 的 Agent Skill,自带 6 套主题、主题生成器和双重校验。

周增长:近期登上 Trendshift 趋势榜、增长强劲,具体周增以实时榜为准

  • **痛点**:专治『Markdown 粘进公众号排版就崩』,6 套主题 + 主题生成器 + 双重校验,产出即粘即用
  • **热度**:约 2.6k 星并登上 Trendshift,是本季最出圈的中文向 Skill 之一
  • **范式**:不做大平台,把一个具体动作封成可复用、跨 agent 可移植的技能——这正是 skills 生态跑通的样板
推荐理由:对个人:这是 Skills 变现最接地气的模板——挑一个你所在圈子天天犯、又很烦的小事(公众号排版、某种报告格式、某类数据清洗),把它打磨成一个开箱即用、产出可靠的技能。不需要多前沿的技术,赢在『解决得够专、够干净』。会把细分痛点封成好技能的人,正在 skills 生态里攒下自己的名气和被动收入入口。
商机信号(萌芽):谁付钱:要日更公众号、又被排版反复折磨的自媒体作者、运营和中小团队 痛点:写作在 Markdown、发布在公众号,中间排版反复手工调,既费时产出还不稳定 切入点:锁定一个具体平台/格式的『最后一公里排版』痛点,做成产出即用、跨 agent 可移植的高质量技能,先靠一个场景做深再扩品类
#07
GitHub Repo
★ 1,100 NEW

makecindy/cindy

cindy 走的是和一堆 agent 框架相反的路线——它不是给你搭积木的框架,而是一个装好就能用的成品 App。7 月 22 日创建、约 1.1k 星,用 TypeScript 写成 pnpm monorepo(Electron 桌面 + React Native 移动端),本地运行、整合多模型多工具,还兼容 Claude Code、Codex 等多种 harness,Apache-2.0 开源、双语、对新手友好。定位是一个人人可上手的个人 agent,而不是又一个需要你自己拼装的开发者玩具。
#AI App#TypeScript
展开详情

一个开箱即用的开源 AI agent 成品应用,跨 iOS/安卓/桌面/浏览器,整合多模型多工具,本地运行,主打『想到就能做到』。

周增长:7 月 22 日创建,约 1.1k 星(>150/天),周增以 GitHub Trending / star-history 实时为准

  • **成品化**:开箱即用而非框架,跨 iOS/安卓/桌面/浏览器,本地运行、整合多模型多工具
  • **工程**:TypeScript + pnpm monorepo(Electron + React Native),兼容 Claude Code/Codex 等 harness,Apache-2.0 开源
  • **热度**:7/22 创建、约 1.1k 星(>150/天),双语、对新手友好,主打『想到就能做到』
推荐理由:对个人:agent 正在从『开发者拼积木的框架』走向『普通人下载就能用的成品 App』——这中间的产品化能力是巨大机会。能把复杂的 agent 能力包装成一个跨平台、装好即用、对小白友好的东西,比又写一个框架有价值得多。想做 AI 产品的人,重点该放在『把能力做成人人能用的成品』这件事上。
#08
GitHub Repo
★ 314 NEW

gavamedia/deltafin

deltafin 干了件看着不可能的事:在一台 Apple Silicon Mac(参考机是 64GB 的 M1 Max)上跑 2.8T 参数的 Kimi K3。做法是把 MoE 的专家按需流式载入本地磁盘缓存,配上 NEON 融合算子、Metal/MPS 计算,并暴露一个 OpenAI 兼容的服务端;也支持 x86-64/aarch64 Linux。7 月 28 日创建,两天约 314 星。星数还不高,但它代表的方向很硬——把万亿级前沿模型从『只能上云』拉到『你自己的笔记本上就能跑』。
#DevTools#Python
展开详情

让 2.8 万亿参数的 MoE 大模型 Kimi K3 在单台 Apple Silicon Mac 上跑起来——按需把专家流式载入本地磁盘缓存,配 NEON/Metal 融合算子和 OpenAI 兼容接口。

周增长:7 月 28 日创建,两天约 314 星,周增以 star-history 实时为准

  • **壮举**:在单台 M1 Max(64GB)上跑 2.8T 参数的 Kimi K3,靠专家按需流式载入磁盘缓存绕开显存墙
  • **工程**:NEON 融合算子 + Metal/MPS 计算 + OpenAI 兼容接口,Mac 与 Linux 都支持
  • **方向**:星数虽还不高(7/28 创建两天约 314 星),但把万亿级模型从『只能上云』拉到本地,是值得押注的趋势
推荐理由:对个人:本地跑大模型的门槛在被一点点砸开——今天能在一台 Mac 上跑万亿参数模型,意味着数据隐私敏感、想省 API 费、或要离线用的人,很快有真正可行的本地方案。懂量化、懂专家流式加载、懂在消费级硬件上榨性能的人会越来越值钱。盯住『本地推理』这条线,它是绕开云端成本和隐私顾虑的一整片机会。
#09
ports.marinelink.com Article
NEW

物流 AI 落地实测:DHL 全欧铺开 AI 动态选路,关键航线时效压缩 10–15%

2026 年 1 月,DHL Global Forwarding 宣布其自研的 AI 动态选路平台已在全欧网络铺开。系统实时吃进天气、港口拥堵、清关时长、承运商表现等数据,动态为空运/海运货挑最优且更省的路线,并主动绕开瓶颈重新规划。官方口径是关键航线时效可压缩 10–15%,同时明显降低燃油消耗与温室气体排放,提升服务可靠性;下一步计划年内向全球扩展。它赢的不是用了最强模型,而是把优化能力嵌进了『每一票货今天到底该怎么走』这个具体决策里。
#行业应用
另有 1 家信源报道
展开详情
  • **数字**:关键航线运输时效预计压缩 10–15%,燃油消耗与温室气体排放同步下降,首批区域数月内达到正 ROI
  • **做法**:实时融合天气/港口拥堵/清关时长/承运商表现,动态选路 + 主动绕瓶颈重规划,而非静态排线
  • **打法**:不追大模型,把优化嵌进『每票货怎么走』的具体运营决策——全欧先跑通,再向全球扩展
推荐理由:对个人:物流、货代、供应链这类『不性感』的传统行业,恰恰是 AI 见真金白银最快的地方——时效和油耗省下的都是硬钱。你不需要会训模型,需要懂这个行业的数据长什么样、卡在选路/清关/排箱哪一步。会把现成的优化/预测能力接进某个具体物流环节的人,比会跑 benchmark 的人稀缺得多,也更好变现。
#10
indiehackers.com Product 直接可用
NEW

Superpower ChatGPT:骑在 ChatGPT 流量上的一个 Chrome 插件,做到五位数月收入

ChatGPT 刚火时,Saeed Ezzati 花一个周末给自己做了个 Chrome 插件,补上 ChatGPT 原生缺的那些工作流功能(提示管理、文件夹、导出等),成了 Chrome 商店里第一个 ChatGPT 插件。此后靠『骑在别人流量上』把它滚成一整套生意:Superpower ChatGPT 累计 42 万+ 下载、15 万周活,配套的 Superpower Daily 邮件通讯 35 万订阅,整体做到五位数月收入。一个人、几天起步,护城河就是『第一个上、且死磕 ChatGPT 重度用户缺的那一个功能』。
#小微现金流#免费增值 Chrome 插件…
另有 2 家信源报道
展开详情
  • **成绩**:单人做到五位数 MRR,插件 42 万+ 下载、15 万周活,配套通讯 35 万订阅
  • **打法**:骑在 ChatGPT 的巨大流量上做增强插件,补官方没做的重度用户工作流功能——分发几乎零成本
  • **先发**:Chrome 商店第一个 ChatGPT 插件,靠『第一个上 + 死磕一个刚需功能』建立壁垒
推荐理由:对想挣现金流的普通人:最快的分发不是自己从零拉用户,而是骑在一个已经有海量用户的 AI 平台上,补它没做好的那一个高频功能。ChatGPT、Claude、各类 AI App 的原生体验都有缺口,一个小插件、一个月费几美元,就可能滚成一门实打实的生意。关键是先发 + 死磕一个刚需,别贪大。
My Take:评分(5=最优):最快成交 4 / 最低成本 5 / 可复制 3 / 风险安全度 3。骑在成熟平台流量上补刚需功能,是单人零预算起量最快的路径之一;风险在平台政策与被官方吸收。
商机信号(加速):谁付钱:每天重度使用 ChatGPT 的写作者、营销、开发者等,愿意为官方没做的效率功能付月费 痛点:原生 ChatGPT 缺提示管理、文件夹、导出等工作流工具,重度用户天天被这些缺口卡住 切入点:挑一个有海量用户的 AI 平台,做一个补齐其某项高频缺失功能的浏览器插件,先免费获量再转付费订阅,靠先发和分发红利起量