📅
Hall of Fame
Hall of Fame
Track
Type
Source
8月5日 周三 · 10 条
今日趋势综述
OpenAI 用 Astra 花 2000 美元解开十道数十年悬案的同一周,真正在涨钱、涨岗、涨用户的却是把模型能力『管住、审住、交付住』的那一层——顶尖智能越强,能驾驭它的工程和交付手艺越值钱。
今天的信号:模型越聪明,管它的手艺越值钱

今天最抓眼球的是 OpenAI 8 月 1 日甩出的 Astra——它解开了十道搁置数十年的数学难题,包括自 1999 年就悬着的『非同域群是否存在』,还配上机器可验证的 Lean 4 证明,全部算力成本只花了约 2000 美元。这几乎是在宣告:最前沿的推理能力正在变得又强又便宜。但把今天其余几条线索并排看,你会发现钱和注意力并没有涌向『谁的模型更聪明』,而是涌向一个朴素得多的问题——怎么让这么强的模型在真实任务里不跑偏、能交付。

证据很集中:阿里 DreamX 团队的 LongHorizon-Harness 论文,靠一个『管理-执行-审计』的三角循环,把 Qwen 在长任务基准上从 51.8% 拉到 80.7%,方法全在『把已验证的状态放到执行之外、独立审一遍』,而不是换更强的模型;本周 GitHub 上真正在冲榜的三个仓库——腾讯云的 Agent 记忆中枢、Agent-Reach 的统一信息触达、Orca 的并行 agent 工作台——清一色是『让 agent 记得住、看得见、管得动』的基础设施;Anthropic 把交付制度化成了 Services Track,合作伙伴的段位直接绑定『线上跑着的生产部署』,EPAM 一口气要培养 250 名驻场『黑带』FDE;连一个人做的 Backlinker AI,靠把 AI 外联做成『保证每月拿到几条高质量外链』的确定性服务,就做到了五位数月收入。

对个人的行动因此很清楚:别再把自己训练成『会调最强 API 的人』——那条优势正在被 2000 美元的算力和随处可得的开源权重迅速填平。把时间押到三件填不平的手艺上:一是评测与审计(会设计基准、能在模型更新后抓住回归,这正是 FDE 岗位最被反复点名的差异化能力,也是今天那篇 shortcut hacking 论文的警示——37% 的『正确答案』其实是蒙对的);二是长任务编排(把一个业务流程拆成 agent 能一步步跑完、能被独立审核验收的结构);三是把不确定的 AI 能力包装成对某个付费人群『确定的结果』。模型是越来越聪明的水,会接管道、能验水质、知道往哪个厨房接的人,才拿走增值。

今日新增 8
#01
openai.com Article
NEW

OpenAI Astra 花 2000 美元解开十道数十年数学悬案,附机器可验 Lean 4 证明

OpenAI 8 月 1 日发了一份 249 页手稿《数学与理论计算机科学的十项进展》,宣布其下一代模型 Astra 的内部版本解开了十道『至少十年无人推进』的难题。最重磅的是首次显式构造出『非同域群』(non-sofic group)——这个问题自 Gromov 1999 年提出概念以来悬了 27 年。此外 Astra 还证伪了 Connes 关于冯诺依曼代数的刚性猜想、证明了 Ehrhart 体积猜想、解决了 Erdős 名录里的三道题(含第 183 号多色 Ramsey 数)、把 1978 年以来高维球堆积密度上界第一次往前推了一步。关键在于:每个结果都配了机器可验证的 Lean 4 证明证书、放在 GitHub 上任人复核;而找出全部十个解的算力成本,按 Sol API 价算只约 2000 美元。注意这是厂商发布、用未公开发售的内部模型跑出的结果,Lean 证明可独立验证是最硬的一环,但『Astra 有多强』仍要等正式发布与第三方复测。
#LLM/Model
另有 3 家信源报道
展开详情
  • **硬突破**:首次显式构造非同域群(Gromov 1999 悬案),外加证伪 Connes 刚性猜想、解 Erdős 三题、球堆积上界近半世纪来首次改进
  • **可验证**:不是『相信我』,而是每个结果都带机器可验的 Lean 4 证明证书、公开在 GitHub 上任人复核
  • **便宜到反直觉**:找出全部十个解总算力成本按 Sol API 价约 2000 美元——前沿推理能力正在同时变强又变便宜
推荐理由:对普通人最该读到的一层不是『AI 会做数学题了』,而是『强推理 + 可机器验证』这套组合正在成型:模型负责大胆猜、形式化系统负责严格验。这意味着以后在任何『答案对不对可以被机械检查』的领域(代码、合约条款、财务勾稽、工程约束),你都能让 AI 放开跑、再用验证器兜底。行动上:与其惊叹分数,不如现在就练一手『把你的问题变成可自动验收的形式』的能力——谁能把业务判题标准写成机器能跑的检查,谁就能安全地把最强模型用到满格。
#02
benchlm.ai Article
NEW

ARC-AGI-2 榜单(8/4):GPT-5.6 Sol 92.5% 领先,Opus 5 与 GPT-5.5 咬在身后

ARC-AGI-2 是 ARC Prize 出的抽象推理基准,专门考『见所未见的规律归纳』,比刷题型编码榜更难被背题污染。截至 8 月 4 日的这版榜单里,OpenAI 的 GPT-5.6 Sol 以 92.5% 登顶,Anthropic 的 Claude Opus 5(Max 推理档、半私有集)拿 90.4% 紧咬其后,上一代 GPT-5.5 则是 85%。三者之间的差距——顶尖两家只差 2.1 分——说明在这条更硬的推理基准上,前沿模型也已经挤在很小的区间里。要留意口径:Opus 5 的 90.4% 是 ARC-AGI-2 半私有集、开到 Max 推理档跑出来的,不同档位/不同子集分数会变,横向比时要对齐条件。
#评测
另有 1 家信源报道
展开详情
  • **对比**:GPT-5.6 Sol 92.5% vs Claude Opus 5 90.4% vs GPT-5.5 85%(ARC-AGI-2,截至 8/4,共约 20 个模型上榜)
  • **看点**:顶尖两家只差 2.1 分,这条以『抗背题』著称的抽象推理榜也在往饱和挤
  • **别被单分误导**:Opus 5 的 90.4% 是半私有集 + Max 推理档口径,换子集/换推理档分数会动,横向比先对齐条件
推荐理由:对开发者的直接用处是选型别只认榜首:92.5% 与 90.4% 在真实产品里几乎感知不到差别,但两家的价格、延迟、可私有化程度、工具调用生态差得多。真要抠推理天花板(复杂规划、少样本归纳)就上 Sol 或 Opus 5 的高推理档;大多数日常任务,便宜一档的模型开中等推理就够,把省下的预算花在评测和护栏上更划算。普通人能练的手艺,是拿这类第三方抗污染榜(而不是厂商自测表)当选型依据,并学会看清每个分数背后的『子集/推理档』口径。
#03
arXiv Paper
NEW

LongHorizon-Harness:一个『管理-执行-审计』循环,把长任务通过率从 51.8% 拉到 80.7%

阿里 DreamX 团队这篇 8 月初的论文,针对 agent 跑长任务时越跑越偏、忘掉目标的老毛病,提出一个 Manage-Execute-Audit(管理-执行-审计)三角循环:Manager 只负责守住原始目标、记录『已验证的进度』和下一步;Executor 每一轮都拿全新上下文、只专注当前这一小步;Auditor 独立去查文件、接口、日志、测试,判断这步到底做没做对。核心思想是把『可信的任务状态』保存在执行过程之外,不让它被一次次对话污染。效果很硬:Qwen 3.7-Plus 在 WeaveBench(114 个任务)上从 51.8% 提到 80.7%,Terminal-Bench 2.1 从 69.7% 到 77.2%,OSWorld 2.0 二值完成率从 2.8% 翻到 8.3%;连 Claude Opus 4.7 在 OSWorld 2.0 子集上也从 20.0% 提到 34.3%。代码已开源。
证明长任务 agent 的瓶颈不在模型强弱,而在『状态会漂移』——把已验证的任务状态放到执行之外、由独立审计者复核,就能大幅提通过率
#AI Agent
另有 1 家信源报道
展开详情
  • **方法**:Manager 守目标+已验证状态、Executor 每轮清空上下文只做一步、Auditor 独立查文件/日志/测试——把可信状态放到执行之外
  • **数据**:Qwen 3.7-Plus 在 WeaveBench 51.8%→80.7%、Terminal-Bench 2.1 69.7%→77.2%、OSWorld 2.0 2.8%→8.3%
  • **通用**:套在 Claude Opus 4.7 上,OSWorld 2.0 子集也从 20.0% 提到 34.3%——是框架增益而非换模型
推荐理由:这篇对个人开发者是可以直接抄的工程模板:你不需要最强的模型,也不用等更聪明的模型,只要把长流程拆成『一个守目标的管理者 + 每步清空重来的执行者 + 一个独立审计者』,就能显著降低 agent 跑偏。尤其那个 Auditor——独立、不带执行历史地复核每一步,正是把 demo 级 agent 变成能验收、能交付的关键。想在 AI 落地上有手艺的人,值得把这套三角循环变成自己的默认架构,而不是把所有希望寄托在一个越堆越长的 prompt 上。
#04
GitHub Repo
★ 13.5k NEW

TencentCloud/TencentDB-Agent-Memory

腾讯云开源的『团队级 Agent 记忆中枢』,本周在 GitHub 冲榜(星数约 1.35 万、这几天日增上千)。它把对话、文档、代码沉淀成四类可复用的记忆资产——Chat Memory(对话记忆)、Skill(技能)、LLM-Wiki(知识)、Code-Graph(代码图),并用 ACL 权限治理,让这些记忆能跨 agent、跨框架共享和调用。短期记忆用 Mermaid 符号压缩,长期记忆分层管理。官方给的一个数据是:搭配 OpenClaw 使用时 token 降 61%、通过率升 51%(厂商口径,建议自测)。定位不是又一个向量库,而是让一个团队/一群 agent 共享同一套『可治理的记忆』。星数为 GitHub 页面快照,增速为近期趋势估计。
#AI Agent#Python
另有 1 家信源报道
展开详情

周增长:本周 GitHub 冲榜,近日日增约千星,是团队级 agent 记忆方向的当红项目

  • **四类记忆资产**:把对话/文档/代码沉淀成 Chat Memory、Skill、LLM-Wiki、Code-Graph,还带 ACL 权限治理
  • **跨 agent 共享**:记忆不再锁在单个会话里,而是团队级、跨框架复用——这是从个人 agent 走向团队 agent 的关键件
  • **厂商数据**:配 OpenClaw 称 token 降 61%、通过率升 51%(自测口径,迁移前请拿自己任务复测)
推荐理由:记忆正在成为 agent 时代的新基础设施品类——去重清单里这几天已经出现过好几个记忆/上下文项目,说明这是条正在拥挤的赛道。对个人的机会有两层:一是应用层,学会给自己的 agent 接一套结构化记忆(而不是每次从零喂上下文),能立刻拉开可靠性差距;二是这类开源件大多来自大厂、面向团队治理,独立开发者反而可以在『个人/小团队够用的轻量记忆方案』这个缝隙里做产品。先把『agent 记忆怎么组织、怎么权限隔离』搞懂,是接下来做任何多 agent 系统的必修课。
#07
anthropic.com Article
NEW

Anthropic 把 AI 交付制度化:Services Track 用『线上生产部署』定合作伙伴段位,EPAM 要养 250 名驻场黑带

Anthropic 把企业交付这件事做成了正式制度——Services Track + Partner Hub,分 Select / Preferred / Global Premier 三档,段位直接绑『成果』:合作伙伴的等级由手上跑着的『线上生产部署』数量决定,维持不住活跃的生产客户就会掉档。背后是 3 月那笔 1 亿美元合作承诺,晋级评审每年 1 月 1 日、7 月 1 日各一次。配套的落地力量也在铺:EPAM 与 Anthropic 联手要培养 1 万名 Claude 认证架构师,其中 250 名是驻场的『黑带』FDE,目标 Q3 末先认证 5000 人。方法论主线始终是『评测工程』——证明系统真能用、并在模型更新后抓住回归,被反复点名为 FDE 最核心的差异化能力。业内引用的薪资带在 30 万到 120 万美元以上。
#FDE
另有 2 家信源报道
展开详情
  • **成果绑定**:Services Track 段位由『线上跑着的生产部署』决定,掉了活跃生产客户就掉档——把交付而非签单变成硬指标
  • **规模化**:EPAM+Anthropic 要养 1 万名 Claude 认证架构师,含 250 名驻场黑带 FDE,Q3 末先认 5000 人
  • **核心手艺**:评测工程(证明系统能用 + 模型更新后抓回归)被反复点名为 FDE 最关键差异化,薪资带 30 万–120 万美元+
推荐理由:这条把 FDE 从『某几家实验室的打法』变成了『整个生态的制度』——当交付能力被明码标价、被写进合作伙伴段位规则,说明『把模型落进客户业务』正式成了一门独立、稀缺、高薪的手艺。对个人最实的机会:不必进大厂也能吃这波,中小企业遍地是『买了 AI 却落不了地』的 50 万美元部署缺口。现在就补两件事——一是评测/审计能力(会设计验收标准、能在模型换代后守住质量),二是端到端交付经验(哪怕先在一个小客户身上把一个 AI 流程从 0 跑到上线验收)。会交付的人,正在从『加分项』变成企业抢着要的入场券。
商机信号(加速):谁付钱:有真实业务、买了 AI 却落不了地的中大型企业,以及需要驻场交付能力的系统集成商 痛点:模型能力和业务系统之间存在『最后一公里』部署缺口(被称作 50 万美元 gap):光有 API 接不进遗留系统、上不了生产、模型一更新质量就漂 切入点:个人/小团队先在一个具体客户的单一流程上做端到端交付(含验收标准与回归监控),把『评测工程 + 落地交付』做成可复用的方法论和案例,再顺着 Anthropic/EPAM 这类认证与合作网络接活
#08
backlinker.ai Product 直接可用
NEW

Backlinker AI:一个人把 AI 外联做成『保证每月拿到高质量外链』的确定性服务,做到五位数月收入

Backlinker AI 是独立开发者 Bennett Heyn 一个人做的 SEO 工具,主打用 AI 自动做『记者/媒体外联』拿编辑外链:它接进 Featured.com、HelpAB2BWriter 这类记者提问平台,自动扫描相关问题、起草并发送应答式 pitch,帮客户赢得高权重编辑外链。公开的成长故事被多个独立营收追踪站佐证——Starter Story 记为『13 个月做到 $20K MRR』,一年累计约 $22.7 万营收、约 $16 万 ARR、同比增长 187%、churn 约 10%;不同追踪站近期口径在 $12–20K MRR 区间(也有一个 Flippa 挂牌页显示 $12.6K MRR)。卖点是把外链这件贵且不确定的活,做成『每月保证交付 3+ 条 DR30+ 外链、价格约为传统机构十分之一』的确定性服务,代运营档约 $300/月。创始人一人运营、可与全职工作并行。
#小微现金流#SaaS 订阅 + Done…
另有 3 家信源报道
展开详情
  • **确定性交付**:不卖『我帮你试试』,卖『每月保证 3+ 条 DR30+ 外链』——把不确定的 AI 能力包装成客户能验收的结果
  • **数字**:多个独立追踪站佐证 $12–20K MRR 区间,一年约 $22.7 万营收、$16 万 ARR、同比 +187%、一人运营
  • **打法**:AI 自动应答记者提问平台拿编辑外链,价格约为传统外链机构的十分之一,靠成本结构差打出空间
推荐理由:对想挣现金流的普通人,这是一个可抄的范式:选一个『结果可量化、客户愿持续付费、但人工做又贵又烦』的窄活(这里是外链),用 AI 把成本打到十分之一,再用『保证交付 X』的确定性话术卖出去。关键不在技术多炫,而在两点——一是找准一个有明确付费意愿、结果能被验收的细分需求;二是敢于把服务做成『保证结果』而非『按小时』,这样定价权和复购都在你手里。SEO 只是其中一个口子,法务合规、招聘外联、评论回复、客服工单,凡是『重复+可量化+现在靠人工很贵』的活,都能套这个模型。
My Take:评分(5=最优):最快成交 4 / 最低成本 4 / 可复制 4 / 风险安全度 3。把『不确定的 AI 外联』包装成『保证交付的确定结果』,一人可跑、复购稳,风险主要在外链平台政策与 SEO 规则变动。
商机信号(加速):谁付钱:需要 SEO 外链但请不起传统外链机构的中小企业主、SaaS 创始人、独立站/内容站运营者 痛点:高质量编辑外链又贵又慢、传统机构报价高且结果不透明,自己做又极其耗时且难保证权重 切入点:个人可先用 AI 自动化『应答式记者外联』这一个环节,做成『每月保证 N 条 DRxx+ 外链』的固定套餐代运营,先服务 5–10 个细分行业客户跑通确定性交付,再产品化成自助 SaaS
#09
agentman.ai Article
NEW

Agent Skills 补上团队层:共享、只用不改、版本回滚、审计治理,定价从免费起

Agent Skills 生态本周的关键动向不是又出了一个新技能,而是补上了『团队协作与治理』这一层。一次更新里一口气上了:像 Google Docs 那样共享技能、『只用不改』的访问权限(保护创作者 IP,别人能调用但看不到/改不了源)、2.0 版本历史 + 一键回滚、治理与审计日志、把在 Claude 里现做的技能批量导入,以及一个从免费起步的新定价。配套地,Claude Managed Agents 也更新到单会话最多可挂 500 个技能,并加了逐 agent 的推理档位、更多 webhook 事件类型等。合起来看,Skills 正从『个人攒一堆 md 文件』升级成『团队可共享、可治理、可追溯、能商业化』的资产层。
#Skills#元技能
另有 2 家信源报道
展开详情
  • **协作**:像 Google Docs 一样共享技能,配『只用不改』权限——别人能调用但保护你的创作者 IP
  • **治理**:版本历史 2.0 + 一键回滚 + 审计日志,技能第一次有了企业级的可追溯与回退能力
  • **规模**:Managed Agents 单会话最多挂 500 个技能,配逐 agent 推理档与更多 webhook 事件
推荐理由:去重清单里这一周反复出现 skills 相关条目,说明它正从爱好者玩具变成有治理、有定价、能卖钱的资产层——这对个人是明确的窗口期。两个机会:一是做『会被反复调用的高质量单一技能』,趁市场还早、创作者分成还高(多数独立技能市场给创作者约 90%)时占位;二是做『元技能』——管理、评估、组织别人技能的技能,随着一个团队挂几百个技能,怎么筛选、怎么保证质量本身就成了新需求。现在该练的不是多囤技能,而是学会把一个技能做到『单一职责、行为可预测、可被治理』,这正是从玩具走向资产的分界线。
商机信号(萌芽):谁付钱:需要给团队统一 agent 能力的中小团队,以及愿意为高质量、免维护技能付费/订阅的 Claude 重度用户 痛点:技能散在各人手里、质量参差、无法共享治理与回滚;团队想统一 agent 行为却缺可信、可审计的技能来源 切入点:个人可趁创作者分成还高(约 90%)时,做少而精的单一职责技能占位某个垂直场景,或做『元技能』帮团队筛选/评估/组织已有技能
#10
catalyst.nejm.org Article
NEW

医疗 AI 落地实测:环境式 AI 病历跨 7260 名医生、250 万次问诊铺开,日省文书 13–16 分钟、倦怠降 31%

『环境式 AI 病历』(ambient AI scribe,医生看诊时 AI 在旁边自动听写、生成病历)是目前医疗里落地最扎实的一类 AI。NEJM Catalyst 复盘 Permanente 医疗集团一年经验:这套系统已铺到 7260 名医生、覆盖约 257 万次问诊;UCSF 在 120 万次门诊里达到 44.6% 的采用率。效果诚实——多中心研究显示每 8 小时看诊约省 16 分钟、每周多看约 0.49 个号;JAMA 一项研究显示医生每天省 13–16 分钟 EHR 文书、自报倦怠下降 31%,一年累计省下约 1.57 万小时文书时间。赢家的共同点不是买了最强模型,而是把 AI 嵌进了医生本来就要走的看诊-记录流程里,几乎不改工作习惯。注意:最硬的数字多来自 2026 上半年发表的研究,是真实规模化部署而非本周新闻;ROI 类聚合数字(如每投 1 美元回 3.2 美元)建议回溯一手来源再引用。
#行业应用
另有 2 家信源报道
展开详情
  • **规模**:Permanente 铺到 7260 名医生、约 257 万次问诊;UCSF 120 万次门诊达 44.6% 采用率——是真规模不是试点
  • **效果诚实**:每 8 小时看诊省约 16 分钟、每天省 13–16 分钟文书、自报倦怠降 31%,一年累计省约 1.57 万小时
  • **赢在嵌入**:不改医生看诊习惯、把 AI 塞进本来就要走的『看诊-记录』流程,而非要求医生学新系统
推荐理由:医疗 AI 这条线给普通人的最大启示是『别追最炫的诊断 AI,去做最枯燥的流程嵌入』。真正跑出规模和 ROI 的,是把 AI 卡进一个人人都嫌烦、又天天必做的环节(写病历),而且做到用户几乎无感——不用学新东西、不改习惯。这个模式可迁移到任何行业:找一个专业人士每天被迫做、又极其耗时的记录/整理/合规动作,用 AI 在旁边默默替他做掉,价值立刻可感。对想切医疗或其他强监管行业的人,机会也很清楚:难点从来不在模型,而在合规、隐私和把 AI 无缝塞进既有工作流的那份耐心手艺。
仍在热榜 2
Repo Panniantong/Agent-Reach 在榜 4d 本周在 X 上刷屏、GitHub 星数冲到约 6.6 万的一个 CLI/MCP 服务器,主打给 AI agent 装上『… DevTools
Repo stablyai/orca 在榜 3d Stably AI(YC 背景)开源的 ADE(Agent Development Environment,agent … DevTools