Hall of Fame
今日趋势综述
今天的信号:模型越聪明,管它的手艺越值钱
今天最抓眼球的是 OpenAI 8 月 1 日甩出的 Astra——它解开了十道搁置数十年的数学难题,包括自 1999 年就悬着的『非同域群是否存在』,还配上机器可验证的 Lean 4 证明,全部算力成本只花了约 2000 美元。这几乎是在宣告:最前沿的推理能力正在变得又强又便宜。但把今天其余几条线索并排看,你会发现钱和注意力并没有涌向『谁的模型更聪明』,而是涌向一个朴素得多的问题——怎么让这么强的模型在真实任务里不跑偏、能交付。
证据很集中:阿里 DreamX 团队的 LongHorizon-Harness 论文,靠一个『管理-执行-审计』的三角循环,把 Qwen 在长任务基准上从 51.8% 拉到 80.7%,方法全在『把已验证的状态放到执行之外、独立审一遍』,而不是换更强的模型;本周 GitHub 上真正在冲榜的三个仓库——腾讯云的 Agent 记忆中枢、Agent-Reach 的统一信息触达、Orca 的并行 agent 工作台——清一色是『让 agent 记得住、看得见、管得动』的基础设施;Anthropic 把交付制度化成了 Services Track,合作伙伴的段位直接绑定『线上跑着的生产部署』,EPAM 一口气要培养 250 名驻场『黑带』FDE;连一个人做的 Backlinker AI,靠把 AI 外联做成『保证每月拿到几条高质量外链』的确定性服务,就做到了五位数月收入。
对个人的行动因此很清楚:别再把自己训练成『会调最强 API 的人』——那条优势正在被 2000 美元的算力和随处可得的开源权重迅速填平。把时间押到三件填不平的手艺上:一是评测与审计(会设计基准、能在模型更新后抓住回归,这正是 FDE 岗位最被反复点名的差异化能力,也是今天那篇 shortcut hacking 论文的警示——37% 的『正确答案』其实是蒙对的);二是长任务编排(把一个业务流程拆成 agent 能一步步跑完、能被独立审核验收的结构);三是把不确定的 AI 能力包装成对某个付费人群『确定的结果』。模型是越来越聪明的水,会接管道、能验水质、知道往哪个厨房接的人,才拿走增值。
OpenAI Astra 花 2000 美元解开十道数十年数学悬案,附机器可验 Lean 4 证明
展开详情
- **硬突破**:首次显式构造非同域群(Gromov 1999 悬案),外加证伪 Connes 刚性猜想、解 Erdős 三题、球堆积上界近半世纪来首次改进
- **可验证**:不是『相信我』,而是每个结果都带机器可验的 Lean 4 证明证书、公开在 GitHub 上任人复核
- **便宜到反直觉**:找出全部十个解总算力成本按 Sol API 价约 2000 美元——前沿推理能力正在同时变强又变便宜
ARC-AGI-2 榜单(8/4):GPT-5.6 Sol 92.5% 领先,Opus 5 与 GPT-5.5 咬在身后
展开详情
- **对比**:GPT-5.6 Sol 92.5% vs Claude Opus 5 90.4% vs GPT-5.5 85%(ARC-AGI-2,截至 8/4,共约 20 个模型上榜)
- **看点**:顶尖两家只差 2.1 分,这条以『抗背题』著称的抽象推理榜也在往饱和挤
- **别被单分误导**:Opus 5 的 90.4% 是半私有集 + Max 推理档口径,换子集/换推理档分数会动,横向比先对齐条件
LongHorizon-Harness:一个『管理-执行-审计』循环,把长任务通过率从 51.8% 拉到 80.7%
展开详情
- **方法**:Manager 守目标+已验证状态、Executor 每轮清空上下文只做一步、Auditor 独立查文件/日志/测试——把可信状态放到执行之外
- **数据**:Qwen 3.7-Plus 在 WeaveBench 51.8%→80.7%、Terminal-Bench 2.1 69.7%→77.2%、OSWorld 2.0 2.8%→8.3%
- **通用**:套在 Claude Opus 4.7 上,OSWorld 2.0 子集也从 20.0% 提到 34.3%——是框架增益而非换模型
TencentCloud/TencentDB-Agent-Memory
展开详情
周增长:本周 GitHub 冲榜,近日日增约千星,是团队级 agent 记忆方向的当红项目
- **四类记忆资产**:把对话/文档/代码沉淀成 Chat Memory、Skill、LLM-Wiki、Code-Graph,还带 ACL 权限治理
- **跨 agent 共享**:记忆不再锁在单个会话里,而是团队级、跨框架复用——这是从个人 agent 走向团队 agent 的关键件
- **厂商数据**:配 OpenClaw 称 token 降 61%、通过率升 51%(自测口径,迁移前请拿自己任务复测)
Anthropic 把 AI 交付制度化:Services Track 用『线上生产部署』定合作伙伴段位,EPAM 要养 250 名驻场黑带
展开详情
- **成果绑定**:Services Track 段位由『线上跑着的生产部署』决定,掉了活跃生产客户就掉档——把交付而非签单变成硬指标
- **规模化**:EPAM+Anthropic 要养 1 万名 Claude 认证架构师,含 250 名驻场黑带 FDE,Q3 末先认 5000 人
- **核心手艺**:评测工程(证明系统能用 + 模型更新后抓回归)被反复点名为 FDE 最关键差异化,薪资带 30 万–120 万美元+
Backlinker AI:一个人把 AI 外联做成『保证每月拿到高质量外链』的确定性服务,做到五位数月收入
展开详情
- **确定性交付**:不卖『我帮你试试』,卖『每月保证 3+ 条 DR30+ 外链』——把不确定的 AI 能力包装成客户能验收的结果
- **数字**:多个独立追踪站佐证 $12–20K MRR 区间,一年约 $22.7 万营收、$16 万 ARR、同比 +187%、一人运营
- **打法**:AI 自动应答记者提问平台拿编辑外链,价格约为传统外链机构的十分之一,靠成本结构差打出空间
Agent Skills 补上团队层:共享、只用不改、版本回滚、审计治理,定价从免费起
展开详情
- **协作**:像 Google Docs 一样共享技能,配『只用不改』权限——别人能调用但保护你的创作者 IP
- **治理**:版本历史 2.0 + 一键回滚 + 审计日志,技能第一次有了企业级的可追溯与回退能力
- **规模**:Managed Agents 单会话最多挂 500 个技能,配逐 agent 推理档与更多 webhook 事件
医疗 AI 落地实测:环境式 AI 病历跨 7260 名医生、250 万次问诊铺开,日省文书 13–16 分钟、倦怠降 31%
展开详情
- **规模**:Permanente 铺到 7260 名医生、约 257 万次问诊;UCSF 120 万次门诊达 44.6% 采用率——是真规模不是试点
- **效果诚实**:每 8 小时看诊省约 16 分钟、每天省 13–16 分钟文书、自报倦怠降 31%,一年累计省约 1.57 万小时
- **赢在嵌入**:不改医生看诊习惯、把 AI 塞进本来就要走的『看诊-记录』流程,而非要求医生学新系统
今日趋势综述
今天的信号:模型这条护城河正在被填平
把今天几条线索并排看,一个方向很清楚:顶尖模型的『独家优势』正在快速缩水。DeepSeek 上周五甩出 MIT 许可、13B 激活就跑赢自家旗舰的 V4-Flash-0731;在专门防数据污染的 SWE-rebench 上,开源的 GLM-5、GLM-5.1 已经咬到闭源 Opus 4.6 身后 2.6 分以内;xAI 把整套 Grok Build 编码 agent 也开源了。三件事指向同一句话——『用得上的强模型』正在变成随处可取、还能本地跑的公共品,光靠『我接了最强的 API』已经越来越不值钱。
既然模型这层被填平,价值就顺着水管往下游流。今天另外三条恰好是下游:企业为『能把 AI 塞进遗留系统、上线第一天就交东西』的 Forward Deployed Engineer 开出七位数薪水,1000 份岗位分析显示它成了增长最快的技术岗之一;零售业把 AI 卡进补货、定价、推荐的具体环节,个性化点击率 +24%、动态定价毛利 +3–6% 都是真金白银;单人公司 Zigpoll 靠死磕一个细分人群把 MRR 做到 $125k。它们的共同点不是『用了更强的模型』,而是『把某个模型能力精准嵌进了一个愿意付钱的工作流』。
对个人的行动很直接:别再把时间花在追榜首、比谁的模型分高上——那条优势正在归零。把时间投到三件填不平的事上:一是选型判断力(同一基准下便宜/开源模型什么场景够用,见今天的评测),二是交付手艺(把一个具体业务流程拆成 agent 能跑完、能验收的步骤,这正是 FDE 和垂直落地的核心),三是找准一个窄到你能吃透的付费人群。模型越来越像自来水,会接水管、知道往哪个厨房接的人,才拿走增值。
DeepSeek-V4-Flash-0731:13B 激活跑赢自家旗舰,MIT 权重可商用
展开详情
- **反直觉**:激活参数从 49B 砍到 13B,九项 agentic 基准反而全面反超自家 V4-Pro 预览版——赢在后训练不在堆参数
- **可商用**:MIT 许可、ungated,权重能直接私有化部署,企业不用等授权就能落到自己机房
- **别照单全收**:DeepSWE 54.4、Terminal-Bench 2.1 82.7 均为厂商自测、harness 未公开,迁移前务必用自己的任务复测
SWE-rebench 防污染榜:开源 GLM-5 咬到闭源 Opus 4.6 身后 2.6 分内
展开详情
- **对比**:Opus 4.6 65.3% vs GLM-5 62.8% vs GLM-5.1 62.7%(SWE-rebench,防污染滚动榜,截至 8/2)
- **看点**:领先的是闭源,但咬在身后 2.6 分内的两个全是开源权重——干净基准上开源已逼近前沿
- **信号**:前三挤在 2.6 分内,编码榜正逼近饱和,『榜首模型』的边际优势越来越薄
1000 份岗位拆出来的 FDE 真相:增长最快的技术岗之一,前沿实验室开到七位数
展开详情
- **热度**:被 KORE1 列为企业 AI 里增长最快的三个技术岗之一,连 Google 都在大规模招 FDE 铺进 Fortune 500
- **薪酬**:种子期约 $200K 全包 → C 轮 $450K–$550K+;前沿实验室 L4–L5 总包 $665K–$750K,principal 破 $1M
- **筛的能力**:不再只看写代码,而看『需求挖掘 + 产品化』——把客户模糊痛点变成第一天就能交付的上线系统
零售 AI 落地实测:赢家不是买了最强模型,而是把 AI 卡进补货/定价/推荐每个环节
展开详情
- **个性化**:推荐点击率 +24%、客单价 +18%(对比通用推荐)——嵌进商详页/推荐位就能对账
- **定价**:动态定价在铺开品类上毛利 +3–6%,中型零售商增收 €1.8–4.5M;库存持有成本靠 AI 预测砍 20–30%
- **留存**:一家零售商 12 个月自愿流失率 -22%,约留住 18 万客户;NVIDIA 调查 54% 零售商称 AI 提升了员工生产力
Zigpoll:一个人、无融资、无销售团队,靠死磕一个细分人群做到 $125k MRR
展开详情
- **数字**:单人、无融资、无销售,2026 开局约 $1.03M ARR,6 月约 $125k MRR(≈$1.5M 年化)
- **打法**:先只服务电商这一个窄人群,跑通后再扩到 SaaS 团队——聚焦细分而非追热点
- **反常识**:护城河不是 AI 功能,而是『把一个已在付钱的窄人群吃透』——窄和专注才是单人能扛得住的壁垒
Self-Evolving World Models for LLM Agent Planning
展开详情
- **核心**:让 agent 自己演化出预测『动作→环境如何变』的世界模型,用来支撑长程规划,少靠人工监督
- **验证**:既看世界模型对未来观测的预测准不准,也看它能否实打实提升下游规划表现
- **场景**:在 Word2World、ALFWorld、ScienceWorld 等多步决策环境上评估——瞄准长任务而非单轮问答
xAI 把 Grok Build 编码 agent 整套开源:可本地编译、指向自己的推理跑
展开详情
- **开源范围**:agent loop、代码工具、终端 UI、扩展框架全套源码上 GitHub,Apache 2.0,可审计可魔改
- **local-first**:能自己编译、指向本地推理、配置走 config.toml,不必依赖 xAI 云端
- **同一股风**:叠加本周 DeepSeek/GLM 开源权重——编码 agent 的 harness 也在从闭源黑盒变公共件
Kimi K3:Moonshot 开源 2.8T 稀疏 MoE 权重,改良版 MIT 许可
展开详情
- **体量**:2.8 万亿总参稀疏 MoE,Modified MIT 许可,完整权重已上 Hugging Face
- **节奏**:7/16 世界人工智能大会先上 API,10 天后(7/26)放权重——先服务再开源的打法
- **趋势**:与 DeepSeek V4-Flash 同周,构成『开源阵营在参数量级上持续追平闭源』的又一注脚
今日趋势综述
今天的信号:agent 从『会聊天』变成『交活』,而交活的底座你现在就能捡
把今天的几条串起来,方向很清楚:AI 的价值正在从『模型多聪明』转向『agent 能不能把一件事从头做完并交付成品』。OpenAI 的 ChatGPT Work 让 agent 接管整条工作流、几个小时后甩回做好的表格/幻灯片/网页;美国银行、摩根大通已经把上百到近千个 AI 用例塞进生产线,20 万员工每天几十万次调用。这已经不是试点,是把 agent 当员工在用。
但真正对个人友好的信号,藏在『底座』这一层。MCP 这次 2026-07-28 大改把协议从有状态改成无状态请求/响应——初始化握手、会话 ID 全砍掉,任何一台服务器都能被普通负载均衡随手转发,agent 后端第一次能像普通 Web 服务一样部署到 serverless/边缘。配上单端点接 290+ 模型的 OmniRoute、把扫描件和文本 PDF 秒级分流的 pdf-inspector,你会发现:搭一套能跑活的 agent 管道,门槛正在被逐块拆掉。
给普通人的一句话:别只盯着『哪个模型登顶』,去盯『交活链路』里还缺哪块砖。会把无状态 MCP + 模型网关 + 文档清洗拼成一条能交付成品的流水线的人,既能像 last30days 作者那样把一个技能做到 5 万星,也能像那些做 AI 语音前台的独立开发者那样,一个客户收 $300–800/月、两三周就见现金流。今天所有信号的共同点是:能力在变成基础设施,而基础设施是可以被个人捡起来变现的。
ChatGPT Work(OpenAI workspace agents)
展开详情
- **范式**:从『答问题』到『交成品』——给一个 outcome,agent 自己跨应用取数、拆步骤、后台跑数小时,交回表格/幻灯片/网页
- **打包**:一次发布捆了三件套——workspace agent + 内置 Codex 的桌面端 + 托管站点服务,等于把『造 + 部署』连成一条线
- **信号**:巨头把 agent 明确做成『企业工作流的拥有者』并能团队共享,agent 产品的战场从单机能力转向组织级交付
MCP 2026-07-28 大改:协议从『有状态』变『无状态』,agent 后端第一次能像普通 Web 服务那样部署
展开详情
- **核心变化**:有状态→无状态请求/响应,砍掉初始化握手和会话 ID,任何服务器实例都能被普通轮询 LB 转发
- **部署红利**:不再需要粘性会话/共享会话存储,MCP 服务器可以像普通 HTTP 服务一样上 serverless、边缘、自动扩缩
- **治理**:新增版本化扩展框架 + OAuth/OIDC 授权加固,把『加新能力』和『不破坏兼容』这两件事制度化
银行把 AI 跑成了生产线:美国银行上百个用例、摩根大通近千个,20 万员工每天几十万次调用
展开详情
- **规模**:美国银行 300+ 已批用例 / 114 个生成式 / 34 个完整落地,20 万员工每天 40 万+ 次调用
- **广度**:摩根大通近 1,000 个在跑用例,覆盖风控/反欺诈/营销/文档,企业 ML 平台服务每天约 $10 万亿交易
- **转折**:CEO 把『AI 用例数量』写进财报口径本身就是信号——AI 从成本项变成了要对投资人交代的战略资产
AI 语音前台代运营:一个人给本地生意接漏掉的电话,单客户 $300–800/月、约 80% 毛利
展开详情
- **现成拼装**:Callin.io(语音)+ n8n(编排)+ Cal.com(预约),不碰模型训练,两三周上线第一个客户
- **单位经济**:$1–2K 搭建 + $300–800/月订阅、约 80% 毛利;3–5 个客户即 $5–15K MRR,一人可运营
- **痛点硬**:6,200 万+ 小微企业每漏一个电话损失 $500–2K,需求是『正在流血的现金』而不是想象出来的
firecrawl/pdf-inspector
展开详情
一个高性能 Rust 库:先把 PDF 分类成文本型/扫描型/图片型/混合型,再据此智能路由——文本型直接快速抽取转干净 Markdown,扫描型才交给 OCR,避免无脑全跑 OCR。
周增长:2026-02 创建,近 7 天约 +510 星(约 +32%),基准结果 2026-07-31 刷新到 v0.2.6,属于持续有动量的文档处理工具
- **智能分流**:先判 PDF 是文本还是扫描(约 10–50ms、带置信度),文本型免 OCR 直转 Markdown,只把扫描件交给 OCR
- **性能对比**:200 文档 0.470s / 总分 0.875,对比 PyMuPDF4LLM 17.117s / 0.735——快约 36 倍且分更高
- **易接入**:纯 Rust 仅依赖 lopdf,提供 Python / Node.js / 浏览器 WASM 绑定,适合塞进任意文档预处理管道