Hall of Fame
Hall of Fame
Track
Type
Source
8月4日
今日趋势综述
开源权重逼近前沿、编码榜逼近饱和的同一周,钱和岗位却在往『把模型落进具体业务』这头涌——模型不再是护城河,交付才是。
今天的信号:模型这条护城河正在被填平
把今天几条线索并排看,一个方向很清楚:顶尖模型的『独家优势』正在快速缩水。DeepSeek 上周五甩出 MIT 许可、13B 激活就跑赢自家旗舰的 V4-Flash-0731;在专门防数据污染的 SWE-rebench 上,开源的 GLM-5、GLM-5.1 已经咬到闭源 Opus 4.6 身后 2.6 分以内;xAI 把整套 Grok Build 编码 agent 也开源了。三件事指向同一句话——『用得上的强模型』正在变成随处可取、还能本地跑的公共品,光靠『我接了最强的 API』已经越来越不值钱。
既然模型这层被填平,价值就顺着水管往下游流。今天另外三条恰好是下游:企业为『能把 AI 塞进遗留系统、上线第一天就交东西』的 Forward Deployed Engineer 开出七位数薪水,1000 份岗位分析显示它成了增长最快的技术岗之一;零售业把 AI 卡进补货、定价、推荐的具体环节,个性化点击率 +24%、动态定价毛利 +3–6% 都是真金白银;单人公司 Zigpoll 靠死磕一个细分人群把 MRR 做到 $125k。它们的共同点不是『用了更强的模型』,而是『把某个模型能力精准嵌进了一个愿意付钱的工作流』。
对个人的行动很直接:别再把时间花在追榜首、比谁的模型分高上——那条优势正在归零。把时间投到三件填不平的事上:一是选型判断力(同一基准下便宜/开源模型什么场景够用,见今天的评测),二是交付手艺(把一个具体业务流程拆成 agent 能跑完、能验收的步骤,这正是 FDE 和垂直落地的核心),三是找准一个窄到你能吃透的付费人群。模型越来越像自来水,会接水管、知道往哪个厨房接的人,才拿走增值。
#01
Hugging Face
Product
NEW
DeepSeek-V4-Flash-0731:13B 激活跑赢自家旗舰,MIT 权重可商用
DeepSeek 7 月 31 日放出 V4-Flash 的正式版 0731,架构和体量不变(284B 总参、约 13B 激活的 MoE),提升全靠重新做的后训练。官方口径是:这颗只激活 13B 的小号,在它们公布的九项 agentic 基准上全面超过激活 49B 的 V4-Pro 预览版——用更低的运行成本换到更强的表现。许可证是 MIT、不设门槛,意味着企业可以直接拉去做私有化、商用部署,不用等授权。注意官方分数(如 DeepSWE 54.4、Terminal-Bench 2.1 上 82.7)都是厂商自测、跑在未公开的 harness 上,迁移前建议拿自己的真实任务在 API 和权重上复测,别把官方表当转移保证。
另有 2 家信源报道
展开详情
- **反直觉**:激活参数从 49B 砍到 13B,九项 agentic 基准反而全面反超自家 V4-Pro 预览版——赢在后训练不在堆参数
- **可商用**:MIT 许可、ungated,权重能直接私有化部署,企业不用等授权就能落到自己机房
- **别照单全收**:DeepSWE 54.4、Terminal-Bench 2.1 82.7 均为厂商自测、harness 未公开,迁移前务必用自己的任务复测
推荐理由:对个人最实在的机会是:一颗 MIT、13B 激活的强模型,意味着你现在能用一张消费级/单卡的预算,把过去要付 API 的能力搬到本地跑起来。这对做隐私敏感场景(法律、医疗、企业内数据)的独立开发者尤其关键——你可以承诺『数据不出内网』,这是套壳 API 的人给不了的卖点。行动上:与其纠结哪个闭源模型分高,不如练一手『开源权重私有化部署 + 针对自己业务微调/提示工程』的活,这正在从加分项变成很多 B 端项目的入场券。
#02
benchlm.ai
Article
NEW
SWE-rebench 防污染榜:开源 GLM-5 咬到闭源 Opus 4.6 身后 2.6 分内
SWE-rebench 是一条『滚动更新、专防数据污染』的编码基准——它不断从新出现的真实 GitHub issue 里取题,避免模型在训练里见过考题。截至 8 月 2 日的这版榜单里,闭源的 Claude Opus 4.6 以 65.3% 领跑,但紧跟其后的是两个开源权重模型:GLM-5 拿 62.8%、GLM-5.1 拿 62.7%,前三挤在 2.6 分之内。换句话说,在一条『考题模型没背过』的干净基准上,开源模型已经贴到了闭源第一的身后。榜单同时也透出饱和味道——前排差距被压得很小。
另有 2 家信源报道
展开详情
- **对比**:Opus 4.6 65.3% vs GLM-5 62.8% vs GLM-5.1 62.7%(SWE-rebench,防污染滚动榜,截至 8/2)
- **看点**:领先的是闭源,但咬在身后 2.6 分内的两个全是开源权重——干净基准上开源已逼近前沿
- **信号**:前三挤在 2.6 分内,编码榜正逼近饱和,『榜首模型』的边际优势越来越薄
推荐理由:对开发者的选型建议很具体:如果你的活是『改真实代码库的 issue』这类编码/agentic 任务,现在没必要为那多出来的 2.6 分去锁死最贵的闭源 API——GLM-5 这类开源权重在防污染榜上已经够用,还能本地跑、可商用、成本可控,隐私敏感或量大的场景优先它。把闭源第一留给真正吃那点精度差的关键路径。会看『同一条基准下便宜/开源选项什么场景够用』,比记住谁是榜首更省钱也更值钱。
#03
getperspective.ai
Article
NEW
1000 份岗位拆出来的 FDE 真相:增长最快的技术岗之一,前沿实验室开到七位数
这篇拆了 1000 份岗位的分析给 Forward Deployed Engineer(驻场交付工程师)画了张清晰的市场图:它被 KORE1 的 2026 招聘报告点名为企业 AI 里增长最快的三个技术岗之一;连 Google 都在为『把 AI 嵌进 Fortune 500 工作流』大规模招 FDE,说明这个岗位已经从纯前沿实验室扩散到大厂主流。薪酬上,种子期全包约 $200K,到 C 轮冲到 $450K–$550K+;在 Anthropic、OpenAI 这类前沿实验室,L4–L5 区间总包 $665K–$750K,principal 级破 $1M。招聘方现在明确筛的不再只是写代码,而是『需求挖掘 + 产品化』——能把一个客户的模糊痛点变成上线系统。
另有 1 家信源报道
展开详情
- **热度**:被 KORE1 列为企业 AI 里增长最快的三个技术岗之一,连 Google 都在大规模招 FDE 铺进 Fortune 500
- **薪酬**:种子期约 $200K 全包 → C 轮 $450K–$550K+;前沿实验室 L4–L5 总包 $665K–$750K,principal 破 $1M
- **筛的能力**:不再只看写代码,而看『需求挖掘 + 产品化』——把客户模糊痛点变成第一天就能交付的上线系统
推荐理由:这是给工程师的明牌转型信号:当模型能力变成公共品,市场最缺、给钱最狠的是能『翻越集成墙』的人——把模型塞进客户遗留系统、和真实业务对齐、上线就交东西。你不必进大厂才能吃这波:把你现有的行业知识 + 拆流程 + 落地交付的能力打包,就是中小企业眼里的『AI 落地工程师』。想入场,练三件事——跟非技术客户做需求挖掘、把模糊需求切成能验收的里程碑、用最短路径交付第一个能用的版本。这套手艺比刷题涨分抗贬值得多。
商机信号(加速):谁付钱:从前沿实验室(Anthropic/OpenAI)到大厂(Google)再到融了钱的 AI 创业公司,都在为『能把 AI 落进客户业务』的人开高薪;付费与增长信号明确 痛点:模型很强但卡在『demo 很惊艳、塞不进客户遗留系统』这道集成墙上,pilot 停在原地无法变成七位数合同 切入点:个人从『会调模型』转向『会交付』:挑一个你懂的行业,练需求挖掘+流程拆解+最短路径上线,先接中小企业的 AI 落地驻场活,用交付案例攒口碑再往上走
#04
mindit.io
Article
NEW
零售 AI 落地实测:赢家不是买了最强模型,而是把 AI 卡进补货/定价/推荐每个环节
这份 2026 零售 AI 的 ROI 基准把『AI 到底省了多少钱』拆到具体环节,全是能对账的数字:个性化推荐让点击率 +24%、客单价 +18%(对比通用推荐);动态定价在铺开的品类上带来 3–6% 毛利提升,中型零售商增收 €1.8–4.5M;AI 需求预测把库存持有成本砍 20–30%、预测误差最多减半;一家零售商 12 个月内自愿流失率降 22%(约留住 18 万客户)。共同规律和前几天的法律、保险、制造一样——效果不来自『买了最强模型』,而来自把 AI 精准嵌进补货、定价、推荐、留存这些具体作业流的节拍里。NVIDIA 2026 零售调查里 54% 的零售商报告 AI 直接提升了员工生产力。
另有 2 家信源报道
展开详情
- **个性化**:推荐点击率 +24%、客单价 +18%(对比通用推荐)——嵌进商详页/推荐位就能对账
- **定价**:动态定价在铺开品类上毛利 +3–6%,中型零售商增收 €1.8–4.5M;库存持有成本靠 AI 预测砍 20–30%
- **留存**:一家零售商 12 个月自愿流失率 -22%,约留住 18 万客户;NVIDIA 调查 54% 零售商称 AI 提升了员工生产力
推荐理由:给想切零售 AI 的个人/小团队的提示:别做『又一个零售大模型』,去认领一个能对账的具体环节。上面每个数字背后都是一条可外包的活——帮小商家配个性化推荐位、搭动态定价规则、做补货预测。你需要的不是最强模型,而是懂零售作业流 + 能把 AI 卡进那一步 + 用店家能看懂的指标(客单价、缺货率、毛利)验收。ROI 越具体,越好卖,也越难被通用大厂替掉。
#05
indiehackers.com
Article
值得关注
NEW
Zigpoll:一个人、无融资、无销售团队,靠死磕一个细分人群做到 $125k MRR
Zigpoll 是个做问卷/客户反馈的工具,创始人一个人扛:没有联合创始人、没融资、没销售团队。它 2026 年开局约 $1.03M ARR,到 6 月做到约 $125k MRR(约 $1.5M 年化)。它给独立开发者的核心一课不是『用了什么 AI 神器』,而是选对细分人群后『往死里聚焦』:产品最早只服务电商,验证跑通后才扩到 SaaS 团队;不是去追下一个热点,而是把一个已经在付钱、痛点明确的窄人群吃透。这条路径和本周其他现金流案例呼应——赢家赢在窄和专注,不是广。
另有 1 家信源报道
展开详情
- **数字**:单人、无融资、无销售,2026 开局约 $1.03M ARR,6 月约 $125k MRR(≈$1.5M 年化)
- **打法**:先只服务电商这一个窄人群,跑通后再扩到 SaaS 团队——聚焦细分而非追热点
- **反常识**:护城河不是 AI 功能,而是『把一个已在付钱的窄人群吃透』——窄和专注才是单人能扛得住的壁垒
推荐理由:对想挣现金流的普通人,这是最实在的模板:先找一个已经在为某件事付钱、但被服务得很差的窄人群(Zigpoll 是电商问卷),用 AI 把交付成本压到一个人能扛,再死磕这一群人别乱扩。别一上来就想做『通用 AI 平台』——你没有团队去覆盖广度,但你能在一个窄口子里比大厂更懂客户、响应更快。先窄到能吃透,赚到钱、验证透了再谈扩张。
My Take:评分(5=最优):最快成交 3 / 最低成本 4 / 可复制 4 / 风险安全度 4。单人聚焦细分人群做工具型 SaaS,慢热但复制性强、风险低。
商机信号(加速):谁付钱:有客户反馈/问卷需求的电商与 SaaS 团队,已在为这类轻量工具持续付费(Zigpoll 年化约 $1.5M 验证了付费意愿) 痛点:通用问卷工具不贴细分场景、集成和分析都要自己拼;小团队想要开箱即用、能嵌进现有流程的轻方案 切入点:挑一个你熟的窄行业(如某类电商/某类 SaaS),做一个只服务它、开箱即用的反馈/数据小工具,用 AI 把交付和支持压到单人可扛,先吃透再扩
#06
arXiv
Paper
NEW
Self-Evolving World Models for LLM Agent Planning
这篇论文提出让 LLM agent 自己演化出一个『世界模型』——即对环境如何随动作变化的内部预测——并用它来做长程规划,且尽量少依赖人工监督。评估方式是看世界模型对未来观测的预测有多贴合真实,以及它能否带来下游规划能力的提升,测试环境包括 Word2World、ALFWorld、ScienceWorld 这类需要多步决策的任务场景。它属于当下一个明显在升温的研究方向:不只让模型『会回答』,而是让 agent 通过自建、自更新的环境模型学会在长任务里预判后果、自我纠偏。
让 agent 靠自我演化的『世界模型』做长程规划,减少对人工监督的依赖,指向更能自己在环境里试错、纠偏的智能体
展开详情
- **核心**:让 agent 自己演化出预测『动作→环境如何变』的世界模型,用来支撑长程规划,少靠人工监督
- **验证**:既看世界模型对未来观测的预测准不准,也看它能否实打实提升下游规划表现
- **场景**:在 Word2World、ALFWorld、ScienceWorld 等多步决策环境上评估——瞄准长任务而非单轮问答
推荐理由:对普通人这是一个『往哪押注学习方向』的信号:agent 的下一个能力台阶不在『答得更准』,而在『能不能自己在环境里试错、预判、纠偏地把长任务跑完』。这意味着未来值钱的活会从『写好一个提示词』转向『给 agent 设计好它要面对的环境、反馈和验收信号』。想提前卡位的人,可以开始留意 agent 的环境/反馈设计(怎么给 agent 一个能自我改进的闭环),而不只是提示工程本身。
#07
x.ai
Article
NEW
xAI 把 Grok Build 编码 agent 整套开源:可本地编译、指向自己的推理跑
xAI 把它的终端编码 agent Grok Build 整套源码放上了 GitHub,Apache 2.0 许可,等于把 agent loop(上下文组装 + 模型响应解析)、代码工具(读/改/搜/执行命令)、终端 UI(输入处理 + diff 审阅)和扩展框架全部亮出来给人审计和魔改。更关键的是它现在能完全 local-first 跑:自己编译、把它指向你本地的推理服务、所有配置走 config.toml——不必依赖 xAI 云端。它和本周 DeepSeek、GLM 的开源权重是同一股风:编码 agent 这层的 harness 也在从闭源黑盒变成可自托管的公共件。
另有 2 家信源报道
展开详情
- **开源范围**:agent loop、代码工具、终端 UI、扩展框架全套源码上 GitHub,Apache 2.0,可审计可魔改
- **local-first**:能自己编译、指向本地推理、配置走 config.toml,不必依赖 xAI 云端
- **同一股风**:叠加本周 DeepSeek/GLM 开源权重——编码 agent 的 harness 也在从闭源黑盒变公共件
推荐理由:对开发者,这是一份免费的『生产级 agent 是怎么搭的』教材:与其从零猜 agent 的上下文怎么组、工具怎么调、diff 怎么审,不如直接读 Grok Build 这类开源 harness 的源码,把它的结构抄进你自己的项目。会读、会改开源 agent harness,正在成为比『会用某个闭源编码工具』更硬的能力——因为它让你能把 agent 接到自己的本地模型和私有流程上,这正是企业私有化场景最想要的。
#08
Hugging Face
Product
NEW
Kimi K3:Moonshot 开源 2.8T 稀疏 MoE 权重,改良版 MIT 许可
Moonshot 在 7 月 26 日把 Kimi K3 的完整权重放上了 Hugging Face——一颗 2.8 万亿总参的稀疏 MoE 模型,采用改良版 MIT 许可。节奏是先在 7 月 16 日的上海世界人工智能大会以 API 形式亮相,十天后再放开权重。它和 DeepSeek V4-Flash 一起,构成本周『中国系开源大模型密集放权重』的又一例:把万亿级模型的权重直接开放出来,进一步压低了『拥有一颗前沿量级模型』的门槛。对多数个人来说 2.8T 无法本地跑,但它进一步夯实了开源阵营在参数量级上追平闭源的态势。
另有 1 家信源报道
展开详情
- **体量**:2.8 万亿总参稀疏 MoE,Modified MIT 许可,完整权重已上 Hugging Face
- **节奏**:7/16 世界人工智能大会先上 API,10 天后(7/26)放权重——先服务再开源的打法
- **趋势**:与 DeepSeek V4-Flash 同周,构成『开源阵营在参数量级上持续追平闭源』的又一注脚
推荐理由:对普通人,Kimi K3 这类万亿级开源权重的直接价值不是拿回家跑(跑不动),而是它压低了整个市场的模型成本曲线:越来越多云厂商、推理平台会托管这些开源权重,你能以更低价格调到接近前沿的能力。机会在于早点摸清『同一个开源模型在哪家平台托管最便宜/最快』,把你的产品成本压下去;以及关注这些模型在中文和特定任务上的实测表现,抢先用在国内场景的应用里。