Hall of Fame
今日趋势综述
今天的信号:智能已经白菜价,值钱的是把它『送到位』
把今天的几条线连起来看,一个判断越来越清楚:模型有多聪明,正在不再是竞争的关键。第三方中立评测(vals.ai)本周的 SWE-bench Verified 榜上,Claude Opus 5 97.0%、DeepSeek V4 Pro 96.4%、GPT-5.6 Sol 96.2%、Grok 4.6 95.6% 几乎挤成一条线——分数已经卷到天花板,谁比谁高一两个点,普通人根本感受不到。真正的地震在价格:DeepSeek V4 Pro 用约 $0.022/题 打平了单价 $1.29 的 Opus 5,便宜了近 60 倍。换句话说,前沿级的智能已经变成了随手可得、几乎不要钱的原材料。
原材料一旦白菜价,价值就会往两头跑:一头是『怎么把它稳稳送进现实』,一头是『用它解决哪个具体的人的具体问题』。今天热榜和搜索里冒头的东西,无一例外都在这两头——unsloth 把本地训练/运行模型做成开箱即用的桌面 GUI,让你能拥有并微调自己的模型;microsandbox 解决『让 agent 安全地跑它自己写的代码』这个部署硬骨头,已经被 LlamaIndex、Vercel 采用;Lightricks 的 LTX-2 把 4K 音视频生成开源到消费级显卡上;连一篇 position 论文都在提醒:SWE-bench 这类刷分榜,可能根本没对齐真实的『agentic 软件工程』。而教育(Khanmigo 报出比传统辅导多 34% 的学习增益)、FDE(岗位两年暴涨 42 倍,因为『瓶颈不再是模型能力,而是塞进混乱的企业环境』)、给小微企业做自动化的自由职业者(月入 $3K–25K),讲的都是同一件事:把现成能力交付到位,比造更强的模型更值钱。
对个人最实在的一条:别再纠结『用哪个模型最强』——它们都够强,而且越来越便宜。把精力押到『交付力』上:选对性价比的模型(同样的活,DeepSeek 便宜 60 倍你还坚持用最贵的吗)、把它可靠地接进一个真实场景、对准一个具体人群的具体痛点。教育、法律、本地小店、某个行业的重复流程——谁能把这份白菜价的智能真正『用到某个人身上』,谁就站在了价值这一端。这不需要你会训模型,需要的是懂一个场景、并且能把 AI 稳稳送进去。
本周编码模型中立横评:顶尖挤在 96–97%,但 DeepSeek V4 Pro 用 1/60 的价格打平了它们
展开详情
- **对比(SWE-bench Verified,Vals AI 中立 harness)**:Opus 5 97.0% vs DeepSeek V4 Pro 96.4% vs GPT-5.6 Sol 96.2% vs Grok 4.6 95.6% vs Kimi K3 93.4%——头部几乎并列
- **价格才是分水岭**:同一评测里每题成本 DeepSeek V4 Pro ≈$0.022 vs Grok 4.6 ≈$0.785 vs Opus 5 ≈$1.29,性能打平、单价差约 36–60 倍
- **开源在逼近**:开源权重 Kimi K3(93.4%)已反超上一代闭源 Opus 4.8(88.6%)、Grok 4.5(86.6%),前沿与开源的差距缩到个位数
unslothai/unsloth
展开详情
把『本地训练/运行大模型』从一堆 Python 环境变成开箱即用的桌面 GUI:unsloth 本周随 Unsloth Desktop(Beta)冲榜,用手写 Triton kernel 做到约 2× 训练速度、省 70% 显存,覆盖 Qwen3.8、Kimi K3、MiniMax-H3、Gemma 4、DeepSeek-V4、FLUX 等,从数据准备、训练(含 GRPO 强化学习)、实时 loss 监控到导出一条龙,全程无代码、跑在自己的硬件上。
周增长:本周约 +3,329 星(周榜读数,未经 API 核实)
- **本地训练做成桌面 GUI**:Unsloth Desktop(Beta)把微调全流程(数据→训练→GRPO 强化学习→实时 loss→导出)无代码化,跑在自己的硬件上
- **性能是真卖点**:手写 Triton kernel 约 2× 训练加速、省 70% 显存,MoE 模型最高 12× 加速,号称零精度损失
- **覆盖主流开源权重**:Qwen3.8、Kimi K3、MiniMax-H3、Gemma 4、DeepSeek-V4、FLUX 等——本周约 +3,329 星、累计约 73.5K
Position 论文:SWE-bench 这类编码榜,可能根本没对齐真实的『agentic 软件工程』
展开详情
- **核心立场**:SWE-bench 这类『修单 issue + 给定环境』的基准,和真实 agentic 软件工程(自主定位、跨模块规划、协作、长期维护)并不对齐
- **为什么重要**:头部模型集体 96–97%,容易被读成『编码已解决』,但基准饱和 ≠ 真实工程能力到位
- **给评测方法踩刹车**:主张把评测往『更贴近真实工作流』重做,别用一个错位的高分掩盖真实交付的差距(立场/方法论文,具体论证见原文)
superradcompany/microsandbox
展开详情
给 AI agent、用户代码、插件、CI 任务这类『不可信负载』提供本地就能跑的隔离沙箱:用微虚拟机(microVM)做硬件级隔离,平均 100ms 以内启动,兼容 OCI 容器镜像,提供 Rust/Python/TS/Go SDK 和 CLI,还专门做了『Agent-Ready』——集成 Agent Skills 和 MCP server,让 agent 能自己开沙箱、在隔离环境里安全执行自己写的代码。
周增长:本周约 +352 星(周榜读数,未经 API 核实)
- **为『跑 agent 写的代码』而生**:microVM 硬件级隔离 + 平均 <100ms 冷启动,不可信代码出错炸不到宿主机,比容器更安全、比 VM 更快
- **Agent-Ready**:内置 Agent Skills 与 MCP server,agent 可自主开沙箱执行自己生成的代码;Rust/Python/TS/Go 可嵌入 SDK + CLI
- **已被真实项目采用**:LlamaIndex、Vercel(Eve)、Tuist(Condukt)在用,Apache 2.0 开源——『安全执行层』正成为 agent 基础设施必需品
Lightricks/LTX-2
展开详情
Lightricks 开源的音视频生成基础模型:一次前向就同步生成画面 + 声音(对口型、拟音、环境音),原生 4K、最高 50fps,且能跑在消费级显卡上;本月还放出了更新的 LTX-2.5 开源权重,附官方推理与 LoRA 训练包。
周增长:本周约 +544 星(周榜读数,未经 API 核实)
- **音画一次生成**:单次前向同步产出画面 + 对口型/拟音/环境音,省掉『先出视频再配音对口型』的整条后期链路
- **开源 + 消费级可跑**:原生 4K、最高 50fps,完全开源权重、能在消费级显卡上运行,可审计/微调/训练自己的变体
- **商用门槛友好**:学术免费、ARR<1000 万美元公司免费商用;本月更新的 LTX-2.5 附官方推理与 LoRA 训练包——本周约 +544 星
教育 AI 落地实测:AI 辅导比传统辅导多 34% 学习增益,用更少时间拿到更高分
展开详情
- **对比数据**:用 Khanmigo 的学生比传统辅导多约 34% 学习增益(NBER),弱势社区学生受益更明显
- **又好又快**:RCT 里 AI 导师组后测分数显著更高、用时更少(约 49 分钟 vs 传统 60 分钟);完成率 +70%、辍学率 -15%
- **采用率全行业最高**:教育机构 86% 在用生成式 AI,K-12 从 23%→78%、高校 41%→92%;市场 2025 约 76 亿→2034 超 1120 亿美元
FDE(前置部署工程师)为什么成了企业 AI 的『交付层』:岗位两年暴涨 42 倍,因为瓶颈不再是模型
展开详情
- **两年 42 倍**:FDE 岗位 2023–2025 增长约 42 倍,远超普通 AI 工程师岗的约 13 倍;增速最陡在垂直 AI 创业公司
- **瓶颈变了**:不再是模型能力,而是『部署进混乱的企业环境』——FDE 住进客户现场 60–180 天,把模糊问题变成可落地的集成与产品
- **薪酬硬**:种子期约 $200K 全包,C 轮 $450K–$550K+;Palantir 打法成行业默认,Google Cloud/OpenAI/Anthropic/Salesforce 等都在抄
50+ AI 自由职业者真实收入拆解:靠给『没技术团队的企业』搭自动化,月入 $3K–25K
展开详情
- **真实收入区间**:调查 50+ 从业者,卖 AI 服务月入普遍 $3K–25K;最赚且最不用写代码的是 n8n/Make 自动化搭建
- **单位经济清楚**:单个自动化项目 $2,000–5,000、实投约 2–8 小时;叠加 $200–500/月/客户 retainer,10 客户≈$2K–5K/月准被动
- **成长节奏**:第 3–4 个月普遍做到月入 $5K,首月现实目标 $500–2,000;成事的人都是『选窄利基 + 建一个分销渠道』