Hall of Fame
今日趋势综述
今天的信号:AI 的价值正从『更大的模型』转向『更会用模型』
把今天几件事连起来看,会发现它们指向同一个方向——2026 下半年,前沿模型本身已经不再是稀缺品,稀缺的是『怎么把它用好、用便宜、用在离钱最近的地方』。微软 SkillOpt 不动一根模型权重,只在文本空间里像训神经网络那样反复打磨一份 best_skill.md,就能把一个冻结的模型在各类任务上平均拉高二十多分;Kyutai 把一个能语音克隆的 TTS 压进 1 亿参数、塞进 CPU,MacBook Air 上比实时还快 6 倍;LMCache 用一层 KV 缓存把 LLM 推理成本和延迟砍下来。三件事看似无关,其实是同一件事的三个切面:让 AI 的能力变得更可复用、更本地、更便宜。
这对个人的含义很直接:你不需要拥有最强的模型,也不需要会训练,就能吃到这一轮红利。真正值钱的能力,正在从『会调大模型』下移到两头——一头是『会把经验沉淀成可复用的技能和记忆』(今天那篇 agent 记忆综述系统地讲了这件事该怎么做),另一头是『会把某个具体行业的具体苦活,用现成模型包成一个窄产品直接卖钱』。Setter AI 就是后者的活样本:一个从没打过工的人,用 OpenAI 的模型做了个『帮服务业自动跟进线索、约客上门』的文本助手,靠 SEO 冷启动,反复摔过又爬回 $10k 月收入。
所以如果你在找方向:别去追那个每周都在换的『最强模型』榜单,把注意力放在中间层——把 AI 的能力压小、压近、压成一份能复用的技能或一个能收钱的窄产品。谁离『可复用』和『可收钱』这两个词更近,谁在这一轮里就更稳。
microsoft/SkillOpt
展开详情
SkillOpt 解决的是一个越来越普遍的痛点:你手里的模型是冻结的(要么是闭源 API,要么你没算力去微调),但你又想让它在你的特定任务上变得更强。它的答案是——不碰模型权重,只在『文本空间』里训练技能。整个流程像训神经网络一样有 epoch、有 mini-batch、有学习率、有验证门:让 agent 反复跑任务(rollout)、反思哪里做错了(reflect)、把经验聚合筛选(aggregate/select)、更新成一份自然语言的技能文档(update),再用基准验证是否真的变好(evaluate)。最后产出的就是一份可直接部署的 best_skill.md,把它喂给同一个冻结模型,就能在直接对话、Codex agent 循环、Claude Code 里分别平均提升约 23.5 / 24.8 / 19.1 分。它不是又一个 agent 框架,而是把『让模型变强』这件事,从改权重变成了改一段可读、可版本化、可分享的文字。
- **不动权重、只改文字**:把『让冻结模型变强』变成迭代一份自然语言技能文档,闭源 API 也能用,个人无需任何训练算力
- **像训神经网络一样有纪律**:epoch、mini-batch、学习率、验证门一应俱全,靠 rollout→reflect→update→evaluate 闭环,避免『拍脑袋写 prompt』
- **实测涨点明显且可迁移**:跨六基准、七模型、三种 harness,直接对话 +23.5、Codex 循环 +24.8、Claude Code +19.1 分,产出的 best_skill.md 可直接部署分享
kyutai-labs/pocket-tts
展开详情
pocket-tts 解决的是『高质量语音合成一直需要 GPU 或云 API,个人和小项目用不起、也不敢把声音数据传上云』这个矛盾。Kyutai 的答案是把整个 TTS 压到 1 亿参数、能完全跑在 CPU 上——不需要显卡、不需要联网、不需要调任何云端接口。它首个音频块延迟约 200ms,在 MacBook Air M4 上比实时还快约 6 倍;支持英、法、德、葡、意、西六种语言;还能语音克隆——只要给一段 wav,它就能模仿那个声音说话。用法也极简:作为 Python 库调用,或命令行 `pocket-tts generate`,或 `pocket-tts serve` 起一个本地服务在浏览器里用。它把『能说话的 AI』从一件需要基础设施的事,变成了一件在你自己笔记本上随手就能跑的事。
- **塞进 CPU、不用显卡**:1 亿参数全程跑在 CPU 上,MacBook Air M4 比实时快约 6 倍、首块音频约 200ms,个人零基础设施即可用
- **本地 + 可克隆**:完全离线运行、声音数据不出机器,给一段 wav 就能语音克隆,正吃隐私敏感与低成本两类刚需
- **上手极简**:可作 Python 库、命令行 `pocket-tts generate` 或 `serve` 起本地服务在浏览器用,六种语言开箱即用,MIT 生态围绕它已长出多个 Web UI / ComfyUI 封装
OpenAI 发布 GPT-Live:一边听一边说的全双工语音模型,还会用『嗯』『对』搭话、该安静时就闭嘴
展开详情
- **全双工、边听边说**:不再是『你说完它才答』,能同时听和说、会附和会接话、也会在你思考时安静,交互质感接近真人对话
- **分级 + 会转包**:GPT-Live-1 付费默认、mini 免费默认,底层默认 GPT-5.5,碰到难题临时派给更强前沿模型算完再带回,兼顾流畅与深度
- **全球全平台铺开**:iOS/Android/Web 同步上线、支持多语言、含实时翻译与『Hey Chat』唤醒词,API 也在排队开放
LMCache/LMCache
展开详情
LMCache 解决的是自托管/自建 LLM 服务时最痛的一块成本:每次请求都要重新计算 KV 缓存,长上下文、重复前缀(比如同一份长文档反复问、同一套系统提示反复用)会白白烧掉大量算力和时间。它是一层专门的 KV 缓存管理层,把这些键值缓存高效地存起来、跨请求复用,从而给可扩展的 LLM 推理提速、降本。它不是又一个模型,而是让你已经在跑的模型跑得更便宜、更快的基础设施件——尤其在 RAG、长文档问答、多轮对话、agent 反复调用同一上下文这些今天最主流的场景里,收益最直接。
- **专治重复计算**:把 KV 缓存跨请求复用,长上下文、重复前缀、多轮对话不再每次从头算,直接省算力省时间
- **面向真实场景**:RAG、长文档问答、agent 反复调用同一上下文这些今天最主流的用法收益最大
- **基础设施件、可组合**:不是新模型,而是给你已在跑的模型提速降本,能与 vLLM 等推理引擎配套,自托管方最该关注
Setter AI:一个从没打过工的人,用 OpenAI 做了个『帮服务业自动跟进线索、约客上门』的助手,摔到 $0 又爬回 $10k 月收入
展开详情
- **极窄场景 + 现成模型**:只做『帮服务业自动跟进线索、约客上门』一件事,套 OpenAI 的 LLM,不自研模型,需求真、成交快
- **先收钱再做产品**:产品还没影时先说服客户预付 $500 验证需求,把『会不会有人真付钱』这个最大风险提前排掉
- **SEO 冷启动、摔了能爬回**:主靠 SEO+简单落地页拿流量,YouTube/直销辅助;$0→$10k→$0→$10k 的真实曲线,证明窄现金流生意可修复可重来