Hall of Fame
Hall of Fame
Track
Type
Source
9月14日
今日趋势综述
本周的主线是『智力正在变便宜』:Gemini 3.8 Flash 用近前沿的分数把价格打到旗舰的十分之一,推理成本两年掉了 95%——真正决定胜负的护城河从『模型多强』转向『你把它接进谁的业务、喂什么数据、怎么持续收钱』。
今天的信号:模型越来越像自来水,赚钱的却是修水管的人
把今天几条放到一起看,会发现它们在讲同一件事的正反面。正面是价格:Google 一口气把 Gemini 3.8 Flash 的智力分做到 59(离 GPT-6 Astra 的 61.1 只差两三分),输入价却只有 $0.75/百万 token——是 Astra 的十三分之一;放到两年维度,同等质量的推理成本整整掉了 95%,一个每天跑五千万 token 的编码团队从月付两万多美元变成四百美元。智力正在变成拧开就有的自来水。
#01
artificialanalysis.ai
Article
NEW
Gemini 3.8 Flash 独立评测:智力 59 逼近 GPT-6 Astra 的 61.1,输入价却只要 1/13,选型该按『任务×成本』分层
Google 四个月内第四次更新 Flash 系列,这次的 Gemini 3.8 Flash 在 Artificial Analysis 智力指数上拿到 59 分(高推理档),已经贴到 GPT-6 Astra 的 61.1 分身后,只差两三分;但价格是另一个世界——Gemini 3.8 Flash 输入 $0.75、输出 $3.75(每百万 token,年底前),而 GPT-6 Astra 是输入 $10、输出 $50,Astra 的输入价整整贵约 13 倍;Claude Opus 5 以 $5/百万输入卡在中间。结论不是『谁最强』,而是同一条智力曲线上,顶端每多两三分要多付十几倍的钱。第三方的读法很一致:绝大多数量产任务用 Flash 这类『近前沿+极低价』的模型就够,把最贵的旗舰只留给真正吃力的长链路推理。
另有 2 家信源报道
展开详情
- **对比**:智力指数 Gemini 3.8 Flash 59 vs GPT-6 Astra 61.1(同为 AA 智力指数高推理档)——顶端差距已被压到两三分
- **价差**:输入价 Gemini 3.8 Flash $0.75 vs Claude Opus 5 $5 vs GPT-6 Astra $10(每百万 token),最强档要贵约 13 倍
- **分层选型**:量产/高并发任务用 Flash 级模型,复杂长链路推理再上 Astra/Opus——按『任务难度×单位成本』分档,而不是全用旗舰
推荐理由:对普通人的机会:不要被『新旗舰又刷榜』绑架。真正拉开成本差距的是选型策略——同一个产品里,把 90% 的普通调用交给 Gemini 3.8 Flash 这类近前沿平价模型,只在啃硬骨头时切到旗舰,账单能差出一个数量级。学会『按任务给模型分档 + 用便宜模型兜底』这套路由能力,是这轮降价里普通开发者最值钱的手艺。
#02
valueaddvc.com
Article
NEW
推理成本两年坍塌 95%:同等质量的编码工作负载从月付 $22,500 掉到 $405,护城河被逼着从模型挪到数据与分发
把 Gemini 3.8 Flash 这类降价放到两年维度看,是一场系统性坍塌:硬件级投机解码、超大集群、MoE 架构叠加,让同等质量的推理价格掉了约 95%。一个每天处理五千万 token 的 AI 编码团队,从 2025 年的月付约 $22,500,降到 2026 年的约 $405——降幅 55 倍。分析者的判断很直接:『推理还能多便宜』这个问题正在归零,接下来的问题是『你在近乎免费的智力之上建什么』——专有数据、工作流的所有权、分发渠道。模型是大宗商品,围着它建的一切才是护城河。文章也给了两条落地建议:算账要按『每次完成的交互成本』而不是每 token 成本;共享 system prompt 的场景用 prompt 缓存能再降 2–10 倍。
另有 2 家信源报道
展开详情
- **数字**:同等质量推理两年降约 95%;五千万 token/天的编码工作负载从 $22,500/月 → $405/月(约 55 倍)
- **护城河转移**:模型变大宗商品,真正的壁垒是专有数据 + 工作流所有权 + 分发,而不是『我用了哪个模型』
- **算账口径**:盯『每次完成交互的成本』而非每 token;共享 system prompt 用缓存再省 2–10 倍
推荐理由:对普通人的机会:便宜到极致的智力对每个人是同一份公开福利,所以拼『谁能调用模型』已经没有差异。真正的机会是去积累别人复制不了的东西:某个垂直的专有数据、一条被你握住的分发渠道、一套嵌进客户日常的工作流。今天开始就问自己一句——如果模型免费,我这门生意还剩下什么值钱?答得上来的地方,才是该投入的地方。
#03
digital-adoption.com
Article
NEW
零售 AI 落地实测:Sephora 虚拟试妆把转化拉高 30%、退货降 30%,Walmart 预测补货让 4700 家店缺货降 30%
零售是本周『AI 从概念走到账本』最扎实的一个行业。拿到具体数字的都不是『上了大模型』本身,而是把 AI 接进了某个具体环节:Sephora 的 Virtual Artist 用 AR 试妆把购买转化率提高约 30%、退货率降低约 30%,其 AI 导购让 App 互动 +25%、整体销售 +15%;Walmart 把机器学习铺进 4700 多家门店的需求预测与补货,缺货减少约 30%,路径优化一年省下约 3000 万英里的无效里程,并落地了 150+『未来门店』做无人化库存与无感结账;H&M 则把供应商排期、仓库库存、门店销售汇到一个 Google Cloud 数据平台上统一预测。共同点是:见效的都是『接进已有业务流的具体动作』,不是炫技的通用聊天。
另有 1 家信源报道
展开详情
- **Sephora**:AR 虚拟试妆购买转化 +30%、退货 -30%;AI 导购带来 App 互动 +25%、整体销售 +15%
- **Walmart**:4700+ 门店预测补货,缺货 -30%,路径优化年省约 3000 万英里,落地 150+『未来门店』
- **共性**:拿到数字的都是『AI 接进试妆/补货/客服某个具体环节』,而非通用对话——落地颗粒度决定 ROI
推荐理由:对普通人的机会:零售的经验对任何想用 AI 的人都通用——价值不在『用了多聪明的模型』,而在你把它精准塞进哪个高频、可量化的环节(试妆之于转化、预测之于补货)。想切入行业 AI,先别谈平台,先找那个『每天重复、结果能用数字衡量』的动作,把 AI 接进去、把前后对比拉出来,这就是最有说服力的作品。
#04
getperspective.ai
Article
NEW
FDE 组建打法:把模糊的企业问题变成可交付产品,靠『嵌进客户现场 60–180 天』这套前向部署方法论
这是一份写给创始人的『怎么搭 FDE(前向部署工程师)团队』手册,把这个 2026 年最火的 AI 岗位讲清楚了。FDE 不是写脚本的外包,而是带着客户判断力、住进客户环境 60–180 天的工程师:他要把厂商平台和客户的遗留系统之间的整套架构桥起来——梳理旧系统、规划微服务与 API 网关、搭 ETL 管道把数据喂进向量库、落实安全治理,再把架构约束反馈回核心产品团队。手册给了三种组织形态:按客户建 pod、按垂直行业建 pod、按产品做矩阵。之所以成为主线打法,是因为 AI 实验室已经把 FDE 当成企业收入的第一引擎——Anthropic 头一百个企业合同就是 FDE 关下来的,OpenAI 也把企业 GTM 重组成内部叫 Applied AI Engineer 的组织。
另有 2 家信源报道
展开详情
- **定义**:FDE = 带客户判断力、驻场 60–180 天、把模糊企业问题变成可上线产品的工程师,owner 不是做 demo
- **干的活**:桥接厂商平台与客户遗留系统——梳理旧系统、规划微服务/API 网关、搭 ETL 喂向量库、做安全治理
- **组织形态**:按客户 pod / 按垂直 pod / 按产品矩阵三选一;已是 Anthropic、OpenAI 拿企业收入的第一引擎
推荐理由:对普通人的机会:AI 时代最稀缺、最难被模型替代的能力,是『把通用模型送进某个具体企业的脏乱业务里并对结果负责』。这条路不要求你会训模型,要求你既懂工程又能读懂客户的真实约束。想涨身价,就刻意练两件事:一是深入某个行业把它的系统和痛点摸透,二是练『把模糊需求拆成可交付方案』的落地力——这正是 FDE 溢价的来源。
#05
trysetter.com
Product
直接可用
NEW
Setter AI(AI 短信预约成交)
Setter AI 是给服务型生意做『AI 自动跟进+约客』的工具:新线索一进来,它在约 10 秒内通过 WhatsApp/SMS 回复、来回聊、直接把预约写进日历,24 小时不打烊,官方称线索到预约的转化率能做到 15–52%。创始人早期做的是 AI 打电话,因为电话接通率只剩 15–20%、技术不稳、客户流失严重,果断转型做『文字预约』——这一转把生意从 0 做到 $10K MRR、又崩回 0、如今重新回到 $10K+ MRR。定价按客户想触达的线索量分档,$49/月起,最高约 $5K/月,已服务 Mindvalley 这类客户;获客主要靠 SEO,辅以 YouTube 长视频和直销。技术栈是 Supabase + OpenAI + Stripe,TypeScript/Svelte。
另有 2 家信源报道
展开详情
- **痛点即卖点**:服务型生意最怕线索凉掉——Setter 在约 10 秒内用短信/WhatsApp 跟进并直接约进日历,转化 15–52%
- **转型故事**:从 AI 打电话(接通率仅 15–20%、不稳、高流失)转做文字预约,才把 MRR 从 0→崩回 0→重回 $10K+
- **可复制结构**:按线索量分档收费 $49–5K/月,SEO 获客 + 现成大模型 API,是个人能照抄的『垂直代约客』模型
推荐理由:对想挣现金流的普通人意味着:不需要发明新技术,只要盯住『线索接不住、约不上』这个所有服务生意都痛的环节,用现成大模型 API 拼一个『秒回+自动约客』的小工具,就能按月收费。Setter 的关键教训有两条——一是选『文字』这种更稳的渠道而不是炫酷但不可靠的语音,二是靠 SEO 做可持续获客。先服务一个熟悉的本地垂直(健身房、诊所、装修),把同一套跟进流程复制给同行。
My Take:评分(5=最优):最快成交 4 / 最低成本 4 / 可复制 4 / 风险安全度 4。盯住服务生意『线索接不住』的刚需,用现成 API 拼秒回约客工具按月收费,个人可起步。
商机信号(加速):谁付钱:有稳定线索但接待人手不足的本地服务生意:健身房、私教、诊所/牙科、美容院、装修/家政、教培、房产中介,以及靠预约成交的成长期服务型 SaaS 痛点:线索来了没人在 10 秒内跟进就凉了、电话没人接、人工排班约客成本高又漏单——直接损失的是能成交的钱 切入点:先锁一个你熟的本地垂直,用大模型 API + WhatsApp/SMS + 日历接口搭一套『新线索秒回并自动约进日历』的模板,按线索量分档收月费,从头 3 个同行客户起步再横向复制
#06
GitHub
Article
NEW
Skill Seekers:把任意文档站/GitHub 仓库/PDF 一键变成 Claude 专属技能,还自带冲突检测
Skill Seekers 解决的是 skill 生态里一个很实在的痛点:好用的 skill 得有人写,但把一份框架文档手动整理成 SKILL.md 要耗好几个小时。它能把文档网站、GitHub 仓库、PDF(含扫描件 OCR)一把抓下来,20–40 分钟自动生成一个可直接用的 Claude 技能,支持 llms.txt、通用爬取、智能归类,还能把多来源(文档+代码+PDF+视频)合并成一个知识资产,并做冲突检测避免同名/矛盾内容打架。换句话说,它是一个『造技能的技能』——让你为任何一个框架、API、内部工具快速造出 agent 的专属上下文,而不用等官方出 skill。
另有 1 家信源报道
展开详情
- **造技能的技能**:文档站/GitHub/PDF(含 OCR 扫描件)→ 20–40 分钟产出可用 SKILL.md,省下手工整理几小时
- **多源合并**:把文档+代码+PDF+视频揉成一个知识资产,并做冲突检测,避免同名或矛盾内容互相打架
- **补生态缺口**:官方没出 skill 的框架/内部工具,你可以自己一键生成 agent 专属上下文,不用干等
推荐理由:对普通人的机会:与其到处收藏别人的 skill,不如学会为自己常用的框架、公司内部文档、甚至一本技术书自造 skill——这才是把 agent 真正调教成『懂你这摊活』的关键。当大家都能装通用 skill 时,你手里那套围绕专有文档和私有流程生成的 skill,就是别人复制不走的差异。会造、会审、会维护 skill 的『元技能』,正在成为比堆 skill 数量更稀缺的能力。
#07
arXiv
Paper
NEW
CityReal: Human-Aligned Urban Behavior and City Dynamics Simulation with Large-Scale LLM Agents
此前用 LLM 当 agent 模拟城市居民日常,看着挺像,但有个硬伤:模型靠 few-shot 提示生成行为,结果 agent 复刻的是大模型自带的行为先验,而不是目标城市真实人口的样子——个体像人,群体却不对。CityReal 提出一个模块化框架,把 agent 建成『意图驱动』的决策者:它们追求连贯的出行和活动计划,而不是一步步孤立选择,并会随经验和约束学习自己的习惯与偏好。关键创新是为各行为模块学习『文本适配器(textual adapter)』,把 agent 的决策向真实人口统计对齐。实验显示,CityReal 在微观(个体行为)和宏观(人口分布)两个层面都更贴近真实世界。
让大规模 LLM agent 模拟出的城市行为真正对齐真实人口统计,而不是复刻大模型自带的行为偏好
另有 1 家信源报道
展开详情
- **问题**:few-shot 提示让 agent 复刻大模型的行为先验,个体像人、群体却偏离真实人口分布
- **方法**:意图驱动决策 + 为行为模块学习『文本适配器』,把决策对齐到观测到的人口统计
- **结果**:微观个体行为与宏观人口分布两个尺度上都更贴近真实世界,可用于城市/交通/政策模拟
推荐理由:对普通人的机会:这篇提醒我们,多智能体模拟真正难的不是『让 agent 像个人』,而是『让一群 agent 合起来像真实世界』——决定可信度的是有没有真实数据来校准。想在 agent 应用上做出别人做不出的东西,护城河往往不在提示词,而在你能否拿到、并用来对齐的那份真实行为数据。谁掌握了校准数据,谁的模拟/推荐/决策才可信。
#08
simonw.substack.com
Article
NEW
Simon Willison:让编码 agent 真正好用的,是工程实践而不是更强的模型
在模型越来越便宜、越来越同质的当下,Simon Willison 反复强调一个被低估的点:决定编码 agent 能不能干活的,往往不是模型强弱,而是围绕它的工程实践。他梳理的一套『agentic engineering patterns』核心是——给 agent 一个能自我验证的闭环:清晰、可复现的测试与检查(让 agent 自己知道有没有做对),受控且相关的上下文(喂错上下文再强的模型也会『腐烂』),以及把大任务拆成可验证的小步。他也一直提醒 agent 的安全边界(比如恶意上下文和权限问题)。一句话:模型是原料,让它稳定产出价值的是你搭的脚手架和反馈回路。
另有 2 家信源报道
展开详情
- **闭环优先**:给 agent 可复现的测试/检查,让它能自我验证对错,比换更强的模型更能提升产出
- **上下文治理**:喂错或过量上下文会让再强的模型『腐烂』,受控、相关的上下文是工程重点
- **拆小步**:把大任务切成可验证的小步 + 关注 agent 的安全边界,是让 agent 真正上生产的关键
推荐理由:对普通人的机会:当所有人都能用上同样便宜又强的模型,差距就落在『你会不会用工程手段驾驭它』。与其追新模型,不如把功夫下在可复现的测试、干净的上下文、任务拆解和反馈回路这些『脚手架』上——这套工程直觉能迁移到任何模型、任何工具,是比『会用某个产品』更保值的能力。