Hall of Fame
今日趋势综述
今天的信号:旗舰越来越贵,钱却越来越往『会组装的人』手里流
把今天几条线索连起来,会看到一个越来越清晰的分叉。一边是前沿模型:GPT-6 Astra 把 token 价格一口气抬到 GPT-5.6 Sol 的 2.5 倍($10/$50),换来的却只是在 Artificial Analysis 智力指数上和 Claude Fable 5.1 并列第一——能力已经见顶,涨的是价。另一边,是把这些能力接进真实业务的人在闷声赚钱:Factory 靠企业级编码 Droid 五个月估值翻三倍到 50 亿美元,客户是 Nvidia、Blackstone、RBC;牙科诊所的 AI 语音前台被做成白标转售的生意,20 万家诊所、每家每年因漏接电话损失数万美元的缺口,正被按 $0.05/分钟的用量定价一点点填上。
中间还有一条容易被忽略的暗线:能力过剩之后,『质量』和『可评估性』成了新的稀缺。obra/superpowers 这类把开发方法论固化成技能库的项目冲到 28 万星,Graphify 把代码库变成可查询知识图谱、也做成了跨 agent 的技能——它们卖的都不是模型,而是『怎么让模型把活干对』的工程范式。学术界同步给出量尺:SkillsBench 这类基准专门测『一个技能到底有没有改变 agent 的行为』,回应了公开技能库 190 万个、平均质量却只有 6.2/12 的行业尴尬。
对个人,今天的行动方向很具体:第一,别再为『榜首』多掏钱,学会看『每完成一个任务多少钱』来分层调度模型;第二,选一个你熟的垂直场景(诊所、教培、门店),把现成的便宜能力 + 现成的技能组装成能收月费的服务,交付本身就是护城河;第三,AI 教育今天的数据(Khanmigo 用户一年从 4 万涨到 70 万,但只有 15% 的人真的在用)提醒我们——能力落地的瓶颈从来不是技术,而是让人真正用起来的那『最后一公里』,谁能补上,谁就吃到红利。
GPT-6 Astra 涨价 2.5 倍却只是并列第一:智力指数打平 Fable 5.1,选型该看『每任务成本』而不是 token 单价
展开详情
- **对比(智力打平)**:GPT-6 Astra(max)53 vs Claude Fable 5.1(max)53,并列第一,行业中位数仅 24(Artificial Analysis 智力指数)
- **对比(单价却翻倍)**:Astra 输入/输出 $10/$50 vs 前代 GPT-5.6 Sol $4/$20,涨价 2.5 倍;编码上 Terminal-Bench 4.0:Astra 58.2 vs Fable 5.1 57.9,几乎无差
- **反直觉**:因 Astra 输出更简洁,其『每任务实际成本』约为 Fable 5.1 的 40%——token 单价高 ≠ 干完一件事更贵
AI 教育落地实测:Khanmigo 用户一年 4 万→70 万(17 倍),但只有 15% 真的在用——瓶颈从来不是模型
展开详情
- **规模对比**:Khanmigo 用户 4 万→70 万(17 倍/年)、学区 45→380+;Duolingo 一年服务 70 万学生、148 门课
- **效果对比(试点 vs 严谨 RCT)**:试点提升 1.4 个年级、Squirrel AI 1.2 个年级/学速 5.4 倍;但两年随机对照实验只测出每学期 +1.26 个百分位
- **真瓶颈**:有权限的学生只有 15% 实际使用——落地卡在『让人真用起来』的最后一公里,不是模型能力
Factory:企业级编码 Droid 五个月估值翻三倍到 50 亿美元,客户全是 Nvidia、Blackstone 这类大厂
展开详情
- **增长信号**:估值 5 个月从 15 亿→40 亿→50 亿美元,翻三倍;本轮 2 亿美元,总融资超 4 亿
- **客户即护城河**:Nvidia、Blackstone、RBC、Palo Alto Networks、Adobe、T-Mobile 已在生产环境用 Droid
- **赛道转向**:竞争焦点从『agent 会不会写代码』转到『大企业敢不敢把 SDLC 交给它、能不能衡量与管控』
牙科诊所 AI 语音前台正在被『白标转售』:20 万家诊所、每家每年漏接电话损失数万美元的现金流缺口
展开详情
- **痛点有价**:全美 20 万+ 牙医,每家每年因漏接电话损失数万美元产值,且漏的多是新患者——ROI 一算就通
- **技术已现成**:CloudTalk、Adit(5000+ 诊所)、LuMay($0.05/分钟、<500ms、原生对接 Dentrix/Open Dental)等可直接用,无需自研
- **个人切口**:Trillet 等平台开放白标转售,个人做『本地诊所语音前台代装代运营』,按月收订阅 + 安装费
A Framework for Evaluating Agentic Skills at Scale(SkillsBench:怎么测一个技能到底有没有改变 agent 的行为)
展开详情
- **测行为而非输出**:SkillsBench 用手写任务 + 单元测试,直接量化『装了技能 vs 没装』的 agent 行为差异
- **回应行业痛点**:公开技能库已达 190 万个但平均质量仅 6.2/12,缺的正是这种可复现的『有用性』量尺
- **方向转变**:配合 SkillAxe(自我精炼)、技能路由/检索基准,技能生态从『比数量』转向『比可证明的有效性』
OpenAI 在 ChatGPT Work 里上线 Data agent:连上数据源就能问答、自动生成交互式仪表盘
展开详情
- **一句话出报表**:连上数据源→自然语言提问→自动分析→生成交互式仪表盘,压缩掉取数-分析-可视化全链路
- **冲击对象明确**:初/中级数据分析、BI 报表这类『结构化取数+出图』岗位首当其冲
- **方向一致**:与 GPT-6 Astra 的端到端多步能力呼应,ChatGPT 正从问答工具变成『替你干完一类活』的 agent