📅
Hall of Fame
Hall of Fame
Track
Type
Source
9月21日 周一 · 8 条
今日趋势综述
模型能力见顶、价格反而上涨(GPT-6 Astra 涨价 2.5 倍却只是并列第一),真正的价值正加速流向『把便宜能力接进具体工作流』的一侧——从企业级编码 agent(Factory 5 个月估值翻三倍到 50 亿美元)到垂类现金流(牙科 AI 语音前台白标转售),个人的机会是学会评估、组装并交付这些能力,而不是追最强模型。
今天的信号:旗舰越来越贵,钱却越来越往『会组装的人』手里流

把今天几条线索连起来,会看到一个越来越清晰的分叉。一边是前沿模型:GPT-6 Astra 把 token 价格一口气抬到 GPT-5.6 Sol 的 2.5 倍($10/$50),换来的却只是在 Artificial Analysis 智力指数上和 Claude Fable 5.1 并列第一——能力已经见顶,涨的是价。另一边,是把这些能力接进真实业务的人在闷声赚钱:Factory 靠企业级编码 Droid 五个月估值翻三倍到 50 亿美元,客户是 Nvidia、Blackstone、RBC;牙科诊所的 AI 语音前台被做成白标转售的生意,20 万家诊所、每家每年因漏接电话损失数万美元的缺口,正被按 $0.05/分钟的用量定价一点点填上。

中间还有一条容易被忽略的暗线:能力过剩之后,『质量』和『可评估性』成了新的稀缺。obra/superpowers 这类把开发方法论固化成技能库的项目冲到 28 万星,Graphify 把代码库变成可查询知识图谱、也做成了跨 agent 的技能——它们卖的都不是模型,而是『怎么让模型把活干对』的工程范式。学术界同步给出量尺:SkillsBench 这类基准专门测『一个技能到底有没有改变 agent 的行为』,回应了公开技能库 190 万个、平均质量却只有 6.2/12 的行业尴尬。

对个人,今天的行动方向很具体:第一,别再为『榜首』多掏钱,学会看『每完成一个任务多少钱』来分层调度模型;第二,选一个你熟的垂直场景(诊所、教培、门店),把现成的便宜能力 + 现成的技能组装成能收月费的服务,交付本身就是护城河;第三,AI 教育今天的数据(Khanmigo 用户一年从 4 万涨到 70 万,但只有 15% 的人真的在用)提醒我们——能力落地的瓶颈从来不是技术,而是让人真正用起来的那『最后一公里』,谁能补上,谁就吃到红利。

今日新增 6
#02
artificialanalysis.ai Article
NEW

GPT-6 Astra 涨价 2.5 倍却只是并列第一:智力指数打平 Fable 5.1,选型该看『每任务成本』而不是 token 单价

OpenAI 9 月 3 日发布的 GPT-6 Astra(max),在 Artificial Analysis 智力指数上拿到 53 分,与 Claude Fable 5.1(max)并列第一(行业中位数只有 24)。但代价是价格一口气涨到 GPT-5.6 Sol 的 2.5 倍——输入 $10、输出 $50 每百万 token(前代是 $4/$20)。有意思的是:因为 Astra 输出更简洁(59 tokens/s、话少),在『每完成一个任务的实际花费』上,它反而只有 Fable 5.1 的约 40%。在编码场景,Terminal-Bench 4.0 上 GPT-6 Astra(Codex 里)58.2 分,和 Claude Fable 5.1(Claude Code 里)57.9 分几乎贴脸。结论:前沿模型的能力已经见顶到『并列第一』,token 单价却在涨,唯一能救你账单的指标是『每任务成本』。
#评测
另有 1 家信源报道
展开详情
  • **对比(智力打平)**:GPT-6 Astra(max)53 vs Claude Fable 5.1(max)53,并列第一,行业中位数仅 24(Artificial Analysis 智力指数)
  • **对比(单价却翻倍)**:Astra 输入/输出 $10/$50 vs 前代 GPT-5.6 Sol $4/$20,涨价 2.5 倍;编码上 Terminal-Bench 4.0:Astra 58.2 vs Fable 5.1 57.9,几乎无差
  • **反直觉**:因 Astra 输出更简洁,其『每任务实际成本』约为 Fable 5.1 的 40%——token 单价高 ≠ 干完一件事更贵
推荐理由:这条评测给普通人两个可执行动作:一是彻底戒掉『买最贵就是买最好』的心智——旗舰之间已经在 1 分内贴脸,为『榜首』多掏钱基本是交智商税;二是学会算『每任务成本』这笔真账:token 单价高的模型如果话少、一次做对,实际可能更便宜。把这套『分数÷每任务成本』的选型能力练成肌肉记忆,一个人的 AI 账单能差出好几倍,这本身就是 2026 年能直接省钱变现的硬技能。
#03
minssam.com Article
NEW

AI 教育落地实测:Khanmigo 用户一年 4 万→70 万(17 倍),但只有 15% 真的在用——瓶颈从来不是模型

教育是今年 AI 落地『理想与现实差距』最明显的行业。规模侧:Khan Academy 的 Khanmigo 用户一年从 4 万涨到 70 万(17 倍),合作学区从 45 个扩到 380+。效果侧则分两层:试点数据很漂亮——学生数学平均提升 1.4 个年级水平,每周用满 30 分钟约等于多上 2–3 周课;Squirrel AI 用满 6 个月平均提升 1.2 个年级、某些数学知识点学习速度快 5.4 倍。但一项两年随机对照实验给出更冷静的数字:Khanmigo 每学期只把数学成绩拉高约 1.26 个百分位。最扎心的是采用率——有权限的学生里只有 15% 真的在用,Khan Academy 为此定了 2026 夏季重做产品。
#行业应用
另有 2 家信源报道
展开详情
  • **规模对比**:Khanmigo 用户 4 万→70 万(17 倍/年)、学区 45→380+;Duolingo 一年服务 70 万学生、148 门课
  • **效果对比(试点 vs 严谨 RCT)**:试点提升 1.4 个年级、Squirrel AI 1.2 个年级/学速 5.4 倍;但两年随机对照实验只测出每学期 +1.26 个百分位
  • **真瓶颈**:有权限的学生只有 15% 实际使用——落地卡在『让人真用起来』的最后一公里,不是模型能力
推荐理由:教育这条曲线给普通人的信号很直接:AI 产品的胜负手已经不在模型强弱,而在『把人真正带上车』的那一环——引导、习惯养成、和现有流程的嵌合。如果你想在 AI 时代做点事,与其卷模型,不如去补『采用率』这块短板:做家长/老师看得懂的使用陪跑、把 AI 工具接进学校/机构已有的教学流程、用运营手段把 15% 的使用率拉到 50%。谁能把『有权限但不用』变成『天天在用』,谁就拿到了这个万亿市场里最稀缺的能力。
#04
factory.com Product
NEW

Factory:企业级编码 Droid 五个月估值翻三倍到 50 亿美元,客户全是 Nvidia、Blackstone 这类大厂

Factory 9 月 15 日宣布完成 2 亿美元新一轮融资,估值 50 亿美元——从 4 月的 15 亿(Series C)到 7 月约 40 亿,再到现在 50 亿,五个月翻了三倍多,总融资已超 4 亿美元,投资方包括 Blackstone、Khosla、Sequoia,天使里还有 Salesforce CEO Benioff。产品是一套企业平台,让叫作『Droid』的自主 agent 端到端接管软件开发生命周期。真正的护城河是客户名单:Nvidia、Blackstone、加拿大皇家银行(RBC)、Palo Alto Networks、Adobe、T-Mobile——这些大厂在用它搭『可控、可信、可衡量的自我改进软件工厂』。它和昨天 GitHub 多模型编排、前几天 Cursor/Codex 的故事连起来看,说明企业级编码 agent 的军备竞赛已经从『能不能写代码』打到『能不能被大企业信任地大规模部署』。
#AI Agent#企业平台,定制报价
另有 2 家信源报道
展开详情
  • **增长信号**:估值 5 个月从 15 亿→40 亿→50 亿美元,翻三倍;本轮 2 亿美元,总融资超 4 亿
  • **客户即护城河**:Nvidia、Blackstone、RBC、Palo Alto Networks、Adobe、T-Mobile 已在生产环境用 Droid
  • **赛道转向**:竞争焦点从『agent 会不会写代码』转到『大企业敢不敢把 SDLC 交给它、能不能衡量与管控』
推荐理由:Factory 的估值曲线告诉普通人:企业级 AI 落地的钱,正砸向『可信、可衡量、可管控』这几个词,而不是模型本身。机会不在于你能不能造一个更强的 Droid,而在于你能不能成为帮企业『把 agent 安全接进现有开发流程、建立评估与管控体系』的那个人——这正是 FDE(前向部署工程师)和 AI 交付顾问溢价最高的活。盯住大厂在买什么,把自己训练成『交付与治理』的专家,比追新模型更接近钱。
商机信号(加速):谁付钱:Nvidia、RBC、Adobe、T-Mobile 等大型企业的工程团队,愿为『可控可衡量的自主编码 agent』付企业级合同 痛点:企业想让 agent 接管开发生命周期,但缺少让它安全落地、可审计、可衡量 ROI 的部署与治理能力 切入点:个人/小团队切入点:不做平台,做『企业编码 agent 的落地与治理顾问』——帮客户搭评估基准、权限护栏、成效度量,按项目 + 月度维护收费
#05
trillet.ai Article 直接可用
NEW

牙科诊所 AI 语音前台正在被『白标转售』:20 万家诊所、每家每年漏接电话损失数万美元的现金流缺口

牙科诊所的 AI 语音前台在 2026 年已经跑通成熟:它像真人接线员一样 24/7 接电话、直接在诊所管理系统(Dentrix、Open Dental 等)里预约/改约、回答保险与治疗问题、分诊急诊、做召回电话,多语言、HIPAA 合规。真正的现金流机会不在『做一个语音 agent』(这块已有 CloudTalk、Adit(服务 5000+ 家诊所)、LuMay($0.05/分钟、亚 500ms 延迟)等成熟产品),而在『白标转售 + 本地交付』:全美 20 万+ 执业牙医,多为单店或小型连锁,每家每年因漏接电话损失数万美元产值(漏接的多是新患者的预约请求)。Trillet 这类平台已经明确开放给代理商做白标转售——个人不用造技术,只要拿现成产品去帮本地诊所装好、调好、跑起来,就能吃到这块预算。
#小微现金流
另有 2 家信源报道
展开详情
  • **痛点有价**:全美 20 万+ 牙医,每家每年因漏接电话损失数万美元产值,且漏的多是新患者——ROI 一算就通
  • **技术已现成**:CloudTalk、Adit(5000+ 诊所)、LuMay($0.05/分钟、<500ms、原生对接 Dentrix/Open Dental)等可直接用,无需自研
  • **个人切口**:Trillet 等平台开放白标转售,个人做『本地诊所语音前台代装代运营』,按月收订阅 + 安装费
推荐理由:对想挣现金流的普通人,这是一个『不用懂 AI 也能做』的典型样板:技术、合规、对接都被平台做完了,剩下的是最土也最赚钱的活——找到本地诊所、用『你每月漏掉 X 个新患者 = 损失 X 元』的账说服老板、把现成产品装好调好收月费。这种『垂类 + 本地 + 白标转售』的模式可复制到牙科之外的任何高客单、怕漏客的小微服务业(医美、律所、房产、维修)。护城河不是技术,是你对某个行业的了解和本地信任。
My Take:评分(5=最优):最快成交 4 / 最低成本 4 / 可复制 5 / 风险安全度 4。用现成白标产品做本地诊所语音前台代装代运营,是当下门槛最低、可复制性最强的 AI 现金流样板之一。
商机信号(加速):谁付钱:全美 20 万+ 单店/小型连锁牙科诊所的老板,愿为『不再漏接新患者电话』付月费 痛点:前台忙不过来、下班无人接听,漏接的新患者预约每年造成数万美元产值流失 切入点:个人切入点:拿 Trillet/LuMay 等平台的白标授权,做本地诊所语音前台的代装+调优+代运营,按月订阅(含安装费)收费,先跑通一家再复制到同城同行
#06
arXiv Paper
NEW

A Framework for Evaluating Agentic Skills at Scale(SkillsBench:怎么测一个技能到底有没有改变 agent 的行为)

当人人都在写 agent 技能(skills),一个尖锐的问题浮出水面:你加的这个技能,到底有没有真的改变 agent 的行为、把活干得更好?这篇论文提出的 SkillsBench,是目前少见的、专门为『技能有效性』设计的公开基准——它把少量技能和一批手写任务配对,用单元测试来判分,直接测量『装了这个技能 vs 没装』的行为差异,而不是笼统看输出好不好。配套的一批 2026 工作(SkillAxe 的评估引导自我精炼、Skill 路由与检索基准等)共同指向一个新方向:技能生态从『比谁写得多』转向『比谁能证明有用』。
回应了『公开技能库 190 万个、平均质量却只有 6.2/12』的行业尴尬——给出了可复现的『技能是否真的有用』的量尺。
#AI Agent
展开详情
  • **测行为而非输出**:SkillsBench 用手写任务 + 单元测试,直接量化『装了技能 vs 没装』的 agent 行为差异
  • **回应行业痛点**:公开技能库已达 190 万个但平均质量仅 6.2/12,缺的正是这种可复现的『有用性』量尺
  • **方向转变**:配合 SkillAxe(自我精炼)、技能路由/检索基准,技能生态从『比数量』转向『比可证明的有效性』
推荐理由:对想在 skills 生态里做事的人,这篇论文其实是一张藏宝图:它告诉你未来值钱的不是『又写了一百个技能』,而是『能证明我的技能真的有用』。行动上——写技能时就配上可跑的评测任务和单元测试,把『装了它准确率/成功率提升多少』做成硬数据;在鱼龙混杂的技能市场里,能拿出评测证据的技能作者会天然胜出。学会用 SkillsBench 这类方法给自己的技能打分,就是给自己的作品盖上『可信』的章。
#08
Product Hunt Product
NEW

OpenAI 在 ChatGPT Work 里上线 Data agent:连上数据源就能问答、自动生成交互式仪表盘

OpenAI 9 月 9 日在 ChatGPT Work 里上线 Data agent:企业接上自己的数据源后,可以直接用自然语言提问、让它做分析、并自动生成交互式仪表盘——本质是把『取数 + 分析 + 可视化 + 报表』这套原本要数据分析师/BI 工程师干的活,压进一个对话框。它和同期 OpenAI 的一系列 agent 化动作(GPT-6 Astra 主打端到端多步工作)一脉相承:OpenAI 正把 ChatGPT 从『问答工具』推向『能替你把一整类白领工作干完的 agent』。
#AI App#随 ChatGPT Work…
另有 1 家信源报道
展开详情
  • **一句话出报表**:连上数据源→自然语言提问→自动分析→生成交互式仪表盘,压缩掉取数-分析-可视化全链路
  • **冲击对象明确**:初/中级数据分析、BI 报表这类『结构化取数+出图』岗位首当其冲
  • **方向一致**:与 GPT-6 Astra 的端到端多步能力呼应,ChatGPT 正从问答工具变成『替你干完一类活』的 agent
推荐理由:Data agent 把一个残酷但有用的信号摆到桌面上:『会用 SQL 取数 + 拉个仪表盘』正在迅速贬值。与其焦虑,不如顺势升级——把自己从『做图表的人』变成『问对问题、并对结论负责的人』:Data agent 能出图,但看不出这个数字异常背后是业务问题还是数据脏了、也不会替你向老板解释该怎么决策。数据分析师的价值正从『操作』上移到『提问、质疑、归因和讲故事』。现在就用它替自己干掉重复取数的活,把省下的时间投到业务理解上,你就是被 AI 放大的那一方,而不是被替代的那一方。
仍在热榜 2
Repo obra/superpowers 在榜 6d 把『怎么让编码 agent 把活干对』固化成一整套可自动激活的技能库 + 开发方法论,跨 Claude Code、Cur… Skills · 编程开发
Repo Graphify-Labs/graphify 在榜 2d 把整个代码库(含文档、SQL schema、配置、PDF)在本地解析成可查询的知识图谱,让 AI 编码助手真正『看懂』项… DevTools