Hall of Fame
今日趋势综述
今天的信号:模型越来越便宜,值钱的是它周围那一圈
本周的模型层又发生了一次『拉平』:xAI 的 Grok 4.6 以每百万 token 2/6 美元、单任务 0.84 美元的价格挤进智能榜并列第三,只花 GPT-5.6 Sol、Claude Opus 5 四分之一的钱就把知识工作和 agent 类评测打赢了六成。当第一名和第四名挤在 2 分之内、价格却差 4 倍时,一个信号已经很清楚:选模型这件事正在从『谁最强』变成『谁最划算』,模型本身越来越像水电。
那价值往哪走了?看今天涨得最猛的东西就知道——不是模型,是模型周围那一圈。Claude Code 的 diagram-design 技能包一周涨近 1.5 万星,腾讯、NVIDIA 这样的大厂在抢『给 agent 装团队级记忆』和『给产品配官方技能库』的位置,一篇被反复引用的论文(ContinualSkillBench)甚至在泼冷水:技能库并不会自动『越用越强』,真正的增量来自把经验沉淀成可复用的抽象。换句话说,记忆、技能、编排、评测——这些『外围基础设施』才是现在的竞争焦点。
对个人最实在的机会不在于追哪个新模型,而在两件事:一是练『把模型周围那圈能力组织起来』的本事——怎么给 agent 设计记忆、怎么写触发得准的技能、怎么按场景选最划算的模型;二是干脆绕开技术层,去做『把 AI 包成服务卖给具体人群』的生意——今天的 GEO 品牌监测(Peec 16 个月做到 1000 万美元 ARR)、给蓝领装修队的拍照报价(QuoteIQ 4 万用户),证明的都是同一件事:模型是白菜价了,但『帮某个具体行业把 AI 用起来』这件事,还远远没人做完。
cathrynlavery/diagram-design
展开详情
给 Claude Code 用的一套『会画图的技能包』:29 种编辑级图表类型,直接输出自包含的 HTML + SVG,主打『不要阴影、不要 Mermaid 那种糊图』。
周增长:本周约 +14,700 星、本周 GitHub 全站增速冠军(约 2K+/天,周榜读数,未经 API 核实)
- **一个技能包,29 种图**:装进 Claude Code 后直接产出编辑级 HTML+SVG 图表,覆盖流程、架构、时间线、对比等常见场景
- **定位就是『反糊图』**:口号 No shadows / No Mermaid-slop,专治 agent 自动生成的图太丑、不能直接用
- **一周 +1.47 万星登顶全站**:证明『把一个具体本事打包成技能』是当下最容易被普通人接受的 AI 能力形态
cactus-compute/needle
展开详情
一个只有 14MB 的基础模型,专门跑在手机、可穿戴、智能家居和机器人这类微型设备上,MIT 开源。
周增长:本周约 +2,490 星(周榜读数,未经 API 核实)
- **14MB 能跑一个基础模型**:对比动辄几百 G 的云端大模型,它专为手机/手表/家居/机器人这类微型设备设计
- **端侧优先、隐私友好**:本地运行、不必联网、数据不出设备,适合对延迟和隐私敏感的场景
- **MIT 开源可商用**:给做硬件和端侧应用的开发者一个现成地基,本周约 +2,490 星
macro-inc/macro
展开详情
一个用 Rust 写的团队一体化工作台:邮件、聊天、文档、任务、agent、通话、CRM 全塞进一个应用,用 @ 互相链接,共享同一套 AI 记忆。
周增长:本周约 +2,430 星(周榜读数,未经 API 核实)
- **一个应用装下一支团队**:邮件/聊天/文档/任务/通话/CRM 全在一处,用 @ 互链,对标 Slack+Notion+Linear+CRM 合体
- **共享 AI 记忆是核心**:agent 能看到团队里发生的一切并直接在其中干活,解决『AI 看不到分散上下文』的老问题
- **Rust 从零重写、野心很大**:本周约 +2,430 星,押注『合并工具 + 打通记忆』才能让 agent 真正好用
Grok 4.6 第三方实测横评:用四分之一的价格,挤进智能榜并列第三
展开详情
- **对比(AA Intelligence Index,9 项综合)**:Claude Opus 5 63 > Claude Fable 5 62 > GPT-5.6 Sol 61 ≈ Grok 4.6 61 > Grok 4.5 56——前四挤在 2 分内
- **价格差 4 倍是真故事**:Grok 4.6 每百万 token 2/6 美元、单任务约 $0.84,而 Opus 5 5/25、GPT-5.6 Sol 5/30;同等智能下 Grok 便宜约四分之三、agent 轮数省一半
- **强在知识工作、弱在硬编码**:与 GPT-5.6 Sol 的 9 项共测里 Grok 赢 6 项,但 DeepSWE、Terminal-Bench 硬 harness 仍是 Sol/Opus 5 领先
ContinualSkillBench: Can LLM Agents Truly Evolve Their Capabilities?
展开详情
- **动态基准设计**:5 领域 × 100 个难度递增、互相关联的子任务,专门测 agent 连续作业中的能力沉淀,而非一次性问答
- **扎心结论**:显式维护技能库 ≈ 单纯上下文学习,多数『进步』是临时上下文适应,没变成可迁移的抽象技能
- **弱模型更糟**:越弱的模型攒的技能库越大越碎、越没用——技能不会自动复利,抽象能力才是关键
Arize AI:怎么写出真正有效的 agent 技能——6 条有数据支撑的实践
展开详情
- **一技能一事、控制在 ~1500 token**:只教一件事、别写太长,否则模型抓不住重点——大多数技能失效是设计问题不是指令问题
- **必须来自真实专长**:内容要基于真实任务和真实经验,别让大模型现编一段『听起来专业』的通用流程,那是头号失败原因
- **每个技能配一个 eval**:用评测证明『有它比没它强』,否则技能只是在给上下文添乱——把写技能变成可验证的工程
建筑业 AI 落地实测:Suffolk 用 agent 排期,一个生命科学项目抢回 42 天工期
展开详情
- **agent 自动重排工序**:Schedule Insights Agent 先砍掉关键路径 22 天负浮时,定向优化再压缩,最终抢回 42 天工期
- **赢在卡进烧钱环节**:AI 不做花哨功能,而是精准切入建筑业最容易延误、最烧钱的工期排程环节
- **平台级佐证**:8 英里公路项目省 2500 万+美元、数据中心提前 90+天、平均缩短 17% 工期 / 降 14% 人力成本
GEO 品牌可见度监测:盯住你的品牌在 ChatGPT / Perplexity 里被不被提及
展开详情
- **全新焦虑、零存量工具**:品牌不知道自己在 AI 答案里被不被提及、怎么排——传统 SEO 工具完全没覆盖这块
- **付费信号硬**:Peec AI 约 16 个月做到 $10M ARR、2500+ 付费团队、融资约 $2900 万,$89–$499/月不限席位
- **底端还很浅**:$29/月 Otterly、€99/月 Rankscale 证明微 SaaS 可行,SMB 端工具粗糙,正好留给小团队
QuoteIQ:给蓝领装修队的『拍张照就出报价』CRM
展开详情
- **拍照直接出报价**:暖通/水管/油漆/屋顶等 50+ 种家庭服务,AI 从现场照片估算报价,解决『报价慢、不统一、丢单』的老大难
- **大白话 CRM**:Autopilot 用自然语言操作,不逼着不爱坐办公室的蓝领老板去学复杂软件
- **付费真实**:4 万+活跃用户、$29.99/月起,蓝领老板为『更快接到活』掏钱毫不含糊