📅
Hall of Fame
Hall of Fame
Track
Type
Source
8月17日 周一 · 10 条
今日趋势综述
模型层被 Grok 4.6 用四分之一的价格再次拉平,真正涨星、涨钱的都在『外围』——给 agent 装记忆、给 Claude Code 装技能、以及把 AI 包成服务卖给具体行业的人。
今天的信号:模型越来越便宜,值钱的是它周围那一圈

本周的模型层又发生了一次『拉平』:xAI 的 Grok 4.6 以每百万 token 2/6 美元、单任务 0.84 美元的价格挤进智能榜并列第三,只花 GPT-5.6 Sol、Claude Opus 5 四分之一的钱就把知识工作和 agent 类评测打赢了六成。当第一名和第四名挤在 2 分之内、价格却差 4 倍时,一个信号已经很清楚:选模型这件事正在从『谁最强』变成『谁最划算』,模型本身越来越像水电。

那价值往哪走了?看今天涨得最猛的东西就知道——不是模型,是模型周围那一圈。Claude Code 的 diagram-design 技能包一周涨近 1.5 万星,腾讯、NVIDIA 这样的大厂在抢『给 agent 装团队级记忆』和『给产品配官方技能库』的位置,一篇被反复引用的论文(ContinualSkillBench)甚至在泼冷水:技能库并不会自动『越用越强』,真正的增量来自把经验沉淀成可复用的抽象。换句话说,记忆、技能、编排、评测——这些『外围基础设施』才是现在的竞争焦点。

对个人最实在的机会不在于追哪个新模型,而在两件事:一是练『把模型周围那圈能力组织起来』的本事——怎么给 agent 设计记忆、怎么写触发得准的技能、怎么按场景选最划算的模型;二是干脆绕开技术层,去做『把 AI 包成服务卖给具体人群』的生意——今天的 GEO 品牌监测(Peec 16 个月做到 1000 万美元 ARR)、给蓝领装修队的拍照报价(QuoteIQ 4 万用户),证明的都是同一件事:模型是白菜价了,但『帮某个具体行业把 AI 用起来』这件事,还远远没人做完。

今日新增 9
#01
GitHub Repo
★ 19.5K NEW

cathrynlavery/diagram-design

diagram-design 这周是 GitHub 全站涨星冠军,一周涨了近 1.5 万星,逻辑其实很朴素:它戳中了『agent 画的图太丑』这个人人都烦、但没人认真解决的痛点。它是一个给 Claude Code 装的技能包,内置 29 种编辑级的图表模板(流程、架构、时间线、对比图等),生成的是干净的、自包含的 HTML+SVG,而不是那种一眼假的自动图。它的口号『No shadows, no Mermaid-slop』本身就是定位——市面上 agent 生成的图普遍粗糙,而它把『好看、能直接放进文档/幻灯片的图』做成了一个可以一键装上的能力。它涨得这么快,说明技能包这种『把某个具体本事打包进 agent』的形态,正在被大量普通用户真实需要。
#Skills#设计多媒体#HTML
展开详情

给 Claude Code 用的一套『会画图的技能包』:29 种编辑级图表类型,直接输出自包含的 HTML + SVG,主打『不要阴影、不要 Mermaid 那种糊图』。

周增长:本周约 +14,700 星、本周 GitHub 全站增速冠军(约 2K+/天,周榜读数,未经 API 核实)

  • **一个技能包,29 种图**:装进 Claude Code 后直接产出编辑级 HTML+SVG 图表,覆盖流程、架构、时间线、对比等常见场景
  • **定位就是『反糊图』**:口号 No shadows / No Mermaid-slop,专治 agent 自动生成的图太丑、不能直接用
  • **一周 +1.47 万星登顶全站**:证明『把一个具体本事打包成技能』是当下最容易被普通人接受的 AI 能力形态
推荐理由:对个人:这是『技能包经济』最直白的一个样本——作者没做大模型、没做平台,只是把『画好看的图』这一件小事打磨成一个能一键装的技能,就拿到了全站涨星冠军。你的机会是照着做:挑一件你比别人做得好、且 agent 现在做得糙的具体事(写合同、做表、排版、生成某类文档),把它固化成一个触发得准、输出稳定的技能包发出去。技能生态还早,先占位的人吃的是分发红利。
#03
GitHub Repo
★ 6.5K NEW

cactus-compute/needle

在所有人都在比谁的模型更大、更贵的时候,needle 反着来:它把一个能用的基础模型压到 14MB,目标是塞进手机、手表、智能家居、机器人这种算力和内存都极其紧张的小设备里。这个数字很有冲击力——当云端大模型动辄几百 G 权重时,一个 14MB、能本地跑、不依赖联网、不上传数据的模型,代表的是另一条完全不同的路线:AI 不一定都在云上,很多场景需要的是『足够小、够用、就在设备里』。它 MIT 授权、可自由商用,对做硬件、做端侧应用的人是个现成的地基。它涨星说明端侧/边缘 AI 这条被大模型叙事盖过的支线,正在重新被重视。
#LLM/Model#Python
展开详情

一个只有 14MB 的基础模型,专门跑在手机、可穿戴、智能家居和机器人这类微型设备上,MIT 开源。

周增长:本周约 +2,490 星(周榜读数,未经 API 核实)

  • **14MB 能跑一个基础模型**:对比动辄几百 G 的云端大模型,它专为手机/手表/家居/机器人这类微型设备设计
  • **端侧优先、隐私友好**:本地运行、不必联网、数据不出设备,适合对延迟和隐私敏感的场景
  • **MIT 开源可商用**:给做硬件和端侧应用的开发者一个现成地基,本周约 +2,490 星
推荐理由:对个人:大模型的叙事让很多人以为 AI 的机会都在云端和大厂,但 needle 提醒你还有一条更适合小团队的路——端侧 AI。它不需要你烧钱租 GPU,机会在于把小模型嵌进具体的硬件或离线场景:智能玩具、可穿戴、工业传感、离线助手、隐私敏感的本地工具。这些赛道大厂看不上、云端大模型又进不去,正好留给能动手把模型塞进设备、解决一个具体场景的个人开发者。
#04
GitHub Repo
★ 3.4K NEW

macro-inc/macro

macro 想做的是『Slack + Notion + Linear + CRM 的合体,且原生带 agent』。它把一个团队日常要用的邮件、聊天、文档、任务、通话、CRM 全部收进一个 Rust 写的应用里,任何东西都能 @ 互相链接,背后是一套共享的 AI 记忆——也就是说 agent 能看到你团队里发生的一切,并在其中直接干活。这个方向的野心很大,本周涨 2400 多星说明市场对『别再让我在十几个 SaaS 之间来回切、还要手动喂上下文给 AI』这件事怨念很深。它踩中的是一个真问题:现在的 agent 之所以不好用,很大程度是因为它看不到你分散在各个工具里的上下文;macro 的赌注是——把工具合并、把记忆打通,agent 才真正有用武之地。
#AI App#Rust
展开详情

一个用 Rust 写的团队一体化工作台:邮件、聊天、文档、任务、agent、通话、CRM 全塞进一个应用,用 @ 互相链接,共享同一套 AI 记忆。

周增长:本周约 +2,430 星(周榜读数,未经 API 核实)

  • **一个应用装下一支团队**:邮件/聊天/文档/任务/通话/CRM 全在一处,用 @ 互链,对标 Slack+Notion+Linear+CRM 合体
  • **共享 AI 记忆是核心**:agent 能看到团队里发生的一切并直接在其中干活,解决『AI 看不到分散上下文』的老问题
  • **Rust 从零重写、野心很大**:本周约 +2,430 星,押注『合并工具 + 打通记忆』才能让 agent 真正好用
推荐理由:对个人:macro 这类产品短期你抄不动,但它指出的方向很值钱——未来的软件不再是一个个孤立的工具,而是『agent 能贯穿其中的一体化工作面』。对个人的启示是:如果你在做面向小团队的工具,不要只做一个孤岛功能,要想清楚『agent 怎么在我这里拿到上下文、又把结果写回哪去』。能把数据打通、让 AI 在你的产品里顺畅干活的设计,会比多加几个功能更有竞争力。
#05
artificialanalysis.ai Article
NEW

Grok 4.6 第三方实测横评:用四分之一的价格,挤进智能榜并列第三

xAI 在 8 月 12 日发布 Grok 4.6,第三方评测机构 Artificial Analysis 当天给出的横评是本周最有信息量的一条:在它的 Intelligence Index(9 项评测综合)上,Claude Opus 5 拿 63 分第一、Claude Fable 5 拿 62、GPT-5.6 Sol 和 Grok 4.6 并列 61 分第三——也就是说榜单前四挤在 2 分之内。但真正的看点在价格:Grok 4.6 每百万 token 输入/输出只要 2/6 美元,而 Opus 5 是 5/25、GPT-5.6 Sol 是 5/30,Grok 便宜约四分之三;按单任务成本算,Grok 4.6 约 0.84 美元/任务,还在保持高智能的同时把 agent 完成任务的轮数和 token 砍掉约一半。它和 GPT-5.6 Sol 的 9 项共同评测里赢了 6 项(尤其在法律、知识工作类任务上大幅领先),但在最难的 agent 编码评测(DeepSWE、Terminal-Bench 的硬 harness)上仍落后。一个重要提醒:Grok 4.6 在 Terminal-Bench 上因 harness 不同会出现 26% 和 88.4% 两个天差地别的数字,跨 harness 的分数绝不能直接比。
#评测
另有 1 家信源报道
展开详情
  • **对比(AA Intelligence Index,9 项综合)**:Claude Opus 5 63 > Claude Fable 5 62 > GPT-5.6 Sol 61 ≈ Grok 4.6 61 > Grok 4.5 56——前四挤在 2 分内
  • **价格差 4 倍是真故事**:Grok 4.6 每百万 token 2/6 美元、单任务约 $0.84,而 Opus 5 5/25、GPT-5.6 Sol 5/30;同等智能下 Grok 便宜约四分之三、agent 轮数省一半
  • **强在知识工作、弱在硬编码**:与 GPT-5.6 Sol 的 9 项共测里 Grok 赢 6 项,但 DeepSWE、Terminal-Bench 硬 harness 仍是 Sol/Opus 5 领先
推荐理由:对个人:这条最实用的价值是帮你按场景选模型省钱。如果你在做高频次、走量的 agent 应用(批量客服、内容生成、数据处理),Grok 4.6 是当前性价比之王——同样的智能只花四分之一的钱、还省一半 token,成本压力立刻下来。但如果你干的是最硬的编码 agent(复杂仓库改动、终端操作),还是老老实实用 GPT-5.6 Sol 或 Claude Opus 5。记住一个原则:别再迷信『用最强的模型』,学会按任务难度分级用模型,是这个阶段最值钱的省钱技能。同时警惕评测数字——同一模型换个 harness 能差 60 分,看榜先看它用的什么基准和脚手架。
#06
arXiv Paper
NEW

ContinualSkillBench: Can LLM Agents Truly Evolve Their Capabilities?

现在流行一个说法:给 agent 配一个外部技能库,它就能像人一样『干得越多、技能越强』。这篇论文专门做了个动态基准来验证这件事——横跨 5 个领域、每个领域 100 个难度递增且互相关联的子任务,看 agent 在连续执行中是否真的沉淀出了可迁移的能力。结论相当扎心:连续执行确实有帮助,但收益因模型和领域差异巨大;更关键的是,平均而言『显式维护技能库』并不比单纯的『上下文学习(in-context learning)』强多少——很多所谓的进步其实只是对当前上下文的临时适应,而不是把经验抽象成了真正可复用的技能。论文还发现,越弱的模型攒下的技能库越大、越碎,反而更没用。这是对『技能生态会自动复利』这个热门叙事的一次严肃反证。
第一个正面拷问『带技能库的 agent 到底能不能越用越强』的动态评测基准,给当下火热的『技能会复利』叙事泼了盆冷水。
#AI Agent
另有 1 家信源报道
展开详情
  • **动态基准设计**:5 领域 × 100 个难度递增、互相关联的子任务,专门测 agent 连续作业中的能力沉淀,而非一次性问答
  • **扎心结论**:显式维护技能库 ≈ 单纯上下文学习,多数『进步』是临时上下文适应,没变成可迁移的抽象技能
  • **弱模型更糟**:越弱的模型攒的技能库越大越碎、越没用——技能不会自动复利,抽象能力才是关键
推荐理由:对个人:这篇论文的价值是帮你避坑——别以为给 agent 堆一大堆技能、让它不停跑,它就会自动变聪明。真正让技能『复利』的不是数量,而是抽象质量:一个写得好、边界清晰、能迁移到多个场景的技能,胜过一百个碎片化的。落到实操上,无论你是在攒自己的 prompt 库、技能包,还是在训练团队的 agent,都应该定期做『减法和提炼』——把重复的经验合并成更高层的抽象,而不是无脑往里加。这也解释了为什么『会写好技能』本身正在成为一门稀缺手艺。
#07
arize.com Article
NEW

Arize AI:怎么写出真正有效的 agent 技能——6 条有数据支撑的实践

在技能包满天飞、但大多数触发不准、效果拉胯的当下,这篇来自 Arize AI 的工程文给出了 6 条有数据支撑的写技能实践,几乎条条戳中新手的坑。核心几条:一个技能只教一件事,别贪多;把技能控制在约 1500 token 以内,太长模型反而抓不住重点;技能内容必须来自真实专长和真实任务,而不是让大模型现编一段听起来专业的通用流程(这是最常见的失败原因);每个技能都要配一个对应的评测(eval),用它来证明这个技能确实比没有它时更强,否则就是在给 context 添乱。配合本周那篇 ContinualSkillBench 论文一起看会更清楚:技能不是越多越好,写得对、边界清、经得起评测检验的技能才有价值。
#Skills#元技能
另有 1 家信源报道
展开详情
  • **一技能一事、控制在 ~1500 token**:只教一件事、别写太长,否则模型抓不住重点——大多数技能失效是设计问题不是指令问题
  • **必须来自真实专长**:内容要基于真实任务和真实经验,别让大模型现编一段『听起来专业』的通用流程,那是头号失败原因
  • **每个技能配一个 eval**:用评测证明『有它比没它强』,否则技能只是在给上下文添乱——把写技能变成可验证的工程
推荐理由:对个人:这篇是把『写技能』从玄学变成工程的实操手册,非常适合现在就照着练。为什么值得投入?因为『会写触发得准、经得起评测的技能』正在成为 AI 时代的一门稀缺硬手艺——技能生态在爆发,但绝大多数技能质量很差,写得好的人天然稀缺。你可以从自己最擅长的一件事入手,按这 6 条打磨出一个真正好用的技能,既能大幅提升自己用 agent 的效率,也能作为作品发到技能市场里占位。判断标准很简单:给它配个 eval,用数据说话。
#08
alicetechnologies.com Article
NEW

建筑业 AI 落地实测:Suffolk 用 agent 排期,一个生命科学项目抢回 42 天工期

建筑是个出了名难被 AI 撬动的传统行业,这个案例难得有具体数字。总承包商 Suffolk 在一个生命科学项目上用了 ALICE 的 agent 化排期:先用『Schedule Insights Agent』自动找出可以重新排序的工序,把关键路径上的负浮时(意味着工期风险)砍掉 22 天,再用定向优化进一步压缩,最终整个项目抢回 42 天工期、并消除了关键里程碑上的负浮时。这套打法之所以有效,和其他行业 AI 落地的赢家逻辑一致——不是拿 AI 做花哨的东西,而是把它精准卡进最烧钱、最容易延误的环节(工期排程)。ALICE 平台层面的其他数据也印证了这点:一条 8 英里州际公路项目省了 2500 多万美元、数据中心组合交付提前 90 多天、平台平均缩短 17% 工期、降 14% 人力成本。
#行业应用
另有 1 家信源报道
展开详情
  • **agent 自动重排工序**:Schedule Insights Agent 先砍掉关键路径 22 天负浮时,定向优化再压缩,最终抢回 42 天工期
  • **赢在卡进烧钱环节**:AI 不做花哨功能,而是精准切入建筑业最容易延误、最烧钱的工期排程环节
  • **平台级佐证**:8 英里公路项目省 2500 万+美元、数据中心提前 90+天、平均缩短 17% 工期 / 降 14% 人力成本
推荐理由:对个人:建筑、制造这类『看起来离 AI 很远』的传统重行业,恰恰是机会洼地——竞争少、痛点大、且愿意为省下真金白银的工期/成本付费。这个案例给的模板很清晰:找到某个传统行业里最烧钱、最容易出错的具体环节(排期、报价、质检、调度),把 AI 精准怼上去、用省下的钱说话。你不需要懂建筑,需要的是愿意钻进一个『不性感但花钱』的细分场景,做别人不愿意做的脏活。行业越传统,先行者的优势越大。
#09
peec.ai Product 直接可用
NEW

GEO 品牌可见度监测:盯住你的品牌在 ChatGPT / Perplexity 里被不被提及

一个全新的、连传统工具都还没覆盖的现金流赛道正在起来:GEO(Generative Engine Optimization,生成式引擎优化)——帮品牌搞清楚自己在 ChatGPT、Perplexity、AI Overviews 这些 AI 答案里到底有没有被提及、被推荐,以及怎么往上爬。这是个董事会级别的新焦虑:越来越多流量正从 Google 漏向 AI 对话,而企业对『AI 到底怎么说我』完全两眼一抹黑,且几乎没有现成工具。领跑者 Peec AI 用约 16 个月做到了 1000 万美元 ARR、2500+ 付费团队,还拿了约 2900 万美元 A 轮融资——付费意愿已经被验证得很扎实。而底端市场($29/月的 Otterly、€99/月的 Rankscale)还很浅,正是小团队能切入的地方。
#小微现金流#Peec AI 每月 $89…
另有 2 家信源报道
展开详情
  • **全新焦虑、零存量工具**:品牌不知道自己在 AI 答案里被不被提及、怎么排——传统 SEO 工具完全没覆盖这块
  • **付费信号硬**:Peec AI 约 16 个月做到 $10M ARR、2500+ 付费团队、融资约 $2900 万,$89–$499/月不限席位
  • **底端还很浅**:$29/月 Otterly、€99/月 Rankscale 证明微 SaaS 可行,SMB 端工具粗糙,正好留给小团队
推荐理由:对想挣现金流的普通人:这是个『需求刚被创造出来、但工具还没跟上』的黄金窗口。你不用去和 Peec 拼产品,两条更轻的路更适合个人:一是做『单一垂类的 AI 可见度追踪+优化』服务,比如专盯律所、SaaS、电商某一个行业,做成 $500–1500/月的代运营;二是把它做成一个每月的产品化服务(跑一组品牌相关 prompt + 出报告 + 改内容),卖给本地/区域企业。付费意愿已经被大玩家验证过了,你要抢的是他们够不着的细分和本地市场。
My Take:评分(5=最优):最快成交 4 / 最低成本 5 / 可复制 4 / 风险安全度 4。全新品类、需求已验证、底端工具浅,做单一垂类的产品化 GEO 服务是个人最好的切入点。
商机信号(加速):谁付钱:有品牌焦虑的中型品牌、SEO/营销代运营机构——它们眼看流量从 Google 漏向 AI 对话,却不知道 AI 怎么描述、推不推荐自己 痛点:『我在 AI 答案里被提及了吗、怎么往上爬』是个董事会级的新焦虑,却几乎没有成熟工具,尤其中小品牌端一片空白 切入点:锁定一个垂类(如律所/SaaS/本地电商),做产品化的『每月 GEO 审计+内容修改』服务,$500–1500/月起,用现成工具当后端、不必自己造轮子
#10
myquoteiq.com Product 直接可用
NEW

QuoteIQ:给蓝领装修队的『拍张照就出报价』CRM

不是所有 AI 现金流都在知识工作里,蓝领服务业是块被严重低估的地。QuoteIQ 面向压力清洗、暖通、草坪养护、油漆、屋顶、水管等 50 多种家庭服务的个体户和小队,核心功能特别接地气:拍几张房子/现场的照片,AI 就直接估算出报价,再配一个能用大白话操作的 CRM『Autopilot』。它戳中的痛点很实在——这些老板最讨厌坐办公室、报价又慢又不统一,报价晚了、漏了就丢单。目前已有 4 万+活跃用户、$29.99/月起,说明蓝领老板对『能更快接到活』的东西是真愿意掏钱的。这类人群通常自己不会去折腾软件,谁帮他们把工具用起来,谁就有得赚。
#小微现金流#$29.99/月起;AI 估…
另有 1 家信源报道
展开详情
  • **拍照直接出报价**:暖通/水管/油漆/屋顶等 50+ 种家庭服务,AI 从现场照片估算报价,解决『报价慢、不统一、丢单』的老大难
  • **大白话 CRM**:Autopilot 用自然语言操作,不逼着不爱坐办公室的蓝领老板去学复杂软件
  • **付费真实**:4 万+活跃用户、$29.99/月起,蓝领老板为『更快接到活』掏钱毫不含糊
推荐理由:对想挣现金流的普通人:蓝领服务业是 AI 变现里最被忽视、竞争最少的一块——这些老板有真实的钱、有真实的痛点(漏接电话、报价慢、不会用软件),但很少有人愿意俯下身去服务他们。两个可落地的切口:一是做某个单一工种的『拍照报价』微工具($19–39/月);二是干脆做『上门帮装修队把 AI 报价/CRM 配起来』的服务,收 $300–500 装机费+每月分成。技术难度不高,难的是愿意去和蓝领老板打交道——而这正是门槛,也是护城河。
My Take:评分(5=最优):最快成交 4 / 最低成本 4 / 可复制 4 / 风险安全度 5。蓝领服务业竞争少、付费实在,做单工种拍照报价工具或上门配置服务,个人可快速起量。
商机信号(加速):谁付钱:压力清洗/暖通/草坪/油漆/屋顶/水管等 50+ 种家庭服务的个体户和小队老板——有真实营收、最怕报价慢和漏单 痛点:报价又慢又不统一、老板讨厌坐办公室处理文书,报价晚了漏了就直接丢单,且他们大多不会自己折腾软件 切入点:做某个单一工种的拍照报价微工具($19–39/月),或做『上门帮装修队配置 AI 报价+CRM』的服务,收 $300–500 装机费加每月分成
仍在热榜 1
Repo TencentCloud/TencentDB-Agent-Memory 在榜 2d 腾讯出的团队级 agent 记忆中枢:把对话、文档、代码沉淀成四类可复用记忆资产(Chat Memory、Skill、L… AI Agent