📅
Hall of Fame
Hall of Fame
Track
Type
Source
7月26日 周日 · 8 条
今日趋势综述
今天的信号一条线:机会正从『造更强的模型』移到『把 agent 用对、管住、卖出去』——会编排技能、会按价选型、会把 AI 塞进具体生意的人,正在拿到最实在的红利。
今天的信号:模型见顶,杠杆在『会用』的人手里

把今天几条放一起看,会发现它们指向同一件事:光有强模型已经不够了,真正拉开差距的是怎么把它用出来。微软 SkillOpt 把『技能文档』当成可训练的状态来优化,一个冻结不动的模型靠一份被反复迭代的 skill,就能在 GPT-5.5 上平均涨 23.5 分——这说明『会写、会调技能』本身正在变成一种可积累、可复利的能力;一位地球物理学家被裁员后用 Claude Code 搭的 ai-job-search 三周冲到近两万星,则是最朴素的证明:普通人把 agent 编排成一条完整流水线,就能替自己干真正有价值的活。

另一头是『把 agent 管住、跑稳』的基础设施在补齐:Sim 让不写代码的人也能拖拽出 agent 工作流,LangChain 的 OpenWiki 专门给 agent 造一份它读得懂的代码文档,而 AgenticSTS 这篇论文直指长跑 agent 最要命的软肋——记忆一旦无界就会崩。能力的天花板不再是模型,而是可靠性和工程。

最后是『把 AI 变现』这一端越来越具体:中端模型(Sonnet 5 / GPT-5.6 Sol / Gemini 3.1 Pro)价格差到两三倍,会按场景选型的人直接省下真金白银;零售靠一个购物 agent 就能把转化拉到 3 倍;连『帮小店永不漏接电话』都能做成按月收费的白标生意。给个人的行动建议只有一句:别再追下一个榜首模型,去练那些模型进步抹不平的能力——编排技能、按价选型、把 AI 落进一门具体的生意。

今日新增 5
#04
GitHub Product
NEW

langchain-ai/openwiki

OpenWiki 是 LangChain 刚发布的开源 CLI:它给你的代码库自动写并持续维护一份『给 agent 看的文档』。跟传统给人看、靠人扫读的 README 不同,它生成的是一份专为大模型结构化的 wiki,并在合适处自动嵌入 Mermaid 图——运行/请求流用时序图、数据模型用 ER 图、生命周期用状态图、控制流用流程图——而且随着仓库变化自动更新。它瞄准的是一个越来越现实的痛点:当写代码的越来越多是 agent,代码库也需要一份 agent 读得懂、且不会过期的说明书。
#DevTools#开源免费(CLI,支持 Op…
另有 1 家信源报道
展开详情
  • **为 agent 写文档**:不是给人扫读的 README,而是为大模型结构化的 wiki,让编码 agent 更懂你的代码库
  • **自动画图**:在能讲清楚概念处自动嵌 Mermaid——时序图(请求流)、ER 图(数据模型)、状态图(生命周期)、流程图(控制流)
  • **保持不过期**:CLI 接进你的编码 agent,随仓库变化自动维护更新,多后端(OpenRouter/Fireworks/Baseten/OpenAI/Anthropic)开箱即用
推荐理由:OpenWiki 点出一个正在成型的新范式:文档的读者正从『人』变成『agent』。对个人开发者,这里有两个即时可用的价值——一是给自己的项目挂上 OpenWiki,让 Claude Code / Codex 这类 agent 干活时少犯错、少跑偏,直接提升你用 agent 编码的产出质量;二是更前瞻的机会:『为 AI 可读性做优化』(给代码库、给产品、给知识库准备一份 agent 友好的结构化文档)正在成为一项新技能,就像十年前的 SEO。谁先意识到『你的东西要被 agent 读懂才有价值』,谁就占了身位。
#05
arXiv Paper
NEW

AgenticSTS: A Bounded-Memory Testbed for Long-Horizon LLM Agents

这篇论文关注一个被榜单掩盖的真问题:agent 要连续干很多步(long-horizon)时,最常见的做法是把过往对话原样越攒越长地塞进上下文,结果 prompt 无界膨胀、表现随之崩坏。AgenticSTS 提出一个『有界记忆』的测试床与契约:明确规定每一步决策『被允许看到什么』——不再把跨决策的原始对话流一股脑append 进去,而是每次都从一条全新的用户消息出发,靠带类型的检索去组装该看的信息,从而让 prompt 在整个运行过程中保持有界。它把『agent 记忆该怎么管』从工程玄学变成了可度量、可对比的研究对象。
直指长跑 agent 最要命的软肋——记忆一旦无界拼接就会拖垮表现,并给出一套可复现的『有界记忆』测试床与替代契约
#AI Agent
展开详情
  • **问题定位**:长跑 agent 把历史原样拼进上下文会导致 prompt 无界膨胀、表现退化——这是很多 agent『跑着跑着就变笨』的根因之一
  • **替代契约**:每步决策从全新用户消息出发,用带类型的检索按需组装信息,不 append 原始跨决策对话流,让上下文始终有界
  • **可复现测试床**:给『记忆该看什么、看多少』提供了统一的评测环境,把记忆管理从手感调参推向可度量对比
推荐理由:对做 agent 应用的人,这篇是很实用的一课:agent 不稳定、跑长任务就退化,往往不是模型不行,而是你把记忆管坏了——无脑往上下文里堆历史。可迁移的做法很明确:别把全部历史原样塞进去,而是给每一步决策显式设计『它该看到什么』,用检索按需组装、保持上下文有界。这也指向一个正在升值的能力方向——『agent 记忆/上下文工程』:会做有界记忆、类型化检索、上下文预算管理的人,能让同样的模型跑出稳得多的长任务表现,而这正是当前 agent 落地最缺、最值钱的工程能力之一。
#06
edenai.co Article
NEW

中端模型三选一:Sonnet 5 / GPT-5.6 Sol / Gemini 3.1 Pro,价格差到两三倍,怎么选才不亏

旗舰模型的编码榜单已经刷到饱和,真正影响个人和小团队钱包的其实是『中端主力』的选型。把三家中端拉到同一张表:能力上,SWE-bench Pro 上 GPT-5.6 Sol 约 64.6%、Claude Sonnet 5 约 63.2%,两者贴得很近(作为参照,同榜旗舰 Fable 5 约 80.3%、Opus 4.8 现役约 69.2%);价格上差得却很大——Sonnet 5 引入期(截至 8/31)约 $2 / $10 每百万 token(输入/输出),Gemini 3.1 Pro 约 $2 / $12(超 200K 上下文涨到 $4 / $18),GPT-5.6 Sol 约 $5 / $30,是三者里最贵的。也就是说:能力咬得很紧,成本却能差两到三倍,选错的代价直接体现在账单上。
#评测
另有 2 家信源报道
展开详情
  • **对比(能力)**:SWE-bench Pro 上 GPT-5.6 Sol ≈64.6% vs Sonnet 5 ≈63.2%(旗舰参照:Fable 5 ≈80.3%、Opus 4.8 现役 ≈69.2%)——中端两家几乎打平
  • **对比(价格/百万 token)**:Sonnet 5 ≈$2/$10(引入期至 8/31)vs Gemini 3.1 Pro ≈$2/$12(>200K 涨到 $4/$18)vs GPT-5.6 Sol ≈$5/$30——最贵的是 Sol
  • **方法论提醒**:OpenAI 7/8 审计指出 SWE-bench Pro 约 30% 任务存在缺陷(测试过严/描述不全),Gemini 3.1 在不同评测集上从 46% 到 80% 波动大,分数要结合基准来源看
推荐理由:给普通开发者的可执行结论:中端这三家能力咬得很紧,别为『感觉更强』多付两三倍的钱。具体怎么选——追求性价比、又要能力全面,Sonnet 5 在引入期价格($2/$10)几乎是最划算的主力;要长上下文、或已在 Google 生态里,Gemini 3.1 Pro 便宜且量大,但注意超 200K 会涨价;除非你有明确只有 Sol 才做得好的场景,否则 GPT-5.6 Sol 的 $5/$30 对大多数日常任务并不值。真正省钱的能力不是追榜首,而是按『任务难度×调用量×上下文长度』分场景配模型——把重活留给旗舰、日常批量走中端最便宜那档。
#07
mparticle.com Article
NEW

零售的『代理式电商』落地实测:一个购物 agent 把转化拉到 3 倍、AOV 高 38%——Tatcha 的数字与 BCG 的大盘

零售是今年 agent 落地里数字最实、最能算清 ROI 的领域之一。护肤品牌 Tatcha 接入购物 agent 后的一手数据:AI 辅助购物者的转化率是站点平均的约 3 倍,客单价(AOV)高约 38%,全站营收里约 11.4% 可归因于这套 AI 对话,同时 82% 的客服问题无需真人、CSAT 达 81%。放到大盘看也不是个例——BCG 研究显示部署第一方 AI agent 的零售商普遍有 5%–15% 的转化提升,AI 增强搜索最高可提转化 20%、发现引擎抬 AOV 约 12%。关键不在买了多强的模型,而在把 agent 真正嵌进『搜索—推荐—答疑—下单』这条转化链路里。
#行业应用
另有 2 家信源报道
展开详情
  • **一手数字(Tatcha)**:AI 辅助购物者转化 ≈站点平均 3 倍、AOV 高 ≈38%、全站营收 ≈11.4% 可归因于 AI 对话,82% 问题无需真人、CSAT 81%
  • **大盘对比(BCG)**:部署第一方 AI agent 的零售商普遍 5%–15% 转化提升;AI 增强搜索最高 +20% 转化、发现引擎 +12% AOV
  • **赢点不在模型**:效果来自把 agent 嵌进搜索—推荐—答疑—下单的完整转化链路,而非采购了最强旗舰
推荐理由:对想在零售/电商里吃到 AI 红利的人,这条给出很具体的方向:机会不在『卖一个更聪明的聊天机器人』,而在『把 agent 接进转化链路并对结果负责』。Tatcha 的 11.4% 营收归因意味着——只要能把购物 agent 的转化、AOV 提升说清楚、算成钱,商家就愿意持续付费。个人/小团队可切入的最小切口:给某一类中小电商(比如某个垂直品类的独立站)做『会带货的购物 agent』集成,按转化提升或营收分成收费;核心竞争力不是模型,而是懂这门生意的转化链路、能把效果量化出来。
商机信号(加速):谁付钱:有一定流量但转化和客单价上不去的中小电商/独立站商家,尤其美妆、时尚、家居等高决策成本品类 痛点:客服答不过来、顾客有疑问就弃购,站内搜索和推荐做不精,转化与 AOV 长期卡住 切入点:为单一垂直品类的独立站做『会带货的购物 agent』集成(答疑+推荐+引导下单),先做出一个能证明转化提升的样板店,再按转化提升/营收分成复制到同品类商家
#08
leadlock.ai Product 直接可用
NEW

白标 AI 语音前台『转售』模式:帮小店永不漏接电话,做成按月收费的现金流生意

这不是又一个语音 agent 产品,而是一门可复制的现金流生意:用现成的白标语音平台,给『一漏接电话就丢单』的本地小店(诊所、餐馆、家政、维修、律所)搭一个永不漏接的 AI 前台,按月收订阅费。经济账很清楚:小企业平均每年因漏接电话损失约 $12.6 万;一个 AI 前台的年成本约 $1,188–$5,988,而请一个真人前台要 $2.8 万–$3.5 万;客户通常 2–3 周就靠追回的漏接来电回本,之后扩容边际成本几乎为零。给做生意的人这端,平台成本低到 Retell $0.07/分钟、Trillet 白标 $99/月带 3 个子账户,意味着你可以一次搭好、多客户复用、按月稳定收费。
#小微现金流#平台成本:Retell ≈$…
另有 2 家信源报道
展开详情
  • **客户的痛点值钱**:小企业年均因漏接电话损失约 $12.6 万;AI 前台年成本 $1,188–$5,988 vs 真人前台 $2.8 万–$3.5 万,客户 2–3 周回本
  • **转售成本极低**:Retell ≈$0.07/分钟、Synthflow ≈$0.15–$0.24/分钟,Trillet 白标 Studio ≈$99/月含 3 个子账户——一次搭好、多客户复用
  • **可复制**:按行业做模板(诊所/餐馆/家政/维修/律所各一套话术与预约流程),复制到同类商家即可,边际成本趋近于零
推荐理由:对想挣现金流的普通人,这是当前门槛最低、成交最快的 AI 变现路径之一:你不需要会训练模型,只需要会用白标平台搭好一个『永不漏接电话+能预约』的语音前台,再把它当服务卖给本地小店。真正的坎不是技术(平台已经现成、$99/月就能起步),而是分发——能不能找到并说服一批同类小老板。所以最小切口是:先绑死一个你熟的垂直行业(比如本地诊所或家政),做出一套能证明『帮他们月增 X 个预约/少丢 Y 单』的样板,再靠口碑和转介绍在同行业里复制,按月收订阅。先做一个行业做深,比做通用工具好卖得多。
My Take:评分(5=最优):最快成交 4 / 最低成本 5 / 可复制 5 / 风险安全度 4。用现成白标平台把『帮小店永不漏接电话』做成按月收费的服务,技术门槛低、复制性强,成败主要看能否搞定分发和获客。
商机信号(加速):谁付钱:营业时间忙、一漏接电话就直接丢单丢预约的本地小店:诊所、餐馆、家政、维修、律所等 痛点:高峰期/下班后没人接电话,客户流失且看不见;请全职前台太贵,自己又搭不起 AI 切入点:锁定一个熟悉的垂直行业,用 Retell/Trillet 等白标平台搭好一套带预约的行业专用语音前台,做出可量化效果的样板店,再靠转介绍在同行业复制、按月订阅收费
仍在热榜 3
Repo microsoft/SkillOpt 在榜 2d SkillOpt 是微软开源的『技能优化器』:它不去微调模型,也不靠人手改提示,而是把一份 skill 文档当作冻结模型… Skills · 元技能
Repo MadsLorentzen/ai-job-search 在榜 2d ai-job-search 把 Claude Code 变成一套完整的『求职助理流水线』:fork 下来、填好自己的档案… AI App
Repo simstudioai/sim 在榜 2d Sim 是一个开源的可视化 agent 工作流构建器:用拖拽式的『积木』把大模型和你常用的工具连起来,快速搭出、部署、编… AI Agent