📅
Hall of Fame
Hall of Fame
Track
Type
Source
9月26日 周六 · 8 条
今日趋势综述
agent 工具战从「单个更聪明的 agent」转向「怎么同时管一队、怎么把 token 省下来、怎么按每任务成本挑模型」——Orca 让你并行跑一队编码 agent、context-mode 把工具输出砍掉 98%、GPT-6 Sol/Luna 把便宜档做成选型新坐标;与此同时巨头在硬件入口(Muse 进眼镜)和算力(Colossus 2 冲 144 万卡)上厮杀,普通人真正能收到钱的仍是法律、语音前台这类垂直落地。
今天的信号:agent 进入「车队 + 成本」时代

这两天几条工具线拼在一起,指向 agent 使用方式的一次换挡:主角从「一个更聪明的 agent」变成「怎么同时管一队 agent、怎么让它们别把上下文和钱烧光」。Stably AI 的 Orca 冲到 7.8 万星,卖点是让你在各自隔离的 git worktree 里并行跑五六个编码 agent、从一个界面盯全场;context-mode 用 MCP 把工具输出从 315KB 压到 5.4KB(98% 削减)、把会话状态存进 SQLite 按需检索;连智谱 Z.ai 都开源了自己的编码 agent 工作台 ZCode。信号很一致:单个 agent 已经不稀奇,能同时编排一队、还能把 context 成本压住,才是新的工程门槛。

和这条线咬合的是选型逻辑的变化。OpenAI 刚把 GPT-6 Sol/Luna 的便宜档推出来——Sol 定价对标 Opus 5.5,Luna 便宜到 $0.10/$0.50(比 Opus 5.5 便宜约 40 倍),在 AutomationBench 上 Sol 高强度跑出接近 Opus 5.5 的分数却只花约三分之一的每任务成本。加上前几天 Opus 5.5 登顶智力指数,结论越来越清楚:模型能力在顶部挤成一团、价格却在跳水,选型该看「这一类任务,谁的每任务成本最低、能不能自托管」,而不是谁 token 单价便宜、谁榜首。会「按任务分层调度不同价位的模型」正在变成一项实打实的省钱技能。

巨头则把战线抬到了个人够不着的地方:Meta 在 Connect 上把 Muse 塞进智能眼镜、抢下一代硬件入口,马斯克宣布 Colossus 2 年底可能冲到 144 万块 GPU——入口和算力是资本游戏。对个人,机会依旧在「模型已经够用、但还没接进真实业务」的缝隙:法律行业一线已经把尽调文档审阅时间砍掉 73%(M&A 项目从 200 小时压到 54 小时),一个人用现成语音模型给本地小生意做 AI 前台,单客户能收 $300–800/月、毛利约 80%。别在能力层和算力层里内卷,去做编排、做省钱调度、做垂直交付——那才是这一波普通人能落袋的地方。

今日新增 7
#02
GitHub Repo
★ 949 NEW

mikehasa/golive-skill

golive-skill 补的是 vibe coding 之后最脏最烦的一段:东西做出来了,但要真正上线得注册一堆服务、连 Vercel/Netlify、开 Supabase/Neon、买域名(Porkbun/GoDaddy)、配邮件(Resend)、接 Stripe 支付……它把这套「上线运维」打包成一个 agent 可调用的技能,用你自己的账号操作、零 GoLive 托管服务、无遥测,纯本地 Node CLI。关键在它的安全设计:每一步先 detect→plan,改动前要 --yes 审批,DNS/生产部署/删除等危险操作还要二次确认,支持有限回滚。目前是 v0.1 早期 alpha,但它示范了一个正在冒头的品类——「让 agent 不只写代码,还能把产品推上线」的自动化技能。
#Skills#自动化集成#TypeScript
展开详情

一个开源的 agent 技能(skill):把「agent 做出来的产品」真正上线——托管、数据库、域名、邮件、支付全用你自己的账号一键搞定,走「检测→规划→审批→执行→校验」五步,改动前必须人工点头。

周增长:约 +900/周(本周新上榜 GitHub Trending)

  • **补上「最后一公里」**:托管/数据库/域名/邮件/支付一键接好,全用你自己的账号,专治 agent 写完代码却上不了线
  • **审批闸门**:detect→plan→approve→apply→verify 五步,DNS 与生产部署要二次确认,凭「人工把关」把自动化风险关住
  • **信号**:本周新上 GitHub Trending,TypeScript、零后端零遥测,代表 skill 从「帮 agent 写代码」扩到「帮 agent 交付运维」
推荐理由:对独立开发者和做 AI 交付的小团队:会写代码的 agent 已经不稀缺,能把产品「安全地推上线并运维」的能力才是稀缺环节。golive-skill 这类「部署技能」提示了一个可切入的活——帮别人把 agent 生成的原型接上真实的托管/支付/域名并对结果负责,这正是很多个人开发者卡住、愿意付钱的地方。
商机信号(萌芽):谁付钱:用 AI/agent 快速做出原型、却卡在「上线运维」这一步的独立开发者和小工作室 痛点:产品做出来了,但配托管、数据库、域名、支付、邮件这套上线杂活既烦又容易出错,还怕搞坏生产环境 切入点:做「agent 产品上线代运维」的小服务:用这类部署技能帮客户把原型安全推上线并托管,按项目或月费收钱,先吃「会做不会上线」这批人的需求
#03
digitalapplied.com Article
NEW

GPT-6 Sol/Luna 把「便宜档」做成选型新坐标:Sol 高强度≈Opus 5.5 分数却省约 2/3 每任务成本,Luna 便宜 40 倍

OpenAI 在 9 月 22 日补齐了 GPT-6 的便宜档:Sol 定价 $2/$10(每百万 token 输入/输出),正好对标 Claude Opus 5.5;Luna 只要 $0.10/$0.50,比 Opus 5.5 便宜约 40 倍。分数上顶级模型仍略胜——在两家都报的 AutomationBench 上 Opus 5.5 领先 40.0% vs Sol 33.2%;但一算「每任务成本」画风就变了:Sol 高强度(xhigh)在 AutomationBench 拿 33.2% 只花 $0.27/任务,而 Opus 5 顶配拿 26.9% 却贵 11.1 倍;Luna 顶配在 DeepSWE 拿 66.6% 只花 $0.22,和 Sol xhigh 花 $1.00 拿到的同分。结论是:顶部能力挤成一团、价格却在跳水,选型的关键坐标从「谁 token 单价低/谁榜首」变成「这一类任务谁的每任务成本最低」。
#评测
另有 2 家信源报道
展开详情
  • **对比(价格)**:Sol $2/$10 对标 Opus 5.5;Luna $0.10/$0.50,比 Opus 5.5 便宜约 40 倍
  • **对比(每任务成本,AutomationBench)**:Sol xhigh 33.2% @ $0.27/任务 vs Opus 5 顶配 26.9% @ 11.1 倍成本;分数榜 Opus 5.5 仍领先(40.0 vs 33.2)
  • **对比(DeepSWE)**:Luna 顶配 66.6% @ $0.22 = Sol xhigh 花 $1.00 的同分——同分下按成本挑更便宜档
推荐理由:对开发者和做 AI 产品的普通人:现在最省钱的做法不是「一律上最强模型」,而是按任务难度分层——需要稳、需要顶级推理的关键任务上 Opus 5.5/Astra;量大、结构化、可容错的批量活用 Sol/Luna,能把账单砍掉几倍到几十倍。真正值钱的技能是「给不同任务配不同价位的模型 + 用每任务成本而非 token 单价比价」,这套调度能力现在就能直接省钱。
#04
thomsonreuters.com Article
NEW

法律 AI 落地实测:GenAI 使用率一年从 28% 涨到 41%,尽调文档审阅时间砍 73%(M&A 200 小时→54 小时)

法律是今年 AI 落地数据最扎实的行业之一。2026《AI in Professional Services》报告显示,律所里生成式 AI 的使用率一年从 28% 涨到 41%,企业法务从 23% 涨到 47%;Clio 称 79% 的法律从业者已在实践中用 AI,但全所范围的结构化采用只有约 34%——用起来的人多,真正体系化落进流程的少。真实效果上,有管理合伙人报告 AI 把尽调文档审阅时间砍掉 73%:一个典型 M&A 尽调从计费 200 小时压到 54 小时;有明确 AI 战略的律所拿到可见 ROI 的概率是别人的近 4 倍。合同审阅是最集中的场景,52% 的企业法务已在用或评估。整体市场预计从 2025 年的 21 亿美元长到 2030 年的 39 亿美元(CAGR 17.3%)。
#行业应用
另有 1 家信源报道
展开详情
  • **采用率**:律所 GenAI 使用率一年 28%→41%,企业法务 23%→47%;但全所结构化采用仅约 34%,瓶颈在流程而非模型
  • **硬效果**:尽调文档审阅时间砍 73%,M&A 尽调从 200 小时压到 54 小时;有明确 AI 战略的律所拿到 ROI 概率高近 4 倍
  • **场景**:合同审阅最集中(52% 企业法务在用/评估);市场 2025 年 21 亿→2030 年 39 亿美元,CAGR 17.3%
推荐理由:对想切法律 AI 的个人/小团队:机会不在「再造一个法律大模型」,而在「把已经够用的模型接进律所的真实流程」——数据显示卡点是结构化采用(只有 34%),也就是没人把 AI 稳稳嵌进尽调、合同审阅这些具体工序。会做「垂直场景的流程改造 + 评测把关 + 数据合规」的交付型角色,比纯做工具的更容易在这个高客单价行业收到钱。
#05
GitHub Repo
★ 23200 NEW

ousamabenyounes/context-mode

context-mode 盯的是 agent 最贵也最容易被忽视的成本——上下文里堆的工具输出。它做成 MCP server + 各平台原生 hook:工具(如 ctx_execute)在隔离子进程里跑,原始数据留在沙箱、只有精简后的 stdout 进 context;每一次文件编辑、git 操作、任务、报错都记进 SQLite 并用 FTS5 建索引,会话被压缩时用 BM25 检索「只取相关的那部分」回灌,而不是把原始记录重新塞回去;ctx_index/ctx_search 还能把 markdown 知识库切块检索。它支持 17+ 平台(Claude Code、Cursor、VS Code Copilot、Codex CLI 等),2100+ 次提交、是个成熟在维护的项目(ELv2 协议)。它和 Orca 是同一趋势的两面:一个管「并行的一队 agent」,一个管「每个 agent 别把 context 和钱烧光」。
#Infra#TypeScript
展开详情

给编码 agent 做「上下文瘦身」的 MCP 中间层:把每次工具调用灌进上下文的原始数据关进沙箱,只让摘要进 context(315KB→5.4KB,声称 98% 削减),并把会话状态存进 SQLite 按需检索。

周增长:约 +2K/周

  • **工具输出砍 98%**:原始数据关进沙箱、只让摘要进 context,315KB→5.4KB,直接压 token 账单
  • **会话可恢复**:编辑/git/任务/报错记进 SQLite+FTS5,压缩后用 BM25 只回灌相关片段,而非重塞原始记录
  • **信号**:17+ 平台 hook、2100+ 提交、约 2.3 万星、ELv2,代表「context 工程」正在长出专门的基础设施层
推荐理由:对做 agent 的开发者:token 账单里最大的一块常常不是 agent 写的代码,而是工具输出反复灌进上下文的 overhead。context-mode 这套「工具输出沙箱化 + 会话状态外置 + 按需检索」的思路,是把 agent 从 demo 推向长时间生产运行时绕不开的一课——就算不用它,也该把这套降本模式抄进自己的项目。
#06
GitHub Repo
★ 6800 NEW

zai-org/ZCode

ZCode 是又一家一线大模型公司把自己的「编码 agent harness」开源出来——继各家竞相做编码 agent 之后,智谱 Z.ai 用 Apache-2.0 放出了自己的工作台。它的形态是「一套后端 + 多种前端」:桌面(Electron)、Web、终端 TUI 三种界面共享同一个 Agent runtime 和 provider 系统,一个 zcode 命令就能在本地做编码助手,也能作为远程服务部署,支持 SSH/WSL 远程开发场景。它本身的星数(约 6.8K)不算爆炸,但信号明确:编码 agent 的「工作台/harness」这一层正在从各家自研走向开源标准化,连中国头部实验室也在这条赛道上摆开架势。
#AI Agent#TypeScript
展开详情

智谱 Z.ai 开源的编码 agent 工作台:一个统一的 zcode 命令,同时提供桌面应用、浏览器界面和终端 Agent 三种入口,可本地跑也可远程部署(支持 SSH/WSL)。

周增长:约 +2K/周(本周上榜 GitHub Trending)

  • **一命令三入口**:桌面/浏览器/终端共享同一 Agent runtime 与 provider 系统,本地或远程(SSH/WSL)皆可
  • **开源信号**:智谱 Z.ai 出品、Apache-2.0,一线大模型公司把编码 agent 工作台开源,harness 层正在标准化
  • **定位**:不是模型而是「跑模型的壳」,和 Claude Code、Codex、Orca 争同一层——谁掌握开发者的日常入口
推荐理由:对开发者:编码 agent 的竞争正从「谁的模型强」下沉到「谁的工作台顺手、能不能自托管、锁不锁模型」。像 ZCode 这类开源 harness 的价值在于可自托管、可换底层模型——对在意数据不出内网、想按每任务成本换模型的团队尤其实用。留意这条「开源 agent 工作台」赛道,它决定了你未来每天在哪个壳里干活。
#07
indiehackers.com Product 直接可用
NEW

AI 语音前台「代运营」的单人经济账:$1–2K 搭建 + $300–800/月/客户、约 80% 毛利,2–3 周见首单

前几天我们扒过语音前台的工具(Retell/ThunderPhone)和垂直缝隙(牙科、家政),这条是把「一个人靠它挣现金流」的经济账算明白:用 Callin.io 这类白标语音平台 + n8n 编排 + Cal.com 排期,给本地服务生意(年营收 $50 万–500 万那类)做 AI 接线员,单价是一次性搭建 $1–2K 外加每客户 $300–800/月,毛利约 80%,从接单到首笔收入通常 2–3 周。需求侧的痛点很硬:小生意每漏接一通电话平均损失 $500–2K,全美/欧仍有 6200 万家小微在用 2005 年的老流程接客。它不是新工具,而是一份可复制的「现金流配方」——门槛低、成交快、按月续费。
#小微现金流#典型:一次性搭建 $1–2K…
另有 1 家信源报道
展开详情
  • **单位经济**:一次性搭建 $1–2K + 每客户 $300–800/月,约 80% 毛利,2–3 周见首单
  • **需求硬**:小生意每漏接一通电话损失 $500–2K,6200 万家小微仍在用老流程,付费意愿明确
  • **工具栈**:白标语音平台(Callin.io 等)+ n8n 编排 + Cal.com 排期,无需自研,个人可跑通
推荐理由:对想用 AI 挣现金流的普通人:这是当下「最快成交」的一类活——不需要造模型、不需要大团队,把现成语音 agent 打包成本地生意的 AI 前台,按月收订阅。关键不是技术,而是找客户和把交付标准化:先锁一个垂直(诊所/家政/med spa),做出一个能演示的样板,再复制到同类商家。
My Take:评分(5=最优):最快成交 5 / 最低成本 4 / 可复制 5 / 风险安全度 4。用现成白标语音栈给本地小生意做 AI 前台,是现在个人最容易跑通、按月续费的现金流生意。
商机信号(加速):谁付钱:年营收 $50 万–500 万、靠电话接单又常漏接的本地服务生意(诊所、家政、维修、med spa 等) 痛点:高峰期没人接电话,每漏接一通平均损失 $500–2K,请全职接线员又贵(年 $2.8–3.5 万) 切入点:用白标语音平台 + n8n + Cal.com 打包成「AI 前台代运营」,锁定一个垂直做出样板再复制,一次性搭建费 + 每月 $300–800 订阅
#08
Twitter/X Opinion
NEW

Elon Musk

#Infra
另有 2 家信源报道
推荐理由:对个人:算力和硬件入口是资本游戏,普通人挤不进也不该挤。真正的启示是反过来的——当头部把几十万卡堆起来、把模型价格打到地板(见今天 GPT-6 Sol/Luna),「智能」正在变成像电一样的商品。你的机会不在发电,而在用电:把便宜且够用的模型接进具体业务、做省钱调度和垂直交付,才是这波算力洪水下普通人能站住的位置。
仍在热榜 1
Repo stablyai/orca 在榜 8d 来自 YC W22 的 Stably AI:一个「Agent 开发环境(ADE)」,让你在各自隔离的真实 git wor… DevTools