Hall of Fame
今日趋势综述
今天的信号:AI 的计价单位正从『一次回答』变成『一整件活』
把今天几条串起来,方向出奇一致:AI 正在从『你问它答』变成『你把活交给它、它自己干完』。最硬的信号来自 OpenAI——7 月 9 日 GPT-5.6 分 Sol/Terra/Luna 三档正式放开,同时上线的 ChatGPT Work 被官方明确定位成『去完成整份工作,而不只是回答问题』:它能跨你连接的应用和文件收集上下文,直接产出文档、表格、演示稿。换句话说,模型厂商自己在把产品从『对话框』推向『替你干活的员工』。
开源和工具层同频共振。usestrix/strix 冲到约 4 万星,卖点是『自主 AI 黑客』——把一次渗透测试从踩点、写 exploit、验证到出合规报告全程包圆,而不是丢给你一堆告警让你自己判断;msitarzewski/agency-agents 干脆把 230 多个带角色和流程的专家 agent 打包成『一整支 AI 代理公司』;Nx 团队的 Polygraph 则补上最关键的地基——让 agent 能跨仓库看清依赖全局、让会话记忆跨机器跨框架不丢,这样它才谈得上『把一件横跨五个仓库的活真正做完』。学术侧那篇多工具编排综述讲的也是同一件事:agent 的能力正从『调一个工具』进化到『把一串工具编排起来闭环一个任务』。当『干完一件活』成了默认期待,护城河就不在『会不会用某个模型』,而在『你能不能把一个具体的、有人付钱的活,稳定地交给 agent 跑通到交付』。
对想在 AI 时代挣到钱的普通人,今天最落地的一条是那位做 AI 语音前台的独立开发者:他用 Callin.io + n8n + Cal.com 给本地服务生意(年营收 $50 万–500 万那种)搭『帮你接电话、约客、跟进』的 AI 前台,每客户 $1–2K 启动费 + $300–800 MRR、约八成毛利。他卖的根本不是『AI 能力』,而是『帮你把接电话这件天天漏单的活干完』。这就是今天所有信号的共同落点——别再把 AI 当成一个会回答的聊天框去展示,去找一个『有人正因为没人/没空干而漏钱』的具体活,用现成组件把它整件包圆、按月收费。计价单位从「回答」变成「干完的活」,恰恰是个人能切进去、且客户愿意持续付费的地方。
OpenAI 放开 GPT-5.6(Sol/Terra/Luna)与 ChatGPT Work:官方定位是『去干完整份工作,而不只是回答问题』
展开详情
- **从答问题到干整活**:ChatGPT Work 被官方定位为『执行整份工作』的 agent,能跨应用/文件收集上下文并直接产出文档、表格、演示稿等成品
- **三档定价拉开梯度**:Sol $5/$30、Terra $2.5/$15、Luna $1/$6(每百万 token),让你按『任务难度 vs 成本』挑档,便宜档足以塞进大批量自动化
- **效率是新战场**:Sol 号称 agentic coding token 效率 +54%、并加入把活拆给子模型的 ultra 模式——比拼的不再只是聪明,而是『同样的活花更少钱干完』
usestrix/strix
展开详情
strix 解决的是『渗透测试太贵、太慢、太依赖稀缺的安全专家』这个老大难。它是一套开源的自主 AI 渗透测试工具——把自己定位成『会自己找漏洞并给出修复的 AI 黑客』:多个 agent 协作,从侦察、开发 exploit、到用 PoC 验证漏洞真实性,再到生成合规级的渗透测试报告,全程闭环,而不是像传统静态扫描那样甩给你一堆真假难辨的告警。它能扫本地代码库、分析 GitHub 仓库、也能对 Web 应用做黑盒评估,覆盖 OWASP Top 10,并原生接入 CI/CD(尤其 GitHub Actions)。一句话:它把『做一次渗透测试』这件活,从一份需要专家的人力工程,压成一条能在流水线里自动跑的 agent 流程。
周增长:近期在 Trendshift / GitHub 安全类趋势榜快速攀升,是 2026 年 7 月最受关注的开源安全 agent 之一(不同第三方数据源星数口径存在出入,此处以仓库主页为准)
- **整件活闭环**:从踩点、写 exploit、PoC 验证到出合规报告全程自动,交付的是『验证过的结论+修复建议』而非一堆待人工分诊的告警
- **多 agent 协作 + 少误报**:以多 agent 编排做协同安全测试,强调经 PoC 证实的真实问题,直击静态扫描误报泛滥的痛点
- **能进流水线**:原生接 CI/CD(尤其 GitHub Actions),可对本地代码、GitHub 仓库、Web 应用做黑盒评估,把安全体检变成持续跑的自动流程
msitarzewski/agency-agents
展开详情
agency-agents 想解决的是『你想让 AI 帮你干一整摊事,却每次都要从零写一堆角色提示词』。它把 230 多个带明确专业、性格和工作流的专家 agent 打包成一支『开箱即用的 AI 代理公司』,横跨工程、设计、市场、销售、产品、安全等 20 多个部门,可直接部署到 Claude Code、GitHub Copilot、Cursor 等多种 AI 工具里,还配了跨工具安装脚本和一个原生桌面 App 方便管理。它的卖点是『用有流程、有交付物的专业分工,替代千篇一律的通用提示词』——不是给你一个万能助手,而是给你一整队各司其职、各有产出的角色。
周增长:本周约 +1.5k 星,是 Trendshift 周榜上升最快的 AI agent 项目之一
- **一整支 AI 团队**:230+ 个带专业/性格/流程的角色 agent,横跨工程、设计、市场、销售、产品、安全等 20+ 部门,开箱即用
- **跨工具可部署**:支持 Claude Code、GitHub Copilot、Cursor 等,配跨工具安装脚本和桌面 App,不锁死在某一个 AI 编码工具里
- **专业分工胜过万能提示**:强调每个 agent 有文档化流程和明确交付物,用角色化分工替代一句通用 system prompt 打天下
Polygraph(Nx 团队):让 AI agent 跨仓库看清全局、会话记忆跨机器跨框架不丢
展开详情
- **跨仓库全局视野**:索引你所有可访问仓库并建依赖图,让 agent 把分散仓库当成一个合成 monorepo 来规划跨仓库任务
- **记忆跨机器跨框架**:会话记忆持久化且转写规范化,同事在 Claude 里开的会话你能在 Codex 里接着做,不再『换个工具就失忆』
- **面向真实交付**:一次会话里管多个仓库、跨仓库跑 CI、并在开 PR 前验证一个共享库改动对 5 个下游仓库的影响
The Evolution of Tool Use in LLM Agents: From Single-Tool Call to Multi-Tool Orchestration
展开详情
- **一条演进主线**:把 agent 工具能力从『单工具调用』到『多工具编排』的路径讲清楚,帮你给市面上一堆 agent 能力归位
- **编排才是关键**:明确指出『能否干完整件活』取决于工具选择、调用规划、错误恢复与多工具协同,而非单次回答的准确率
- **可迁移的框架**:把碎片化的工程实践归纳成结构化问题清单,是理解和自研 agent 时省时间的『该关注什么』地图
AI 语音前台代运营:用 Callin.io + n8n + Cal.com 给本地生意搭『帮你接电话』的 AI,每客户 $300–800 MRR、约八成毛利
展开详情
- **堵的是漏钱的洞**:本地生意漏接一个电话就漏一单,AI 语音前台直接解决『没人接/接不过来』,价值肉眼可见、老板愿意付
- **全用现成白标件**:Callin.io(语音)+ n8n(自动化)+ Cal.com(排期)拼装,不用自研、不用训模型,一个人当天就能搭出可交付的东西
- **单位经济健康**:$1–2K 启动费 + $300–800 MRR、约八成毛利,只要几个客户就能稳定跑起来,可复制到不同本地行业