📅
Hall of Fame
Hall of Fame
Track
Type
Source
8月2日 周日 · 8 条
今日趋势综述
模型不再是护城河:本周最猛的信号集中在『围着模型搭脚手架』——多人协作的 agent harness、编排评测基准、把前沿模型塞进 2GB 内存本地跑,以及让 agent 干成片、接电话的真实活。
今天的信号:会搭脚手架的人,正在接管 agent 时代

把今天的条目连起来看,一条主线非常清楚:值钱的地方正在从『模型本身』外移到『围着模型搭的那圈东西』。yc-software 的 qm 是个多人协作的 agent harness、lopopolo 把 harness engineering 直接写成了一本工程手册、arXiv 上的 OrchBench 开始专门评测『多 agent 编排方案』好不好——这三件事指向同一个判断:模型能力已经过剩,真正的瓶颈是上下文怎么给、工具怎么接、多个 agent 怎么协同、以及怎么把这套编排『评』出好坏。谁会搭这套脚手架,谁的产出就高一个数量级。

另一半信号是『能力下沉 + 落地变现』:turbo-fieldfare 用流式加载把 Gemma 4 26B 塞进 8GB Mac、约 2GB 常驻内存就能跑,前沿模型的推理成本正在被压到个人设备上;video-shotcraft 让 Claude Code 直接产出电影级产品短片、qwen-audio-agent 用开源实时语音让 agent 边聊边干活——agent 已经不只是写代码,而是在做视频、接电话、跑工厂质检这些能直接换钱的活。Kleo 三个月做到 $62k MRR(虽然赢在创始人自带 LinkedIn 流量)、制造业视觉质检普遍跑到 200% ROI,都是同一个逻辑的下游。

对个人的启示很直接:别再追每周换一次的新模型榜。把时间花在两件会复利的事上——第一,练『给 agent 搭环境』的手艺(写好上下文、接好工具、设计编排、会评测),这是 harness engineering 正在成型的新工种;第二,盯一个能用 agent 直接产出可交付物、且有人已经在付钱的具体场景(做片、接电话、质检、写社媒),把开源能力接成现金流。模型是租来的,脚手架和场景才是你自己的。

#01
GitHub Repo
★ 4.9k NEW

yc-software/qm

qm 抓住的痛点是:现在人人有 Claude Code / Codex,但都是各玩各的,团队层面没有一个共享的 agent 工作台。它给每个人一个隔离的持久化沙盒(工具装一次就常驻),同时提供『个人 + 共享』两种作用域——你可以在私有区里折腾,也能把 agent、频道、内部小应用共享给全队。能力上它把 agent 接到公司的内部笔记、邮件、文档、数据库和网络,支持定时任务和后台自动化(收件箱分诊、跑报表),还能让 agent 直接在代码仓里干活、临时搭个内部 Web 应用部署出去。架构是 TypeScript/Node + Postgres 持久化,安全上给了 Strict(每步审批)/ Auto(默认带筛查)/ Dangerous(放开)三档姿态,并有管理员控制和按人分权。模型层不锁死,Pi、OpenCode、Codex、Claude Code 都能接。
#AI Agent#TypeScript
展开详情

一个面向创业团队的『多人协作 agent harness』:每个员工有自己的沙盒工作区,又能通过 Slack 和 Web 一起协作,让 agent 从个人工具变成团队操作系统。

周增长:2026-07-29 创建,约 3 天冲到 4.8k+ 星(均值 >1.5k/天),是本周最猛的 agent 基础设施黑马

  • **定位**:不是又一个 coding agent,而是把 agent 拉到团队层的协作 harness——个人沙盒 + 共享作用域 + Slack/Web 统一身份
  • **能力**:接内部笔记/邮件/文档/数据库/网络,支持定时任务、收件箱分诊、临时内部应用一键部署
  • **安全**:Strict/Auto/Dangerous 三档执行姿态 + 管理员按人分权,把『放开 agent』的风险做成可配置的旋钮
推荐理由:对个人的机会有两层:短期,如果你在小团队,这类工具让你不用等大厂 IT,就能给全队搭一个共享 agent 工作台,谁先把团队的『共享 agent + 内部知识』跑通,谁就掌握了协作效率的杠杆。更深一层——qm 这类项目在明确一个新方向:agent 产品的下一战场不是单机能力,而是『多人 + 权限 + 编排 + 治理』。会设计这套协作与授权结构的人,正在从『用 agent 的人』升级成『给组织搭 agent 的人』。
商机信号(加速):谁付钱:10–50 人的创业团队和小型 agency——已经人人在用 coding agent,但缺一个团队级共享工作台和权限治理层 痛点:每个人各用各的 agent,内部知识散落、无法共享 agent/流程、放开权限又怕失控,团队层面没有统一入口和审批 切入点:个人/小团队可以基于这类开源 harness,给某个垂直行业(律所、诊所、跨境电商)做『带内部知识 + 分权审批』的定制化团队 agent 工作台,按坐席月费收费
#02
GitHub Repo
★ 3.6k NEW

drumih/turbo-fieldfare

turbo-fieldfare 干的是一件反直觉的事:让一台 8GB 内存的 MacBook Air 跑得动 26B 的 MoE 大模型。它的核心是『流式加载』架构——只把 1.35GB 的共享核心和 FP16 的 KV cache 常驻内存,专家权重(experts)则在推理时按需从 SSD 流式读取。权重用 4-bit 量化(router 用 8-bit),配一个 LFU 缓存和有界并行磁盘读,在每层 transformer 计算时把需要的专家捞进来;再用 chunked prefill(每次最多处理 128 token)摊薄专家加载成本,并在 Metal 算别的算子时用有界并行 pread 把磁盘读藏起来。实测:M2 MacBook Air(8GB)解码 5.1–6.3 tok/s,M5 Pro(24GB)到 31–35 tok/s。需要 macOS 26 + Metal 4、Xcode 26、Swift 6.2,安装占约 14.3GB 磁盘。
#LLM/Model#Swift
展开详情

用 Swift + Metal 写的推理运行时,让 Google 的 Gemma 4 26B-A4B 这个 260 亿参数模型,在只有 8GB 内存的 Apple Silicon Mac 上、约 2GB 常驻内存就能跑起来。

周增长:2026-07-17 创建,约两周冲到 3.6k 星,是本周本地大模型方向的高热项目

  • **反直觉**:26B 模型不再需要 26GB 内存——靠 SSD 流式加载专家权重,2GB 常驻内存就能跑
  • **数字**:M2 Air(8GB)5.1–6.3 tok/s、M5 Pro 31–35 tok/s;4-bit 量化 + LFU 专家缓存 + chunked prefill 128 token
  • **工程**:全套自定义 Metal kernel(量化算子/注意力/MoE 路由/采样)+ 流式安装器,边下边重打包不落地完整 checkpoint
推荐理由:这条对普通人的意义是『前沿能力正在白嫖化』:你不需要 A100、也不需要氪金云 API,一台普通 Mac 就能本地跑接近前沿的开源模型,隐私敏感、离线、成本敏感的场景全被打开。更值得学的是它的思路——把『内存不够』变成『用 SSD 换内存 + 精细调度』的工程题。会做这类系统级优化(量化、缓存、调度、把 IO 藏进计算)的人,在端侧 AI 爆发的当下极度稀缺,这是比追模型榜更硬的技能。
#03
GitHub Repo
★ 2.4k NEW

lopopolo/harness-engineering

这个项目的核心主张是:与其等更强的模型,不如把 agent 所处的『环境』做好。作者把 harness engineering 定义为『在模型固定的前提下,通过塑造上下文和工具来提升 agent 产出』,并直言『大多数人不知道,你完全可以让 agent 直接读我的写作、推文、播客和演讲,产出就能提升 100 倍』。文集从系统层面讲:怎么把组织的非功能性需求(可靠性、安全、性能、可维护性)嵌进 agent 的运行上下文,怎么把隐性的流程知识——当前状态、本地术语体系、职权关系——变成 agent 可检索、可执行的文档、示例和约束。中心论点是『最后一公里的活』:通用模型权重里没有你公司的私有流程数据,把这些隐性知识结构化成上下文和工具,再通过一轮轮反馈循环让 agent 的判断力累积起来,才是可靠落地的关键。
#DevTools#Python
展开详情

一本关于『harness engineering』的工程文集与实操手册:把模型和 coding agent 当成固定不变的,转而系统性地优化围绕它的两根外部杠杆——上下文和工具。

周增长:2026-07-18 创建,两周冲到 2.4k 星,踩中『harness/上下文工程正在成为新工种』的风口

  • **范式**:把模型/agent 当常量,只优化『上下文 + 工具』两根外部杠杆——这就是 harness engineering 的定义
  • **金句**:『让 agent 读你的写作、推文、播客、演讲,产出就能提升 100 倍』——知识资产比提示词更值钱
  • **落地**:核心是『最后一公里』——把组织隐性流程知识变成可检索、可执行的上下文与约束,靠反馈循环累积判断力
推荐理由:这份文集其实在给一个正在成型的新工种写岗位说明书。对普通人的机会:如果你觉得自己『不够懂算法、拼不过做模型的人』,harness engineering 恰好是一条不需要训模型也能吃到 agent 红利的路——它拼的是工程判断、领域知识组织能力和把隐性经验显性化的本事。现在就开始练:选一个你熟的业务流程,把它的规则、术语、常见坑写成 agent 能读的上下文和工具,做出可复现的产出提升,这份手艺在企业 AI 落地里会越来越值钱。
#04
arXiv Paper
NEW

OrchBench: Evaluating Multi-Agent Orchestration Plans in Isolation via Deterministic Simulation

OrchBench 针对一个真实痛点:当你搭一套多 agent 系统时,产出差往往分不清是『编排方案设计得烂』还是『模型本身不行』。它把多 agent 编排方案抽象成——给各个 agent 分派子任务、并规定 agent 之间如何传递信息——然后用确定性模拟(deterministic simulation)在隔离环境里评测这个『编排计划』本身的质量,绕开底层模型随机性的干扰。这样一来,编排的好坏第一次可以被单独、可复现地量化,而不是每次都要拉真实模型端到端跑、结果还带一堆噪声。它和同期一批 agent 评测工作(如把 base 模型能力与框架设计解耦的 UniClawBench)共同指向一个趋势:agent 评测正在从『测模型』细分到『测 harness / 测编排 / 测框架』。
多 agent 系统越来越多,但过去评测总是把『编排方案好不好』和『底层模型强不强』混在一起测。OrchBench 第一次尝试把『编排计划』单独拎出来、用确定性模拟隔离评测,指向 agent 时代一个新的工程学科:编排本身是可评估、可优化的对象。
#AI Agent
另有 1 家信源报道
展开详情
  • **问题**:多 agent 产出差,分不清是编排烂还是模型弱——评测把两者混在一起,无法定位
  • **方法**:把编排方案抽象成『子任务分派 + 跨 agent 信息传递』,用确定性模拟隔离评测编排本身
  • **趋势**:与 UniClawBench 等一起,标志 agent 评测从『测模型』分化出『测编排/测框架』的新方向
推荐理由:对做 agent 的人,这篇的实用启示是:别再用『换个更强的模型试试』来调多 agent 系统,那样你永远不知道问题出在哪。把编排逻辑(谁做什么、信息怎么传)单独拎出来评测和迭代,才能稳定提升。更大的机会是——『评测 agent 编排』本身正在变成一门手艺和一类产品需求。谁能帮企业把自家 agent 工作流的编排质量量化出来、给出可复现的优化建议,谁就卡住了 agent 落地链条上一个还很空的位置。
#05
GitHub Repo
★ 3.1k NEW

Vincentwei1021/video-shotcraft

video-shotcraft 把 agent 从『写代码』推进到『做成片』。它自带一套 104 张『分镜配方卡』(shot recipe cards),每张卡写清这个镜头的用途、能量级、时长、参数和实现要点,都是从 Figma、Notion、Slack 这类专业产品片里拆解出来的手法;再配 161 种运镜风格,全部在在线 Gallery 里可搜索、可筛选、可预览。还有一个开箱即用的『Ink Press』模板——一支已验证的 36 秒 promo(1920×1080、30fps、10 个镜头),带转场、标题卡和完整 SFX 混音,你只要把产品截图和品牌换进去就能出片。资源上还打包了可复用的 Remotion 组件、页面截图脚本、5 首背景music 和分成 16 个场景类别的 149 个音效。agent 的用法很简单:按名字引用分镜卡来现搭视频,或直接套模板秒出成品。
#Skills#设计多媒体#TypeScript
展开详情

一个给 Claude Code / Codex 用的『电影级产品短片』agent skill:基于 Remotion(React 视频框架),让 agent 直接把产品截图变成有分镜、有运镜、有音效的成片。

周增长:2026-07-19 创建,两周冲到 3.1k 星,是本周 Skills 生态里最出圈的创作类技能

  • **能力**:agent 直接产出电影级产品片——真实页面截图 + 2.5D 运镜 + 卡点剪辑 + 影视级音效
  • **素材**:104 张分镜配方卡(拆自 Figma/Notion/Slack 的专业片)+ 161 种运镜 + 149 个音效 + 5 首 BGM
  • **模板**:开箱即用的 36 秒 promo 模板(10 镜头 + 转场 + 混音),换截图换品牌即可出片
推荐理由:对个人创作者和独立开发者,这是一条被打开的现金流缝隙:过去做一支像样的产品 promo 要么外包(几千块起)、要么自己啃剪辑软件。现在用一个 skill,让 agent 按专业分镜规则直接产出,成本和门槛断崖式下降。更深的启示——Skills 生态正在从『帮你写代码』扩到『帮你做可交付的成品(视频/设计/文案)』。会把某个专业领域的手艺(这里是产品影片的分镜与节奏)沉淀成 agent skill 的人,等于把一门手艺打包成了可无限复用的资产。
商机信号(萌芽):谁付钱:独立开发者、小型 SaaS、跨境电商卖家——需要产品 promo/广告短片但请不起视频团队 痛点:做一支专业产品短片要么外包几千块起、要么自己啃剪辑软件,出片慢、贵、不稳定 切入点:个人可以基于这类 skill 接『AI 快速产品短片』的小单(按片收费 199–999),或做垂类模板包(如独立游戏/美妆/餐饮 promo)售卖
#06
GitHub Repo
★ 1.2k NEW

QwenAudio/qwen-audio-agent

qwen-audio-agent 解决的是语音 agent 的一个体验硬伤:过去你说完话得干等它执行完才能继续。它做的是全双工实时语音——支持自然打断,同时前台对话和后台任务并行跑:你在跟它聊,它在后台异步执行多个独立任务,算完自动把结果塞回对话。接入上兼容 OpenCode、OpenClaw、Qoder、Claude Code 等多种 agent 协议,提供 WebUI、终端 TUI 和 macOS 桌面『悬浮球』三种界面,还带本地用户档案和跨会话记忆。架构上走 DashScope API + ACP(Agent Client Protocol),Apache 2.0 开源,npm 可装,macOS/Linux/Windows 三平台,需要 Node.js 22.22.2+ 和 DashScope API Key。
#AI App#JavaScript
展开详情

阿里 Qwen 团队开源的实时语音运行时,让 AI agent 能『边聊边干活』:前台对话和后台任务并行,全双工语音、可自然打断,结果算完自动回到对话里。

周增长:2026-07-27 创建,几天内到 1.2k 星,来自阿里 Qwen 团队的开源实时语音运行时

  • **体验**:全双工实时语音 + 自然打断,前台对话与后台任务并行——不用干等执行
  • **协议**:兼容 OpenCode/OpenClaw/Qoder/Claude Code,WebUI + TUI + macOS 悬浮球三种界面,带跨会话记忆
  • **开源**:Apache 2.0,npm 可装,三平台;背后是阿里 Qwen 团队 + DashScope + ACP 架构
推荐理由:语音正在成为 agent 最自然的入口,而开源实时语音运行时的出现,意味着『做一个能接电话/能对话干活的语音 agent』不再必须按分钟付费给闭源平台。对想挣现金流的人,这打开了一个具体切口:用开源实时语音跑门店/诊所/工作室的前台接待,把过去按分钟计费的闭源方案,换成自己可控、成本更低的自建方案。会把开源语音能力接成某个垂直行业前台系统的人,能吃到这波语音 agent 落地的红利。
商机信号(加速):谁付钱:本地小生意主——诊所、餐厅、维修/家政、律所前台,痛在营业外和高峰期漏接电话 痛点:漏接一个电话平均损失 $50–150,请全职前台一年 $28k–35k,闭源语音方案按分钟计费长期不便宜 切入点:个人可基于开源实时语音运行时,给单一垂类(如牙科诊所)做『7×24 语音前台 + 预约登记』,按月订阅收费,自建成本远低于按分钟计费
#07
tech-stack.com Article
NEW

制造业 AI 视觉质检落地实测:普遍跑到 200% ROI,Intel 单条产线年省 $2M,赢家赢在把 AI 卡进产线节拍

本周把制造业 AI 落地的一手数字汇总来看,最成熟、最能算清账的仍是『视觉质检』这个场景。综合多份 2026 案例:AI 质检普遍带来 200–300% ROI,制造商平均 AI 投资回报约 200%,计算机视觉质检在产线速度下能做到 99%+ 的缺陷检出率。具体案例:Intel 公开披露单条 AI 晶圆视觉检测产线一年省约 $2M;一家电子厂把缺陷漏检率从 2.3% 压到 0.1%,一年消掉约 $1.8M 的保修风险敞口;汽车零部件工厂用 AI 检测两年内实现缺陷降 37%、OEE(设备综合效率)提升 22%;整体上 AI 质检能把废品率砍掉约 30%,连带省下原料、能耗和白做的人工。和其它垂直行业一样,赢家不是买了最强模型,而是把 AI 卡进产线的实时节拍里,让它在流水线速度下自动判定、直接触发处置。
#行业应用
另有 1 家信源报道
展开详情
  • **对比**:Intel 单条晶圆检测产线年省 $2M;电子厂漏检率 2.3%→0.1%、消掉 $1.8M 保修敞口;汽车件缺陷降 37%、OEE +22%
  • **大盘**:AI 质检普遍 200–300% ROI,产线速度下缺陷检出率 99%+,废品率砍约 30%
  • **赢法**:不是买最强模型,而是把 AI 嵌进产线实时节拍——线速下自动判定、直接触发处置
推荐理由:制造业的信号和前面几天医疗、法律、保险的落地实测是同一条铁律:AI 落地的价值不在模型多强,而在能不能卡进一个具体的、高频的、算得清账的工作流。对普通人的机会——视觉质检这类场景,模型早已不是瓶颈,瓶颈是懂产线、懂缺陷类型、能把 AI 接进 MES/产线节拍的『落地工程师』。如果你在制造业或供应链里,把一个具体工序的质检用 AI 跑通、把账算清(省了多少废品、多少保修),这份能把技术翻译成产线 ROI 的能力,比会调模型稀缺得多。
#08
indiehackers.com Product 值得关注
NEW

Kleo:三个月 0 → $62k MRR 的 LinkedIn 内容插件,靠 Claude + Claude Memory 学你的写作风格

Kleo 是一个帮 LinkedIn 创作者更快产出内容的 Chrome 插件,三个月内从 0 做到 $62k MRR。重建后的版本用 Claude(Anthropic)做内容生成、用 Claude Memory 长期学习你的写作嗓音,越用越像你。但这条案例最该被诚实拆解的地方在于:它增长这么快,很大程度是因为几位创始人(Jake Ward、Lara Acosta 等)本身在 LinkedIn 上有数十万目标客群粉丝——产品一上线就精准砸中自己的受众。同一个团队还并行做了 Mentions($20k MRR)。它是『自带流量 + AI 把内容生产工业化』的典型现金流打法,而不是纯靠产品从零冷启动。
#小微现金流#订阅制,约 $99/月(第三…
另有 1 家信源报道
展开详情
  • **数字**:Chrome 插件,3 个月 0 → $62k MRR;同团队并行的 Mentions 做到 $20k MRR
  • **技术**:用 Claude 做生成 + Claude Memory 学写作风格,越用越贴近你的嗓音
  • **真相**:暴涨主因是创始人自带数十万 LinkedIn 目标粉丝——分发力比产品本身更决定速度
推荐理由:对想用 AI 挣现金流的普通人,Kleo 给的不是『抄一个 LinkedIn 工具』,而是一条被反复验证的顺序:先有分发(受众/流量),再上产品,AI 只是把内容生产的边际成本压到近乎零。别倒过来——先埋头做一个精美工具再愁没人用。可复制的动作是:在你已经有影响力或人脉的某个细分圈子里,找一个他们每天都在重复的内容/运营动作,用 AI 做成插件或轻 SaaS,靠你已有的分发冷启动。
My Take:评分(5=最优):最快成交 3 / 最低成本 4 / 可复制 2 / 风险安全度 4。样板价值高但高度依赖创始人自带流量,普通人可复制的是『先分发后产品』的顺序,而非工具本身。