📅
Hall of Fame
Hall of Fame
Track
Type
Source
9月15日 周二 · 8 条
今日趋势综述
模型这层在肉眼可见地收敛——顶级编码 agent 挤在两三分内、开源模型逼近前沿;真正拉开差距的,是把 skills/上下文工程好、把 agent 送进真实工作流的能力。
今天的信号:模型在收敛,价值往'skills + 落地'上迁移

把今天几条串起来看,会发现一个清晰的方向:模型能力这一层正在快速收敛。Terminal-Bench 4.0 上顶级编码 agent(GPT-6 Astra、Claude Fable 5.1、Opus 5)挤在 6 分之内,开源侧 Qwen3.8 Max、GLM-5.3、DeepSeek V4 Pro 也一路追到前沿身后、还能自托管。当'谁的模型更强'越来越难分高下,竞争就整体上移到了另外两层:一是怎么把能力组织好,二是怎么把它送进真实工作流。

今日新增 7
#02
GitHub Repo
★ 2.3K NEW

mgechev/skills-best-practices

如果说上周 UC Irvine 那篇『99% 的 SKILL.md 至少带一个缺陷』暴露了问题,这个仓库给的是解法。它把写 skill 这件事从『随手写段说明』提升成一门有规范、能校验的工程:名字和描述要为 agent 路由而优化、主文档要瘦、步骤要可执行、脏活要沉进脚本、写完还要用 LLM 跑一遍验证。渐进披露这套做法据实测能把初始上下文占用砍掉约 94%,直接决定 skill 能不能被 agent 正确发现和调用。当 skills 生态从『能用』卷向『好用』,这类方法论仓库就是普通人上手的最短路径。
#Skills#元技能#Markdown / Pyt…
另有 2 家信源报道
展开详情

一份系统的『怎么写专业级 agent skill』的方法论仓库:规定 SKILL.md 元数据结构,强调用『渐进披露』控制上下文(主文档控制在 500 行内,只在需要时加载细节),主张用『第三人称祈使 + 步骤编号』而非散文式描述,把重复操作固化成经过测试的确定性脚本(Python/Bash/Node)防止 agent 乱编逻辑,并给出一套用 LLM 自己做四步校验(发现→逻辑→边界→架构)的评测流程。是一份把 skill 当代码来工程化、而不是当文档随手写的指南。

周增长:本周在 claude-code-skills / agent-skills 话题下热度靠前;作者 Minko Gechev(前 Angular 核心团队、Google 工程师)背书,社区认可度高

  • **渐进披露**:主文档控制在 500 行内、按需加载细节,实测可把初始上下文占用砍掉约 94%——这是 skill 能否被正确路由的关键
  • **脏活沉进脚本**:把重复/易错的操作固化成经过测试的 Python/Bash/Node 脚本,避免 agent 每次现编复杂逻辑而出错
  • **LLM 自校验**:给出四步(发现→逻辑→边界→架构)用 LLM 自己评测 skill 的方法,写完就能验,而不是上线才踩坑
推荐理由:对普通人的机会:会写 skill 正在变成一项可迁移的硬技能,而写好 skill 是有明确套路的。把这份方法论吃透——描述为路由优化、上下文做减法、逻辑沉进脚本、写完用 LLM 验一遍——你就能把自己某个工种的 know-how 打包成高质量 skill:既能自用提效,也能作为作品立人设、甚至做成行业定制 skill 包对外接单。在人人都会用 AI 的时代,『会把专业知识工程化成 skill』是拉开身位的元技能。
#03
GitHub Product
NEW

Switch(把任意 AI agent 接进团队聊天)

Switch 是 SandboxAQ 开源的一层『协作基础设施』:把用 Claude Code、Google ADK、LangChain、OpenAI 工具等各种框架做的 agent,直接接进 Slack、Teams、Discord、Telegram、Mattermost 这些团队本来就在用的聊天工具里。agent 以『具名参与者』身份进频道,和人共享同一份上下文、资源和历史,SandboxAQ 把这种共享空间叫『room』——参与者进出、任务交接时上下文都不丢。约 617 星、Product Hunt 512 票,Apache 2.0 + Commons Clause、可自托管、模型与框架无关。它押的是:企业不缺 agent,缺的是让 agent 和人在同一个地方协作的通道。
#AI Agent#开源免费,Apache 2.…
另有 2 家信源报道
展开详情
  • **接进现有工具**:不逼团队换工具,把 agent 塞进 Slack/Teams/Discord/Telegram/Mattermost,agent 作为具名成员和人同处一个频道
  • **框架/模型无关**:Claude Code、Google ADK、LangChain、OpenAI 工具做的 agent 都能接,开源可自托管,避免绑死某家
  • **共享上下文的 room**:把频道变成人和 agent 共享上下文、资源、历史的工作空间,参与者进出/交接时上下文不丢
推荐理由:对普通人的机会:agent 的『最后一公里』不是造更强的 agent,而是把它接到人真正干活的地方。Switch 这种『协作层』开源出来,意味着你不必自建集成,就能围绕它给具体行业做落地——比如给某类中小团队把他们的客服/运营/研发 agent 接进他们的 Slack 工作流,配好权限、话术和交接规则,按项目或月费收钱。真正稀缺的从来不是 agent 本身,而是懂业务、能把 agent 缝进团队日常协作的人。
#04
codingfleet.com Article
NEW

Terminal-Bench 4.0 独立榜单:顶级编码 agent 挤在 6 分内,选型早该看『任务×成本』而非榜首

Terminal-Bench 换到更难的 4.0 大版本后(专测 agent 端到端驱动终端干活,与 SWE-bench 的『修 bug』角度不同),最新榜单是:GPT-6 Astra 58.2%、Claude Fable 5.1 57.9%、Claude Opus 5 51.8%、GLM-5.3 41.8%。头两名只差 0.3 分,前三名也就 6 分出头的差距——这和之前 SWE-bench Verified、SWE-bench Pro 上『前几名挤成一团』的读数完全一致。注意 TB 4.0 的分数与旧版 2.1(当时 GPT-5.6 Sol 91.9%)不可直接比较,是难度重构后的新标尺。结论不是『谁第一』,而是顶端选手的能力差已经小到,选型该回到你的具体任务类型和单位成本上。
#评测
另有 2 家信源报道
展开详情
  • **对比**:Terminal-Bench 4.0 上 GPT-6 Astra 58.2% vs Claude Fable 5.1 57.9% vs Claude Opus 5 51.8% vs GLM-5.3 41.8%——前两名只差 0.3 分
  • **版本不可比**:TB 4.0 是难度重构后的新标尺,分数不能和旧版 2.1(GPT-5.6 Sol 91.9%)直接对比,看榜先看版本号
  • **开源在追**:闭源第一梯队挤在 58 分附近,开源的 GLM-5.3 已到 41.8%,差距在缩小、且能自托管——成本敏感场景多了真选项
推荐理由:对普通人/开发者的机会:别被『谁刷新榜首』牵着走。TB 4.0、SWE-bench 等多个独立榜单都指向同一件事——顶级编码 agent 的能力差已被压到几分之内。真正该练的是『分层选型』:把大量常规编码任务交给便宜够用的模型(含开源自托管),只在真正难的长链路任务上切到最贵的旗舰。会按『任务难度×单位成本』给模型分档路由,比死磕某个榜首模型能省出一个数量级的账单。
#05
ifactoryapp.com Article
NEW

制造业 AI 落地实测:Intel 一个视觉质检站年省 200 万美元、BMW OEE 提升 22%,行业中位回本约 14 个月

制造业的 AI 已经从『试点』走到『投产』,而且开始有可核对的数字。几个具体案例:Intel 公开披露单个 AI 晶圆视觉质检站一年省约 200 万美元(一个站、一条产线);一家电子厂把缺陷漏检率从 2.3% 压到 0.1%,一年砍掉约 180 万美元质保成本;BMW 记录到 AI 产线站点 OEE(整体设备效率)提升 22%、缺陷下降 30–40%。行业侧的汇总读数是:AI 投资平均 ROI 约 200%,光预测性维护就把非计划停机降 30–50%,视觉质检缺陷识别率做到 99%+,遵循分阶段实施的工厂中位回本期约 14 个月。领先厂商靠的正是这套已投产的量化结果,把自己和还在用被动摄像头+人工巡检的同行拉开商业身位。
#行业应用
另有 2 家信源报道
展开详情
  • **单点即回本**:Intel 一个 AI 晶圆视觉质检站年省约 200 万美元;某电子厂缺陷漏检 2.3%→0.1%、年省约 180 万美元质保
  • **整线提效**:BMW 记录 AI 站点 OEE 提升 22%、缺陷降 30–40%;预测性维护普遍把非计划停机降 30–50%
  • **回本可算**:行业汇总 AI 投资平均 ROI 约 200%、视觉质检缺陷识别 99%+,分阶段实施的工厂中位回本期约 14 个月
推荐理由:对普通人的机会:制造业 AI 的红利集中在『看得见摸得着的单点』——视觉质检、预测性维护、缺陷追溯,每一个都能算出省了多少钱、几个月回本。中小工厂普遍看到了大厂的数字却没有内部团队落地。如果你能把某一个环节(比如某类产品的视觉质检)用现成模型+摄像头跑通,做出一个可复述的降本数字,就能按『建置费+月费』复制给同城同类工厂。切口越窄、ROI 越好算,越容易成交。
#06
mindstudio.ai Article 直接可用
NEW

把一个 AI 工作流做成包月服务:给会计所做『文档分拣』,$500→$800/客户,跑通再复制

这篇复盘记录了一批从 2.5 万美元 ARR 副业到 270 万美元 ARR 公司的 AI 自动化生意,共同套路是『把一个具体工作流产品化成包月服务』。最典型的是 Marcus:他只做一件事——给小型会计师事务所做『AI 文档收单+自动分类』的工作流,起步不收建置费、按每客户 $500/月,服务满前 5 家后涨到 $800/月。更普适的定价结构被反复验证:冲前 2–3 万美元月收入时,用『一次性 $1.5–5K 建置费 + $500–2K/月维护费』的组合,先签下同行业头几个客户,再横向复制。关键不在技术多先进,而在于选一个『卡钱又费人』的窄环节,做成开箱即用、不用销售电话就能买的产品化服务。
#小微现金流
另有 2 家信源报道
展开详情
  • **窄环节切入**:Marcus 只做会计所的『AI 文档收单+分类』一个动作,按客户 $500/月起步,满 5 家后涨到 $800/月
  • **可复制定价**:冲前 2–3 万美元月收入用『一次性 $1.5–5K 建置费 + $500–2K/月维护』组合,先签同行头几家再横向复制
  • **产品化交付**:做成不用销售电话、下单即用的包月服务,而不是卖工具账号——把 AI 的结果打包卖,而非把工具转售
推荐理由:对想挣现金流的普通人意味着:不用发明技术,选一个你熟悉行业里『既卡钱又费人』的重复文书环节(收单、分类、对账、初审),用现成 AI+无代码拼成一个工作流,做成包月的『代劳服务』。先服务 3–5 家同行、跑出一个可复述的省钱/省时数字,再照抄给同类客户。Marcus 的关键教训有两条:一是切口要窄到能一句话说清、ROI 能算,二是卖『做好的结果』而不是『工具使用权』。
My Take:评分(5=最优):最快成交 4 / 最低成本 5 / 可复制 4 / 风险安全度 4。选一个熟悉行业的窄文书环节做成包月代劳服务,现成 AI+无代码即可起步,先跑 3-5 家再复制。
商机信号(加速):谁付钱:被重复文书拖住、又养不起专职技术的小微机构:小型会计所/律所/诊所、地区电商、本地服务商——他们已看到 AI 能省人,但没人能把它接进自己的流程 痛点:收单/分类/对账/初审这类环节每天吃掉大量人工却又必须做,请全职太贵、通用 AI 工具他们自己又不会配、配不到自家业务里 切入点:锁定一个你熟的垂直,把其中一个『卡钱又费人』的文书环节用现成 AI+无代码做成开箱即用的工作流,以一次性建置费 + 月度维护费签下同行头 3-5 家,跑出可复述的降本数字再横向复制
#07
arXiv Paper
NEW

Meta Context Engineering via Agentic Skill Evolution

论文指出,现在的上下文工程(CE)大多依赖人手工搭的固定套路——僵化的『生成-反思』流程、写死的上下文模板——这些结构性偏见把优化空间限制得很窄。MCE(Meta Context Engineering)的做法是引入一个『元层 agent』,通过对历史 skill、它们的执行与评测结果做『agentic 交叉』(一种在技能历史上做的深思熟虑式搜索),自动进化出更好的上下文工程 skill;底层 agent 再执行这些 skill 去优化上下文(以文件和代码的形式)。实测相对最强的现有 agentic CE 方法,平均相对提升 16.9%、最高到 53.8%,同时在上下文使用效率、可迁移性上都更好。它把『怎么喂模型』本身也变成了可以被 agent 自动优化的对象。
把『上下文工程』从人手写死的固定流程,升级成让 meta-agent 自己进化 skill 的可搜索空间,相对现有 SOTA 的 agentic 上下文工程方法平均提升 16.9%(最高 53.8%)——ICML 2026 收录。
#AI Agent
另有 2 家信源报道
展开详情
  • **问题**:现有上下文工程靠人手写死的流程和模板,结构性偏见大、优化空间窄,做不动更复杂的任务
  • **方法**:引入 meta-agent,通过对历史 skill/执行/评测做『agentic 交叉』自动进化上下文工程技能,底层 agent 负责执行
  • **结果**:相对最强现有 agentic CE 方法平均提升 16.9%、最高 53.8%,且上下文效率与可迁移性更优(ICML 2026)
推荐理由:对普通人的机会:这篇论文的信号是——『上下文工程』正在从一门手艺变成可被自动化的对象,但恰恰因此,理解它底层规律的人更值钱。短期看,手写高质量 skill、会做上下文工程仍是稀缺技能(参见今天 mgechev 那份方法论);长期看,谁能把『让 agent 自己优化 skill/上下文』这套 meta 能力用起来,谁就能把一个人的产能再放大一档。值得把它当成 skills 工程的下一站来跟。
#08
morphllm.com Article
NEW

开源权重模型逼近前沿:Qwen3.8 Max 71.6 领跑开源、DeepSeek V4 Pro 拿下 SWE-bench Verified 80.6%(还能自托管)

把几张开源权重榜单放一起看,前沿和开源的差距正在被填平:按当前开源权重综合分,Qwen3.8 Max 以 71.6 领跑,GLM-5.3 68.4、GLM-5.2 68.1 紧随;编码上,DeepSeek-V4-Pro 在 MIT 许可下把 SWE-bench Verified 做到 80.6%,GLM-5.2 是最强 MIT 模型(SWE-bench Pro 62.1%),Qwen3.6-27B 用 27B 稠密体量拿到 77.2%;Kimi K3 则在 Terminal-Bench 2.1 上到 88.3、编码指数 76.2。在 Artificial Analysis 智力指数上,GLM-5.3(最大算力档)以 45 分居开源权重之首。这些模型大多可下载自托管,许可从自定义到 MIT/Apache 2.0 不等。对成本敏感、或有数据合规要求、不想被 API 绑死的团队,第一次有了『够用又能自己掌控』的真选项。
#LLM/Model
另有 2 家信源报道
展开详情
  • **对比**:开源权重综合分 Qwen3.8 Max 71.6 vs GLM-5.3 68.4 vs GLM-5.2 68.1;编码上 DeepSeek-V4-Pro(MIT)SWE-bench Verified 80.6%
  • **小体量也能打**:Qwen3.6-27B 用 27B 稠密拿到 77.2%,意味着更低显存/成本也能跑出接近前沿的编码能力
  • **自托管+许可友好**:多数可下载自托管,GLM-5.2 为最强 MIT 模型、DeepSeek V4 Pro 也走 MIT——数据合规/成本敏感场景有了真选项
推荐理由:对普通人的机会:闭源旗舰和开源权重的差距缩到几分之内,且开源可自托管、许可越来越宽松。这打开两条路:一是成本——把大量常规任务放到自托管的 GLM/Qwen/DeepSeek 上,边际成本趋近于电费;二是合规——医疗/法律/金融这类不能把数据发给外部 API 的场景,现在有了能私有部署又够强的模型。会挑开源模型、会本地/私有部署、会按任务在开源与闭源之间分流,是这轮降价里普通开发者能吃到的直接红利。
仍在热榜 1
Repo earendil-works/pi 在榜 6d Pi 是一套开源的『agent 底座(harness)』,把做编码 agent 需要的三块东西打包成一体:一个统一的多家… DevTools