Hall of Fame
今日趋势综述
今天的信号:从『会用 agent』到『会造 agent、会给 agent 质检』
把今天的条目串起来,会看到一条清晰的产业链在成形。上游是『造』——PenguinHarness 这类自进化 harness 让一句话就能生成并自动优化一个 agent,成本压到 Claude Code 的几十分之一;中游是『质检』——DeepEval 4.0 把评测做成能塞进 Claude Code 的本地环,Cozeloop 把开发-调试-评估-监控打成一条 LLMOps 流水线;下游是『把关』——NVIDIA 一口气开源了官方 skills 库和 SkillSpector 安全扫描器,因为公开 skill 已经涨到十几万个,供应链投毒和提示注入成了真问题。模型能力本身反而不是今天的主角:Artificial Analysis 综合榜前三名咬在 2 分内,谁第一已经不重要了。
对个人的机会因此从『训练/调用一个更强的模型』下移到了三个更接地气的位置:一是当『agent 装配工』,用零码 harness 给身边一个具体场景(客服、取数、外联)做出能用的 agent,按项目或月费交付;二是当『agent 质检员/安全审计员』,用 DeepEval、SkillSpector 这类工具给团队出评测报告、建 skill 白名单——这是个刚冒头、几乎没人系统做的缝隙;三是把这套能力搬进一个具体行业,像农业 AI 那样,个人碰不了硬件,但可以在软件层把大厂能力打包成小农户/小生意用得起的订阅服务。
一句话:这一周值得盯的方向不是『又出了什么大模型』,而是『agent 从手工作坊走向流水线』——流水线上的每一个工位(装配、质检、安全、垂直交付),都是普通人现在就能站上去的位置。
Prism-Shadow/penguin-harness
展开详情
一个开源的『自进化 agent 工厂』:零码 CLI + Web UI,接 1000+ 模型,让 agent 自动构建、评测并优化另一个 agent,本地优先、可递归自我改进。
周增长:97 forks、17 open issues;同步在 Product Hunt 以 PenguinHarness 之名发布,主打『一句话、约 $0.02 造一个 agent』
- **自进化**:agent 自动生成/评测/优化另一个 agent,闭环迭代,不用人一步步搭
- **成本**:一句提示约 $0.02 搭出完整 RAG 应用,数据分析任务号称约为 Claude Code 的 1/70 成本
- **零码**:CLI + Web UI,接 1000+ 模型、本地优先,非工程背景也能上手
Artificial Analysis 智能指数 8 月榜:前三名咬在 2 分内,第一已不重要
展开详情
- **对比**:Opus 5 60.7 vs Fable 5 59.9 vs GPT-5.6 Sol 58.9(Artificial Analysis Intelligence Index,10 项评测综合)
- **含义**:前三名差 <2 分,综合『智力』已见顶趋同,单看总榜选不出赢家
- **价格锚点**:Opus 5 $5/$25 每百万 token;Sonnet 5 促销价 $2/$10(8/31 前)——同门便宜档往往更划算
农业 AI 落地实测:John Deere 精准喷洒铺到 500 万英亩、省下 3100 万加仑药水,赢在软件层
展开详情
- **规模案例**:John Deere See & Spray 2025 季覆盖约 500 万英亩,省约 3100 万加仑药水混合液
- **ROI**:大型农场综合 AI 采用约 150% 回报,小农户定向应用约 120%;灌溉省水约 30%、人工降约 35%
- **规律**:软件层(生成式顾问、卫星监测订阅)在企业规模上 12–24 个月即可转正 ROI,硬件精准喷洒/自主除草回本最快
RECON: Benchmarking Agent Memory for Compositional Reasoning over Long Contexts
展开详情
- **反直觉结论**:控制检索后仍有约 39.4pp 差距,瓶颈从『记不住』转成『不会组合推理』
- **结构化的价值**:把记忆组织成结构化表示(而非塞更长上下文)才是补差距的关键
- **呼应**:被动回忆基准接近满分,主动决策式记忆场景骤降到 40–60%,评测口径决定结论
DeepEval 4.0:把 LLM 评测做成能塞进 Claude Code 的本地环
展开详情
- **规模**:17,480 星、PyPI 下载超 800 万,是最主流的开源 LLM 评测框架之一
- **新能力**:为 Claude Code 加本地评测环——自动生成数据集、跑套件、看失败轨迹、迭代到指标达标
- **覆盖面**:agent / RAG / 多轮对话 / 合成数据 / tracing / Pytest / CI/CD 一体
coze-dev/coze-loop
展开详情
开源的 AI Agent 优化平台(Cozeloop):把 agent 从开发、调试、评测到线上监控的全生命周期打成一条 LLMOps 流水线。
周增长:由 Coze 团队开源,Go 编写,覆盖 prompt 管理、评测、观测与监控的全生命周期
- **定位**:agent 全生命周期平台——开发/调试/评测/监控一条流水线,而非单点工具
- **能力**:prompt 管理 + 评估 + 可观测性 + 线上监控,把 agent 当软件来运维
- **趋势**:与 DeepEval、SkillSpector 一起,指向『agent 进生产先补 LLMOps 与治理』的确定性方向
自进化 harness 入门:当 agent 开始自己造 agent、给 agent 打分
展开详情
- **范式**:从人工搭 agent,转向让 harness 自动构建/评测/优化 agent 的闭环自我改进
- **组件**:可复用技能、工具与上下文管理、自动数据生成、多 agent 评测缺一不可
- **判断**:下一个战场是『造 agent 的流水线』有多自动多便宜,而非单模型峰值