📅
Hall of Fame
Hall of Fame
Track
Type
Source
7月23日 周四 · 8 条
今日趋势综述
xAI 被扒出 Grok Build 偷传整个代码仓库后 72 小时紧急开源;SWE-bench Verified 刷满后,同一模型在 SWE-bench Pro 上给出三套不同分数——今天的信号是:AI 工具越强,你越要学会验证它、而不是盲信它。
今天的信号:别盲信 AI 工具,学会验证它

今天最刺眼的一条,是 xAI 的编码 CLI Grok Build。一位安全研究者用抓包证明:它一边宣称『本地优先』,一边把你整个 Git 仓库(连提交历史里的密钥一起)打包上传到 xAI 的 Google Cloud 桶里——一个只需 192KB 就能完成的小任务,它传了 5.1GB,差了近 2.8 万倍。而那个大家以为是『数据开关』的『改进模型』选项,管的只是训练授权,根本拦不住代码外传。被曝光 72 小时后,xAI 才紧急开源、关闭默认留存、上线漏洞赏金。这不是个别厂商翻车,而是给所有人提了个醒:你往编码 agent 里塞的是公司最核心的源码,工具说什么不重要,它实际往哪发包才重要。

同一天,评测圈也在讲『别盲信数字』。SWE-bench Verified 被头部模型刷到 90%+ 后失去区分度,大家转看更难的 SWE-bench Pro——可同一个 Claude Opus,在 Scale 标准化公开集上是 51.9%,在厂商自报的聚合口径里却是 69.2%,换套脚手架能差十几个点。SkillsBench 更直接:4.7 万个公开 agent skills,平均质量只有 6.2/12,大多数是凑数的;但一套精挑的 skills 能把任务通过率从 33.9% 拉到 50.5%,医疗场景甚至暴涨 51.9 个百分点。数字不会自己说话,得看它怎么测出来的。

把这些串起来,普通人今年真正该练的能力,不是『会用哪个 AI 工具』,而是『会验证 AI 工具』:给编码 agent 上沙箱、抓它的网络出站、看它到底把代码发去哪;读评测先问是哪套基准哪个口径,别被一个漂亮百分比带走;用 skills、agent 前先验它在你的活儿上到底有没有效。会验证的人,才敢把真实业务交给 AI——这恰恰是 Khan Academy 在学校、独立开发者在小生意里真正跑通落地的分水岭。

今日新增 7
#01
GitHub Repo
★ 3,900 NEW

xai-org/grok-build

这条不是普通的『大厂开源编码工具』,而是一次被逼出来的信任修复。7 月 13 日,一位安全研究者用 wire-level 抓包证明:宣称『本地优先』的 Grok Build CLI,实际把用户整个被追踪的 Git 仓库(全部文件 + 完整提交历史,连提交进去的密钥一起)打包成 Git bundle,悄悄上传到 xAI 的 grok-code-session-traces Google Cloud 存储桶。在一个 12GB 测试仓上,它传了约 5.1GB / 73 个分块,而当时的任务只需约 192KB——相差约 2.8 万倍。更糟的是那个『改进模型』开关只管训练授权,压根拦不住代码外传。xAI 7 月 13 日服务端悄悄关掉上传、未发声明,直到 7 月 15 日才开源代码、把默认数据留存回溯关闭到 7 月 12 日、承诺删除已留存数据、并上线 HackerOne 赏金($100–$20,000),对外称『提供完整用户隐私』。
#DevTools#Rust(终端原生 TUI …
另有 3 家信源报道
展开详情

Grok Build 是 xAI 的终端原生 AI 编码 agent(就是 grok 命令背后那套),2026 年 5 月以 SuperGrok Heavy(每月 $300)内测起步,主打大代码库里的自主编码。它对标 Claude Code / Codex / opencode,含完整的 agent loop、读写代码的工具集、全屏可鼠标交互的 TUI,以及 skills / plugins / hooks / MCP 扩展体系。7 月 15 日 xAI 把它整个开源到 GitHub(Apache 2.0,Simon Willison 数了约 84 万行 Rust),号称可自行编译、指向本地推理、用 config.toml 完全本地运行。但它开源的真正导火索,是一桩安全事故——见下。

周增长:开源公告后一周内新增数千星,具体周增以 GitHub Trending / star-history 实时为准

  • **2.8 万倍的数据外传**:12GB 测试仓被上传约 5.1GB,而任务本身只需约 192KB,抓包实锤『本地优先』宣称为假
  • **隐私开关是摆设**:多数人以为『改进模型』能拦数据,实际它只管训练授权,代码照样离开你的机器进云桶——连提交历史里的密钥一并外传
  • **开源是危机公关**:被曝光约 72 小时后才开源(84 万行 Rust / Apache 2.0)、关默认留存、上赏金;代码可审计,但已上传数据的删除承诺仍未经第三方核实
推荐理由:对普通人,这是 2026 年最该记住的一课:你往编码 agent 里喂的是公司最核心的源码,工具嘴上说『本地优先』不算数,它实际往哪发包才算数。机会有两层。防守层:养成给 AI CLI 上沙箱、抓网络出站(一个简单的 mitmproxy / Little Snitch 就能看清它到底连了谁)、在隔离仓里先跑一遍再上真项目的习惯——这套『验证 AI 工具』的能力,正在从极客洁癖变成职场基本功。进攻层:企业现在极度缺『能审计 AI 工具数据流向、把 agent 安全落地进合规环境』的人,这类活儿(AI 供应链安全、agent 沙箱与出站管控)需求正在爆发、门槛高、也不容易被下一个模型抹平。别只学怎么用最新工具,学会怎么信任地用它——后者更稀缺、更值钱。
#02
labs.scale.com Article
NEW

Verified 刷满之后看 SWE-bench Pro:同一个 Opus 三套分数,编码榜单该怎么读

SWE-bench Verified 被头部模型刷到 88–95% 后失去区分度(昨天已聊过 OpenAI 干脆弃榜),大家转向更难、更贴近真实工程的 SWE-bench Pro。但 Pro 自己也开始『不可比』:同一个 Claude Opus,在 Scale 标准化公开集上只有约 51.9%,在 llm-stats 的厂商自报聚合口径里却是 69.2%,换套脚手架和数据划分能差十几个点。这篇把不同口径的分数摊开对齐,提醒开发者:一个漂亮百分比脱离了『哪套基准、哪个划分、什么脚手架』就没有意义。
#评测
另有 2 家信源报道
展开详情
  • **对比(同一基准 SWE-bench Pro · Scale 标准化公开集,2026-06-28)**:GPT-5.4 xHigh 59.1% vs Meta Muse Spark 55.0% vs Claude Opus 4.6 thinking 51.9%——头部只差个位数,且都远低于 Verified 的 90%+
  • **同模型三套数**:Claude Opus 在 Scale 公开集 51.9% / 厂商聚合口径(llm-stats)Opus 4.8 达 69.2% / Scale 私有商用集另一版本约 47.1%,口径决定结论
  • **Verified vs Pro 的落差**:从 Verified 的近乎满分掉到 Pro 的五六成,说明『真实工程任务』这道坎远没被跨过,别被饱和的旧榜误导
推荐理由:对开发者,务实的选法不是背排行榜第一名,而是学会问三个问题:这是哪套基准(Verified 已饱和、Pro 更能区分真实工程)?哪个划分(Scale 标准化公开集比厂商自报可比得多)?什么脚手架(换 harness 能差十几个点)?现在选模型,与其纠结谁在某榜领先一两个点,不如按活儿定:日常改 bug、跑测试,饱和区里几家都够用、挑便宜快的(开放权重能进一步压成本);真正长程、跨文件的硬任务,才值得为标准化 Pro 集上领先的那家多付钱。对想进 AI 的人,『会读评测、会自己搭一套贴合自己业务的小评测集』本身就是稀缺技能——比记住榜单值钱得多。
#03
arXiv Paper
NEW

Your Agent's Memories Are Not Its Own: Forged Reasoning Attacks on LLM Agent Memory and Defenses

越来越多 agent 挂上了持久记忆——把过往决策、推理过程、工具使用记录都存下来复用。这篇提出 FARMA(Forged Amplifying Rationale Memory Attack):不去篡改记忆里的事实,而是往里注入『看起来合理的伪造推理』。之后 agent 每次检索记忆做决策,都会被这段被污染的推理链带偏,且因为事实本身没错、很难被常规校验发现。论文同时给出攻击方法和初步防御,把『记忆安全』从理论担忧变成了可复现的实证问题。
首次系统性揭示『污染 agent 的记忆推理链、而非事实知识』这一新攻击面,正撞上编码/办公 agent 大规模挂载持久记忆的当口
#AI Agent
展开详情
  • **新攻击面**:污染的是『推理理由(rationale)』而非事实,绕过大多数只查事实一致性的防线
  • **放大效应**:被污染的推理被反复检索复用,一次投毒可持续影响后续多轮决策,越用越偏
  • **攻防成对给出**:不止提出 FARMA,还给了初步检测/缓解方案,为记忆型 agent 的安全设计提供起点
推荐理由:这条紧接昨天『给 agent 装代码记忆 MCP』的趋势——记忆是 2026 年 agent 的核心外设,但记忆也会被下毒。对普通人有两层意义。一是使用侧:当你给 Claude Code / Cursor 挂上跨会话记忆、共享的团队记忆库时,要意识到那是个新的攻击面,别把来路不明的『记忆包 / 共享上下文』直接灌进去。二是机会侧:agent 记忆的安全、审计、可信检索,正在从论文变成产品需求——谁能做出『可信记忆层』(带来源标注、推理链校验、污染检测),谁就卡住了 agent 时代一个又硬又新的位置。想做深水区的人,记忆安全比追模型更有护城河。
#04
the-decoder.com Article
NEW

首个 agent skills 基准 SkillsBench:4.7 万个公开技能,平均分只有 6.2/12

agent skills(SKILL.md 那套跨工具技能)这半年从一个注册表长到八个市场、号称跨约 40 款产品通用,但质量到底如何一直没人量化。SkillsBench 是首个系统性基准:分析了 47,150 个公开 skills,平均质量分只有 6.2/12——大多数是凑数的。但它也证明了好 skills 的价值:一套精挑细选的 skills 能把 agent 任务通过率从 33.9% 拉到 50.5%(+16.6 个百分点),且效果高度分领域——医疗暴涨 51.9pp(34.2%→86.1%),软件工程只涨约 4.5pp。结论很清醒:skills 有用,但『大部分公开 skills 写得不好』和『会写好 skill 的人很少』同时成立。
#Skills#元技能
另有 2 家信源报道
展开详情
  • **质量真相**:4.7 万个公开 skills 平均仅 6.2/12,市场繁荣 ≠ 质量繁荣,随手抄一个装上大概率没用
  • **对比(有无精选 skills)**:任务通过率 33.9% → 50.5%(+16.6pp);医疗 +51.9pp(34.2%→86.1%)vs 软件工程仅 +4.5pp——领域越专、增益越大
  • **元技能缺口**:真正稀缺的是『评估和写好一个 skill』的能力,这正是当前 skills 生态最薄弱、也最值钱的一环
推荐理由:对想吃到 skills 红利的普通人,这份数据把机会指向了非常具体的地方。第一,别做通用 skills 去挤那 4.7 万个平庸货,去做垂直领域的高质量 skills——医疗、法律、金融这类专业场景增益最大(医疗 +51.9pp),因为通用模型在这些地方最缺结构化的领域知识,而你恰好懂行。第二,『会评估 skill 好坏、会把领域 know-how 写成让 agent 真能用的 SKILL.md』这个元技能,本身就是当下最稀缺的技能——它比会调 prompt 门槛高、也更难被下一个模型抹平。一句话:在 skills 市场里,当那个『把专业知识产品化』的人,而不是又一个搬运工。
#05
khanacademy.org Article
NEW

AI 进课堂的真实成绩单:用够时长才有效,Khanmigo 单独效果仍待验证

教育是被吹得最凶、但落地最慢的 AI 垂直领域之一。今天挑它,是因为难得有带硬数字、也带清醒边界的一手证据。Khan Academy 的 AI 辅导 Khanmigo 已铺进 1.5 万+ 所学校、约 500 万用户;平台层面的效果有真实证据:每周用满约 1 小时的学生,在学年末数学测评上比对照组高 0.44–0.47 个标准差(Oreopoulos 等 2026 RCT);每周用 30 分钟以上、全年累计 18 小时以上,与约 20% 高于预期的学习增益相关(MAP Growth 标准化测评)。但有个关键边界:截至 2026 年 3 月,尚无同行评审研究单独证明『Khanmigo 这个 AI 辅导本身』提升成绩——现有强证据是『Khan Academy 平台 + 保证使用时长』,而非 AI 那一层单独的功劳。
#行业应用
另有 1 家信源报道
展开详情
  • **用够才有效**:每周约 1 小时的学生末考数学高出对照组 0.44–0.47 个标准差(2026 RCT),核心变量是使用时长与老师督促,不是有没有 AI
  • **规模已铺开**:Khanmigo 进入 1.5 万+ 学校、约 500 万用户,1.8× 更快的掌握率——但样本大不等于因果清晰
  • **清醒的边界**:截至 2026 年 3 月,无同行评审研究单独证实 Khanmigo(AI 辅导层)提升成绩;别把『平台有效』直接当成『AI 有效』
推荐理由:对做 AI 教育、或想用 AI 帮孩子/自己学习的人,这份成绩单给了两个务实结论。一,AI 工具的效果几乎全押在『用够时长 + 有人督促』上——买了不用、或没人盯着,再强的 AI 也出不了成绩;真正值钱的产品设计和服务,是把『让人持续用下去』这件事做好(提醒、陪伴、可见进度),而不是堆模型能力。二,别被『AI 让成绩暴涨』的营销带走,要会分辨『平台有效』和『AI 那一层有效』——这种读证据的能力,无论你是家长、老师还是想做教育 AI 的创业者,都是不被割韭菜的底线。想在教育 AI 里挣钱,卖『可验证的效果和坚持』,比卖『最新大模型』靠谱得多。
#06
indiehackers.com Product 值得关注
NEW

六周做到 $10k MRR 的 AI 设计工具:一个人、零市场预算的可复制路径

这周挑一条和近期『AI 语音/自动化服务代运营』完全不同角度的现金流路子:不做代客服务、做自己拥有的小产品(productized micro-SaaS)。一位独立开发者用 AI 快速搭出一个垂直的 AI 设计工具,六周内、零市场预算做到约 $10k MRR。关键动作是三条老掉牙但有效的原则:极致垂直(只做某一类设计,不做通用)、先解决一个具体到疼的痛点、自己掌握支付与获客渠道。2026 年跑这种模式的门槛已经很低——一套 production 级 micro-SaaS 月成本约 $85–200,AI 还能帮你写代码、写文档、接客服、投广告。
#小微现金流#订阅制 micro-SaaS…
另有 1 家信源报道
展开详情
  • **极致垂直**:不做通用设计工具,只死磕某一类具体设计需求,让潜在用户一眼觉得『这就是给我做的』
  • **成本极低、可复制**:月运营成本约 $85–200,AI 承担开发/文档/客服/投放,一个人也能跑起一条产品线
  • **自己掌渠道**:从第一天起就自己握住支付和获客,不把命脉外包,才有稳定现金流
推荐理由:对想挣现金流的普通人,这条和最近几天的『AI 服务代运营』互为镜像,各有取舍:服务代运营成交快、启动几乎零成本,但你在卖时间、天花板是自己的产能;而 productized micro-SaaS 前期要搭产品、慢一点,但一旦跑通就是可复制、能睡后收钱的资产。2026 年真正的坎不是『能不能做出来』——AI 已经把做出来这件事变便宜了——而是分发:你能不能持续找到那群『痛到愿意付费』的垂直用户。给你的行动建议:从你最懂的一个细分场景切入,用 AI 一周内做出能收钱的最小版本,把全部精力压在『找到并说服前 20 个付费用户』上,而不是继续打磨产品。
My Take:评分(5=最优):最快成交 3 / 最低成本 4 / 可复制 4 / 风险安全度 4。适合有点动手能力、想做自己拥有的睡后收入资产、愿意用几周换长期复利的人。
#08
Product Hunt Product
NEW

buildpipe:给开发者的本地优先 AI 流水线(本地版 Zapier/n8n)

buildpipe 是一个面向开发者的本地优先流水线自动化应用:把 shell 命令、AI 调用、HTTP 请求、文件操作串成可复用的 pipeline,然后按计划、按文件变动或经 webhook 触发。它定位成『本地版 Zapier / n8n』,但专为开发者、且完全在你自己机器上跑——作者的动机就是『受够了反复写一次性脚本把 AI 调用和文件操作拼一起、然后弄丢』。在 Grok Build 把整个仓库偷传上云的当口,这种『数据不离开本机』的本地优先工具正好戳中开发者的敏感神经。
#DevTools#本地优先桌面应用,在你自己机…
另有 1 家信源报道
展开详情
  • **本地优先**:pipeline 全在你自己机器上执行,数据不出本机——与今天 Grok Build 偷传上云形成鲜明对照
  • **开发者专属**:把 shell / AI 调用 / HTTP / 文件操作拼成可复用流水线,替代到处散落、写完就丢的一次性脚本
  • **多种触发**:支持定时、文件变动、webhook 触发,适合把重复的 AI + 数据小活儿自动化固化下来
推荐理由:对普通开发者和想用 AI 提效的人,buildpipe 代表一个值得跟的方向:本地优先的 AI 自动化。它的价值不在多花哨,而在把你天天手动重复的『拉数据→喂给 AI→存结果』这类碎活儿固化成一条可复用、可定时、还不上云的流水线。结合今天 Grok Build 的教训,选工具时把『数据是否离开本机』当成一条硬标准会越来越重要。给你的行动建议:先盘一盘自己每天手动重复、又涉及敏感数据的小流程(比如整理日志、批量改文件、定时跑一段 AI 分析),用这类本地优先工具把它们自动化——省时间的同时,也把数据主权留在自己手里。
仍在热榜 1
Repo msitarzewski/agency-agents 在榜 2d agency-agents 是一套社区打磨的『AI 代理公司』人设库——从前端高手、Reddit 社区运营到『现实检查员… AI Agent