📅
Hall of Fame
Hall of Fame
Track
Type
Source
7月31日 周五 · 8 条
今日趋势综述
前沿模型能力开始『下沉』到具体、无聊、垂直的真实活儿里——今天的信号是:价值不在追榜首,而在把能力嵌进某个具体工作流。
今天的信号:能力过剩,落地稀缺

把今天的几条线索连起来,会看到一个清晰的错位:模型的『纸面能力』在飙,但『真正干活』的天花板低得多。编码榜 SWE-bench Verified 已经逼近饱和(97%),可换到更贴近企业真实仓库的 SWE-bench Pro,最强也才 ~69%——中间那 30 分,就是模型能力和真实交付之间的鸿沟。教育端更直白:Khanmigo 铺进了 1.5 万所学校、5 百万用户,但只有 15% 的人经常用,严谨的随机对照结果还没出来。铺得广,不等于学得好。

真正在赚钱、在涨星的,全是『把能力嵌进一个具体流程』的东西:Strix 不谈通用智能,只干渗透测试这一件脏活,涨到 4.5 万星;PixelRAG 不追更大模型,只把网页当截图去检索,两个月 8 千星;一个独立开发者盯着『物理治疗诊所的保险预授权』这一个无聊到没人想碰的工作流,14 个月做到 $41K MRR。Glaze 则把『描述一句话→生成一个原生 Mac app』做成了产品,软件生产的门槛又降了一截。

对个人的启示很统一:别把注意力放在『哪个模型最强』上,那是实验室的比赛;把注意力放在『哪个具体、脏、无聊、已经有人付钱的工作流,还没被 AI 好好接管』。能力已经过剩,稀缺的是愿意钻进某个垂直缝隙、把最后一公里跑通的人。顺带提醒一句:当 agent 开始拥有持久记忆,记忆本身也成了新的攻击面(见今天的 FARMA 论文)——落地越深,越要把安全一起想进去。

今日新增 5
#01
morphllm.com Article
NEW

编码榜的另一半真相:SWE-bench Verified 快饱和了,但换到更难的 Pro,天花板骤降到 ~69%

昨天的信号是 Opus 5 把 SWE-bench Verified 刷到 97%、前三挤在两分内——榜快饱和了。但饱和的只是『Verified』这一档。SWE-bench Pro 用的是更长、更真实、还带商业闭源仓库的任务,同一批模型换到这里,成绩集体跳水 15–35 分:Opus 4.8 以 69.2% 领跑活跃模型,Gemini 3.1 Pro 62.3%(落后约 6.9 分),GPT-5.5 掉到约 58.6%;到了纯闭源商业代码那一档,没有任何模型超过 ~47%。同一批『接近满分』的模型,一碰真实企业代码就露馅。这提醒我们:看单一榜单选模型会严重高估它的真实交付能力。
#评测
另有 2 家信源报道
展开详情
  • **对比**:SWE-bench Pro 上 Opus 4.8 69.2% vs Gemini 3.1 Pro 62.3% vs GPT-5.5 ~58.6%(活跃模型口径),闭源商业代码档最高仅 ~47%
  • **落差**:同一批模型从 Verified 换到 Pro 普遍掉 15–35 分——Verified 的 97% 是『会做的题』,Pro 才更接近『你司真实仓库』
  • **怎么选**:日常改 bug、补函数选性价比高的即可;真要它独立啃陌生大仓库/长任务,优先当前 Pro 榜靠前的 Opus 4.8,且务必人工兜底 review
推荐理由:对普通开发者最实用的一课:别拿 Verified 榜首的 97% 去想象它在你项目里的表现。选模型时,找一个和你真实工作最像的基准(长任务、多文件、闭源风格)去看排名,甚至用自己仓库里几个真 issue 手动实测三家——这套『按场景挑基准』的判断力,比记住谁是榜首值钱得多。
#03
GitHub Repo
★ 8.3k NEW

StarTrail-org/PixelRAG

PixelRAG 出自 Berkeley SkyLab / BAIR / Berkeley NLP,是论文《Web Screenshots Beat Text for RAG》的官方实现,两个月涨到约 8.3k 星。它的核心反直觉:不再把网页解析成文本再检索,而是把文档(网页、PDF、图片)整页渲染成截图,直接在图像上做检索——那些被 HTML 解析丢掉的表格、图表、信息图和版式关系,在截图里全都留住了。项目 Apache-2.0 全开源,还给了个诚意十足的开箱包:把维基百科 828 万篇文章做成预构建索引、提供无需 API key 的托管公开接口、附上 FAISS 索引和 Hugging Face 上的 LoRA 适配权重。对『文档结构一复杂 RAG 就失真』的老问题,是个换角度的解法。
#Infra#Python
另有 2 家信源报道
展开详情

像素原生的视觉 RAG:把网页/PDF/图片当截图直接检索,保住表格、图表和版式。

周增长:2026-05 创建,约两个月 8.3k 星(均值 >1k/周),周增以 star-history 实时为准

  • **思路**:把文档当截图检索而非先转文本,表格/图表/版式这些『被解析丢掉的信息』被完整保留
  • **开箱**:维基 828 万篇预构建索引 + 无需 key 的托管接口 + FAISS 索引 + HF 上的 LoRA 权重,Apache-2.0
  • **背书**:Berkeley SkyLab/BAIR/NLP 出品,v0.3.0 已发,属于有论文支撑的一手实现而非包装
推荐理由:如果你在做知识库问答、企业文档检索,值得亲手比一次:同一批带复杂表格/图表的 PDF,文本 RAG vs PixelRAG 的召回差多少。视觉检索正在成为 RAG 的一条新主线,早点上手『多模态检索』这个技能点,比继续在纯文本切块调参上内卷更有杠杆。
#05
raycast.com Product
NEW

Glaze by Raycast:描述一句话,生成一个能进 Dock 的原生 Mac app

Raycast 在 7 月初把 Glaze 正式放出(3 月起内测),上线即拿下 Product Hunt 当日第一(24 小时 574 赞)。它把『描述→原生桌面 app』做成了产品:你用大白话说想要什么,它生成一个真正能进 Dock、秒开、可离线、能用键盘快捷键/菜单栏/后台任务的原生 Mac 应用,之后还能继续用自然语言实时改。更有意思的是它带商店——公开商店加团队私有商店,找到接近的直接装、再微调;Raycast 自己的支持和销售就跑在用 Glaze 搭出来的 app 上。它代表的方向很明确:内部小工具、个人效率 app 的生产成本,正在被压到『说句话』的量级。
#AI App#免费档可建可用;付费约 $2…
另有 2 家信源报道
展开详情
  • **产物**:不是网页壳,而是能进 Dock、可离线、支持快捷键/菜单栏/后台任务的原生 Mac app
  • **分发**:公开商店 + 团队私有商店,装现成的再用自然语言微调,Raycast 自家业务已跑在上面
  • **门槛**:免费即可搭可用,约 $20/月解锁更多用量与分享,个人做内部工具几乎零成本
推荐理由:过去『做个小工具』要会写代码、要打包、要维护,现在门槛塌到一句话。对普通人这是实打实的机会:把你团队里那些还在用 Excel + 手工凑合的小流程,一个个变成顺手的原生小 app。会把『真实痛点』翻译成『一句清晰的 app 描述』的人,正在获得不写代码也能造工具的能力。
#06
skillademia.com Article
NEW

教育 AI 落地实测:Khanmigo 铺进 1.5 万所学校、5 百万用户,但只有 15% 常用、严谨结论仍未出

把教育 AI 最出圈的样本 Khanmigo 拉出来看真实数据,会比宣传冷静很多。规模确实大:2025 年已达 5 百万用户、铺进 1.5 万+ 所学校。但两个数字值得盯:一是使用率——有权限的学生里只有约 15% 经常用;二是证据——截至 2026 年,仍没有针对 Khanmigo 的同行评审研究能证明它切实提升学习成果,由 J-PAL 和多伦多大学在加拿大 6–8 年级课堂做的随机对照实验,结果预计 2026 年中才出。小样本测试有正向信号(12 人的小测里数学 +23%、科学 +18%,另有 Stanford 背书的 1.8 倍掌握速度),但样本太小只能当参考;更靠谱的是 2025 年一项 RCT 显示 AI 辅导相对课堂主动学习效应量达 0.73–1.3 个标准差——潜力真实,但『铺得广』和『学得好』之间隔着使用率和流程设计。
#行业应用
另有 2 家信源报道
展开详情
  • **规模 vs 使用**:5 百万用户、1.5 万+ 学校,但有权限的学生只有约 15% 经常用——铺开 ≠ 用起来
  • **证据**:至今无针对 Khanmigo 的同行评审成效研究,J-PAL/多大 RCT 结果要等 2026 年中
  • **潜力**:2025 年一项 RCT 显示 AI 辅导相对主动学习效应量 0.73–1.3 个标准差,天花板确实高
推荐理由:教育 AI 的赢点,和其他行业一样,不在『用了多强的模型』,而在『有没有解决使用率和融入流程』。对做教育产品或想在教培里用 AI 的人,真正的护城河是把 AI 卡进老师和学生每天已有的动作里、让人愿意反复用,而不是发一个没人打开的强大工具。别被『铺了多少学校』的大数字带偏,盯『日活和留存』。
#07
foundra.ai Article 值得关注
NEW

一个人盯『物理治疗保险预授权』这件无聊活,14 个月做到 $41K MRR

一个首次创业的独立开发者,没有合伙人、没融资,只做一件事:给物理治疗诊所自动化『保险预授权提交』这个又琐碎又必须做的活。14 个月做到 $41K MRR,年二有望冲 $500K ARR,而模型账单每月压在 $4K 以内。打法极度克制——只服务一类客户(PT 诊所)、只干一个工作流、把一件无聊事做到人工十分之一的成本。商业模式也做实了:第 9 个月起转 12 个月年签,带 60 天上线条款和每月 100 单的用量下限,单个客户年合同约 $11,800,把『天天要防流失』的拉扯变成『每季度续约』的节奏。它是『垂直无聊工作流 + 单人运营』这条现金流路子的教科书案例。
#小微现金流
另有 1 家信源报道
展开详情
  • **数字**:单人 14 个月 $41K MRR,模型成本 <$4K/月,年二目标 $500K ARR,单客户年签约 $11,800
  • **克制**:一类客户 + 一个工作流 + 一件无聊事,做到人工成本的十分之一,不铺品类
  • **收费**:第 9 月转年签 + 60 天上线条款 + 每月 100 单用量下限,把留存压力变成季度续约
推荐理由:对想靠 AI 挣现金流的普通人,这是最实在的模板:不要做通用工具,去找一个『合规/保险/行政』里被手工拖累、又天天必须做的垂直工作流,把它自动化到人工十分之一成本。这类活无聊、没人想碰、切换成本高,恰恰最适合单人长期收租。关键动作——先锁死一类客户和一个流程,跑通再谈扩张。
My Take:评分(5=最优):最快成交 3 / 最低成本 4 / 可复制 3 / 风险安全度 3。医疗合规垂类,慢热但粘性极高、年签续费稳,适合能沉住气啃一个流程的单人玩家。
商机信号(加速):谁付钱:被保险预授权手工提交拖垮的物理治疗/康复类诊所(可推广到牙科、影像、专科门诊等所有吃保险流程的小诊所) 痛点:预授权提交琐碎、重复、还必须做,人工慢且贵,漏一单就影响收款,诊所前台被这类行政活占满 切入点:挑一个被保险/合规流程拖垮的具体诊所类目,先只做『一个流程』做到人工十分之一成本,用年签+用量下限锁定现金流,跑通一个类目再横向复制到相邻科室
仍在热榜 3
Repo usestrix/strix 在榜 3d 开源的 AI 渗透测试 agent:像真人安全研究员一样动态测应用、验证漏洞并给出 PoC。 DevTools
Paper Your Agent's Memories Are Not Its Own: Forged Reasoning Attacks on LLM Agent Memory and Defenses 在榜 2d 持久记忆让 agent 能存下事实、历史决策、推理过程和工具使用记录,但这篇论文指出:记忆也因此成了投毒目标。作者提出 … AI Agent
Repo obra/superpowers 在榜 4d 用一叠 Markdown 技能把整套软件开发方法论固化下来,让 agent 像资深工程师那样按流程干活。 Skills · 编程开发