Hall of Fame
Hall of Fame
Track
Type
Source
8月23日
今日趋势综述
本期主线是'能力在变便宜、落地在变值钱':开源权重一年把与前沿的差距从13分收到6分、Gemini 3.7 Flash用半价把速度封王,而真正稀缺的已彻底从'能不能做'转向'能不能嵌进具体流程、能不能拿到付费客户、能不能保证质量'。
今天的信号:能力在变便宜,落地在变值钱
把今天几条串起来,同一条趋势线在往下压门槛:Gemini 3.7 Flash 用半价把'又快又便宜'的智能推到手边(输出速度 340 tokens/秒全场第一),开源权重与前沿的智能指数差距一年从 13 分收到 6 分、LMArena 上的 Elo 差从约 150 压到约 30——'用得起接近前沿的智能'正在变成默认。模型这一层的能力,正在快速商品化、变便宜。
但便宜的是能力,值钱的是落地。金融反欺诈一年帮 JPMorgan 省 15 亿美元、物流 AI 平均 ROI 约 190%,可 91% 的银行喊 AI 重要、只有 23% 真进了生产——价值全卡在'把 AI 嵌进一件具体苦活并被真正用起来'这一步。同样的逻辑在小微现金流里更直白:给牙科诊所做自动化,一个客户 $2K/月、一人服务 10 家就是 $20K/月,可 54% 的独立开发产品营收是 0——瓶颈早就不是'能不能做出来',而是'能不能拿到并留住付费客户'。连 skills 也一样:'会写 skill'在贬值,UC Irvine 发现 94% 的 skill 有'合理化漏洞',于是'会审、会加固别人的 skill'在升值。
所以想在 AI 时代增值,别把时间全花在追最新模型上——那层在变便宜、会被租用。把复利押在三件越来越值钱的事上:一是落地,走进一个具体行业与流程,把能力嵌进去并量化出结果;二是分销,在一个垂类里建立触达与信任,搞定前 10 个、前 100 个付费客户;三是质量工程,把 harness、skills、eval 做扎实,让系统稳定可交付。今天的每一条,都是这三件事的注脚。
今日新增 7
#01
felloai.com
Article
NEW
Gemini 3.7 Flash 独立横评:输出速度 340 tokens/秒全场第一,但'半价'是有到期日的
Google 8 月 13 日发布 Gemini 3.7 Flash,只比 3.6 Flash 晚三周,主打编码与 agent 场景。第三方实测的结论是'又快又便宜、智能中前段':Artificial Analysis 智能指数给它 56(3.6 Flash 是 52),并把它的输出速度排到 186 个模型里第一,340.1 tokens/秒;编码上 DeepSWE v1.1 从 49.0% 跳到 65.3%、Zapier AutomationBench 从 17.0% 提到 30.4%、FrontierCode 1.1 从 34.4% 到 43.6%。价格是最大看点也是最大坑:introductory 定价 $0.75/$3.75 每百万 token(输入/输出),但 2027 年 1 月 1 日会涨到 $1.50/$7.50,正好是 3.6 Flash 当初的价——现在的'半价'是有到期日的。定位上它在多项实用编码与 agent 测试上贴近甚至压过 Claude Sonnet 5、GPT-5.6 Terra 这类中前沿模型,同时明显更便宜。
另有 2 家信源报道
展开详情
- **对比**:AA 智能指数 Gemini 3.7 Flash 56 vs 3.6 Flash 52 vs Grok 4.6 60.9 vs Claude Opus 5 63.0(同一 AA 榜)——单看智能是中前段,赢在速度与价格
- **速度封王**:输出 340.1 tokens/秒,186 个模型排第一;编码 DeepSWE v1.1 49.0%→65.3%,Zapier AutomationBench 17.0%→30.4%
- **半价有期限**:introductory $0.75/$3.75 每百万 token,2027-01-01 涨到 $1.50/$7.50(3.6 Flash 当初的价),趁窗口把成本模型跑通
推荐理由:对开发者/普通人:选型别被'速度第一'带偏,先分清任务吃哪碗饭。高并发、要快要便宜的 agent/批处理(客服、抓取、文档流水线)——Gemini 3.7 Flash 现在是性价比甜点,趁半价窗口把成本跑通;但要写复杂代码、做高难推理,智能指数 56 明显不如 Opus 5/Fable 5 这类前沿,该用前沿别硬省。口诀:吞吐与成本敏感→Flash;单次质量与难任务→前沿。
#02
kore.ai
Article
NEW
金融 AI 落地实测:JPMorgan 一年靠 AI 省 15 亿美元、graph 反欺诈揪出 1.5 亿美元黑产,但 91% 银行喊重要、只有 23% 真进生产
继医疗、法律之后,今天看另一个高壁垒、也是 ROI 最清晰的行业——金融。反欺诈是银行里最成熟、也最能立刻量化回报的 AI 应用:JPMorgan 的 graph 反欺诈系统首年就揪出 1.5 亿美元过去查不到的欺诈团伙活动,全行 AI 一年省下约 15 亿美元;HSBC 把反欺诈误报降了 60%,American Express 检测准确率再提 6%。这些都是能直接落到损益表、几个月内见效的数字。但和其他行业一样,战略与落地之间有巨大断层:Accenture 2026 Q1 调查显示 91% 的银行高管把 AI 列为战略优先,却只有 23% 真正走出试点、进了生产。价值不在'换个更强的模型',而在把 AI 卡进反欺诈打标、对账、材料审阅这类重复苦活,并让它在合规边界内被真正用起来。
另有 2 家信源报道
展开详情
- **反欺诈=最硬 ROI**:JPMorgan graph 反欺诈首年揪出 1.5 亿美元黑产、全行 AI 年省约 15 亿美元,几个月内可量化
- **误报大降**:HSBC 反欺诈误报降 60%、American Express 检测准确率再提 6%——省的是运营成本与客户体验
- **战略与落地断层**:Accenture 2026 Q1,91% 银行高管把 AI 列战略优先,仅 23% 走出试点进生产
推荐理由:对个人:金融和医疗、法律一样,价值全在'把 AI 卡进一件重复苦活'(反欺诈打标、对账、审材料),不是换更强的模型。91% 想做、只 23% 落地——中间那道'把能力嵌进合规流程并被真正用起来'的鸿沟,就是懂业务+懂 AI 的人的饭碗。你不需要会训模型,你需要能走进一个风控/运营团队,摸清它的数据、系统与合规红线,把一个具体环节自动化到能量化出结果。
#03
atlan.com
Article
NEW
别再无脑装 skill:UC Irvine 扒了 238 个真实 skill,编出 26 种'坏味道',94% 都有'合理化漏洞'
skills 生态正从'能不能装'进入'装了会不会坑你'的阶段。UC Irvine 2026 一项研究系统扒了 238 个真实世界的 agent skill,归纳出 26 种命名的'skill 坏味道'(skill smells),把'写 skill'从玄学变成能像代码一样 review 的工程。其中最普遍的是'合理化漏洞'(Rationalization Loophole)——skill 里缺少一道'不许跳过某个必需步骤'的护栏,于是 agent 会给自己找理由把关键步骤略过;这种毛病在 94% 的被测 skill 里都出现了,而且它是流程缺陷、不是数据问题,一旦写进去几乎不会自己被纠正。对照昨天 NVIDIA SkillSpector(安全扫描)那条来看,信号很清楚:skill 正从'一键安装的加分项'变成'要先验质量与安全的工程活'——一个防恶意,一个防低质。最佳实践也在收敛:SKILL.md 规范、结构化 eval、最小权限、把'必需步骤'写成硬约束。
另有 1 家信源报道
展开详情
- **26 种坏味道**:UC Irvine 扒 238 个真实 skill 编出 26 种命名 skill smells,把'写 skill'变成能 code review 的工程
- **94% 中招**:最普遍的'合理化漏洞'——缺'禁止跳过必需步骤'的护栏,agent 会自我合理化略过关键步骤,且写进去不会自愈
- **门槛化**:SKILL.md 规范、结构化 eval、最小权限、把必需步骤写成硬约束,正从可选项变成上架/采用的门槛
推荐理由:对个人:'会写 skill'本身正在贬值,'会写不坑人的 skill、会审别人的 skill'在升值。把这 26 种坏味道当 checklist,你就能提供一项别人还没意识到需要的服务:帮团队审计/加固他们在用的社区 skill。这和'安全扫描'是一体两面。现在入场做'skill 质检',是趁生态刚意识到问题、标准还没成型的窗口——先从你熟的垂类(数据、DevOps 等)切入。
商机信号(萌芽):谁付钱:开始批量采用社区 skills 的开发团队与中小企业——想用现成 skill 提效,却怕装进来的 skill 偷偷跳步骤、埋隐患,但团队里没人会审 痛点:skill 数量爆炸(市场号称几千上万个)、质量参差,94% 有合理化漏洞;一旦出错不知道是哪条 skill 的锅,也没有现成的质检流程 切入点:把 UC Irvine 的 26 种 skill smells 做成一份可执行审计 checklist + 一个轻量扫描脚本,按仓库/按次收费帮团队体检他们在用的 skill,先从自己熟悉的垂类(数据、DevOps)切入验证
#04
medium.com
Article
直接可用
NEW
垂类自动化代运营挣现金流:给牙科诊所盯 Google 评价+自动回访,单店 $2K/月、一人做 10 家 = $20K/月
接着这几天的'小微现金流'主线,今天更聚焦'一个人怎么用垂类自动化把现金流做起来'。打法不是做通用 SaaS,而是死磕一个窄行业的一件苦活:比如给牙科诊所做一套'监控新 Google 评价 → 自动发感谢+预约链接 → 跟进序列'的自动化,单店收 $2,000/月,一个人服务约 10 家诊所就是 $20,000/月营收;牙科预约 agent 常见报价是 $3,000 装机费 + $300/月。更广的口径:这类垂类自动化项目一次性收 $5,000–$50,000,外加 $500–$5,000/月的持续 retainer,头部一人代理能做到 $20K+/月。为什么垂类跑得快——市场小到一个人就能吃下、痛点又急又具体、在行业社群里获客更容易。但要清醒:门槛已经从'会不会搭'转移到'能不能拿到并留住 10 个付费客户'。
另有 2 家信源报道
展开详情
- **具体报价**:牙科诊所'评价监控+自动回访'单店 $2K/月,一人 10 家 = $20K/月;预约 agent 常见 $3K 装机 + $300/月
- **项目+retainer 双收**:垂类自动化一次性 $5K–$50K + 每月 $500–$5K 持续费,头部一人代理 $20K+/月
- **为什么垂类赢**:市场小到一人可独占、痛点急且具体、行业社群获客更省力——不做通用 SaaS,死磕一个窄行业的一件苦活
推荐理由:对想挣现金流的普通人:这是当下门槛最低、路径最清晰的一条——你不需要发明技术,只要选定一个你能接触到的窄行业(牙科/地产/会计/本地服务),找出它一件天天要做又烦人的重复活,用现成的 no-code + agent 工具搭成'代运营服务'按月收费。真正稀缺的不是搭建能力,是'搞定前 10 个付费客户'的销售与信任。先在一个你有人脉的垂类里拿下 3 个客户验证,再复制到 10 家。
My Take:评分(5=最优):最快成交 4 / 最低成本 5 / 可复制 4 / 风险安全度 4。定位:低成本、可复制的垂类自动化代运营,卡点在获客不在技术。
商机信号(加速):谁付钱:没有技术团队的本地小生意(牙科诊所、地产经纪、会计事务所等),每月愿意为'省人省事的重复流程自动化'付 $300–2,000 痛点:评价管理、预约跟进、对账等重复活天天做、又烦又漏,请全职人不划算、自己没精力 切入点:选一个你有人脉的窄垂类,把一件最烦的重复活(如评价监控+自动回访)用 no-code+agent 打成标准化服务,单店按月收费,先拿下 3 家验证再复制到 10 家
#05
solooperatorstack.com
Opinion
值得关注
NEW
Solo Operator Stack
另有 1 家信源报道
推荐理由:对想挣现金流的普通人:把这条当'期望管理 + 路线校正'。别信'用 AI 随便做个 wrapper 就躺赚'——一半产品挂零。真正该投入的不是再学一个建站工具,而是分销能力:在一个你有存在感的社群/垂类里持续输出、建立信任、把前 100 个付费用户搞定。建议把顺序反过来:先验证有人肯付钱、你能触达客户,再动手做产品。
My Take:评分(5=最优):最快成交 2 / 最低成本 5 / 可复制 3 / 风险安全度 4。定位:给'AI 躺赚'幻觉的现实校准——动手前先确认你够得着付费客户。
#07
aibuzz.blog
Article
NEW
物流 AI 落地实测:DHL 路径优化砍 12% 运输开支、仓库少走 50% 路,UPS ORION 一年省 1 亿英里,平均 ROI 约 190%
继金融之后,今天第二个高确定性 ROI 的行业是物流——而且它的好处最'能被 CFO 几周内验证',因为每公里油耗、每小时拣货数、准时率这些 KPI 精确、实时、可直接归因。真实读数:路径优化普遍带来 10–30% 运营成本下降、约 15% 里程减少;DHL 在欧洲网络用 AI 路径优化砍掉 12% 总运输开支,其 AI 仓库布局让员工少走 50% 的路、站点产能提升最高 30%;UPS 的 ORION 系统一年省下超 1 亿英里行驶。Amazon 的 52 万台仓储机器人一年省约 40 亿美元。行业平均 AI ROI 约 190%,路径优化回本期 2–4 个月、仓储自动化 6–12 个月。Accenture 预计 2026 年 80% 的物流运营将被 AI 增强,且已从'实验'转为'运营'。
另有 2 家信源报道
展开详情
- **对得上账**:路径优化 10–30% 降本、约 15% 少里程;DHL 欧洲网络 -12% 运输开支、仓库员工少走 50% 路、产能 +30%
- **规模效应**:UPS ORION 一年省 1 亿+英里;Amazon 52 万台仓储机器人年省约 40 亿美元
- **回本快**:平均 AI ROI 约 190%,路径优化 2–4 个月回本、仓储自动化 6–12 个月;KPI 精确可归因,CFO 几周内即可验证
推荐理由:对个人:物流是'AI 落地'里最容易证明价值、也最好切入的行业之一——它的每个动作都有精确、实时、可归因的数字(油耗/拣货/准时率),你做的自动化好不好,几周就见分晓,不用扯虚的。这意味着即使是中小物流/仓配/最后一公里团队,也能用现成工具做一个'看得见省了多少钱'的小项目。想入这行的落地工程,先学会用它自带的 KPI 把成果量化——能量化的成果才卖得出价。
#08
digiwit.ai
Article
NEW
开源权重正在逼平前沿:智能指数差距一年从 13 分收到 6 分,LMArena Elo 差从约 150 压到约 30
一个正在改变'个人和小团队用什么模型'的结构性变化:开源权重模型与闭源前沿的差距,一年里被大幅压缩。在 Artificial Analysis 智能指数上,最好的开源权重与专有前沿的差距从 12 个月前的 13 分收窄到 6 分;LMArena 用另一种货币讲同样的故事——开源与闭源的 Elo 差从大约 150 分压到约 30 分。具体牌面:AA 榜上 GLM-5.2 是开源权重头名;Moonshot 的 Kimi K3(2.8T MoE)更猛,在 AA 智能指数上总排第 3,只落后 Claude Fable 5 和 GPT-5.6 Sol 两个专有模型。LLM Stats 8 月 7 日的开源榜快照里 Kimi K3 以总分 55.4(推理 54.5、编码 45.4)领跑开源阵营;GLM-5.2 以 46.8 总分、38.4 编码、100 万 token 上下文、MIT 许可,做最强的'低价追赶者'。
另有 2 家信源报道
展开详情
- **对比**:AA 智能指数——开源头名 GLM-5.2、开源总冠 Kimi K3(总榜第3,仅次 Fable 5 / GPT-5.6 Sol)vs 前沿,开源与前沿差距从 13 分收到 6 分
- **另一把尺**:LMArena 开源 vs 闭源 Elo 差从约 150 压到约 30,两套榜单指向同一结论——差距在肉眼可见地缩小
- **可自部署**:GLM-5.2 46.8 总分 / 38.4 编码、100 万 token 上下文、MIT 许可——低价、可私有部署、可商用
推荐理由:对个人/小团队:'用得起前沿级智能'不再是大厂专利。差距收到 6 分、顶级开源多为宽松许可(如 MIT)、可私有部署——你现在能在自己可控的成本与数据边界内跑接近前沿的模型。行动建议:把一个真实工作流分别用便宜开源模型和前沿闭源模型各跑一遍,测出'质量差多少、成本省多少',很多场景你会发现开源已经够用且便宜一个数量级。真正的杠杆不是永远追最强模型,而是知道你的任务'够用'的下限在哪。
仍在热榜 1
Repo
bytedance/deer-flow
在榜 4d
字节跳动开源的'超级 agent harness':把 sandbox(沙箱)、memory(记忆)、tools(工具)…
AI Agent