📅
Hall of Fame
Hall of Fame
Track
Type
Source
8月15日 周六 · 8 条
今日趋势综述
本周信号收敛到一条主线:软件本身正在变成 agent——从个人开发者的 agent 工具链(pi 90K 星、Orca 并行编码舰队),到把这套能力落进真实营收流水线(物流巨头省下数亿美元、垂类微 SaaS 单人做到 $30K MRR),护城河正从『会写代码』迁移到『拥有一个窄场景+分发渠道』。
今天的信号:当软件变成 agent,你的护城河搬家了

把今天的条目连起来看,会发现它们其实在讲同一件事的不同侧面。一头是工具层的爆发:earendil-works/pi 冲到 9 万星,Orca 让一个人同时指挥五个编码 agent 干活——写代码这件事的『生产资料』正在被彻底重做。另一头是学术界给这件事下了定义:arXiv 那篇《Agentic Software》说得直白,传统软件里『代码是预先写好的决策逻辑的载体』,而 agent 时代『agent 本身就是软件,决策逻辑在运行时才生成』,商业形态也从 SaaS 走向 AaaS(Agent-as-a-Service)。Karpathy 早就用身体力行印证:他说自己 80% 的代码交给 agent、几个月没手敲过一行了。

但真正值钱的信号不在工具本身,而在工具怎么落地。物流三巨头给出了最硬的数字:Maersk 靠预测性 AI 一年省下 3 亿多美元、把延误砍 67%;DHL 把运输成本降 12%、预测误差降 40%;UPS 的 ORION 一年少跑 1 亿英里、省 4 亿美元。它们赢的地方不是模型多先进,而是把 AI 卡进了一个每天都在烧钱的具体环节。同样的逻辑在个人尺度上重演:垂类 AI 微 SaaS 里,一个懂某行业的单人开发者,用 $500 客单价 × 60 个客户就能做到 $30K MRR、毛利 70%+。

所以今天给普通人的一句话是:模型能力正在变成水电,谁都能调 API 的时候,『会调 API』不再是护城河。真正的护城河搬到了两个地方——你是否深扎进了一个别人不愿意碰的窄场景(律所合规、诊所医保、物流调度、某个『无聊』行业的工作流),以及你是否掌握了把这套能力送到付费用户面前的分发渠道。工具越强,这个判断越成立:与其再造一个通用 agent,不如去拿现成的 agent 能力,绑死一个『已经在花钱』的真实痛点。

今日新增 5
#03
GitHub Repo
★ 34.7K NEW

HKUDS/DeepTutor

DeepTutor 想解决的是教育 AI 里最难的一块:不是回答单个问题,而是『长期陪一个人学下去』。它把辅导做成一个有记忆、能追踪知识状态、会按薄弱环节规划路径的 agent,而且开源可自托管。这一点很关键——过去像 Khan Academy 的 Khanmigo 这类个性化辅导是闭源产品,学校和机构只能买、不能改,数据也交给别人。DeepTutor 让懂教育的人可以拿开源框架去搭自己的垂类辅导产品:给考研、给编程、给某门专业课定制一个长期陪学的 agent,还能把学生数据留在自己手里。3.4 万星说明教育圈和开发者都在关注。要落地当然还得配上优质题库和教研内容——框架解决的是『怎么教』,教什么仍是护城河。
#AI App#Python
另有 1 家信源报道
展开详情

港大数据智能实验室(HKUDS)开源的『终身个性化辅导 agent』:不是一次性问答,而是能持续跟踪一个学习者的知识状态、按其薄弱点长期规划教学路径的开源教育 agent 框架,让个性化家教从闭源产品变成可自托管、可改造的开源方案。

周增长:本周在 GitHub Trending AI 分类持续上榜(页面读数近期快速上涨;具体周增未经 API 核实)

  • **终身记忆而非一次性问答**:持续追踪学习者知识状态、按薄弱点长期规划,这是个性化辅导真正难的地方
  • **开源可自托管**:对标闭源的 Khanmigo,但可改造、数据自留,教育机构能拿它搭自己的垂类产品
  • **港大实验室出品 + 3.4 万星**:有学术团队背书,社区快速聚拢,比一般教育 demo 更可能持续演进
推荐理由:对个人:教育是少数『AI 能力已就绪、但优质内容仍是壁垒』的领域。机会不在于再训一个更聪明的辅导模型,而在于拿 DeepTutor 这类开源框架,绑上你独有的教研内容——某个细分考试、某门难课、某项职业技能的题库和方法论,做成一个能长期陪学的产品。懂某个领域怎么『教好』的人,现在有了把这份 know-how 产品化的工具。
#04
venturebeat.com Article
NEW

第三方独立评测:2.8 万亿参数的 Kimi K3 把『开源权重』顶到了美国前沿模型的门口

Moonshot 放出的 Kimi K3 是一个 2.8 万亿参数的 MoE 模型(原生多模态、100 万 token 上下文),号称『史上最大开源权重模型』。抛开厂商自夸,看第三方独立评测的横向数字才有意义:在 Artificial Analysis 的综合智能指数上,K3 约 57 分排第三/第四,落后 Claude Fable 5(约 60)和 GPT-5.6 Sol(约 59),但领先 GPT-5.5、Opus 4.8、以及 GLM-5.2(51)和 DeepSeek V4 Pro(44);在贴近真实任务的 GDPval-AA v2 上 K3 得 1687,仅次于 Fable 5 Max(1815)和 GPT-5.6 Sol Max(1747.8)、反超 Opus 4.8(1600);在 agentic 基准 AA-Briefcase 上 K3 更是冲到 1527、反超 GPT-5.6 Sol Max(1495),仅次于 Fable 5 Max(1587)。信号很清楚:顶尖开源权重和闭源前沿的差距已经收窄到『同一档、差几分』,而 K3 是开源可自托管的。
#评测
另有 2 家信源报道
展开详情
  • **对比(综合智能指数)**:Kimi K3 约 57 vs Claude Fable 5 约 60 vs GPT-5.6 Sol 约 59,领先 GLM-5.2 的 51、DeepSeek V4 Pro 的 44(Artificial Analysis)
  • **对比(真实任务 GDPval-AA v2)**:K3 1687 vs Fable 5 Max 1815 vs GPT-5.6 Sol Max 1747.8,且反超 Claude Opus 4.8 的 1600
  • **对比(agentic 基准 AA-Briefcase)**:K3 1527 反超 GPT-5.6 Sol Max 的 1495,仅次于 Fable 5 Max 的 1587——开源模型在 agent 场景已能咬住闭源第一梯队
推荐理由:对个人:该选哪个、什么场景用哪个——要绝对最强的通用智能、且不在乎自托管,Fable 5 / GPT-5.6 Sol 仍是天花板;但如果你做的是 agent 类应用、且在意成本可控与数据自留,Kimi K3 这种能自托管、agentic 分数已进第一梯队的开源权重,是性价比更高的选择。更大的机会信号是:当开源和闭源只差几分,个人和小团队完全可以用开源权重把成本压到底,把省下的预算投到『做出一个有人付费的具体产品』上——模型选型不再是瓶颈,产品和场景才是。
#05
digital-adoption.com Article
NEW

物流 AI 落地实测:Maersk 一年省 3 亿多美元、DHL 运输成本降 12%、UPS ORION 少跑 1 亿英里,赢在把 AI 卡进烧钱环节

物流是最不性感、但 AI 回报最硬的行业之一,今年的数字很能说明问题。Maersk 靠预测性 AI 做船舶维护预测、燃油优化和路径调整,一年省下超 3 亿美元,把延误砍了 67%、燃油成本省了 3.4 亿美元;DHL 的 AI 路径优化把整个欧洲网络的运输开支降了 12%、Smart Trucks 一年少跑 1000 万英里,预测误差降 40%、仓库效率提 35%、订单准确率做到 99.7%,还在用 HappyRobot 的 AI agent 自动处理数十万封邮件和数百万分钟语音的排期与承运协调;UPS 的 ORION 一年少跑 1 亿英里、省约 4 亿美元,预测性维护把非计划抛锚降了 30%。这些赢家的共同点不是模型多先进,而是把 AI 精准地卡进了一个每天都在大额烧钱的环节——路径、燃油、维护、排期。
#行业应用
另有 2 家信源报道
展开详情
  • **Maersk**:预测性 AI 一年省超 3 亿美元,延误砍 67%、燃油省 3.4 亿美元——押在维护预测+燃油+路径这几个最烧钱的点上
  • **DHL**:运输开支降 12%、预测误差降 40%、仓库效率提 35%、订单准确率 99.7%,并用 HappyRobot AI agent 自动跑排期与承运协调
  • **UPS ORION**:一年少跑 1 亿英里、省约 4 亿美元,预测性维护把非计划抛锚降 30%——十年老系统持续吃到复利
推荐理由:对个人:物流的启示对任何想用 AI 变现的人都成立——别追『最聪明的模型』,去找一个每天都在大额烧钱、又有清晰数据的具体环节,把 AI 卡进去。巨头们的护城河是规模和数据,但同样的方法论在中小尺度也能复制:给区域配送商做路径优化、给仓库做拣货排班、给车队做预测性维护,都是『无聊但持续付钱』的真实需求。懂某个物流子环节的人,比只懂模型的人更容易把这件事做成生意。
#06
aimagicx.com Article 值得关注
NEW

垂类 AI 微 SaaS:单人靠 $500 客单价 × 60 个客户做到 $30K MRR,2026 唯一还跑得通的 AI 生意模型

这篇把 2026 年个人做 AI 生意的现实讲透了:纯 AI 套壳(拿 GPT 包一层卖)几乎全死了,还活得好的是『垂类 AI 微 SaaS』——给某个不性感的具体行业做一个窄工具。它给的单人经济模型很具体:一个有行业 know-how + 过得去工程能力的单人开发者,12–18 个月能做到 $30 万–50 万 ARR;更细的算法是 $500 客单价 × 60 个客户 = $30K MRR($36 万 ARR),扣掉 AI 成本后毛利要保持 70%+,低于 60% 就说明你要么定价太低、要么架构太糟。反复被验证的规律是:给『无聊行业』做垂直 CRM、给窄场景做专用工具的人,稳定跑赢追 AI 热点的人。关键不是技术多炫,而是你是否真的懂那个窄niche 的痛点,并能把工具送到他们面前。
#小微现金流
另有 2 家信源报道
展开详情
  • **单人经济模型**:$500 客单价 × 60 客户 = $30K MRR,12–18 个月可做到 $30 万–50 万 ARR,前提是有行业 know-how
  • **毛利红线**:扣掉 AI 调用成本后毛利要 70%+,低于 60% 就是定价太低或架构低效——AI 成本必须算进单位经济
  • **套壳已死、垂类才活**:给『无聊行业』做垂直工具/CRM 的稳定跑赢追热点的,护城河是行业 know-how 不是模型
推荐理由:对想挣现金流的普通人:这是一条被反复验证、门槛可控的路——不要做通用 AI 工具去和大厂拼,去找一个你或身边人真正懂的窄行业(宠物医院排班、健身房会员管理、某类小工厂的报价单),做一个别人懒得碰的专用工具。$30K MRR 不需要爆款,只需要 60 个愿意每月付 $500 的客户;难的不是技术,是你能不能接触到这 60 个客户并让他们相信你懂他们的痛。
My Take:评分(5=最优):最快成交 3 / 最低成本 4 / 可复制 4 / 风险安全度 4。定位:有行业 know-how 的人把专业沉淀产品化的稳健长跑路线,不快但扎实。
商机信号(加速):谁付钱:被通用 SaaS 忽视的窄行业小微商家(宠物医院、健身房、区域配送商、小工厂等)的老板,愿意为『真正懂我这行的工具』每月付 $200–800 痛点:现成的通用 SaaS 覆盖不到他们的具体工作流,只能靠 Excel + 微信 + 人肉硬扛,重复劳动多、易出错、招人贵 切入点:选一个你或家人真正懂的窄行业,先用 no-code + LLM 拼一个只解决『那一个最痛环节』的最小工具,找 3–5 个种子客户按月收费验证到 $3K MRR,再逐步加功能加密度
#08
fortune.com Opinion
NEW

Andrej Karpathy

构建软件的默认工作流,在最近几个月里已经彻底变了——现在我大约 80% 的代码交给 agent 写,自己已经好几个月没有手敲过一行代码。
Karpathy 这句话被反复引用,因为它来自一个真正在一线写代码的人,而不是卖工具的人。它精准地捕捉到今天所有信号背后的那个转折:写代码这件事的主语正在从『人』变成『人指挥的 agent』。配合本周的 pi、Orca(并行 agent 舰队)和那篇《Agentic Software》论文一起看,会发现工具、实践、理论三者已经对齐——个人开发者的产能上限,正在从『我手速多快』变成『我能协调多少 agent』。但要注意,Karpathy 也提醒过 agent 编码容易进入一种『看起来在动、其实在原地打转』的状态,把控方向、拆解任务、验收结果这些判断力,反而比以前更值钱。
#DevTools
另有 1 家信源报道
推荐理由:对个人:如果连 Karpathy 都几个月不手敲代码了,那么『手写代码的熟练度』作为个人核心竞争力的时代正在过去。该现在就投入练的新技能是『指挥 agent 的判断力』——怎么把需求拆成 agent 能并行执行的子任务、怎么快速判断 agent 的产出对不对、怎么在它跑偏时及时纠正。越早从『代码执行者』转型为『agent 指挥者』,越能吃到这波产能红利。
仍在热榜 3
Repo earendil-works/pi 在榜 6d 一套开源的 AI agent 工具链,把三件事缝到一起:统一多家 LLM 提供商的 API(OpenAI/Anthrop… AI Agent
Repo stablyai/orca 在榜 8d 一个面向『并行 agent 舰队』的 ADE(Agent 开发环境):让你在一个统一控制台里同时跑多个编码 agent,… DevTools
Paper Agentic Software: How AI Agents Are Restructuring the Software Paradigm 在榜 2d 这篇论文帮你把『agent 到底改变了什么』想清楚。作者指出,半个多世纪以来软件的底层前提是:人类工程师拆解问题、把决策… AI Agent