📅
Hall of Fame
Hall of Fame
Track
Type
Source
9月16日 周三 · 8 条
今日趋势综述
DeepSeek 官方把编码 agent 做成『一切皆插件』的开源底座一周揽星破十万,叠加 VISTA 论文用『给模型一块状态仪表盘』零训练大幅提升上下文管理——今天的信号都指向同一件事:模型这层在收敛,能打的是底座、上下文与工程手艺。
今天的信号:模型在收敛,『底座 + 上下文』在升值

今天最响的两个信号并不是又一个更强的模型。一个是 DeepSeek 亲自下场开源『DeepSeek Harness』——把编码 agent 的界面、工具调用、agent 循环、模型接入全做成可插拔插件,一周揽星冲到十几万,直接把『用哪家模型』变成底座下游一个可替换的选项。另一个是 VISTA 论文:它不训练模型,只给模型一块能看见『每块上下文有多大、多旧、用没用过』的仪表盘,就把 Gemini-3-Flash 在长上下文基准上从 22.7% 拉到 50.7%,还压过了 ReAct、compaction 乃至 Claude Code。两件事指向同一个判断:模型能力这层正在收敛,真正拉开差距的是底座(harness)、上下文工程和把它们落到业务里的工程手艺。

今日新增 7
#02
GitHub Repo
★ 46.2K NEW

ayghri/i-have-adhd

i-have-adhd 火成周榜第一,说明一个被长期忽视的事实:agent 好不好用,一半在模型,一半在『它怎么把结果交给你』。同样的模型,输出结构对不对,使用体验能差一大截——这恰好和今天 VISTA 论文『界面比模型更关键』是同一个道理的用户侧版本。它也示范了 skill 这个形态的威力:不改模型、不写复杂代码,几十行规则就能把通用 agent 调教成贴合你工作习惯的样子。对每天和编码 agent 打交道的人,这类『行为塑形 skill』是投入产出比极高的一手工具。
#Skills#编程开发#Skill 配置为主(Jav…
另有 2 家信源报道
展开详情

一个给编码 agent(尤其 Claude)用的 skill,专治一个真实痛点:agent 常把真正的答案和关键改动埋在一大段解释、铺垫、客套里,读者要扒半天。它用约 10 条格式规则强制改造输出——先给可执行步骤、多步任务编号、砍掉旁枝末节、去掉啰嗦的收尾——把冗长的『解释型』回答压成直给、编号的『行动型』回答。README 用 before/after 示例直观展示这种转变。

周增长:长期高居 GitHub 周榜 Top 1 附近,是当前『改造编码 agent 输出行为』这一 skill 品类里星数最高的项目之一

  • **先给答案**:约 10 条规则强制 agent 先抛可执行步骤、多步编号、砍掉铺垫和啰嗦收尾,把『解释型』输出改造成『行动型』
  • **零改模型**:不训练、不改权重,纯 skill 配置即插即用,几十行规则就把通用编码 agent 调成贴合个人习惯的交付风格
  • **周榜第一 + MIT**:约 46.2K 星长期霸榜,开源可自由改造,是『用 skill 塑形 agent 行为』最热门的范例
推荐理由:对普通人的机会:别只盯着换更强的模型,先学会用 skill 塑形你手里的 agent。i-have-adhd 证明几十行规则就能显著改善日常体验——把它读懂、改成你自己的版本(比如你行业的术语、你团队的格式规范),就是一份可复用、可分享、甚至可打包出售的个人生产力资产。会写 skill,是这轮 AI 里门槛最低、见效最快的一门手艺。
#03
arXiv Paper
NEW

LLM Agents Are Latent Context Managers: Eliciting Self-Managed Context via State Proprioception

这篇论文提出 VISTA(Visible Internal State for Tool Agents):把 agent 的工作记忆表示成一块块有类型、可寻址的上下文,并给模型一个『仪表盘』,实时显示每块上下文的 token 占用、新旧、被访问历史和预算。作者的核心论点很反直觉——前沿模型对自己的上下文是『本体盲(proprioceptively blind)』的,光看提示词它根本不知道每块内容多大、多旧、用没用过;而『会不会管理上下文』这件事,能力其实已经潜藏在模型里,缺的只是一个把状态暴露出来的界面。给上界面后,零训练就大幅提分。它把『上下文工程』从玄学变成了可量化、可复现的系统设计。
证明了强模型早已『会管上下文』,缺的不是训练,而是一块能让它看见自身上下文状态的界面——给对界面,同一个模型长上下文成绩能翻倍。
#AI Agent
另有 1 家信源报道
展开详情
  • **零训练翻倍**:在 LOCA-Bench 上把 Gemini-3-Flash 从 22.7% 拉到 50.7%,BrowseComp-Plus 达 58.0%,全程不训练模型
  • **界面 > 策略**:同一界面在 LOCA-Bench 上压过 ReAct、删除、掩码、compaction 乃至 Claude Code,并在 4 种底座上都迁移有效
  • **可精确归档**:臃肿的上下文块可作为外部 payload 存档并留稳定句柄,按需精确取回原字节,删块不丢信息
推荐理由:对普通人的机会:VISTA 把一句朴素的经验变成了硬证据——你喂给 AI 的上下文『长什么样、怎么组织、怎么归档』,比换更强的模型更能决定结果。哪怕你不搞研究,也能把这套思路用在日常:给 agent 明确标注每段材料的用途和优先级、及时清理过期上下文、把大块资料归档成可召回的引用。把『上下文管理』练成习惯,是当前性价比最高的能力升级。
#04
Product Hunt Product
NEW

Experiential Labs

Experiential Labs 是一个开源 AI 网关(gateway):一把 key 就能调用 1000+ 模型,既能用它自带的模型市场,也能自带各家 provider 的 key,或接入本地/自有云上跑的模型。它的价值在于把『多家模型接入』这件重复劳动收敛成一个统一入口——这和今天 DeepSeek Harness『模型可插拔』是同一股力量在基础设施侧的体现。对既想用最新模型、又不想被单一厂商锁定、还想按成本灵活切换的开发者,这类网关正在成为标配中间件。开源 + BYOK 的组合,也让它比闭源托管网关更容易被小团队信任和自托管。
#Infra#开源 AI 网关,免费自托管…
展开详情
  • **一把 key 通 1000+ 模型**:统一入口调度上千模型,换模型近乎零成本,把厂商锁定问题下沉为可切换配置
  • **开源 + BYOK**:可自托管、自带各家 provider key,也能接本地/自有云模型,数据与成本控制权留在自己手里
  • **网关即中间件**:把多模型接入、路由、计费这类重复劳动标准件化,是自建 agent / 应用时省下大量胶水代码的地基
推荐理由:对普通人的机会:如果你在做 AI 应用或 agent,别把多模型接入一家家手写。用开源网关把『模型层』抽象成一个可切换入口,你就能在成本、速度、质量之间自由调度——今天用便宜的『够用层』跑批量,明天用前沿模型啃硬骨头。掌握『网关 + BYOK』这套基础设施打法,是把 AI 成本打下来、又不被锁死的关键一步。
#05
research.google Article
NEW

医疗 AI 落地实测:Google AMIE 对话式诊断 AI 首次真人临床研究,诊断准确度追平全科医生、零安全叫停

Google 把对话式诊断 AI『AMIE』第一次放进真实临床场景做有监督部署,结论是:可行、且对话层面安全,诊断准确度可与初级保健医生(PCP)相当,患者与 AI 交互期间零安全叫停(zero safety stops)。这是医疗 AI 从『论文刷分/影像单点任务』往『真人问诊全流程』迈出的关键一步——注意关键词是『有监督部署』:AI 不是取代医生,而是在医生兜底下承担问诊与初步判断。配合行业其它数据(AI 病历工具把医生写病历时间砍 40–45%、影像诊断多项任务已达专家级),医疗 AI 的落地范式越来越清晰:AI 干重复与初判,人负责兜底与决策。
#行业应用
另有 1 家信源报道
展开详情
  • **准确度追平全科医生**:真实临床研究中 AMIE 的诊断准确度与初级保健医生相当,且患者交互全程零安全叫停
  • **范式是『AI+人』**:采用有监督部署,AI 承担问诊与初判、医生兜底决策,而非纯 AI 替代——和教育、法律的落地路径一致
  • **外围早已成熟**:AI 病历工具把医生写病历时间降 40–45%、笔记错误率降 25–30%,影像诊断多项任务已达或超专家级
推荐理由:对普通人的机会:医疗 AI 的钱不在『造一个取代医生的模型』,而在『把 AI 稳稳嵌进医生工作流』的那层活——病历自动化、问诊预处理、随访提醒、合规与安全兜底。如果你在医疗、健康或相关 IT 领域,学会做『AI+人』的流程设计与落地交付(哪一步交给 AI、哪一步必须人兜底、怎么留审计痕迹),比单纯会调模型更稀缺、更值钱。
#06
deepengineering.net Article
NEW

FDE 岗位真相:招聘一年暴涨约 729%,但『职位多 ≠ 好拿』,能真正落地的人才是稀缺项

Forward Deployed Engineer(前向部署工程师)岗位过去一年井喷——招聘数据口径『同比高出约 729%』『职位数暴涨 800%』,OpenAI、Anthropic、Google、Databricks、Scale、Ramp 等都在抢人。但这篇文章戳破一个错觉:职位多不等于好拿。FDE 的面试考的不是刷算法题,而是三关——行为/契合度(沟通与 ownership)、技术深挖(写生产代码 + 系统设计)、以及著名的『问题拆解(decomposition)』案例。企业其实招不到人,因为合适的人来自解决方案架构师、技术顾问、应用型 AI builder 这些非传统软件工程师池子,稀缺的是『能把模糊的企业问题拆成可交付、并亲手送进客户业务里』的判断力。
#FDE
另有 1 家信源报道
展开详情
  • **需求井喷但难填**:FDE 招聘同比约 +729%、职位数涨约 800%,却是最紧的高级技术市场,招聘周期常拉到 6–10 周
  • **考拆解不考刷题**:面试三关是行为契合、技术深挖(生产代码+系统设计)、decomposition 案例,判断力比算法题更被看重
  • **人来自非传统池**:合适人选多是解决方案架构师/技术顾问/应用型 builder,稀缺的是『把模糊问题送进业务落地』的能力
推荐理由:对普通人的机会:FDE 是当下 AI 里最稀缺、也最好『非科班切入』的高价值岗位。如果你不是顶尖算法工程师,但擅长跟客户对话、把模糊需求拆成可交付、并能写出能跑的生产代码——这正是企业最缺的画像。刻意练习『问题拆解 + 端到端交付』,比刷 LeetCode 更能让你吃到这波 AI 落地红利。
#07
fungies.io Article 值得关注
NEW

把『AI 挽回失败扣款』做成小微 SaaS:AI dunning 挽回率 65–80% 碾压传统 30–40%,Churnkey 做到 $30K MRR

订阅制生意有个『闷声流血』的漏洞:扣款失败(信用卡过期、余额不足)会吃掉每月 8–15% 的 MRR,占全部流失的 20–40%,而且几乎全是可挽回的『非自愿流失』。传统 dunning 用死板的通用邮件和固定重试,只能挽回 30–40%;AI dunning 靠个性化重试时机、文案和升级路径,把挽回率拉到 65–80%。这生意对小微/个人开发者极友好:毛利 70–90%,收入直接和客户被挽回的钱挂钩,几周就回本。案例如 Churnkey 做到约 $30K MRR、平均帮客户降 18% 流失,Baremetrics 从副业做到 $1M+ ARR。切口清晰、痛点可量化、买单意愿明确——是典型『能算出回本』的现金流生意。
#小微现金流
另有 2 家信源报道
展开详情
  • **痛点可量化**:扣款失败吃掉 8–15% MRR、占流失 20–40%,且几乎全可挽回,是被 $10M ARR 以下公司系统性忽视的『捡钱』环节
  • **AI 把挽回率翻倍**:个性化重试时机/文案/升级路径把挽回率从传统 30–40% 拉到 65–80%,毛利 70–90% 且收入随客户营收增长
  • **有跑通案例**:Churnkey 约 $30K MRR、平均降客户流失 18%;Baremetrics 从副业做到 $1M+ ARR,切口窄、回本快
推荐理由:对想挣现金流的普通人:这是一个『痛点能算成钱、买单意愿现成』的窄切口。你不需要造复杂产品——挑一个细分(比如只服务某类 Stripe 独立开发者或某垂类 SaaS),把 AI 个性化重试 + 挽回文案做扎实,按『挽回金额分成或月费』收钱。因为客户能直接看到你帮他追回多少钱,成交和续费都容易。宁可窄、宁可深,先跑通一个细分再复制。
My Take:评分(5=最优):最快成交 4 / 最低成本 4 / 可复制 5 / 风险安全度 4。定位:给中小订阅制商户做 AI 失败扣款挽回,按挽回金额或月费收钱、回本可算。
商机信号(加速):谁付钱:月流水有一定规模的订阅制 SaaS / 会员制 / 独立开发者商户(尤其 $10M ARR 以下、被大厂 dunning 方案忽视的中小客户) 痛点:扣款失败吃掉 8–15% MRR、占流失的 20–40%,几乎全是可挽回的非自愿流失,但自己没精力做个性化重试与挽回,白白流血 切入点:锁定一个细分渠道(如某支付平台上的某垂类商户),做『AI 个性化重试时机+文案+升级路径』的轻量挽回服务,按追回金额分成或低月费起步,用『帮你追回了多少钱』的可见结果做转化,先跑通一个细分再横向复制
#08
benchlm.ai Article
NEW

智力榜『够用层』价格坍塌:Gemini 3.8 Flash($0.75/$3.75)智力逼近前沿,选型该按『任务分层』而非只买最强

把 9 月各家新模型摆到 Artificial Analysis 的智力指数(Intelligence Index)同一把尺子上看,会发现两件事:一是前沿被 Claude 领跑,二是『够用层』的价格已经坍塌到前沿的十几分之一,而智力差距只有几到十几分。这意味着『买最强的』在多数任务上是浪费——真正省钱的做法是按任务分层调度:批量、简单、走量的活交给便宜的 Flash 级模型,只有真正难啃的复杂推理才上前沿旗舰。配合今天 DeepSeek Harness / 开源网关『模型可插拔』的趋势,分层调度已经从理念变成人人可落地的工程实践。
#评测
另有 2 家信源报道
展开详情
  • **对比(智力指数,越高越强)**:Claude Fable 5.1 约 66 vs Claude Opus 5 约 63 vs GPT-6 Astra 约 61 vs GPT-5.6 Sol 约 59–61 vs Gemini 3.8 Flash 约 53(Artificial Analysis Intelligence Index,max effort 口径)
  • **对比(每百万 token 价格,越低越省)**:Gemini 3.8 Flash $0.75/$3.75 vs GPT-5.6 Sol $4/$20 vs GPT-6 Astra $10/$50——够用层比前沿便宜一个数量级,智力只差十几分
  • **结论是分层**:多数量大简单任务用 Flash 级(省一个数量级成本),只有硬推理才上 Fable 5.1 / Opus 5 级旗舰,靠网关/harness 自动路由
推荐理由:对开发者/普通人:现在选模型别再『一把梭最强的』。把任务分三层——走量简单活用 Gemini 3.8 Flash 这类便宜够用层(成本能省一个数量级),中等复杂用 Sol 级,只有真正难的复杂推理才动用 Fable 5.1 / Opus 5。用开源网关或 harness 做自动路由,你能在几乎不掉质量的前提下把 AI 账单砍掉一大半。会『按任务×成本分层调度』,是这轮模型收敛里最实在的省钱手艺。
仍在热榜 1
Repo deepseek-ai/deepseek-harness 在榜 3d DeepSeek 官方开源的编码 agent 底座(harness),核心主张是『Everything is a Plu… DevTools