Hall of Fame
今日趋势综述
今天的信号:把 AI『接进业务』的人,比追最强模型的人更值钱
今天几条看似无关的信号,其实指向同一个方向。Artificial Analysis 把智力指数升到 v4.2,评测重心明确转向『agentic 工作流』并加私有测试集防刷榜——这等于官方承认:模型顶端只差几分,真正拉开差距的是能不能在真实任务里稳定干活。而金融业的落地实测给出了对照答案:Commonwealth Bank 半年砍掉两成欺诈损失、某美资行把信贷备忘录提效 20–60%,这些数字不是来自更强的模型,而是来自把 agent 嵌进具体流程。FDE 那篇更直白:95% 的企业 AI 试点死在『最后一公里』,卡的是交付不是模型。
对个人来说,这是一张越来越清晰的机会地图。往上看,是 PerceptUI 这种把 LLM 训成『合成用户』、在真人测试前就替你跑 UI/UX 反馈的新范式;往下看,是 scientific-agent-skills 这类垂直 skills 库正在把某个专业领域的手艺标准件化、被十几万科研人员真金白银地用;往侧面看,是有人靠『追踪 AI 答案里有没有提到你』这么一个监测层小生意做到 $20K MRR。它们的共同点是:都不在拼谁的模型更强,而在拼谁能把 AI 能力精准接到一个具体人群的具体痛点上。
所以今天的行动方向很明确:别再纠结该用哪个旗舰模型,去选一个你懂的场景或行业,把『AI + 这个场景』做深——写一套垂直 skills、做一个监测层小工具、或者干脆学会 FDE 那套『嵌进客户现场把 demo 变成生产系统』的手艺。模型每周都在换,但『会落地』这份能力,只会越来越稀缺。
Artificial Analysis 智力指数升到 v4.2:评测重心转向『agentic 工作流』,加私有测试集防刷榜
展开详情
- **对比**:Intelligence Index v4.1.1(max effort)Claude Fable 5.1 ≈66 > Claude Opus 5 ≈63 > GPT-6 Astra ≈61 ≈ GPT-5.6 Sol ≈61——顶端仅差约 5 分,知识/推理题已基本卷不动
- **方法论升级**:v4.2 把 Terminal-Bench 升到 v4、新增 AutomationBench-AA(agentic 工作流自动化基准),并扩充私有测试集防止针对性刷榜,评测重心从『答题』转向『端到端完成任务』
- **选型信号**:当榜首差距缩到个位数,价格与延迟成了真正的分水岭——同等质量下,便宜且够快的『够用层』模型能吃掉大量批量任务,前沿模型只留给真正的硬骨头
金融业 AI agent 落地实测:Commonwealth Bank 半年砍 20% 欺诈损失,某美资行信贷备忘录提效 20–60%
展开详情
- **防欺诈**:成熟部署里欺诈误报率降 60%+,Commonwealth Bank 2026 财年上半年欺诈损失砍约 20%——直接对应真金白银的损失减少
- **提效率**:某美资行用 agent 改写信贷风险备忘录,生产力升 20%–60%、信贷周转提速约 30%;HSBC/Citi/UBS/DBS/ING 真实部署普遍降本 20%–40%
- **新岗位**:银行开始设立『监督 AI』的新角色,落地逻辑是把人从重复劳动挪到监督兜底,而非纯替换——合规敏感行业尤其如此
FDE 火的真正原因:95% 企业 AI 试点死在『最后一公里』,卡的是交付不是模型
展开详情
- **核心痛点**:约 95% 企业 AI 试点进不了生产,卡在最后一公里(脏数据、权限、法务安全、成本论证、demo 后还得能跑),而非模型能力
- **FDE 定位**:坐在软件工程 × 平台工程 × 解决方案架构交叉点,把强能力翻译成业务结果,并陪客户跑到能独立运转为止
- **行业共识**:OpenAI/Anthropic/AWS 独立得出『瓶颈是部署不是模型』并砸重金嵌工程师进客户现场——落地能力成为最稀缺资源
K-Dense-AI/scientific-agent-skills
展开详情
把任意 AI agent 变成『AI 科学家』的垂直 skills 库:内置约 165 个经过验证的即用 skill,外加 100+ 科研数据库连接,覆盖生物、化学、医学与药物发现——从癌症基因组学、1000 Genomes 个体级查询、AlphaGenome 变异效应、活体病原变异监测,到 PK/PD 建模与给药选择、全文生物医学与监管文献检索、药物-靶点结合、分子动力学、RNA velocity、微生物组基础模型等。它不改模型,而是把某个专业领域『怎么做研究』的手艺打包成 agent 能直接调用的标准件,跨多家 agent 平台通用。
周增长:在 Skills 生态里持续高热,被大量科研/生物医药团队引用与安装,属于『垂直 skills 库』这条线的头部项目
- **垂直而非通用**:165 个验证过的科研 skill + 100+ 专业数据库,专攻生物/化学/医学/药物发现,被官方口径 19 万+ 科研人员使用
- **接上权威数据**:从癌症基因组、AlphaGenome 变异效应到 PK/PD 建模、文献检索、分子动力学——skill 的价值锚在可信数据源与方法学,而非泛泛 prompt
- **跨平台通用**:兼容 Cursor / Claude Code / Codex / Pi / Antigravity 及开放 Agent Skills 标准,一次封装多处可用,降低了垂直 skill 的分发门槛
PerceptUI: LLM Agents as Human-Aligned Synthetic Users for UI/UX Evaluation
展开详情
- **合成用户**:给定人格画像即可预测该用户如何评价界面并给出自然语言理由,把真人用研前置成可批量运行的模拟
- **两段训练**:对比式反思微调(从真人决策蒸馏推理)+ 基于自身失败轨迹的反思式 prompt 演化,逼近真人真实度
- **可泛化**:在多领域/多数据集上达到接近真人的水平,能泛化到未见过的问题与人格,并给出群体层面的回答分布
AgentConn
GitHub Trending 正在变成一个 skills 市场——2026 年下半年真正的圈地运动,不是抢模型,而是抢『谁的 skill 被默认装进别人的 agent』。
AI 搜索监测层成小微 SaaS 现金牛:追踪『AI 答案里有没有提到你』,Mentions 已到 $20K MRR
展开详情
- **新行为造新需求**:消费者改用 AI 搜索选品牌,催生『我在 AI 答案里有没有被提到』的监测刚需,Mentions 靠这单点做到约 $20K MRR、目标年底 $100K
- **单点死磕**:同批单人创始人 Kleo(LinkedIn 内容)不到 90 天重建到 $62K MRR——共同规律是聚焦一个具体人群的具体新痛点,而非大而全
- **门槛在洞察不在技术**:AI 已把开发门槛拉平,真正壁垒是第一时间发现『某个新行为刚制造出、还没人做』的监测/补齐缺口
Agentation
展开详情
- **看得见的 agent**:把 agent 每一步的观察、动作与决策可视化,直击『agent 能跑但看不清错在哪』这个最大调试痛点
- **落地配套**:属于 agent 可观测/可调试这条中间件线——是把自主 agent 从 demo 推向可靠生产的必备工具
- **开发者优先**:面向正在做 agent 的开发者,先解决『可观测』往往比换更强模型更能提升实际可用性