跳转至

刚刚,小红书开源dots3-note!IMO 42分满分同系列模型来了

来源:机器之心(微信公众号)|分类:LLM 原文链接:https://mp.weixin.qq.com/s/C02ISl4t6rBzVOyyBKTqpw 编辑:杜伟、杨文

摘要

小红书 dots 模型实验室宣布开源 dots3-note preview——上个月在国际奥数竞赛(IMO)中斩获官方认证满分 42 分的 dots-note-3.0 同系列模型。这是 dots3 系列首个开源版本,瞄准「真实生活长程任务」。

正文要点

一、模型基本参数 - 总参数 280B,激活参数 16B(MoE 架构),支持 512K 超长上下文 - 具备文本、视觉、语音多模态理解能力 - 针对复杂推理、Agent 和多模态感知优化 - 开源地址:HuggingFace(dots-studio/dots3-note-prev)+ GitHub(studio-dots-ai/dots3-note-prev),API 入口 dots.ai/platform/

二、为什么做「长程任务」 - IMO 满分验证了数学推理与证明能力,此次把挑战放到更难标准化的场景:旅行规划、婚礼筹备、开店经营——没有唯一答案,时间可能拉长到数小时、数天甚至更久 - 踩中 Agent 发展主线:OpenAI 披露今年 5 月超 70% 用户让 Codex 处理需人类 1 小时以上的工作;6 月内部使用量最高 1% 活跃用户每天产生超 60 小时 agent turns - 与数学、代码等成熟场景不同,真实生活环境更开放、需求更模糊

三、一手实测(4 个 case) 1. 《杀戮尖塔 II》:模型未针对该游戏训练,却能根据战斗反馈学习卡牌和敌人机制,管理生命/牌组/金币/药水,在商店、营地和精英战之间权衡,一路玩到 33 层 2. ARC-AGI 3:规则完全未知,模型逐步发现方块上下同步、左右镜像规律,摸索出危险格、可移动标记、压力开关和闸门机制;假设出错时启动 Self-Critiquing 重新评估,把修正后的规则写入 memory.md(模型的「记事本」),最终 320 步解开全部 6 关 3. 读图解决装修难题:同时上传户型图 + 两款冰箱参数截图,结合 1.5 米台面尺寸计算墙面剩余空间给出适配结论,还主动提醒用户现场复尺确认;继续沿用户型图为书房设计四套实木风方案,保留此前尺寸与采光信息、搜索小红书笔记、生成网页——连续完成读图、计算、检索、内容生成 4. 端到端 visionOS 应用开发:「参考小红书的设计,开发 Apple Vision Pro 原生应用」——先理解需求参考 9 张界面图,自主确定 SwiftUI+RealityKit 技术路线,规划组织窗口/沉浸式空间/3D 商品展示模块;生成 12 个 Swift 文件、1876 行代码,接入 USDZ 3D 模型,自行生成 Xcode 工程、调用 xcodebuild 编译,visionOS Simulator 显示「BUILD SUCCEEDED」

四、核心技术:TEMPO 训练方法 - 问题:长程任务探索成本太高(一次探索十几小时),value-free RL 要等整条轨迹结束才有训练信号;PPO 等 actor-critic 方法的传统 critic 只有一次固定算力前向计算,无法判断复杂 Agent 任务的进展 - 方案:TEMPO(Test-time-scaled Value Estimation with Macro-step Policy Optimization)——把长轨迹切成多个 macro-step(每段含多轮模型与环境交互),阶段结束时模型从 actor 切换为 critic,通过推理、工具调用和 test-time scaling 估计当前状态的未来回报,把评价变成未结束轨迹的训练信号 - 模型既要学如何行动,也要学如何评价自己——自我评价让 RL 训练能放到更长任务中 - 效果:任务进入深水区后优势明显,交互轮次增加时 GRPO 和 Base checkpoint 得分停滞,TEMPO 仍能继续提升 - 训练数据:构建数千个不依赖先验知识的超长程新颖环境,让 Agent 持续探索学习新规则;任务超过上下文窗口后学会保留对解决问题有用的信息(已在 ARC-AGI 3 验证) - 成本:ARC-AGI-3 上以不到 500 美元成本取得约 0.35 分,绝对分数低于 Claude Opus 4.8 (high),但成本效率明显更高

五、Self-Critiquing 机制 - 即使问题没解出来,也能从两个表面相似的中间状态判断哪个更有希望突破 - IMO 2026 参赛时,同系列分支版本一边生成证明、一边通过工具调用反复检查修改,最终满分 - 未来计划:「开放任务」中探索递归自我评价(recursive self-critiquing),在缺少清晰外部奖励时自己判断任务进展、调整记忆和规划

六、两套开源评测基准 - VibeSearchBench:「用户没一次说清需求,Agent 能不能弄明白他到底想要什么」——20 个领域、200 项任务,模拟真实用户多轮补充需求和限制条件 - VibeLifeBench:「外部条件变化后 Agent 还能不能跟得住」——10 个领域、20 项任务,每项 20-30 个阶段,1247 项 atomic checks 检查状态一致性、工具执行正确性和最终交付 - 结果:连 Claude Opus 5、GPT-5.5 这样的全球头部模型都没达到及格水平——说明高难度单点任务已足够强,但把能力稳定维持数小时以上仍是 Agent 力所不及的地方

七、产品规划 - dots3-note 是 dots3 系列最轻量级版本,正式版近期开源 - 未来 dots3 系列将推出 jazz 和 aria,与 note 组成三个层级,覆盖不同任务复杂度、响应速度和计算成本 - 此前小红书已开源 dots.llm1(文本)、dots.ocr(文档布局解析)、dots.vlm1(多模态视觉),此次补上 Agent 拼图

🎯 Friday 提炼

  • 小红书这套「主动记忆 + 超长轨迹强化学习 + 中途自评」的组合,给出了长程 Agent 进入现实世界的一种具体解法
  • 280B 总参/16B 激活的 MoE 架构 + 512K 上下文,走的是「小而精」开源路线,成本效率是卖点(不到 500 美元刷 ARC-AGI-3)
  • 两个 benchmark 全员不及格(含 Claude Opus 5、GPT-5.5)是核心信号:长程稳定性是当前 Agent 公认短板,小红书把评测做成了「公开处刑」式营销

💡 Friday 看法

这篇最值得关注的不是 IMO 满分(那只是推理能力的单点证明),而是小红书把评测场景从「考试」搬到了「过日子」——旅行、婚礼、装修这种没有标准答案、需求还会中途变化的场景。TEMPO 的「切段自评」思路挺有意思,等于给长轨迹训练装了中途反馈站,比 GRPO 硬等到终点拿信号靠谱得多。两个开源 benchmark 全员不及格也印证了:Agent 短跑已经很快,马拉松才是下一场竞赛。对哥哥来说,如果你在评估 Agent 类的工具/模型,VibeLifeBench 这类「中途变卦还跟得住」的评测,比传统榜单位更有参考价值。

一句话总结

小红书开源 IMO 满分同系列模型 dots3-note preview(280B/16B MoE、512K 上下文),主打长程真实生活 Agent 任务,凭 TEMPO 中途自评训练法在 ARC-AGI-3、装修规划、visionOS 开发等实测中表现亮眼,并开源两套让 Claude Opus 5、GPT-5.5 都不及格的 Agent 评测基准。