首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

刚刚,小红书开源dots3-note!IMO 42分满分同系列模型来了

摘要

编辑|杜伟、杨文 终于,小红书 IMO 满分夺金模型的同系列版本开源了! 上个月,小红书自研大模型「dots-note-3.0」创下了一个历史记录:AI 首次在国际奥数竞赛中斩获官方认证的满分42 分。此后,社区最关心的问题,就是模型什么时候开源。 HuggingFace AI 研究及社区生态相关负责人 Adina Yakup。图源 X Post 就在今天,小红书 dots 模型实验室(以下简称 ...

dots note dots3 preview Agent https 小红书 IMO studio prev
2026-08-14 1 阅读 约10分钟阅读 机器之心
分享:
字号:
编辑|杜伟、杨文 终于,小红书 IMO 满分夺金模型的同系列版本开源了! 上个月,小红书自研大模型「dots-note-3.0」创下了一个历史记录:AI 首次在国际奥数竞赛中斩获官方认证的满分42 分。此后,社区最关心的问题,就是模型什么时候开源。 HuggingFace AI 研究及社区生态相关负责人 Adina Yakup。图源 X Post 就在今天,小红书 dots 模型实验室(以下简称 dots 实验室)宣布 开源 dots3-note preview !它也是 dots3 系列模型首个开源版本,瞄准了更贴近现实、更难评测的长程任务。 从参数来看,dots3-note preview 的总参数为 280B,其中激活参数为 16B,支持 512K 超长上下文窗口,具备了文本、视觉与语音多模态理解能力,并 针对复杂推理、Agent 和多模态感知进行了优化 。 API 入口: https://dots.ai/platform/ Huggingface: https://huggingface.co/dots-studio/dots3-note-prev GitHub: https://github.com/studio-dots-ai/dots3-note-prev IMO 满分验证了该系列模型在数学推理与证明上的能力,此次开源把挑战带到了另一类更难标准化的场景:旅行规划、婚礼筹备、开店经营。这类任务没有唯一答案,时间还可能拉长到数小时、数天甚至更久。 dots3-note preview 将重心放在长程任务上,也踩中了当前 Agent 发展的一条主线:它们开始被要求独立承担越来越长、越来越完整的工作。OpenAI 曾披露,今年 5 月,超过 70% 的用户让 Codex 处理需要人类一小时以上才能完成的工作;到 6 月,OpenAI 内部使用量最高的 1% 活跃用户每天产生超过 60 小时的 agent turns。 不过当任务落到不同场景里,难度很快就会拉开。与数学、代码和工程等 Agent 表现比较成熟的场景不同,真实生活环境更开放、需求更模糊。dots3-note preview 选择把「考场」放在这里,对自身的长程规划、判断与纠错能力提出了更高要求。 从多项主流 benchmark 数据来看, 在多项推理及智能体任务上,模型可比肩甚至超过参数规模数倍于自身的大尺寸模型 , 视觉能力在同尺寸区间表现突出 。 图源:官方技术博客 图源:官方技术博客 此前,小红书已经陆续开源了文本大模型 dots.llm1、多语言文档布局解析模型 dots.ocr 和多模态视觉理解大模型 dots.vlm1。 最新的开源,补上了 Agent 这一块拼图 。 一手实测: 它能真正完成复杂任务吗? 模型的真实能力,光看榜单远远不够。接下来,我们通过几个 case,来看看这款模型在面对信息零散、步骤繁多、环境持续变化的任务时,如何独立推进并交付结果的。 接管《杀戮尖塔 II》 先让 dots3-note preview 接管一局《杀戮尖塔 II》。 该游戏的难点在于,选什么路线、拿哪张牌、是否挑战精英、金币怎么花、营地选择休息还是升级,都会影响几十个回合后的生存概率。局部最优的选择,很可能给后面的 Boss 战埋下隐患。 模型事先并未针对这款游戏进行专门训练,却能根据战斗反馈学习卡牌和敌人机制,同时管理生命、牌组、金币与药水,在商店、营地和精英战之间不断权衡,一路玩到了 33 层。 从零破解 ARC-AGI 3 在长程推理任务 ARC-AGI 3 中,规则完全未知,模型需要观察画面,提出假设,再通过操作加以验证。 dots3-note preview 逐步发现两个方块上下同步、左右镜像规律,并摸索出危险格、可移动标记、压力开关和闸门等机制。 每当假设出错后,它会启动 Self-Critiquing 机制重新评估,将修正后的规则写入 memory.md,这个文件类似模型的记事本,持续保存对环境的动态理解。 最终,模型通过 320 步操作解开全部 6 关。 读图解决装修难题 持续学习与推理能力,最终还是要回到真实生活。 比如下面这个典型的装修难题:同时上传户型图和两款冰箱的参数截图,并补充信息:厨房靠近书房一侧的墙面,已经做了 1.5 米长的台面,现在想把冰箱放在这面墙上,究竟还能不能放下? 关键信息分散在不同图片和文字表述中,模型需要结合户型图、已有台面尺寸和两款冰箱规格,计算出墙面剩余空间,给出适配结论。它还主动提醒用户到现场复尺确认。 整个过程涉及视觉空间理解、复杂推理和工具调用,也体现出模型基于个人实际环境生成定制化答案的能力。 沿用刚才的户型图,继续让模型为书房设计几套实木风装修方案。 模型保留此前识别的尺寸与采光信息,搜索小红书相关笔记,整理四套实木风方案并生成网页,连续完成读图、计算、检索和内容生成。 端到端跑通 visionOS 应用开发 最后,来看 dots3-note preview 能否独立完成一个完整的端到端软件工程任务,让它「参考小红书的设计,开发一款 Apple Vision Pro 原生应用」。 接到任务后,模型没有急于写代码,它先理解产品需求并参考 9 张界面图,自主确定开发方案,包括采用 SwiftUI+RealityKit 技术路线,规划组织窗口、沉浸式空间和 3D 商品展示等不同模块。方案敲定后,它继续准备本地图片和 3D 模型等素材,再逐步完成代码实现。 整个项目生成 12 个 Swift 文件、1876 行代码,实现信息流、个人主页、私信、商品等界面,并接入 USDZ 3D 模型。随后,模型又自行生成 Xcode 工程、调用 xcodebuild 编译,并在 visionOS Simulator 中完成检查,最终显示「BUILD SUCCEEDED」。 从需求理解、技术选型到代码实现、编译和验证,这套开发流程最终被完整跑通 。 从最后的成品来看,已经具备了一套比较完整的空间交互。信息流可以滚动、笔记能够进入详情页,个人主页、私信可以作为独立窗口展开。 用户还可以在购物界面中直接查看并切换不同的 3D 商品。 没有标准答案, 模型得持续学习,并给自己纠错 从几组实测来看,dots3-note preview 最突出的能力是边探索、边记住新信息,遇到变化或判断失误后再调整,直到把结果交付出来。它是怎么做到呢?关键在于两件事: 学习并记住真正有用的信息,以及及时发现自身判断出现偏差并修正 。 dots 实验室首先要解决的一个问题是:模型结束训练之后,能不能持续从环境和用户身上学习。 为了训练这种能力,dots 实验室构建了 数千个 不依赖先验知识的超长程新颖环境,让 Agent 在此前没有接触过的场景中持续探索,通过与环境交互学习新的规则和知识,用于后续决策。并且,当任务长度显著超过模型的上下文窗口后,模型不能始终依赖上下文中已有的信息。经过强化学习训练,它会逐渐学会如何保留对后续解决问题有用的信息。这项能力已经在 ARC-AGI 3 上得到了验证。 从下图可以看到,dots3-note preview 在 ARC-AGI-3 上以不到 500 美元的成本取得约 0.3
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱