8月14日消息,据机器之心报道,小红书 IMO 满分夺金自研模型的同系列版本 dots-note-3.0 正式开源,引发业界广泛关注。
上个月,小红书自研大模型「dots-note-3.0」创下历史纪录:AI 首次在国际奥数竞赛中拿下最新认证的满分 42 分,展现出强劲的数学推理能力。
今天,小红书 dots 模型实验室(以下简称 dots 实验室)宣布开源 dots3-note preview!作为 dots3 系列模型的首个开源版本,它面向更贴近真实应用场景、也更难评测的长程任务,进一步拓展了大模型与 AI Agent 的应用边界。
从目前披露的配置来看,dots3-note preview 总参数规模达到 280B,激活参数为 16B,支持 512K 超长上下文窗口,同时具备文本、视觉与语音的多模态理解能力,并针对复杂推理、Agent 应用以及多模态感知场景进行了专门优化。
此次开源将挑战带到了另一类更难标准化评估的任务场景,例如旅行规划、婚礼筹备、开店经营等。这类真实世界任务往往没有唯一标准答案,执行周期也可能从数小时延伸到数天甚至更长时间。
dots3-note preview 将重点放在长程任务处理上,也契合了当前 AI Agent 发展的重要趋势:智能体正被要求独立承担越来越长链路、越来越完整的复杂工作流。
OpenAI 此前披露,今年 5 月,超过 70% 的用户会让 Codex 处理需要人类一小时以上才能完成的工作;到了 6 月,OpenAI 内部使用量最高的 1% 活跃用户每天产生的 agent turns 已超过 60 小时。
但一旦进入不同的实际应用场景,任务复杂度就会迅速拉开差距。相较于数学、代码、工程等 Agent 已展现较高成熟度的领域,真实生活环境通常更加开放,用户需求也更模糊。dots3-note preview 将「考场」设在这一类环境中,意味着其长程规划、过程判断、动态纠错与任务执行能力将接受更高强度的检验。

从多项主流 benchmark 测试数据来看,在多项推理能力与智能体任务评测中,该模型可比肩甚至超过参数规模数倍于自身的大尺寸模型,且视觉理解能力在同尺寸模型区间内表现尤为突出。

