游乐游手机版
首页/科技数码/文章详情

北大与字节推出Open-o3+:视频嵌入时空证据让AI推理有迹可循

时间:2025-11-30 12:05
在人工智能领域,视频理解一直是极具挑战性的课题。近日,一支由北京大学与字节跳动联合组成的科研团队,成功研发出全球首个将显式时空证据嵌入视频推理全过程的开源模型——Open-o3 Video。该模型突

在人工智能领域,视频理解一直是个极具挑战性的难题。近日,由北京大学与字节跳动组成的联合科研团队,成功研发出全球首个将显式时空证据嵌入视频推理全过程的开源模型——Open-o3+Video。该模型突破了传统视频推理的局限,不仅能准确回答问题,还能在推理过程中同步标注关键事件的发生时间和具体位置,实现了真正意义上的可追溯推理。

视频理解任务要求模型同时处理时间维度的动态变化与空间维度的场景交互。传统模型虽能识别画面中的物体和动作,却难以准确判断事件发生的具体时间和位置。Open-o3+Video通过创新性的技术架构,成功解决了这一难题。该模型采用非 agent 架构设计,避免了复杂的工具调用和多轮推理,在单次回复中即可完成“观察-思考-验证-回答”的完整闭环。实验数据显示,在多个视频推理测试中,其关键指标较现有模型提升最高达24.2%,性能表现超越GPT-4o和Gemini-2-Flash等闭源模型。

研发团队指出,实现视频推理的可解释性面临两大核心挑战:一是保持文本、时间戳和物体检测框在推理过程中的一致性;二是解决时空耦合监督数据的严重缺失问题。现有数据集要么仅提供时间标注,要么只有空间标注,缺乏统一的时空标注体系。为突破这一瓶颈,团队构建了首个面向显式时空推理的统一语料体系STGR,包含30万条监督微调数据和3.6万条强化学习数据,其中5900条高质量时空数据通过严格标注流程确保数据质量。

该模型采用独特的双阶段训练机制:首先通过监督微调阶段让模型掌握推理格式与输出规范,再基于GSPO的强化学习阶段优化时空对齐能力。研发团队特别设计了自适应时间临近机制和时间门控机制,前者通过动态调整时间奖励的容忍范围实现从粗定位到精定位的收敛,后者确保空间奖励计算仅在时间预测准确时启动。这种创新训练方式使模型能够稳定高效地学习时空推理能力。

在基准测试中,Open-o3+Video展现出卓越性能。在时空推理基准V-STAR上,其时间对齐和空间对齐指标分别提升14.4%和24.2%;在VideoMME、WorldSense等四个主流测试集中,模型在需要复杂推理的时空任务和传统视频识别任务中均表现突出。特别是在VideoMME-Long子任务中,模型准确率达到54.9%,较基线模型提升4.1个百分点。

消融实验验证了模型设计的有效性:双阶段训练机制使模型性能提升显著,关键奖励机制确保训练稳定性,统一时空标注数据对推理能力提升至关重要。可视化结果显示,模型在处理物体识别、动作分析和环境推理等任务时,不仅能给出准确答案,还能提供时间戳和目标框等可验证证据,使推理过程透明可信。

目前,该研究的论文、代码和模型已全部开源。这一突破性成果为视频多模态模型的发展开辟了新方向,有望推动人工智能从“能理解”向“能定位、能解释”的更高阶段迈进。科研团队表示,将持续完善时空推理数据与训练机制,为更长视频、更复杂场景下的问答任务提供可靠支撑。

来源:https://www.itbear.com.cn/html/2025-11/1010581.html
上一篇8TB固态硬盘首发 金斯顿FURY Renegade G5仅售6399元 下一篇阿里云通义AgentScope 1.0开源:智能体框架与两大应用发布
本站内容用于信息整理与展示,如有侵权或内容问题请及时联系处理。

相关推荐

补充同频道和同主题内容,方便继续浏览更多相关内容。

同类最新

继续查看同栏目最近更新的文章。

更多
OpenClaw手机App上线,结果翻车了
科技数码 · 2026-07-01

OpenClaw手机App上线,结果翻车了

OpenClaw 官方宣布,已正式推出 iOS 和 Android 原生移动 App,用户如今可以在手机上使用这款主打“能真正帮你做事”的个人 AI 助手。官方在 X 上给出的定位也很直接:把 Agent 放进口袋里,让用户可以在移动端处理频道消息、任务和回复。从功能上看,OpenClaw 移动端并

优必选CEO周剑:家庭机器人生态核心投入过半精力
科技数码 · 2026-07-01

优必选CEO周剑:家庭机器人生态核心投入过半精力

先说几个核心判断:优必选正在布局一盘长远战略。创始人兼CEO周剑在近期一场媒体沟通会上,直接亮出了公司未来的发展路线——工业、商用、家庭陪伴机器人三条业务主赛道并行推进,现阶段每条线各占约一半精力。一边是已经能够稳定创造收入的工业场景,另一边则是他眼中“最具想象力与未来空间”的家庭陪伴领域。工业人形

CPO/NPO/OIO开启封装级光连接价值空间,技术路线尚未收敛
科技数码 · 2026-07-01

CPO/NPO/OIO开启封装级光连接价值空间,技术路线尚未收敛

6月30日,申银万国在光连接系列研报中重点指出,MPO光连接器领域的投资机会值得高度关注。通俗来说,随着AI算力集群持续扩张,光互联升级带来的连锁效应——数据中心光纤通道数量、前面板端口密度、机柜内光纤管理复杂度——均在同步攀升。光连接器的角色早已超越传统的低价值标准件,如今它直接决定着链路插损、可

龙岗AR实景剧本游内测体验短板有效破解之道
科技数码 · 2026-07-01

龙岗AR实景剧本游内测体验短板有效破解之道

在今年龙岗区第二届人工智能与机器人发展大会上,区级部门一次性推出了7个AI“龙搭子”。其中,名为“龙导游”的成果成为文商旅融合领域的核心亮点。据南都N视频记者了解,依托“龙导游”打造的全区全域AR实景剧本游“龙岗大陆”,已在今年五一假期发布了内测版本。经过一个月市场验证后,该项目正式启动面向全社会的

南下资金6月30日净买入中芯国际与建滔积层板
科技数码 · 2026-07-01

南下资金6月30日净买入中芯国际与建滔积层板

6月30日,南下资金持续大举买入港股,单日净流入金额高达58 95亿港元。接下来,我们直接盘点哪些个股获得资金青睐、哪些遭到减持: 净买入方面,中芯国际领跑全场,单日吸金19 33亿港元;建滔积层板紧随其后,净买入10 59亿港元;腾讯控股获得7 65亿港元净流入;智谱(02513 HK)也有6 5