游乐游手机版
首页/AI热点日报/热点详情

智谱AI开源CogVLM2-Video视频理解模型支持时间问答

类型:热点整理2026-07-20
视频理解模型虽然能够解析画面内容,但在准确回答“这个动作发生在第几秒”这类时间相关问题时,往往力不从心。当前主流的视频理解模型普遍采用帧平均或视频标记压缩来降低计算开销,导致时间维度的细节信息被压缩丢失,面对时间敏感的问题自然难以给出精准答案。而部分专门针对时间问答设计的模型,又过度局限于特定格式和

视频理解模型虽然能够解析画面内容,但在准确回答“这个动作发生在第几秒”这类时间相关问题时,往往力不从心。当前主流的视频理解模型普遍采用帧平均或视频标记压缩来降低计算开销,导致时间维度的细节信息被压缩丢失,面对时间敏感的问题自然难以给出精准答案。而部分专门针对时间问答设计的模型,又过度局限于特定格式和领域,丧失了更广泛的问答能力。

智谱 AI 开源视频理解模型 CogVLM2-Video,可回答时间相关问题

▲ 官方效果演示画面

智谱AI此次推出的CogVLM2-Video,正是针对这一痛点进行了深度优化。他们提出了一套基于视觉模型的自动时间定位数据构建方法,生成了3万条与时间相关的视频问答数据。在此基础上,结合现有开放领域问答数据,将多帧视频图像与时间戳共同作为编码器输入,最终训练出了CogVLM2-Video模型。

从测试结果来看,CogVLM2-Video不仅在公共视频理解基准测试中达到了最新最优性能,在视频字幕生成和时间定位这两个细分任务上同样表现突出。目前该模型已开源,相关资源链接如下:

  • 代码仓库:https://github.com/THUDM/CogVLM2

  • 项目官网:https://cogvlm2-video.github.io

  • 在线体验:http://36.103.203.44:7868/

来源:https://www.1ai.net/15469.html

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。