游乐游手机版
首页/AI热点日报/热点详情

MiniMax H3开源发布通用视频模型支持多模态上下文与2K分辨率

类型:热点整理2026-08-07
MiniMaxH3开源,作为通用视频模型支持文本、图像、视频和音频多模态输入与输出上下文,可输出2K分辨率、最长15秒带原生立体声的视频,覆盖多种宽高比及11种语言,具备广泛的跨模态理解与内容生成能力。

8月3日,MiniMax 正式开源了新一代通用视频模型——MiniMax H3。这一消息在 AI 领域引发了广泛关注。简而言之,这是一套面向通用任务的全模态生成系统,能够同时处理文本、图像、视频和音频等多模态上下文信息,并输出最高 2K 分辨率、最长 15 秒且自带原生立体声音频的视频。其核心优势在于,从预训练阶段开始就并非“偏科生”,而是以任务泛化为导向进行设计,因此天然具备强大的多模态理解与生成能力,在执行复杂指令时表现相当可靠。换句话说,当你给它一个多模态“提示”时,它不仅能听懂,还能看懂,并在理解的基础上生成内容,这才是真正的“通用”视频生成模型。

通用视频模型MiniMax H3开源:支持多模态上下文、2K分辨率

具体参数方面,H3 的输出时长覆盖 4 到 15 秒,支持多种宽高比,包括 21:9、16:9、4:3、1:1、3:4、9:16 等主流比例。默认情况下,模型将短边设置为 768 像素;如需 2K 分辨率,直接调用 H3-Regenerate-2K 即可。此外,它稳定支持 11 种语言,涵盖阿拉伯语、中文、英语、法语、德语、意大利语、日语、韩语、葡萄牙语、俄语和西班牙语,其他语言也有不同程度的覆盖。这种多语言能力对于全球化应用场景而言,无疑是一项非常实用的加分项。

来源:https://tech.ifeng.com/c/8vHiGm3Sp7w

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。