视频生成模型这个月格外热闹。
7 月 31 日,MiniMax H3 与字节跳动 Seedance 2.5 在同一天发布。3 天后,MiniMax H3 正式开源;8 月 7 日,Seedance 2.5 也开放了 API。
H3 的核心卖点是开源和低成本,最长可生成 15 秒、2K 视频,API 定价为每秒 0.8 元;Seedance 2.5 则把单次生成时长从 15 秒提升到 30 秒,一次最多支持 30 张图片、10 段视频和 10 段音频,共计 50 份多模态参考素材,同时强化了时间戳控制、定向编辑和白模参考等能力。
模型能力越来越强,但产品是否真的能把这些能力用好?
从某种意义上说,7 月发布的这两款视频模型,反而进一步说明了一件事:视频模型越强,产品层和应用层就越有机会创造更高的价值。
01
模型变强了,
产品层要做的事反而更多了
前段时间,MiniMax 在 reddit 社区进行了一场 AMA,集中分享了不少 H3 模型背后的细节。团队提到一个很有意思的现象:在训练过程中,模型的泛化能力正在明显增强。更具体地说,这个模型原本只接受过“根据首帧和文字描述预测末帧”的训练任务,但即便没有专门针对图像编辑方向做强化训练,它在多项图像编辑测试中依然取得了相当不错的结果。
换句话说,模型在完成一类训练任务的过程中,会自发学会另一类任务。
这也意味着,过去一些需要专项模型,或者必须配合复杂工作流才能完成的能力,正在逐步被通用模型吸收。随着模型泛化能力持续提升,仅靠多接入几个模型来形成产品差异的方式,已经越来越难成立。
抢先接入新模型、依靠时间差建立优势,在今天其实也不再稳固。
H3 开源后,主流模型托管平台、开源工具以及多家芯片厂商在短短几天内就完成了适配。而作为业内高度关注的旗舰视频生成模型,Seedance 2.5 的同步接入,也已经成为各类视频 Agent 产品的标准动作。

LibTV 同步上线了 H3 和 Seedance 2.5
我们从 LibTV 了解到,H3 上线后,部分原本调用 Seedance 2.0 的电商视频和影视任务,已经开始尝试切换到 H3,主要考虑因素就是价格以及具体任务中的生成表现。创作者会根据效果、成本和生产效率,在不同视频模型之间灵活切换。
有些用户已经摸索出一套跨模型工作流:先用 H3 快速打草稿,确认构图和节奏,满意后再切换到 Seedance 2.5 输出终稿。草稿阶段可以先确定提示词、参考素材组合和节奏安排。画面本身未必能直接迁移到下一个模型,但这套做法确实能够节省一部分试错成本。
很明显,模型选择本身,正在成为一项需要由产品来承接的能力。
什么任务值得调用更贵的模型,什么场景用便宜模型就足够,这些都需要系统判断。产品还要考虑已有项目是否值得迁移。更换底层模型之后,原有角色、场景和历史素材是否还能继续复用,也会直接影响选择。目前,这些判断往往仍由创作者手动完成。但从长期来看,选择合适视频模型这件事,不应该成为创作者必须掌握的能力,而应该由产品和模型编排层来解决。
除了模型选择之外,随着模型变强,创作者还需要管理更多变量。
先看素材管理这一环。一支广告、短剧或 MV 的制作,往往远不只是丢进一两张图那么简单,角色的正面、侧面参考要完整,服装、场景、道具等元素也都要准备齐全。Seedance 2.5 单次最多可以接收 50 份素材,输入容量确实提高了,但新问题也随之出现:用户不仅要先找到正确版本的素材,还要把这些素材准确地放进剧本和提示词对应的位置。输入上限抬高之后,真正限制效率的,反而变成了素材组织与管理。

一个测试视频的素材管理,复杂一些的任务,素材会更多
然后是任务返工。视频时长从 15 秒增加到 30 秒之后,修复局部错误的代价也会同步上升。重新生成整条视频,不仅 token 成本已经花出去,原本正确的部分也可能被重新改坏。
单条视频越长,一次返工浪费的时间和费用就越多。能不能只修改出问题的几秒,能不能在正式生成前以更低成本验证方向,会直接影响整个项目的实际投入。Seedance 2.5 已经支持基于时间戳的定向编辑,并尽量保持修改前后的连续性。模型提供了编辑能力,但产品要把这种能力真正变成一套顺手、可落地的修改流程。
生成长视频还有另一层复杂度。H3 社区里就有开发者分享过自己的方法:先让模型生成一段,再把上一段的尾部作为下一轮参考输入。生成过程中,他会持续提供同一张主体图片,以维持角色一致性,最终拼接出约 60 秒的连续视频。
MiniMax 技术团队对此回应称,这种续写能力确实存在。只是模型目前还没有原生训练过由多段续写组成的长视频,因此真正意义上的连续长视频生成仍未完全实现。
这意味着,现阶段使用 H3 或 Seedance 2.5 生成长视频,仍然需要由应用层完成片段拆分、前后衔接管理,以及角色和场景一致性的维护。模型提供了续写能力,应用则负责把这些片段组织成一个完整项目。
模型扩大的是生成空间,而模型能力提升带来的这些工程复杂度,本来就应该由视频 Agent 和产品层来解决。
02
比起更快接入模型,
更好驾驭模型才是壁垒
今天的视频 Agent,已经开始尝试解决这些真实存在的生产问题。
LibTV 上的 AI 短剧《被裁掉的女孩》上线不到 30 天,第一季累计播放量已经破亿。前 6 集主要由 3 个人完成,每集平均需要 2 到 3 天。技术门槛已经大幅降低,但在内容生产环节,又出现了一些新的瓶颈。
导演菲菲飞在采访中提到,最耗时的环节往往是场景、服装、妆造以及视觉基调的建立。团队需要逐项确认光比、色彩搭配、场景元素和人物服饰,再反复测试不同方案,直到画面接近他们真正想要的状态。为了让同一批角色连续出演十多集,电脑桌面上经常堆着几千张图片、几百条视频。仅仅是找到某套服装或某个场景,就需要耗费不少时间。
项目一旦进入连续生产阶段,核心瓶颈就会从“能不能更快生成”,转向“能不能更高效地管理”。
SD2.5 和 H3 发布之后,LibTV 的核心产品动作,基本也都是围绕这些视频生产问题展开的。
首先是生成前的素材组织。逐帧拉片 Shot Breakdown 可以分析参考视频中的画面风格、关键帧、运镜方式、叙事节奏和背景音乐,再把这些信息整理成可持续复用的参考素材组,而且这一过程不会扣除视频生成积分。
AutoLink 会读取剧本和画布素材,尝试把角色、场景和道具对应的参考内容自动放入提示词。用户仍然可以检查和替换,但不再需要从几十份素材里逐个查找和手动引用。它们的作用非常直接,就是先替用户准备好输入,再交给视频生成模型处理。

第二个环节是生成后的局部修改。Seedance 2.5 本身提供了按时间段定向编辑的接口,LibTV 则把这项能力封装成时间轴上的选区、修改和回填流程。用户只需选中需要调整的区间,重新描述人物、动作或画面要求,再把生成的新片段回填到完整视频中。
如果 30 秒的视频里只有 2 秒出错,那就只需要重做这 2 秒,而不必让整条视频重新生成。单条视频越长,局部修改能力的价值就越明显,也越能显著降低重复生成的时间和成本。
第三个环节,是把多个片段组织成一个完整作品。Seedance 2.5 单次生成上限为 30 秒,官方也支持多轮延长。LibTV 则支持把长任务拆分成多个片段,并保留中间节点与生成关系。用户可以展开并修改某个镜头,再同步回最终作品,最终支持生成最长 5 分钟的视频。

用户可以展开查看、单独修改任一镜头,再同步更新最终视频
Seedance 2.5 API 上线当天,LibTV 就交付了这些功能。之所以能够同步上线,是因为画布、节点关系、资产库和时间线这套底层能力早已准备完成,新模型只需要接入既有结构即可。
反过来看,如果一个产品只有一个对话框和一个模型下拉列表,那么即使新模型再强,最终呈现出来的变化,也不过是模型选项里多了一个名字而已。
模型之上的竞争,比起谁更早接入新模型,更关键的是谁能在新模型发布时,就已经准备好配套的生产系统,让模型能力真正快速交付为用户想要的结果。
03
视频 Agent 之间的竞争,
开始走向模型层之上
模型迭代这么快,行业里始终存在一种担忧:Agent 应用会不会最终沦为单个模型的“二道贩子”?现有能力会不会被底层模型逐步吸收?
H3 和 Seedance 2.5 从不同维度扩展了模型能力边界:更强的任务泛化、更长的视频生成时长、更多的参考输入,以及更细粒度的编辑控制。这些能力让单个镜头的生成更强,但也让完整项目的管理变得更复杂。从这个角度看,视频 Agent 的竞争优势和产品壁垒,也正在随之变化。
新模型上线之后,平台需要尽快判断它更适合什么任务,哪些流量应该迁移,哪些场景应该继续使用旧模型。H3 上线后的任务迁移,考验的正是这层响应速度。快当然重要,但快本身也是可以被追上的。
模型真正进入实际生产之后,许多摩擦点才会逐渐暴露。Seedance 2.5 支持更多参考输入,产品就必须处理素材组织和自动匹配的问题。视频时长更长,产品就要尽量降低局部错误带来的返工成本。生成素材越来越多,产品还得继续承接混剪、合成和最终交付。
第三层涉及项目资产与团队流程的持续沉淀。一个项目完成后,会积累下角色、场景、道具和历史镜头。团队也会逐渐形成自己的审核与修改习惯,并沉淀不同模型在具体任务中的效果数据。这些信息可以帮助下一个作品更快完成,同时也更难被复制。
视频 Agent 的素材管理,无论在模态数量还是复杂度上,都比代码 Agent 更难。代码有 Git,写到一半的项目 clone 一下就能整体搬走,但视频生产到今天仍然缺少通用的状态格式。主角的面部参考、不同情绪下的表情设定,以及十几集积累下来的服装与场景资产,很多时候都与具体工具深度绑定。单个功能也许随时会被模型厂商吸收,但这套持续积累的生产状态,很难在一夜之间被替代。
过去的视频编排,更多是在图像、视频、配音之间传递结果。H3、Seedance 2.5 这类模型出现后,编排对象已经进一步扩大。Agent 还要处理剧本拆解、模型选择、素材继承、镜头状态和局部返工,以及决定人在什么阶段介入。
未来的模型一定会吸收今天的一部分产品功能,单纯依靠接入模型形成的差异也会继续缩小。但创作者最终要交付的内容不会改变,他们面临的难题——素材组织、成本控制、局部修改和项目管理——也不会因为模型升级就自动消失。
模型在持续变强,但模型编排并没有消失,只是编排的对象,正在从模型本身转向作品交付。
今天视频 Agent 之间的竞争,也真正进入了模型层之上。好的视频模型,可以决定第一条片子有多惊艳;而一款优秀的 Agent 产品,最终决定的是作品能否准时、稳定、高质量地完成交付。
