7月31日,字节跳动Seed团队正式发布了Seedance 2.5,直接将单次视频生成时长从15秒提升至30秒。模型上线后,创作者们迅速探索这多出的15秒如何用于叙事:有人仅用一个提示词便完成了六个动作镜头的连贯输出,有人尝试长对话与完整脚本;但也有人发现,视频时长增加后,漏动作和重新生成所带来的成本也随之上升。
Seed团队透露,Seedance 2.5已在即梦AI和豆包专业版陆续上线,火山方舟API也将在近期进一步开放。
最新介绍:时长、素材、控制
此次升级最直观的变化在于时长。据官方介绍,Seedance 2.5能够在30秒内组织多个相互关联的镜头,使一段内容能够容纳铺垫、推进、转折与收尾。生成结束后,用户还可继续延长视频,后续镜头会自动沿用原有的人物、场景、画面风格及声音。

在参考素材方面,Seedance 2.5单次最多可输入30张图片、10段视频和10段音频。用户还能利用时间戳规划某一秒发生的故事情节、动作与运镜,生成后也可定向修改指定片段中的角色、声音或剧情,无需重新生成整条视频。据Seed团队称,这一能力有助于减少反复生成的成本。

本次还重点介绍了白模、绿幕与视角编辑功能。用户可利用无纹理3D模型预先搭建空间结构、人物姿态、运动轨迹及镜头机位,再让模型按照这套结构生成画面;绿幕编辑则可在保留主体的前提下更换场景。
Seedance系列一直沿着时长、音画与控制能力不断迭代。2025年6月发布的1.0能在10秒内完成2到3次镜头切换;同年12月,1.5 Pro加入了原生音画联合生成;今年2月发布的2.0将单次多镜头音视频时长提升至15秒,并支持文字、图片、视频和音频作为参考。当时公开的参考上限为9张图片、3段视频和3段音频,而2.5进一步将三类素材合计上限提升至50项。
Seed团队在发布稿中表示,30秒时长与多轮延长功能有助于减少拆分镜头、反复拼接及处理衔接的成本。不过,他们也承认,Seedance 2.5在复杂运动的物理合理性以及多主体交互场景的稳定性方面仍有提升空间。
创作者实测:成片率、积分消耗与实际表现
在实际制作环节,创作者们更关注成片率与积分消耗。
AI电影创作者Jay Nwabueze测试一天后评价道:2.5生成的30秒片段衔接自然,人物与光照保持稳定,音频也减少了此前常见的音频伪影。他估计提示词遵循度约为90%,30秒片段约1分钟即可生成。不过,在他使用的Dreamina账户中,2.5生成15秒需要630积分,而2.0只需230积分。他最终采用的策略是先用2.0打草稿、确定方案,再将2.5用于关键镜头。

tarumasakti的12组同条件对比也指向类似选择:超过15秒的对话和完整脚本更适合2.5,而多数普通场景使用2.0已足够。对创作者而言,30秒减少了拆段和续接的工作量,但每次重抽的代价也随之增加。
同样是复杂动作,不同测试者得到的结果差异明显。RafaSimon用一个提示词生成了30秒、六个镜头的视频,其中包含摩托追逐、导弹爆炸、后空翻和召唤魔法,全程无需后期剪辑。他认为时间戳、人物与载具身份以及镜头切换均执行到位,后空翻也保留了重量感。
另一位创作者AlexIché得到的结果则不那么整齐。他在30秒提示词中加入了八个参考元素,成片并未全部捕捉到。尽管画面的分辨率、真实感和声音有所改善,但他提醒,时长变长后,若继续往提示词中塞入大量具体动作和元素,出错概率也会相应提高。

创作者“多肉”的《灯灭之前》同样保住了主要人物、道具和空间,却遗漏了“断电波追逐”,中间出现1.375秒纯黑片段,灯光也未沿原路径恢复。
音频与连续性:改善与不足并存
音频方面,不同测试者的感受也不尽相同。Larus Canus尝试使用深度视频、多视角人物图、九宫格素材、场景图及参考音乐,拼出了一段30秒的人物小传。他发现,动作、镜头和音乐能够沿同一条时间轴推进,镜头切换基本踩着背景音乐节奏。

另一位测试者“财经老王”认为,2.5的人物表演、台词节奏和情绪过渡比2.0自然,但方言处理反而退步,粤语的准确度和自然度仍不理想。
当片段从30秒继续延长至3分钟时,连续性问题开始更加明显。Christian Luoma仅用两张参考图和一段简单提示词,生成了3分钟、480p的视频,消耗约4100积分。他认为结果可用于构思场景和剪辑,但连续性和音频仍存在问题。
画质升级有多大?看法不一
画质本身是否明显提升,也有人持保留意见。Jason W使用同一条“炒锅广告”提示词进行测试,2.0一直将焦点放在炒锅上,而2.5却转向了米饭;他的另一组30秒720p测试消耗1440积分,两次结果均未达到预期。
Zentrix则发现,在相同提示词下,两代模型的光照、细节和整体观感十分接近,2.5更明显的变化仍是时长、控制和工作流程。

小结
总体来看,2.5的核心变化集中在时长与制作流程上:它减少了拆段和拼接的操作,也让时间戳、参考素材及音画关系更容易融入同一条时间轴。代价是每次重抽更加昂贵,复杂提示中的遗漏项会直接放大成本。
因此,多位关注成本的创作者已采用相似策略:先用2.0测试提示词、确定方案,再将2.5用于关键镜头。
