想要生成连贯稳定的动漫视频,关键在于能不能把文字剧本中的画面提示,准确转译成模型能够识别和执行的“指令”。很多用户会直接把一整段长剧本丢进去,结果往往是:角色每一秒都像换了一张脸,关键道具突然消失,服装也无缘无故发生变化——这并不是模型能力不够,而是你的提示词结构,没有和它的生成机制对齐。

想解决这三个最常见、也最影响出片效果的问题——角色形象不稳定、动作衔接不流畅、画面提示经常被忽略——需要从三个层面系统优化。
锁定角色外观:从首帧定义到全局复用
首先,在角色第一次出场的句子里,就要用括号完整写清它的视觉特征。例如:“(林小雨,16岁,齐肩黑发,左耳戴银色星形耳钉,穿蓝白水手服,裙摆有浅灰波点)”。这段描述必须放进角色首次出现的同一句话中,不能拆成多行,也不能分散到前后句。
在这之后,所有涉及该角色的镜头提示,只需要保留名字加动作或表情即可,外貌信息不必反复重复。比如写“林小雨皱眉→伸手推眼镜→转身跑出教室”,而不要每次都写成“林小雨(黑发+耳钉+水手服)皱眉……”。
还有一个非常关键的步骤:导出分镜之前,一定要打开度加AI的“角色锚定”功能,并点击“提取首帧角色特征”。如果省略这一步,后续每一帧都可能被模型当作全新角色重新生成,那么前面做的角色设定基本都会失效。
控制画面提示不被吞掉:动词前置+权重锚点
很多画面信息之所以被模型忽略,核心原因往往是提示位置不合理。把核心画面元素放在句首,并紧跟在动词后面用括号补充说明,通常效果会更稳定。比如,错误写法是“教室窗外飘着樱花”,模型常常会忽略“窗外”这个关键空间位置;更合适的写法应该是“镜头拉远(窗外满树粉白樱花,花瓣正被风吹入窗内)”。
对于那些必须保留、不能丢失的重要物件,还需要增加权重标记。比如“书桌(:1.3)上摊开物理试卷(:1.5),红笔(:1.8)斜压在右下角”。这些数字代表生成时的优先级,但需要注意,数值超过1.8容易造成画面畸变,低于1.2则很可能被模型直接忽略。
另外,尽量不要堆叠过多抽象形容词,比如“温馨的”“朦胧的”“充满青春感的”。这类词对AI模型来说缺少明确的空间和视觉坐标,不如改成可以被直接定位的具体描述,例如“阳光从东南角窗户斜射进来,在课桌表面形成20cm宽光带”。
保持动作连贯性:用镜头链替代单帧提示
连续动作生成,是另一个非常容易翻车的环节。更正确的做法是,把连续动作拆分成最小、不可再分的动作单元,每个单元单独成句,并用→符号明确连接顺序。例如:“林小雨低头看手机(屏幕显示未读消息3条)→手指向上滑动→眉头突然舒展→抬头望向窗外→嘴角微扬”。
相邻两句之间,至少要保留一个不变的空间锚点。比如上一句提到“课桌左上角橡皮”,下一句就应延续这个位置关系,写成“橡皮旁手机屏幕亮起”,而不是直接跳转到“她站在天台边缘”。
如果涉及转场,必须显式写明过渡方式。比如“切镜:黑屏0.3秒→林小雨已站在校门口”,而不要模糊地写成“然后她到了校门口”。因为度加AI并不能准确理解这种隐含式的转场逻辑。
