将DeepSeek生成的中文长文高效转化为可直接拍摄的短视频脚本,是AI短视频脚本生成中的关键环节。分镜描述绝不能依赖“大概意思”或“画面感强一点”这类模糊指令——否则它会输出“温馨的办公室场景”“主角若有所思”等剪辑师无法执行的无效内容。先来看几个核心判断原则。
先拆解长文结构,再锁定镜头触发点
第一步,需要将原文按信息颗粒度进行切分——注意,不是按段落切分,而是按“一个视觉动作可承载的信息量”来划分。举例来说,原文写道“他连续三年每天5点起床跑步,膝盖旧伤复发后仍坚持,直到在马拉松终点晕倒”,这句话不能直接当作口播使用,必须拆解为三个镜头:①闹钟特写显示5:00+窗外漆黑;②慢镜头中左膝缠着肌效贴、鞋底磨损特写;③冲线瞬间身体前倾、瞳孔失焦、计时器定格在3:42:18。如果不这样拆分,DeepSeek会将整段压缩成一句“他很拼”,完全失去分镜价值。
第二步,为每块信息标注【视觉锚点】——即原文中唯一能被镜头捕捉的具体物体。例如,“旧伤复发”不是锚点,“肌效贴边缘卷起”才是;“晕倒”不是锚点,“计时器屏幕反光映出他倒下的剪影”才是。DeepSeek只能识别看得见、拍得出的内容,抽象状态词必须转化为物理痕迹。
【关键前提】若不提供至少3个视觉锚点,DeepSeek会自动用“人物表情+背景虚化”填充,生成的结果90%以上无法实拍。
分镜描述必须含四要素,缺一不可
方法一:硬编码字段法(适用于API调用或批量生成)
输入指令时直接规定输出格式:“仅输出四列:【画面主体】|【构图与运镜】|【动作状态】|【精确时长(秒)】,用竖线|分隔,禁止换行”。
示例原文句:“她撕掉辞职信,转身把咖啡泼在老板桌上。”
合格输出:
【手部俯拍:左手捏着A4纸一角】|【微距+轻微晃动模拟呼吸感】|【纸张正被指腹横向撕裂,纤维翘起】|【1.3】
【桌面仰角:马克杯沿离桌沿2cm】|【镜头急速下移+焦点从杯身滑至液体飞溅轨迹】|【褐色液体呈抛物线泼向黑色西装袖口】|【0.9】
方法二:动作拆解法(适合Chat界面单次精修)
① 将“撕掉辞职信”拆解为两个独立动作单元:手指发力→纸张形变→碎片飘落;
② 每个单元单独输入DeepSeek,指令写作:“请为‘纸张正被指腹横向撕裂,纤维翘起’生成分镜描述,要求包含具体主体(不是‘手’,而是‘右手食指指甲盖泛白’)、构图(微距俯拍)、动作状态(指关节角度约110°)、时长(1.3秒)”;
③ 收到结果后立即检查是否出现“坚定”“愤怒”等情绪形容词——如有则删除,补充指令:“所有描述必须可被摄影机记录,删除主观判断词”。
规避三个高频废稿陷阱
陷阱一:以“展示”“体现”“象征”开头。DeepSeek识别到“展示奋斗精神”就会输出空镜头扫过奖状墙,而实际你需要的是“特写:第三张奖状玻璃罩内侧有指纹印,旁边放着半包止痛药”。遇到这种情况,立即追加指令:“删除所有动词‘展示/体现/象征’,改用‘拍摄……’开头”。
陷阱二:时长写成“约2秒”或“短暂”。CapCut导入时会报错,剪辑师无法精确拉时间轴。必须写“2.0”或“1.5”,小数点后一位不可省略。
陷阱三:主体模糊。例如“产品特写”需改为“小米扩展坞正面USB-A口金属触点,表面有细微划痕反光”。【注意】DeepSeek对“正面”“侧面”“俯视”的理解不稳定,必须写“镜头垂直向下,传感器中心对准接口十字纹路”才可靠。
