很多用户希望借助度加AI将若干张图片合成为带有配音的抖音图文视频,但在实际操作中经常遇到找不到入口、生成后语音卡顿、图片被自动裁切变形等问题。其实问题并不在于你,而是2026年7月最新版度加AI的图文视频生成逻辑发生了变化:它不再叫“图文成片”,而是隐藏在「智能创作」的二级菜单里,并且必须手动关闭“智能构图”才能保留原始图片比例。下面直接拆解完整操作流程。

打开度加AI并定位图文视频入口
访问度加AI官网(dujia.bytedance.com),使用抖音账号扫码登录。在首页顶部导航栏点击「智能创作」,在下拉菜单中找到并选择「图文转视频」。这一步千万注意不要误点「AI成片」或「脚本生成」——这两个入口走的是文生视频路线,会忽略你上传的图片。
上传图片与设置基础参数
点击「上传图片」区域,拖入3~12张JPG或PNG格式图片,每张大小不超过10MB。图片必须按播放顺序编号命名,例如01.jpg、02.jpg……否则系统会自动打乱顺序。勾选「保持原始比例」,然后关闭「智能构图」开关(该开关默认开启,不关闭的话人物头像容易被裁切)。接着设置视频时长:每张图片默认停留3秒,总时长等于图片数量×3,也可以手动微调任意一张图片的停留时间。
生成配音的两种方法
方法一:AI自动配音(推荐新手使用)
点击「添加配音」→ 选择「AI配音」→ 在音色列表中选取「温暖女声-03」或「沉稳男声-05」(2026年7月实测这两个音色的口型同步率最高)→ 点击「生成配音」,等待8~12秒即可完成。
方法二:自定义文案配音(适合有脚本需求的用户)
先点击「编辑文案」,为每张图片输入对应的旁白(例如第一张图填写“清晨六点,老城区的青石板路泛着微光”)。然后返回配音页面,选择同一音色,点击「按文案配音」——系统会严格按照你写的文字逐句合成,语速自动匹配字数。
注意:如果文案中包含方言词汇或专有名词,比如“厝边”“鲯鳅”,务必在文案后面加括号注音,否则AI可能读错。
导出前的关键校验步骤
第一步:预览全片,拖动时间轴检查每张图片是否完整显示、配音是否卡在画面切换点。
第二步:点击「字幕设置」,开启「自动识别配音生成字幕」,字体选择「思源黑体 Bold」,字号设为48,位置选「底部居中」。
第三步:点击「导出设置」,分辨率选「1080×1920」,帧率选「30fps」,码率选「8Mbps」,格式选「MP4」,最后点击「立即导出」。
