最近在筹备短视频自动化流程时发现,配音这个环节虽然不复杂,但如果不提前规划好自动化配音方案,后面批量做获客视频的时候一定会拖慢整体进度。
你想啊,一条获客短视频,画面再精美,配音拉胯的话,观众三秒就划走了。声音虽然不是最重要的,但它绝对不能成为短板。
坦白讲,自己做视频时要么自己录旁白,NG 十几遍是常态,嗓子都录哑了。要么花钱请配音,一条视频报价两三百,批量做根本扛不住。录完还要剪辑对轨,一条两分钟的口播,光配音环节就得折腾大半天。
直到认真测了一圈 2026 年的 TTS 工具,这事才算真正打通。
用 TTS 做配音,痛点在哪
先说说为什么不用真人配音。
自己录,最大的问题是效率低。一条两分钟的口播,写稿半小时,录音半小时,中间 NG 七八次,最后剪辑还要对轨。一天录五条就已经是极限了。
请人录,贵。而且沟通成本高,你写的文案他不一定理解到位,语气、节奏、情绪都要反复调整。
批量做视频的时候,光配音这一个环节就能把整个流程拖慢好几天。
那 TTS 呢?说实话,几年前试过几次,效果确实不行。声音机械,没有感情,一听就是机器人。
拿来做获客视频,观众第一反应就是「又是 AI 念稿」,直接划走。
但 2026 年的 TTS,跟以前真的不一样了。
六款 TTS 工具的真实体感
前前后后测了六款主流的 TTS 工具,说个有意思的发现,选 TTS 最重要的根本不是音质。
edge-tts,微软出品,完全免费,不需要 API Key,装好之后一行命令就能出音频。
中文语音包做得挺扎实,日常旁白完全够用。其实吧,免费加命令行调用,对自动化来说简直是天菜。
Fish Audio 的中文语音质量是测下来最好的,还支持声音克隆,有自己的音频样本就能复刻。
它有 REST API,免费额度也够个人创作者用一阵子。
MiniMax TTS 也在用,中文效果不错,API 价格亲民。
它同样支持音色克隆,录一段真人音频就能生成自己的数字声音,做个人 IP 特别实用。
接入起来也挺顺畅,文档写得比较清楚。
CosyVoice 是阿里开源的,支持本地部署和声音克隆,Python SDK 写得还算清晰。
适合想在自己机器上跑的同学,不用担心数据外泄。
ElevenLabs 的英文语音质量确实碾压级别,但中文表现一般,而且价格不便宜。
如果你主做英文内容它是首选,中文场景就别硬上了。
火山引擎 TTS 是字节跳动家的,中文语音质量在线,企业级 API 稳定性好,适合有量级需求的团队。
怎么说呢,如果你做中文短视频获客,直接推荐 edge-tts 起步,零成本先跑通链路。
追求音质再上 Fish Audio 或者 MiniMax。
能用代码调用的工具才是生产力工具,只能手动操作的工具再好听也只是个玩具。
光说不练假把式,下面直接上手。
装好 edge-tts,零成本起步
首先你需要一个免费又好用的 TTS 引擎。edge-tts 零配置开箱即用,支持三百多种音色,中英文都覆盖到了。
打开终端跑一下安装命令。
pip install edge-tts
装好后直接用命令行测试一段文本转语音。
edge-tts --voice zh-CN-XiaoyiNeural --text "大家好,欢迎收看本期视频" --write-media test.mp3
跑完以后去当前目录找 test.mp3,双击播放能听到一段清晰的女声就对了。
听不到声音的话回头检查 pip 有没有装成功。
这里有个坑要注意。如果终端报「edge-tts 不是内部或外部命令」,说明 Python Scripts 目录没加到系统 PATH 里。
去环境变量设置里把 Scripts 路径加进去,加完记得重启终端再试。
edge-tts 提供好几种中文音色,平时常用下面这几个搭配。
# 活泼少女音,适合短视频解说
edge-tts --voice zh-CN-XiaoyiNeural --text "你的文案" --write-media output.mp3
# 温暖女声,适合教程旁白
edge-tts --voice zh-CN-XiaoxiaoNeural --text "你的文案" --write-media output.mp3
# 年轻男声,适合科技测评
edge-tts --voice zh-CN-YunxiNeural --text "你的文案" --write-media output.mp3
选一个你喜欢的音色先用着,后面随时能换。
想升级音质?Fish Audio 接进来
说实话 edge-tts 已经够用了,但你要是追求更好的音质,可以试试 Fish Audio。
这家支持声音克隆,效果比免费方案好一个档次。
先去 fish.audio 注册一个账号,在后台拿到你的 API Key。
然后跑一段 Python 代码来测试 API 调用。
import requests
headers = {"Authorization": "Bearer 你的API_KEY"}
data = {"text": "大家好,欢迎收看本期视频","reference_id": "默认音色ID","format": "mp3"}
resp = requests.post("https://api.fish.audio/v1/tts",headers=headers,json=data)
with open("fish_test.mp3", "wb") as f:
f.write(resp.content)
跑完打开 fish_test.mp3 听听效果,再跟刚才 edge-tts 的 test.mp3 对比一下。
Fish Audio 的声音更自然,气息感更明显。对音质有要求的朋友建议上这个方案。
Fish Audio 还有个杀手锏功能就是声音克隆。你录一段三十秒的真人音频上传到平台,它就能生成一个跟你声音几乎一模一样的数字分身。
以后写好的文案直接用自己的声音输出,连录音环节都省了。做个人 IP 的朋友这个功能真的值得研究一下。
要注意 API Key 千万别泄露出去,别把带 Key 的代码直接贴到公开仓库里。
用 WorkBuddy 一键调用 TTS
接下来是关键的一步。前面我们都是手动跑命令,现在要让 WorkBuddy 帮你一键完成配音。
在 WorkBuddy 里创建一个 Skill,让它读取文案文件后自动调用 edge-tts 生成音频。
打开 WorkBuddy 的 Skill 管理面板,新建一个 Skill,描述里写清楚输入和输出的约定。
## Skill 描述
读取指定的文案文件,调用edge-tts将文本转为mp3音频。
输入,文案文件路径
输出,同名mp3音频文件
## 执行步骤
1. 读取输入文件的全部文本
2. 调用edge-tts命令生成mp3
3. 输出文件路径供后续使用
Skill 保存后直接就能用,不需要重启 WorkBuddy。
跟 WorkBuddy 说「帮我读一下 script.txt 生成配音」,它自动就跑完了。
去输出目录确认 mp3 文件已经生成,点开听一下内容对不对。
这里有个真正需要注意的坑。Skill 里调用 edge-tts 的时候要用完整路径而不是直接写命令名。
Windows 上完整路径大概是这样的。
C:Users你的用户名AppDataRoamingPythonPython311Scriptsedge-tts.exe --voice zh-CN-XiaoyiNeural --text "文案内容" --write-media output.mp3
WorkBuddy 的运行环境和你终端的 PATH 不一样,直接写 edge-tts 大概率会报找不到命令。用完整路径就能解决。
FFmpeg 合成,一条命令出成片
说真的,有了音频文件以后,你需要把它和视频画面合到一起。FFmpeg 一条命令就能搞定。
ffmpeg -i video.mp4 -i audio.mp3 -c:v copy -c:a aac -ar 44100 -shortest output.mp4
这条命令保持视频画面不动,把音频替换成你的配音,输出到 output.mp4。
注意加了-ar 44100参数,这是因为 edge-tts 默认输出 24000Hz,但视频平台标准是 44100Hz,不匹配的话合成后声音会发闷。养成习惯每次都带上。
跑完打开 output.mp4 看一下,画面和声音都正常就大功告成了。
全链路跑通,一句话出片
整套流程跑通以后,你可以把全部环节串成一条流水线。
WorkBuddy 接收一句自然语言指令,自动生成文案,调用 TTS 生成配音,再用 FFmpeg 合成视频,最后输出成品。
# WorkBuddy全链路执行流程
# 1. 根据主题生成视频文案
# 2. 调用edge-tts生成配音mp3
# 3. 调用ffmpeg合成最终视频
# 4. 输出成品视频文件
这套工作流封装成了 WorkBuddy 的一个 Skill,每次丢一句话进去就能跑完整个流程。一句自然语言就能出片,这才是效率工具该有的样子。
搭好之前和搭好之后
搭好之前做一条带旁白的视频,要么自己录音反复 NG,要么花钱找配音等排期,前前后后折腾两个小时起步。碰到文案改几版的情况,一整天就耗在配音上了。
搭好以后呢?文案丢进去,命令一跑,五分钟搞定。而且文案随时能改,改完重新生成就行,配音质量不输付费服务。
你想想看,用这套流程做了二十多条短视频,每条省下来的时间够多写一篇稿子。
批量出片的时候更明显,十条视频的配音加起来不到半小时。
做内容做到最后,拼的不是单一环节的质量,而是整条流水线的效率。
写在最后
从 edge-tts 开始,零成本,装好就跑。配合 WorkBuddy,你的视频旁白环节可以直接从工作流里消失。
先跑通基础流程,确认整条链路没问题了再考虑升级音质。
TTS 的护城河不是声音有多像真人,而是它能不能无缝嵌入你的自动化流水线。
光配音这一个环节,就已经能帮你省掉大量时间和金钱了。
如果你也在做短视频获客,建议今天就把 edge-tts 装上试一下。
别等所有人都用上了你才动手,工具红利窗口期不会太长。
想,都是问题。干,就对了。
