火山引擎提供开箱即用的音频处理能力,支持语音识别(ASR)、音频降噪与人声分离(MediaProcessing)、AI语音合成配音(TTS);使用前需先开通对应服务、获取 App Key/App Secret 及 Access Key,再通过 Python SDK 或 API 接口完成调用。

如果你想将一段录音自动转换成文字,或者进行人声提取、音频降噪、AI 配音生成,火山引擎都提供了现成可用的音频处理方案,无需自己搭建 FFmpeg 集群,也不用额外训练语音模型。
开通服务并获取凭证
登录火山引擎控制台后,在搜索栏输入“语音识别”或“语音合成”,进入对应产品页面,点击【立即开通】即可启用相关服务。
开通完成后,进入【API管理】→【创建应用】,填写应用名称(例如“短视频配音后台”),系统会自动生成 App Key 和 App Secret;【请务必及时复制并妥善保存 App Secret,页面关闭后将无法再次查看】。
随后在【密钥管理】中创建 Access Key,类型选择“程序调用”,生成后下载 CSV 文件——其中包含 ACCESS_KEY_ID 和 SECRET_ACCESS_KEY,这两项是后续调用各类音频 API 的核心身份凭证。
用Python调用语音识别(ASR)
方法一:同步识别(适用于 ≤60 秒的短音频)
安装 SDK:pip install volcengine。
初始化客户端并发起请求时,需要特别注意 AudioUrl 必须是公网可直接访问的 HTTPS 地址,不能使用本地文件路径,也不能填写内网地址:
```python from volcengine.volc import get_service # 创建语音识别服务实例 asr = get_service("asr", region="cn-beijing", access_key="AKLTxxx", secret_key="SKLTxxx") # 提交语音识别任务并获取结果 resp = asr.sync_submit_task(AudioUrl="https://example.com/audio.mp3", AudioFormat="mp3") print(resp["Result"]["Text"]) ```
方法二:异步识别(更推荐用于长音频识别或批量语音转文字任务)
先调用async_submit_task获取 TaskId,再通过get_task_result轮询识别结果;轮询间隔不能小于 2 秒,否则可能触发接口限流。
音频降噪与人声分离(使用MediaProcessing服务)
第一步:将原始音频上传到火山引擎对象存储(TOS)
在 TOS 控制台中新建 Bucket(例如“audio-raw”),把待处理的 wav/mp3 文件上传进去,设置为公共读权限后,即可获得类似https://audio-raw.tos-cn-beijing.volces.com/noisy_20260819.mp3这样的可访问 URL。
第二步:调用 MediaProcessing API 发起音频处理任务
请求 Body 中可指定降噪强度(0–100,默认 50)以及是否开启语音增强:
```json
{
"Input": {"ObjectKey": "noisy_20260819.mp3"},
"Output": {"Bucket": "audio-clean", "ObjectKey": "cleaned.mp3"},
"Template": {
"NoiseReduction": {"Enable": true, "Strength": 75},
"VoiceEnhancement": {"Enable": true}
}
}
```
第三步:监听回调通知或主动查询任务状态
任务处理成功后,清洗完成的音频文件会自动保存到你指定的 Output Bucket 中,既可以直接下载,也可以继续用于后续的人声处理或 AI 配音合成流程。
生成AI配音(TTS)并控制语速语调
① 进入火山引擎 TTS 控制台,确认相关服务已经成功开通,并且当前状态显示为“运行中”。
② 在【语音库管理】中选择适合业务场景的音色,例如“zh_female_yunxi”(女声·云溪)更适合知识分享类口播,“zh_male_zhixing”(男声·志行)则更适用于新闻播报场景。
③ 构造请求体时,以下关键参数需要完整传入:
"text":表示待合成的纯文本内容,这里不支持 HTML 标签;"voice_type":音色 ID 必须与控制台中的配置保持一致;"format":当前支持 mp3、wav、pcm 这几种音频格式;"speed":取值范围为 0.5 至 2.0,默认值是 1.0,若低于 0.7,语音效果通常更容易出现失真;"pitch":范围为 -5 到 5,用于调节基频,负值会让声音听起来更沉稳,正值则会让音色更明亮。
④ 向https://openspeech.bytedance.com/api/v1/tts发起 POST 请求,并在 Header 中携带Authorization: Bearer YOUR_API_TOKEN(该 Token 需要通过 App Key/App Secret 借助 STS 服务签发,不能直接填写 Secret)。
