只有已发布的克隆音色才能正常调用:请先在「我的音色」中确认状态为【已发布】;网页端可通过「智能配音」或「API调试页」直接使用;如需接入API,则要先获取密钥、构造JWT鉴权请求头,并正确填写 voice_name 等关键参数。

如果你想在讯飞智作中把刚刚克隆完成的专属音色真正投入使用,比如用于视频配音、有声书制作,或接入自动化业务流程,但一时找不到调用入口,或者不清楚 API 参数该如何填写,下面这份操作说明可以直接参考。
确认音色已训练完成并成功发布
登录讯飞智作官网后,进入「AI声音工厂」→点击「我的音色」,查看目标音色的当前状态。只有显示【已发布】的克隆音色才可以被调用;如果仍显示为灰色的“训练中”或“审核中”,则暂时无法用于语音合成。
如果音色长期停留在“待审核”状态,建议检查提交的录音样本是否触发内容安全规则。系统通常会自动拦截包含敏感词、方言混杂明显,或背景噪音较大的音频素材。
网页端直接调用生成语音
方法一:在「智能配音」工作台中调用
打开「智能配音」→粘贴需要合成的文本→点击「选择发音人」→在「我的音色」分类下找到你的克隆音色→点击启用→再点击「立即合成」。
注意:首次调用专属音色时,页面右上角通常会弹出「音色授权确认」提示层,必须勾选「同意将该音色用于本次合成任务」后才能继续;否则页面可能一直处于加载状态,无法完成生成。
方法二:通过「API调试页」快速验证音色调用是否正常
进入「开发者中心」→「API调试工具」→选择「TTS语音合成v3」接口→在 voice_name 参数中填写你音色的完整 ID(格式示例:iflytek_custom_20260815_xxxx)→输入测试文本→点击「发送请求」。
这一步通常非常适合做快速测试,按页面提示填写参数即可。返回结果一般为 base64 音频数据或可直接访问的音频 URL,拿到结果后就能立即播放,用于验证声音克隆的还原效果与可用性。
调用API集成到自有系统
第一步:获取接口凭证
在「开发者中心」→「应用管理」中创建新的应用,随后获取 APP_ID、API_KEY、SECRET_KEY 这三组调用密钥。
第二步:构造请求头
接口调用必须使用 HTTPS 协议,请在 Header 中携带 Authorization 字段,其值格式为 "Bearer " + 由 API_KEY 和 SECRET_KEY 签发的 JWT 令牌。该令牌有效期通常为 2 小时,过期后需要重新生成并签发。
第三步:提交语音合成请求
调用 POST /v3/tts 接口,Body 使用 JSON 格式。常用关键字段包括:text(UTF-8 编码纯文本,单次长度需≤300字)、voice_name(音色 ID,区分大小写)、sample_rate(建议设置为16000)、speed(取值范围为0.5至2.0)、volume(取值范围为0至100)。其中尤其需要注意,【voice_name必须与「我的音色」列表中显示的ID完全一致,复制时不要附带空格、换行或其他隐藏字符】。
第四步:处理接口响应结果
当接口成功返回时,code=0,data.audio 中会包含 base64 音频流;如果返回 code=10112,通常表示音色 ID 不存在,或该克隆音色尚未发布;若返回 code=10105,则说明 token 已失效。系统默认输出 MP3 格式音频,无需额外转码,就可以直接嵌入网页 audio 标签进行播放。
