近日,字节跳动正式发布了音频创作模型 Seed Audio1.0,标志着AI音频生成技术从单一语音合成阶段,进入完整声音场景创作的全新阶段。该模型现已上线火山方舟体验中心,面向广大创作者开放测试。
核心突破:从“拼接”到“端到端创作”
传统上,影视级音频内容生产需要依赖多个模型分别生成 人声、音效与环境声,再通过人工进行繁琐的拼接与混音,流程冗长且难以保证整体叙事的一致性。Seed Audio1.0的技术突破在于,它并非简单拼接素材,而是在统一框架下联合建模多种音频要素,端到端生成可用于叙事的“完整声音作品”。

功能亮点:从“会说”到“会创作”
- 统一框架建模:将人声、音效、环境声等要素融合于单一模型内,无需分步拼接。
- 端到端生成:输入文字描述或参考音频,即可直接输出完整的音频作品,确保叙事一致性。
- 降低制作门槛:创作者无需具备专业音频编辑技能,即可生成高质量影视级声音内容。
未来规划
团队计划进一步融合视频参考等多模态输入,并探索可控翻译技术,持续优化长音频与分轨生成能力,助力创作者将脑海中的声音构想高效转化为可聆听的作品。
体验与使用
Seed Audio1.0现已上线火山方舟体验中心,面向所有创作者开放测试。具体体验路径如下:
- 项目主页:https://seed.bytedance.com/seedaudio1_0
- 体验入口:火山方舟体验中心 → 登录 → 选择语音模型 → 语音合成 → Doubao → 音频生成 → 1.0
小提示
- 使用前,请确保已注册火山方舟账号并完成登录。
- 当前版本处于测试阶段,生成结果可能存在不确定性,建议多次尝试以获取最佳效果。
- 如需生成长音频,建议分场景输入,以便模型更好地捕捉叙事逻辑。
常见问题
- 问:Seed Audio1.0可以生成哪些类型的音频?
答:支持生成包含人声、音效、环境声在内的完整声音场景,适用于影视、游戏、短视频等各类创作场景。 - 问:是否需要专业音频知识才能使用?
答:不需要。模型设计为“一句话生成音频”,只需输入文字描述或参考音频,即可获得结果。 - 问:生成的音频可以商用吗?
答:目前处于测试阶段,具体商用授权请查阅火山方舟平台的使用条款。 - 问:未来是否支持分轨导出?
答:团队计划优化分轨生成能力,后续版本有望支持单独导出人声、音效、环境声等轨道。
