字节这次又扔了个重磅冲击波。
在“豆博士”登顶国内月活最高AI助手、Seedance 2.0 拿下全球最强视频创作模型之后,豆包又端出了一款新模态模型——Seed Audio 1.0 音频创作模型。

先简单介绍一下这款模型。根据官方说法:
Seed Audio 1.0 面向完整声音场景,在统一框架下联合建模人声、音效和环境声等多种音频要素,端到端完成影视级音频创作。声音不再只是画面的补充,而是可以直接参与叙事,在听者脑海中直接形成画面,做到“听见”即“看见”。
说白了,就是它生成的音频,人声、音效和环境声能融合得更自然,画面感更强。
目前 Seed Audio 1.0 能输入3000字以内的提示词,生成的音频时长大约2分钟。如果文本较长,语速会相应加快。

它的核心能力主要体现在三个方面:
第一,一条prompt就能统一编排带有特定情绪的对话、音效和背景音,并且可以按时间线精准设定声音什么时候出现。对创作者来说,这意味着更大的创作空间和更精准的把控。

第二,支持参考音频输入。当需要更长时间、不同场景下的音频内容时,声音可以维持固定的音色。比如一段10分钟的音频,可能涉及5个场景、5种情绪,以前得分段生成再合成,现在Seed Audio能够保持前后音色统一,也支持同一音色自然呈现不同情绪、场景和表达方式——后期发挥空间大了不少。
第三,支持20多种语言。这对配音、播客等音频类工作非常友好。比如录制一段中文播客,就可以利用音频文件和对应的文本,生成多种语言的音频内容。对于内容出海、游戏本地化、品牌广告等企业,有多语言需求时,能低成本完成语言切换。
