这款模型最多可生成 47 秒的音频片段,非常适合制作鼓点节奏、乐器旋律、环境音效以及拟声效果。在技术架构上,它基于 Transformers 扩散模型(DiT),在自动编码器的潜在空间中进行运算,从而有效保障了音频输出的质量与多样性。
目前该模型已开放源代码,感兴趣的用户可以直接前往 HuggingFace 平台体验。训练数据方面,据称使用了来自 FreeSound、Free Music Archive 等音乐库的超过 48.6 万个采样样本,数据规模相当可观。
需要注意的是,Stability AI 在官方说明中明确指出:“虽然它能生成短小的音乐片段,但不适合用于制作完整的歌曲、旋律或人声。” 换言之,它更适合作为素材片段来使用,而非创作一首完整的乐曲。
此外,有必要区分一下:Stable Audio Open 与之前发布的 Stable Audio 2.0 定位不同。前者是开源模型,专注于短音频片段和音效生成;后者则能够生成最长 3 分钟的完整音频,走的是另一条技术路线。
