游乐游手机版
首页/AI热点日报/热点详情

Stable Audio Open开源AI模型发布,48.6万训练样本生成47秒音效

类型:热点整理2026-07-21
StableAudioOpen开源模型基于48 6万个样本训练,采用transforms扩散模型,可生成长达47秒的鼓点、旋律及环境音效等短音频片段,但不适合生成完整歌曲或人声,与可生成3分钟完整音频的StableAudio2 0定位不同。

这款模型最多可生成 47 秒的音频片段,非常适合制作鼓点节奏、乐器旋律、环境音效以及拟声效果。在技术架构上,它基于 Transformers 扩散模型(DiT),在自动编码器的潜在空间中进行运算,从而有效保障了音频输出的质量与多样性。

目前该模型已开放源代码,感兴趣的用户可以直接前往 HuggingFace 平台体验。训练数据方面,据称使用了来自 FreeSound、Free Music Archive 等音乐库的超过 48.6 万个采样样本,数据规模相当可观。

需要注意的是,Stability AI 在官方说明中明确指出:“虽然它能生成短小的音乐片段,但不适合用于制作完整的歌曲、旋律或人声。” 换言之,它更适合作为素材片段来使用,而非创作一首完整的乐曲。

此外,有必要区分一下:Stable Audio Open 与之前发布的 Stable Audio 2.0 定位不同。前者是开源模型,专注于短音频片段和音效生成;后者则能够生成最长 3 分钟的完整音频,走的是另一条技术路线。

来源:https://www.1ai.net/12538.html

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。