腾讯近日正式将混元文生图大模型开源,并同步推出了业界首个中英双语DiT架构。目前该模型已在Hugging Face和GitHub平台上线,包括模型权重、推理代码及完整算法在内的全套资源均已开放,企业和个人开发者均可免费商用。

▲ 混元文生图生成效果展示
升级后的版本采用了与Sora相同的DiT架构,但腾讯强调这是行业内首个中英双语DiT架构。混元DiT本质上是一个基于扩散Transformer的文本到图像生成模型,其核心优势在于对中英文语义的细粒度理解能力——不仅能够精准解析用户输入,还支持多轮对话交互,能够根据对话上下文动态调整并优化图像生成结果。这也是行业内首个中文原生的DiT架构文生图开源模型,参数量达15亿,全面支持中英文双语输入与语义理解。

想要运行这个模型?你需要一块支持CUDA的英伟达GPU。单独运行混元DiT时,最低显存要求为11GB;若同时运行DialogGen(腾讯推出的文本转图像多模态交互式对话系统)与混元DiT,则至少需要32GB显存。腾讯表示已在Linux系统上对V100和A100 GPU完成了兼容性测试与验证。

▲ 硬件配置要求说明
此外,值得关注的是,在国内首个官方“大模型标准符合性评测”结果中,腾讯混元大模型已首批通过,同期通过的还有阿里通义千问、360智脑和百度文心一言。这一结果也从侧面印证,混元在技术合规性与成熟度方面已跻身行业第一梯队。
