前有OpenAI发布GPT-4o,后有Google亮出Imagen3,如今腾讯也正式交出了自己的答卷:混元文生图大模型全面升级,并宣布开源。
这是目前业内首个中文原生的DiT架构开源模型,同时支持中英双语输入与理解。
说到DiT架构,简单理解就是,Stable Diffusion 3和Sora同样采用了这一架构。不过,Sora至今未对外开放,Stable Diffusion 3也没有像之前承诺的那样完全开源。相比之下,腾讯混元大模型此次是实打实地开源了。从这个角度看,腾讯混元团队的诚意确实十足。
注:这是官方公布的架构图,感兴趣的可以深入研究,具体原理不妨让Kimi或GPT-4帮忙解读,亲测可行。
那么,这个混元-DiT模型的实际表现究竟如何?咱们逐一来看。
1、支持中文提示词
正如前面提到的,混元-DiT原生支持中英文输入。这对国内用户来说是一个实实在在的利好,终于不用再经历“中文转英文再转图片”的繁琐过程了。
注:这是官方展示的几组效果图。
2、长文本理解能力
换句话说,它能够分析和理解长篇文本中的信息,并据此生成符合要求的艺术作品。以下是官方放出的效果图。
3、支持多轮对话
这意味着你可以通过多次对话逐步修改图片,直到达到满意的效果。毕竟,很多时候一次对话很难一步到位生成理想的图片。
那么问题来了:混元-DiT模型怎么才能上手体验?目前的情况是,并没有一个直接的在线体验入口。
虽然混元-DiT的官网上提到了“欢迎在腾讯混元助手中体验”,但实际登录进去后发现,里面的模型似乎并不是新开源的这一个(也可能是不在灰度范围内)。
第一个证据是,页脚标注的依然是基于腾讯混元大模型V1.7.6版本,而且消息中心里没有任何关于最新开源的通知。
第二,官方演示视频中展示的版本,其实已经更新到了2.0。
第三,靠直观感受来判断:在混元助手里面生成的图片,质量明显不如官网展示的效果,而且还需要依赖“生成一张图片”这类提示词来触发。
所以,如果真想体验,只能参照GitHub上的说明自行部署安装。恰好我的电脑配置能满足要求,后续会专门出一期部署教学。
最后,再来说说它与其他文生图模型的横向对比。以下是GitHub上放出的评测结果。
注:该评测由50余名专业评测人员共同完成。
总体来看,相较于其他开源模型,混元-DiT确实有所提升。不过,与一些闭源模型相比,仍然存在差距。希望开源的力量能推动它变得更好。
相关地址:
混元-DiT官网:https://dit.hunyuan.tencent.com/
混元-DiT Github地址:https://github.com/Tencent/HunyuanDiT
