多模态大模型赛道再添一位重量级选手。
近日,华中科技大学与金山软件联合发布的 Monkey 模型引发了业界广泛关注。它并没有走“从零开始预训练”的传统路线,而是基于现有视觉编辑器进行高效扩展,通过提升输入分辨率,并引入一套多级描述生成机制,显著增强了模型对复杂场景和细粒度视觉细节的理解能力。简单来说,就是让AI不仅“看得见”,更能“看得清、看得准、看得懂”。

开源地址: https://github.com/Yuliang-Liu/Monkey
论文地址: https://arxiv.org/abs/2311.06607v1
这款多模态大模型的突出优势,首先体现在它的“训练配方”上。研究团队并没有简单依赖海量数据堆叠,而是精心构建了数十万条高质量图像描述数据。具体做法是,借助多个不同模型自动生成文本描述,再对这些结果进行融合优化——这有点像让多位风格各异的画师分别为同一幅作品撰写注解,最后整合出一份更全面、更精准、更细致的说明。正是这种高质量数据合成方式,为Monkey奠定了扎实的视觉感知基础。
在模型架构选择上,研究人员同样下了不少功夫:视觉编码器采用了20亿参数的ViT-BigHuge,语言解码器则使用开源模型Qwen-VL。更关键的是,整个方案有效避开了重复预训练带来的高成本和低效率问题,大幅提升了研发效率。为了让模型兼顾全局理解与细节识别,训练流程被划分为三个核心阶段:多级描述生成(由粗到细逐步理解)、高分辨率编码(尽可能保留每一处关键视觉信息)、多任务训练(覆盖图像字幕、视觉问答等多类任务)。
从实际评测结果来看,Monkey的表现相当亮眼。在16个不同数据集上——涵盖图像字幕生成、通用视觉问答、文档导向问答等任务——该模型都取得了非常出色的成绩。尤其是在通用视觉问答领域,Monkey在多个基准数据集上展现出明显优势。而在TextCaps数据集上,它对图像中文字内容的识别与理解能力进一步证明,这不仅是一款会“看图”的模型,也是一款具备较强“读字”能力的多模态模型。在文档导向问答方面,它在多个文档图像理解数据集上的表现同样可圈可点。
研究团队表示,Monkey未来的应用前景远不止当前这些测试场景。在医学影像分析、遥感卫星图像解译等专业领域,这一模型同样具备广阔的落地潜力。下一阶段,团队将继续围绕模型的感知能力、联想能力、推理能力以及泛化能力展开优化——也就是说,让这只“猴子”变得更加智能、更加稳定、也更加值得信赖。
总体来看,Monkey的技术路线非常清晰:无需从零开始投入大量资源进行预训练,而是通过提升输入分辨率、结合多级描述生成机制,精准解决复杂场景理解与视觉细节处理难题。在多项多模态任务中,它已经展现出强大的细粒度视觉感知能力和复杂场景理解能力,作为一款开源多模态大模型,未来发展值得持续关注。
