智谱AI近日宣布重磅消息——正式开源其新一代视觉推理模型GLM-4.5V。根据官方数据,该模型在41项公开视觉多模态基准测试中,一举夺得同级别开源模型的SOTA(当前最佳技术)成绩。换言之,在开源阵营中,它已跻身最前沿。
该模型总参数量高达1,060亿,而激活参数仅120亿,属于典型的视觉-语言模型(VLM)。它基于智谱此前旗舰文本基座模型GLM-4.5-Air构建,并沿用了GLM-4.1V-Thinking的技术路线。模型采用MIT开源协议,这意味着商业应用几乎没有任何限制。

图:基准测试结果(来源:Hugging Face)
从技术架构来看,GLM-4.5V由视觉编码器、MLP适配器和语言解码器三部分组成。其亮点在于引入了三维旋转位置编码(3D-RoPE),使模型对多模态信息中的三维空间关系具备更强的感知与推理能力。同时,该模型支持64K tokens的多模态长上下文输入,并采用三维卷积提升视频处理效率。这意味着它不仅能处理图像,还能理解视频内容,即使面对高分辨率或极端宽高比的图像,处理也更稳定。

图:技术细节(来源:智谱)
为了将多模态能力推向极致,智谱在模型训练的每个阶段都进行了精心设计。在预训练阶段,大规模使用图文交错的多模态语料和长上下文内容,旨在强化模型对复杂图文及视频的基础理解。随后在监督微调(SFT)阶段,引入显式的“思维链”格式训练样本,提升因果推理与多模态理解的深度。最后在强化学习(RL)阶段,通过构建多领域奖励系统,结合可验证奖励强化学习(RLVR)和基于人类反馈的强化学习(RLHF),使模型在STEM问题、多模态定位及智能体任务等方面实现了全面优化。
在官方演示中,GLM-4.5V展现的视觉推理能力覆盖了多种应用场景。例如在图像推理层面,它能够进行复杂的场景理解和多图分析。模型可根据用户的自然语言提问,精准识别图像中的目标物体并输出坐标框。甚至在不依赖外部搜索工具的情况下,仅通过分析图像中的植被、气候痕迹、建筑风格等细节,就能推断出照片的拍摄地点及大致经纬度。
在一项与人类玩家的对比测试中,GLM-4.5V参与了“图寻游戏”全球积分赛,仅用16小时便击败了99%的人类玩家,7天后更是攀升至全球第66名。实测表明,该能力确实精准。
(来源:DeepTech)
不过,当换用一张北京某公园的照片进行测试时,模型猜错了——可能是因为类似场景太多,它也有些不知所措。
(来源:DeepTech)
在复杂文档理解方面,GLM-4.5V能够处理长达数十页、包含大量图表的复杂长文本。它采用类似人类的视觉方式逐页读取,实现文字与图像信息的同步理解,从而更准确地进行内容总结、翻译和图表信息提取。这有效避免了传统OCR加文本模型流程中常见的错误传递问题。
针对前端开发和用户界面交互任务,GLM-4.5V还提供了“前端复刻”功能。它可以分析网页截图甚至交互视频,并生成相应的结构化HTML、CSS和JavaScript代码,复刻网页的布局、样式乃至动态交互逻辑。
图:官方演示(来源:X)
在简单测试中,尝试复刻谷歌学术首页,整体UI效果还原度较高。不过,它忽略了演示视频中点击呼出侧边栏的交互功能,略有遗憾。
(来源:DeepTech)
此外,模型的GUI Agent能力使其能够识别和处理电子屏幕画面,执行对话问答、图标定位等任务。这为开发可辅助操作桌面环境的智能体应用奠定了坚实基础。智谱同时开源了一款桌面助手应用,可实时截屏、录屏获取屏幕信息,依托GLM-4.5V处理多种视觉推理任务,涵盖代码辅助、视频内容分析、游戏解答、文档解读等多类场景。
