上上周一的晚上,智谱毫无预兆地开源了GLM-4.5——这款模型一经发布,就被业界视为当时最强的开源大模型之一。紧接着,这一周的周一,他们再次重磅出击,开源了多模态版本的GLM-4.5V,再次引发广泛关注。
作为4.5系列的延续,GLM-4.5V沿用了GLM-4.1V-Thinking的技术路线,通过对GLM-4.5-Air进行重新训练,成功赋予了模型强大的视觉多模态理解能力。
在模型规模上,GLM-4.5V总参数量达到106B,激活参数为12B——这一体量在开源多模态模型中已属大规模级别,具备较强的竞争力。
在能力表现上,GLM-4.5V同样底气十足:在全部42个评测基准中,它拿下了41个SOTA(最先进水平),覆盖范围之全面,令人印象深刻。这份评测列表所展现出的广度,已经很久没有在开源模型中看到了。智谱这一波操作,显然信心满满。
目前,该模型已在多个平台开源,用户可直接下载权重文件。不过,106B的参数量级对消费级硬件部署仍有一定挑战。如果你想快速体验,可以前往智谱的z.ai网站直接试用——网址就是z.ai。
我们第一时间对GLM-4.5V进行了测试。首先使用的是由专业评测团队拓界AI开发的一套多模态测试题。
第一道题:游标卡尺读数。这类题目读取起来相当费劲,需要将整数和小数分开读取,还必须非常仔细。看到图片时,确实让人有些懵。但GLM-4.5V仅用极短时间就给出了正确答案,思考过程简洁明了,毫无冗余,响应速度极快——这一点非常值得称赞。
第二题:小猫摸球问题。图片布局复杂,问题要求判断谁摸到了毛线球。GLM-4.5V不仅准确找到了正确答案,还附带了详细的操作方法。我们特意验证了两次,结果完全正确,没有任何问题。
在视觉推理能力上,GLM-4.5V确实表现出色,而且处理速度令人惊讶。
接下来,我们测试了一个经典的地理位置识别案例:横店明清宫苑的图片。目的是检验模型能否准确分辨这一地点。这个测试颇具挑战性,因为横店的明清宫苑是按照故宫1:1比例复制的,细节高度还原。如果模型仅依赖简单的建筑风格识别,很容易判断失误。GPT-5-Thinking在深度思考后,给出了一个相当抽象的答案——“华清宫”。而GLM-4.5V则准确回答:横店的明清宫苑。这个结果令人惊艳,并非因为结论本身,而是因为它能够在如此相似的环境中做出精准判断——这表明模型并非简单的模式匹配,而是真正具备了一定的视觉推理能力。
当我们追问为什么是横店而非故宫时,模型给出了三个详细且有理有据的要点,逻辑清晰。
随后,我们测试了内景。找了一张宫殿内部图片,询问模型是哪里。这次,GLM-4.5V未能正确回答,追问后依然坚持是故宫。说实话,就连我们自己看着这张内景图都有些拿不准——横店的复制度确实很高,内景装饰、色彩、布局都做到了高度还原。GPT-5-Thinking同样判断错误,甚至目前视觉推理能力最强的o3也出现了失误。横店做得太像了,这确实是一个难以解决的难题。
在这种情况下,模型出错也情有可原。
此外,GLM-4.5V还具备一个非常酷的功能:原生视频理解。目前,只有Gemini拥有类似能力。这里需要特别说明:很多产品声称自己具备视频理解或视频总结能力,但实际上并非如此——它们大多是将视频中的音频提取出来,找到人声部分,然后通过STT转成文字稿,再交由大模型进行总结,并非基于模型自身的原生视频理解。
我们给GLM-4.5V发送了一段二十世纪影业官方25周年《泰坦尼克号》的混剪视频,要求模型分析其中包含哪些经典画面。视频理解一直是多模态模型的难点,需要处理时间序列、画面转换、场景连贯性等问题,对模型能力和算力的要求呈几何级增长。GLM-4.5V思考了一会儿,给出了一个非常全面的回答。我们特意回到视频中核对对应的时间点——所有时间点一一对应,完全正确。展开思考过程后,可以看到模型确实理解了画面之间的逻辑关系和故事脉络,并非简单的逐帧识别,而是将场景串联成一个完整的叙事序列:从船头的浪漫时刻,到灾难降临后的生离死别,再到最后的救援场面。它不仅识别出关键画面,还能准确标注时间点。这种时空理解能力,在开源模型中确实非常罕见。
当然,视频理解功能也存在一定限制:只能处理200M以内的视频文件,超过此大小则无法处理。不过,对于大多数应用场景来说,这个限制还算合理。另外,请注意仅支持MP4格式,请不要上传MOV等其他格式。
我们还测试了视觉定位功能。上传了一张《流浪地球3》开机大合照的照片,要求模型框选出郭帆导演——模型框选得非常准确。找出烧烤签子也不在话下,标记精准。甚至还有一个更有趣的测试:要求圈出他最擅长的运动——结果果然是篮球。GLM-4.5V实在是太懂了。
除了视觉定位,还有一个非常有意思的功能:网页复刻。将一张网页截图直接交给模型,让它复刻出对应的代码。结果确实令人震撼——框架、结构几乎一模一样,仅存在一些设计样式上的细微差别。说实话,感觉比智谱自己的官网还要好看。这种看图写代码的能力,以前基本是Gemini、Claude这些顶级闭源模型的专利。如今,开源模型也能达到如此水平,是一个巨大的进步。
而且,该模型完全开源,用户可以下载权重并部署在自己的服务器上。API定价也相当良心:输入2元/M tokens,输出6元/M tokens,在多模态模型中属于非常便宜的价位。
最后总结一下。曾经的国产之光,智谱似乎正在强势回归。连续开源GLM-4.5和GLM-4.5V,效果都相当强劲。回想上周OpenAI开源了一些内容,以及GPT-5的一系列操作——他们像是守着巨大城堡的国王,偶尔大发慈悲扔出一些金币,希望平民们感恩戴德地冲上去疯抢。而国内这些大模型厂商,更像热衷于基建的狂人,不屑于守着城堡,每天都在家门口修路、建桥、盖发电站,然后把钥匙直接塞到用户手上说:随便用,兄弟,不够再跟我说。
所以说,智谱这波操作值得称赞的,不仅仅是它在41个基准测试中取得的SOTA。更值得称赞的,是这种持续不断、近乎偏执的开放精神。海外Close AI,国内天天Open AI。AI的未来,不应该只掌握在少数几个巨头的服务器里——从GPT-4o下线引发的风波就能看出影响。它更应该,也必须,绽放在每一个人的硬盘上。
