游乐游手机版
首页/AI热点日报/热点详情

智谱开源GLM-4.5V国产AI性能强劲

类型:热点整理2026-07-21
智谱开源视觉模型GLM-4 5V,基于GLM-4 5-Air与GLM-4 1V-Thinking架构,参数106B,在42项评测中获41项第一。具备图像推理、视频理解、GUI任务、图表解析及物体定位能力,并同步开源桌面助手应用。

国产AI大模型公司智谱再次引爆行业关注。上个月开源的GLM-4.1V-Thinking刚拿下HuggingFace Trending第一,累计下载量超13万次;上周又发布了GLM-4.5和GLM-4.5-Air旗舰模型。现在,基于GLM-4.5-Air、沿用GLM-4.1V-Thinking架构训练出的视觉模型GLM-4.5V,直接开源,42项榜单中拿下41个第一。

国产 AI 智谱开源了 GLM-4.5V,杀疯了。

直接看效果

简单试了几个案例,提示词没有刻意调整,一次通过,效果相当惊艳。

① 猜一猜车型
上传一张车辆照片,让GLM-4.5V识别车牌和型号。模型的思考过程直击重点:首先注意到方向盘上的特斯拉标志,接着发现右上角有Model Y的品牌名称——即便存在镜像和角度问题,依然给出准确判断。

② 猜一猜地点
给定一张照片,其中「北京大学」四个字被刻意打码,让模型猜测。它根据建筑特征、装饰风格以及周围人群活动的密度,准确推断出这是北京大学西门。细节令人惊叹。

③ 提取图片内容,代码生成网站
读取图片中的Markdown格式内容,直接生成一个美观的个人说明前端HTML页面。

④ 提取图片中信息
上传身份证图片,模型自动提取结构化信息并转换为JSON格式。

⑤ 网站截屏复刻
上传一个网站首页的截屏,要求生成前端HTML页面代码,UI尽可能复刻。原图与生成结果对比,细节还原度极高。

⑥ 圈出图片中的物体
这个能力非常实用。上传一张图片,要求圈出帐篷和人,模型不仅输出两个帐篷和人的坐标,还生成一张带标注的图片。接着增加难度:要求圈出《清明上河图》中的轿子,同样精准完成。

项目简介

GLM-4.5V是全球100B级效果最佳的开源视觉推理模型,总参数106B,激活参数12B。已在GitHub与Hugging Face开源。真实场景下的表现与可用性同样出色,覆盖多场景视觉内容处理能力:

  • 图像推理:场景理解、复杂多图分析、位置识别
  • 视频理解:长视频分镜分析、事件识别
  • GUI任务:前端复刻、桌面操作辅助
  • 复杂图表与长文档解析
  • Grounding能力:精准定位视觉元素

为了让开发者快速体验,还同步开源了一个桌面助手应用,能够实时截屏、获取屏幕信息,基于GLM-4.5V的多模态能力让许多有意思的场景落地。

AI正在学会像人类一样,把看到的、听到的、读到的信息融合在一起理解世界,变得越来越“通感”。这种综合处理多种信息并思考的能力,是迈向真正“聪明”AI的关键,而多模态AI正是重要基石。这不仅是技术进步,更可能带来深远的文明影响。不妨亲自上手试试,看看能玩出什么新花样。

来源:https://www.53ai.com/news/OpenSourceLLM/2025081203246.html

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。