游乐游手机版
首页/AI热点日报/热点详情

英伟达GH200性能优化与GPT-4V算力加速多模态高性能计算探索未来

类型:热点整理2026-07-20
GPT-4V在多模态任务中表现突出,支持交错图像-文本输入、视觉指向提示及上下文少样本学习,能完成图像描述、场景文本识别、幽默理解等。其视觉语言能力与通用性为强大多模态系统奠定基础。多模态训练依赖CLIP等模型实现图文对齐,算力需求呈量级提升,英伟达GH200等芯片可支撑相关训练。

这两年,多模态大模型成了人工智能圈的绝对主角。它们通过融合视觉、语言等多种感知能力,硬是把大语言模型(LLM)的边界往外扩了一大圈。要说这个领域的风向标,GPT-4V的开放无疑是里程碑式的——它首次让语言模型真正“看见”了世界,也让我们对大型多模态模型(LMM)的潜力有了更直观的认识。

所以,这篇分析的核心,就是围绕GPT-4V能干什么来展开的。我们准备了不少测试样本,试图摸清它的能力底牌和通用性。

从测试结果来看,GPT-4V在处理交错的多模态输入方面表现得有点超出预期。更关键的是,它的通用性让它看起来已经具备了成为一个强大多模态智能系统的底子。比如,它不仅能理解用户在图片上手绘的标记,还能据此产生像“视觉指引”这种全新的人机交互方式。

接下来,我们不只聊GPT-4V的初步探索,还会深入聊聊多模态对算力到底意味着什么顺风车,顺带看看英伟达那张号称最强的AI芯片GH200究竟强在哪里,以及像蓝海大脑这类的大模型训练平台,又是如何接住这波红利的。

GPT-4V的初步探索

这次探索没有走传统严格的定量评测,而是采用了定性案例设计,通过一个个具体的案例来评估。之所以这么干,主要是希望为后续建立大型多模态模型的评估基准提供一些思路。考虑到不同的交互模式可能会影响效果,我们主要用零样本提示来测试,尽量减少对上下文示例的依赖,这样才能更清楚地看到GPT-4V独立处理复杂多模态输入的真实水平。

一、GPT-4V的输入模式

GPT-4V本质上是个文本输入的单模型语言系统,但它的独特之处在于可以接收图像-文本对作为输入。作为纯文本模型时,它的语言处理能力已经足够强悍。一旦接受单张图像-文本对的输入,它就能搞定各种视觉任务,像图像识别、目标定位、图像描述、视觉问答以及视觉对话等等。

真正让它在应用场景上拉开差距的,是它对交错图像-文本输入模式的支持。这种灵活的输入方式意味着它能处理更复杂的现实需求。比如,你可以丢给它几张收据图片,让它算个总税额;或者从多张图片里提取你要的查询信息。这种处理交错输入的能力也是少样本学习等技术的基础,很大程度上提升了GPT-4V的适用范围和灵活性。

GPT-4V支持使用多图像和交错图像-文本输入

二、GPT-4V的工作方式和提示技术

GPT-4V可以理解并遵循文本指令,生成所需的文本输出或学会完成一项新任务。红色表示信息较少的答案。

GPT-4V一个很明显的优势,在于它对自然语言指令的理解和遵循能力。你可以直接用自然语言给它规定输出格式,甚至可以通过包含中间步骤的复杂指令,让它去完成一些抽象推理题。这意味着,它天生就有适应未知应用场景的潜力。

1、视觉指向和视觉引用提示

人类交流中,“指点”是个基础动作。为了让机器也能用这种直观的方式交流,我们尝试了各种用“指点”来表示图像中兴趣区域的方法。手绘箭头、圆圈、方框……只要你能想到的标记方式都能用。

基于这种灵活性,我们提出了一种全新的提示方式——“视觉指代提示”。简单说,就是直接在输入图像的像素上做手脚,比如画个视觉指示器或手写场景文字,以此来指定目标。跟传统的文本提示完全不同,这种方式让交互变得更直观。比如,你可以让它基于你画出的那个对象生成一段描述,同时不影响它对整体场景的理解。

2、视觉+文本提示

视觉引用提示也可以跟其他图像-文本提示结合起来,形成一个更简洁好用的交互界面。可以说,GPT-4V的提示灵活性很强,尤其是在整合不同输入格式以及无缝混合指令这方面。这种像人类一样理解多模态指令的能力,赋予了它极强的泛化性和适应未知任务的本领。

它能处理图像、子图像、文本、场景文本、视觉指针等多种指令模态,这使得它的扩展能力和通用性又上了一个台阶。更有意思的是,它能把抽象的文本指令直接关联到视觉示例上,这比纯文本指令或传统的上下文少样本学习更贴近人类的学习方式。

约束提示以JSON格式返回。图像是样本的示例id。红色的突出显示错误的答案。

在大型语言模型(LLM)中,我们发现了一种新的上下文少样本学习能力,模型只需看几个格式相同的例子就能生成预期输出。这种能力在GPT-4V这样的多模态模型身上也出现了,只需要把查询输入格式化成图像-文本对。特别是在零射或一射指令不够用的时候,提供足够多的示例就显得格外关键。

举个例子,在一个读取仪表盘指针的复杂场景里,GPT-4V一开始自己搞不定,但在提供了2个上下文示例之后,它成功预测了正确读数。还有个多步推理的折线图案例,也是在额外示例的二射提示下,它才能得出正确结论。这些例子都证明,上下文少样本学习是提升LMM性能的一个可行方向,甚至可以作为微调方法的备选方案。

在读取速度计的挑战性场景下的零射击性能。GPT-4V即使采用不同的提示方式,也能够准确读取速度表并避免失败。红色表示错误的答案。

三、视觉语言能力

1、不同域的图像描述

GPT-4V在处理“图像-文字对”输入时,展现出的能力和泛化性相当扎实。要求它生成自然语言描述,它能覆盖的领域非常广:名人识别、地标识别、食物识别、医学图像理解、Logo识别、场景理解,甚至还能应对逆向示例的误导。

具体来看,在名人识别上,它能从不同背景里准确认出名人,还能理解场景信息,比如认出2023年G7峰会上哪位总统在演讲。地标识别方面,它不仅能准确说出地名,还能给你来段生动的叙述。食物识别上,面对各种菜品,它能捕捉到那些复杂细节。医学图像理解上,它甚至能识别X光片上的牙齿结构,并根据CT扫描判断潜在问题。Logo识别上,它能准确描述Logo的设计和含义。场景理解上,它可以描述道路场景中车辆的相对位置、颜色,并读取路标上的限速提示。最关键的是逆向示例,就算你给它一个带有误导性的问题,它也能坚守底线,正确描述图像内容,不上当。

名人识别和描述结果:GPT-4V可以识别各种名人描述视觉信息(包括他们的职业、行动、背景和事件)细节

2、对象定位、计数和密集字幕

GPT-4V在理解人与物体的空间关系上表现不赖,能分析图像中的相对位置。在物体计数上也能算清楚图像中苹果、橙子、人的个数。不过,当场景混乱或者物体被遮挡时,计数偶尔会翻车。

空间关系理解结果:GPT-4V能够识别图像中物体之间的空间关系

3、物体定位

物体定位是计算机视觉的老大难问题,GPT-4V在初步实验里,通过简单的文本提示生成边界框坐标来定位人物,在场景不那么复杂的条件下有一定效果。但在更复杂的场景(比如物体相互遮挡)中,它的局限性就暴露出来了,需要更进一步的提示技术才能提升性能。

4、密集字幕生成

密集字幕生成通常需要一个包含目标检测、人脸识别、字幕生成等多个模块的复杂系统。但GPT-4V仅靠文本提示就能搞定这项任务,成功定位并识别图像中的个体,还能给出简洁的描述,这确实体现了它作为统一模型的优势。

密集字幕的结果:成功为输入图像生成详细的说明

四、多模态知识和常识

GPT-4V在理解表情包和幽默方面让人眼前一亮。它能把文本和图像里的信息收集起来,搞明白笑点在哪。在科学知识推理任务上,它也能正确回答一大堆跨领域的问题。在多模态常识推理方面,它能利用图像中物体的边界框来识别动作,并推断场景中的细节。如果你给的提示够“刁钻”,它甚至能根据一些微妙的线索给出合理的假设。

笑话和模因理解的结果:GPT-4V展示了令人印象深刻的能力理解表情包中的幽默

五、场景文本、表格、图表和文档推理

GPT-4V在识别和解读图像中的场景文本上十分拿手,无论是手写体还是印刷体,它都能识别出来,并提取关键数学信息来解题。此外,对图表、流程图、坐标轴等细节都有不错的理解和推理能力,甚至能把流程图的详细信息转成Python代码。在平面图、海报、考卷等各种文档上,它也能给出合理的回答。当然,在一些极具挑战性的案例中,它偶尔也会遗漏一些微小的实现细节。

场景文本识别结果:GPT-4V可以识别许多具有挑战性的场景文本场景

六、多语言多模式理解

GPT-4V能用不同语言的文本提示来生成对应语言的图像描述。在多语言场景文字识别中,它能看懂不同场景里的文字,还能给你翻译过来。在多元文化理解测试中,它也表现出对文化细微差别的敏感度,能生成合理的多语言描述。

多语言图像描述的结果:GPT-4V能够根据图像生成不同语言的描述

七、与人类的互动视觉参考提示

在人机交互里,指向特定空间位置的能力太重要了。GPT-4V能很好地理解在图像上直接画的视觉指示。所以,人们提出了一种新的交互方法——“视觉引用提示”。核心思路就是直接在图像像素上画箭头、画圈或写文字,作为一种参考指令。

更妙的是,科学家们还探索了让GPT-4V生成这些视觉指针作为输出的方法。这些视觉指针既直观又人性化,成了人机交互的极佳渠道。GPT-4V不仅能识别不同类型的视觉标记,还能生成专注于特定区域的视觉描述。在传统视觉语言模型难以处理的挑战性问题面前,它更有优势。虽然它在空间判断上偶尔会有些不精确的小毛病,但如果图像上有清晰叠加的视觉指示,它还是比纯文本坐标更靠谱一些。

GPT-4V理解图像上的视觉指针

这种新出现的视觉参照提示,直接利用了在输入图像像素空间编辑的技巧,为人机交互增添了新的可能。比如,GPT-4V能自然地把箭头指向的对象和给定的对象索引关联起来;它能理解图像上手写的问题,并指向对应的边缘或角度;它能指向图中的任何一个区域。这种交互方式有望催生各种全新的应用案例。

而GPT-4V能自己生成这类指示输出,更进一步推动了人机交互的闭环。你可以让它以文本坐标的形式预测区域,然后生成视觉指示。在这个过程中,如果提示里包含一些例子来引导它理解坐标定义,它就能生成更准确的指示。这种反复的指示生成、理解和执行, 无疑会帮助它在各种复杂的视觉推理任务中表现得更好。

视觉参考提示直接编辑输入图像作为输入提示,如绘图视觉指针和场景文本。作为文本提示的补充,视觉引用提示提供了一个更微妙和自然的交互。例如,(1)将有指向的对象与索引相关联,(2)指向对图像进行质疑,(3)在文件和表格中突出线条,(4)绘制图案在图像上,以及许多其他新颖的用例。

八、情商测验

在人机交互中,光有智商还不够。“情商”同样重要。GPT-4V在这方面的表现也说明它开始理解和分享人类的情感了。根据人类情商测试的定义,检验它在三个方面能力:一是识别和解读面部表情里的情感;二是理解视觉内容如何引发情感;三是在期望的情感态度下,生成合适且富有同理心的文本输出。

GPT-4V了解不同的视觉内容如何激发人类的情感

这种“共情”能力有多重要?想象一下家用机器人,它们必须能预测什么样的视觉内容会唤起人类的哪种情绪,并做出恰当的反应。这在家用机器人等场景中尤其关键。

GPT-4V根据社会标准和规范来判断图像美学

除了理解情感,GPT-4V还能与人类的主观判断对齐,比如审美观点。经过测试,它能根据社会标准来判断一幅图像的美学价值。

GPT-4V能根据感知到的情绪,有效生成与所需情绪相匹配的适当文本输出。例如GPT-4V能根据提示描述右边的恐怖图像,使其更加可怕或令人安心。这展示了其在实现情绪感知人机交流方面的潜力。

多模态对算力影响的探讨

一、CLIP 打开图文对齐大门,或成为实现多模态的核心基础

目前实现视觉+语言多模态大模型的主流方法,基本思路是借助预训练好的大语言模型和图像编码器,用一个图文特征对齐模块把它们连起来。这样一来,语言模型就能理解图像特征并进行更深层的推理问答了。

虽然OpenAI还没公开GPT-4V的多模态实现细节,特别是视觉部分,但我们或许可以从它发布的CLIP以及后续衍生的BLIP、BLIP2等模型上,大致理解里面的门道。

1、CLIP 模型:实现了图像与文本的特征对齐

以往的计算机视觉系统大多被训练成图像分类模型,这在遇到没见过的类别时就抓瞎了。要想获得大量、广泛的弱监督训练数据,直接从原始文本中学习视觉表示显然更有前途。

OpenAI在2021年提出的CLIP模型就干了这件事。它采用图像-文本对比学习的预训练方法,在超大规模数据上学着把图像的视觉特征与匹配的文本关联起来。好处是,就算不微调,它也能直接用于下游视觉任务,效果还挺好。这算是突破了以往需要大量标注数据的瓶颈。

代表性视觉大模型发布时间

2、CLIP 的训练与零样本分类

CLIP的训练过程是这样的:它接受一系列图像-文本样本对,图像通过图像编码器提取特征,文本通过文本编码器提取语义特征。然后,模型会计算每一对匹配图像和文本之间的特征相似度,作为“正样本”;同时计算不匹配图像和文本之间的特征相似度,作为“负样本”。训练的目标,就是让所有正样本对的相似度最大,负样本对的相似度最小。

依靠这种预训练,CLIP模型在零样本图像分类中非常“省心”。你只需要给每个类别设计一个描述文本,比如“一张{label}的图片”,然后提取这些文本的特征。接着,输入你想分类的图片,提取它的图像特征,计算这个特征与所有类别文本特征的相似度,相似度最高的那个就是预测结果。

CLIP 训练方法

3、CLIP 最大的创新:超大规模数据集

CLIP的创新之处没那么玄,它没有提出全新的网络架构,而是用高效的图像-文本匹配模型在超大规模的数据集上硬训练出来的。在它之前,像COCO、VisualGenome这些主流视觉数据集,虽然人工标注质量很高,但规模太小,只有数百万级别。为了获得与GPT-2相当的训练数据量,OpenAI构建了包含40亿个数据点的WIT数据集,这才让CLIP模型的训练变得更充分有效。

4、训练成本:256张V100,训练12天

OpenAI训练了一系列CLIP模型,基于ResNet和Vision Transformer架构。最大的ViT模型用了256个英伟达V100 GPU,训练了12天。效果对比下来,ViT模型优于ResNet模型,而最终的最优模型是ViT-L/14@336px。相比以前的工作,CLIP在零样本分类上的表现提升到了一个新高度。

CLIP 与以往视觉分类模型效果比较

可以说,CLIP通过预训练图像-文本匹配,在视觉和语义特征之间架起了一座桥梁,使得多模态上下文中的推理成为可能。正是基于CLIP系列模型,像ChatGPT这样的大规模语言模型才终于长出了“眼睛”,获得了视觉理解的能力。CLIP为视觉语言的统一预训练奠定了基石,也是实现多模态ChatGPT的关键一步。

二、多模态应用空间广阔,算力需求或呈量级式提升

多模态模型的训练对算力的需求可不是小打小闹,而是**数量级的提升**,动辄需要数万张GPU卡。有报道称,与GPT-3.5相当的大规模语言模型Inflection在训练时用了约3500张英伟达H100 GPU。对于初创公司来说,训练大模型通常需要数千张H100,微调也得几十到几百张。更有消息显示,GPT-4可能在1万到2.5万张A100上训练,而GPT-5预计需要的H100数量可能会是2.5万到5万张,相比GPT-3.5的规模提升了大约10倍。

在推理阶段,情况同样如此。图像、视频和语音的数据量相比文本交互提升了数个量级,这直接导致算力需求的急剧膨胀。

1、文本:从搜索到邮件,主流软件已逐步开放

像Outlook和Gmail这些主流电子邮件服务商已经支持ChatGPT功能。比如,Outlook可以帮你自动生成不同需求的回复;Gmail用户也能靠ChatGPT来撰写完整的电子邮件。据统计,全球每天发送超过3300亿封电子邮件,其中Gmail和Outlook的市场占有率分别是27.2%和7.8%。如果只算非垃圾邮件,Outlook日均邮件数量约为137亿封,对应的数据量约25.52TB。假设ChatGPT在Outlook邮件场景中的使用率只有1%,每日需要处理的数据量就约261GB,这比当前问答场景提升了近8倍。

Outlook 利用 GPT 生成邮件

2、语音:Teams 与 OpenAI 结合,大幅提升线上会议效率

微软的Teams平台与OpenAI的结合,让线上会议的效率上了一个台阶。它支持自动生成会议纪要、对会议进行章节划分、智能时间标记等功能。用户每月支付10美元,就能用GPT-3.5获得这些服务。随着语音输入在Teams中的普及,新增的数据量需求也会显著提升。假设每天处理1小时的电话质量音频(8kHz采样、8bit量化),每天新增的数据量约为7.03KB。考虑到Teams日活跃用户早已过亿,如果所有用户都用1小时音频交互,每天新增的数据量需求约703GB,相比纯文本交互,数据量提升了约200倍。这些数据都表明,语音交互的引入会给AI系统带来数据量级的巨大提升。

通过实时翻译与字幕,减少会议期间的语言障碍

3、图片:Filmora 接入 OpenAI 服务,实现“文生图”及“图生图”

万兴科技旗下的视频制作软件Filmora已经集成了OpenAI的AI绘图能力。用户只需通过简单描绘,就能在几秒钟内获得AI生成的完整图像。从“文生图”到“图生图”,标志着创作工具与AI结合的新方向。按照Filmora的图片参数估算,其OpenAI生成图片每天的输出数据量约为586GB。以默认的1920*1080分辨率、每张图片约6MB计算,假设月活跃用户数为300万,每天调用10万次,数据量就相当可观。未来,AI生成图像的应用空间必将继续扩大。

Wondershare Filmora 一键“创作”图片

4、视频:AIGC 辅助生成动画,星辰大海拉开序幕

AIGC技术在商业动画片《犬与少年》中的应用,让人看到了视频生成的巨大潜力。这部作品由Netflix、小冰公司日本分部、WIT STUDIO共同创作。与此同时,Runway Gen-2模型也已开放公测。它只需要文字、图像或两者结合的描述,就能快速生成视频,是市场上首个公开可用的文本到视频模型。视频单秒输出数据量可达1MB,未来在影视剧集、宣传视频等领域,AIGC将显著提升视频创作效率。

《犬与少年》AI 参与制作

SDR 视频上 Youtube 的推荐比特率

总的来看,目前的ChatGPT和AIGC应用场景远未被完全挖掘。语音、图片、视频等多种形式的输入输出,将为内容创作领域带来革命性变化。更广泛的数据形态、更多的应用场景,无疑会增加对人工智能算力的需求,这很可能意味着算力的高速扩张时代已经到来。

OpenAI 大模型各类场景数据量测算

三、英伟达最强AI芯片GH200究竟强在哪里?

很多人以为GH200是一款全新的计算芯片,其实它和H100属于同一代产品,核心的AI计算架构和算力差不多。那它的优势在哪?答案很简单:内存。

GH200的内存容量比H100大了3.5倍。这对需要处理更复杂模型或海量数据的AI任务来说,优势是决定性的。它把Grace CPU和Hopper GPU通过高速NVLink-C2C互联在一起,带宽高达900GB/s。这意味着GPU可以直接访问CPU的全部内存。而在H100系统里,CPU和GPU通常通过PCIe连接,带宽只有128GB/s,不到GH200的七分之一。通过芯片级别的优化,GH200实现了高效得多的CPU-GPU内存共享,对于频繁需要数据交换的AI计算来说,体验好太多了。

每个GH200集成512GB CPU内存和96GB GPU HBM3内存。Hopper GPU通过NVLink-C2C访问Grace CPU全部内存。相比之下,单颗H100最多80GB HBM3内存,且无法高效连接CPU。基于GH200的DGX GH200集群,256个GPU连接后共享144TB内存(计算方式:(480GB+96GB)* 256)。DGX GH200适用于存在GPU内存瓶颈的AI和HPC应用。GH200通过超大内存和CPU-GPU互联,可以加速这些应用。

蓝海大脑大模型训练平台

面对越来越庞大的模型,算力平台也成了关键环节。蓝海大脑大模型训练平台的核心思路很明确:提供强大的算力支持,满足大模型训练中张量并行的通信需求。它支持高性能I/O扩展,并能扩展至万卡级别的AI集群,以应对流水线和数据并行的通信挑战。同时,它的液冷系统和智能电源管理技术也颇为亮眼,能主动监测硬件故障和异常电涌,通过自动降低系统功耗来保证安全。

一、为什么需要大模型?

1、模型效果更优:大模型在各场景上的效果普遍优于普通模型。

2、创造能力更强:大模型能进行AIGC内容生成,助力规模化内容生产。

3、灵活定制场景:通过举例子(少样本学习)的方式,就能定制大模型的海量应用场景。

4、标注数据更少:只需学习少量行业数据,大模型便能应对特定业务场景需求。

二、平台特点

1、异构计算资源调度:平台调度和管理包括CPU、GPU在内的多种异构计算资源,并通过强大的虚拟化管理轻松部署底层算力,充分发挥不同硬件加速能力,加快模型运行速度。

2、稳定可靠的数据存储:支持块、文件、对象等多种存储协议,通过存储资源池化实现数据自由流通,并采用多副本、多级故障域等机制保障数据安全。

3、高性能分布式网络:通过专门的网络和分布式转发机制,透传物理网络性能,显著提高模型训练和推理效率。

4、全方位安全保障:从模型仓库的权限管理,到数据存储的私有化部署和磁盘加密,再到模型运行过程的账号认证和审计,全方位守护安全。

三、常用配置

1、处理器CPU:包括了Intel Xeon和AMD EPYC系列的多款高性能处理器,如Intel Xeon Gold 8358P、Platinum 8350C、Platinum 8458P、Platinum 8468,以及AMD EPYC 7742、AMD EPYC 9654。

2、显卡GPU:支持NVIDIA L40S 48GB、NVLink-A100-SXM640GB、NVIDIA HGX A800 80GB、Tesla H800 80GB HBM2、A800-80GB-400Wx8等多种主流计算卡。

来源:https://m.elecfans.com/article/2273698.html

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。