游乐游手机版
首页/AI热点日报/热点详情

多模态大模型引领未来人机交互新趋势

类型:热点整理2026-07-20
目前市面上的交互产品,主流还是单模交互,尤其是语音交互。如果我说,现在的车载语音助手多少有点“智商欠费”,你大概不会反对吧? 语音类产品,最常见的就是语音助手。比起按键操作,语音确实便捷不少——特别是在开车的时候,动动嘴就能搞定,能减少驾驶员分神,提升安全性。 长城汽车多模态技术负责人林俊分享了一个

目前市面上的交互产品,主流还是单模交互,尤其是语音交互。如果我说,现在的车载语音助手多少有点“智商欠费”,你大概不会反对吧?

语音类产品,最常见的就是语音助手。比起按键操作,语音确实便捷不少——特别是在开车的时候,动动嘴就能搞定,能减少驾驶员分神,提升安全性。

长城汽车多模态技术负责人林俊分享了一个典型场景:

在交互类功能里,目前真正大规模上车的还是语音。比如主驾说“帮我打开座椅加热”,副驾跟着说“我也要”,车机就会同时把主驾和副驾的座椅加热都打开。这种“复制”指令的能力,是按键操作无论如何也做不到的。

至于视觉类产品,主要包括DMS(驾驶员监控系统)、HUD(抬头显示)等。

随着汽车智能化程度越来越高,座舱里的功能也越来越多,用户对交互便捷性的期望水涨船高。但坦白讲,现在的汽车离“便捷的人机交互空间”还有不小的距离。

原因主要有两方面。

首先,各个模态技术本身仍有局限,在某些场景下并不能提供理想的体验。

其次,车内虽然集成了手势识别、眼动追踪、语音识别等五花八门的功能,但它们大多是“各干各的”,各传感器接收到的信息很难被统一整合。用户实际用起来,体验难免有些“差强人意”。

具体来说,问题集中在以下五个方面:

01 语音识别在噪声环境下精度堪忧

语音理解本身并不算太大的难题。可一旦环境嘈杂,系统就很难把噪音和人声干净地分开,识别结果自然就不太靠谱了。

02 语音助手难以支撑多轮对话

目前语音识别技术还不够成熟。尤其在多轮对话场景中,由于缺乏对上下文的联合解读,语音助手常常显得不够“聪明”,对话一绕就懵了。

03 语音助手与车机应用尚未打通

语音模型和车机里的App基本上是“各玩各的”——语音助手不知道车机上装了哪些应用,也不知道屏幕上正显示什么内容。这种“孤立”状态,让它的表现大打折扣。

拿天猫精灵来对比就很明显。在家居场景里,天猫精灵的表现远比在车上好,核心原因是它与需要互动的设备(窗帘、灯光等)交互链路短且确定。一句“打开灯光”下去,执行起来很顺畅。

但在车端,导航地点和基于位置的服务信息普遍没有打通。语音助手无法判断当前应该调用地图导航、其他应用,还是空调座椅等设置信息。用户一用之下,自然就会觉得这语音助手有点“弱智”。

04 视觉在某些场景下精度不够

简单的人脸识别系统做起来并不难,但想把精度拉到很高,那是另一回事。人脸角度只要偏转几十度,系统有时就会认错。

有业内人士就吐槽过:“现在车上DMS的提醒有时很让人懵——我头确实偏向一侧时它不提醒,正常开车时它反而弹出来了。”

更极端的例子:前阵子还有位驾驶员因为眼睛小,被车上的DMS系统判定为“在睡觉”,引发了圈内热议。

05 视觉尚难准确判断用户行为

当前的视觉识别技术,还很难准确区分用户是在打电话还是在抽烟,这类行为判断的精度还有待提升。

一 多模融合:单模态痛点的解法

1. 多模融合是什么

要提升用户体验,除了优化每个模态的识别能力,另一种思路是把不同模态的信息整合起来——这就是多模融合技术,目的是给用户更好的体验。

2. 多模融合怎么用

通过和行业专家的交流,目前车端落地的多模融合技术主要应用于两个方面。

2.1 限定语音交互的区域和范围

第一类是通过热区来限定语音交互的范围。现在的座舱大致分为十几个热区,包括中控、仪表盘、左右车窗、后视镜、前挡风玻璃、HUD等。划分好热区后,工程师就能把语音指令精准定位到对应的区域。

换句话说,用户发出语音指令后,后台能比较精确地知道需要调用哪个区域的传感器或执行器。比如驾驶员说“打开车窗”,系统自动打开左侧的车窗,不用特意强调“打开左车窗”。

2.2 让信号输入更精准

第二类是用视觉信息叠加到语音上,来提升信号输入精度。比如用视觉感知(包括唇语识别、唇动识别、手势识别等)作为语音的补充,当车内环境嘈杂时,系统也能较好地识别用户意图。

车窗开着或者别的因素导致车内噪音很大时,语音交互的识别精度会直线下降,召回率(用户说话时语音助手应答的概率)也会变得很低。

传统应对嘈杂环境的方式主要是做信号过滤。现在可以用视觉信息辅助:摄像头捕捉车内用户的唇语信息,系统就能在嘈杂环境中更准确地判断用户说了什么。

更进一步,当车里多人同时讲话时——比如主驾和副驾都在说——结合各自的唇语信息,系统就能把两人的语音分离开,分别判断他们在说什么。

商汤绝影智能车舱产品高级总监李轲提到:

开窗驾驶时,语音助手的召回率会受到很大影响。如果只靠语音单模态,人机交互会面临很大困难。商汤的视觉模型能够分析座舱内的视觉信息——包括驾驶员的眼部动作、面部朝向、唇动、唇语等。把这些视觉信息和语音信息融合,在背景噪音大的情况下,召回率能大幅提高,用户体验随之明显提升。

二 已落地的多模态融合技术

目前量产车上落地的多模态融合技术,主要是两类:结果层面的融合(后融合)和特征层面的融合(前融合)。

1. 后融合

1.1 后融合是什么

结果层面的融合,是指主机厂拿到不同模态信息的处理结果之后——包括视觉算法的结果、语音算法的结果等——在逻辑层面对这些结果进行组合。

目前行业的常见景象是:各个模块通常由不同供应商分别研发,然后把识别结果交给主机厂。比如主机厂把语音识别委托给专攻语音的供应商,把图像识别交给擅长视觉的供应商。

通常来说,一家供应商只专精一个方向,很少有同时擅长语音和计算机视觉的。主机厂从不同供应商那里拿到的都是处理后的结果,而非原始特征。因此,市面上多模态融合方案多采用后融合。

一位行业专家坦言:

如果主机厂真能把不同供应商处理后的传感器信息处理好——也就是做好后融合——已经是很大的进步了。但遗憾的是,目前后融合本身都没做好。有的主机厂还担心,就算做好了,用户也感受不到和没做的区别;既然带不动销量,那投入产出比就不划算。

1.2 后融合的局限

1.2.1 结果高度依赖单车调优

后融合非常依赖单车调优。同一套语音识别算法,换到不同型号的手机上可能照样用,不需要分别调优。但在车上,车的空间大小、造型设计等因素都会影响语音算法的效果,所以算法必须针对不同车型分别调优,工作量自然就上去了。视觉算法也是同理。

1.2.2 对不同模态识别结果的一致性要求高

想要后融合效果好,每个单模识别本身都得有足够精度。

有业内专家直言:首先要保证单模是非常精准的,只有单模精度达标、用户觉得好用,我们才能谈多模融合。

但在实际操作中,视觉算法公司和语音算法公司各自都有侧重点,不一定完全按主机厂的意愿来调整。如果视觉算法的供应商把结果优化得很好,但语音算法的供应商做得不够,整体效果也好不到哪去。反过来也一样。

另一位业内专家补充:

最终要做出体验非常好的产品,还是需要全栈能力。而且最好能通过端侧解决,因为端相对云来说延时更低,信息处理效率更高。

但全栈能力需要巨大的投入。如果公司体量不够大,根本无力投那么多资源。而且按目前的市场情况,这种投入未必能快速见效,对许多公司来说,账是算不过来的。

1.2.3 信息容易丢失

后融合会丢失信息,很难把不同模态的信息有效叠加,在处理过程中已经丢掉了大量原始信息。

2. 前融合

2.1 前融合是什么

特征层面的融合,是指供应商先将不同模态信息的特征提取出来,然后用同一个模型训练,最终交付给主机厂的是已经融合了多模态信息的结果。

相比后融合,前融合由于融合阶段更早,天然有优势。

一方面,用同一个模型训练,可以规避不同供应商能力或优化意愿不一致的问题。

另一方面,训练时包含了不同模态的特征信息,信息利用程度相对后融合更高。

因此,前融合方式的性能一般优于后融合——用一个模型处理语音和视觉信息,融合程度更深,最终效果更好。

2.2 前融合的局限

2.2.1 电子电气架构不一定适配

科大讯飞汽车智能交互总监章伟提到:

在多模信号关联度高、输出精度要求高、信号同步要求高的情况下,电子电气架构需要做调整来保障信号同步。

2.2.2 芯片适配和算法优化工作量巨大

产品需要能在不同芯片平台上运行——高通、英伟达、TI等。为这些不同芯片做适配,工作量相当惊人。

据了解,商汤绝影有一个大几十人的团队,专门负责不同架构芯片与特定企业的适配,同时还要降低资源占用。为什么?因为车企现在功能越来越多,除了DMS这类视觉识别系统,还有音乐、地图,仪表也越来越丰富。车企自然希望每家供应商的资源占用率越低越好。

这就意味着,光适配还不够,还要不断压缩资源消耗。以前处理不同模态信息可能占芯片算力的10%,现在得降到5%。

资源占用的优化主要从两方面入手:一是优化模型本身,降低对算力和存储空间的需求;二是针对芯片底层的指令集进行优化。

2.2.3 供应商不一定有全栈能力

前融合要求一家供应商同时把语音和视觉都做得比较好,这本身就有难度。而且,前融合也并不是在所有场景下都比后融合好,有些场景甚至根本不需要融合。

2.2.4 主机厂的采购习惯可能不适应

一位业内专家指出:

由于长期形成的采购习惯,一些主机厂的采购部门会习惯性地分开采购语音算法和视觉算法。如果突然要求采购融合后的结果,采购部门不一定能接受。

就目前观察到的情况来看,大家可能会在前融合方向投一些研发资源,但因为现阶段的车辆架构做后融合更方便,真正落地前融合的厂商并不多。

地平线由于具备视觉、语音等全栈能力,是为数不多有量产落地前融合方案的厂商。

不过,无论是前融合还是后融合,本质上都是基于两套逻辑的“组合”。这种组合方式有两大硬伤。

首先,组合逻辑是人为定义的,很难被普遍认可。客户认可的时候没问题,客户不认可,供应商可能就得重写组合逻辑。比如供应商给A厂商的某套方案,到了B厂商那里可能被直接否决——因为不同厂商要追求产品差异化,处理不同模态信息时的侧重点可能完全不同。结果就是,一套方案很难复用,工作量非常庞大。

其次,基于规则的组合很难避免生硬。就算投入大量精力,最终可能只是让组合变得更完善了一些。

中科创达座舱产品线总经理赵锐的观点很直白:

我们不走前融合或后融合的路子。这些东西在我看来都是过渡态,虽然也能当卖点,但我们是做产品的,要看终局。

第三点,基于规则的组合还会限制交互场景,拉低用户体验。

回顾历史,每一次大型智能终端的变革,都伴随着人机交互方式的升级。早期PC靠鼠标和键盘,智能手机靠触屏。到了智能汽车时代,驾驶员的双手和双眼都被占用,交互方式必须走向自然交互。自然交互最简单的形式就是语音,再辅以视觉(比如手势)。

如果在这种交互方式里,还要靠逻辑来限定场景和措施,体验自然会打折扣。

多模态应该是一种能力,而不是预设好的规则。

用户在使用过程中会不断发现更多有趣的东西。如果只能在有限的几个场景里体验多模态技术,其他场景又回到原始状态,这种“割裂感”会非常影响整体体验。

那么,如果不走基于规则的组合路线,又该怎么整合不同模态的信息?答案是——用多模态大模型做模型层融合。

三 模型层融合

1. 什么是模型层融合

模型层面的融合,是指用来训练模型的数据既有语音数据,也有图片数据,以及其他各种模态的数据。融合的阶段更早——在数据层就已经开始融合了。

2023年3月,微软发布了Kosmos-1,一种多模态大语言模型(MLLM,Multimodal Large Language Model),参数总量16亿。这个模型可以接收文本、图像、语音等不同模态的信息输入,完成语言理解、视觉问答、多模态对话等多种任务,如下图所示。

Kosmos-1的主体是一个基于Transformer的语言模型。自然语言以及其他模态的信息都会被处理成统一格式,输入到Transformer decoder中。

在输入阶段,研究人员用表示序列的开头和结尾,用和表示图片信息的开头和结尾。

下图列出了几种不同类型的输入信息,包括纯文本、纯图片,以及文本和图片的混合输入。

Kosmos-1的提出,给人机交互带来了新的可能性。当然,距离大规模落地还有一段路要走。

商汤绝影智能车舱产品高级总监李轲表示:

只有把语音和视觉融合在一起,才叫真正的多模。商汤的特色就是大模型和多模态融合。

具备多模态能力后,车辆可以收集动态信息——语音的、视觉的,再结合地图上的信息,就能实现面向车内驾乘人员的主动推荐功能。

主动推荐是一个非常关键的升级。以前我们通常需要明确下达指令,告诉车机要做什么——打开车窗、打开空调、推荐美食。现在则可以让车机根据用户当前的状态和习惯“主动”去做推荐,比如在用户开车上班途中,推荐早餐地点。

有业内专家直言:

模型层面的融合,在我看来比较接近自然交互的终极状态。既然能看到终点,我们为什么不直接走那条路,而非要先去走过渡态?

为什么模型层融合被看作是自然交互的终极状态?在模型层做融合具体有哪些优势?

2. 模型层融合的优势

2.1 更贴近人的交互习惯

从第一性原理来看,模型层面的融合更贴近人类与外界交互的方式。

人与外界打交道时,是一边听一边看,同时接收听觉、视觉及其他感官的信息,形成综合判断。而不是先通过视觉做一个判断,再通过听觉做另一个判断。这就类似多模态模型——接收不同模态信息,综合处理后直接输出结果。

2.2 信息利用更充分

有了多模态模型之后,就不需要纠结前融合还是后融合了。直接在模型层面融合,视觉信息、语音信息等不同模态的信号可以同时输入,模型直接处理,不用担心中间环节信息丢失。

有业内专家评价:

模型层面融合效果会更好,它可以从多个维度提取更深度的信息。

2.3 更方便持续学习

多模态大模型具备上下文学习的能力。接入一个场景后,就可以根据该场景的数据持续学习。比如接入GitHub后,它能学习代码逻辑——如何生成代码、如何做编译查错;接入Office全家桶之后,文本编辑能力就大幅提升。

换句话说,随着模型接入越来越多不同模态的信息,它会持续训练、持续强化。这种能力是“长”出来的,而不是靠人为定义的一套规则实现的。

大模型不需要人设定规则,只需要喂给数据,它就能自己学会如何融合不同模态的信息。

更关键的是,经过十多年发展,无监督训练已经相对成熟。未经标注的数据同样可以作为多模态大模型的学习素材——这意味着可以用来“学习”的数据量大大增加,非常有利于模型能力的进化。

那么在实际应用中,多模态大模型该如何落地?

3. 用多模态大模型实现自然交互

中科创达座舱产品线总经理赵锐分享了他的看法:

ChatGPT有可能会成为一个场景中枢。语音识别、视觉识别等算法可以由供应商提供,但具体如何与用户互动——比如屏幕上要投什么内容、根据互动数据持续更新——这些都是大模型该做的事,可以借助云端算力做深度处理。当然,在车端信号不好、通信时效无法保障的时候,可以用一个简单的小模型来做过滤。

业内普遍认为,相比自动驾驶,多模态能力会先被集成到智能座舱。座舱里很可能会出现一到两个爆款场景,让用户真正体验到多模态技术的好处。

实际应用中,可能会做成一个产品引擎方案,分为好几层。

底层是各种感知信号的输入源——视觉类、音频类、账户类、第三方信息,以及用户身上的展示信息。

再往上走是策略层。策略层按发展历程又分成几个阶段。

第一阶段主要是固定脚本编辑式的。这类方案已经在为主机厂做场景方案时落地了。比如可以预定义“出门工作”的场景——车机自动打开空调、预设导航、查看路况。用户一键触发,相关任务自动执行。

第二阶段是结合推荐算法。产品经理希望在车端App中引入推荐算法,主动为用户做推荐。

但这个功能目前并不好用。车端的各类数据相对独立,车机实际上并不真正“理解”用户——车的ID和普通App的ID不一致,车载信息全都握在主机厂手里。主机厂通常不会对供应商开放数据,所以车端App的推荐远远不如抖音、今日头条那样“懂你”。

第三阶段,才是真正在车端用上多模态大模型的能力——让大模型主动抓取不同模态、不同来源的信号,实现与用户的自然交互。前文提到的商汤绝影根据用户状态和习惯“主动”推荐,正是这一类应用。

尽管如此,在当前市场环境下,用户还很难为多模态产品心甘情愿地买单。除了长安UNIT-T在宣传时把多模态产品作为卖点,其他厂商很少会突出多模态。

ChatGPT的出现可能会给这个行业注入一些新意。也许以后用户能真正感受到多模产品带来的体验提升,愿意为之买单。到那时,这个行业才会迎来真正的爆发。

4. 多模态大模型在车端落地的局限

愿景美好,但现实不简单。虽然很多业内人士都认为多模态大模型可能是未来的方向,但目前大规模落地尚未实现。具体有哪些困难?

4.1 训练数据不足

在基于多模态大模型的产品没有在车端形成成熟生态之前,训练数据大多来自其他行业。不管是语音还是视觉数据,都基于已经大规模落地的产品方案获取。但如果希望多模态大模型在车端表现出色,需要大量车端专属数据来训练。

然而,主机厂对用户数据的隔离非常严格,不会随便开放。有的主机厂会给供应商提供一个账号做训练,但数据的所有权依然属于主机厂。这对后续的迭代速度、功能体验提升都会带来显著挑战。

另一方面,大模型在车端的落地还处于极早期,这一块的训练数据非常稀缺。可以类比一下,文心一言刚推出时,生成“胸有成竹”、“夫妻肺片”这些对应图片时,也出现过令人啼笑皆非的结果。原因很简单——工程师在开发场景时,没想到用户会这么玩。冷启动期间的预训练或初步规则制定,还没有达到一定的量级。

有业内专家表示:

目前主要问题是大家还没有形成共识。很多厂商的想法是:先小规模测试一下,根据用户反馈再决定下一步。现状更像是一个令人振奋的新东西出来了,大家觉得这是未来的方向。那么,先把它做出来,让用户慢慢习惯。前方的路基本上确定了,过程中还有一些难题要解决,但我相信都会搞定。

另外,在车内采集数据还涉及隐私问题。厂商可能需要设计脱敏方案——比如不需要把整段语音都上传云端,而是做一些特征点裁剪,作为语料的补充。或者直接在端侧部署——大模型本身是一个公版,交给每个厂商时做定制化封装。

4.2 车端信息过于庞杂

车内的信息维度非常多。座舱是一个巨大的市场,也是巨大的挑战。背后的核心在于:汽车是当前人类社会最大的智能移动终端。“大”、“智能”、“移动”这几个关键词都很重要。它们决定了产品设计时安全是第一位的。

叠加了“大”和“可移动”这两个属性后,汽车这个智能终端和手机就非常不同了。手机只有一个屏,所有内容从一个屏输出,传感器感知的内容也少——主要就是语音、视觉、GPS定位信息。

但在车上,即便不算车身气垫,传感器的数量也是手机的十倍以上。座舱内部很多部件自由度很高,可改造空间巨大——座椅、氛围灯都能改造,HUD、VR等新交互方式也正在上车。这种情况下,工程师希望用一个统一的模型来做场景开发,难度确实非常大——输入越多,挑战越大。

在智能家居里做一款“天猫精灵”是容易的,但在车里做一个AI助手很难——因为信息太杂了。

4.3 大模型的使用门槛较高

当前使用大模型的门槛不低。比如最近有很多用户的ChatGPT账户被封。根本原因是目前的网络基础设施承载不了大规模的访问。

另外就是隐私泄露风险。大模型的爬虫可以抓取大量数据,后登录的用户可能看到前面用户留下的信息。这非常危险——因为用户根本不清楚它会抓取什么数据、如何处理这些数据。

在这次采访中,不止一次听到有厂商正在和微软或其他具备通用大模型能力的公司洽谈合作。有公司已经开始尝试将大模型应用在座舱上,并且已经拿到了某主流主机厂的定点。

如果进展顺利,我们也许很快就能体验到更智能的座舱。届时,汽车上的人机交互可能会进入一个全新的时代。

来源:https://m.elecfans.com/article/2260217.html

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。