首页 游戏 软件 资讯 排行榜 专题
首页
科技数码
谷歌新模型发布:多模态AI应用的关键布局

谷歌新模型发布:多模态AI应用的关键布局

热心网友
62
转载
2026-03-12

文 | 霞光AI实验室,作者|渡川

免费影视、动漫、音乐、游戏、小说资源长期稳定更新! 👉 点此立即查看 👈

就在昨晚,谷歌发了首个原生多模态嵌入模型Gemini Embedding 2。

跟以往的纯文本基础模型不同,Gemini Embedding 2的核心突破在于将文本、图像、视频、音频和PDF文档等五种模态,全部映射到同一个向量空间里。

在这种情况下,模型可原生支持混合模态输入,例如同时传入图片+文字、视频+音频等复杂组合,而且系统也能够理解不同媒体之间的语义关联。这意味着,你用一段文字去搜索相关的图片,或者用一张图片找到含义相似的音频片段,都可以实现。

但这种嵌入模型并不是面向普通大众使用的,而是面向AI应用开发者、算法工程师以及拥有海量非结构化数据的企业,帮助他们大幅简化了复杂的多模态数据处理流程,提升检索增强生成(RAG)、语义搜索等多模态下游任务的表现,这也将为多模态智能应用铺平了道路。


通常大家说的大模型(LLM / 基础大模型),指的是能理解、推理、生成长文本的底座模型,表现出来是能够与人对话、思考、创作、写代码;而Embedding模型属于向量表征模型,它只做一件事——把文本 / 图像 / 音频转成向量(一串让机器读懂的数字),而不生成内容、不推理、不对话。

以前的机器在搜索/检索时有个问题:文本有文本的 Embedding 模型,图片有图片的 Embedding 模型,音频有音频的 Embedding 模型,它们各自生成的向量是互相隔离的。

而谷歌发布的Gemini Embedding 2 是一款“多模态翻译官”,它让不同类型的数据(文字、图片、声音)能够用同一种语言交流,为企业构建下一代多模态搜索引擎和推荐系统提供了强大的基础工具。


这款产品的核心在于统一和理解。主要特点包括:

总体来说,Gemini Embedding 2为机器创造了统一的“感官”,为下一个高级人工智能体验时代提供了必要的多模态基础。


Gemini Embedding 2最核心的受益群体,正是AI应用开发者和算法工程师,它会极大简化他们过去复杂的工作流程。

以前,如果AI应用开发者要做一个能同时搜索图片和文字的应用,需要维护图像模型和文本模型两套嵌入系统,还得写大量代码对齐结果,而现在一个模型、一个向量索引就能搞定;特别是对于需要处理音频和视频的开发者,以前需要先做语音转文字、视频抽帧等预处理,现在可以直接输入原始音视频,减少了信息丢失,也降低了开发维护成本。

此外,对于很多大型企业(如媒体、医疗、金融)来说,它们的数据资产中绝大部分都是非结构化的图片、扫描件、录音和视频。过去,这些数据只能在数据库里沉睡,而Gemini Embedding 2 可以让这些数据真正变得可搜索、可利用——比如媒体可以建立一个跨格式的资料库,编辑直接用文字描述(如“夕阳下的海滩,带有轻松的背景音乐”)就可以搜索出符合条件的视频素材,无需依赖人工打标签。

此外,随着大模型应用加快,让模型获取最新的、多模态的知识变得至关重要。RAG 是目前的主流方案,而 Gemini Embedding 2 将 RAG 从“文本检索”升级到了“多模态检索”。有了 Gemini Embedding 2 的加持,当用户提问时,系统不仅能检索相关文字,还能找出相关的图表、视频片段作为上下文提供给大模型,从而生成图文并茂、信息量更大的回复。

Gemini Embedding 2的发布,其意义超越了模型本身。谷歌表示,该模型在多项文本、图像和视频任务的基准测试中超越了当前的主流竞品,为多模态嵌入领域设立了新的性能标准。

此外,它还让一系列过去难以实现的场景变得触手可及。例如,在法律领域,它可以从数百万条记录中,快速检索出包含特定图片、音频片段的证据文件;在推荐系统中,它可以基于用户的浏览历史,混合推荐相关的文章、视频和播客,体验更自然流畅。

总结来看,Gemini Embedding 2让机器不仅能生成内容,更能从底层去理解这个由多元信息构成的世界,让AI开启“全感知”应用时代。


2026年,被认为是大模型的“多模态”之年。今年前两个月,国内的快手、字节跳动、阿里巴巴等科技巨头密集发布新一代多模态模型,标志着AI视频生成正从“盲盒式娱乐”向“精准工业化生产”跨越。尤其Seedance2.0的发布,在全球引发关注,其最大亮点在于通过“@素材名”的全新交互范式,让用户能够指定每个图片、视频、音频的用途,且画面的物理规律更合理、动作表现更自然流畅。

如今,全球大模型已从单一文本能力的深耕,转向多模态原生融合的深耕。不同于以往“文本+图像”的简单拼接,2026年的多模态大模型普遍采用统一表示空间架构,能够原生协同处理文本、图像、音频、视频,真正实现跨模态的理解、生成与交互。

Gemini Embedding 2 代表的底层基础设施的革新,则它让机器“读懂”世界的方式变得统一和高效。

来源:https://www.163.com/dy/article/KNR6L9VB05118O92.html
免责声明: 游乐网为非赢利性网站,所展示的游戏/软件/文章内容均来自于互联网或第三方用户上传分享,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系youleyoucom@outlook.com。

相关攻略

DeepSeek挑战Transformer记忆?查表法重塑模型架构新思路
AI
DeepSeek挑战Transformer记忆?查表法重塑模型架构新思路

新智元报道编辑:LRST【新智元导读】ICLR论文STEM架构率先提出「查表式记忆」架构,早于DeepSeek Engram三个月。它将Transformer的FFN从动态计算改为静态查表,用tok

热心网友
03.30
谷歌AI论文涉学术造假,洗白内存占用了900亿刀?
AI
谷歌AI论文涉学术造假,洗白内存占用了900亿刀?

编辑|泽南、杨文没想到这次大面积市场震荡,还引出了学术大瓜。本周五晚,谷歌的学术不端事件成为了 AI 圈的焦点。来自苏黎世联邦理工学院(ETH Zurich)的博士后高健扬在知乎发布文章,表示 Go

热心网友
03.30
电价优势如何助力低成本Token出海:机遇与路径解析
科技数码
电价优势如何助力低成本Token出海:机遇与路径解析

文 | 盘古智库当前,市场上流行一种极度简化的商业叙事:将中国丰富的绿电资源视为人工智能时代的“新煤矿”。其基本逻辑可以表述为:利用西部低至 0 3 元每度的电力优势驱动大规模智算中心,通过算力芯片

热心网友
03.29
谷歌内存论文疑被抄袭,华人学者控诉业内学术不公
AI
谷歌内存论文疑被抄袭,华人学者控诉业内学术不公

新智元报道编辑:好困 Aeneas【新智元导读】把闪存股一夜干崩的谷歌顶会论文,出大事了。TurboQuant的核心方法,两年前就被一位华人学者做完、发完顶会、代码全部开源了。谷歌不仅没正面提及,而

热心网友
03.28
凯洛特科技专利申请:如何精准采集与修复VR数据提升体验
科技数码
凯洛特科技专利申请:如何精准采集与修复VR数据提升体验

国家知识产权局信息显示,青岛凯洛特科技有限公司申请一项名为“一种虚拟现实数据采集及修复方法”的专利,公开号CN121707869A,申请日期为2025年12月。专利摘要显示,本发明提供了一种虚拟现实

热心网友
03.28

最新APP

火柴人传奇
火柴人传奇
动作冒险 04-01
街球艺术
街球艺术
体育竞技 04-01
飞行员模拟
飞行员模拟
休闲益智 04-01
史莱姆农场
史莱姆农场
休闲益智 04-01
绝区零
绝区零
角色扮演 04-01

热门推荐

《全面战争:中世纪3》:只怀旧做不成好游戏经典需要现代化
游戏资讯
《全面战争:中世纪3》:只怀旧做不成好游戏经典需要现代化

《全面战争:中世纪3》:经典延续,如何平衡怀旧与创新? 近期,《全面战争:中世纪3》的项目负责人帕维尔·沃伊斯坦然指出,要打造一款真正优秀的续作,绝不能仅仅依赖对前作模式的简单复刻。这一观点引人深思——尽管《中世纪2:全面战争》至今仍在策略游戏爱好者心中占据着经典地位,但开发团队此次显然决心跳出“照

热心网友
04.02
雷鸟创新AWE斩获艾普兰创新奖 蝙蝠侠限定款国内首秀
科技数码
雷鸟创新AWE斩获艾普兰创新奖 蝙蝠侠限定款国内首秀

雷鸟X3 Pro斩获AWE艾普兰创新大奖,开启全民AR生活新篇章 在上海新国际博览中心隆重揭幕的2026年中国家电及消费电子博览会(AWE)上,前沿AI科技与未来生活愿景激情碰撞。全球消费级AR领导品牌雷鸟创新,以其里程碑式的表现,定义了行业发展的新方向。 通过“顶尖硬件科技+顶级文化IP”的双轨战

热心网友
04.02
AWE探展MOVA:31款创新产品集中亮相 重新定义智慧生活新体验
科技数码
AWE探展MOVA:31款创新产品集中亮相 重新定义智慧生活新体验

借力AWE2026“一展双区”,MOVA双区协同、震撼登场 备受瞩目的科技盛会——2026年中国家电及消费电子博览会(AWE),于3月12日至15日在上海盛大举办。本届AWE展会首次创新采用“一展双区”的展览模式,主会场位于上海新国际博览中心,分会场则设于上海东方枢纽国际商务合作区,两大展区高效联动

热心网友
04.02
DNF2026冰结技能数据是怎样的-2026DNF冰结技能数据详情
游戏攻略
DNF2026冰结技能数据是怎样的-2026DNF冰结技能数据详情

冰结师技能全解析 踏入2026年,《地下城与勇士》中的冰结师职业,其技能体系已构建得更为成熟与强大。无论是在副本中高效清理海量怪物,还是在决斗场与高手玩家周旋,这个职业都能凭借其独特的冰霜艺术掌控战局。刷图时,酷寒的范围法术可瞬间清屏;而在PVP竞技中,一套将冻结控制与瞬间爆发完美衔接的连招,往往让

热心网友
04.02
iPhone 18 Pro设计挤牙膏了 继续用前代模具
科技数码
iPhone 18 Pro设计挤牙膏了 继续用前代模具

iPhone 18 Pro系列模具不变,屏幕形态将与iPhone 17 Pro保持一致 备受期待的屏下Face ID组件小型化设计与灵动岛区域缩窄方案,预计将被推迟至后续迭代机型中正式应用。 近期,关于iPhone 18 Pro系列的技术传闻持续引发行业关注,尤其在显示与解锁设计领域传言甚多。多方消

热心网友
04.02