作者:黄楠
向量数据库的崛起,使得非结构化数据的处理能力直接覆盖了80%的应用场景——这是一个相当务实的数据。保险行业本就是数据密集型领域,数据库在此已有多年的应用基础。近年来,随着保险公司数字化转型加速,文本、音视频凭证票证核保以及批量跑批任务日益增多,不少机构开始将数据库深度融入业务流程。然而现实颇为严峻:传统数据库仅能处理字符串这类结构化数据,依靠精确点查和范围查找来匹配,面对格式五花八门、无法统一处理的非结构化数据时,完全束手无策,最终仍依赖人工手动录入和核验。一位行业从业者透露,目前保险公司内部人为处理的事务占比极高,业务中人工比例可达90%,AI仅支撑了10%的信息存取与数据流转。
技术瓶颈显而易见,缺乏一套通用方法论来解决传统数据库在存储、检索与分析方面的难题。数据局限的困境不仅困扰着保险公司,各行各业都深受其影响——直到大模型与向量数据库的出现。今年以来,大模型风头正劲,向量数据库能够帮助大模型解决数据更新、知识图谱构建、消除幻觉等关键问题,短时间内便成为最受关注的领域之一。向量数据库类产品数量激增,创业公司和大厂纷纷布局。今年7月,腾讯云发布了AI原生向量数据库Tencent Cloud VectorDB,并于11月1日正式全量开放公测,性能大幅提升。向量数据库之于大模型,是实现降本增效的重要基础设施。数据显示,企业采用向量数据库后,能够覆盖80%的非结构化数据处理能力。大模型竞技场上有一个行业共识:谁更善于利用数据、将数据沉淀到工程化体系中、更快让数据接入大模型及整个AI系统,谁就有可能抢占先机。选择合适的合作伙伴至关重要。
1. 大模型的“数据”局限
数据在MaaS时代的重要性不言而喻,市场的火热直接反映在企业行为上:大量垂直模型推出、数据库融资数量增加、数据库使用量猛增。但在企业落地过程中,大模型面临的难题并未减少。经过近半年的观察,数据局限对企业应用大模型的影响可归结为三点。
首先是数据的管理与运维。随着文本、图片、视频等多模态非结构化数据的使用需求增长,许多企业产出的非结构化数据量级可高达80%。如果依靠预训练方式将数据“喂”给模型,成本高得难以承受。明星创业公司百川智能在模型训练与调试时也曾遇到类似问题。在未使用向量数据库之前,他们一直采用开源方案,例如以向量索引为核心,相当于为模型准备一个library级别或算法级别的知识库,使用简单,依赖分布式系统实现扩展。但缺点也很明显:数据量增长到一定规模时,分布式存储很快遇到瓶颈。更麻烦的是,市面上缺乏成熟的管理工具,数据格式如何组织、更新频率如何安排、新旧数据如何更迭,都需要额外派遣工程师来处理,人力成本随之飙升。
第二点,大模型支持的token数量虽在增加,具备了“短暂记忆”能力,但“一本正经地胡说八道”的问题始终未能解决,其中还时常出现敏感内容,稍有不慎就可能引发严重后果。因此,支撑模型训练的数据不仅要数量充足,质量也必须足够高。例如,大模型与教育行业结合时,模型能够完成一定的推理和解题,但好未来发现,大模型面对数学问题时的表现仍有不足。要解决这一问题,必须依托庞大且高质量的数据库,比如教程题库、数学错题集等,在此基础上尝试启发式内容生成。
第三,如何保障企业数据的安全性?数据在空间和时间上存在较大限制。一方面,企业很难将核心竞争力的数据放入大模型训练。有行业人士指出,许多应用型公司不愿将自己微调的模型贡献到公有版本中与他人共享,而是倾向于自己训练大模型后进行本地私有化部署。在这个过程中,主要难点在于如何将私有化业务数据与大模型结合。销售易很早就将大模型引入智能CRM业务,例如提供相似客户推荐、构建问答机器人。但客户在使用时发现,大模型推荐的客户类型经常匹配度不高,询问与企业相关的系统功能问题时,大模型也无法回答。另一方面,企业业务数据变化快、实时性强,私有化部署后的大模型在数据层很难做到秒级或天级的更新。
这些问题横亘在企业与大模型落地之间,学术界和工业界提出了两种解决方案:一是通过Fine-tuning方式迭代,让大模型学习更多知识;二是通过Vector search,将最新的私域知识存储在向量数据库中,需要时进行基于语义的向量检索。两种方法都能为大模型提供更精准的答案。但成本方面,行业人士指出,向量数据库的成本仅为Fine-tuning的千分之一。向量数据库通过将数据向量化、存储和查询,能有效解决大模型预训练成本高、缺乏“长期记忆”、幻觉、知识更新不及时等问题。凭借这些优势,向量数据库被视为加速大模型落地行业场景的关键突破口。
2. 向量数据库的大模型之路
大模型火爆以来,沉寂多年的向量数据库重新受到企业和资本的高度关注。据公开数据,2023年4月起,以向量数据库为代表的AI投资领域呈增长趋势,Pinecone、Chroma和Weviate等多家初创企业均获得了上亿级美元融资。为了最大程度帮助企业应对数据局限、将大模型能力释放到行业和产业中,腾讯云走在了国内云厂商前列,今年7月正式上线了向量数据库Tencent Cloud VectorDB,11月1日全量开放公测。这也体现了腾讯云在大模型时代下的视角:大模型技术创新只是第一步,像向量数据库这类数据存储、检索、分析的基础设施搭建同样重要。腾讯不仅直接提供大模型服务,更重要的是递出“铲子”、提供趁手的平台工具。
市面上好用的向量数据库不少,腾讯云相比其他厂商有何不同?首先在架构上,腾讯云采用了AI原生的开发架构,从接入层、计算层到存储层提供全面AI化的解决方案,形成一套完整的端到端一站式技术栈,让不同阶段、不同需求的用户都能在腾讯云向量数据库中找到对应可用的AI能力。

腾讯云全面AI化解决方案
例如,在接入层,腾讯云向量数据库支持自然语言文本数据,采用“标量+向量”的查询方式,支持全内存索引;计算层,AI原生的开发范式能够实现全量数据AI计算,一站式解决企业搭建私域知识库时数据切分等难题。这些能力让交互更加自然,同时在计算结果、效率、成本等方面也能进一步优化。百川智能的工程师们认为,向量数据库带来的最直观改变是,数据分片、导入导出等工作效率大幅提升。面对每天约2亿的数据量,以前单线程序处理速度有限,加入向量数据库后,配合RAG框架,能有效解决私有数据、实时数据问题,在数据齐备的情况下还能消除部分由数据带来的幻觉问题。数据显示,将腾讯云向量数据库用于大模型预训练数据的分类、去重和清洗,相比传统方式能实现10倍效率提升;如果作为外部知识库用于模型推理,则能把成本降低2到4个数量级。以前企业将现有数据接入一个大模型需要约1个月,使用腾讯云向量数据库后,最短3天即可完成,接入成本大幅降低。
第二是集成了Embedding功能,企业用户无需关注向量生成过程,使用更加简单。

腾讯云向量数据库AI套件
与腾讯云合作之前,好未来曾使用过一些小型的基于内存的向量数据库,虽有语义结合能力,但性能和维护都不理想。而在腾讯云向量数据库上,通过语音召回加语义Embedding功能,这种语义结合检索的方式让模型能力得到提升,召回内容更多、更精准、速度更快,用户体验更好。例如,搜索题库中的“第一单元”,文本召回必须准确给出“第一单元”这个提示词,但借助向量数据库的相似性检索,语义检索能将“Unit1”等近似语义的内容也召回。
第三,自研分布式向量数据库核心引擎,服务更稳定可靠、高可用。腾讯云向量数据库所用的核心引擎是2019年在内部上线使用的Olama,经过4年探索和迭代实现了大规模升级,包括集成腾讯内部优秀的向量算法、降低Olama成本、提升稳定性等,更好地适配大语言模型应用。截至今年7月,Olama已覆盖腾讯30多个业务、100多个场景,日均调用量超过1200亿,调用成功率100%,搜索成功率99.995%。面对企业在大模型落地中的普遍难题,腾讯云向量数据库力求在每个环节提供便捷、有效的解决方案,突破数据局限,加速大模型+向量数据库的应用,切实解决企业痛点。
3. 应用是风口
受限于研发成本和开发难度,过去十年全球仅有1%的开发者专注于AI领域研发。而今天,以大为模型能力基座,开发一个AI应用仅需两三名工程师、一个周末的时间即可完成。向量数据库也从主要服务于搜索、广告、推荐领域,随着AI大规模发展,开始深入千行百业,与C端用户连接更加紧密。举一个销售易与腾讯云的合作案例。作为企业级CRM服务商,销售易每天有数万次用户问答发生在智能客服场景中。以前传统NLP客服机器人只能做一问一答,基于分词语法关键字的检索方式容易导致搜索不精准,用户使用体验不佳,逐渐不愿提问。例如,客户希望在业务分析中检索调用多个数据报表,要在成千上万个报表中找到指定数据,对模型的信息抽取能力要求很高,直接关系到业务分析效率。但跟腾讯云合作后,销售易先将报表以Embedding形式存入自有向量数据库,用户端自然语言问询时,客服机器人智能化分析问询者意图,在向量数据库内检索相关文档,得出更接近人类思考方式的回答。这样的客服机器人不仅支持多轮对话,更关键的是支持检索模糊的相关性,无需维护大量同义词、词典或相似问法,类似相关性的语言可交给大模型+向量数据库解决。
在潜在客户推荐场景中,腾讯云向量数据库带来的影响也很明显。过去销售易主要依据客户特征字段在结构化信息中检索具有相关特征的企业信息,对内部销售人员要求很高,必须准确检索近上百个字段,像企业介绍这类描述性内容很难被检测,久而久之员工经常出现关键字匹配度不高的问题。使用向量数据库后,基于相关性特征检索是从文本描述出发,当销售人员想检索某个行业、某种产品或某种业务需求的客户时,可以借助文本进行自然语言模糊的相关性检索,使用简单,检索结果更真实准确,智能化效果明显,大大降低了员工从事客户推荐的难度。

腾讯云超级底座
可以看到,向量数据库之于大模型应用落地、之于AI技术发展的意义已逐渐显现。腾讯云数据库副总经理罗云指出,数据、向量数据库、大模型三者如何更好地服务全行业是首要问题,“只有向量数据库变得更AI化,数据、向量数据库、大模型三者才能形成飞轮效应,彼此相互拉动、相互促进,这是我们对向量数据库未来发展的判断。”这也是腾讯云在当下推出向量数据库Tencent Cloud VectorDB的原因。数据显示,自7月正式发布以来,腾讯云向量数据库日请求量达1600亿次,服务腾讯集团内部40多个业务,外部客户数多达数百家,包括前面提到的百川智能、好未来、销售易,帮助教育、SaaS、工具、游戏等多行业客户快速进行AI方向探索。
大模型进一步推动了对向量数据库的需求。业界共识是,所有产品应用都值得用AI重做一次。在这个背景下,企业会越来越重视如何将其与AI、大模型的能力结合起来。腾讯云向量数据库在推出之时就已看到企业在应用落地中的痛点,用向量数据库在技术“大脑”中构建起一个健康且旺盛的“海马体”,为企业迈进大模型时代提供坚实基座。本次Techo Day技术开放日将资料和课件整合成了一份《腾讯云工具指南》,技术含量很高,可帮助学习了解向量数据库的技术优势与价值应用。
编辑:黄飞
