在这个数据为王的时代,数据是人工智能的三大支柱之一,这已是行业共识。最近,OpenAI收购数据库初创公司Rockset的消息,引发了不小的关注。算法和算力上早已遥遥领先的OpenAI,通过这次收购,把Rockset先进的数据索引和查询技术整合进自家产品,目标是让数据真正变成"可操作的智能"。这背后其实透露了一个信号:数据基础设施,正在成为AI竞争的下一个制高点。
现代数据库与人工智能的融合,早已不是纸上谈兵,而是一场正在席卷全球的技术革命,深刻重塑着技术与产业的格局。要说这融合,无非体现在两个方向上:一边是数据库技术要更好地支持AI应用,比如向量数据库——也就是所谓的DB for AI;另一边,AI技术反过来让数据库运维更省力、更智能,实现自动化和智能化,也就是AI for DB。
变革从来不是一帆风顺的,数据库产业正面临不少棘手挑战:海量数据下的高性能和大并发、大规模实例的智能优化、数据安全与防篡改的防护……问题在于,企业到底该如何通过技术创新和生态协同,把这些挑战变成机遇?
作为数据库领域的头部玩家,东方国信、PingCAP、云和恩墨用自身的技术和产品实践给出了参考答案。同时,它们与英特尔的协同创新,也让我们看到了整个数据库生态的蓬勃生机。
新需求催生新挑战
在AI大模型时代,数据库的使用人数和数据量都迎来了爆炸性增长,系统的并发度自然水涨船高。云和恩墨联合创始人兼CTO杨廷琨点出了关键:数据量暴增带来压力的同时,硬件技术的快速发展也给算力提升带来了可能。面对这个局面,数据库厂商得从两个方向使劲:一是单机性能要更强,二是架构设计要实现平滑扩展,这样才能满足海量数据的处理需求。
数据量一上去,数据冗余的问题也跟着冒出来。用户那边也提出了新想法,东方国信副总裁兼CTO查礼就说,用户往往希望一个数仓既能做数据加工,又能做分析和查询,这对数据库系统的灵活性和多功能性提出了很高要求。
数据来源的多样化和用户需求的复杂化,让硬件的担子越来越重。数据库要保持高性能、高稳定性,而开发和运维人员又希望它用起来简单——这两个诉求搁在一起,就是一个典型的"既要、又要"难题。
为了解决这个悖论,越来越多的数据技术公司选择让AI"入局",让数据库越跑越"聪明"。PingCAP服务总经理林景旭表示,他们正在探索用AI技术增强数据库功能,同时简化用户操作。作为一家分布式数据库厂商,PingCAP提供的开源分布式数据产品与解决方案,通过计算和存储分离的架构,实现了动态扩展来满足不同用户需求,其中就包含了用AI算法优化资源使用和性能评判。
说到底,数据库产业需要不断推陈出新,开发更高效、更可靠、更智能的技术,才能应对新需求的挑战。同时,整个产业链也需要紧密合作,为数字经济的发展打下更坚实的基础。
生态协同推动产业变革
数据库产业面临的挑战不是单个企业能独自解决的,必须靠整个产业的协同合作,共同应对,共同抓住机遇。
凭借先进的处理器技术、开源合作策略以及对客户需求的深入理解,英特尔正与数据库领域的合作伙伴一起,构建一个开源开放、合作共赢的生态环境,助力数据库技术的持续创新和应用落地。
英特尔中国云创中心技术总经理张晓军介绍说,第四代和第五代英特尔® 至强® 可扩展处理器内置了多项面向数据库优化的技术。比如英特尔® QAT用于数据压缩解压缩,英特尔® IAA加速数据分析。在数据安全方面,英特尔通过TDX和SGX为使用中的数据提供了端到端硬件级防护能力。
近期发布的英特尔至强6处理器,提供了两种不同的CPU微架构版本——性能核和能效核,让多种工作负载的性能和能效表现再创新高。其全新功能和内置翻跟斗,为目标工作负载带来了进一步的助力。
基于英特尔® 架构的翻跟斗与软件工具
众多合作伙伴正借助至强处理器、翻跟斗及软件工具,增强自身产品竞争力。
PingCAP推出的TiDB开源分布式数据库就是一个典型例子。得益于第四代英特尔® 至强® 可扩展处理器的代际性能提升,其只读性能与读写性能分别达到基准配置的1.62倍与1.43倍。
此外,TiDB利用至强® 可扩展处理器搭载的英特尔® IAA,在保证吞吐量的前提下,显著提升了数据压缩率,节约了存储空间。用英特尔® IAA代替LZ4之后,压缩率达到了后者的1.4倍。
结合CPU迭代,性能提升可达到原配置的1.56倍,帮助客户化解了数据压缩带来的性能困扰。
硬件性能提升为数据库处理海量数据提供了基础,但要真正发挥这些算力,还得对数据库内核进行深度优化。云和恩墨通过对数据库内核进行改进,让它更好地适应多核CPU、大内存和高速IO子系统等现代硬件,实现了单机性能的显著提升。
根据其测试结果,在一颗至强® 双路服务器架构上,以50G内存配置再加一个NVMe SSD闪存,云和恩墨达到了700万TPCC的指标,单机能力可谓大幅提升。
东方国信适用于超大规模数据存储和在线分析的大数据BEH平台企业版,通过集成Gluten与Velox Backend向量化执行引擎,为Spark注入了原生矢量化执行的能力。再结合第四代英特尔® 至强® 可扩展处理器和英特尔® QAT翻跟斗,Spark批处理计算、SparkSQL计算、SQL查询服务的执行效率都得到了显著优化。经测试,在相同硬件环境下,配合英特尔® QAT,Spark计算性能可提升高达2.9倍。
除了硬件,英特尔在软件及数据库生态方面也加大了投入。张晓军强调了英特尔在开源领域的贡献,比如Apache社区的Gluten项目,已在很多客户系统里得到广泛应用。相比传统Spark,性能可以提高2-3倍,如果运行在英特尔硬件上,预计还能取得更优表现,大幅提升大数据处理效率。
数据库与AI深度融合
大数据时代,数据量和系统数量都在指数级增长,数据类型也从结构化数据演变成非结构化和半结构化数据。这对数据库系统的稳定性和能力提出了更高要求,数据库技术与人工智能技术的结合,已成为当前最热门的研究主题之一。
在AI时代,数据是驱动企业发展的核心要素,数据库作为存储、管理和分析数据的基础设施,与AI技术的深度融合是大势所趋。这种融合不仅能提升数据库的性能和智能化水平,也能推动AI技术的落地应用。
各家数据库厂商正在不同维度上探索AI的应用。东方国信正利用AI技术,尤其是智能取数方面,通过自然语言处理生成SQL语句,提高数据提取的灵活性和效率。同时,他们也在探索智能建仓,尝试用AI自动完成数据仓库的构建和维护。查礼表示,公司正积极研发解决方案,旨在通过AI辅助减少人工介入,预计能将数仓维护成本降低60%。
PingCAP则利用AI算法进行资源管理,让数据库更好地适应复杂多变的业务场景。林景旭强调,通过集成AI技术优化数据库内部管理,提升其智能水平,可以在满足复杂业务场景的同时降低使用门槛。这意味着数据库不仅要能处理海量数据,还得具备自我管理和优化的能力,确保在面对日益复杂的业务需求时,能更自主、高效地运行。
云和恩墨则在推动"AI for DB"和"DB for AI"的双向促进。杨廷琨指出,他们正在利用AI提升数据库性能,尤其是在智能资源管理、智能监控、智能根因追踪、智能参数调优、SQL智能优化以及自动驾驶等方面的应用潜力。
结语
现代数据库与人工智能的结合,不仅对处理能力、架构灵活性和用户体验提出了更高要求,也为数据库产业带来了前所未有的发展机遇。随着技术不断进步和生态合作持续深化,未来的数据库将更加智能、灵活和强大,为数字经济发展提供坚实基础。英特尔与数据库领域的合作伙伴,正在共同推动数据库产业向智能化、高效化转型,满足客户的业务创新需求。
