泽拓科技的CEO赵伟坐在办公桌前,灰色西装外套,说话声音不高,带着微笑,以及那种极客特有的真诚与激情。
当被问及数据库产品是否应该自研时,他保持着徐徐的语调,一字一句地说:“我们从一开始就大大方方在社区里讲,我们是基于社区版的MySQL和PG深度研发了大量内核增强、优化扩展和新功能组件,让两者发生‘核聚变反应’,锤炼成全新的产品。”
在他看来,对计算机软件而言,比亲自写每一行代码更重要的,是能否掌控自己产品的完整设计和实现,同时必须遵循所用开源组件的开源协议。所以,他们不会为了自研率而有所隐瞒。
泽拓科技的昆仑数据库,就是借力开源生态做成的。赵伟将其形容为“炼丹”——“丹”的主体基于MySQL和PostgreSQL等开源社区的组件作为素材和原料,团队在此基础上增强原有功能、增加新功能组件,将两个原本互不关联的开源单机数据库揉合成一个统一而协调的整体架构和产品功能集。
建基开源之上的优势在于,昆仑数据库能充分融合客户需要的功能。有一段时间,社区里都在讨论能同时做到TP和AP的HTAP功能,团队便进一步加强数据库的AP性能,使其具备了HTAP能力;后来大模型带火了向量数据管理需求,借助pgvector这个开源组件,泽拓团队用了不到三个月就让昆仑数据库拥有了向量数据处理能力。“昆仑数据库已有丰富的功能,且有开放可扩展的架构,因此社区关注什么,我们就能快速增加相应的功能。”昆仑数据库就这样成长为数据库的“集大成者”。
当然,实现这一切的前提是,泽拓科技产品研发团队里有好几位来自Oracle的MySQL原厂内核开发者——他们都是赵伟之前在Oracle工作时的同事。而赵伟本人,在Oracle做过多年MySQL内核研发后,又在腾讯将基于MySQL打造的TDSQL迭代为成熟的分布式数据库产品。深耕MySQL和PostgreSQL开源生态多年,泽拓团队知道如何最高效、高质量地基于原有代码做深度研发,满足客户需求。
那么,作为一个借力MySQL和PostgreSQL社区生态的数据库公司,这几年商业化的道路好走吗?依靠社区转化而非传统销售的商业模式,是否真的行得通?以下是经过整理的对话内容。
泽拓科技 CEO 赵伟
社区关注什么,泽拓团队就能讲什么
问:之前有段时间,泽拓团队强调过昆仑数据库具备HTAP能力?
赵伟:昆仑数据库有HTAP能力,除此之外还有空间数据管理和向量数据管理能力。因为昆仑数据库的计算节点基于PostgreSQL研发,大部分组件无需修改即可使用;少量组件(比如PostGIS和pgvector)需要做内核研发,使其适应昆仑数据库的架构。对这些第三方组件做调整的投入都不大,可能只有从零开始研发工作量的1%。
之前我们宣传昆仑数据库的HTAP能力,是因为那段时间数据库社区里厂商都在宣传HTAP,就像现在大家讨论大模型、RAG和向量数据管理一样。这些数据管理功能,昆仑数据库都有。社区里关注什么,团队就能讲什么。
HTAP这个名词是前几年其他厂商提出来的,但Oracle很多年前就已经支持AP查询了。不过Oracle是集中式数据库,到了互联网时代,很多中小型公司也有几十TB的数据要分析,Oracle难以承载大量数据分析需求,所以业界从20多年前开始用HBase、Hive等工具来迭代,由此诞生了国内外多个AP类数据库产品。后来市场就“发明”出一些需求——也可能是真实的需求——把TP和AP的功能融合在一个产品里,也就是HTAP。
问:为什么说是“发明出来”的需求?市场没有HTAP的真实需求吗?
赵伟:可能有,但实际上我们拜访的那么多客户里,很多时候TP和AP负载还是分开在两个数据库实例中运行。大多数情况下,对于HTAP数据库,大家往往只侧重使用其TP或AP的功能。这样可以避免两类负载的资源竞争,确保两者的性能都更高;而且开源社区有很多免费的数仓产品,客户自己多用些机器就能独立部署TP和AP数据库。当时我们做HTAP,也主要是从技术角度看,觉得可能有一些需求,同时想通过深度研发一系列技术来大幅改进昆仑数据库的AP性能。现在看,技术和产品层面我们的目标基本实现了,但在用户使用场景方面,更多用户倾向于把昆仑数据库作为TP数据库来直接支撑应用系统,或者从多个其他数据库汇聚数据。
问:听下来,你们公司找到产品与市场的PMF了吗?
赵伟:我们最本质的PMF就是企业级的MySQL和企业级的PostgreSQL。昆仑数据库的计算节点基于PostgreSQL开发,存储节点基于MySQL开发。与那些只兼容MySQL协议和SQL语法的产品相比,我们对二者的兼容程度要高得多。DBA的学习曲线很平滑,他们原先对MySQL的运维管理知识,有很多仍然适用于昆仑数据库。另外,PostgreSQL近些年在国内外的普及度也在快速上升,对PostgreSQL用户来说,昆仑数据库在性能、弹性扩展能力等方面也具有独特价值。
问:这个PMF竞争力大吗?
赵伟:竞争力挺大。因为Oracle现在对社区版MySQL的投入已经大大降低,把研发MySQL的资源都投到了云上闭源版本。过去15年,Oracle在社区版MySQL上做了大量投入,基本每个季度发布新版本,就像掉个新的“馅饼”给全球用户。但如今,定期发布的开源MySQL新版本几乎已经没有新功能,基本就是在修bug。对用户来说,以后“天上掉馅饼”的机会就很少了。如果MySQL用户有新的功能需求,或者有问题需要解决,我们就能在昆仑数据库里把这个功能做出来给他们。
同时,PostgreSQL一直没有厂商维护,虽然开源社区的开放性非常优秀,但商业用户不仅需要企业级数据管理能力,也需要可靠的厂商技术支持。
问:为什么你们团队能做到这点?
赵伟:我们团队十几个人里,有好几位是之前MySQL的原厂内核开发者,还有几位PostgreSQL内核开发者,我们完全掌握这两个数据库的设计和实现、功能与用法;而且核心开发者和技术支持人员都有国内外互联网大厂的多年工作经验,解决过很多极致负载和极致需求下的技术难题。数据库作为基础软件,服务是很重要的,不像手机上下个APP就能用。用户需要专业的技术服务。
问:面对这么多国产数据库,也有观点认为全自研的数据库可能比借力开源生态的更有前景,您怎么看?
赵伟:从用户视角来看,用户更看重其选择的数据库及其他基础软件产品能否解决现实问题和需求。有功能需求时,供应商能研发出来或者按需更改;遇到bug能即时有效地解决——这才是关键。他们反而不太在意产品自研率是100%、80%还是50%。我们从一开始就大大方方在社区里讲,我们基于社区版的MySQL和PG深度研发了大量内核增强、优化扩展和新功能组件,使二者发生“核聚变反应”,锤炼成全新的产品。对计算机软件而言,比自研率更重要的,是能否掌控产品的完整设计和实现,从而按需增强现有功能、扩展开发新功能。而且,必须遵循所用开源组件的开源协议。所以我们不会为了所谓的自研率做任何隐瞒。
那些100%自己写代码的产品,虽然其执着的精神可嘉,但用户会担忧:“产品要多久才能稳定下来?”“有多少DBA可以管理这些数据库?”“有多少第三方组件能够适配支持?”MySQL和PostgreSQL开源数据库的成熟度比较高,我们基于此出发,在资金、人力上的投入比每行代码都自己写的公司少很多,还能更快完成产品开发迭代。
但有个大家容易忽视的前提:我们的研发团队本来就对MySQL和PostgreSQL等组件非常熟悉,能理解其设计思路,知道如何高质量、高效地增强和扩展——这是隐含条件。当前昆仑数据库所有组件的最新代码中,泽拓团队自研的代码总量也占据了总代码量的一多半,而且团队100%理解、掌握昆仑数据库的架构、原理和每一行代码。我们的技术团队其实也具备完整而强大的数据库系统自研能力。
问:在您看来,泽拓和自研数据库的公司完全是同一赛道吗?
赵伟:宽泛点说,大家的目标客户群及其所在的行业都一样,就是同一个大赛道。但彼此的发展策略不同。比如我们是借力于开源生态,从现有的开源社区发展用户;有的公司是自己重新开辟一个生态系统,前期比较艰苦、投入非常大、见效慢,但一旦做成,整个生态就是他们自己的。
借力开源做数据库是“炼丹”
问:您是在什么契机下决定创建泽拓科技的?
赵伟:2017、18年左右,云计算普及度很高,国内外也有很多基础软件通过云平台销售——基础软件可以成为独立的产品,这是一种新的商业模式。以前只有Oracle、微软等少数几个美国公司能做到,那几年涌现出MongoDB、Redis、ES之类的公司,很鼓舞人心,所以我也萌生了这个念头。我2019年8月从腾讯离职出来筹备,公司于2020年底成立。
问:公司刚成立时,设定的产品方向是什么?
赵伟:当时就只是想着做分布式数据库,管理海量数据,应对极致负载。虽然产品的功能在持续开发,但有几点基本因素我们一直保持着。第一,要从开源生态借力,因为创业公司资源有限,做事效率要比大厂更高,而且要更灵活地即时调整。我们把研发昆仑数据库称之为“炼丹”——“丹”的原料一部分是开源社区的组件(即MySQL和PostgreSQL),毕竟我们没有那么多资源从零写每一行代码。第二,可以从MySQL和PostgreSQL的开源数据库社区用户群中发展用户,通过社区发展影响力,让大家知道我们的产品比开源免费版更有价值,从而成为我们的商业客户。
问:为什么给产品起名叫昆仑数据库?
赵伟:我想要一个足够大气又朗朗上口的名字。一开始还想过“喜马拉雅”,后来又想过“青海湖”,但觉得以湖命名太秀气了。我还列了个表,把全中国两个字的名山大川列了一遍——太行、昆仑、贺兰、峨眉、武当。最后选了昆仑,万山之祖。
问:咱们是在2024年8月左右就已经打磨好产品可以落地商业化了吗?
赵伟:当时产品作为数据库来说,基本功能差不多都有了,可以POC。实际商业化是从2024上半年开始的。公司刚成立没多久,我就雇了第一个销售,但当时产品还没成型,没过多久又让人家离开了。现在看,那时在商业化方面还是有点急,太想尽早开拓客户。
问:现在2025年初,商业化两年后,目前的进度您满意吗?
赵伟:比当初想象中要困难一些。一方面是经济大环境的影响,另一方面数据库作为基础软件,比其他软件推广难度更大。原先设想开源社区用户可以主动转化为我们的用户,后来发现还是得靠传统的商业化方法为主,由销售人员去获取客户。
问:原先的设想难在哪里?是其他基于MySQL做数据库的公司带来的压力吗?
赵伟:要说竞争,可能就是公有云大厂。他们也有基于MySQL和PG做的云数据库,昆仑数据库和他们的产品确实有部分功能重叠。而且,数据库软件就像地基,用户选择产品时也很谨慎,建立信任需要比较长的时间。在国内,一个公司用什么软件,往往也不是一线技术人员能决定的。作为初创公司,商业化起步比较难。现在有了一批早期客户后,后续应该会越来越顺畅。
问:咱们的产品跟大厂有重叠,那差异化的地方是什么?
赵伟:还蛮多的。比如昆仑数据库比OceanBase和TDSQL多了向量数据管理、空间数据管理,比TDSQL的AP性能更高,等等。虽然这些差异化的功能客户是否需要,因人而异,但我特别想强调一点:昆仑数据库的独特优势在于对MySQL做深度兼容。因为昆仑数据库的存储节点基于MySQL研发而成,不仅仅是像其他数据库产品那样仅兼容MySQL的协议语法——相当于MySQL用户的DBA可以直接来运维管理昆仑数据库,上手难度很低。
问:最开始会选择什么样的客户来打磨产品?
赵伟:比如数据量大的,单个MySQL实例装不下;或者MySQL复杂查询性能较低;或者需要比MySQL更高的一致性、性能,以及更可靠的容灾和故障恢复能力的客户。
问:会倾向什么行业?因为许多数据库公司可能会选择金融行业作为产品打磨的开始。
赵伟:金融行业的竞争比较激烈,各大厂也都挤在金融行业里,而且通常成单周期比较长。虽然金融行业有很多MySQL用户,但我们现在这个阶段去金融行业可能还有点早,可能要做到第一百个客户再去找金融行业。我们目前还在制造业、教育、医疗、能源、交通等行业开拓。
问:在开拓客户的过程中,会面临很多定制化需求吗?
赵伟:会有些,但这些定制都是和数据有关的。用户有需求,产品原先没这功能,这就叫一定程度的“定制”。但“定制”的功能是有通用性的,可以成为产品矩阵的组成部分。比如我们之前因为客户的需求增加了一个功能:让他们从社区MySQL把数据动态迁移过来后,可以在一段时间内双库运行,还能随时进行增量对比校验,确保双库数据相同。这个功能现在已经成了我们产品矩阵里的组件。
问:国内市场定制化需求会比较常见吗?
赵伟:有的。但不能让用户做“产品经理”。在ToB场景中,很多用户常常不知道自己真正需要什么,我们要做的就是帮他们解决业务场景的问题——帮客户设计解决方案、规划产品能力,然后研发实现。同时,如果是需要浪费很多时间和人力去做的应用层定制化开发,只能给一个客户使用,缺乏通用性、不能产品化,那可能就要做一些取舍了。
DeepSeek给私有化部署数据库产品带来增长点
问:现在泽拓能实现收支平衡了吗?
赵伟:今年可能可以实现。
问:前几年国内软件市场价格战比较明显,泽拓会受到波及吗?
赵伟:公有云上的价格确实比较低,比如小客户1核2G一年可能就几百块钱。一个创业公司如果还在迭代产品阶段,一年买云数据库可能就花不到一万块。云厂商有体系化的优势,可以把价格压得很低。但我们不跟他们比价格,毕竟后续技术服务都有成本。我们通过产品能力和技术服务来获取差异化竞争优势。
问:咱们在2024年完成了A轮融资,是吗?当时是怎么打动VC的?
赵伟:对,我们只做过两轮融资。投资人在2024年底找到我们,经过交流和对项目的深度考察,挺认可我们的产品和团队。同时还有个重要因素:我们一直把估值控制在很合理的区间,我觉得这样做心里比较踏实。后来证明这是对的,至少投资人不会觉得价格太高。
问:那么,DeepSeek热潮发展起来后,对数据库行业有什么影响?
赵伟:带来了更多向量数据管理的需求。我们2024年底把向量数据管理能力加入到昆仑数据库里去了。当时PGVector迭代很快,但PostgreSQL是集中式数据库,单个向量就好几KB,一个大模型RAG应用假设需要管理一亿个向量,就是TB级的数据量;而且大模型每个向量的维度很大,导致向量数据的常见计算负载非常大。集中式数据库使用单台服务器的资源,承载不了这么大的存储和计算负载。
问:那DeepSeek热潮对数据库公司来说,增长点可能在哪里?
赵伟:DeepSeek开启了国内各公司、各单位可以放心大规模使用大模型的生态环境,尤其是政府事业单位和国企。大模型有个特点:比如RAG的向量数据包含各个公司内部的特定领域知识,用户未必愿意把这些数据放到云上,于是便出现了更多私有化部署的需求——这对数据库产品来说是个机会。公有云厂商还是更希望用户上云,这样可以减少实施成本。
问:对数据库的技术会提出新的要求吗?
赵伟:向量数据的特点是数据量和计算量都特别大,所以要能非常有效地管理向量数据,目前还有提升空间。这是新的赛道。前两年大家想的还是怎么把RAG应用基于大模型跑起来,处于产品研发和推广阶段,数据量和计算负载都不大,在成本、效率方面也没那么在意。但接下来,大家会开始越来越重视全系统的效率、成本、可靠性、性能、业务连续性等各个方面。
问:像向量数据库这类专用数据库,未来发展趋势如何?
赵伟:专用数据库也分多种。像图数据库和关系型数据库的区别就非常大,甚至可以说底层算法和理论是相互冲突的。以前Oracle曾试图做过Oracle Graph,但似乎没有普及开来——因为用关系表存储图,然后基于表连接来实现图遍历,这样的效率实在太低了。另外,Redis这样的纯内存数据库,其使用场景和需求、运行的环境或条件也和关系型数据库完全不一样。所以这些专用数据库都有其特定的场景和用户群,与常见的关系数据库差异较大。向量数据是一种数据类型,可以嵌入关系型数据库里。我们在昆仑数据库中支持向量数据管理只用了不到3个月,因为昆仑数据库的基础能力可以支持包括向量数据在内的丰富数据类型,我们只需要为实现向量数据的存储和计算能力而研发即可。
问:国产数据库在2020年前后经历了百花齐放,但到2024年底,墨天轮中国数据库流行榜收录的数据库产品较前一年减少了大约60个。您怎么看这种情况?
赵伟:我感觉本质上可能没有两三百家数据库公司。真正活跃在社区里、正式有产品介绍和产品发布的,可能也就五六十个产品。而且这其中,国内几个大厂的产品又占了接近一半。细分到每个产品类别和维度之后——比如TP型、AP型;关系型、图型、NoSQL、时序型、JSON型;内存型、集中式、分布式等等——每个小分类里的产品其实并不多。不过,这些产品如果仅在国内发展,空间仍然会比较受限。我们对未来的发展抱有谨慎乐观的态度,但认为国内各基础软件厂商需要出海,去做全球的客户。
专题介绍
2020年前后,国产数据库创业大潮汹涌。然而,随着AI大模型的出现,人们视线的聚焦与资本的兴趣也发生转变。五年过去,国内的数据库公司现状如何?他们在做什么新的尝试?又遇到什么新的困难?本专题与一系列数据库创业公司的创始人对话,回顾近年数据库公司在商业和技术领域的探索。纵然面对数据库市场的寒冬,从业者们各有招数,怀揣着对数据库的理想与确信,走出各具特色的商业化之路。
