IBM近期将Ceph的块存储与文件存储能力向前推进了一大步,其明确目标是让Ceph作为Storage Scale并行文件系统的底层数据存储层,专门服务于AI工作负载。

作为开源项目,Ceph底层基于对象存储,上层提供文件、块和对象三种存储接口,并具备自修复与自管理能力。2019年,IBM以340亿美元收购红帽,Ceph随之纳入IBM旗下。一年多前,IBM将Ceph产品从红帽业务部门划归至存储部门,并更名为Storage Ceph。IBM Storage Ceph技术产品经理Gerald Sternagl在上月博客中透露了后续开发计划,随后IBM存储业务总经理Denis Kennelly通过简报补充了更多细节。
作为IBM存储业务(涵盖硬件与软件)的负责人,Kennelly透露,IBM存储收入中硬件约占三分之二,软件占三分之一。2023年,IBM在硬件存储市场,尤其是高端DS8000阵列和FlashSystem全闪存阵列领域,市场份额有所增长。当被问及Ceph销量是否随之上升时,他简洁回答:“有,当然有。”
IBM Storage当前聚焦三大战略方向:混合云、人工智能(AI),以及数据恢复与弹性。Ceph在混合云和AI领域均扮演关键角色——其核心作用是在大语言模型处理系统介入之前,帮助用户打通非结构化数据的访问通道。
IBM的Storage Defender产品与Cohesity保持着长期合作关系。随着Cohesity收购Veritas,IBM在数据恢复与弹性领域的市场地位随之增强。从逻辑上看,这笔交易也为IBM在原有Veritas客户群中开拓新销路提供了机会。Kennelly直言:“备份市场显然正在经历一轮兼并浪潮。”
回归Ceph本身,Kennelly认为其完美契合软件定义存储市场的需求。他解释称,红帽已将Ceph、OpenShift和容器技术整合在一起。而IBM的构想是,通过一套运行在商用硬件上的完整软件定义存储技术栈,进一步推动这一进程——硬件方面,戴尔、HPE、联想、Supermicro等厂商的服务器和存储设备均在考虑范围之内。
过去一年,IBM为Ceph的块存储新增了NVMe/TCP支持,并提升了可用性。Kennelly特别指出,AI项目常需存储容量达到100 TB级别,传统SAN方案在此类场景下往往力不从心——光是规划扩展可能就需要20到30个独立步骤。而在Ceph环境中,“用户可以直接将100 TB容量的设备加入集群,即刻可用。”更重要的是,Ceph对硬件兼容性极佳。他甚至透露:“WatsonX团队也在与Ceph紧密合作。”WatsonX是IBM自家的生成式AI平台。
当被问及Ceph是否计划支持GPUDirect时,Kennelly坦诚回应:“我们确实在考虑这个事情。”但他同时指出,IBM Storage已拥有一款出色产品——带并行文件系统的Storage Scale,它可通过GPUDirect将数据快速传输至GPU服务器。“Storage Scale支持GPUDirect,我们可以将Scale与底层运行的Ceph配对使用。”
Storage Scale还提供AFM(主动文件管理),这是一种高性能文件系统缓存层,可链接至Ceph后端。AFM允许用户在本地Scale集群与远程存储之间建立关联,定义文件数据流向,实现自动化管理。由此,用户能够在全球各站点间构建统一命名空间的数据存储视图。
IBM持续对这套Scale-Ceph组合进行基准测试。Kennelly对结果表示满意,预计将在今年晚些时候正式公布。Scale-Ceph的核心思路是数据保持原位,由IBM执行查询,这与Snowflake、Databricks那种“你把数据交给我,我来帮你查”的模式有所不同。
“随着市场对快速查询的需求日益增长,Storage Scale的优势愈发凸显。”Kennelly补充道,“用户当然可以使用NFS,但永远无法达到Scale那样的性能表现。”
在他看来,“AI即将迎来一次重大变革,面对这个令人兴奋的节点,我们还有很多工作要做。”而Ceph正是那个强大的基础平台,通过作为底层数据存储方案的Storage Ceph,将自身管理的数据交付给运行在GPU服务器上的大语言模型。
