游乐游手机版
首页/AI热点日报/热点详情

西部数据WAIC公布AI数据存储架构创新路线图

类型:热点整理2026-07-22
近日,西部数据在WAIC上公布HDD创新技术,其高带宽双枢轴组合使顺序输入输出性能提升4倍,单盘容量达100TB。该公司提出AI存储栈四层架构,约80%数据存于HDD。未来五年将并行发展ePMR与HAMR两种技术,目标2029年单盘容量突破100TB。

先说一个核心判断:AI能否真正实现可持续、经济高效的规模化发展,关键取决于数据如何存储、管理和保障。在刚刚落幕的WAIC 2026上,西部数据通过展台展示与专题分论坛,对此进行了深入剖析。

展台上,他们亮出了两项业界首创的HDD技术——高带宽硬盘技术和双枢轴硬盘技术,并结合HAMR、ePMR和UltraSMR等硬核技术。这些技术并非孤立存在,而是与整个平台产品线深度整合,专为规模化AI基础设施量身打造。

其中,高带宽硬盘技术颇具亮点——多磁头同时在多个磁道上读写,功耗保持不变,带宽却能达到传统HDD的两倍。而且,该技术具备清晰的扩展路径,未来最高可实现8倍的带宽增益,目前已交付客户进行验证。双枢轴技术则在独立枢轴上增加了第二组独立运行的执行器,在3.5英寸硬盘中可提供2倍顺序IO性能增益。与以往那些牺牲容量、需要客户大幅修改软件的双执行器设计不同,它通过缩小磁碟间距,在单盘内集成更多磁碟,容量也随之提升。

这两项技术组合在一起,能将HDD的顺序IO性能整体提升至4倍,实现100TB容量,同时保持每TB的IO速率不变。这意味着客户在扩容时,无需急于增加SSD或重构服务架构。

当然,展出的内容不止这些。还有面向大规模数据存储环境的Ultrastar企业级HDD系列:40TB和34TB的Ultrastar DC HC6100 UltraSMR硬盘、30TB和28TB的Ultrastar DC HC5090 CMR硬盘、采用HAMR技术的40TB Ultrastar DC HCS100 UltraSMR硬盘,以及采用高带宽和双枢轴技术的性能优化型硬盘。值得注意的是,采用UltraSMR ePMR技术的40TB HDD已进入客户认证阶段,预计2026年下半年量产。

存储平台方面,全新Ultrastar Data60 3000混合存储平台、OpenFlex Data24 4200存储平台以及RapidFlex C2000网络交换桥接适配器也一并亮相,目标十分明确:支持可扩展部署,灵活调配资源,满足现代数据基础设施的需求。

7月19日下午,西部数据举办了以“面向AI时代的数据存储架构创新”为主题的分论坛。西部数据开发工程高级副总裁Tim Rausch做了主题演讲,他从一个关键差异点切入:计算周期可以重复利用,但数据会持续累积。

Tim强调,AI本质上不仅是计算系统,更是数据系统。训练和推理循环往复,每一次交互都会产生新数据,这些数据被存储下来,再重新纳入训练,用于改进后续模型。因此,存储需求变得持续且累积。如何高效管理这些海量数据,才是行业真正的核心挑战。

他重点阐述了三类工作负载:

第一类是训练数据。通常一次写入,存储在HDD上,周期性读取——因为模型并非24小时都在训练。随着用户生成的内容回流到AI数据循环中,训练数据量还会持续增长。因此,这一层最看重的是能够扩展到EB级、成本效益高的存储——这正是HDD的用武之地。

第二类是推理。例如,你让AI提供晚餐食谱、生成一张图片,同时还有数百万用户也在进行类似操作。这会产生大量随机小数据读取,还需用内存来保留对话上下文。因此,这一层既需要高带宽和高IOPS,也需要持久化存储——这正是SSD的舞台。

第三类是推理输出。AI生成的食谱、图片、日志、追踪记录、合规记录和元数据,都归属于此。许多数据最初存放在HBM或DRAM中,但很快会向下迁移到HDD进行持久化存储。

值得注意的是,AI存储栈与传统云应用的存储栈有所不同。传统应用可能仅有两个层级:闪存和HDD。例如,一个应用中有几千张图,用户打开时最先看到的10到20张从闪存中调取,快速呈现;再往下翻,则从HDD加载,因为HDD更具成本效益。开发者根据性能和成本,将内容放置在合适的层级。AI构建者沿用同一套原则,但层级更多。

最上层是模型权重和GPU显存溢出,即HBM或DRAM,紧邻昂贵的GPU,持续为其提供数据。下一层是KV缓存,也就是AI系统的短期记忆,主要使用DRAM和SSD。再下一层是语义数据库,存储向量、嵌入和RAG数据,通常运行在SSD上的高性能数据层。最底层就是HDD大容量存储,用于保存日志、用户生成内容副本和训练数据。

“在规模化发展中,经济性决定架构。”Tim这句话点明了关键。用闪存处理性能敏感型的小数据读取,用HDD承载不断累积的写入流——这种智能数据分层与均衡的存储架构,不仅能应对持续增长的数据规模,还能让AI基础设施变得务实、优雅且经济可行。

他举了一个例子:生成一个3.97MB的视频,需要在整个存储栈内完成46.5GB的读写,最终在后端留下506MB数据。当推理输出被存储、重新纳入系统并用作合成训练数据后,就会形成“模型改进—更多推理—更多输出被留存”的自我强化循环,持久存储层也随之不断壮大。

Tim认为,成功的AI企业会将数据放置在正确的层级,并让数据在AI存储栈的4个层级中持续迁移。“目前我们看到,约80%的AI内容存储在HDD上,20%在SSD上。”他特别强调,这并非指HDD市场份额应更高,而是数据总量本身在增长,HDD和SSD并非存量竞争,而是互补关系。HDD、SSD、DRAM、HBM,各自按性能和成本部署在最合适的位置。

最后,西部数据还透露了未来五年的路线图。他们将采取ePMR与HAMR并行发展的路径,帮助客户平稳迈向2029年单盘100TB以上的容量。对于需要高性能的工作负载,采用高带宽和双枢轴技术来提供带宽和IO性能增益。针对AI交互生成并需要持久留存的数据,则使用功耗优化型HDD来提供经济可持续的解决方案。此外,他们还将利用智能平台,将HDD的经济性和优势延伸至更广泛的客户群体。

来源:https://www.163.com/dy/article/L2D8EUJT051180F7.html

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。