AI 存储,四种关键路径,一套权威基准
AI 系统触达存储的方式只有四种:训练数据流、检查点、KV Cache、向量检索。MLPerf® Storage v3.0 首次将它们纳入同一套基准,让"AI存储性能"第一次有了可横向比较的统一标尺。
Solidigm 交出答卷:一台服务器、一块 SSD、七项全过
Solidigm D7-PS1010 与Solidigm D5-P5336 企业级SSD通过七项MLPerf Storage v3.0 工作负载:一台服务器、一块 SSD,跑通全部工作负载,全部成绩进入 CLOSED 排行榜。

要点
MLPerf Storage V3——从以训练为中心的I/O到完整的AI数据链路
MLPerf Storage V3 是由 MLCommons 组织发布的全球权威 AI 存储性能基准测试套件的最新版本。它主要用于标准化地评估和验证存储系统在应对机器学习任务时的端到端性能。V3 版本从 V2 的训练为主的工作负载,拓展到了四项工作负载,代表了 AI 生命周期中核心的存储访问模式。
四项工作负载

测试系统
Solidigm为AI存储打造了两种解决方案,我们测试了两者:PCIe Gen5 TLC SSD Solidigm D7-PS1010,专为性能和低延迟设计,以及PCIe Gen4 QLC SSD Solidigm D5-P5336 ——我们测试了61.44 TB型号,该系列单设备可容纳多达122 TB的AI数据集。

硬件同样简单:一台NewFW的裸金属(2×AMD EPYC 9655,192核心/384线程,377GB DDR5,Ubuntu 24.04),每块SSD通过PCIe直连到主机上——没有SAN、NAS、中间不经过任何网络节点。
以下成绩是系统级调优的成果,不是一张驱动器规格表 —— Solidigm 的企业级 SSD,加上 NewFW 在内核 VFS 与 XFS 层面的调优,缺一不可。所有工作负载测试均通过 NewFW 的 CWP 云工作负载平台下发测试任务,cwp-agent 插件在测试机上自动化运行 mlpstorage 测试套件,并实时监控和上报系统和硬盘各项数据指标,最后生成分析报告。正是通过 CWP 平台,我们得以积累大量测试数据和经验,通过分析不断优化,才最终交出一份满意的答卷。
测试结果
四个工作负载全部通过 MLCommons CLOSED类别验证:Training I/O、Checkpointing、KV Cache 在两块盘上均达标,Vector Database 在Solidigm D7-PS1010 上达标。
Training I/O(Unet3D)
Solidigm D7-PS1010以11.61 GiB/s的数据传输率,使模拟的B200加速器利用率保持在98%以上;Solidigm D5-P5336提供5.76 GiB/s的数据传输率,加速器利用率达到了97.7%的速度——对于一个为单个加速器提供数据驱动的存储设备来说,这是一个非常出色的成绩。

如何解读这些数字。每个模拟的B200理论上对存储的供给需求约6.3 GB/s,因此两个加速器加起来约12.7 GB/s——Solidigm D7-PS1010提供11.61 GiB/s(约12.5 GB/s),并且在连续五轮连续测试中,保持加速器利用率在98.4%。第三个B200将推高需求超过19 GB/s,超出单个PCIe Gen5 x4 NVMe SSD的性能——因此两个B200是(单块SSD)能够满足的最大配置。加速器利用率(Accelerator Utilization)是指模拟GPU计算而非等待存储的时间比例。作为基准测试的结论,要求 AU在连续五次验证运行中≥90%。
如何与我们的v2测试进行比较。图表将v3与我们测试的Solidigm D7-PS1030(6.4TB PCIe Gen5 TLC SSD,H100/A100配置文件)并列对比:
Checkpoint(Llama 3.1 8B)
Solidigm D7-PS1010 的检查点保存吞吐量达 8.64 GiB/s,恢复吞吐量达 13.00 GiB/s。相较于Solidigm D5-P5336,其保存与恢复性能分别提升 2.8 倍和 2.6 倍。该数据直观证明了 PCIe Gen5 TLC SSD 在解决 AI 基础架构中突发密集型写入瓶颈方面的核心优势。

KV Cache(Llama 3.1 8B)

直击显存溢出痛点:Solidigm D7-PS1010 重新定义 KV Cache卸载极限
当 LLM 推理遭遇上下文溢出,KV Cache 卸载至 NVMe 会瞬间触发海量随机小块读写。在严格遵循封闭规则的极限压测中(GPU缓存归零,溢出字节完全由 SSD 承载),Solidigm D7-PS1010 展现了统治级的硬件底层性能。三大极限测试场景(零 GPU 缓存配置):

核心性能突破:
向量数据库(1000万向量×1536维度,Milvus + DiskANN)
在极具挑战的向量检索(RAG、推荐系统)生产环境中,Solidigm D7-PS1010 展现出了卓越的底层 I/O 承载力与极端工况下的抗压底色。
我们是怎么做到的
标准化基准测试中的亮眼成绩绝非偶然。这源自全栈工程的深度打磨——从上层应用到底层 NAND 闪存的系统性架构优化,以及确保测试流程严丝合缝的自动化工具。

我们的方法论涵盖五个步骤:
工程师的Tuning + NewFW CWP 自动化测试核心引擎自动化正是 NewFW 技术的杀手锏。我们的云工作负载平台(CWP)将每个基准测试打包成标准“配方”——这是对所有命令、参数和验证规则的版本化、可审计定义,让测试蜕变为“执行、观测、审查、调优”的持续闭环。这些测试配方由 CWP 代理一键下发至测试主机,实现全自动执行与实时监控。正是这套严密的自动化测试体系,让我们能够自信地向 MLCommons 呈交每一份经得起推敲的卓越成绩单。
为什么这很重要
对客户来说:您现在拥有可信、经独立验证的 AI 存储容量基准——源自业界最严苛的测试流程并完整公开披露。规划训练集群、设计检查点策略或部署推理服务时,您可以站在实测数据而非营销口径之上做决策。
对行业来说:单主机、单 SSD 的透明提交,为基准测试树立了新的诚信基准底线。无论客户、竞争对手还是研究人员,都能完整核查我们所用的硬件、调试方法与被测内容——这才是 NAND SSD 基准应有的样子:可验证,可复现,公开透明。
丁丁打折网©版权所有,未经许可严禁复制或镜像 ICP证: 湘ICP备2023003002号-11
Powered by 丁丁打折网本站为非营利性网站,本站内容均来自网络转载或网友提供,如有侵权或夸大不实请及时联系我们删除!本站不承担任何争议和法律责任!
技术支持:丁丁网 dddazhe@hotmail.com & 2010-2020 All
rights reserved