Special offer. See more information about Outbyte and uninstall instructions. Please review EULA and Privacy policy.

Some links on this page are affiliate links: if you buy through them we may earn a commission, at no extra cost to you.

截至2026年9月,HPE的Cray路线已不只是传统超级计算机:以新一代GX5000为核心,组合覆盖CPU与GPU计算刀片、高速网络、并行存储、系统软件、直接液冷和整机交付。GX5000面向AI训练与传统模拟仿真共存的大型系统;EX4000则仍是HPE当前的领导级超算平台之一。两者并行,而非GX5000已宣布取代EX4000。

这次扩展的重点:从超算平台到完整系统组合

HPE扩展Cray产品组合的意义,不在于发布一个新机柜或单一GPU服务器,而在于把异构计算、互联、存储、管理软件和冷却作为一个系统来设计。GX5000可以组合CPU-only与GPU加速刀片,面向同一中心内的传统高性能计算(HPC)、AI训练和数据分析负载。HPE也提供EX4000、K3000与E2000等相关平台或组件,供不同规模和工作负载的项目选择。

这对采购方很重要:超级计算系统的实际表现不仅由芯片决定,还取决于节点间通信、数据供给、作业调度、设施冷却和应用移植。HPE的卖点是承担更大范围的集成责任;代价则是项目复杂、成本需要定制报价,且需要核实各部件的交付状态和软件兼容性。

Special offer. See more information about Outbyte and uninstall instructions. Please review EULA and Privacy policy.

从2024到2026:产品组合如何演进

  • 2024年11月:HPE扩展直接液冷超算方案,公布EX平台、Blackwell相关方案、E2000存储及软件组合信息。HPE公告中一些型号的上市时间当时仍是预计日期,不能据此推断其当前可订购状态。
  • 2025年10月至11月:GX5000亮相,随后HPE公布AMD与NVIDIA计算刀片、Slingshot 400网络、K3000存储和管理软件等扩展。2025年11月公告给出多项刀片和机柜配置上限。
  • 2026年3月:HPE宣布GX5000可采用NVIDIA Vera CPU计算刀片,并增加NVIDIA Quantum-X800 InfiniBand选项;同一公告也介绍了更广泛的HPE AI Factory方案。公告
  • 2026年7月:HPE公布搭载第六代AMD EPYC处理器的GX5000版本,并更新Discovery、Herder等项目进展。HPE博客

公告、计划和已部署系统不是同一状态。采购时应直接确认指定刀片、加速器、软件版本在所在地区是否正式可订购、预计交付时间及支持周期。

GX5000与EX4000:新旧平台并存

HPE将GX5000定位为面向下一代AI与HPC融合的超级计算平台,强调异构配置和高密度;EX4000则是当前领导级超算平台之一。HPE产品页面称,EX4000支撑了2025年6月Top500榜单前100名中超过一半的系统,这是HPE采用该榜单时点和统计口径给出的说法。它说明EX系列已有广泛部署,但不能单独证明某个具体配置更适合某项工作负载。

维度 GX5000 EX4000
定位 新一代、强调AI与HPC融合及异构刀片 当前主力领导级超算平台之一
决策重点 密度、CPU/GPU分区组合、平台新颖性与项目交付验证 成熟部署经验、既有系统适配及具体配置能力
网络与冷却 可选Slingshot 400或Quantum-X800;平台采用直接液冷设计 依具体EX系统和配置核实网络及冷却方案
采购判断 适合评估新一代融合系统,但需做目标应用和设施验证 适合重视既有平台经验的项目,也需与新方案按实际负载比较

HPE资料并未宣布EX4000停止销售或支持,因此不应把GX5000描述成其已完全取代者。两者更像面向不同项目时间表、配置和风险偏好的并行选择。HPE当前Cray超算组合页面列出了两条平台路线及相关产品。

GX5000计算刀片:按负载配比,而不是追逐数字

HPE公布了不同CPU与加速器路线。下表的机柜数字是公告中的配置上限,不代表每个客户系统都会采用最大配置,也不能直接换算成应用性能。

Special offer. See more information about Outbyte and uninstall instructions. Please review EULA and Privacy policy.
刀片 公告配置 适用方向与注意点
GX440n加速刀片 每刀片4颗NVIDIA Vera CPU、8颗NVIDIA Rubin GPU;每机柜最多24个刀片、192颗Rubin GPU 面向NVIDIA路线的AI及混合精度计算。实际软件栈、GPU间通信和可订购状态须按具体配置确认。
GX350a加速刀片 每刀片1颗AMD EPYC“Venice”CPU、4颗AMD Instinct MI430X GPU;每机柜最多28个刀片、112颗GPU 面向AMD路线的AI与HPC。需要核验ROCm、编译器、框架及既有应用适配。
GX250计算刀片 每刀片8颗AMD EPYC“Venice”CPU;每机柜最多40个刀片 适合CPU密集型、双精度模拟等任务;核心数本身不代表内存带宽或应用吞吐。
GX240计算刀片 每刀片最多16颗NVIDIA Vera CPU;每机柜最多40个刀片、640颗Vera CPU及56,320个Arm兼容核心 提供高密度CPU计算路线。要确认编译工具、数学库及应用对目标CPU架构的支持。

HPE在2026年7月还称,第六代AMD EPYC版本每机柜可提供81,920个CPU核心,并较上一代减少25%的数据中心空间需求。这些是HPE按其比较口径公布的产品数据,不是独立基准。采购者应要求说明对比系统、机柜配置、功耗边界和实际可用资源。

AI和传统HPC的资源偏好并不相同。模拟仿真常看重双精度性能、内存带宽和MPI通信;AI训练则更受GPU显存、加速器互联、输入数据管线和检查点效率影响。GPU刀片过多可能让传统作业承担不必要的成本,CPU节点比例过低则可能造成数据预处理或模拟队列拥堵。应以实际作业队列和用户需求决定配比。

网络:端口速度不等于训练速度

GX5000可配置HPE Slingshot 400,公告标示单端口400Gbps,并给出512、1,024或2,048端口的交换机配置规模;HPE也宣布可选NVIDIA Quantum-X800 InfiniBand,单端口800Gbps。HPE称Slingshot交换机刀片针对高密度系统设计并纳入液冷方案。

对分布式训练而言,网络影响梯度同步、集合通信和尾延迟;对HPC而言,MPI通信模式和拓扑同样关键。但端口额定速率不是模型训练速度,也不是所有节点都能同时获得的端到端带宽。要求供应商用目标节点数、通信库和模型或模拟代码展示集体通信测试,并说明拓扑、过订阅率、拥塞控制和故障时的表现。还要确认Slingshot与InfiniBand在运维工具、应用栈、互通性和人员技能方面的差异。

Special offer. See more information about Outbyte and uninstall instructions. Please review EULA and Privacy policy.

存储:DAOS与Lustre针对不同需求

HPE将K3000定位为基于DAOS的高性能存储路线,面向AI数据管线和I/O密集型应用;E2000采用Lustre并行文件系统,面向大型超算和传统HPC环境。HPE称K3000为工厂集成DAOS的超算存储系统,并宣传其适用于PyTorch、TensorFlow等框架;HPE还称E2000较上一代I/O性能提升超过一倍。具体收益仍取决于实际配置和负载。相关产品信息见HPE Cray页面和2025年公告。

DAOS与Lustre不是简单的快慢等级。选型要看应用所需的文件语义、POSIX兼容、元数据操作、检查点模式、训练数据读取方式、现有软件工具链和运维经验。基准测试至少应覆盖大文件顺序读写、小文件元数据、并发作业、模型加载、检查点写入和故障恢复,并核实两种存储路线之间的数据迁移成本。

直接液冷:密度优势依赖设施条件

GX5000采用HPE所称的100%直接液冷平台设计。HPE表示平台可支持最高约40°C的温水设施条件,并在2026年AMD版本公告中强调空间利用率改善。这里的“100%液冷”描述的是平台系统设计,不表示整座数据中心不需要其他散热设备,也不意味着任何现有水系统都可直接接入。

项目评估应逐项核实设施供水温度、流量、压力和水质;是否需要冷却液分配单元(CDU)、二次回路或额外换热设施;漏液检测和维护流程;泵、CDU或回路故障时的降级策略;维护是否需要停机;以及余热是否能真正接入园区或建筑。温水冷却和高密度可以带来空间与能源方面的潜在收益,但改造、运维和备件成本也必须纳入总拥有成本。

Free tools Windows power users keep installed

One-click scans. No signup required.

Special offer. See more information about Outbyte and uninstall instructions. Please review EULA and Privacy policy.

系统软件与日常运维

HPE把Supercomputing Management Software定位于系统部署、监控、扩容、电力与冷却管理、多租户和安全治理等任务,并提供用户服务软件、Cray编程环境及大规模程序开发、调优和调试工具。其价值不只是提供仪表盘,而是尝试把复杂系统的安装与运维纳入同一交付范围。

不过,“支持容器”不等于公有云式的弹性体验。超算中心仍要解决调度器、MPI、CUDA或ROCm、GPU驱动、并行文件系统、软件模块、用户配额、节点隔离和身份认证等具体问题。多厂商加速器路线可以减少对单一硬件路线的依赖,却会增加编译器、容器镜像、调优、驱动升级和安全补丁验证工作。采购前应获取明确的软件支持矩阵、升级窗口、故障响应责任和应用移植服务范围。

Independent reader supportYour contribution helps us test, update, and keep practical guides available for everyone.Support on Ko-Fi

项目案例说明了什么,尚未说明什么

  • ORNL Discovery:HPE、AMD与美国橡树岭国家实验室合作建设的GX5000系统,规划用于模拟、AI模型开发与训练以及量子计算测试。它显示GX5000面向AI与科研HPC共存的应用,但项目规划不能当成已上线性能结果。
  • ORNL Lux:专用AI系统,旨在加速AI开发,并与美国Genesis Mission相关。它是组合中偏AI的项目,不应与GX5000本身混为一谈。
  • HLRS Herder:斯图加特大学高性能计算中心选择GX5000建设下一代系统。HPE称其预计较HLRS现有超级计算机强大约7倍;这是项目预期口径,不是已验收的实测结论。
  • LRZ Blue Lion:莱布尼茨超级计算中心选择GX5000。HPE转述的项目规划包括100%直接液冷、最高40°C温水运行及相较当前系统最高30倍性能的预期。该倍数不能推广为GX5000对任意系统的普遍性能提升。

这些案例是客户采用和系统规划的信号,不等于所有项目已全面投产。HPE还公布了EX平台其他产品的配置与上市计划;旧公告中的“预计上市”日期不能代替2026年的正式可售确认。

谁应该考虑GX5000,谁应谨慎

适合认真评估:国家实验室、大学HPC中心、主权AI项目和大型企业基础设施团队,尤其是需要在一套系统内运行传统模拟、AI训练及CPU/GPU混合任务,并拥有成熟HPC运维能力的机构。若机房空间或冷却能力受限,且组织能投资液冷设施,高密度设计也可能有吸引力。

Special offer. See more information about Outbyte and uninstall instructions. Please review EULA and Privacy policy.

不一定合适:只需要少量GPU做推理、微调或开发的团队;主要依赖云端Notebook且没有HPC调度经验的组织;无法改造液冷和高速网络的机房;或尚未验证关键应用在CUDA、ROCm或目标CPU架构上表现的团队。此类用户可把标准GPU服务器、公有云AI集群或NVIDIA DGX等方案列入比较。Dell PowerEdge AI系统、Lenovo Neptune和Supermicro GPU系统也可作为不同交付模式的比较对象,但必须按同一规模、网络、存储、软件支持和服务范围比较,不能只看服务器单价。NVIDIA DGX、Dell AI、Lenovo HPC及Supermicro AI页面可用于了解各自方案定位。

采购前应让HPE验证什么

  1. 配置与状态:索取完整物料清单(BOM),列出刀片、CPU/GPU、网络、存储、软件版本、所在地区可订购状态、交付周期和支持期限。
  2. 真实应用性能:用本机构的目标模型和模拟代码测试端到端吞吐、作业时间、多用户并发及故障恢复;不要只接受核心数、理论峰值或厂商营销指标。
  3. 计算与网络基准:要求提供与项目配置相符的HPL、HPCG、AI训练吞吐和网络集合通信结果,并说明测试规模、软件版本、精度、功耗和拓扑。
  4. 存储行为:测试数据预处理、模型权重加载、检查点写入、元数据操作、并发读写和恢复时间,并确认DAOS或Lustre与现有应用和工具的兼容性。
  5. 冷却与能耗:获取设施侧水系统要求、CDU方案、功率预算、运行条件和PUE假设;明确故障降级、维护停机及现场服务安排。
  6. 软件与安全:确认调度器、MPI、CUDA/ROCm、驱动、容器、文件系统、身份认证和补丁版本的支持矩阵,以及升级和回滚流程。
  7. 完整成本:让报价分别列出硬件、软件许可、网络与存储、机房及液冷改造、部署、培训、维保、备件和升级费用。对项目制超算而言,初始设备价格只是总拥有成本的一部分。

GX5000、EX4000及相关存储方案没有可据以比较的统一公开零售价,通常需要按项目配置询价。可通过HPE联系入口申请技术评估、报价或概念验证,并要求把上述指标写入方案和验收条件。

Product prices and availability are accurate as of the date/time indicated and are subject to change. Any price and availability information displayed on Amazon at the time of purchase will apply.