Recommended Free Tools
Some links on this page are affiliate links: if you buy through them we may earn a commission, at no extra cost to you.
HPE推出的不是一台名为“AI工厂”的服务器,而是一组以NVIDIA Blackwell GPU为核心、整合计算、存储、网络、AI软件、管理和服务的企业基础设施方案。其面向企业的重点是HPE Private Cloud AI;面向更大规模多租户部署的方案则包括AI factory at scale和Sovereign AI factory。HPE Store已列出带RTX PRO 6000 Blackwell Server Edition的Private Cloud AI配置,但没有统一公开售价,具体配置、地区供货与交付时间仍须向HPE或合作伙伴确认。
HPE所说的“AI工厂”是什么
AI工厂不是传统工厂,也不只是堆放GPU的集群。它是把GPU和CPU服务器、GPU互联与网络、数据存储、AI软件、资源调度、监控、安全隔离及部署服务组合起来的一套基础设施。目标是让企业能较快地把数据送入模型训练、微调或推理流程,并在多团队使用时管理资源、权限和运行状态。
HPE在2025年6月24日HPE Discover期间公布了与NVIDIA合作的AI工厂产品组合。其主张是减少客户自行挑选和验证服务器、存储、驱动、网络及软件的工作量,而不是提供现成模型或自动开发AI应用。HPE发布公告将方案分为三类:
Outdated Drivers Are Slowing You Down
One free scan finds every outdated or missing driver and matches the right update for your exact hardware.Free scan · exact hardware matchWindows Errors? Fix Them Before They Spread
Repair common Windows errors and clear accumulated junk for a smoother, more stable PC - no reinstall needed.Free scan · no reinstall| 方案 | 主要对象 | 解决的问题 |
|---|---|---|
| HPE Private Cloud AI | 希望在自有数据中心运行AI的企业 | 以交钥匙私有平台部署RAG、智能体及推理工作负载,并提供隔离管理和多租户能力 |
| AI factory at scale | 模型构建者、GPU云及服务提供商 | 通过集群级资源池、调度、网络和液冷支持更大规模、多用户部署 |
| Sovereign AI factory | 政府、公共部门及有主权运营要求的机构 | 围绕数据、技术和运营主权构建基础设施与服务,可包含气隙管理能力 |
“主权”不是自动获得的认证,也不保证系统天然符合某一国家或行业法规。采购者仍需核实数据驻留地点、运维人员所在地、远程支持方式、密钥管理、供应链、许可证和适用认证。
#1 Best Overall
- BALANCED PERFORMANCE SERVER FOR VIRTUALIZATION AND CORE BUSINESS WORKLOADS: HPE ProLiant ML350 Gen12 (P87796-005) powered by Intel Xeon 6505P (12 cores) with 64GB DDR5 memory and 8 SFF drive bays with SSD storage, delivering flexible performance for virtualization, databases, and SMB infrastructure
- PROCESSOR AND MEMORY – 12-CORE XEON WITH DDR5 PERFORMANCE AND SCALE: Powered by Intel Xeon 6505P 12-core processing and 64GB DDR5 memory, this configuration delivers balanced compute performance for business applications, virtual machines, and infrastructure services while supporting future expansion as workload needs grow.
- STORAGE – SSD SPEED WITH FLEXIBLE 8SFF EXPANSION: Configured with 960GB SSD storage and an 8 SFF chassis, this ML350 Gen12 supports fast boot and application responsiveness while enabling additional storage expansion for transactional workloads, virtualization, and evolving business data needs
- STORAGE CONTROL – ENTERPRISE RAID PERFORMANCE AND DATA PROTECTION: HPE MR408i-o storage control provides RAID support for performance, availability, and reliable data protection, helping IT teams maintain business continuity across application, database, and virtualized workloads
- MANAGEMENT AND SECURITY – HPE iLO 6 WITH BUILT-IN PLATFORM PROTECTION: HPE iLO 6 supports secure remote management, monitoring, and lifecycle control, while security technologies such as TPM 2.0, Secure Boot, and Silicon Root of Trust help protect system integrity across hybrid and on-prem environments.
Blackwell GPU:重点是RTX PRO 6000服务器版
HPE此次企业AI工厂报道中的重点GPU是NVIDIA RTX PRO 6000 Blackwell Server Edition。NVIDIA列出的服务器版规格包括96GB ECC GDDR7显存、PCIe Gen 5接口、约1,597GB/s显存带宽,以及最高600W可配置功耗。该卡采用被动散热设计,需依赖服务器气流和系统热设计。NVIDIA官方规格页还列出MIG能力;可用实例划分和软件支持应按具体系统与NVIDIA AI Enterprise版本核实。
这款卡适用于企业推理、智能体AI、计算机视觉、科学计算、数据分析、渲染及数字孪生等混合型工作负载。它不是消费级GeForce RTX 5090,也不等同于面向大型模型训练的B200或GB200平台。“Blackwell”代表一代GPU架构,不是单一性能等级;应按显存、GPU互联、网络规模和目标模型比较方案,而不能只看架构名称。
HPE公告还提及H200 NVL及其他GPU选项,因此HPE AI工厂不等于只能采用RTX PRO 6000。HPE称DL380a Gen12最多可支持10块RTX PRO 6000 Blackwell Server Edition GPU,并提供空气冷却和直接液冷选择;这是公告所说的配置能力,不意味着所有地区、SKU或标准配置都带满10块GPU。HPE 2025年5月公告也提到该服务器此前搭配其他GPU参与MLPerf Inference测试。厂商引用的基准测试结果不应直接视为每个实际客户工作负载的性能保证。
Gen12服务器与整套技术栈
关键服务器是HPE ProLiant Compute DL380a Gen12。它承载GPU及CPU、内存和网络组件,是整套方案中的计算节点,而不是AI工厂的全部。HPE Private Cloud AI资料列出单节点配置示例:一台AI优化DL380a Gen12搭配4块RTX PRO 6000 Blackwell Server Edition GPU。实际Bundle、存储容量、软件和服务可能随地区及版本不同,需以报价和对应产品资料为准。
完整系统的数据流大致如下:
- 数据层:HPE Alletra Storage MP X10000面向数据摄取、训练、推理和持续学习等AI数据工作流。存储延迟、吞吐、小文件及元数据处理都会影响GPU是否能持续获得数据。
- 计算与网络层:DL380a Gen12运行GPU任务;GPU互联、网络与可能使用的DPU影响节点间通信和数据输送。训练检查点写入、预处理或网络拥塞都可能成为瓶颈。
- AI运行层:NVIDIA AI Enterprise及相关软件提供模型运行环境和AI能力;具体驱动、容器、NIM、操作系统与GPU组合应逐项核对NVIDIA支持矩阵。支持矩阵列出RTX PRO 6000 Blackwell Server Edition并显示AI Enterprise 8.1支持,但并不代表所有软件组件版本都自动兼容。
- 平台管理层:HPE Morpheus Enterprise Software被定位为统一控制和工作负载管理层,用于整合基础设施与AI任务;它不是模型,也不会自行提升模型准确率。
- 运维层:HPE OpsRamp用于可观测性和运维,可监控GPU温度、利用率、显存、功耗、时钟、风扇、CPU/GPU资源及集群健康,并支持告警和自动化响应。
GPU数量并不能单独说明系统性能。采购评估还要测量数据吞吐、网络、模型加载、端到端响应时间、GPU利用率、检查点恢复和故障恢复能力。
哪些工作负载与组织更适合
- 企业知识库和RAG:需要在组织控制的数据环境中索引文档并运行检索增强推理的团队,可评估Private Cloud AI的私有部署和数据层。
- 内部智能体与推理服务:希望多个部门共享GPU资源,同时划分租户和管理工作负载的企业,可能从集成平台获益。
- 视频、视觉及多模态应用:RTX PRO系列同时面向图形与AI相关任务,适合评估视频分析、设计可视化、渲染和数字孪生等混合需求。
- 模型微调与科学计算:可能适用,但需先确认单卡96GB显存是否足够,或是否需要量化、张量并行、流水线并行及多GPU分片。
- GPU服务提供商:需要将资源池分配给多客户、部门或项目的运营者,可重点评估AI factory at scale中的集群调度、网络、液冷和运维服务。
- 政府及受监管行业:可评估主权方案,但必须将气隙、数据驻留、身份与密钥、更新和远程支持等要求写进架构与验收条款。
96GB是单张GPU的显存容量,不是整个节点的统一显存池。多卡显存通常不能简单相加后当作一块可供任意模型直接使用的显存;大模型跨卡运行需软件并行策略,并会受到互联和通信开销影响。
Rank #2
什么时候不值得买整套AI工厂
如果团队只是偶尔做原型、GPU利用率不稳定,或只有少量推理请求,完整私有平台可能过度建设。短期或波动负载可以先比较公有云GPU,开发者也可能只需要单节点开发服务器或工作站。
若核心目标是超大规模基础模型预训练,不应仅凭“Blackwell”或“AI工厂”字样认定RTX PRO方案足够。应与面向训练的B系列、HGX、DGX或Grace Blackwell系统比较GPU互联、集群规模、网络和训练软件。反过来,若组织没有可用机房容量、供电与冷却条件,或缺少GPU集群、容器、模型运维和数据治理能力,交钥匙平台也不会消除这些运营需求。
采购状态、价格与交付应如何理解
截至本次资料所反映的产品状态,HPE Store页面已列出搭载RTX PRO 6000 Blackwell Server Edition的Private Cloud AI Developer和Large配置,NVIDIA产品页标注该GPU为“Available Now”。这说明产品已进入可采购组合,但不等于每个地区都有现货、能立即交付或每个配置都可下单。
HPE在2025年6月公告中曾将新一代Blackwell版Private Cloud AI描述为计划于2025年下半年发布,并称Compute XD690计划于2025年10月上市,支持8块Blackwell Ultra GPU。这些是当时公布的计划日期,不应当作2026年各地区的实时交付承诺。下单前应确认具体产品代次、GPU型号、地区SKU、库存和交期。
没有可核实的统一公开零售价。整套报价可能包括GPU数量、节点、存储容量、网络、空气或液冷设计、NVIDIA AI Enterprise许可、HPE软件、支持年限、GreenLake服务和部署服务,并受地区、税费和交付条件影响。HPE、NVIDIA官方页面列出产品或“Available Now”,都不能代替针对具体配置的正式报价。
Do these 3 things before closing this tab:
1Fix the driver behind crashes, sound loss and screen glitches2Repair Windows errors before they cause bigger problems3Scan for outdated or missing drivers - takes under a minuteHPE集成方案、自建集群与云GPU
| 路径 | 优势 | 代价或限制 | 更适合 |
|---|---|---|---|
| HPE Private Cloud AI | 集成度较高,私有部署,硬件、软件与支持可一并规划 | 价格通常需询价,供应商绑定和许可、运维复杂度较高 | 要在企业环境生产运行推理、RAG或智能体且重视统一支持的组织 |
| 自建GPU集群 | 组件选择和架构控制更灵活 | 需自行验证驱动、网络、存储、编排并承担故障排查 | 已有强基础设施与GPU运维团队的组织 |
| 公有云GPU | 启动快,能按需扩缩,不必先建GPU机房 | 长期高利用率成本、数据治理、迁移和可用性需评估 | 负载波动、短期项目或没有机房条件的团队 |
| 其他NVIDIA认证系统 | 可比较不同OEM的服务器、存储、支持和液冷组合 | 需自行评估系统集成与服务边界 | 有架构和采购能力、希望比较多个供应商的大型组织 |
| 工作站或开发节点 | 适合原型和小团队,投入规模较小 | 多租户、扩展和生产级运维能力有限 | 开发者、概念验证或少量GPU需求 |
NVIDIA RTX PRO AI Factory参考架构支持由不同系统合作伙伴提供认证服务器,因此HPE不是唯一可选硬件路径。NVIDIA文档中的典型RTX PRO节点参考配置为8块GPU、合计768GB GPU显存;这属于参考架构示例,不能与HPE Private Cloud AI的具体单节点配置混为一谈。
Quick Recap
采购前的检查清单
- 用实际模型和代表性数据做概念验证,验证吞吐、并发、延迟、GPU利用率和恢复能力,而不是只看峰值算力。
- 确认模型是否能在单卡96GB显存内运行;若需要分片,验证多卡通信与性能。
- 要求供应商说明存储与网络的端到端吞吐、节点间互联、检查点写入与恢复指标。
- 核实机架功率、冷却方式、供电冗余、噪声、承重及液冷设施改造需求。单卡最高可配置600W,多卡节点会显著增加散热与机房负担。
- 逐项确认GPU、服务器SKU、驱动、AI Enterprise、NIM、操作系统和容器版本的兼容性。
- 明确软件许可证、HPE支持与NVIDIA支持的责任边界、备件响应、远程运维方式和交付周期。
- 对主权或气隙环境,核实更新通道、遥测、身份管理、密钥、人员地点、数据驻留和供应链要求。
- 将设备、软件、支持、部署、机房改造和长期运维费用纳入总成本,而不只比较GPU单价。
Product prices and availability are accurate as of the date/time indicated and are subject to change. Any price and availability information displayed on Amazon at the time of purchase will apply.

