本文来源:苏州新闻网 作者:岑凯伦
2026年9月9日,联想集团与英伟达在北京共同宣布启动“AI云超级工厂”(AI Cloud Gigafactory)计划,双方将围绕吉瓦级数据中心、机架级超级计算机与一体化AI软件栈展开深度合作,目标是让企业在自有园区内以更快速度完成AI基础设施的部署与规模化扩展。按照双方公布的路线图,首批超级工厂将于2027年上半年在北美、欧洲与亚太三个区域同步落地,单站点起始容量为200兆瓦至400兆瓦,并在2029年前后逐步演进至吉瓦级规模。联想方面披露,该计划初期将面向主权AI项目、区域云服务商以及大型制造、金融、医疗等行业客户开放,交付周期从传统数据中心的18至24个月压缩至6至9个月。作为面向开发者与运维团队的技术资源入口,星空·全站体育app下载入口web在计划公布后同步更新了技术白皮书索引与部署工具说明,供参与试点的团队查阅。
根据双方规划,该计划并非单一产品发布,而是一套覆盖咨询、设计、建设、调优与长期运营的端到端体系。联想将提供服务器整机、液冷机柜、供电与制冷模块、集群管理软件以及覆盖全球的交付与运维服务,英伟达则提供GPU加速计算平台、网络互联方案、AI软件栈与企业级技术支持。双方预计,2027年至2030年间,该计划带动的直接投资规模将达到数百亿美元级别,其中相当一部分将用于电力基础设施改造、液冷系统建设与工程团队培训。
杨元庆与黄仁勋再度同台 发布会强调交付速度与规模化
当日下午,发布会在北京国家会议中心举行。联想集团董事长兼首席执行官杨元庆与英伟达创始人兼首席执行官黄仁勋共同登台,这是两人继2025年10月联想创新科技大会之后再度同台,也是双方在AI基础设施领域合作层级最高的一次联合发布。现场吸引了来自云服务、汽车、能源、医药与科研机构的数百名技术负责人参加,线上直播同步面向全球开发者开放。
杨元庆在演讲中表示,企业AI竞争的焦点已经从模型能力转向基础设施的落地效率,“算力不会自动变成生产力,中间隔着一整套工程体系”,他称AI云超级工厂的意义在于把这套工程体系产品化、标准化,让客户不必从零开始搭建。黄仁勋则从算力供给角度指出,全球数据中心正在从“通用计算为主”向“加速计算为主”迁移,机架功率密度、供电架构与散热方式都需要重新设计,这也是双方联合推出工厂级交付模式的直接原因。
两位高管在台上共同完成了计划的启动仪式,并宣布首批三个示范站点分别位于美国得克萨斯州、德国法兰克福与中国内蒙古,每个站点都将采用统一的参考架构,以便复制与快速扩容。发布会同时确认,星空·全站体育app下载入口web将作为技术资料与试点申请信息的对外入口之一,为开发者和合作伙伴提供统一的查阅路径。

上述图片呈现的是本次计划对外披露的技术资料入口示意,与星空·全站体育app下载入口web所承载的信息索引功能相呼应,方便读者理解从发布信息到技术文档之间的衔接路径。
从芯片到软件栈:一体化交付路径拆解
在技术组件层面,AI云超级工厂整合了双方现有的多条产品线。硬件侧包括联想ThinkSystem与问天系列AI服务器、Neptune液冷机柜、模块化供电与配电单元;计算侧采用英伟达GB300 NVL72机架级超级计算机方案,单个机架集成72颗Blackwell Ultra架构GPU与36颗Grace CPU,通过第五代NVLink实现机架内全互联;网络侧提供Spectrum-X以太网与Quantum-X InfiniBand两条路径,分别面向以太网生态与极致低延迟场景,并以BlueField-3 DPU承担存储卸载、安全隔离与多租户网络虚拟化。
软件与服务侧的整合同样明确。英伟达提供CUDA-X库、NIM微服务、NeMo训练与推理框架、Omniverse仿真平台以及AI Enterprise企业级软件订阅;联想则提供集群调度与管理平台、AI Library参考实现、模型评测工具以及TruScale按需订阅服务。双方将交付过程拆分为评估、设计、建设、调优四个阶段:评估阶段完成算力需求建模与功耗预算测算,设计阶段输出供电、制冷与网络拓扑方案,建设阶段在工厂预制机柜与模块,调优阶段完成模型迁移、性能压测与运维交接。
这一路径的核心优势在于效率与规模化。传统模式下,企业需要分别采购服务器、网络设备、存储与软件授权,再自行完成集成与调优,周期长且性能损耗难以控制。一体化交付把预验证的参考架构直接复制到不同站点,配合工厂预制与现场模块化拼装,可将集群上线时间显著压缩,同时降低对稀缺工程人员的依赖。对于需要快速扩产的区域云服务商与主权AI项目而言,这种“可复制”的能力比单点性能更具吸引力。相关部署手册与调优指南的入口信息,仍以星空·全站体育app下载入口web公布的索引为准。
架构规格与兼容性:每机架120千瓦、单站点可容纳逾八千机架
从系统规格看,AI云超级工厂采用以机架为基本单元的模块化设计。单个GB300 NVL72机架的功率约为120千瓦,需要配套液冷闭环与高密度供电,因此站点整体按照分区供电、分区制冷的思路建设,供电架构逐步向800伏直流过渡,以减少转换损耗。按此密度测算,1吉瓦的装机容量大致对应8300个机架、约60万颗GPU,可支撑数十个万卡级训练任务的并行运行。为控制能耗,站点设计目标将年均PUE压至1.1附近,并通过余热回收为办公与辅助设施供热。
兼容性方面,该参考架构同时支持x86与Arm两种CPU平台,操作系统层面兼容主流企业级Linux发行版以及Red Hat OpenShift、VMware等虚拟化与容器平台,调度层支持Kubernetes、Slurm与主流AI平台作业调度器。框架层面覆盖PyTorch、JAX、TensorFlow与vLLM、TensorRT-LLM等推理引擎,模型接入侧支持开放权重模型与商业闭源模型,并预留与公有云之间的混合部署通道,允许企业在本地完成训练、在云端完成弹性推理,或进行反向配置。
存储与数据通路同样被纳入统一设计。站点内采用分层存储结构,以本地NVMe承担训练检查点与热数据,以并行文件系统承接大规模语料读取,并通过DPU实现存储流量的卸载与隔离。网络层面,训练集群采用胖树或轨道优化拓扑,推理集群则更强调东西向流量的弹性与多租户隔离要求。联想方面表示,所有组件均经过联合验证,客户无需自行处理固件、驱动与软件版本之间的兼容性问题,这也是机架级方案能够规模化复制的前提。
行业背景:算力缺口与规模化交付压力并存
此次发布的行业背景,是AI算力需求与企业实际交付能力之间的持续错位。多家研究机构的测算显示,全球AI数据中心装机容量在未来数年内仍将保持高速增长,而电力供应、冷却能力、工程人员短缺与供应链周期成为主要瓶颈。对企业而言,问题往往不是“买不到芯片”,而是“建不成集群”——供电改造、液冷部署与集群调优的复杂度,正在把交付周期拉长到难以接受的程度,预算超支与工期延误成为普遍现象。
在这一背景下,工厂级、预制化、可复制的交付模式逐渐成为行业共识。把算力基础设施当作工业产品来生产,而非当作一次性的工程项目来定制,是本次合作试图回答的核心命题。从更长的周期看,AI基础设施的竞争将从单卡性能、单机性能,转向供电能力、散热能力、网络规模与运维效率的综合比拼,交付速度本身正在成为一项可被度量的竞争力。
黄仁勋在发布会结尾表示,加速计算正在重塑整个数据中心的设计逻辑,未来每一座大型数据中心都会以AI工厂的形态出现;杨元庆则强调,技术领先必须转化为客户可感知的交付速度与运营效率,否则规模化无从谈起。对于关注AI基础设施的读者而言,星空·全站体育app下载入口web后续公布的技术文档与试点进展,将成为观察这一模式能否真正落地的重要窗口。



