云巨头亚马逊网络服务(AWS)与芯片制造商英伟达(Nvidia)达成了一项新的大规模协议,根据该协议,2027至2028年间,AWS的全球基础设施中将新增两百万个图形处理器(GPU)。这不仅仅是又一次算力扩展,更是对代理型人工智能和物理人工智能领域爆发式需求的战略回应,这些领域需要根本不同的计算架构。

数百万加速器:从训练到机器人技术

新一批供货补充了此前在GTC 2026上公布的从今年起安装超过100万块GPU的计划。这样一来,英伟达加速器在AWS中的总规模将达到数百万级别。这些资源不仅将用于经典的模型训练和推理,还将用于全新的负载——执行多步骤场景的自主代理,以及在真实物理环境中运行的机器人系统。

硬件演进:Blackwell、Rubin与定制解决方案

在合作框架内,AWS将把英伟达的多个代际平台集成到其集群中,包括Blackwell Ultra以及未来的Rubin和Rubin Ultra。关键要素是采用NVIDIA Vera CPU处理器,该处理器专为协调代理场景中的工具、代码执行和模拟而设计。这有助于将GPU从日常任务中解放出来,提高整体计算效率。

另一个独立方向是与AWS Trainium芯片的深度集成。亚马逊旗下部门Annapurna Labs与英伟达共同扩展了NVLink Fusion技术的支持,包括高速内存和机架级可扩展互连。这种混合方法为客户提供了灵活性,可根据具体任务选择最佳架构。

新实例与性能

AWS还推出了基于NVIDIA RTX PRO 4500 Blackwell Server Edition GPU的EC2 G7云实例。这是大型云提供商中的首个此类产品。根据我的数据,与上一代G6相比,新实例表现出:

  • AI推理效率最高提升4.6倍;
  • 图形性能最高提升2.1倍。

同时,该基础设施保持与AWS Nitro和Elastic Fabric Adapter网络解决方案以及NVIDIA Spectrum技术的兼容性。

政府订单与物理AI

协议中还有一个独立部分涉及美国政府及国防客户。AWS和英伟达将创建专门的人工智能工厂,用于处理安全级别为Impact Level 6及以上的机密数据,这些工厂将获得约10万块GPU。这标志着AI基础设施正成为国家安全的关键要素。

此次合作远远超出了数据中心的范畴。Amazon Robotics将标准化使用英伟达的物理AI平台——Jetson、Omniverse和Isaac。这些技术将用于仓库自动化、合成数据生成和机器人行为模拟。NVIDIA Nemotron开放模型将继续通过Amazon Bedrock和SageMaker提供。

我的观点:这笔交易最终确立了行业范式的转变。竞争正从单纯增加GPU数量转向构建整体计算工厂,其中加速器、CPU、内存和网络作为一个统一体协同工作。能够提供这种综合方法的公司将在代理型AI时代的统治竞赛中获得决定性优势。投资者和开发者应密切关注这种整合在未来两三年内将如何影响计算成本和算力可用性。