AWS 和 NVIDIA 计划额外部署200万 GPU计划在 2027 年和 2028 年期间在 AWS 基础设施上部署。部署计划包括 NVIDIA Blackwell Ultra、Rubin 和 Rubin Ultra GPU适用于人工智能训练、推理、科学计算、企业自动化和物理人工智能工作负载。
该公告描述的是一项未来的基础设施建设承诺,而不是立即可用的200万美元。 GPU此前,AWS 曾计划新增超过一百万个存储空间。 NVIDIA GPU从 2026 年开始。
AWS 和 NVIDIA 的扩展基础设施计划
AWS 和 NVIDIA 两家公司于2026年8月26日宣布扩大合作关系。两家公司表示,新增的合作关系将带来更多益处。 GPU这些系统将部署在 AWS 的全球基础设施中,包括被称为 AI 工厂的系统。
该合作关系涵盖超过 GPU 容量。AWS 和 NVIDIA 还计划:
- 引入基于以下方面的基础设施 NVIDIA Vera CPU。
- 延长 NVIDIA 采用定制高带宽内存的NVLink Fusion。
- 整合 NVIDIA GPUs 与 AWS Nitro 和 Elastic Fabric Adapter 网络。
- 继续提供 NVIDIA Nemotron 模型通过 Amazon Bedrock 和 SageMaker 实现。
- 通过 Amazon EMR 和 OpenSearch 加速数据处理和向量索引。
- 将 NVIDIA 的物理 AI 平台应用于 Amazon Robotics 工作负载。
这些公司还计划为美国政府建设人工智能基础设施。其中包括100,000万个…… GPU在安全 AWS 系统上,专为联邦和国家安全工作负载而设计,影响级别为 6 及以上。
AWS 首席执行官 Matt Garman 表示,客户“希望能够自由选择最适合其 AI 工作负载的工具”。 AWS 和 NVIDIA 公告 此次扩张是为了应对各组织将人工智能项目从试点阶段推进到生产阶段的需求。
有哪些证据表明人工智能基础设施需求正在增长?
亚马逊和 NVIDIA 在宣布追加投资之前,该公司报告称其云和数据中心业务实现了显著增长。 GPU 部署。
亚马逊报告称,AWS在2026年第二季度创造了42.2亿美元的销售额,比2025年同期增长了37%。亚马逊还表示,其AWS人工智能业务的年收入运行率已超过25亿美元,并且正以三位数百分比的年增长率增长。
亚马逊在过去12个月中,用于购置房产和设备的支出增加了66.1亿美元。该公司将这一增长主要归因于对人工智能的投资。 亚马逊第二季度业绩 为基础设施建设提供财务背景。
NVIDIA 该公司公布2027财年第二季度数据中心收入为89亿美元,比上年同期增长117%。
NVIDIA 该公司还报告称,其 Vera Rubin 平台已全面投入生产,合作伙伴部署方案涉及 CoreWeave。 Google Cloud, Microsoft Azure, Oracle Cloud Infrastructure还有Nebius。英伟达创始人兼首席执行官黄仁勋表示:“需求正在加速增长”。 英伟达向美国证券交易委员会提交的财务报告 公司公布的数据中心收入增长数据可以佐证这一说法。
什么是 GPU AWS 目前已提供哪些基础设施?
AWS 已经提供了 GPU 基于多个实例 NVIDIA 架构。新宣布的200万-GPU 未来两年,部署工作将扩大该产品组合。
AWS 使用以下方式启动了 EC2 G7 实例 NVIDIA RTX PRO 4500 Blackwell 服务器版 GPU预计于 2026 年 6 月推出。G7 配置最多支持八个 GPUs,总计 256 GB GPU 内存,192 个虚拟 CPU,768 GiB 系统内存,7.6 TB 本地 NVMe 存储,以及 700 Gbps 网络带宽。
AWS 表示,G7 实例的 AI 推理性能比上一代 G6 实例提升高达 4.6 倍,图形性能提升高达 2.1 倍。这些数据是 AWS 官方公布的,并非独立测试机构得出的结果。 HostScore 基准。
G7 实例最初在美国俄亥俄州东部和俄勒冈州西部区域推出,提供按需实例、节省计划、竞价型实例和部分专用实例配置。AWS EC2 G7 公告提供了当前的实例规格和区域可用性信息。
HostScore的采取
两百万GPU 承诺确认了 AWS 和 NVIDIA 预计人工智能计算需求将保持高位。然而,公告并未说明新增容量的成本,也未说明哪些地区将获得哪些容量。 GPU 模型,或者当各个实例类型可用时。
对人工智能托管成本的潜在影响
更大的容量可以缓解硬件供应紧张的问题,但这并不能保证降低主机托管价格。 GPU 托管费用包括加速器、CPU 分配、内存、存储、网络、数据传输、管理和预留容量。
Blackwell Ultra、Rubin 和 Rubin Ultra 系统也针对日益苛刻的 AI 工作负载。这些系统每分钟可完成更多的工作。 GPU但这并不意味着小型项目的准入门槛会自动降低。
买家应等待实例规格、区域可用性和定价信息公布后再计算 AWS 扩展带来的财务影响。
较小角色 GPU 托管服务商
AWS 适合需要大规模服务的组织。 GPU 集群以及与 Bedrock、SageMaker、OpenSearch、S3 和 Elastic Kubernetes Service 等服务的紧密集成。并非所有 AI 项目都需要如此大的规模或平台深度。
专业基础设施提供商可以为希望获得已知基础设施的企业提供服务。 GPU 配置方式、直接服务器访问、专用硬件或更简单的计费方式。 Atlantic.Net例如,目前提供云服务和专用服务器。 GPU 使用配置 NVIDIA L40S 和 H100 NVL 硬件。其云配置支持按小时和长期计费,而专用服务器提供固定硬件和 root 访问权限。 Atlantic.Net 列出其当前 GPU 此处配置.
Atlantic.Net 它并非 AWS 最大规模分布式集群的直接替代品,而是代表了另一个层面。 GPU 面向规模较小的训练、推理、研究和专用基础设施工作负载的托管市场。
对以下方面的影响: GPU 主机市场
企业应该匹配 GPU 根据工作负载调整基础设施,而不是根据提供商的总容量。
模型训练取决于 GPU 内存,多GPU 网络、存储吞吐量和集群可扩展性。微调可以在一个高内存集群上高效运行。 GPU具体情况取决于模型和数据集。推理任务的买家应该衡量响应延迟、并发性、模型加载时间、利用率以及每次完成请求的成本。长时间运行的工作负载应该将预留云定价与……进行比较。 专用 GPU 台服务器而实验性项目则可以享受按小时计费和快速配置的优势。
CPU性能、系统内存、NVMe存储、网络带宽和软件配置也会影响 GPU 利用率。如果周围的基础设施无法足够快地提供数据,强大的加速器也无法达到预期的性能。