谷歌云利用第六代 TPU 拓展人工智能基础设施领域

该科技公司于 10 月 30 日在应用日和基础设施峰会上宣布,谷歌云将通过新的 TPU 和 NVIDIA GPU 增强人工智能云基础设施。

第六代 Trillium NPU 现已为云客户提供预览版,为许多产品提供支持最受欢迎的服务,包括搜索和地图。

谷歌云计算和人工智能基础设施副总裁兼总经理 Mark Lohmeyer 在一份报告中写道:“通过人工智能基础设施方面的这些进步,谷歌云使企业和研究人员能够重新定义人工智能创新的边界。”新闻稿。 “我们期待在这个强大的基础上出现变革性的新人工智能应用。”

Trillium NPU 加速生成式 AI 流程

随着大型语言模型的发展,支持它们的芯片也必须如此。

第六代 Trillium NPU 在一个 TPU 集群中以 91 exaflops 的速度提供大型语言模型应用程序的训练、推理和交付。报告称,与第五代相比,第六代版本的每芯片峰值计算性能提高了 4.7 倍。它将高带宽内存容量和芯片间互连带宽加倍。

Trillium 满足稳定扩散 XL 等大规模扩散模型的高计算需求。在其巅峰时期,Trillium 基础设施可以连接数以万计的芯片,创造出谷歌云所描述的“建筑规模的超级计算机”。

谷歌云人工智能基础设施集团产品经理 Mohan Pichika 在给 TechRepublic 的电子邮件中表示,企业客户一直要求更具成本效益的人工智能加速和更高的推理性能。

新闻稿移动应用开发公司 HubX 的开发主管、Google Cloud 客户 Deniz Tuna 指出:“我们使用 Trillium TPU 结合 MaxDiffusion 和 FLUX.1 进行文本到图像的创建,结果令人惊叹!我们能够在 7 秒内生成四张图像 — 与我们当前的系统相比,响应延迟提高了 35%,每张图像的成本降低了约 45%!”

新虚拟机预计将交付 NVIDIA Blackwell 芯片

11 月,Google 将在其云服务中添加由 NVIDIA H200 Tensor Core GPU 提供支持的 A3 Ultra VM。 A3 Ultra 虚拟机在 Google Cloud 上运行人工智能或高性能计算工作负载-GPU 到 GPU 流量为 3.2 Tbps 的全网络。他们还为客户提供:

  • 与 NVIDIA ConnectX-7 硬件集成。
  • 与之前的基准测试 A3 Mega 相比,GPU 到 GPU 网络带宽提高了 2 倍。
  • LLM 推理性能提高高达 2 倍。
  • 内存容量几乎翻倍。
  • 内存带宽提高 1.4 倍。

新的虚拟机将通过 Google Cloud 或 Google Kubernetes Engine 提供。

请参阅:Blackwell GPU 是,英伟达首席执行官黄仁勋在 10 月份的投资者会议上表示。

其他 Google Cloud 基础架构更新支持不断发展的企业 LLM 行业

当然,Google Cloud 的基础设施产品可以互操作。例如,A3 Mega 由 Jupiter 数据中心网络支持,该网络很快就会看到自己的以人工智能工作负载为中心的增强功能。

凭借其新的网络适配器,Titanium 的主机卸载功能现在可以更有效地适应 AI 工作负载的多样化需求。 Titanium ML 网络适配器使用 NVIDIA ConnectX-7 硬件和 Google Cloud 数据中心范围内的 4 路铁路对齐网络来提供 3.2 Tbps 的 GPU 到 GPU 流量。这种组合的优势体现在 Google Cloud 的光电路交换网络结构 Jupiter 上。

Google Cloud 人工智能基础设施的另一个关键要素是人工智能训练和推理所需的处理能力。超计算集群将大量人工智能加速器聚集在一起,其中包含 A3 Ultra 虚拟机。超计算集群可以通过 API 调用进行配置,利用 JAX 或 PyTorch 等参考库,并支持 Gemma2 和 Llama3 等开放式 AI 模型进行基准测试。

Google Cloud 客户可以在 11 月通过 A3 Ultra 虚拟机和 Titanium ML 网络适配器访问超计算集群。

Pichika 表示,这些产品满足了企业客户对优化 GPU 利用率和简化对高性能 AI 基础设施的访问的要求。

他在电子邮件中表示:“超计算集群为企业提供了一个易于使用的解决方案,以利用人工智能超计算机的力量进行大规模人工智能训练和推理。”

Google Cloud 还在为 NVIDIA 即将推出的 Blackwell GB200 NVL72 GPU 准备机架,预计将于 2025 年初被超大规模企业采用。一旦推出,这些 GPU 将连接到 Google 的基于 Axion 处理器的 VM 系列,利用 Google 的定制 Arm 处理器。

Pichika 拒绝直接讨论超计算集群或 Titanium ML 的时间安排是否与 Blackwell GPU 的交付延迟有关:“我们很高兴能够继续合作,为客户带来这两种技术的最佳优势。”

另外两项服务,即以 Hyperdisk ML AI/ML 为重点的块存储服务和以 Parallestore AI/HPC 为重点的并行文件系统,现已全面推出。

Google Cloud 服务可以跨多个地方访问国际地区

AI 托管领域 Google Cloud 的竞争对手

Google Cloud 主要在大型语言模型的云托管方面与 Amazon Web Services 和 Microsoft Azure 竞争。阿里巴巴、IBM、甲骨文、VMware 和其他公司提供类似的大型语言模型资源,尽管规模并不总是相同。

根据政治家2024 年第一季度,谷歌云占据全球云基础设施服务市场 10% 的份额。亚马逊 AWS 占据 34%,微软 Azure 占据 25%。