十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

NVIDIA 与 Google 联手降低 AI 推理成本

NVIDIA 与 Google 联手降低 AI 推理成本 NVIDIA 与 Google 联手降低 AI 推理成本:Vera Rubin、A5X 与超大规模 AI 基础设施AI 模型越来越强,但真正决定 AI 能否大规模落地的,正在变成另一个问题:运行这些模型到底需要多少成本?2026 年 4 月,在 Google Cloud Next 大会上,Google 与 NVIDIA 公布了面向大规模 AI 推理的新一代基础设施方案。其中最受关注的是基于NVIDIA Vera Rubin NVL72的A5X 裸金属实例。根据双方公布的信息,通过硬件与软件协同设计,这套架构的目标是:每个 Token 的推理成本最高降低 10 倍每兆瓦的 Token 吞吐量提高 10 倍单站点集群可扩展到80,000 个 NVIDIA Rubin GPU多站点部署规模最高可达到960,000 个 GPU这意味着 AI 基础设施的竞争已经不只是"谁的 GPU 更快",而开始进入一个更加复杂的阶段:如何把计算、网络、软件、能源和数据中心组织成一个高效率的 AI 计算系统。一、AI 进入"大规模推理"时代训练一个 AI 模型和运行一个 AI 模型,是两个完全不同的问题。训练阶段关注的是 数据 → 模型训练 → GPU 集群 → 得到模型。而模型真正进入生产环境以后,系统面对的是大量持续到来的请求:反馈优化大量用户请求AI 推理服务大规模 GPU 集群持续生成 Token持续计算成本当模型只服务少量用户时,单次推理的成本可能不是主要问题。但当 AI 应用进入大规模生产环境以后,AI 基础设施开始关注一个非常现实的指标:每生成一个 Token,需要付出多少计算和基础设施成本?这也是 NVIDIA 和 Google 此次方案关注的核心。二、A5X 到底是什么?此次公布的 A5X 是一种bare-metal instance(裸金属实例),运行在 NVIDIAVera Rubin NVL72rack-scale 系统之上:☁️ Google CloudA5X Bare-Metal InstanceNVIDIA Vera Rubin NVL72Rubin GPU高速互连网络AI 软件栈AI InferenceToken 生成这里有一个非常重要的概念:A5X 不是简单地提供一块 GPU,而是提供一个面向大规模 AI 计算的完整基础设施单元。新闻强调的也是hardware and software codesign,也就是硬件与软件协同设计。三、为什么需要"硬件 + 软件"一起设计?如果只是不断提高 GPU 的峰值计算能力,并不能保证整个 AI 系统的性能同步提高。一个大规模 AI 系统实际上包含多个层次:AI 应用AI 模型推理软件GPU 计算高速网络数据中心电力与散热任何一层出现瓶颈,都可能影响最终结果。例如 GPU 计算能力很强,但网络通信跟不上,GPU 就得等待数据,整体效率下降。所以当 GPU 数量从几百、几千扩大到几十万时:网络和系统调度本身就成为核心技术问题。四、为什么 A5X 需要 ConnectX-9 和 Google Virgo?新闻特别提到了一个关键组合:NVIDIA ConnectX-9 SuperNIC + Google Virgo networking technology。原因很直接——当大量 GPU 同时工作时,它们之间需要交换海量数据:
返回列表