十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

高通“飞龙”入局AI推理,挑战英伟达,重塑云边端协同计算格局

高通“飞龙”入局AI推理,挑战英伟达,重塑云边端协同计算格局 1. 从“移动”到“云端”高通为何要造“飞龙”如果你最近几年关注过数据中心和AI芯片的新闻可能会觉得有点“乱花渐欲迷人眼”。英伟达的GPU一骑绝尘AMD的Instinct系列紧追不舍英特尔也在用Gaudi系列奋力追赶。就在大家以为牌桌上的玩家已经固定时一个我们既熟悉又陌生的名字——高通带着一个全新的品牌“飞龙”Qualcomm Cloud AI杀了进来。说熟悉是因为高通的骁龙芯片几乎统治了我们的手机说陌生是因为在数据中心这个动辄数万张卡、比拼算力密度的“重工业”领域高通似乎一直是个旁观者。但这次高通显然不想再当观众了。“飞龙”品牌的发布被高通自己定位为“补齐AI计算最后一环”。这句话很有意思也很有野心。它暗示着在AI计算这场马拉松里前面的选手可能只跑完了半程而高通带着它的“飞龙”要来跑最关键、也最艰难的后半程了。那么这“最后一环”究竟是什么高通又凭什么认为自己能补上这一环要理解这一点我们不能只看数据中心本身得把视野拉回到高通的“老家”——终端侧。过去十年是高通在移动互联网时代最辉煌的十年。它成功地将高性能、低功耗的计算能力塞进了小小的手机里催生了移动AI的爆发。从手机拍照的实时HDR和背景虚化到语音助手的本地唤醒和识别这些我们习以为常的功能背后都是高通芯片上NPU神经网络处理器的功劳。高通在“端侧AI”或者说“边缘AI”上的积累是深厚且独特的。然而AI的发展从来不是孤立的。它形成了一个从“云”到“端”的连续体。模型在云端进行大规模训练Training生成智慧的“大脑”然后这个大脑被部署到云端服务器进行推理Inference响应来自全球的请求最后为了追求极致的实时性、隐私性和成本一部分推理任务会下沉到手机、汽车、物联网设备等终端。目前行业的焦点和绝大部分利润都集中在“训练”和“云端推理”这两个环节尤其是训练几乎被英伟达的GPU垄断。高通看到的“最后一环”恰恰是“云端推理”之后向“边缘推理”和“混合AI”延伸的那部分。当前的AI计算架构存在一个明显的断层云端的算力强大但遥远、昂贵且涉及数据隐私终端算力有限但近在咫尺、即时且私密。未来的AI应用尤其是那些要求实时交互如AR/VR、涉及敏感数据如个人健康监测或需要永远在线如自动驾驶感知的场景必然需要云和端的紧密协同。这就需要一种全新的计算架构能够无缝地、高效地在云和端之间分配和调度AI工作负载。“飞龙”要补的就是这个“协同”的环。它不是一个单纯的云端训练芯片也不是一个单纯的终端推理芯片。根据目前披露的信息和行业分析“飞龙”很可能是一套面向云端AI推理并深度优化了与终端尤其是搭载高通芯片的终端协同工作的解决方案。高通想做的是利用其在终端侧AI的绝对领导地位和生态优势反向定义云端推理的“接口”和“效率标准”从而在AI计算的完整价值链上建立起一个从云端到边缘、以高通技术栈为核心的闭环。这步棋如果走通意义重大。对于开发者而言他们可以更容易地开发出在“云-边-端”流畅运行的AI应用对于企业用户他们能获得更均衡的成本、更快的响应和更好的隐私保护而对于高通它将从一个移动芯片供应商跃升为横跨云、边、端全域的AI计算平台定义者。所以“飞龙”的出现绝非一时兴起而是高通基于自身基因和对AI未来形态的判断发起的一次战略性总攻。它要挑战的不仅是几款芯片的性能更是一种既有的产业格局和思维定式。2. “飞龙”的核心猜想架构、定位与差异化武器虽然高通尚未公布“飞龙”产品的全部技术细节但结合其历史技术路线、近期收购如收购CPU设计公司Nuvia以及行业发展趋势我们可以对其核心特质进行一番有理有据的推演。这有助于我们理解高通打算用什么来敲开数据中心的大门。2.1 架构基石从ARM到“自定义核”的进化高通的传统优势在于基于ARM指令集架构设计高性能、低功耗的SoC。在数据中心领域ARM架构因其能效比优势正在成为x86之外的重要选择亚马逊的Graviton系列处理器已证明了其可行性。高通此前也尝试过基于ARM公版核心的服务器芯片Centriq但并未掀起太大波澜。此次“飞龙”的不同之处很可能在于其采用了源自Nuvia技术的完全自定义CPU核心。Nuvia团队由前苹果芯片顶级工程师创立擅长设计超越ARM公版方案的超高性能定制核心苹果M系列芯片的成功即是明证。高通收购Nuvia后将其技术整合推出了面向PC的骁龙X Elite平台其CPU性能已叫板苹果M系列和英特尔酷睿Ultra。因此“飞龙”的CPU部分极有可能不是普通的ARM Cortex-A系列而是类似骁龙X Elite上“Oryon”核心的服务器版本。这意味着它将拥有极高的单线程性能对于许多推理任务中存在的串行依赖部分、控制逻辑以及数据库查询等配套工作负载至关重要。领先的能效比这是高通和ARM体系的看家本领在电费占数据中心运营成本大头的今天每瓦性能Performance per Watt是硬通货。针对AI负载的指令集扩展可能会增强对AI框架中常用算子如矩阵乘加、非线性激活函数的硬件加速支持。2.2 核心定位专精于“推理”尤其是“协同推理”“飞龙”品牌明确指向“Cloud AI”但结合“补齐最后一环”的表述其主攻方向大概率是云端AI推理而非训练。这是一个非常聪明的差异化选择。避开红海AI训练市场目前是英伟达H100/H200/B100的绝对主场生态壁垒极高短期难以撼动。瞄准蓝海随着大模型应用落地推理需求正在爆炸式增长并且推理工作负载更加多样化。据行业预测未来几年AI推理的算力需求占比和市场规模将远超训练。发挥协同优势推理特别是面向终端请求的推理与高通的终端生态天然契合。高通可以优化“飞龙”云端芯片使其与骁龙手机、AR/VR设备、汽车座舱芯片之间的数据传输、模型分割、任务调度达到极致效率。我们可以设想一个场景一个复杂的多模态大模型应用。一部分对实时性要求极高、涉及用户隐私的初步感知和决策如语音指令的初步识别、图像中敏感信息的模糊化处理在手机端侧的NPU上完成另一部分需要庞大知识库和复杂逻辑推理的任务则通过高效压缩的中间表示发送到云端的“飞龙”芯片进行深度处理结果再迅速返回终端。整个流程无缝衔接“飞龙”在云端扮演的角色是一个为终端高度优化的、专用的“AI协处理器集群”。2.3 差异化武器全栈软件与“混合AI”生态硬件性能是入场券但真正的胜负手在于软件和生态。这可能是高通“飞龙”最具潜力的“杀手锏”。AI软件栈的深度整合高通拥有多年的AI软件栈积累如骁龙神经处理引擎SNPE、AI模型增效工具包AIMET等。这些工具已经帮助海量开发者将模型高效部署到数以十亿计的高通终端设备上。“飞龙”平台很可能提供一个统一的软件栈让开发者用同一套工具链或高度兼容的流程就能完成从云端“飞龙”到边缘设备、再到手机端侧的全链路模型优化、量化和部署。这极大地降低了开发混合AI应用的复杂度。对流行框架的优化为了吸引开发者“飞龙”必须对PyTorch、TensorFlow、JAX等主流AI框架提供开箱即用的良好支持并且其AI加速库类似英伟达的CUDA和cuDNN需要足够成熟。高通可能会重点优化推理阶段的框架集成。“混合AI”的运行时与编排这是实现“最后一环”愿景的关键。高通可能需要提供或与合作伙伴共同定义一套“混合AI运行时”能够智能地决定一个AI任务或一个模型的不同层应该在云端、边缘还是终端执行并动态管理数据流和计算资源。这涉及到复杂的性能建模、网络状况感知和资源调度算法。注意对于数据中心客户来说一套全新的硬件平台其迁移成本非常高。高通除了要证明“飞龙”的绝对性能和能效优势外还必须提供极其平滑的迁移路径。例如是否支持容器化部署Docker/Kubernetes、是否提供与现有数据中心管理工具的插件、其编程模型是否易于现有工程师掌握这些“非技术”因素往往比峰值算力数字更重要。3. 面临的挑战与破局之道高通需要翻越的“三座大山”理想很丰满但现实很骨感。高通“飞龙”要想在数据中心市场真正立足补上所谓“最后一环”它必须直面并成功翻越三座看似难以逾越的大山。3.1 生态壁垒CUDA的“护城河”有多深这是所有挑战中最核心、最严峻的一个。英伟达在AI计算领域的统治地位不仅源于其GPU硬件性能更在于其构建的、近乎垄断的CUDA软件生态。数以百万计的开发者、几乎所有的AI框架和学术研究都深度绑定在CUDA之上。对于企业客户而言选择CUDA意味着有最丰富的人才池、最稳定的代码库和最全面的社区支持。“飞龙”作为一个新入局者必然要提供自己的并行计算平台和API可能是基于OpenCL、SYCL或是高通自己的定制接口。这就给客户带来了巨大的转换成本代码重写现有的AI模型推理服务代码如果深度优化过CUDA可能需要大量修改才能移植到“飞龙”平台。人才短缺熟悉高通数据中心开发生态的程序员目前几乎为零。工具链成熟度调试工具、性能分析器、编译器优化水平都需要时间积累和迭代。高通的破局点可能在于瞄准增量市场与新应用不过度纠结于迁移现有CUDA重度负载而是专注于那些新兴的、尚未被CUDA完全“固化”的推理场景特别是与终端强相关的混合AI应用。在这些新场景中大家站在同一起跑线。提供卓越的“转换器”投入巨资开发高度自动化的代码移植工具能将常见的CUDA内核或框架代码以较低的性能损失转换为能在“飞龙”上高效运行的代码。拥抱开放标准全力支持和推动OpenAI Triton、MLIR、ONNX Runtime等硬件无关的编译器和运行时标准。让自己成为支持这些开放标准的最佳硬件平台之一从而降低开发者的生态依赖。3.2 客户信任如何赢得第一个大型数据中心订单数据中心采购决策周期长、风险厌恶度高。大型云服务商如AWS、Azure、Google Cloud或头部互联网公司不会因为一份漂亮的PPT或实验室 benchmark 就大规模采购一款全新的芯片。他们需要看到大规模实际工作负载下的稳定性芯片在7x24小时高负荷、多租户环境下的长期可靠性和故障率。总体拥有成本TCO优势不仅仅是芯片采购成本还包括与之相关的服务器设计、机房供电散热、运维人力、软件适配等所有成本。高通必须证明使用“飞龙”平台在1-3年的周期内确实能比使用英伟达或AMD的解决方案更省钱。全栈支持能力当出现深层次软硬件问题时高通能否提供与英特尔、英伟达同等级别的、全球性的、快速响应的技术支持团队高通的破局策略可能包括与一家云巨头深度绑定最可能的路径是复制AWS Graviton的成功模式与某一家大型云厂商例如微软Azure双方在ARM Windows和终端AI已有合作达成战略合作共同设计并率先部署。由云厂商来承担一部分早期风险和推广工作。聚焦细分垂直市场初期不一定强攻通用的公有云市场而是针对某些对功耗、实时性有极端要求且与高通终端生态结合紧密的垂直行业如自动驾驶研发、智能制造、特定领域的科学计算等。在这些领域建立标杆案例。提供极具侵略性的定价在市场份额几乎为零的初期可能需要采取“补贴”或“成本价”策略用难以拒绝的TCO数字来吸引第一批吃螃蟹的客户用他们的真实业务数据来为自己背书。3.3 自身基因转变从IP授权商到系统解决方案商高通传统的商业模式是向OEM厂商授权芯片设计IP如基带或销售芯片。但在数据中心市场客户需要的不是一颗孤立的芯片而是一整套解决方案包括服务器参考设计甚至直接推出自己的服务器加速卡或整机。系统级软件包括固件、驱动程序、与数据中心管理平台如Kubernetes集成的插件、监控工具等。端到端优化从云端芯片到边缘网关再到终端设备整个数据通路和任务链路的协同优化。这对高通的组织架构、技术支持模式和销售团队都提出了全新要求。它需要组建一支既懂底层硬件又懂上层AI应用和云原生架构的复合型团队。这要求高通必须内部整合与跨界学习将来自Nuvia的CPU设计团队、原有的AI软件团队、以及新组建的数据中心团队深度融合。同时向英特尔、英伟达等老牌数据中心玩家学习其系统级的交付和支持经验。建立强大的合作伙伴网络与服务器ODM厂商如广达、英业达、独立软件开发商ISV、系统集成商SI建立紧密合作借助他们的力量快速完善解决方案的各个层面。改变对话方式销售对话不能停留在“我的TOPS每秒万亿次运算是多少”而要升级到“我能为你的这个AI推理服务降低多少延迟、节省多少总成本、带来哪些新的业务可能性”。4. 对行业与开发者的影响如果“飞龙”成功世界会怎样假设高通“飞龙”克服了重重困难在未来3-5年内取得了实质性的市场份额那么它对整个AI计算行业以及我们开发者会产生哪些具体的影响这并非空想而是值得提前思考的格局变化。4.1 行业格局从“一家独大”到“三足鼎立”目前的数据中心AI加速市场英伟达是绝对的霸主AMD是主要的挑战者英特尔是奋力追赶的第三名。高通“飞龙”的加入目标显然是成为这个高端俱乐部的长期成员。如果成功市场可能会呈现“三足鼎立”甚至“四方争霸”的态势。这种竞争对行业是巨大利好价格与成本下降更多的竞争者意味着客户有更多的议价权AI算力的单位成本有望持续下降从而加速AI技术的普及。技术路线多元化除了当前的GPU主导路线基于ARM CPU专用AI加速器的异构计算路线很可能是“飞龙”的路径会得到加强。甚至可能催生更多基于RISC-V等开放架构的AI芯片创新。不同的硬件擅长不同的工作负载多元化让AI计算架构更加健康。软件生态走向开放为了打破CUDA的垄断所有挑战者都会不遗余力地推动开放软件标准如OpenXLA, SYCL, ONNX的发展。长期来看开发者将不再被锁定在单一的硬件平台上模型的可移植性会大大增强。4.2 开发者体验新的机会与挑战并存对于身处一线的AI工程师、算法研究员和应用开发者来说“飞龙”的出现意味着新的工具和可能性但也需要学习新的知识。可能带来的新机会混合AI应用开发成为主流随着高通推动其“云边端”统一软件栈开发能够智能利用云端大模型和端侧小模型的混合AI应用门槛会显著降低。这将催生一大批需要新型架构思维的应用开发岗位。性能优化重心转移在英伟达生态下极致的性能优化几乎等同于CUDA优化。而在一个更多元化的硬件世界里优化重点可能转向更上层的框架编译器如Apache TVM, OpenAI Triton、中间表示MLIR以及运行时调度策略。掌握这些跨硬件平台的优化技能会变得非常有价值。垂直领域深度优化如果“飞龙”在特定垂直领域如自动驾驶推理、移动视频处理建立优势那么熟悉该领域业务逻辑、又能针对“飞龙”平台进行算法和模型优化的复合型人才将会非常抢手。需要应对的新挑战学习新的工具链开发者需要投入时间了解高通的AI SDK、调试工具和性能分析器。初期可能会遇到文档不全、社区支持弱的问题。碎片化带来的测试负担当你的服务需要部署到“英伟达GPU 高通飞龙 自家手机NPU”的混合环境中时确保在所有平台上的功能一致性和性能可接受性测试复杂度会指数级上升。架构设计复杂性增加设计一个能动态在云和端之间分割模型的系统需要考虑网络延迟、数据隐私、模型精度损失、功耗约束等多个维度这比单纯写一个云端推理服务要复杂得多。4.3 终端设备的变革手机不再是终点而是起点“飞龙”的成功将反过来极大地强化高通在终端侧的地位。当云端有了为终端深度优化的“飞龙”集群终端设备尤其是手机的定位将发生微妙变化从“纯消费算力”到“算力协同节点”手机不再仅仅是向云端请求算力的终端它本身成为一个智能的、可参与协同计算的节点。在弱网或无网环境下它能独立完成更多任务在网络良好时它能与云端组成“算力联邦”处理更复杂的任务。端侧硬件设计的新导向为了更好地实现协同手机SoC的设计可能会更加强调与云端芯片在数据格式、计算精度、内存架构上的对齐以减少协同时的转换开销。高通的下一代骁龙芯片可能会看到更多为“混合AI”设计的专用电路和接口。隐私与个性化AI的飞跃敏感数据的处理可以完全留在端侧只有脱敏后的信息或抽象请求才与云端交互。这使真正保护隐私的个性化AI服务如完全本地化的健康助手、隐私安全的照片管理成为可能并可能催生新的应用品类和商业模式。总而言之高通“飞龙”的发布就像向平静的湖面投入了一颗石子。它激起的涟漪可能会逐渐波及到从云端数据中心到我们掌上手机的每一个角落。它未必能立刻撼动巨头的地位但它所带来的竞争、对开放生态的推动以及对“混合AI”范式的聚焦无疑会让整个AI计算产业变得更加活跃、健康并最终为我们带来更强大、更普惠、更私密的AI体验。对于开发者而言保持开放的心态关注不同硬件平台的特性并深耕垂直领域的AI应用能力将是应对这场变局的最佳方式。
返回列表