9 月 16 日,据 The Information 报道,苹果正在开发一款面向企业市场的 AI 服务器,计划使用自研 M8 Ultra 芯片,并考虑引入英伟达的 NVLink Fusion 技术,将多颗芯片连接起来。如果项目最终落地,这将是苹果自 2011 年停产 Xserve 后,第一次重新销售专门的服务器硬件。
按照目前的方案,这款服务器可能提供两个版本:较小的版本配置两颗 M8 Ultra,较大的版本则配置四颗。潜在客户包括 AI 开发者、企业和政府机构,最早预计在 2029 年上市。
据报道,这个项目大约在一年前启动,并得到苹果管理层支持。不过目前距离商业化仍有三年左右,产品配置和技术方案都可能继续变化,项目本身也存在调整甚至取消的可能。
苹果此次选择的切入口是推理,而不是训练。训练是让一个 AI 模型从大量数据中学习,而推理是模型训练完成后真正投入使用的过程。随着模型逐渐进入实际应用,越来越多算力开始被消耗在每天持续发生的推理请求上。
M8 Ultra 这条芯片路线也因此值得关注。它并不是一颗完全脱离 Mac 产品线、重新设计的服务器芯片,而是苹果 M 系列最高端架构继续向数据中心延伸。目前 M8 Ultra 的具体规格尚未公布,不过从最新一代 Ultra 芯片已经能看出苹果强化 AI 计算的方向。
目前,M5 Ultra 最高支持 512GB 统一内存,内存带宽达到 1.2TB/s。苹果还允许多台 Mac Studio 通过 RDMA 组成集群,四台机器运行 AI 推理时,性能最高可以达到单机的约 3 倍。
对于大模型推理来说,这一点尤其重要。很多模型运行时需要把大量参数持续放在高速内存中,因此除了纯算力,内存容量和带宽同样是关键瓶颈。统一内存也因此成为 Apple Silicon 与传统独立 GPU 方案相比比较特殊的一项能力。
苹果早已在自己的数据中心使用 Apple Silicon。2024 年推出 Private Cloud Compute 时,苹果就为其设计了基于自研芯片的服务器硬件,用来处理无法完全在 iPhone、iPad 和 Mac 本地完成的复杂 AI 请求。
此外,苹果此前还被曝正在与博通合作开发代号为 Baltra 的专用 AI 服务器芯片。Baltra 主要服务苹果自身的数据中心,与这次准备对外销售、基于 M8 Ultra 的企业服务器属于不同项目。
如果苹果开始向企业出售 M8 Ultra AI 服务器,它可能在部分推理任务上与英伟达形成竞争。但这不等于苹果准备直接挑战英伟达整个 AI 计算平台。至少目前,苹果的目标主要是企业推理,而英伟达的业务范围覆盖训练、推理、网络、机架系统以及软件生态。更重要的是,苹果甚至可能需要英伟达帮助它把多颗 M8 Ultra 连接起来。
苹果正在评估的 NVLink Fusion,就是英伟达近年来主动向第三方芯片开放的一套高速互连技术。它可以让其他公司设计的 AI 芯片接入 NVLink、交换机以及英伟达的机架级基础设施,多颗处理器由此可以高速交换数据。
这套策略背后的逻辑很简单。即使越来越多公司开始开发自己的 AI 芯片,英伟达也希望它们继续运行在自己的基础设施之上。
目前 AWS 的下一代 Trainium、推理芯片公司 d-Matrix 等都已经加入 NVLink Fusion 生态。9 月 10 日,d-Matrix 刚刚宣布,其下一代 Raptor 推理芯片也将通过 NVLink Fusion 接入英伟达的数据中心平台。
随着谷歌 TPU、AWS Trainium 以及越来越多定制 AI 芯片出现,计算芯片本身正在变得更加多元。英伟达则试图把自己的优势继续向外延伸,从 GPU 扩展到互连、网络、机架和整个数据中心架构。
对苹果来说,这款服务器的路并不好走。企业服务器除了芯片,还需要远程管理、软件兼容、运维、售后和长期供货体系,而这些都不是苹果过去十几年重点经营的领域。The Information 也指出,苹果长期以来并没有建立与传统服务器厂商相当的企业工程和开发者支持体系。
何况,2029 年距离现在还有三年,对于变化极快的 AI 硬件市场而言可以说非常漫长。