苹果芯片人工智能已经到了仅靠效率可能已经不够的地步。 Apple 处理器继续提供强大的每瓦性能、较长的电池寿命以及硬件和软件的紧密集成,但现代生成模型的需求增长速度超出了传统的年度芯片改进可以轻松满足的速度。
英伟达提供了最具影响力的例子,说明半导体开发在人工智能的压力下如何发生变化。 Blackwell 通过高速接口连接两个大型芯片,超越了传统的单芯片 GPU。 Rubin 将这一概念扩展为一个涉及 GPU、CPU、网络、交换机、内存和软件的协调平台。
Apple 不应尝试将数据中心处理器放入 MacBook 或 iPhone 中。然而,它可以吸收 Nvidia 加速开发背后的几个原则,并将其应用于功率、温度、隐私和电池寿命仍然至关重要的个人设备。
Nvidia 不再将每个处理器呈现为独立的组件。布莱克威尔Rubin 和 Rubin 是针对特定类别的工作负载共同开发计算引擎、内存、互连和软件的平台。
苹果已经部分遵循了这一理念。其片上系统结合了 CPU 内核、GPU 内核、神经引擎、媒体加速器、图像处理、内存控制器和安全硬件。统一内存架构允许不同处理器访问同一池,而无需在单独的 CPU 和 GPU 内存之间重复复制大型数据集。
M5 Pro 和 M5 Max 通过融合架构推进了这一方法,将两个芯片组合到一个系统中,并将神经加速器放置在每个 GPU 核心内。 Apple 还将 M5 Max 上的统一内存带宽提高到每秒 614GB。
下一步应该是一个更明显的人工智能路线图,涵盖几代芯片,而不是仅在设备发布时展示每项改进。规划大型本地模型的开发人员需要了解内存容量、数字格式、加速器支持和软件兼容性将如何发展。
可预测的方向将使专业软件公司更有信心优化 Mac 的复杂模型,而不是将 Apple 芯片视为次要平台。

Chiplet 可以扩展到最大的 Mac 之外
Blackwell 演示了如何通过每秒 10TB 的芯片到芯片连接将两个掩模版有限的芯片作为一个 GPU 运行。英伟达使用先进的封装来突破生产一块巨大硅片的物理和制造限制。
Apple 正在朝着类似的方向发展,M5 Pro 和 M5 Max 使用的两芯片融合架构。该设计可以成为更灵活的计算块组合的基础。
未来苹果硅可以将 CPU、GPU、神经引擎、媒体和连接组件分离到专门的小芯片中,而不是在同一流程节点上重建每个功能。可以为性能敏感的逻辑保留更新的制造工艺,而成熟的技术则可以处理因尺寸缩小而获益甚少的组件。
这将提高制造产量,并使苹果能够创建更多配置,而无需为每个设备层设计完全独立的芯片。 Mac Studio 可以接收额外的 GPU 和 AI 块,而MacBook Pro可以优先考虑效率和内存带宽。
台积电已经提供了用于堆叠和连接多个硅片的技术,包括 SoIC、CoWoS 和 InFO。苹果多年来一直使用复杂的封装,但人工智能处理可能证明更深入地采用垂直堆叠和异构集成是合理的。
面临的挑战将是保持苹果芯片的低延迟和能源效率。仅当小芯片之间的通信不会消耗过多电量或强制软件将每个块视为单独的设备时才有用。
记忆必须成为人工智能的一项功能
英伟达最近的发展表明,人工智能性能不仅取决于计算,还取决于移动数据。
大型语言模型在内存和计算单元之间不断传输参数、激活和缓存上下文。处理器可以包含巨大的理论能力,但当内存无法足够快地提供数据时,处理器仍然未得到充分利用。
苹果通过统一内存拥有优势。 Mac 可以将大部分内存分配给 AI 模型,而不受独立显卡常见的固定视频内存限制。数百 GB 的 Mac Studio 配置可以运行许多消费类 GPU 无法容纳的模型。
仅靠能力并不能解决问题。未来的苹果芯片人工智能设计需要更高的带宽、改进的压缩和更智能的缓存,以便更大的上下文窗口不会压垮内存系统。
苹果还可以为桌面芯片推出专用的高带宽内存选项。用于 AI 开发的昂贵的 Mac Studio 或 Mac Pro 可以将统一的系统内存与位于 GPU 和神经引擎旁边的更快的本地池结合起来。
这样的设计会使共享内存架构的简单性变得复杂,但 Nvidia 的进展表明,极端的 AI 性能越来越需要不同的内存层协同工作。

较低的精度可以产生较大的增益
Blackwell 通过扩展对包括 FP4 在内的数字格式的支持,加速了生成式 AI。使用更少的位来表示权重和计算可以减少内存使用,并允许通过相同的硬件运行更多的操作。
较低的精度不会自动保持模型质量。它需要精心设计的缩放、量化和软件支持,以防止准确性下降。
苹果已经针对压缩和量化模型优化了其加速器,但它可能会使低精度人工智能成为更突出的架构优先事项。神经引擎和 GPU 硬件应支持根据每层的敏感度动态选择的多种格式。
未来的模型可以使用更高的精度进行计算,同时将不太敏感的操作转移到 4 位甚至更小的表示形式,从而导致错误累积。这将提高速度并减少内存压力,而无需迫使开发人员对整个模型进行相同的量化。
Apple 可以使该功能在内存和电量有限的 iPhone 和 iPad 上特别有价值。一种精度需要 12GB 的模型在智能压缩后可以安装在主流设备中,从而允许更多的私有处理保留在本地。
软件是 Nvidia 最难的一课
英伟达的优势不仅限于晶体管。 CUDA、TensorRT、通信库和优化的模型框架使其硬件更易于用于研究和生产。
苹果有 Metal、Core ML 和 MLX,但生态系统仍然分散。开发人员可能需要不同的工具,具体取决于他们的目标是消费者应用程序、科学工作流程、本地语言模型还是 GPU 计算。
MLX 是一个强大的基础,因为它是针对 Apple 芯片、统一内存以及来自 NumPy、PyTorch 和 JAX 等框架的熟悉开发模式而设计的。苹果应该将其扩展为从实验到商业部署的更完整的路线。
通过 MLX 创建或微调的模型应该可以更少的转换步骤转移到 Mac、iPhone 和 iPad 应用程序中。分析工具应解释工作负载是否在 CPU、GPU 还是神经引擎上运行,并在模型受到内存、精度或不受支持的操作限制时建议更改。
Nvidia 共同改进了硬件和软件,使每个架构都能从新的内核、编译器和模型优化中受益。苹果也需要同样的紧迫感。当第三方开发人员无法轻松地将要求苛刻的工作负载引导到神经引擎时,更快的神经引擎提供的价值有限。

互连可以将 Mac 变成小型 AI 集群
Rubin通过NVLink和高速交换将众多GPU视为一个协调的计算系统。苹果可以将这一原则应用到更小的规模上。
Thunderbolt 对于存储和显示很有用,但它不允许多台 Mac 共享内存和加速器作为一台低延迟 AI 计算机。专用的 Apple 互连可以让 Mac Studio 或未来的 Mac Pro 模块结合处理资源来进行模型训练、推理和科学模拟。
Apple 之前使用 UltraFusion 连接 M1 Ultra 和 M2 Ultra 内的两个处理器芯片。将相关概念扩展到一个包之外可以创建紧凑的人工智能集群,保留 macOS、统一的开发工具和本地数据控制。
这个概念不会与包含数十个高功率 GPU 的 Nvidia 机架直接竞争。它的吸引力在于隐私、可管理的功耗以及在研究实验室、生产工作室、医疗组织和无法将敏感信息发送到公共云服务的企业内部的安装。
苹果还可以在自己的设备上进行分布式处理。同一本地网络上的 Mac、iPad 和 iPhone 包含多个通常独立使用的神经引擎。安全的工作负载分配可以将闲置设备转变为临时推理资源,而不会暴露个人信息。
苹果必须保持差异化
Nvidia 针对巨大的持续工作负载、液体冷却和跨整个机架测量的功率预算优化了数据中心系统。苹果公司为安静的台式机、轻薄笔记本电脑和袖珍设备设计芯片。
过于密切地追随英伟达会损害苹果芯片成功的品质。 MacBook 完成 AI 任务的速度提高了一倍,但电池寿命却缩短了数小时,这并不代表着一个简单的改进。
相反,苹果应该有选择地使用 Nvidia 的创新:模块化芯片来扩展处理器、更强的互连以减少瓶颈、降低精度以适应更大的模型以及使每个加速器都可访问的统一软件堆栈。
最有希望的测试场可能是未来的 Mac Studio,而不是 iPhone。其更大的热封套可以引入先进的封装、额外的人工智能芯片和更快的内存,然后再减少便携式设备的这些技术。然后,成功的元素可以在产品阵容中移动,为苹果提供一条从工作站级实验到数十亿个人设备的实用路线。




