PrismML AI 93% 压缩可以给 Siri 带来重大提升据报道,PrismML AI 压缩缩小了 270 亿个参数模型,为直接在 iPhone 上实现更强大的 Siri AI 创造了可能的途径。

PrismML AI 压缩可以为苹果提供一种方法来放置更强大的功能人工智能直接在 iPhone 内部。这加州理工学院spinout 表示,它将 270 亿个参数的模型从大约 54GB 减少到不到 4GB,小到足以在 iPhone 17 Pro 上本地运行。

这意味着大约减少了 93%,但更有用的数字可能是内存效率。棱镜ML表示其技术可以比相同型号的传统版本减少多达 15 倍的内存使用。据报道,苹果公司已与这家初创公司就该技术的可能用途进行了早期讨论。

两家公司均未宣布合作伙伴关系、收购或产品计划。 PrismML 的声明还需要通过独立测试、持续性能以及重度压缩带来的妥协来判断。即便如此,该演示直接指出了苹果最大的人工智能挑战之一:在设备内部安装更强大的模型,而不破坏电池寿命、消耗太多内存或将每个复杂的请求发送到云端。

大的人工智能模型很难在手机上运行,​​因为它们的参数需要大量存储和工作内存。标准模型可能在配备强大加速器、大内存池和恒定电力的数据中心中表现良好,但在设计为仅靠一块电池运行一整天的设备中就变得不切实际。

PrismML 通过用更少的位数表示模型权重来解决这个问题。该初创公司开发了所谓的盆景模型,其中包括 1 位版本,旨在保留原始模型的大部分功能,同时大幅减小尺寸和能源消耗。

据报道,iPhone 演示使用了阿里巴巴 Qwen 模型的压缩版本,拥有 270 亿个参数。这比通常与智能手机相关的紧凑语言模型要大得多。在本地运行表明模型大小可能不再仅由参数数量控制。这些参数的表示效率如何也同样重要。

压缩并不是什么新鲜事。开发人员已经使用量化、剪枝和其他方法来缩小模型。 PrismML 声称,其方法进一步推动了这一过程,同时保留了有用的推理和语言性能。

这一说法正是苹果感兴趣的原因。

为什么 Siri AI 需要更小的模型

苹果的人工智能战略取决于设备和云端之间的工作划分。更简单的 Apple Intelligence 请求可以在本地运行,而要求更高的任务可能会转移到私有云计算。这种混合结构使苹果能够提供更强大的功能,而无需强迫 iPhone 搭载它可能需要的每种型号。

然而,云层引入了成本、延迟和可用性要求。请求必须离开设备、到达服务器、被处理并返回。苹果围绕强大的隐私保护设计了私有云计算,但本地处理仍然更快、更容易解释。

更大的设备模型可以提高 Siri AI 的语言理解、推理能力以及在没有网络连接的情况下完成多步骤任务的能力。它还可以减少发送到苹果服务器的请求数量。

这并不意味着云处理将会消失。服务器型号可以保持更大并支持特别苛刻的请求。 PrismML AI 压缩可能会移动分界线。当前需要私有云计算的任务可能会直接在未来的 iPhone 上实现。

随着 Apple Intelligence 覆盖更多用户,其好处可能包括更快的响应、更强大的离线操作以及更少的服务器需求。

图片来源:苹果公司

隐私符合苹果的首选方向

设备端处理一直是苹果人工智能定位的核心。个人信息可以保留在 iPhone 上,而不是通过传统的云服务移动。该设备可以解释请求、使用本地上下文并生成答案,而无需将底层数据暴露到硬件之外。

能够在本地处理更多工作的模型将强化这种方法。 Siri AI 可以理解消息、笔记、日程安排或屏幕内容,同时减少将信息传输到其他地方的需要。

当本地处理不足时,苹果已经使用私有云计算,并且该公司围绕该系统建立了重要的安全措施。然而,iPhone 上完成的每一项任务都消除了一个额外的处理步骤。

隐私并不是唯一的优势。当连接较差或不可用时,本地模型可以继续运行。这可以在飞行、乡村旅行、拥挤的活动或云访问变得不可靠的其他情况下帮助 Siri AI。

功能强大的离线助手也会让人感觉更像是操作系统的一部分,而不是通过界面访问的远程服务。

iPhone 仍然存在物理限制

将型号缩小到 4GB 以下并不会自动使其成为 iPhone 日常使用的理想选择。该模型还必须运行得足够快,避免过热,并为 iOS 和活动应用程序留出足够的内存。

技术演示可能会成功完成任务,但会消耗比用户从 Siri 接受的更多的精力或时间。苹果需要优化其神经引擎、内存架构和软件框架的模型,而不是简单地将 PrismML 的现有构建加载到每个支持的设备上。

存储是另一个考虑因素。占用数千兆字节的模型将与应用程序、照片、离线媒体和系统文件竞争。苹果可以为智能功能预留更多存储空间,有选择地提供模型,或者使用多个专用模型而不是一个大型通用系统。

电池的使用可能会造成最困难的限制。人工智能模型可以放入内存中,但对于频繁的移动使用,仍然需要太多的持续计算。理想的系统需要足够小、快速且高效,以便能够融入 iPhone 的正常行为中。

苹果的芯片设计使其在这方面具有优势。该公司控制处理器、神经引擎、操作系统和人工智能软件堆栈。 PrismML 可以提供压缩技术,而 Apple 则负责更深入的硬件集成。

图片来源:苹果公司

无需取代云即可实现更好的人工智能

PrismML 技术的最大用途可能不是在每部 iPhone 上安装一个巨大的模型。苹果可以在为不同设备和任务设计的一系列模型中使用压缩。

较小的模型可以处理常规语言请求。功能更强大的本地模型只能下载到具有足够内存的最新 Pro 设备。专门的模型可以支持书写、图像生成、应用程序操作或视觉智能。当请求超出本地能力时,私有云计算仍然可用。

这将为苹果提供比全本地或全云设计更大的灵活性。每个设备都可以搭载适合其芯片、内存和电池容量的智能。

该方法还可以帮助 Mac、iPad 和未来的家用产品。压缩模型可以在 MacBook Air、HomePod 或智能家居集线器上更舒适地运行,而无需持续访问服务器。苹果可以扩展相同的智能基础跨产品,同时根据硬件调整模型大小。

当 Siri AI 超越回答问题时,这一点尤其重要。应用程序操作、个人环境和环境智能家居控制需要全天保持可用的智能。较低的内存和能量需求可以使这些体验更加实用。

压缩总是需要权衡

减少 93% 是一个引人注目的标题,但压缩会影响输出质量。较小的表示可能会失去精确性、削弱推理能力或难以处理不常见的信息。真正的考验不是模型是否运行。问题在于它在苹果期望 Siri AI 处理的任务中是否表现得足够好。

PrismML 表示,与全精度模型相比,其技术保留了强大的性能。苹果仍然需要对语言、安全类别、工具使用和个人助理场景进行广泛的评估。

可靠性对于操作系统助手来说尤其敏感。用于休闲头脑风暴的模型可以容忍偶尔的弱点。一个模型处理消息、约会、指示或应用程序操作需要更高级别的一致性。

因此,苹果可能会选择性地使用激进的压缩。某些任务可以接受较小的模型,而其他任务则可能保留在更高质量的服务器模型上。只要响应保持快速且可靠,用户就不需要知道哪个模型处于活动状态。

图片来源:苹果公司

苹果想要的是技术,而不一定是公司

有报道称苹果已经与 PrismML 进行了交谈,但早期的对话可能会朝几个方向发展。苹果可以授权该初创公司的技术、进行技术整合、雇用团队成员或探索收购。

该公司拥有收购小公司以获取专业技术和工程人才的悠久历史。模型压缩适合这种模式,因为它支持苹果现有的人工智能战略,而不是创建单独的消费产品。

PrismML 还可以保持独立并向多家硬件公司提供其工具。其技术在电话、计算机、机器人、车辆和工业设备等领域具有潜在用途,这些领域的云访问成本昂贵或不可靠。

仅苹果公司的兴趣就引起了这家初创公司的关注。更重要的是,高效模型变得与大型模型一样有价值。多年来,人工智能行业一直将规模视为改进的主要途径。移动计算提出了一个不同的问题:在一台个人设备的功率和内存限制内可以容纳多少智能?

较小的型号可以让 Siri 感觉更大

苹果不需要在 iPhone 上放置最大的可用型号。它需要一个足以改善用户每天重复的交互的模型。

PrismML AI 压缩可以帮助 Siri 了解更多上下文、在本地完成更多请求并无需等待服务器即可做出响应。它可以强化苹果的隐私论点,同时减少数百万台人工智能设备造成的基础设施负载。

该技术仍处于早期阶段,启动演示与苹果发布的功能不同。如果质量、电池寿命或速度在日常使用中受到影响,93% 的数字就没有什么意义。

但这个方向非常适合苹果。该公司花费数年时间设计更小、更高效的硬件系统,其性能超出了其明显的极限。 PrismML 为人工智能模型提出了类似的策略。

如果这家初创公司的说法属实,那么 Siri 的下一个重大改进可能不是来自将更大的模型发送到云端。它可能来自于将一个设备安装到 iPhone 中而不让 iPhone 感受到重量。