苹果这轮桌面 Mac 更新里,最反常的数字不是芯片代数,而是 512GB。

Mac Studio 搭载 M5 Ultra,统一内存最高 512GB,带宽达到 1.2TB/s。macOS 26.2 还支持用 Thunderbolt 5 和 MLX 连接多台 Mac,分布式运行更大的本地模型。苹果给出了容量,也给出了连接方法,却暂时没有给出最关键的答案:实际能跑多快。

两台新 Mac,真正拉开差距的是内存

Mac mini 和 Mac Studio 的定位,被这次更新进一步拉开。

产品芯片与内存起价更适合谁
Mac miniM6,最高 32GB 统一内存899 美元本地 AI 入门、轻量代理、小中型量化模型
Mac StudioM5 Ultra,最高 512GB,1.2TB/s 内存带宽2499 美元大模型开发、研究、高隐私工作负载

这里的起价只是产品线门槛。最高内存配置显然会贵得多,不能拿 2499 美元直接对应 512GB。

32GB 能做什么?扣掉系统和应用占用后,更适合 7B、14B 级量化模型。部分 32B 模型也可能装得下,但长上下文、并发请求和 KV Cache 会迅速吃掉余量。普通内存配置的 MacBook,问题也在这里:模型能启动,不等于能长期舒服地用。

512GB 则跨过了另一条线。按容量估算,它有机会容纳数百亿乃至数千亿参数的量化模型,也能给长上下文留下更多空间。但“装得下”和“跑得快”是两回事。苹果尚未提供可核验的 tokens/s、首字延迟和多机扩展效率,现阶段不能把宣传参数直接换算成生产力。

真正受益的人很明确:需要反复运行本地模型的开发者、研究者,以及处理私有代码和敏感数据的团队。普通消费者不需要为了 AI 三个字去追 M5 Ultra。

Mac 被串起来,云端账单是直接推力

Apple Silicon 的优势一直不是单项峰值算力,而是 CPU、GPU 共用一池统一内存。离散显卡常被显存容量卡住,专业级大显存 Nvidia GPU 又价格高昂。Mac 走了另一条路:整机买内存,再用 MLX 把模型调度到苹果芯片上。

macOS 26.2 把这条路向前推了一步。多台支持 Thunderbolt 5 的 Mac mini 或 Mac Studio 可以连接起来,让 MLX 分配模型,在不同机器之间协同推理。

开发者早就在尝试串联 Mac。苹果现在做的,是把民间玩法纳入系统和工具链。

动力并不浪漫。“天下熙熙,皆为利来。”AI 编程代理会连续调用模型,云端 API 按 token 收费,使用越频繁,账单越难忽略。本地推理把成本变成一次性硬件投入、电费和维护费,还能让代码、文档与客户数据少经过一层外部服务。

但多机互联没有把几台 Mac 变成一块零损耗的超级内存。

Thunderbolt 5 的机器间通信速度,远低于 M5 Ultra 本机 1.2TB/s 的内存带宽。模型切分后,中间状态需要跨机器传输,节点越多,通信、同步和调度成本越重。软件没有针对 MLX 和分布式推理适配好,扩容收益就可能迅速递减。

上世纪 90 年代的 Beowulf 集群,也曾用普通 PC 拼出更大的计算系统。历史经验很朴素:廉价节点能降低门槛,互联和软件却会决定上限。今天的 Mac 集群不完全一样——节点本身并不便宜,Thunderbolt 5 也不是专业计算集群的高速网络。

所以,不能把几台 Mac mini 简单写成 Nvidia 专业 GPU 的低成本替代。整机价格、功耗、存储、连接设备和开发适配都要算进去。训练任务、CUDA 软件和追求确定吞吐量的工作负载,Nvidia 仍有更成熟的工具和更清楚的性能路径。

苹果抓住了内存瓶颈,但购买决策仍要等实测

我认可苹果这次的方向。很多本地模型的第一道门槛并非算力不够,而是参数根本装不进内存。模型都加载不了,峰值性能再漂亮也没有意义。

苹果也很清楚自己的生意:它没有把本地 AI 变成免费能力,而是把开发者对隐私、稳定成本和数据控制的需求,换成更高配置的硬件订单。

不同使用方式,账要分开算。

使用场景更现实的选择原因
偶尔调用强模型、需求波动大云端 API不承担硬件闲置成本,还能直接使用前沿模型
日常运行小中型模型或 AI 编程助手单台 Mac mini成本较低,部署简单,但 32GB 很快会碰到容量边界
长期处理私有代码、文档和稳定推理任务单台大内存 Mac Studio数据留在本地,容量充足,运维比集群简单
已经拥有多台 Thunderbolt 5 Mac尝试 MLX 多机推理能利用现有设备,但扩展效率必须实测
训练模型、依赖 CUDA 或要求确定吞吐量Nvidia 工作站或云 GPU软件成熟,性能基准和部署经验更完整

如果你是个人开发者,眼下最合理的动作不是按最高内存下单,而是先看自己的云端账单和使用频率。调用不稳定、偶尔才跑一次大模型,云服务通常更省钱。每天持续调用、数据又不能离开本机,本地硬件才可能摊薄成本。

如果你在团队里做采购,也别一上来买多台 Mac 组集群。先用单机验证模型质量、上下文长度和吞吐量,再决定是否扩容。很多项目最后卡住的并非硬件容量,而是本地模型效果达不到云端前沿模型,或者软件适配成本超过 token 费用。

接下来真正要看的只有几项硬指标:同一模型、同一量化精度下的每秒 token 数,首字延迟,多机扩展效率,持续功耗,以及 512GB 配置的实际价格。

这些数字没有出来之前,512GB 只能证明苹果造出了一只更大的碗,尚不能证明这顿饭吃得快、吃得省。