苹果在8月25日发布了新一代Mac Studio,搭载M5 Max和全新M5 Ultra。发布稿里最响的一句话是:这台机器能在本地跑下超大规模的大模型。M5 Ultra顶配512GB统一内存,理论上能装进千亿参数级的模型。但这个顶配版本要等到10月下旬才发货,比9月22日的常规发货晚了一个月——发布会上喊得最响的那句卖点,发布当天其实还测不了。

一堆倍数,两份口径

官方给出的数字很密集:AI性能最高提升4.3倍,存储速度最高2倍,图形性能最高1.8倍,CPU速度最高1.3倍。M5 Max配18核CPU、最高40核GPU、最高128GB内存,起售2499美元。M5 Ultra配36核CPU、最高80核GPU、512GB内存,起售5499美元,统一内存带宽提升到1.2TB/s,比上代M3 Ultra的819GB/s高出不少。

值得记一笔的是,上代Mac Studio只有M4 Max,没有"M4 Ultra"——M5 Ultra其实跳过了一整代Ultra芯片,直接从M3 Ultra升级过来,这也是为什么它跟M3 Ultra比,而不是跟不存在的M4 Ultra比。

更值得留意的是,苹果自己两份文件对不上账:Mac Studio产品发布稿写的是"AI性能最高提升4.3倍",而M5 Ultra芯片的专稿里,同一件事写的是"GPU AI峰值算力最高提升4.5倍"。大概率是测试工作负载或口径不同,不算矛盾,但也说明这些倍数从一开始就不是一个统一、可复现的标准——全部来自苹果2026年7月的内部测试,没有第三方跑分交叉验证。

苹果自己的口径分裂 4.3x Mac Studio发布稿 "AI性能提升" 4.5x M5 Ultra芯片专稿 "GPU AI峰值算力" 512GB 顶配内存 10月下旬才到货

装得下,不等于跑得快

统一内存架构是苹果的老底牌:CPU、GPU、神经引擎共用一个内存池,容量能堆到512GB,而英伟达消费级显卡的显存是硬上限——RTX 5090也只有32GB。这就是为什么苹果敢说"单机跑超大模型",英伟达做不到。

但容量和速度是两件事。上代M3 Ultra已经有独立用户实测过:512GB配置能完整装下DeepSeek R1这类671B参数的模型,实测生成速度大约18到20 token/秒,功耗不到200瓦。看起来体面,但换成更密集的405B模型,速度会掉到3 token/秒左右——慢到接近不可用。

能装下大象的仓库,不代表大象能在里面跑起来。

RTX 5090反过来:32GB装不下大模型,但只要模型能塞进显存,速度是碾压级的——7B级小模型能跑到200多token/秒,30B级密集模型也有50到65 token/秒。它的短板从来不是速度,是容量:70B以上的模型要靠降精度或多卡分摊才能塞进去。

苹果宣传的那几个"快4倍"的场景,更可能体现在提示词处理(prefill)阶段,真正逐字生成答案(decode)的速度受内存带宽制约,提升幅度大概率远低于宣传数字。

容量优先 vs 速度优先 Mac Studio M5 Ultra 512GB统一内存 671B模型 约18-20 token/秒 功耗低于200W 装得下,跑不快 RTX 5090 32GB GDDR7显存 7B模型 200+ token/秒 70B+模型装不下 跑得快,装不下

谁真的需要这台机器

真正被M5 Ultra打动的,是那些想在单机上跑动辄几百亿参数的研究者和数据科学家——不追求实时对话速度,更看重能装下、能私有部署、功耗还低。对这批人,512GB内存是无可替代的选项。

但如果工作是训练、微调、或者同时服务多个用户,CUDA生态的成熟度和显卡本身的吞吐量,目前还是英伟达占优。Mac Studio的Core AI和MLX框架在补软件生态的短板,但短期内替代不了CUDA的位置。

  • 风险.512GB顶配要等到10月下旬,意味着这次发布会最大的卖点,在9月22日正式发货时其实还没法被验证——独立跑分和大模型实测的真正窗口,要再往后推一个多月。

这次Mac Studio的升级,规格表确实好看:内存翻倍,带宽提升,芯片架构换代。但苹果自己两份文件里都数不清同一个倍数,已经说明这套"快X倍"的叙事本身经不起太细的推敲。对普通开发者和跑中小模型的人来说,这次升级的边际价值,值得打一个问号。