苹果正式发布了第三代基础模型(AFM 3)家族。这套与 Google 合作构建的体系包含五款模型,覆盖从 30 亿参数的端侧密集型模型 AFM 3 Core,到依托 Google Cloud 与英伟达算力运行的云端 AFM 3 Cloud Pro。
最关键的变化落在工程落地与技术结盟两个维度:在端侧,苹果试图用闪存分页与专家剪枝技术打破手机内存对大模型的物理禁锢;在云端,苹果不得不走出全自研芯片的舒适区,借道外部算力与机密计算硬件支撑高强度推理。这家长期以软硬件封闭和绝对隐私为护城河的公司,正在大模型军备竞赛的压力下,重构自己的技术防御线。
闪存换入与动态剪枝:AFM 3 Core Advanced 把 20B 模型拆进消费级芯片
消费级移动设备的动态随机存取内存(DRAM)带宽与容量,一直是端侧大语言模型难以逾越的物理瓶颈。传统混合专家架构(MoE)要求所有专家权重长驻内存,并按生成标记(Token)频繁切换专家,这在手机芯片上会带来无法承受的内存开销与功耗。

根据官方在 2026 年 6 月 8 日发布并在 9 月 9 日修订的技术报告,苹果推出的 AFM 3 Core Advanced 给出了不同的解法。这款总参数量达 200 亿(20B) 的端侧原生多模态模型,并未强行塞入 DRAM,而是基于指令跟随剪枝(IFP)架构,将整机权重存放在成本更低、容量更大的 NAND 闪存中。
由于闪存到内存的带宽无法支撑逐字切换权重,模型改在提示词输入阶段,由轻量级密集模块选定一组专家,随后在生成过程中周期性重新选择。配合始终常驻的静态共享专家,单次推理请求仅激活 10 亿至 40 亿(1-4B) 参数调入 DRAM。这种妥协用微小的调度延迟换取了容量突破,让端侧得以承载更高精度的听觉表征与语音合成任务。
- 结论.20B 端侧大模型本质上是用闪存调度置换内存带宽的工程折中,它能显著改善响应体验,但推理能力不可等同于同尺寸常驻内存的密集基座。
走出自研芯片:AFM 3 Cloud Pro 借道 Google 与英伟达
在云端,苹果延续了私有云计算(PCC)的架构路线,推出了主打效率的 AFM 3 Cloud 与专攻图像生成的 ADM 3 Cloud。这两款模型均运行在苹果芯片集群上,用于承载日常的复杂问答与图像编辑。

真正的战略转折发生在更高端的 AFM 3 Cloud Pro 上。为应对工具调用和复杂长链推理带来的算力开销,苹果首次将私有云计算延伸至 Google Cloud 集群,并引入了英伟达机密计算 GPU。
苹果并非直接租用普通云服务器,而是试图用一整套密码学与硬件机制锁定控制权:底层依靠支持 TDX 技术的英特尔 CPU 与英伟达机密计算硬件阻断宿主机窥探,硬件根植入 Google Titan 安全芯片,节点必须加载经由苹果加密签名的定制系统固件才能接入计算网络。
这套架构比直接使用普通商业云模型更审慎。以常规消费级 Gemini 服务为例,用户的对话数据通常会在服务商服务器保留,并可能进入人工审核或训练池;苹果的私有云计算则承诺计算过程无状态、请求处理完即销毁。但联合 Google 与英伟达的举措也证明,即便坐拥庞大资金,苹果单凭自研芯片也已无法独立吞下顶级多模态大模型的算力负载。
语料饥渴下的条款更新:隐私信任走钢丝
在技术白皮书中,苹果强调 AFM 3 的预训练语料仅由公开网络数据、商业授权采购、开源集、专项研究及合成数据构成,默认不使用 用户的私有个人数据或交互记录进行训练。然而,数据饥渴正在推高规则边界的拉扯。

2026 年 9 月 9 日,苹果在技术更新的同时修订了支持条款,明确标注用户可以选择主动加入(opt-in)以协助改进 Siri 与 Apple Intelligence。紧接着在 9 月 12 日,多位测试用户在社区披露,iOS 27 RC 候选版中弹出了显眼的隐私授权窗口,请求用户授权将 Siri 交互数据用于模型的后续改进与训练。
这一弹窗迅速唤醒了公众的历史记忆。2019 年,苹果曾因第三方承包商在未明确告知的情况下人工抽检 Siri 录音陷入风波,随后招致多国监管调查与诉讼。
隐私绝不是写在白皮书里的密码学公理,而是每一次系统弹窗前给用户的真实控制权。
更大的审视压力来自学术界。早在 2026 年 5 月,针对 PCC 的独立逆向分析就指出,苹果分发的系统部分核心镜像采用了预编译二进制文件,外界无法做到完全可复现的代码构建,这意味着第三方很难从数学上完全证伪运行时的代码行为。
- 风险.当庞大的前沿模型对高质量真实交互语料产生依赖,即便是以隐私立身的生态,也难以彻底避开用便利换授权的商业惯性。
对于数亿 iOS 设备持有者而言,iOS 27 带来的并不只是一系列更聪明的生成式功能,还有一次具体的选择题:在点击那个同意按钮之前,每个人都必须想清楚,自己究竟是愿意继续固守完全隔绝的数据边界,还是用一部分交互痕迹去喂养那个更机敏的语音助手。
