工业界跑了二十年的推荐系统,本质上是一台精密却臃肿的齿轮流水线:上游挂着十多路召回策略,中间架着粗排,下游再堆叠由数百个人工特征工程喂养的重型精排。每个环节各怀鬼胎,上一级截断的误差下一级无力回天。Yandex近日在arXiv发布的Sona技术报告(arXiv:2608.11015,v2版于2026年8月12日更新),直接给这套臃肿体系动了一记大手术:用单一端到端Transformer模型,彻底替代15路以上候选生成器、粗排及精排全套级联。
这场试验不是停留于学术榜单的离线推演。Yandex在其智能音箱端的Music My Vibe表面切出各占15%的随机用户,实机在线A/B测试连续跑了7天。结果所有核心指标全线翻红:主要业务指标活跃用户提升4.53%(统计显著性p < 0.01),是该场景此前最强模型Argus增量(+1.93%)的2.35倍;总收听时长增长6.30%,点赞数跃升11.42%,深度互动用户增加7.37%,语音指令重播更是飙升了17.99%。
零特征工程与长上下文压缩
天下苦特征工程久矣。在过往的经典流水线里,一个工程师团队的大半精力都在挖掘各种滑动窗口统计特征、交叉交叉再交叉的用户画像。Sona最激进之处在于输入端彻底剔除人工特征,全凭原始时间戳日志字段入模:曲目ID、艺术家ID、时长、点赞、播放时长及场景标记,加上预先训练的Semantic IDs。
如何把数百万计的音乐转化成大模型能认的词表?Sona走的是分层离散编码路径。系统先用冻结的多模态LLM在prefill模式下抓取曲目前90秒梅尔频谱图与文本标签,随后通过4层Transformer与真实用户行为日志做InfoNCE对齐,最终经由残差K-means量化为3个容量各为32,000的码本。每个曲目因此变成由3个离散Token组成的三元组。在离线基准中,该方案将Recall@1000从CLMR音频基线的0.8111推升至0.8524。
拿到Token之后,工业级模型要面对另一堵墙:推理算力。为了吃透用户的长程偏好,Sona编码器的最大上下文拉长到了8,192个历史事件。如果对8,192长度全程做多层自注意力运算,在线延迟根本无法承受。Sona团队的解法是非对称分流:
- 最近发生的2,048个高频交互事件,分配完整的7层自注意力堆栈深挖;
- 较早的6,144个交互事件,仅通过交叉注意力与单一层全局网络做压缩映射。
这套非对称设计在保住全注意力绝大部分表征精度的同时,直接抹掉了一半的推理成本。
留在离线的教师与展开蒸馏
在生成式推荐里,让生成器独立生成候选,再交给排序模型打分,极易陷入经典断裂:两边分布脱节。Sona采用2层解码器配合束宽1,024的束搜索展开曲目,随后依靠4层交叉注意力结构的Ranking Module复用同一个编码器状态打分。但轻量级的Ranking Module本身判别能力有限,它的能力源自一套独特的展开蒸馏机制(Rollout Distillation)。
在离线训练阶段,系统部署了一尊0.6B参数规模的Teacher Ranker。这位教师在长达一年的用户互动日志上完成了两阶段训练:先做Next-Token预测预训练,再进行多头排序微调。消融数据显示,光是拿掉教师的预训练步骤,加权配对准确率就从0.6215滑落至0.6153。
在线训练时,解码器通过束搜索把候选实时生成出来,教师模型同时对这些生成候选与线上真曝光样本联合批改打分,强迫轻量级Ranking Module用绝对误差拟合教师输出。学生学会了教师对当前动态生成空间的判别力,而这尊0.6B参数的教师大模型在上线服务那一刻被完全剥离。
工程流水线同样苛刻:系统按15分钟窗口聚合会话日志,GPU训练集群每10分钟把更新权重推送至在线Triton推理集群;借助CUDA Graphs优化,模型FLOPs利用率打到了41%。整个链路从一个交互事件发生到模型在线生效,中位延迟被死死卡在45分钟以内(p99为60分钟)。
削藩之后的代价:覆盖率与信息茧房
传统级联系统像繁冗的官僚体系,层层叠床架屋固然损耗效能,却也维系着脆弱的分权平衡:双塔负责泛化探索,协同过滤捕捉圈子偏好,冷启动策略强制保底长尾,规则引擎兜底多样性。Sona以奥卡姆剃刀之姿用单模型削尽诸侯,看似利落,却立刻撞上了生成式架构的固有暗面。
统一表征的单模型消除了级联内耗,却也把探索负样本的窗口彻底焊死。
论文坦承,Sona在全库曲目覆盖率上低于传统级联流水线。束搜索解码依赖概率最大化,天然偏爱高频共现路径;冷门曲目与长尾音乐人缺乏足量行为Token支撑,在32,000维的离散码本聚类中容易沉降到底层。更致命的是展开蒸馏机制自带的回音壁效应:教师模型打分的样本全来自于解码器生成的束展开候选与已有曝光,一旦解码器早期陷入偏狭选择,整套蒸馏就会在模型自己的生成分布里自娱自乐,缺乏接触外部负样本的能力。
那项飙升17.99%的重播语音指令,正是一记冰冷的双向警钟。它固然证明当前推荐极其切中听众当下的舒适区,但在流媒体生态里,过度复播也意味着系统正在趋于保守,牺牲了发现新内容的空间。
- 风险.My Vibe是极度纯粹的无输入流式听歌场景,用户被动接受流媒体投喂,反馈闭环纯粹;这套单模型一旦移植到搜索意图强烈、带有复杂筛选与多重跳转的电商长流程或图文信息流中,缺乏显式特征交叉与硬规则干预的纯生成式机制恐将面临泛化失控。
Yandex目前并未将Sona推向全量流量,论文作者也明确呼吁需要展开数月维度的长期实验来追踪生态损耗。用生成式大模型吃掉多级流水线,在工程执行力上是一次难得的断腕突围,但技术演化向来利弊相依。一刀斩断旧包袱容易,如何在自闭环的代码深处重新留出长尾的呼吸缝隙,才是端到端架构能否走出单一温室的真正试金石。
