YuE2的展示页放出65个精选案例,每首歌配一份交互式ABC乐谱,红色音符跟着播放实时移动。旁边还摆着原始录音对应的乐谱页做对照,旋律轨和伴奏轨也是分开导出的。这不是听感演示,是结构演示——旋律、节奏、和弦被拆成可读符号,不再是一段听不透的波形。

真正的进步不是生成的音频更像歌,而是把生成过程从"听个响"变成"能拆开核对"。这意味着评价AI音乐生成的标准,正在从"像不像人唱"转向"改不改得动"。但65个案例是官方精选,不是完整评测集,长曲一致性和原创性目前都没有答案。

65个案例:五种变换,一张表看完

变换类型具体操作考验什么
风格重排同一旋律换外壳,流行改雷鬼、改重金属、改爵士旋律骨架能否脱离原编曲
歌词改写换词不换调旋律和文本能否脱钩
速度调整例如把一段旋律从82BPM拉到104BPM节奏结构能否重新对齐
调式重映射F大调搬到D小调和声逻辑能否跟着换
无和弦裸旋律输入只给一条旋律线模型能否自己配和声、编伴奏
黑箱生成 vs 符号可控 传统音频生成 输入:文字/旋律提示 输出:一段波形音频 只能整段试听 无法定位单个音符 改一句词=重新生成整段 YuE2 符号规划 输出:旋律/节奏/和弦乐谱 可逐句对照原始录音 可单独调速度/调性/和弦 旋律层与音频层分离 改一层,不用重生成全曲

这65个案例是官方精选,不是完整评测集。更像一场能力秀,不是跑分单——这点要分清楚。

从黑箱音频到符号乐谱,谁该改做法

多数音乐生成模型的老套路是:文字或参考音频进,波形出。这段副歌用了什么和弦,没人能答。想改一句词,基本等于重新生成一遍整段。

YuE2的做法更像MIDI年代的老逻辑重新登场。MIDI当年把音乐从波形变成可编辑的音符事件,才有了后来的DAW和混音产业。YuE2把这套逻辑搬进生成模型内部,吐出来的不只是音频,还有一份能读、能核对的符号乐谱。

一次生成,拆成四步 原曲输入 旋律·歌词 原始录音 符号规划 旋律/节奏 和弦标注 参数变换 风格·速度 调性·歌词 生成输出 音频+乐谱 逐句可核对

对音乐制作人来说,这层符号乐谱比单纯音频更有用——至少能看清和弦走向,不用靠耳朵扒谱。但展示页没说是否支持导出到主流DAW工程文件,这一步能不能真正接进现有工作流,还得等实际测试验证。

对研究者和开发者来说,该盯的是符号规划层和音频输出是否长期对齐。如果乐谱和最终音频经常对不上,这套"可核对"就只是表面可视化,不是真正的生成约束。目前页面没有给出对齐误差或一致性数据,这个问题还没有答案。

限制在哪,接下来该看什么

页面展示的是案例和结构可视化,不是完整模型评测,也不等于产品化能力。长曲一致性、原创性、训练数据来源、版权处理,这几个问题目前都没有答案。歌词改写和风格重排背后,原曲算改编还是算训练素材,页面没有说明。

谱可核对,曲未必动听。

接下来值得盯的三件事:是否有第三方跑完整测试集,而不是官方精选案例;是否公开训练数据来源和版权处理方式;符号乐谱和音频输出能不能在非精选样本里也保持对齐。这三件没眉目之前,"AI已经懂音乐"这句话还早。