让大模型写一段复古游戏音乐,通常的期待不过是输出几行五线谱文本,或者调用音频模型跑出一小段现成的波形文件。

Simon Willison在2026年10月6日做了一个极简测试:他给Anthropic的Claude Opus 5.5发去一段提示词,要求以经典冒险游戏《猴岛小英雄》配乐品质为参照编写电脑音乐,并且限定必须设计纯文本记谱格式,用Artifact构建一个能直接发声的播放器。

结果模型交出的不是几行代办草稿,而是一个名为“Scrimshaw Jukebox”的完整像素风网页应用。它不仅自创了一套纯文本乐谱格式,还内建了基于浏览器Web Audio API的合成引擎,配上了月夜海港的像素背景、带实时播放指针的钢琴卷帘可视化界面,甚至自带乐谱编辑器与分轨静音开关。里面塞进了6首完整的冒险游戏风格曲目,节奏从66跨到152 bpm,拍号涵盖4/4、6/8与3/4,并支持16种乐器音色合成。

技术路径对比:黑盒波形生成 vs 符号代码闭环 端到端黑盒生成(如Suno、Udio) • 模态:文本直接映射至连续音频波形 • 交互:整段音频黑盒输出,难以二次微调 • 体积:需要完整音频切片传输,带宽开销大 • 状态:不可动态响应游戏内行为或分支逻辑 本质:无法解构、难以集成的音频切片 符号代码闭环(Claude Opus 5.5方案) • 模态:离散文本DSL + 乐理对位符号推理 • 交互:前端实时运行,支持原位修改乐谱 • 体积:仅传输轻量文本与合成代码,近乎零体积 • 状态:分轨独立可控,天然支持动态交互 本质:全栈代码Agent驱动的端侧合成引擎

Willison感叹这出奇得好,甚至怀疑纯文本模型在近几个月涌现出了全新的音乐能力。

但把这件事归结为大模型突然顿悟了音乐天赋,就彻底看轻了它在工程层面的真正变量。

不是音频大模型下场,而是代码Agent的跨界

业界在过去两年习惯把AI音乐等同于Suno或Udio那类黑盒波形生成器。那些模型确实能产出好听的人声与管弦乐,但产物是一整块锁死的音频文件。游戏开发者如果想拿掉一段鼓点、在进入战斗时无缝切调,或者在低配设备上跑几十段背景循环,黑盒音频几乎无从下手。

Opus 5.5走的完全是另一套范式:它根本没有接触任何音频模态训练,而是纯粹靠文本工程闭环打穿了场景。

它先把音乐拆解为自创的轻量DSL(领域特定语言),用字符精确描述音高、八度、休止符和力度;再用JavaScript调取Web Audio API,现场写了一套多声部振荡器和滤波包络,在用户的浏览器内存里实时合成声音。整套系统的体积仅有几十KB的纯文本代码,却实现了分轨静音、乐谱实时热重载和卷帘视图对齐。

决定这套点唱机体验上限的,不是音乐玄学,而是全栈代码工程的装配精度。

此前也有Reddit用户在2026年10月2日测试发现,Opus 5.5在快速阅读Strudel文档后,就能写出包含和弦、贝斯、旋律与鼓组的2分钟潜行游戏编曲,并且在第一次报错时自主修复了语法解析问题。这次的Scrimshaw不过是把这种工程能力进一步封装成了交付级的前端产品。

榜单数据验真:破除“孤立涌现”的神话

如果把目光移到更专业的符号音乐基准上,就会发现纯文本模型的乐理推理并非一日之功,也不存在Opus 5.5一骑绝尘的断层领先。

在评估大模型基于Strudel符号音乐创作能力的盲测众包基准BoogieBench(截至2026年10月6日)中,各家大模型的战况其实极为胶着:

模型BoogieBench Elo对应评测定位
Gemini 3 Pro Preview1665符号音乐盲测第1名
GPT-5.41657密集型和声与长程对位
GPT-51652复杂乐理结构推理
Claude Opus 4.61644上代基线(Opus 5.5尚未收录)

而在更偏重符号规范和指令遵循的ABC-Eval基准中,GPT-5平均分拿到55.02,GPT-5 mini为53.51,Gemini 2.5 Pro为51.25,Gemini 2.5 Flash为44.14。这些评测虽然偏向符号语法而非艺术审美,却清晰地展现了一条符号音乐演进脉络:大语言模型对符号音符的时值、调式与多声部规则的理解,本就是其代码和逻辑推理能力的自然副产物。

古典夜曲LilyPond个案对比(José Luis Miralles实测) Claude Opus 5.5 • 和声轮廓最为贴近肖邦风格 • 浪漫派织体过渡平滑 • 结构连贯但微动态较平 优势:和声风格拟合度极高 GPT-6 Astra • 力度记号执行最为忠实 • 强弱表情层级更分明 • 旋律走向偏向严谨克制 优势:乐谱表情符号执行力强 Gemini 3.8 Flash • 出现超出钢琴音域的音符 • 演奏文字描述与MIDI不一致 • 偶尔产生不可执行标记 缺陷:偶发乐理物理常识幻觉

2026年9月24日José Luis Miralles针对肖邦风格夜曲的LilyPond对比分析,进一步印证了这一点:Opus 5.5的和声轮廓最贴近肖邦风格,GPT-6 Astra在力度记号执行上更忠实,而Gemini 3.8 Flash则出现了超出钢琴实际音域的物理错误。

Anthropic在2026年9月22日发布Opus 5.5时,官方文档里通篇都是代码能力与Agent跑分,完全没提音乐。这恰恰印证了一个事实:只要模型的上下文窗口足够稳、长程逻辑和代码生成足够扎实,符号形态的艺术逻辑就会被当成一种特殊的编程语言自然掌握。

形式胜于音质:边界与现实代价

虽然Scrimshaw Jukebox在感官上令人惊艳,但我们不能把一次出色的交互实验等同于成熟的游戏配乐工业方案。

它当前的发声机制,本质上是用浏览器的Web Audio振荡器生硬搓出来的简易调频合成。这种音色在复古像素风海盗游戏里显得别具风味,甚至让人联想起上世纪90年代的AdLib声卡或MIDI波表合成器。但如果把它放进需要真实乐器质感、环境混响与动态声场的现代3D游戏管线,这种纯代码合成的音质天花板会立刻暴露无遗。

  • 提醒.纯AI生成乐谱与代码不受版权保护,但直接以商业经典风格为靶向,依然游走在合理借鉴与侵权争议的灰色边缘。

美国版权局的现行原则相当清楚:法律只保护具体的旋律表达,而不保护加勒比海盗风、8-bit、猴岛氛围等抽象风格与通用概念。更关键的是,完全由AI自主生成的乐谱文本并不享有版权。这也意味着独立游戏开发者固然可以用近乎为零的边际成本白嫖一整套轻量配乐方案,但你无法阻止竞品在下一秒把你生成的DSL乐谱原封不动复制过去。

大模型用代码写音乐,真正解决的不是人类作曲家灵感枯竭的问题,而是独立开发者、轻量网页工具和动态交互场景在资源匮乏下的工程燃眉之急。它不是艺术的终点,而是代码Agent把触角伸向视听交互时,留下的又一个优雅脚印。