Andrej Karpathy说,他让一个他称为Opus 5的模型,用约100万token、约10美元的推理预算跑了将近两小时,把《指环王》开篇第一段文字变成一个能动的三维场景,自己写出约5500行Three.js代码。这类长任务编排展示不多见,真正的看点不是画面精细,而是模型完成了一次多资产、多坐标、跨两小时的自主编排——超出了以往"画一只骑自行车的鹈鹕"式单张图测试的量级。
这仍是Karpathy个人的一次性实验。他没说清模型具体版本和是否公开可用,场景里也有明显穿模和卡顿。对游戏和互动内容开发者、以及正在给生成式AI编预算的产品和技术负责人来说,这更像一个先导信号,而不是能直接采购的能力。
两小时,5500行代码:这次实验做了什么
Karpathy给的题目很直接:拿《指环王》第一段原文,让模型自己决定怎么用Three.js把它变成三维场景。模型没拿到美术素材或场景模板,得自己判断用多边形摆树、摆人、摆剑,算出每个物体的xyz坐标,再写代码让它们按剧情动起来。
整个过程用掉约100万token的推理预算,按Karpathy的估算约合10美元,模型自己跑了近两小时才收工。产出的5500行Three.js代码渲染出一个能动的场景,他的评价是"有点粗糙,但挺好玩"。
这个"粗糙"不是谦虚。机位卡顿、模型摆位出错、动画衔接生硬,都是演示里能直接看到的问题,不是精修后的成片。
从画鹈鹕到造场景,基准线挪到哪了
以前测大模型,常见玩法是让它画一只骑自行车的鹈鹕:单张SVG图,几十行代码,考的是审美和构图。这次的任务是另一个量级。
| 维度 | 画鹈鹕骑车(传统测试) | 这次《指环王》三维场景 |
|---|---|---|
| 产出形式 | 单张SVG图 | 约5500行Three.js代码 |
| 时间跨度 | 一次性生成,几秒到几分钟 | 约两小时连续运行 |
| 考验能力 | 单帧审美与构图 | 多资产、多坐标、长流程连贯性 |
Karpathy由此提出一个设想:模型能连续跑两小时不喊累,定制内容的边际成本可能被明显压低。他管这类设想叫"按需版GTA"——让玩家能作为旁观者或某个角色,直接走进一段生成的故事。
这仍只是一句设想,没有对应的产品路线图。但对游戏和互动内容团队,思路已经足够具体:可以拿现成大模型,花几十美元级别的推理成本,低成本试做一次性定制场景,先验证创意成不成立,再决定要不要投入正式制作。
模型能搭台,看不清自己搭的台
Karpathy提到一个反直觉的细节:模型造出了一整个能动的三维场景,却没法流畅地"看"自己造的东西。它只能在渲染过程中挑几个时间点截图,靠静态截图判断有没有出错。
这个过程很慢,而且截图之外的地方,模型完全不知道自己哪里搭错了。场景里出现的穿模、错位,很大程度上就是这样漏检出来的。
对游戏和互动内容开发者:现在可以用现成模型试做低成本原型,但碰撞、穿模这类问题模型自己发现不了,人工画面检查和测试环节还省不掉。
对正在给生成式AI开发编预算的产品和技术负责人:约10美元只是这一次推理的token账单,不包含人工验收、算力环境和后续调优的成本,不能直接当成"一个三维世界只要10美元"的通用报价。
接下来最该盯的变量,是模型能不能理解连续视频而不是静态截图,能不能主动试玩自己造的场景并根据反馈修正。这两点解决之前,长任务编排能力再强,也需要人工兜底质量。
