Andrej Karpathy说,他让一个他称为Opus 5的模型,用约100万token、约10美元的推理预算跑了将近两小时,把《指环王》开篇第一段文字变成一个能动的三维场景,自己写出约5500行Three.js代码。这类长任务编排展示不多见,真正的看点不是画面精细,而是模型完成了一次多资产、多坐标、跨两小时的自主编排——超出了以往"画一只骑自行车的鹈鹕"式单张图测试的量级。

这仍是Karpathy个人的一次性实验。他没说清模型具体版本和是否公开可用,场景里也有明显穿模和卡顿。对游戏和互动内容开发者、以及正在给生成式AI编预算的产品和技术负责人来说,这更像一个先导信号,而不是能直接采购的能力。

两小时,5500行代码:这次实验做了什么

Karpathy给的题目很直接:拿《指环王》第一段原文,让模型自己决定怎么用Three.js把它变成三维场景。模型没拿到美术素材或场景模板,得自己判断用多边形摆树、摆人、摆剑,算出每个物体的xyz坐标,再写代码让它们按剧情动起来。

整个过程用掉约100万token的推理预算,按Karpathy的估算约合10美元,模型自己跑了近两小时才收工。产出的5500行Three.js代码渲染出一个能动的场景,他的评价是"有点粗糙,但挺好玩"。

这个"粗糙"不是谦虚。机位卡顿、模型摆位出错、动画衔接生硬,都是演示里能直接看到的问题,不是精修后的成片。

Opus 5的这次两小时实验 token预算 100万 此次口径 推理花费 约10美元 Karpathy估算 运行时长 约2小时 无人工干预 产出代码 5500行 Three.js

从画鹈鹕到造场景,基准线挪到哪了

以前测大模型,常见玩法是让它画一只骑自行车的鹈鹕:单张SVG图,几十行代码,考的是审美和构图。这次的任务是另一个量级。

维度画鹈鹕骑车(传统测试)这次《指环王》三维场景
产出形式单张SVG图约5500行Three.js代码
时间跨度一次性生成,几秒到几分钟约两小时连续运行
考验能力单帧审美与构图多资产、多坐标、长流程连贯性

Karpathy由此提出一个设想:模型能连续跑两小时不喊累,定制内容的边际成本可能被明显压低。他管这类设想叫"按需版GTA"——让玩家能作为旁观者或某个角色,直接走进一段生成的故事。

这仍只是一句设想,没有对应的产品路线图。但对游戏和互动内容团队,思路已经足够具体:可以拿现成大模型,花几十美元级别的推理成本,低成本试做一次性定制场景,先验证创意成不成立,再决定要不要投入正式制作。

模型能搭台,看不清自己搭的台

Karpathy提到一个反直觉的细节:模型造出了一整个能动的三维场景,却没法流畅地"看"自己造的东西。它只能在渲染过程中挑几个时间点截图,靠静态截图判断有没有出错。

这个过程很慢,而且截图之外的地方,模型完全不知道自己哪里搭错了。场景里出现的穿模、错位,很大程度上就是这样漏检出来的。

模型如何造世界,又如何自查 文本输入 指环王 开篇一段 生成代码 摆坐标 写动画 渲染场景 三维中土 可动画 截图自查 间隔截图 漏检穿模

对游戏和互动内容开发者:现在可以用现成模型试做低成本原型,但碰撞、穿模这类问题模型自己发现不了,人工画面检查和测试环节还省不掉。

对正在给生成式AI开发编预算的产品和技术负责人:约10美元只是这一次推理的token账单,不包含人工验收、算力环境和后续调优的成本,不能直接当成"一个三维世界只要10美元"的通用报价。

接下来最该盯的变量,是模型能不能理解连续视频而不是静态截图,能不能主动试玩自己造的场景并根据反馈修正。这两点解决之前,长任务编排能力再强,也需要人工兜底质量。