开源开发者 maanHimself 近日在 GitHub 上线了名为 OpenDLSS-NR 的项目,使用 Vulkan 图形接口完整复刻了 NVIDIA DLSS 5 的神经渲染(Neural Rendering)网络。该实现不仅运行在标准的跨平台图形框架上,更在全网络 75 个中间块边界与 NVIDIA 官方运行时做到了逐字节完全一致。

这一硬核逆向工程迅速在图形学社区激起涟漪。它不仅首次剥开了 NVIDIA 严防死守的专有动态库黑盒,也彻底戳破了公众对 DLSS 5 的技术想象:神经渲染并非过往熟知的空间放大或超分辨率技术,而是一个运行在原生分辨率上的单步生成式扩散模型。伴随架构细节一同浮出水面的,是一笔令人咋舌的算力账单与极具争议的画面重绘代价。

拆解黑盒:71 个注意力模块拼出的「单步扩散」

长期以来,NVIDIA 对 DLSS 5 的官方宣发始终停留在宏观叙事层,仅将其描述为结合运动矢量与时域状态的 3D 导向神经渲染,却对其深层张量规范三缄其口。OpenDLSS-NR 的代码实现首次将这套商业机密公之于众:整个网络是一个包含 6 个池化层级、71 个 Swin/ViT 模块构成的深度 U-Net 结构,模型权重约为 141 MiB,并在张量核心上强制运行 FP8(E4M3)激活与 FP16 累加。

DLSS 演进分支:超分辨率重建与神经重渲染的技术分野 传统超分:DLSS-SR 输入分辨率:低于原生画面(如 1080p) 核心机制:时域滤波 + 几何运动矢量重建 输出效果:升采样至 4K,释放基础渲染算力 本质定位:以轻量计算换取高分辨率帧率 神经渲染:DLSS-NR 输入分辨率:1:1 原生全分辨率(如 4K) 核心机制:注入高斯噪声的单步扩散模型 输出效果:调整色调与微观质感,全屏重绘 本质定位:在既有画面上叠加 AI 生成滤镜

这意味着 DLSS 5 与此前用来拯救帧率的超分辨率放大(DLSS-SR)完全不同。在 DLSS-NR 的管线中,输入和输出分辨率完全一致。引擎先绘制出一帧低动态范围的代理画面,算法以此为基础注入三路高斯噪声,再由神经网络推断出每个像素的 RGB 残差与时域混合比率。

神经渲染不再替显卡省算力,而是把宝贵的帧生成时间拿来做全图重绘。

在游戏运行的每一帧中,GPU 都必须雷打不动地执行 241 次 GPU dispatch。从图形管线的逻辑来看,它更像是一个驻留在渲染管线末端的图像生成模型,对原本纯粹的几何与光影计算进行强行干预。

算力账本:4K 耗时 29.3 毫秒的性能泥潭

全分辨率单步扩散带来的计算代价是极其沉重的。根据项目给出的基准测试数据,在一张主流甜品级显卡 RTX 4070 SUPER 上,OpenDLSS-NR 单帧全网络运行耗时随分辨率提升急剧攀升:

画面分辨率单帧纯网络耗时60 FPS 对应预算占比
768 × 7682.8 ms16.8%
1920 × 10807.8 ms46.9%
2560 × 144012.6 ms75.9%
3840 × 2160 (4K)29.3 ms176.5%

在主流 4K 分辨率下,仅运行一遍神经渲染网络就需要 29.3 毫秒。按照 PC 游戏的工业标准,60 FPS 画面留给全流程的渲染预算仅仅只有 16.6 毫秒。这意味着,即便游戏引擎本身的几何处理、阴影计算和光线追踪开销缩减为零,光是神经渲染 Pass 就会直接将输出帧率封死在 34 FPS 以下。

RTX 4070 SUPER 神经渲染单帧耗时 vs 渲染帧预算 768×768 2.8 ms 1080p 7.8 ms 1440p 12.6 ms 4K (2160p) 29.3 ms (严重超支) 60 FPS 完整单帧总预算线 (16.6 ms)

耗尽算力的产物并未换来交口称赞。在 Ars Technica 等外媒的实测反馈中,玩家和开发者对 DLSS 5 官方画质呈现出极其割裂的评价。不少硬核玩家批评这种重绘带来了明显的过度美颜和皮肤磨皮感,甚至自作主张修改了原作精心布置的光影层次与美术设计。花费近 30 毫秒换取一张丢失原本美术意图的画面,让这项技术的性价比备受推敲。


开源的幻觉与戴着镣铐的跨平台

民间 Mod 社区闻风而动,已有团队尝试将 DLSS 5 移植到更多 RTX 40 系显卡,甚至出现了面向 AMD RDNA 架构的第三方分支,声称能在 24 小时内获得 74% 的性能回升。然而,将 OpenDLSS-NR 等同于打破生态垄断,目前来看依然是一种乐观的幻觉。

这一项目实质上是一具精妙的“空壳管线”。受制于美国版权法第 1201(f) 条关于逆向工程的互操作性抗辩边界,项目在遵循 MIT 协议开源的同时,严格剔除了所有模型权重,也没有提供官方捕获的验证固件。外部用户如果无法自行从专有动态库中提取权重,代码根本无法输出有效画面。更关键的是,作者逆向的仅仅是 DLSS-NR build 310.8.0 这一早期版本,而 NVIDIA 官方在 DLSS 4.5 插件包中分发的 NGX 运行时已经悄然迭代到了 310.9.1。

此外,尽管项目披着 Vulkan 的跨平台外衣,但其实际运行逻辑高度偏向 NVIDIA 硬件体系。为了达成可接受的推理延迟,作者在高速执行路径中极度依赖 NVIDIA 私有扩展与内联 PTX 汇编代码。在不具备 Tensor Core 加速与 FP8 支持的浏览器 WebGPU 环境下,仅仅渲染 512×512 分辨率,单帧耗时就从 2.7 毫秒暴增至 72 毫秒。

  • 风险.缺少开源权重与通用硬件支持,民间逆向项目短期内难以摆脱黑盒依赖,极易在 NVIDIA 官方动态库的小版本迭代中直接失效。

从最初通过深度学习还原边缘细节,到利用生成式扩散模型重绘游戏画面,NVIDIA 正在把图形学带入纯算力对抗的未知水域。OpenDLSS-NR 的出现为外界看清这场技术转向提供了难得的切片,但也以冷酷的基准数据提醒所有人:当生成式 AI 开始凌驾于原生渲染之上,开发者与玩家面临的,或许是一场算力成本与视觉保真度的双重透支。