OptiScaler prueba DLSS 5 híbrido FP8/NVFP4 en RTX 50 y reduce un 1-2% el tiempo de Neural Rendering

Los experimentos para reducir el elevado coste de NVIDIA DLSS 5 continúan avanzando dentro de la comunidad. La versión 0.7.1 del proyecto OptiScaler-DLSSNR-PreSR-Multipass ha introducido una implementación híbrida FP8/NVFP4 de Neural Rendering para las GeForce RTX 50, aprovechando el soporte nativo de Blackwell para formatos de precisión reducida.

Sobre el papel, trasladar parte de la red neuronal desde FP8 hacia NVFP4 parecía una vía directa para acelerar la inferencia, pero las primeras mediciones muestran una mejora mucho más pequeña de lo esperado. El tiempo necesario para completar el pase de Neural Rendering a 4K disminuye únicamente alrededor de un 1-2%, y esa cifra no representa un aumento equivalente en los FPS totales del juego.

NVFP4 aprovecha directamente los Tensor Cores de Blackwell

Las GeForce RTX 50 incorporan Tensor Cores de quinta generación capaces de acelerar de forma nativa operaciones NVFP4, un formato de 4 bits desarrollado por NVIDIA para reducir las necesidades de memoria y aumentar el rendimiento de determinadas cargas de inteligencia artificial.

Frente a FP8, trabajar con una precisión inferior permite representar los datos utilizando menos bits. En teoría, esto puede reducir el movimiento de memoria y aumentar el throughput de inferencia, siempre que la arquitectura y el propio modelo estén correctamente optimizados para aprovecharlo.

Esa última condición resulta fundamental. Convertir simplemente una red diseñada alrededor de FP8 a un formato inferior no garantiza que los Tensor Cores vayan a conseguir automáticamente una gran reducción del tiempo de ejecución. La cuantización necesita adaptarse a la estructura del modelo y mantener además una precisión suficiente para evitar degradaciones visuales.

Eso es precisamente lo que intenta explorar la rama experimental de OptiScaler. En lugar de trasladar todo el modelo de Neural Rendering a NVFP4, la implementación utiliza una ruta híbrida que combina operaciones NVFP4 y FP8, manteniendo estas últimas cuando determinadas formas o cargas no son compatibles con la nueva precisión.

El pase completo solo mejora entre un 1% y un 2%

Los resultados de la versión 0.7.1 muestran que el tiempo total del pase de DLSS 5 Neural Rendering a resolución 4K se reduce aproximadamente entre un 1% y un 2% frente a la implementación original FP8.

El propio desarrollador describe la mejora obtenida sobre Blackwell como muy pequeña. Es importante además interpretar correctamente la cifra: no significa que un juego vaya a funcionar entre un 1% y un 2% más rápido en términos generales.

La medición hace referencia únicamente al tiempo consumido por Neural Rendering. Un juego continúa dedicando recursos a geometría, CPU, rasterización, ray tracing, Super Resolution y otros elementos del pipeline, por lo que una reducción del 2% dentro de una sola etapa puede traducirse en una diferencia bastante menor sobre el rendimiento final.

Además, las configuraciones del modelo que todavía no funcionan correctamente mediante NVFP4 vuelven automáticamente a FP8, limitando el porcentaje total de trabajo que puede beneficiarse de la precisión más reducida.

El resultado sirve también para poner en perspectiva una de las ideas más atractivas alrededor de Blackwell. Disponer de aceleración NVFP4 en hardware no basta por sí solo para duplicar el rendimiento de una red existente, especialmente cuando gran parte del modelo y de su estructura se diseñaron originalmente para otras precisiones.

La versión 0.7.2 convierte la ruta híbrida en la recomendada para RTX 50

El proyecto no se ha detenido en la primera implementación. La posterior versión 0.7.2 añadió nuevas optimizaciones y convirtió la configuración híbrida NVFP4 en la opción recomendada para GPU Blackwell, aunque las diferencias medidas continúan siendo pequeñas.

En una prueba de 120 segundos realizada con Baldur’s Gate 3, la implementación híbrida alcanzó 55,16 FPS renderizados frente a 54,57 FPS utilizando FP8, una diferencia inferior a un fotograma por segundo.

Eso equivale aproximadamente a un 1,1%, pero el propio desarrollador advierte que una diferencia tan pequeña no ha demostrado todavía ser consistentemente repetible. Variaciones normales entre ejecuciones podrían absorber una parte importante de esa distancia.

Por tanto, la prueba no debe interpretarse como evidencia de que NVFP4 ofrezca automáticamente un 1,1% adicional en cualquier juego. Se trata de una única ejecución experimental sobre Baldur’s Gate 3, pendiente de repetición y validación mediante muestras mayores.

Para demostrar una ventaja real harían falta varias pasadas controladas y comparaciones de frametime, consumo de GPU y tiempo específico de inferencia, además de probar diferentes resoluciones, escenas y cargas de Neural Rendering.

El verdadero reto está en optimizar el modelo para 4 bits

OptiScaler prueba DLSS 5 híbrido FP8/NVFP4 en RTX 50 y reduce un 1-2% el tiempo de Neural Rendering

NVIDIA continúa mejorando el rendimiento de su modelo de Neural Rendering de DLSS 5. Fuente de la imagen: NVIDIA.

NVIDIA ha destacado que NVFP4 puede ofrecer menores requisitos de memoria que FP8 y una alta eficiencia de cálculo sobre Blackwell, pero esas ventajas dependen de que el modelo se prepare específicamente para utilizar una precisión tan baja.

Una cuantización agresiva puede reducir memoria y aumentar throughput, pero también introduce el riesgo de perder precisión numérica y afectar al resultado producido por la red neuronal. En Neural Rendering, cualquier degradación puede terminar manifestándose directamente como errores o pérdida de calidad en la imagen.

Por eso la optimización resulta más compleja que recompilar determinadas operaciones. La distribución de precisiones entre capas, la calibración del modelo y las operaciones que deben permanecer en FP8 pueden determinar gran parte del rendimiento final.

La ruta híbrida de OptiScaler representa precisamente un compromiso: utilizar NVFP4 donde parece viable y mantener FP8 donde todavía resulta necesario. La mejora limitada de estas primeras versiones sugiere que hace falta una adaptación mucho más profunda para aprovechar realmente los Tensor Cores NVFP4 de Blackwell.

DLSS 5 ya habría multiplicado por cinco su rendimiento desde GTC 2026

Este trabajo de la comunidad llega mientras NVIDIA también continúa optimizando su implementación oficial. La compañía ha indicado previamente que el modelo de DLSS 5 ya funciona alrededor de cinco veces más rápido que durante su demostración inicial en GTC 2026.

Ese progreso resulta especialmente importante porque Neural Rendering es una de las cargas computacionalmente más exigentes introducidas hasta ahora dentro de DLSS, y su coste puede consumir una parte considerable del rendimiento disponible dependiendo del juego y la configuración.

NVIDIA también ha confirmado que DLSS 5 llegará oficialmente a las GeForce RTX 40, aunque las RTX 50 permanecen como la plataforma más avanzada para ejecutarlo gracias a las capacidades adicionales de Blackwell.

Los experimentos recientes de OptiScaler, incluyendo la ejecución de Neural Rendering antes de Super Resolution y ahora el camino híbrido FP8/NVFP4, muestran que existen varias vías para intentar reducir el coste del modelo sin modificar necesariamente el resultado visual que busca producir.

Por ahora, sin embargo, NVFP4 no supone el atajo masivo que podía sugerir inicialmente su soporte nativo en Blackwell. La implementación híbrida apenas recorta entre un 1% y un 2% el tiempo del pase de Neural Rendering a 4K, dejando claro que conseguir grandes mejoras requerirá algo más que trasladar operaciones de FP8 a una precisión de 4 bits.

Vía: Wccftech

Sobre el autor