Una RTX 4090 habría duplicado el contexto de Qwen al utilizar la GPU integrada para el monitor

Una RTX 4090 habría duplicado el contexto de Qwen al utilizar la GPU integrada para el monitor

Un usuario de Reddit asegura haber conseguido duplicar prácticamente la ventana de contexto de Qwen3.8-27B en una GeForce RTX 4090 de 24 GB mediante un cambio aparentemente sencillo: conectar sus monitores a la GPU integrada del procesador en lugar de utilizar las salidas de vídeo de NVIDIA. Según su testimonio, la modificación liberó aproximadamente 2,5 GB de memoria gráfica.

El usuario, identificado como u/Reklaw12, afirma haber pasado de 65.000 a 132.000 tokens de contexto, manteniendo además una velocidad de generación de hasta 125 tokens/s. Aunque el planteamiento tiene fundamento técnico, no se han presentado pruebas independientes ni una comparación reproducible que confirme todas las cifras anunciadas.

Conectar los monitores a la iGPU habría liberado 2,5 GB de VRAM

El procedimiento consistió en desconectar los cables HDMI de la RTX 4090 y utilizar las salidas de vídeo de la placa base, aprovechando la GPU integrada del procesador. De esta manera, el escritorio de Windows y determinadas aplicaciones dejan de depender directamente de la memoria gráfica dedicada para mostrar sus ventanas.

En su publicación original, u/Reklaw12 aclara que utilizaba dos monitores 4K, además de programas como Blender y Bambu Studio. Este detalle resulta importante porque los 2,5 GB recuperados no corresponden necesariamente al consumo exclusivo de las pantallas, sino también a los recursos gráficos utilizados por otras aplicaciones abiertas.

La configuración empleaba Qwen3.8-27B con cuantización UD-Q4_K_XL y caché KV en formato q8_0, además de funciones de visión y predicción de múltiples tokens. Bajo esas condiciones, el usuario asegura haber alcanzado 132K de contexto y 125 tokens/s, aunque no ha demostrado cuánto contexto llegó a procesar realmente durante una sesión completa.

Por qué unos pocos gigabytes pueden marcar una diferencia importante

Cuando se ejecuta un modelo de lenguaje local, la VRAM no se utiliza únicamente para almacenar sus parámetros. También deben reservarse recursos para las operaciones intermedias y la caché KV, que conserva información de los tokens procesados para evitar repetir cálculos durante la generación.

A medida que aumenta la ventana de contexto, la memoria necesaria para mantener esa caché también crece. Si los pesos del modelo ya ocupan buena parte de los 24 GB disponibles, recuperar incluso 1 o 2 GB puede permitir configurar un contexto considerablemente mayor antes de alcanzar el límite físico de la tarjeta.

Sin embargo, configurar una ventana de 132K no demuestra que se hayan procesado 132.000 tokens reales sin problemas. Tampoco permite asumir que los 125 tokens/s se mantengan con el contexto completamente ocupado, ya que el rendimiento depende del modelo, la cuantización, el software utilizado y las técnicas de aceleración activadas.

Otros usuarios de Reddit obtienen resultados bastante diferentes

La experiencia ha generado debate porque otros participantes consideran demasiado elevado el ahorro anunciado. Uno de ellos señala que mantener tres monitores conectados a una GPU puede representar aproximadamente 0,9 GB de VRAM en reposo, aunque reproducir contenido de YouTube en 4K puede elevar el consumo hasta unos 2,5 GB.

Otro usuario, HighSeasArchivist, asegura haber realizado una prueba similar con una Radeon AI PRO R9700 de 32 GB de memoria gráfica. En su caso, trasladar la salida de vídeo a la GPU integrada habría liberado aproximadamente 1 GB, suficiente para mejorar el margen disponible al trabajar con Qwen3.7-27B y una ventana de contexto de 128K.

Las diferencias muestran que no existe una cantidad fija de VRAM recuperable simplemente por cambiar el cable de vídeo. Influyen la resolución, el número de pantallas, la composición del escritorio y las aplicaciones que utilizan aceleración gráfica, además de cómo el sistema operativo administra la memoria.

PSA: Use your iGPU for display to save VRAM
byu/Reklaw12 inLocalLLM

Utilizar la GPU integrada no significa perder carriles PCIe

Una de las cuestiones planteadas alrededor de esta técnica es su posible impacto sobre el rendimiento de la tarjeta dedicada. Sin embargo, utilizar la GPU integrada del procesador no implica automáticamente quitar carriles PCIe a la RTX 4090, ya que las salidas de vídeo integradas suelen funcionar mediante conexiones propias de la plataforma.

Lo que sí puede ocurrir es que los videojuegos y otras aplicaciones 3D necesiten transferir los fotogramas desde la GPU dedicada hacia la integrada para mostrarlos en pantalla. Dependiendo de la configuración y del sistema operativo, esta operación puede introducir sobrecarga o afectar a determinadas funciones de visualización.

Una alternativa interesante para equipos dedicados a IA local

El principal inconveniente señalado por u/Reklaw12 es tener que volver a conectar sus monitores a la RTX 4090 cuando quiere jugar. No obstante, cambiar físicamente los cables no siempre resulta imprescindible, porque Windows permite seleccionar qué GPU utiliza cada aplicación en determinadas configuraciones.

La técnica requiere que el procesador disponga de gráficos integrados funcionales y que la placa base incorpore salidas de vídeo compatibles. También conviene comprobar que la iGPU esté habilitada en la BIOS, ya que algunas configuraciones pueden desactivarla cuando detectan una tarjeta gráfica dedicada.

Para quienes utilizan habitualmente una GPU potente como la RTX 4090 para ejecutar modelos de IA local, trasladar el escritorio a la integrada puede ser una forma sencilla de recuperar memoria gráfica sin modificar el hardware. No aumenta los 24 GB físicos de la tarjeta, pero reduce la cantidad de memoria ocupada por tareas ajenas al modelo.

Por ahora, el supuesto salto de 65K a 132K de contexto debe considerarse una experiencia individual sin validación independiente. Lo interesante del caso no es que exista una mejora garantizada, sino recordar que liberar recursos gráficos utilizados por el escritorio puede resultar especialmente útil cuando un modelo de IA trabaja al límite de la VRAM disponible.

Vía: Wccftech

Sobre el autor