Un usuario de Reddit ha relatado dos fallos consecutivos en módulos DDR4 ECC mientras ejecutaba localmente Ornith-1.5-35B-A3B, un modelo de IA considerablemente mayor que el LLM de 20B que utilizaba anteriormente sobre una GeForce RTX 5070 Ti de 16 GB.
El sistema recurría a 128 GB de memoria DDR4 ECC para descargar parte del modelo cuando los 16 GB de GDDR7 de la GPU resultaban insuficientes. Uno de los módulos de 8 GB dejó de funcionar después de aproximadamente 90 minutos, mientras otro comenzó a registrar errores tras ocho o nueve días de funcionamiento.
El modelo de 20B cabía dentro de los 16 GB de la RTX 5070 Ti
Future_Fuel_8425 explica que anteriormente utilizaba un modelo de aproximadamente 20B que podía mantenerse dentro de los 16 GB de VRAM de su RTX 5070 Ti, evitando en gran medida depender de la memoria principal del equipo.
El problema apareció al trabajar con tareas más complejas relacionadas con bases de datos, donde consideraba insuficiente la calidad proporcionada por aquel modelo. Por ello decidió pasar a Ornith-1.5-35B-A3B y aprovechar la memoria del sistema para almacenar la parte que no pudiera permanecer en la GPU.
Esta configuración permite ejecutar modelos mayores que la capacidad física de VRAM disponible, aunque introduce una diferencia importante de rendimiento. La memoria DDR4 ofrece muchísimo menos ancho de banda que la GDDR7 de una GPU y además debe comunicarse con ella mediante PCIe, por lo que mover continuamente datos entre RAM y VRAM puede convertirse en un cuello de botella considerable.
Según el usuario, en su caso el funcionamiento seguía siendo suficientemente bueno y la velocidad de generación no sufría una degradación drástica una vez ocupados los 16 GB de VRAM, motivo por el que prefirió mantener el modelo de 35B.
Uno de los módulos de 8 GB falló después de 90 minutos
El equipo disponía de 128 GB de memoria DDR4 ECC repartidos en módulos de 8 GB. Después de iniciar el modelo y dejar el sistema funcionando, el usuario regresó aproximadamente 90 minutos después y encontró el equipo bloqueado.
Las comprobaciones posteriores señalaron uno de los módulos DDR4 ECC como defectuoso, por lo que decidió retirarlo y volver a ejecutar el modelo con el resto de la memoria instalada.
Inicialmente, interpretó el incidente como un fallo aislado de un DIMM antiguo, algo perfectamente posible en hardware que ha acumulado muchas horas de utilización. La presencia de ECC resulta especialmente útil en este tipo de equipos porque permite detectar y, dependiendo del error, corregir determinados fallos de memoria antes de que provoquen corrupción silenciosa.
El caso se volvió más llamativo cuando, tras ocho o nueve días ejecutando nuevamente el modelo, los registros comenzaron a mostrar errores asociados a otro módulo.
Las temperaturas de CPU y GPU no permiten conocer la temperatura de la memoria
El usuario asegura que las temperaturas del sistema se mantuvieron por debajo de 80 °C, aunque únicamente menciona las correspondientes a CPU y GPU.
Esas lecturas no permiten determinar a qué temperatura estaban funcionando realmente los módulos DDR4. Dependiendo de la plataforma y de los propios DIMM, puede que ni siquiera exista telemetría individual accesible para conocer la temperatura de cada módulo.
Un sistema con numerosos DIMM instalados puede además presentar un flujo de aire muy diferente alrededor de los bancos de memoria respecto a un PC convencional con dos módulos. La proximidad entre ellos y una carga sostenida pueden elevar su temperatura, aunque CPU y GPU permanezcan dentro de valores normales.
Sin una medición directa de los módulos, sin embargo, no existe evidencia suficiente para atribuir los fallos al calor. La edad de la memoria, un módulo previamente degradado, la placa base, los contactos, la alimentación o incluso errores acumulados durante años son alternativas igualmente posibles.
Ejecutar un LLM no debería destruir memoria DDR4 por realizar lecturas continuas
La fuente plantea que la memoria DDR4 de consumo podría no estar preparada para lecturas secuenciales prolongadas, pero esa explicación resulta demasiado simplista. La memoria DRAM está diseñada precisamente para soportar enormes cantidades de operaciones de lectura y escritura durante periodos prolongados.
Además, en este caso hablamos de memoria ECC instalada en una estación de trabajo, por lo que asociar directamente una carga sostenida de IA con la destrucción de los DIMM no está respaldado por los datos disponibles.
Una carga de inteligencia artificial puede mantener la memoria intensamente ocupada durante muchas horas, pero ese comportamiento tampoco es exclusivo de un LLM. Bases de datos, simulaciones, renderizado, virtualización o cálculo científico pueden mantener grandes cantidades de RAM bajo actividad constante durante periodos similares.
Por tanto, que los errores aparecieran mientras Ornith-1.5-35B-A3B estaba funcionando establece una coincidencia temporal, pero no demuestra causalidad.
El segundo módulo podría ayudar a detectar un problema más amplio
La aparición de errores en otro DIMM después de varios días hace recomendable comprobar más elementos que los propios módulos individuales. Una prueba prolongada de memoria, cambiar los DIMM de ranura o revisar registros ECC podría ayudar a determinar si los fallos siguen físicamente al módulo o aparecen en un canal concreto.
También habría que considerar la edad exacta de la DDR4, su configuración, voltajes, placa base y controlador de memoria, información que no aparece suficientemente detallada en el relato original.
Los registros ECC son especialmente valiosos porque pueden mostrar si están aumentando los errores corregibles antes de aparecer errores no corregibles, ofreciendo una pista de degradación sin necesidad de esperar a que el sistema termine bloqueándose.
Sin esos datos resulta imposible saber si existen dos DIMM deteriorados, un problema térmico localizado o alguna anomalía en el propio subsistema de memoria.
Pasar a DDR5 tampoco garantiza solucionar el problema
Utilizar DDR5 proporcionaría más ancho de banda y una plataforma más moderna, algo potencialmente beneficioso para ejecutar modelos que descargan gran parte de sus pesos sobre la memoria principal.
Eso no significa, sin embargo, que DDR5 sea inherentemente inmune a este tipo de fallos ni que soporte mejor un LLM simplemente por utilizar una generación más reciente. La estabilidad continúa dependiendo de los módulos, temperaturas, voltajes, placa base y controlador de memoria.
El caso resulta interesante porque muestra hasta dónde pueden llegar las configuraciones locales de IA combinando una RTX 5070 Ti de 16 GB con grandes cantidades de RAM, pero los dos fallos registrados no permiten concluir que el modelo de 35B haya sido responsable directo de degradar la DDR4.
Por ahora, la explicación más prudente es que el usuario ha detectado dos problemas de memoria mientras mantenía una carga intensiva durante largos periodos, aunque todavía faltan mediciones y pruebas suficientes para establecer exactamente qué los provocó.
Vía: Wccftech










