ia

Ejecución de modelos de IA de gran escala en hardware de servidor obsoleto

La clave reside en el bajo coste de la memoria RAM empresarial para superar las limitaciones de VRAM en GPUs de consumo.

El despliegue local de los modelos de inteligencia artificial más grandes se enfrenta a una barrera fundamental: la capacidad de memoria de las unidades de procesamiento gráfico (GPU). A pesar del avance en la velocidad de las GPUs de consumo, su memoria de vídeo (VRAM) es a menudo limitada, lo que obliga a los entusiastas a adquirir múltiples tarjetas gráficas costosas o a optar por modelos de IA de menor tamaño. Ante este desafío, el YouTuber MattMo exploró la posibilidad de emplear un servidor empresarial antiguo equipado con memoria RAM de bajo coste para gestionar estas cargas de trabajo.

El sistema ensamblado por MattMo, reportado por Hackster.io, dista considerablemente de una estación de trabajo de IA moderna. Consiste en un Dell PowerEdge R720, un servidor de montaje en rack introducido alrededor de 2012, adquirido de segunda mano por 250 dólares. En lugar de depender de GPUs, el sistema ejecuta los modelos de IA exclusivamente en un par de procesadores Intel Xeon de 10 núcleos, sumando un total de 20 núcleos y 40 hilos.

Estos procesadores, que carecen de AVX2, un conjunto de instrucciones vectoriales utilizado por muchos frameworks de IA modernos para acelerar la inferencia, se ven obligados a procesar la carga de trabajo mediante instrucciones de CPU estándar. Sin embargo, el objetivo principal de MattMo no era la velocidad, sino la capacidad de memoria necesaria para ejecutar modelos insignia localmente. Para ello, cada ranura DIMM del servidor fue poblada con un módulo DDR3 ECC de 16 GB, totalizando 384 GB de RAM. Esta cantidad de memoria tuvo un coste aproximado de 280 dólares, gracias a la abundancia de hardware empresarial en desuso. El coste total de la máquina, incluyendo una unidad SSD Samsung para el sistema operativo y los archivos de modelo, se situó entre 500 y 600 dólares, una fracción del precio de un sistema basado en GPU capaz de albergar modelos de más de 200 GB íntegramente en VRAM.

Para evaluar la utilidad de esta configuración, MattMo realizó pruebas con varios modelos de lenguaje de gran tamaño utilizando llama.cpp. A cada modelo se le solicitó generar un programa de ordenación en C#. El modelo GLM 5.3 Flash obtuvo el mejor resultado, completando la tarea en dos minutos y 35 segundos a una velocidad aproximada de cuatro tokens por segundo. Qwen 3.8 Dense finalizó en seis minutos y 18 segundos, mientras que Qwen 3.8 8B Flash tardó siete minutos y 32 segundos.

A pesar de que los modelos se ejecutaron con éxito, el rendimiento fue lento. Esto llevó a MattMo a experimentar con modelos Mixture-of-Experts (MoE). Estos modelos, a diferencia de los modelos densos que activan cada parámetro para cada token, solo utilizan un subconjunto de sus redes expertas durante la inferencia. Esto reduce significativamente los requisitos computacionales y el tráfico de memoria, haciéndolos especialmente adecuados para sistemas antiguos que solo emplean CPU. Aunque una máquina como la de MattMo no permite una interacción en tiempo real, sí ofrece la capacidad de ejecutar modelos insignia de gran tamaño de forma completamente offline, sin necesidad de suscripciones a la nube ni de costosas tarjetas aceleradoras. Además, el PowerEdge conserva ranuras PCIe abiertas, lo que permite futuras mejoras con GPUs o la descarga parcial de capas si se requiere un mayor rendimiento.

Fuente original: Hackster.io

Publicaciones Similares

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *