microcontroladores

Microcontrolador de 10 dólares ejecuta un LLM de 135 millones de parámetros

Una demostración técnica supera las limitaciones de memoria para procesar modelos de lenguaje a nivel local.

La capacidad de procesar modelos de lenguaje extensos (LLM) en dispositivos con recursos limitados ha sido un desafío técnico significativo. Sin embargo, un proyecto reciente documentado por Dsn Industries en Hackster.io ha demostrado que es posible ejecutar un LLM de 135 millones de parámetros en un microcontrolador ESP32-S3, un chip cuyo coste ronda los 10 dólares. Este logro subraya el potencial de llevar la inferencia de IA a la periferia sin dependencia de hardware de alto rendimiento ni servicios en la nube.

El ESP32-S3 utilizado en esta demostración dispone de 8 MB de PSRAM, una cantidad considerable para un microcontrolador, pero insuficiente para albergar un modelo de lenguaje de esta envergadura. Para abordar esta limitación, se empleó una versión cuantificada a 4 bits del modelo SmolLM-135M, reduciendo su tamaño a aproximadamente 74 MB.

Dado que los 74 MB del modelo aún superaban la memoria PSRAM disponible, la solución adoptada consistió en almacenar el modelo y el tokenizador en una tarjeta microSD, conectada al ESP32-S3 mediante una interfaz SPI. El microcontrolador no carga el modelo completo en memoria; en su lugar, recupera las ponderaciones de una capa a la vez desde la tarjeta microSD. Estas ponderaciones se cargan en la PSRAM, se utilizan para los cálculos necesarios y luego se reemplazan por las de la siguiente capa. Este método de procesamiento por fragmentos permite que el ESP32-S3 realice la inferencia a pesar de sus restricciones de memoria.

La interacción con el sistema se realiza a través del monitor serial ESP-IDF para la entrada de prompts, mientras que las respuestas generadas por el LLM se muestran tanto en el terminal serial como en una pantalla OLED SSD1306 de 0,96 pulgadas. Es relevante destacar que el proceso se desarrolla de forma autónoma, sin necesidad de conexión a internet ni de servicios de IA basados en la nube.

Aunque el enfoque es técnicamente viable y muestra un avance en la ejecución de LLM en hardware de bajo coste, el tiempo de respuesta constituye una limitación significativa. La generación de una única respuesta puede tardar más de 45 minutos. Esta velocidad lo aleja de aplicaciones prácticas que requieran interactividad en tiempo real, pero confirma la posibilidad técnica de la inferencia de modelos grandes en entornos embebidos extremos.

Fuente original: Hackster.io

Publicaciones Similares

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *