ia

MacMind: un modelo transformer de IA se ejecuta en un Macintosh SE/30 de 1989

El proyecto MacMind, ideado por Sean Lavigne, ha conseguido ejecutar un modelo transformer de inteligencia artificial en un Macintosh SE/30 de 1989. Esta demostración subraya que, mediante una ingeniería ingeniosa, diversas plataformas de hardware pueden participar en el ámbito de la IA, contrarrestando la noción de que esta tecnología está ligada exclusivamente a clústeres de GPU y centros de datos modernos.

El modelo transformer de MacMind está íntegramente escrito en HyperTalk, el lenguaje de scripting de Apple HyperCard. La implementación incluye componentes fundamentales como token embeddings, codificación posicional, autoatención de producto escalar (scaled dot-product self-attention), pérdida de entropía cruzada, retropropagación, descenso de gradiente estocástico y una conexión residual. Con 1.216 parámetros distribuidos en seis matrices de pesos, se trata de un modelo de tamaño reducido en comparación con los estándares actuales.

El objetivo de MacMind fue aprender la permutación de inversión de bits, una operación que reordena los datos invirtiendo la representación binaria de cada índice de posición y que constituye el primer paso de la Transformada Rápida de Fourier, un algoritmo esencial en computación. El sistema no fue programado con este conocimiento previo, sino que lo descubrió progresivamente a través de ejemplos aleatorios, utilizando autoatención y descenso de gradiente. Tras el entrenamiento, el mapa de atención del transformer replicó el patrón de enrutamiento familiar de la Transformada Rápida de Fourier, una observación destacada por Hackster.io.

El proyecto se presenta como un stack de HyperCard de cinco tarjetas, permitiendo a los usuarios entrenar el modelo, probarlo con nuevas entradas, visualizar los pesos de atención y acceder a explicaciones claras de su funcionamiento. La transparencia es clave, ya que el código fuente de HyperTalk es accesible para inspección, facilitando el seguimiento de las operaciones y cálculos de gradiente.

Dados los recursos del Macintosh SE/30, operando bajo System 7.6.1, cada paso de entrenamiento se prolonga durante varios segundos. Alcanzar la convergencia, que requiere aproximadamente 1.000 iteraciones, implica horas de computación ininterrumpida. Las matrices de pesos se almacenan como cadenas de texto separadas por comas dentro de campos ocultos de HyperCard, debido a la ausencia de un tipo de dato de array en HyperTalk, lo que añade una ineficiencia asumida pero funcional para la escala de este modelo. Los pesos aprendidos se guardan junto con el archivo del stack de HyperCard.

Fuente original: Hackster.io

Publicaciones Similares

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *