microcontroladores

Juguete con IA opera visión y narrativa de forma local sin conexión a la nube

CantaStorie, desarrollado por SuperModerno, integra un modelo de lenguaje y visión directamente en un microcontrolador para preservar la privacidad del usuario.

SuperModerno ha desarrollado CantaStorie, un juguete narrador de historias sin pantalla, que ejecuta su arquitectura de inteligencia artificial enteramente de forma local. Esta aproximación busca resolver las implicaciones de privacidad asociadas con juguetes conectados a la nube que procesan información en servidores externos.

El sistema se articula en torno a una placa Arduino UNO Q, que gestiona el procesamiento de visión artificial, la generación de historias y la síntesis de voz. Una cámara integrada en el ojo principal del juguete permite reconocer objetos situados frente a él, incorporándolos a narrativas personalizadas. La información sobre el niño, como su nombre o intereses, se puede configurar previamente y se integra también en las indicaciones para la creación de la historia.

Para la visión, CantaStorie emplea un modelo YOLOX-Nano ligero, filtrando detecciones con una confianza superior al 75% y limitando el reconocimiento a una lista blanca de objetos. Una vez identificado un objeto, se utiliza un modelo de lenguaje pequeño (LLM) que opera localmente a través de llama.cpp. Tras experimentar con modelos como Gemma 3 1B y Qwen 3.5 0.8B, el prototipo final utiliza Gemma 1B. La historia generada se convierte a voz mediante un motor de texto a voz local y se reproduce a través de un altavoz interno.

El diseño físico del juguete, con forma de cíclope, incluye brazos móviles conectados a potenciómetros para modificar parámetros de generación de historias. Un anillo de LED alrededor de la cámara funciona como iluminación y como indicador de estado, mostrando patrones animados mientras la IA procesa.

El desarrollo del proyecto, según Hackster.io en una publicación disponible en hackster.io, no estuvo exento de desafíos. Se requirió una optimización significativa para el rendimiento de la IA; los tiempos de respuesta iniciales para la reproducción de audio, que superaban los dos minutos y medio, se redujeron a aproximadamente 27 segundos. Aunque esta mejora es sustancial, los desarrolladores señalan que la espera aún podría ser considerable para un niño.

Fuente original: Hackster.io

Publicaciones Similares

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *