robotica

Modelo de IA de código abierto mejora la manipulación robótica de objetos

El proyecto de Walnut Sensei con π0.5 explora la autonomía y el rol del lenguaje en robots caseros

La crítica recurrente a la robótica tradicional ha señalado la necesidad de una programación específica para cada tarea individual. Los modelos modernos de Visión-Lenguaje-Acción (VLA) proponen una alternativa: un robot con capacidad VLA interpreta el lenguaje natural, procesa información visual y determina sus propias acciones. Un experimento reciente busca dilucidar la eficacia de esta aproximación en un entorno real.

El youtuber Walnut Sensei ha reemplazado el software de control de un robot casero diseñado para recoger calcetines con π0.5, un modelo VLA de código abierto. Este trabajo, publicado en Hackster.io, no solo evidencia una mejora en el rendimiento del robot, sino que también distingue los contextos en los que el lenguaje se vuelve un factor determinante.

El robot integra un brazo robótico SO-101 sobre una base móvil con orugas, fabricada mediante impresión 3D, que le permite desplazarse. Una Raspberry Pi gestiona la comunicación con el hardware, mientras que la inferencia del modelo se ejecuta en un PC externo. Una cámara ubicada en la muñeca del robot proporciona una vista cercana para la toma de decisiones, y una cesta en la parte trasera actúa como contenedor. La base móvil se controla manualmente a través de un mando de Xbox, dejando el control del brazo como única responsabilidad de la inteligencia artificial.

El entrenamiento se inició con 80 demostraciones de recogida de calcetines. Utilizando el framework LeRobot, se post-entrenó el Action Expert de π0.5, manteniendo congelado su núcleo de visión-lenguaje PaliGemma. Una estimación inicial de siete días para 20.000 pasos de entrenamiento se redujo a aproximadamente diez horas tras corregir un detalle de implementación que forzaba la retropropagación a través del núcleo congelado.

Esta optimización del proceso de entrenamiento condujo a una política de control significativamente mejorada respecto al controlador ACT empleado en versiones anteriores. En 50 pruebas, el robot consiguió recoger y depositar calcetines en su cesta en 48 ocasiones, logrando una tasa de éxito del 96%. Esto supera el 90% de éxito alcanzado con la política ACT.

Un descubrimiento notable fue la escasa influencia del lenguaje en la ejecución de la tarea cuando el robot había sido entrenado exclusivamente para recoger calcetines. La sustitución del comando "recoge el calcetín" por frases sin sentido o su eliminación no alteró significativamente los resultados. Esto sugiere que la escena visual por sí misma proporcionaba suficiente información para determinar la acción requerida.

Para forzar la intervención del modelo de lenguaje, se introdujo una segunda tarea: recoger papeles arrugados y depositarlos en un cubo de basura. El modelo combinado pudo realizar ambas funciones, aunque las tasas de éxito experimentaron una caída. La recogida de calcetines se mantuvo entre el 87% y el 93%, dependiendo del entorno, mientras que la de papel fluctuó entre el 43% y el 50%. Parte de esta disminución se atribuyó a la rigidez de la pinza SO-101 para objetos irregulares y ligeros, así como a la falta de mecanismos de recuperación si la cámara de la muñeca perdía de vista el objeto.

Este proyecto, aún en curso, aporta conocimiento sobre la viabilidad y los desafíos de los modelos VLA de código abierto en aplicaciones robóticas prácticas, enfatizando la interacción entre la percepción visual y la comprensión lingüística.

Fuente original: Hackster.io

Publicaciones Similares

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *