La Nueva Frontera Robótica: Aprendizaje por Demostración Visual

La robótica y la inteligencia artificial están al borde de una nueva era de aprendizaje simplificado. Hasta ahora, la adopción de nuevas tareas por parte de un robot implicaba un proceso de entrenamiento meticuloso y específico para cada función. Sin embargo, la firma Generalist AI ha presentado un avance prometedor con su modelo GEN-1.5, que redefine este paradigma.
El Concepto de "Physical Prompting"
La innovación central de GEN-1.5 reside en su capacidad para asimilar una nueva tarea observando una demostración física de tan solo tres a doce segundos. Este método, denominado "physical prompting", emula el concepto de "prompting" utilizado en los modelos de lenguaje grandes (LLM), pero aplicado al mundo físico. En lugar de una descripción textual, el robot aprende a través de la observación directa de la acción deseada.
La premisa es clara: enseñar al robot en lugar de programarlo exhaustivamente. Si se le presenta una tarea inédita, el robot analiza la demostración visual y procede a intentar replicarla. Ejemplos prácticos como abrir un bote, accionar una cremallera o extraer un billete de una cartera ilustran la versatilidad de este enfoque, evitando la necesidad de crear conjuntos de datos de entrenamiento específicos o realizar ajustes finos (fine tuning) complejos.
Un Prompt Basado en Movimiento y Contexto
A diferencia de los modelos de IA generativa de texto que responden a indicaciones escritas, el "prompt" para GEN-1.5 es un vídeo que detalla los movimientos requeridos. El modelo de IA generativa analiza el estado inicial, la manipulación del objeto y el contexto general para deducir el objetivo de la tarea. De esta manera, el entorno físico se convierte en la fuente principal de aprendizaje para el robot.
La empresa ha demostrado capacidades notables, como la concatenación de dos demostraciones distintas para que el robot complete autónomamente los movimientos intermedios. Sorprendentemente, GEN-1.5 puede transferir el aprendizaje de simulaciones a robots reales, incluso si estos no han sido preentrenados en entornos simulados. La observación directa de una persona realizando la tarea también es suficiente para que el robot intente emular los movimientos con sus propias pinzas, demostrando una interpretación de objetivos más allá de la simple imitación de trayectorias.
Resultados Actuales y Potencial a Futuro
Si bien el potencial es inmenso, la tecnología se encuentra en una fase temprana. En pruebas con diez tareas de manipulación sencillas, GEN-1.5 alcanzó una tasa de éxito promedio del 59%. Esto indica que, si bien es capaz de aprender rápidamente, la fiabilidad de las funciones adquiridas por "physical prompting" es, por el momento, inferior a la obtenida mediante entrenamiento tradicional. Los responsables de Generalist AI reconocen esta inconsistencia, calificándola como un área de mejora.
No obstante, el margen de mejora es considerable. Tras un breve periodo de entrenamiento adicional, que incluye aproximadamente cinco minutos de datos (unas 50 demostraciones) y apenas 10 actualizaciones del modelo, la tasa de éxito puede elevarse al 83%. En este proceso, los cambios en los parámetros del modelo son mínimos (inferiores al 0.15%), lo que sugiere que el modelo ajusta y reorganiza conocimientos generales preexistentes.
Hacia la Generalización Robótica
Generalist AI se suma a iniciativas como las de DeepMind en la búsqueda de modelos robóticos generales capaces de transferir conocimientos entre diversas tareas y escenarios. Este avance refleja una tendencia similar observada en la IA de texto, transitando de modelos especializados a grandes modelos base que pueden adaptarse a múltiples propósitos. La empresa afirma haber preentrenado sus modelos con más de medio millón de horas de interacción física, confiando en que una experiencia previa extensa abaratará el aprendizaje de futuras interacciones.
Fuente: Ver artículo original