El límite de los modelos de visión en la robótica actual
Los modelos de visión-lenguaje-acción (VLA) han permitido que los robots ejecuten tareas complejas en entornos desconocidos mediante el entrenamiento previo con grandes volúmenes de imágenes, vídeos y texto. Estos sistemas, ajustados posteriormente con demostraciones teleoperadas, pueden realizar actividades como doblar la ropa o recoger objetos en una habitación utilizando instrucciones en lenguaje natural y una señal de vídeo. Sin embargo, la dependencia exclusiva de la visión genera fallos críticos en tareas que requieren un control manual preciso.
La manipulación de materiales deformables o la interacción con objetos pequeños, como insertar un cable USB o girar una llave en una cerradura, representan barreras significativas para los VLA. El problema radica en que estos modelos ignoran la retroalimentación táctil, una fuente de información esencial que los humanos utilizan para ajustar la fuerza y la posición de sus manos sin necesidad de ver el objeto. La capacidad de detectar el deslizamiento o la presión exacta es fundamental para la destreza, pero los sensores tradicionales de visión no pueden capturar estos datos.
Estrategias para la integración del sentido del tacto
Trevor Darrell, profesor de ciencias de la computación de la Universidad de California en Berkeley, sostiene que la mayor parte de la manipulación diestra puede realizarse con los ojos cerrados gracias a la comprensión de la fuerza y el agarre. Para trasladar esta capacidad a las máquinas, su equipo ha desarrollado un método de entrenamiento basado en un submodelo especializado. Este sistema se ha entrenado con 100 horas de datos táctiles de alta calidad que incluyen acciones como limpiar, agarrar, girar o verter utilizando más de 200 objetos domésticos diferentes.
La implementación de estos datos ha requerido una arquitectura de modelos separados denominada «expertos». Debido a que los modelos de visión-lenguaje operan con una velocidad insuficiente para las correcciones táctiles en tiempo real, el equipo de Berkeley creó un experto en acción para los planes de movimiento y un experto táctil que opera cuatro veces más rápido. Este último ajusta el plan de movimiento basándose en lo que el robot siente en cada instante. Tras el ajuste con 100 demostraciones teleoperadas en tareas como enroscar una bombilla o trasladar un huevo entre bandejas, el sistema alcanzó una tasa de éxito del 65 % en 12 tareas, duplicando el rendimiento del mejor modelo VLA disponible.
Estandarización y diversidad de datos táctiles
Uno de los principales obstáculos en la investigación actual es la especificidad del hardware. Las manos robóticas varían desde diseños de cinco dedos articulados hasta pinzas simples, y los sensores táctiles utilizan principios físicos distintos, como la medición de cambios de resistencia o la deformación de almohadillas de gel blando. Esta fragmentación impide que los datos y el aprendizaje sean transferibles entre diferentes grupos de investigación.
Chengbo Yuan, estudiante de máster en la Universidad de Tsinghua en Pekín, ha abordado este problema agregando más de 3.000 horas de datos táctiles de conjuntos de datos públicos. Este esfuerzo abarca 21 tipos de sensores y diversas configuraciones robóticas. Inspirándose en la colaboración Open X-Embodiment, el equipo de Yuan diseñó un modelo agnóstico al hardware que convierte la salida de cada sensor en un formato compartido, mapeándolo sobre una plantilla de mano humana. Este enfoque ha permitido que el modelo generalice el conocimiento táctil incluso en hardware que no fue utilizado durante su fase de entrenamiento.
Escalado de datos y predicción proactiva
La cantidad de datos disponibles sigue siendo insuficiente comparada con los volúmenes de datos de visión y lenguaje. En este contexto, la Universidad de Fudan en Shanghái y su empresa derivada, NeoteAI, han creado un conjunto de datos táctiles significativamente mayor. Mediante el uso de sensores propietarios instalados en brazos robóticos y pinzas manuales operadas por humanos, han recopilado más de 30.000 horas de demostraciones con datos visuales y táctiles sincronizados.
Shunlin Lu, investigador postdoctoral de la Universidad de Fudan y CTO de NeoteAI, indica que este volumen de datos permite entrenar modelos que no solo reaccionan al tacto, sino que predicen proactivamente lo que el robot debería sentir para guiar la acción. Lu estima que alcanzar las 100.000 horas de datos recopilados en entornos reales, fuera del laboratorio, podría desbloquear capacidades robóticas completamente nuevas, posicionando la inteligencia táctil como el siguiente paso fundamental para la IA física.
Alternativas basadas en la inferencia visual
Como alternativa a la instalación de sensores físicos, investigadores de la Universidad del Sur de California han desarrollado un modelo capaz de inferir información táctil a partir de datos visuales. El sistema fue entrenado con 2.700 demostraciones de manipulación utilizando una pinza que registraba simultáneamente imágenes y presión. El modelo aprendió a asociar la imagen del contacto del robot con el objeto con la cantidad de presión sentida por los sensores.
Esta capacidad permite que robots que carecen de sensores táctiles tengan un sentido del tacto rudimentario, útil en tareas de manipulación con contacto intenso. El objetivo a largo plazo de este proyecto es utilizar este generador para añadir datos táctiles sintéticos a los conjuntos de datos de visión ya existentes, acelerando así el entrenamiento de otros modelos sin necesidad de hardware costoso.
El desafío de la señal táctil intermitente
No todos los expertos coinciden en que el volumen de datos sea la única solución. Long Cheng, de la Academia China de Ciencias en Pekín, argumenta que el problema reside en la naturaleza de la señal. Mientras que la visión ofrece un flujo continuo de píxeles, las señales táctiles son dispersas e intermitentes, lo que provoca que muchos modelos aprendan a ignorarlas.
Para solucionar esto, Cheng ha presentado un modelo que predice la sensación táctil basándose únicamente en la visión y luego compara esa predicción con la entrada real del sensor. Cuando existe una diferencia significativa entre lo esperado y lo sentido, el sistema amplifica esa señal sorprendente y atenúa las predecibles. En pruebas realizadas en cinco tareas de contacto intenso, este método logró una tasa de éxito del 62,8 %, frente al 28,2 % del modelo que no utilizaba el tacto. Esta metodología demuestra que la forma en que se procesan los datos es tan crucial como la cantidad de información recopilada.




