# Un Go2 aprende a llegar a tiempo para atrapar una pelota

Un Unitree Go2 combina visión externa y aprendizaje por refuerzo para anticipar dónde y cuándo caerá una pelota y alcanzar el punto de intercepción.

- URL canónica: https://robotica.es/ia/unitree-go2-atrapa-pelota-control-temporal/
- Versión Markdown: https://robotica.es/ia/unitree-go2-atrapa-pelota-control-temporal.md
- Publicado: 2026-08-10
- Última actualización editorial: 2026-08-10
- Autoría: Redacción Robotica.es
- Categoría: IA en robótica
- Etiquetas: Unitree, Go2, aprendizaje por refuerzo, visión artificial, robots cuadrúpedos, sim-to-real
- Idioma: es-ES

Un equipo del **Physical Intelligence Lab** ha convertido un **Unitree Go2** en un interceptor de pelotas. El cuadrúpedo no persigue el objeto directamente: calcula su punto y su instante de caída, y corre para colocar a tiempo una cesta montada sobre el lomo.

## El tiempo entra en la orden de movimiento

El experimento intenta resolver un problema que la navegación robótica convencional suele simplificar. Llegar a unas coordenadas no basta cuando el objetivo solo estará allí durante una fracción de segundo. Un robot puede alcanzar el lugar correcto demasiado pronto o demasiado tarde y fallar igualmente.

El sistema presentado el **7 de agosto de 2026** en [un manuscrito del Physical Intelligence Lab](https://arxiv.org/abs/2608.06907) introduce por eso dos datos en la orden de locomoción: la posición prevista de caída y el tiempo restante hasta el impacto. La política de control, entrenada mediante aprendizaje por refuerzo, aprende a sincronizar el desplazamiento con ambos valores en vez de recibir únicamente una velocidad lineal y angular.

La demostración utiliza un **Unitree Go2** equipado con una cesta de **22 × 28 × 9 centímetros** y un ordenador NVIDIA Jetson Orin Nano para ejecutar la política de locomoción. La cesta deja un margen de error útil de unos **17,8 centímetros**, suficiente para convertir el acierto o el fallo en una prueba exigente de posición y tiempo.

El comportamiento emergente tiene dos fases. El robot gira primero hacia el punto previsto y después acelera en línea recta. Los autores no programaron explícitamente esa secuencia; apareció durante el entrenamiento al premiar la llegada precisa y penalizar caídas, posturas inestables, consumo excesivo y movimientos poco suaves.

## Dos cámaras predicen la caída

La percepción no viaja a bordo del cuadrúpedo. Una cámara Intel RealSense D415 observa la trayectoria de la pelota de tenis, mientras una cámara cenital localiza el robot mediante una etiqueta AprilTag fijada en su parte superior. Un ordenador externo reúne las mediciones y transmite el objetivo al Go2.

La pelota se detecta con una versión ajustada de **YOLOv13n**, apoyada por un detector de color como respaldo. El equipo declara una latencia inferior a **10 milisegundos por imagen**. Después, un filtro de Kalman estima la trayectoria en tres dimensiones y predice tanto el lugar como el momento de caída. Esta combinación importa: el aprendizaje se ocupa de la locomoción, pero no intenta redescubrir desde cero la física balística.

Los investigadores compararon su método con un controlador que transforma la distancia al objetivo en órdenes de velocidad. En las pruebas físicas, cada política realizó **100 lanzamientos**, con caídas aleatorias a una distancia de hasta **2 metros** y vuelos de entre **0,8 y 1,2 segundos**.

El control condicionado por posición y tiempo acertó en el fondo de la cesta en el **37,5%** de los lanzamientos a menos de medio metro, en el **24,44%** entre medio metro y un metro y en el **36,84%** entre uno y dos metros. El controlador de velocidad obtuvo, respectivamente, **6,25%**, **9,62%** y **25%**. Si se cuentan también los contactos con el borde de la cesta, el nuevo método superó el **60%** en las tres franjas.

## Una prueba controlada, no un cazador autónomo

El resultado muestra que incluir el tiempo en la interfaz de control puede mejorar tareas dinámicas, pero el montaje está lejos de funcionar en cualquier entorno. Las cámaras son externas y necesitan mantener el robot y la pelota dentro de su campo de visión. El suelo es plano, la cesta amplía la superficie de captura y los lanzamientos se realizan dentro de una zona preparada.

La tasa de acierto absoluta sigue siendo modesta. Incluso el mejor resultado estricto deja sin capturar más de seis pelotas de cada diez. Los propios autores señalan como fuentes de error la latencia de comunicación, el ruido de seguimiento, las variaciones de fuerza de los motores con el estado de la batería y la resistencia del suelo durante los giros rápidos.

Tampoco se ha aislado cuánto aporta cada componente: el condicionamiento temporal, la predicción de trayectoria, la destilación entre una política profesora y otra estudiante o el diseño de las recompensas. La comparación demuestra una ventaja frente al controlador de velocidad elegido, no una superioridad general sobre todos los métodos de intercepción.

La aportación más útil está en la arquitectura completa. El experimento conecta percepción, predicción, comunicaciones y control sim-to-real en un bucle que debe reaccionar en aproximadamente un segundo. Esa coordinación puede trasladarse a otras tareas en las que un cuadrúpedo deba coincidir con un objeto móvil, siempre que futuras versiones lleven la percepción a bordo y mantengan el rendimiento fuera del laboratorio.

## Fuentes

- [arXiv — manuscrito sobre intercepción dinámica con un cuadrúpedo [en]](https://arxiv.org/abs/2608.06907)
- [Physical Intelligence Lab — laboratorio responsable del trabajo [en]](https://physicalintelligence-lab.github.io/)
- [Unitree Robotics — especificaciones oficiales del Go2 [en]](https://www.unitree.com/go2/)
- [Imagen: figura del experimento real publicada por los autores en el manuscrito [en]](https://arxiv.org/pdf/2608.06907)
