Amap, la plataforma de mapas y localización de Alibaba, ha reunido en ABot cinco componentes de IA para robots: navegación, manipulación móvil, razonamiento, memoria y control de movimiento. La actualización busca que máquinas con cuerpos distintos compartan una misma arquitectura, aunque por ahora la evidencia pública procede sobre todo de benchmarks y trabajos técnicos.
Cinco capas para evitar robots hechos de piezas aisladas
El anuncio del 23 de julio presenta ABot como un sistema completo, no como otro modelo visión-lenguaje-acción que traduce una cámara y una orden en movimientos. La propuesta conecta modelos del mundo, control corporal y una capa de agente encargada de planificar, usar herramientas, verificar resultados y recordar lo ocurrido en tareas anteriores.
La navegación recae en ABot-N1. El modelo separa el razonamiento lento, que interpreta el entorno y fija objetivos sobre la imagen, del control rápido que produce trayectorias continuas. Esa división intenta corregir dos problemas habituales: perder precisión espacial durante recorridos largos y reaccionar mal ante instrucciones poco frecuentes. En el preprint de ABot-N1, el equipo declara tasas de éxito del 95,4% en interiores y del 92,9% en exteriores dentro de sus evaluaciones, además de publicar nuevos benchmarks de navegación urbana.
Para las tareas que exigen desplazarse y actuar sobre objetos, Amap incorpora ABot-M0.5. En vez de tratar la base móvil y los brazos como una única secuencia de acciones, el modelo divide ambos flujos y los sincroniza a escala de fotogramas. El ejemplo utilizado por la empresa es sencillo de explicar y difícil de ejecutar: llegar hasta un dispensador y llenar un vaso. Un error pequeño al acercarse puede dejar el brazo fuera de alcance; una desviación al agarrar puede arruinar todos los pasos posteriores.
Según la compañía, M0.5 superó al mejor resultado previo de RoboCasa-365 en un 20,4% para tareas complejas y en un 10,6% para tareas básicas. El trabajo técnico del modelo describe un entrenamiento que reutiliza predicciones visuales imperfectas para que el sistema aprenda a continuar cuando la ejecución se separa ligeramente de la trayectoria prevista.
Un sistema operativo para planificar y recordar
La parte más ambiciosa está por encima del control físico. ABot-ER razona sobre relaciones entre objetos, espacios y objetivos, mientras ABot-AgentOS convierte el plan en habilidades que puede ejecutar un robot concreto. Amap dice que esta capa admite máquinas humanoides, cuadrúpedos y robots con ruedas mediante complementos, sin exigir que cada cuerpo use el mismo controlador de bajo nivel.
AgentOS añade además memoria multimodal persistente. Su función no es guardar una transcripción, sino relacionar diálogo, observaciones visuales, lugares, tiempos y trazas de ejecución. Cuando una tarea falla, el sistema puede diagnosticar qué recuerdo o decisión fue insuficiente y convertir esa experiencia en un recurso para evaluaciones posteriores. El equipo lo ha probado en EmbodiedWorldBench, un entorno propio con 16 escenarios y más de 200 tareas de navegación, búsqueda de objetos, conversación y respuesta a eventos dinámicos.
El último bloque, ABot-C0, transforma las decisiones en comportamientos físicos para cuadrúpedos y contempla la coordinación entre robots heterogéneos. La imagen oficial de la arquitectura coloca al robot cuadrúpedo Tutu como cuerpo visible del sistema, pero la apuesta de Amap es que el software no quede ligado a una sola máquina.
Esta dirección encaja con la evolución reciente de la compañía. Amap creó su división de inteligencia incorporada a comienzos de 2026, presentó modelos iniciales de navegación y manipulación y, en junio, abrió la beta de ABot-Earth0.5, capaz de generar entornos urbanos tridimensionales para simulación. La combinación permite cerrar un bucle: construir escenarios virtuales, entrenar modelos, ejecutar tareas físicas y devolver los fallos al sistema.
Los benchmarks aún no equivalen a un despliegue
La arquitectura responde a un problema real. Un robot útil fuera de una demo necesita navegar, manipular, planificar y recuperarse de errores durante muchos pasos; optimizar cada capacidad por separado no garantiza que el conjunto funcione. También es razonable separar las decisiones de alto nivel del control rápido, porque los dos procesos operan con escalas de tiempo y requisitos de seguridad diferentes.
Pero el anuncio no detalla disponibilidad comercial, clientes, número de robots operativos ni horas acumuladas en entornos reales. Los resultados son cifras comunicadas por Amap y varios documentos siguen siendo preprints sin revisión por pares. EmbodiedWorldBench, además, ha sido creado por el propio equipo, por lo que su posición frente a sistemas rivales necesitará comparaciones independientes y reproducibles.
ABot importa menos por adjudicarse resultados de estado del arte que por el diseño que propone: una pila común en la que navegación, manipulación, memoria y control intercambian información. El siguiente paso decisivo será verla trabajando durante turnos prolongados, con cuerpos diferentes y ante fallos que no estaban previstos en el conjunto de evaluación.
Fuentes
- Amap / PR Newswire — presentación de la actualización completa de ABot [en]
- arXiv — ABot-N1 para navegación visual y lingüística [en]
- arXiv — ABot-M0.5 para movilidad y manipulación [en]
- arXiv — ABot-AgentOS y memoria multimodal persistente [en]
- Amap / PR Newswire — ABot-Earth0.5 y el cuadrúpedo Tutu [en]
- Imagen: Amap / PR Newswire — arquitectura oficial de ABot y robot Tutu [en]