BoxBot combina visión e IA para cortar y abrir cajas

Viam BoxBot corta cinta con control visual y abre solapas con SmolVLA. Sus datos y código permiten estudiar el montaje, aún sin resultados de fiabilidad publicados.

·Redacción Robotica.es
4 min de lectura
Montaje fotográfico oficial de BoxBot en el laboratorio de Viam: un brazo blanco sobre una caja y dos detalles de su herramienta roja entre las solapas.

Viam BoxBot abre cajas de cartón cerradas con cinta repartiendo el trabajo entre dos controles: la cámara guía el corte y un modelo aprendido mueve las solapas. El proyecto de investigación, anunciado el 22 de septiembre para IROS 2026, ofrece código y datos para estudiar esa combinación. Aún no publica una tasa de éxito que permita valorarlo como máquina para una línea de desembalaje.

La demostración aborda una tarea anterior a recoger el contenido. Liberar la tapa evita que un segundo robot tenga que lidiar con el embalaje cerrado, pero el montaje presentado no acredita una cadena completa de apertura, extracción y reposición de productos.

El corte sigue una línea; las solapas cambian de forma

El anuncio técnico de Viam [en] describe un control visual que corrige la posición de la herramienta mientras busca el encuentro de la cinta, con una anchura típica de uno a dos milímetros. Esa cifra describe la zona que debe localizar, no un error de corte medido.

Después interviene SmolVLA, un modelo de visión, lenguaje y acción adaptado para abrir y ajustar las cuatro solapas. El cartón se deforma al tocarlo; aprender movimientos de ejemplos permite abordar una fase cuya geometría cambia durante la operación. Viam también emplea planificación clásica de movimiento en otras partes de la aplicación.

La división deja una cuestión de integración muy concreta: decidir cuándo la cinta ya está cortada y puede comenzar la apertura. Si una solapa sigue adherida, ejecutar la secuencia aprendida no resuelve automáticamente ese fallo. Separar las etapas ayuda a investigar cuál necesita mejorar, en lugar de atribuir cualquier error al modelo de IA.

La página del proyecto para IROS [en] sitúa la inferencia del VLA en un NVIDIA Jetson Orin Nano junto al robot. Es el cálculo de las acciones durante el uso. La preparación del modelo siguió otro recorrido: Viam sincronizó los registros del brazo y dos cámaras con la nube y utilizó LeRobot en Hugging Face Jobs para entrenar. Ejecutar la política localmente no significa que todo el desarrollo se haya realizado sin servicios externos.

Las 125 demostraciones son una adaptación, no todo el aprendizaje

Dos ingenieros recopilaron 125 demostraciones teleoperadas con un mando de realidad virtual en unas cinco horas repartidas entre cuatro días, según Viam. Esa cifra corresponde al trabajo descrito en el anuncio; no es el tamaño de cualquier versión del proyecto que se descargue después.

La ficha publicada de smolvla-box-bot-subtasks-v3 [en] identifica una adaptación de lerobot/smolvla_base y un conjunto de 156 episodios, organizado en tareas para abrir cada solapa. Sus entradas incluyen dos vistas de cámara y un estado de seis valores; produce acciones de seis valores. Quien quiera repetir el experimento debe comprobar que el modelo y las observaciones de su montaje encajan, además de descargar los pesos.

El trabajo original de SmolVLA [en], publicado en junio de 2025 por investigadores de Hugging Face y colaboradores académicos, explica el aprendizaje previo sobre unas 23.000 trayectorias. Por tanto, los ejemplos de BoxBot ajustan capacidades existentes; no enseñan desde cero toda la percepción y el movimiento.

Ese mismo trabajo identifica límites al cambiar de plataforma robótica y al abordar tareas largas. Sus resultados tampoco evalúan BoxBot. Para entender esta aplicación de la IA en robótica, conviene separar la capacidad del modelo base de la fiabilidad de una combinación concreta de brazo, cámaras y herramienta.

Llevarlo a otra mesa exige configurar el control

El servicio de inferencia abierto de Viam [en] distingue el cálculo de acciones del bucle que lee cámaras y mueve el brazo. Su manual exige Python 3.12 o posterior y configurar la correspondencia de cámaras, articulaciones y unidades. También incorpora límites por movimiento y registros que ayudan a detectar una configuración incorrecta.

Hay una precisión relevante para el montaje físico: cuando se envían desplazamientos cartesianos de la herramienta, la evitación de obstáculos depende de cómo la implemente el controlador del brazo. Los límites del módulo no bastan para deducir que una cuchilla pueda trabajar junto a personas en cualquier mesa.

La ficha de v3 declara que todavía no aporta resultados de evaluación. Para una aplicación de robótica industrial, harían falta ciclos completos con distintos embalajes, incluidos cortes fallidos y posibles daños al contenido. El material abierto permite preparar esos ensayos; descargarlo no proporciona una célula de desembalaje terminada.

Fuentes

Sigue explorando

Robots relacionados

Descubre sus fichas y todo lo que hemos contado sobre ellos.

Ver toda la categoría
Brazo negro RoArm-M2-S de Waveshare con pinza y estructura de fibra de carbono sobre fondo blanco

RoArm-M2-S

Waveshare

Caja abierta del kit LEGO Education Computer Science & AI 45521 con piezas y componentes

LEGO Education Computer Science & AI

LEGO Education

OriginMan físico con un brazo levantado en una imagen de su documentación

OriginMan

Guyue Home

XLeRobot físico con dos brazos SO101, cámara y carrito móvil

XLeRobot

XLeRobot Contributors

Render oficial de VEX AIM con mando, pelotas, barriles y señales AprilTag.

AIM Coding Robot

VEX Robotics

Brazo azul xArm AI de Hiwonder con pinza, módulo de visión y sensor ultrasónico frontal

xArm AI

Hiwonder

Robot Transbot SE gris con orugas, brazo y cámara orientable, en una imagen comercial de Yahboom con logotipos de plataformas

Transbot SE

Yahboom

MasterPi con brazo naranja, cámara junto a la pinza y cuatro ruedas Mecanum sobre fondo blanco

MasterPi

Hiwonder