# Jarvis Desktop Robot: voz y ruedas con control local

Jarvis es un compañero de escritorio construido en 2026 con ESP32-S3, voz y ruedas. Su informe explica las pruebas y los límites del audio con batería.

- URL canónica: https://robotica.es/hogar/jarvis-desktop-2026-robot-escritorio-voz-ruedas-pruebas/
- Versión Markdown: https://robotica.es/hogar/jarvis-desktop-2026-robot-escritorio-voz-ruedas-pruebas.md
- Publicado: 2026-10-08
- Última actualización editorial: 2026-10-08
- Autoría: Redacción Robotica.es
- Categoría: Hogar y Consumo
- Etiquetas: Equipo Jarvis de UIUC, Jarvis Desktop Robot, escritorio, interacción, robots de compañía
- Idioma: es-ES

**Jarvis Desktop Robot** es un compañero de escritorio construido por Jiajun Gao, Yuchen Shih y Zichao Wang en un proyecto universitario de 2026. Combina una cara en pantalla, conversación por voz y ruedas para desplazarse. El informe final, fechado el 4 de mayo, muestra un prototipo físico y explica también las funciones que todavía necesitan mejorar. [Informe de los autores](https://courses.grainger.illinois.edu/ece445/getfile.asp?id=25810).

## Una pequeña carcasa con dos placas

El diseño divide la electrónica entre una placa para la cara y otra para movimiento y alimentación. La primera incorpora el ESP32-S3, el micrófono, el amplificador de audio y la pantalla ST7735. La segunda reúne potencia y control de los motores. [Documento de diseño](https://courses.grainger.illinois.edu/ece445/getfile.asp?id=25523).

La presentación permite ver el robot completo: una carcasa blanca, pantalla frontal y ruedas. También muestra las placas desarrolladas por el equipo. Esa separación ayudó a probar subsistemas antes de integrar el conjunto, y facilita distinguir un fallo de audio de otro relacionado con la propulsión. [Presentación del prototipo](https://courses.grainger.illinois.edu/ece445/getfile.asp?id=25760).

La pantalla utiliza expresiones geométricas y estados de actividad. Indicar que el robot escucha, piensa o habla puede hacer más comprensible una pausa, aunque una expresión facial no demuestre que reconozca las emociones del usuario.

## La conversación pasa por un ordenador

El robot envía audio a un servidor ejecutado en un Mac. Allí se organiza el reconocimiento de voz, la respuesta del modelo y la síntesis que vuelve al altavoz. La configuración documentada utiliza Gemini 2.5 Flash y servicios de voz; no acredita que toda la conversación se procese dentro del ESP32. [Arquitectura final](https://courses.grainger.illinois.edu/ece445/getfile.asp?id=25810).

Las peticiones de movimiento llegan como herramientas con acciones definidas. El modelo puede solicitar una dirección, pero el controlador local comprueba el modo y los sensores antes de permitir la orden a los motores. También existe conducción manual por Wi-Fi desde un navegador.

Para alguien interesado en construir un compañero de escritorio, esa división deja dos necesidades claras: mantener disponible el ordenador y revisar qué información atraviesa cada servicio de audio. El aspecto compacto del cuerpo no elimina las dependencias del sistema de conversación.

## Qué comprobaron y qué falló

La presentación recoge pruebas de respuesta y detección de borde realizadas por el propio equipo. Sus cifras pertenecen a esas sesiones y a sus condiciones de ensayo. Un resultado completo en una muestra no significa que cualquier mesa, iluminación u obstáculo produzca el mismo comportamiento. [Resultados presentados](https://courses.grainger.illinois.edu/ece445/getfile.asp?id=25760).

El informe final identifica una limitación importante: el reconocimiento de palabras cortas baja aproximadamente del 95 % con alimentación externa al 55 % con batería. Los autores relacionan esa caída con la alimentación del circuito de audio. También describen eco causado por la proximidad del micrófono y el altavoz. [Evaluación y limitaciones](https://courses.grainger.illinois.edu/ece445/getfile.asp?id=25810).

Es una distinción útil: completar una petición de reconocimiento no demuestra haber entendido correctamente todas sus palabras. Antes de valorar una conversación, conviene separar éxito del proceso, exactitud del texto y respuesta final del robot.

## Un prototipo para aprender interacción

La construcción final emplea infrarrojos TCRT5000, aunque el diseño inicial contemplaba otras soluciones. Sus lecturas pueden cambiar con superficies oscuras o poco reflectantes. La memoria propone mejorar sensores, alimentación y aislamiento del micrófono en futuras revisiones.

Jarvis aporta un ejemplo reciente de integración entre voz y movimiento sobre una mesa. Su objetivo de compañía y alivio cotidiano del estrés es una intención del proyecto, no una prueba terapéutica. Las fuentes permiten estudiar un prototipo universitario con resultados y fallos documentados; no acreditan una unidad comercial lista para usar.

## Fuentes

- [Jarvis: informe final de ECE 445, 4 de mayo de 2026, documento de los autores (inglés, PDF).](https://courses.grainger.illinois.edu/ece445/getfile.asp?id=25810)
- [Jarvis: documento de diseño de primavera de 2026, fuente universitaria original (inglés, PDF).](https://courses.grainger.illinois.edu/ece445/getfile.asp?id=25523)
- [Jarvis Desktop Robot: presentación del prototipo y sus pruebas, fuente original (inglés, PDF).](https://courses.grainger.illinois.edu/ece445/getfile.asp?id=25760)

*Imagen: Fotografía del equipo Jarvis de su robot completo, con carcasa blanca, cara en pantalla, dos ruedas negras y ruedas auxiliares claras. [Archivo original](https://courses.grainger.illinois.edu/ece445/getfile.asp?id=25760).*
