Google DeepMind lanzó un modelo que procesa texto, imágenes, vídeo y audio para planificar tareas físicas, supervisar su ejecución y delegar movimientos en sistemas de control robótico.
Google DeepMind presentó el 30 de julio de 2026 Gemini Robotics ER 2, un modelo de inteligencia artificial diseñado para interpretar entornos físicos, planificar tareas de varios pasos y coordinar las herramientas que controlan un robot.
El sistema está basado en Gemini 3.5 Flash y admite texto, imágenes, vídeo y audio como entradas. Su función no consiste en accionar directamente los motores. Opera como una capa de razonamiento de alto nivel que descompone una instrucción, decide qué herramienta utilizar y entrega la ejecución física a modelos de visión, lenguaje y acción, interfaces de navegación u otras funciones definidas por el desarrollador.
Seguimiento de tareas mediante vídeo
Una de las principales novedades es el procesamiento de secuencias continuas de vídeo. Esta capacidad permite al modelo estimar el avance de una tarea, comprobar si una etapa terminó y modificar el plan cuando detecta un fallo.
En evaluaciones internas, Google atribuye al modelo una precisión del 57,4 por ciento al clasificar el progreso de una actividad. En pruebas destinadas a localizar el momento exacto en que ocurre un evento dentro de un vídeo, registró una precisión del 91,3 por ciento y una distancia temporal media de 0,96 segundos. Estos resultados no han sido reproducidos de manera independiente y deben entenderse como mediciones del fabricante.
Coordinación de diferentes robots
Gemini Robotics ER 2 incorpora funciones para organizar el trabajo de varias máquinas. La propuesta es que robots con distintas formas y capacidades compartan una representación semántica de la tarea y se entreguen objetos o responsabilidades durante su ejecución.
Google mostró demostraciones con el humanoide Apollo 2 de Apptronik, el sistema Franka F3 Duo y el robot Spot de Boston Dynamics. En el caso de Spot, el modelo combina instrucciones en lenguaje natural con las interfaces de navegación y manipulación del fabricante para localizar y transportar objetos.
Disponibilidad para desarrolladores
El modelo está disponible en vista previa mediante Gemini API y Google AI Studio. También se ofrece en vista previa privada dentro de Gemini Enterprise Agent Platform. La documentación identifica dos variantes: una destinada a interacciones convencionales y otra preparada para transmisión bidireccional en aplicaciones sensibles a la latencia.
El contexto de entrada admite hasta 131.072 tokens y puede combinar diferentes modalidades. La salida es texto, incluyendo respuestas estructuradas y llamadas a funciones que pueden conectarse con las interfaces de un robot.
La seguridad física sigue dependiendo de otras capas
Google publicó junto con el modelo un informe sobre ASIMOV Agentic, un conjunto de pruebas para evaluar el rechazo de instrucciones peligrosas, la detección de personas, el tratamiento de tareas ambiguas y la respuesta ante fallos del hardware.
En pruebas de laboratorio con un humanoide Apollo 2, la empresa informó una precisión del 99 por ciento al detectar personas y una fiabilidad del 96 por ciento al pasar a una posición segura. El propio informe advierte que estas pruebas se concentran en el razonamiento y la coordinación de alto nivel. No evalúan la arquitectura de seguridad funcional, los componentes certificados, la redundancia ni las garantías de respuesta en tiempo real necesarias para una instalación física.
La documentación también recuerda que los modelos generativos pueden equivocarse y que corresponde al operador mantener un entorno seguro. Cuando el sistema capta imágenes, voces u otros datos de personas identificables, el desarrollador debe informar a los afectados, obtener el consentimiento correspondiente y reducir la recopilación de información personal.
Gemini Robotics ER 2 debe entenderse como infraestructura para integrar razonamiento multimodal con sistemas robóticos existentes, no como un robot terminado. Su utilidad en entornos productivos dependerá de pruebas independientes, integración con cada plataforma, mecanismos deterministas de protección y cumplimiento de las normas de seguridad aplicables.
Fuentes
- Google, anuncio de Gemini Robotics ER 2
- Google DeepMind, ficha del modelo Gemini Robotics ER 2
- Google AI for Developers, documentación de Gemini Robotics ER
- Google DeepMind, informe Gemini Robotics 2: Safety Evaluations
📬 Newsletter gratuito