Google abrirá la Vista Previa Pública de Gemini Robotics ER 2 el 30 de julio de 2026. Esta vez, en lugar de reemplazar solo un nombre de modelo, ofrece simultáneamente tanto inferencia estándar como rutas de acceso en streaming en tiempo real:
gemini-robotics-er-2-preview: Adecuado para análisis de imágenes y vídeo de una sola toma y orquestación de herramientas en varios pasos.gemini-robotics-er-2-streaming-preview: Recibe audio, vídeo y texto de forma continua a través de la API de Live, adecuada para interacciones con bots de baja latencia.
Los gemini-robotics-er-1.6-preview heredados cesarán su servicio el 31 de agosto de 2026. Los proyectos que ya usan el modelo antiguo deben completar las pruebas de reemplazo y regresión del nombre del modelo lo antes posible, y no esperar hasta el día de cierre para migrar.
Conclusión rápida: qué endpoint elegir
Si el robot planifica acciones tras recibir una foto, o necesita analizar un vídeo ya grabado, prioriza el uso de endpoints estándar. Si el robot necesita observar continuamente la cámara, recibir comandos de voz y llamar repetidamente a herramientas como movimiento y agarre durante las sesiones, selecciona el endpoint de streaming en tiempo real.
| Escenario | Modelo recomendado |
|---|---|
| Posicionamiento y guía de objetos en imágenes | gemini-robotics-er-2-preview |
| Cajas delimitadoras, trayectorias y juicio de relaciones espaciales | gemini-robotics-er-2-preview |
| Posicionamiento de momentos clave en un vídeo largo | gemini-robotics-er-2-preview |
| Evaluación del progreso y la finalización de la tarea | gemini-robotics-er-2-preview |
| Interacción continua con cámara y voz | gemini-robotics-er-2-streaming-preview |
| Control de robots multiruedas de baja latencia | gemini-robotics-er-2-streaming-preview |
Ambos pueden recibir texto, imágenes, vídeo y audio, pero la salida es texto. Si el robot necesita hablar, también debe entregar el texto a un servicio TTS externo o declarar el TTS como herramienta llamable.
Qué es Embodied Reasoning en ER 2
ER significa Razonamiento Incorporado. Los modelos de visión ordinarios se centran más en lo que aparece en la imagen, mientras que los modelos de razonamiento incorporado deben entender dónde está el objeto, cómo llega, qué paso ha dado la tarea y qué acción del robot llamar a continuación. El ER 2 estándar está construido sobre Gemini 3.5 Flash, con los aspectos oficiales destacados:
- Razonamiento espacial: Identificar puntos, seguir objetos, generar cuadros delimitadores y planificar trayectorias.
- Visión Agentica: Combina ejecución de código y procesamiento de imágenes para realizar análisis visual.
- Comprensión en vídeo: Identificar momentos críticos para evaluar el progreso de la tarea y el estado de finalización.
- Orquestación de herramientas: Combinar APIs personalizadas de bots en un proceso de crecimiento.
- Colaboración multi-robot: coordina diferentes dispositivos según el estado de la tarea.
Esto no significa que el modelo pueda controlar directa y de forma segura el hardware real. El modelo es responsable de entender y hacer recomendaciones, mientras que los desarrolladores aún deben limitar la velocidad, el alcance, los permisos y las condiciones de parada en la capa de ejecución de la herramienta.
Diferencias funcionales entre la versión estándar y la versión en streaming
Aunque ambos modelos tienen nombres similares, las funciones de Gemini API que soportan no son exactamente las mismas.
| Capacidades de la API | Versión estándar | Versión en streaming en tiempo real |
|---|---|---|
| Llamada de función | Soporte | Soporte |
| Pensando | Apoyo | Apoyo |
| Búsqueda de Google Conexión a la Tierra | Soporte | Soporte |
| Live API | No soportada | Soportada |
| Ejecución de código | Soportado | No soportado |
| Caché contextual | Soportado | No soportado |
| Salida estructurada | Soportada | No soportada |
| URL Contexto | Soporte | No soportar |
| Búsqueda de archivos | Soporte | No soportar |
| API por lotes | Soporte | No soportar |
La versión estándar también soporta Uso de Ordenador, Conexión a Tierra de Google Maps y otras funciones, pero no soporta la API en Vivo. La versión de streaming está optimizada para conexiones persistentes y entradas de sensor; no asumas que solo porque el nombre incluya ER 2, los parámetros de configuración en ambos lados pueden intercambiarse tal cual. Ambas tienen límites de token de entrada de 131.072 y topes de token de salida de 65.536. La entrada de alta resolución y niveles de Thinking más altos aumentan la latencia, así que al equilibrar velocidad y calidad de inferencia, La recomendación oficial es empezar a probar con Pensamiento Medio.
Prepara el SDK de Python y la clave API
Instala o actualiza el SDK de IA de la generación de Google:
|
|
Luego, configura la clave API en las variables de entorno:
|
|
No escribas claves directamente en el repositorio de código.
Si la solicitud responde 403,
También comprueba si la clave API es completamente sin restricciones.
La API de Robótica requiere añadir restricciones apropiadas para las claves,
Las teclas sin restricciones pueden ser rechazadas.
Ejemplo 1: usar el endpoint estándar para localizar objetos en una imagen
Por ejemplo, sube primero una imagen,
Luego, el modelo debe devolver hasta diez puntos objetivo.
El orden de coordenadas es [y, x],
y normalizado de 0 a 1000.
|
|
Después de recibir la salida, no acciones inmediatamente el brazo robótico. Como mínimo, deberían añadirse las siguientes verificaciones:
- El resultado del acuse de recibo puede analizarse en la estructura JSON esperada.
- Asegúrate de que cada coordenada esté dentro del rango de 0 a 1000.
- Convertir coordenadas normalizadas en coordenadas primas de la imagen original.
- Rechazar etiquetas desconocidas, etiquetas vacías y resultados de cantidades anormales.
- Convertir posiciones bidimensionales en sistemas de coordenadas robóticas mediante calibración por cámara.
- Comprobar el espacio de trabajo, el riesgo de colisión y las condiciones de confianza antes de la ejecución.
Si el objeto es demasiado pequeño o está muy obstruido, Puedes recortar y ampliar primero el área objetivo. La luz, el contraste y el ángulo de cámara afectan al juicio espacial, Las tareas de alta precisión pueden consultarse repetidamente y utilizar resultados consistentes, Sin embargo, esto aún no puede sustituir a los sensores y controladores de seguridad.
Ejemplo 2: Declarar las acciones de los robots como herramientas
Los modelos no deben unirse directamente ni ejecutarse mediante los comandos del SDK del robot. Un enfoque más seguro es exponer solo las herramientas que ya han sido revisadas, Los parámetros también están en la lista blanca para su verificación. Las acciones físicas en la API de Robotics Live en streaming deben declararse como llamadas bloqueantes:
|
|
"behavior": "BLOCKING" significa:
Después de que el modelo emita una llamada de acción,
Debes esperar a que el lado de la ejecución devuelva el resultado,
Solo entonces podremos seguir planificando los siguientes pasos.
Por ejemplo, cuando un robot se mueve hacia un punto seguro,
El modelo no puede moverse antes de que el movimiento esté completo,
Asume que ya está en su sitio y llama a la herramienta de agarre.
La capa de ejecución de la herramienta también debe asegurar:
- Solo se permiten nombres de acciones predefinidos y zonas seguras.
- Limitar la velocidad, fuerza, ángulo articular y rango de movimiento del brazo robótico.
- Se establecen mecanismos de tiempo de espera y cancelación para cada acción.
- Mantiene el parada de emergencia hardware y el bloqueo de seguridad independiente.
- Devolver claramente el éxito, fallo, tiempo de espera y estado del sensor al modelo.
- Añadir confirmación manual o aprobación del motor de políticas para acciones peligrosas.
- Registrar solicitudes de modelo, parámetros de herramientas, resultados de ejecución y marcas de tiempo.
La salida en lenguaje natural del modelo solo puede servir como sugerencias, No puede saltarse la capa de herramientas y convertir directamente a comandos motores.
Cómo funcionan los endpoints de streaming en tiempo real
gemini-robotics-er-2-streaming-preview Utiliza APIs dedicadas a Live,
Mantener las sesiones mediante conexiones WebSocket persistentes y con estado.
Un ciclo típico consta de tres pasos:
- Declarar la herramienta de acción del bot en la configuración de la sesión.
- Envío continuo de cámaras, micrófonos o mensajes de texto.
- Recibir la llamada a la herramienta, ejecutar el SDK del robot y luego devolver el resultado de la herramienta.
También existen restricciones claras en la entrada de audio y vídeo:
- Audio utiliza PCM nativo, 16 bits, 16 kHz, formato de gama pequeña.
- Los vídeos se envían como fotogramas de imagen JPEG, hasta 1 FPS.
- El propio fotograma de vídeo no activa automáticamente la inferencia del modelo.
- Requiere activar respuestas con comandos de texto o audio.
- Para un seguimiento proactivo continuo, envía regularmente alertas de latidos cardíacos.
El último punto es fácil de caer. Subiendo continuamente las grabaciones de la cámara, Esto no significa que el modelo abra o llame activamente a herramientas cuando detecte una excepción. Inspecciones de almacén, supervisión de la línea de producción y otros escenarios, Se deben diseñar comandos claros con latido cardíaco, Por ejemplo, pide al modelo que compruebe si hay obstrucciones, caídas o personal que entra en zonas de peligro en las últimas imágenes. La frecuencia cardíaca tampoco debería aumentarse indefinidamente. Teniendo en cuenta el límite de vídeo de 1 FPS, la latencia, la cuota y la ventana de riesgo real, Determina un ciclo de inspección razonable.
Migrando de ER 1.6 a ER 2
El cambio de código más pequeño es reemplazar la cadena de modelo:
|
|
Pero la migración formal no puede basarse únicamente en si la solicitud devuelve 200. Se recomienda manejarlas en el siguiente orden:
- Hacer balance de todo el código, variables de entorno y nombres antiguos de modelos en los archivos de configuración.
- Elegir la versión estándar o en streaming según el tipo de negocio para evitar errores mecánicos de reemplazo.
- Compruebe si las capacidades de la API de las que actualmente dependen son soportadas por el endpoint objetivo.
- Actualizar el SDK y usar la clave de API restringida en el entorno de prueba.
- Revalidar esquemas de herramientas, comportamientos de bloqueo y manejo de errores.
- Comparar los resultados de la versión anterior con ER 2 usando un conjunto de pruebas fijo.
- Escala de grises de bajo tráfico en línea para observar latencia, tasa de fallo y tasa de abortos operativos.
- Eliminar la ruta de rollback de la versión antigua antes del 31 de agosto de 2026.
El conjunto de pruebas de regresión debería cubrir al menos:
- Coordenadas de puntero y cajas delimitadoras en imágenes.
- Objetos pequeños, objetos ocultos y escenas de bajo contraste.
- Lecturas de instrumentos y determinación de orientación a objetos.
- Vídeos de momentos clave, progreso de la tarea y estado de finalización.
- Las condiciones de orden y parada para llamadas a funciones de varios pasos.
- Fallo de herramientas, tiempo de espera y formatos anormales de retorno.
- Rechazo o respuesta de seguridad tras la entrada del personal en la zona de trabajo.
- Latencia y calidad en diferentes niveles de pensamiento.
Durante la fase de Vista Previa Pública, los comportamientos o interfaces aún pueden ajustarse, Los proyectos de producción deben estar bloqueados a la versión SDK, Registrar la identificación del modelo y los resultados de las pruebas, Y sigue siguiendo el registro de actualizaciones.
Seguridad, Privacidad y Despliegue en Producción
Los errores en el modelo de bots pueden causar daños a la propiedad o riesgos personales. Los desarrolladores deben ser responsables del entorno físico y de las acciones finales, No puedes tratar el “juicio correcto del modelo” como certificación de seguridad. El entorno de producción sugiere descomponer el sistema en tres capas:
- Capa de comprensión: ER 2 es responsable de la percepción, el razonamiento y la propuesta de llamadas a herramientas.
- Capa de políticas: Valida permisos, parámetros, estado y reglas de seguridad.
- Capa de ejecución: Los controladores robot realizan acciones y proporcionan protección hardware.
En cuanto a datos de cámaras y micrófonos relacionados con el personal, Se debe obtener una notificación clara y el consentimiento necesario. Minimizar la recogida de datos personales, Puede evitar imágenes de personas identificables, O realizar desenfoque facial u otro procesamiento antes de subir. No almacenes el audio y vídeo original, la ubicación exacta o la información de identidad indefinidamente en los registros. Se deben establecer mecanismos de control de acceso, periodo de retención y eliminación, Las evaluaciones de cumplimiento se realizan según las regiones de despliegue.
Preguntas frecuentes
¿Puede ER 2 generar acciones de robot directamente?
Puede seleccionar las acciones del robot definidas por el desarrollador mediante llamadas a funciones, Pero la acción real sigue siendo realizada por la capa de ejecución de tu herramienta. Las operaciones físicas deben usar llamadas de bloqueo, Se han aprobado la validación de parámetros y el enclavamiento de seguridad.
¿Puede el endpoint estándar usar Live API?
No.
Deben utilizarse sesiones de streaming en tiempo real
gemini-robotics-er-2-streaming-preview。
¿El streaming monitoriza automáticamente todos los fotogramas de vídeo?
No. Los fotogramas de vídeo no disparan la inferencia por sí solos, Se requieren mensajes de texto, comandos de audio o latidos cardíacos regulares.
¿El streaming genera voz directamente?
No, la salida del modelo es texto. Las emisiones de voz requieren TTS externo, TTS también puede empaquetarse como herramientas.
¿Por qué la clave API devuelve 403?
Primero, comprueba si la clave tiene alguna restricción. La explicación oficial indica que las claves API sin restricciones serán rechazadas, Se deben configurar restricciones API adecuadas para ellos, Al mismo tiempo, confirma que tanto los permisos del proyecto como de la API son correctos.
¿Deberías migrar ahora?
Debería serlo.
Versión antigua gemini-robotics-er-1.6-preview
El servicio cesará el 31 de agosto de 2026.
Primero, realizamos la prueba de comparación en una escena fija,
Luego cambia gradualmente el flujo de producción.
Resumen
Gemini Robotics ER 2 divide la API robótica en dos rutas claras: La versión estándar gestiona razonamientos espaciales, de vídeo y de varios pasos más completos, El streaming es responsable de la interacción continua de audio y vídeo de baja latencia. Lo que realmente determina la fiabilidad del proyecto, No solo elegir el nombre correcto del modelo, También incluye llamadas a funciones de bloqueo, listas blancas de herramientas, retornos de estado, enclavamiento por hardware, y establecer pruebas de regresión repetibles para escenarios del mundo real. Si sigues usando ER 1.6, La migración debería empezar ahora, Finaliza el plan de lanzamiento y retroceso en escala de grises antes de la fecha de cierre.