Artículo
El nivel 4 por dentro: modelos del mundo, políticas VLA y la brecha sim2real
Qué es un modelo del mundo y en qué se diferencia de un modelo predictivo, cómo se entrena una política visión-lenguaje-acción, por qué la brecha sim2real es un problema de distribución y qué separa hoy un piloto documentado de una producción.
- Publicado
- 9 de septiembre de 2026
- Actualizado
- 9 de septiembre de 2026
- Formato
- Guía
- Lectura
- 18 min
El nivel 4 de la escalera de la IA física describe sistemas que perciben, razonan y actúan de forma autónoma sobre el mundo real. Es el estado del arte del sector y se explica aquí en tercera persona, con sus piezas técnicas reales: qué es un modelo del mundo, qué es una política visión-lenguaje-acción, por qué la brecha entre simulación y realidad es un problema de distribución y no de fotorrealismo, dónde tiene que vivir la inferencia y qué separa un piloto documentado de una producción.
Modelo del mundo frente a modelo predictivo
En los niveles 2 y 3 de la escalera se trabaja con modelos predictivos. Un modelo predictivo es una función que va de un vector de características a una salida acotada: probabilidad de fallo de un rodamiento en siete días, consumo previsto del turno, clase del defecto de una imagen. Tres propiedades lo definen: no representa la dinámica del proceso sino una correlación entre entrada y salida en el régimen observado; no contiene acciones, de modo que no puede responder a qué pasaría si se hiciese otra cosa; y se valida fuera de línea con una métrica de error sobre un conjunto de prueba separado.
Un modelo del mundo es otra cosa. Codifica la dinámica del entorno: dado un estado latente y una acción, cuál es el siguiente estado latente y qué observación se espera, con su incertidumbre. La definición de referencia del sector está en el paper de la plataforma Cosmos que NVIDIA publicó en arXiv el 7 de enero de 2025 (identificador 2501.03575), donde un world foundation model se describe como un modelo del mundo de propósito general que puede afinarse para obtener modelos del mundo especializados. El 31 de mayo de 2026 la compañía anunció Cosmos 3, con arquitectura de mezcla de transformers y pesos de las variantes Super y Nano publicados en Hugging Face bajo licencia OpenMDW-1.1.
Lo que añade sobre un predictor son tres capacidades concretas:
- Trayectorias imaginadas: desplegar hacia delante el efecto de una secuencia de acciones y comparar alternativas que nunca se ejecutaron.
- Entrenamiento sin tocar la planta: planificar dentro del modelo, lo que hace viable aprender cuando cada ensayo real cuesta dinero, tiempo de línea o riesgo.
- Contrafactuales: expresar qué habría pasado bajo otra decisión, cosa que un predictor no puede hacer porque en su formulación no hay acción.
De ahí se sigue la consecuencia que más importa a una fábrica: un modelo del mundo necesita dato de acciones, no solo de observaciones. Un histórico con variables de proceso pero sin registro de las intervenciones es dato puramente observacional, y con él se aprende qué suele pasar, no qué pasa si se interviene. Por eso el bucle cerrado supervisado, el nivel 3, es prerrequisito del nivel 4.
El límite conocido de esta familia es el error de composición: al encadenar predicciones el error se acumula, y una política optimizada contra un modelo imperfecto tiende a explotar sus fallos en vez de resolver la tarea. La práctica lo compensa con horizontes cortos, recalibración con dato real y penalización de las zonas donde el modelo tiene poca evidencia.
| Aspecto | Modelo predictivo | Modelo del mundo | Política visión-lenguaje-acción |
|---|---|---|---|
| Qué recibe | Un vector de características de señales de proceso. | Un estado latente y una acción candidata. | Imágenes, propiocepción y una instrucción en lenguaje natural. |
| Qué devuelve | Una salida acotada: probabilidad, clase o valor previsto. | El siguiente estado latente y la observación esperada, con su incertidumbre. | Acciones de bajo nivel: incrementos de pose o comandos articulares. |
| Qué pregunta responde | Qué suele pasar en el régimen ya observado. | Qué pasaría si se ejecutase esta acción y no otra. | Qué hago ahora para cumplir la instrucción. |
| Con qué se valida | Error sobre un conjunto de prueba separado, fuera de línea. | Trayectorias predichas frente a medidas ante las mismas entradas. | Tasa de éxito en tareas reales no vistas, medida en línea. |
| Qué dato necesita | Histórico observacional con contexto y marca de tiempo fiable. | Pares de acción y efecto, no solo observaciones. | Episodios de observación, instrucción, acción y resultado. |
| Dónde vive en la escalera | Niveles 2 y 3. | Nivel 4, y como herramienta de simulación para el 3. | Nivel 4. |
Políticas visión-lenguaje-acción y cómo se entrenan
Una política es una función que convierte el estado estimado en una acción, sujeta a restricciones declaradas y orientada a un objetivo declarado. Una política visión-lenguaje-acción es un caso particular: toma observaciones visuales, propiocepción y una instrucción en lenguaje natural, y emite directamente acciones de bajo nivel, del tipo incremento de pose o comando articular. El término se fija en RT-2, publicado por Google DeepMind en arXiv el 28 de julio de 2023 (identificador 2307.15818), cuya aportación fue tratar las acciones como tokens de texto e incorporarlas al conjunto de entrenamiento de un modelo de visión y lenguaje, de manera que el conocimiento preentrenado se transfiere al control. Eso explica que generalicen a objetos y variantes de tarea descritas con palabras, en vez de exigir una trayectoria programada por referencia.
La arquitectura de doble sistema
Las implementaciones del sector convergen en separar dos velocidades. NVIDIA lo describe en el paper de Isaac GR00T N1, publicado en arXiv el 18 de marzo de 2025 (identificador 2503.14734): un System 2 de visión y lenguaje encargado del razonamiento semántico, y un System 1 que es un transformer de difusión que genera las acciones. Figure AI publicó el 20 de febrero de 2025 las frecuencias de su modelo Helix, y son el dato más útil para razonar sobre latencia: el System 1 reactivo corre a 200 Hz, un ciclo cada 5 milisegundos, y el System 2 semántico a 7 a 9 Hz. La separación responde a un hecho físico: razonar qué hacer y ejecutar un movimiento estable tienen requisitos temporales que difieren en más de un orden de magnitud.
De dónde sale el dato de entrenamiento
- Teleoperación real. Un humano maneja el robot y se registran las trayectorias. Es el dato más caro y el más valioso porque contiene la dinámica real. El conjunto abierto de referencia es Open X-Embodiment, publicado en arXiv el 13 de octubre de 2023 (identificador 2310.08864): 22 robots, 21 instituciones y 527 habilidades demostradas, agregadas de 60 conjuntos previos. Figure declaró unas 500 horas de teleoperación para Helix.
- Vídeo humano y dato web. Aporta variedad de escenas, objetos y contexto semántico que ninguna flota de robots produce, a cambio de no contener acciones ni fuerzas.
- Dato sintético. Generado en simulación o con modelos del mundo. Cubre casos raros de forma barata y hereda los errores del modelo que lo generó.
El paper de GR00T N1 formula la receta como una mezcla heterogénea de trayectorias reales de robot, vídeo humano y conjuntos sintéticos. Physical Intelligence llegó al mismo lugar por otro camino con pi-0.5, publicado en arXiv el 22 de abril de 2025 (identificador 2504.16054), que usa co-entrenamiento sobre tareas heterogéneas para conseguir generalización a mundo abierto.
Imitación primero, refuerzo después
El entrenamiento base es aprendizaje por imitación sobre tripletas de observación, instrucción y acción demostrada. Es estable y barato de validar, pero tiene techo: la política no supera al demostrador y se degrada en cuanto se aleja de los estados que este visitó. El aprendizaje por refuerzo entra después para mejorar tasa de éxito y rendimiento en tareas reales; en la cronología publicada por Physical Intelligence en su blog (consultada el 9 de septiembre de 2026), esa es la aportación declarada de pi*0.6, de noviembre de 2025, dentro de una secuencia que va de pi-0 en octubre de 2024 a pi-0.7 en abril de 2026. La tercera línea es la adaptación con pocos ejemplos: Google DeepMind separó acción y razonamiento en Gemini Robotics 1.5, el 25 de septiembre de 2025, y en Gemini Robotics 2, anunciado el 30 de julio de 2026, declara adaptación a una morfología nueva en unas pocas horas y, típicamente, con menos de 200 ejemplos, además de una variante que corre en el propio dispositivo.
Los límites que importan en una fábrica son cuatro:
- la frecuencia de inferencia acota el ancho de banda de control alcanzable, así que no sustituyen al lazo de milisegundos sino que se apoyan sobre él;
- la salida es probabilística, de modo que por debajo hace falta una envolvente de seguridad determinista que no dependa del modelo;
- el comportamiento fuera de distribución es difícil de acotar formalmente, lo que choca con la certificación de una celda compartida con personas;
- no resuelven el problema de saber en qué estado está la planta: consumen percepción y la convierten en movimiento dentro de una tarea acotada.
La brecha sim2real es un problema de distribución
La explicación popular dice que la simulación falla por falta de realismo visual. La revisión académica publicada en arXiv el 23 de octubre de 2025 (identificador 2510.20808), incluida en el Annual Review of Control, Robotics, and Autonomous Systems de 2026, lo enuncia de otra forma: la brecha nace de las abstracciones y aproximaciones que inevitablemente introducen discrepancias entre el entorno simulado y el real. Todo simulador es un modelo y, por tanto, imperfecto por construcción.
En términos de aprendizaje: una política entrenada en simulación optimiza el rendimiento esperado bajo la distribución de estados y observaciones que induce el simulador, y al desplegarla encuentra otra distinta. El agravante es propio del control y no aparece en un problema de clasificación: la política determina qué estados visita. Un error pequeño la lleva a estados poco representados en el entrenamiento, donde comete un error mayor, que la lleva más lejos todavía. El desplazamiento se realimenta.
Las fuentes de ese desplazamiento son varias y solo una es visual:
- parámetros dinámicos mal identificados: fricción, inercias, holguras, elasticidad, retardos y saturación del actuador;
- ruido, resolución y latencia de los sensores, que en simulación se modelan como ideales;
- contacto, fricción y deformación, la parte peor modelada de casi cualquier simulador;
- y, en último lugar, apariencia: iluminación, texturas y reflejos.
El corolario incomoda a quien compra por la demostración: un simulador fotorrealista con la fricción equivocada sigue fallando. Las técnicas que reducen la brecha atacan las cuatro fuentes. La aleatorización de dominio entrena sobre una familia de simuladores con parámetros aleatorizados para que la realidad caiga dentro de esa familia; la formulación canónica es la de Tobin y otros en arXiv, del 20 de marzo de 2017 (identificador 1703.06907), que transfiere imágenes simuladas a reales aleatorizando el renderizado, y la idea se generalizó después a los parámetros dinámicos. El dato sintético a escala es el uso que el glosario de NVIDIA (consultado en septiembre de 2026) atribuye a los world foundation models. La identificación con dato real mide sobre la máquina los parámetros que el simulador adivinaba, para centrar esa familia donde de verdad está el sistema. Y el ajuste con episodios reales afina la política en el entorno de destino.
Las tres últimas requieren dato medido de la planta. Aquí reaparece el nivel 1 de la escalera: un retardo mal caracterizado se aprende como una dinámica que no existe. La calidad de la marca de tiempo y la sincronización entre modalidades no son un detalle de la ingesta, son una condición para que el modelo sea correcto.
Qué aporta y qué no aporta el histórico de una planta
Cuatro cosas aporta y una no, y conviene separarlas con cuidado.
- Percepción. El histórico observacional sirve para detectar anomalías, clasificar defectos y estimar variables no medidas. Es el terreno del mantenimiento predictivo y de la inspección visual con IA, y no exige salir del nivel 2.
- Identificación de la dinámica. Permite ajustar los parámetros de un modelo del proceso en el régimen que la planta ha recorrido de verdad. No dice nada de los regímenes nunca visitados, y ese silencio se confunde con evidencia.
- Validación. Es un banco de escenarios reales y una fuente de casos raros que nadie habría pensado en simular. También calibra el simulador comparando trayectorias reales y simuladas ante las mismas entradas.
- Acotar la autoridad del sistema. Define la envolvente de operación normal y permite detectar cuándo el sistema está fuera de distribución y debe ceder el control. Sin esa envolvente no hay criterio para saber cuándo el modelo no debe decidir.
- Lo que no aporta: aprender una política. Un histórico observacional no contiene las acciones alternativas ni sus resultados. Sin contrafactual no se puede evaluar una decisión que no se tomó. La única forma de generar ese dato es operar un bucle cerrado supervisado y registrar, por acción, qué dato la disparó, qué versión de regla o modelo la produjo, qué se escribió, qué respondió el equipo y qué efecto se midió después.
Hay además un requisito de calidad que se subestima. En el nivel 4 el problema deja de ser el volumen y pasa a ser la sincronización entre modalidades: una política que asocia imagen y fuerza aprende la correlación equivocada si las dos corrientes están desfasadas, y el error es invisible en la métrica de entrenamiento. La completitud también cambia de naturaleza: ya no es porcentaje de muestras, es cobertura de la distribución. Diez mil repeticiones del caso normal no cubren el caso raro que decide si el sistema es desplegable.
Latencia y cómputo: por qué la inferencia vive en el borde
El bucle se cierra sobre una máquina real, y esa máquina impone el reloj. El diagrama encadena las cuatro etapas con la latencia que cada tramo tolera.
El orden de magnitud está documentado. El white paper de 5G-ACIA y ZVEI sobre integración de redes Ethernet industriales con redes 5G, de noviembre de 2019, sitúa los tiempos de ciclo cortos habituales en comunicación industrial periódica en el rango de 10 ms a 1 ms y 0,5 ms. El mismo documento fija que los dominios de reloj de trabajo, donde viven robots y control de movimiento, exigen sincronización temporal de 1 microsegundo o mejor, con tendencia a los 100 nanosegundos. La norma que la hace posible es IEEE 1588-2019, aprobada el 7 de noviembre de 2019 y publicada el 16 de junio de 2020 por la IEEE Standards Association.
Contra esas cifras se entiende por qué la inferencia no puede vivir en la nube. Un ciclo de 200 Hz dispone de 5 milisegundos para capturar, inferir, escribir y comprobar, y un trayecto de ida y vuelta a un centro de datos consume ese presupuesto entero en el mejor caso. El argumento decisivo, sin embargo, no es la media del retardo sino su varianza: un lazo con retardo variable no se puede sintonizar, o se vuelve lento para ser estable o oscila. Una red no determinista no ofrece cota superior. De ahí el reparto habitual del cómputo:
- Lazo reactivo, en el armario o embarcado. Sin depender de ninguna red externa y con comportamiento seguro definido si el nivel superior desaparece.
- Razonamiento semántico, en el borde de la planta. A 7 o 9 Hz hay margen para un acelerador local y no para salir del recinto. El diseño de referencia abierto de robot humanoide que NVIDIA presentó el 31 de mayo de 2026 para investigación académica es explícito: combina chasis, manos y un módulo de cómputo embarcado Jetson AGX Thor. En la misma línea, Gemini Robotics 2 incluye desde el 30 de julio de 2026 una variante que corre en el dispositivo.
- Entrenamiento y evaluación, en plataforma o nube. Nunca en el camino crítico de una decisión rápida. Ahí vive el modelo del mundo cuando se usa para generar dato o para planificar sin tocar la planta.
La frontera que más se viola es la primera: cerrar un lazo de milisegundos a través de una plataforma. No falla por ancho de banda, falla por varianza del retardo, y el síntoma se atribuye al algoritmo cuando el problema es de transporte. El concepto está en la ficha de IA en el borde del glosario.
Estado real de los despliegues industriales
Distinguir prueba, piloto y producción es lo que las notas de prensa mezclan. La tabla recoge los despliegues industriales documentados con el estado que la propia fuente declara.
| Sistema y ubicación | Tarea concreta | Estado declarado | Fuente y fecha |
|---|---|---|---|
| Figure 02 en la planta de BMW en Spartanburg | Carga de piezas de chapa en utillaje de soldadura, tolerancia de 5 mm en 2 segundos. | Despliegue declarado por el proveedor: más de 1.250 horas y más de 90.000 piezas en 10 meses. Cifras no auditadas por terceros. | Figure AI, 19 de noviembre de 2025 |
| Figure 03 en la misma planta | Coger piezas desordenadas de contenedores y ordenarlas en carros de secuenciación. | Proyecto en curso. BMW no lo etiqueta como producción plena en su comunicado. | BMW Group PressClub, 25 de junio de 2026 |
| AEON de Hexagon en la planta de BMW en Leipzig | Montaje de baterías de alta tensión y fabricación de componentes. | Prueba en diciembre de 2025, nueva prueba desde abril de 2026 y fase piloto desde el verano de 2026. | BMW Group PressClub, 27 de febrero de 2026 |
| HMND 01 Alpha en la fábrica de Siemens en Erlangen | Desapilado de totes en logística interna y colocación en puntos de recogida. | Prueba de concepto: 60 movimientos de tote por hora, más de 8 horas de disponibilidad y tasa de manipulación autónoma superior al 90 %. | Siemens Press, 16 de abril de 2026 |
| Atlas de Boston Dynamics en la Metaplant de Hyundai | Pruebas de manipulación en entorno de planta. | Prueba en otoño de 2025. La página del fabricante no lleva fecha visible. | Boston Dynamics, página sin fecha publicada |
| Blue Jay y Project Eluna en centros logísticos de Amazon | Brazos coordinados sobre unos tres cuartos de los tipos de artículo del sitio, con una capa de IA agéntica. | Piloto en instalaciones concretas, no despliegue de red. | About Amazon, anuncio de 22 de octubre de 2025 |
| Digit de Agility Robotics en instalaciones de cliente | Manipulación logística en nueve instalaciones. | Más de 65.000 horas acumuladas y más de 300 millones de dólares en pedidos declarados. | Agility Robotics, 24 de junio de 2026 |
Tres lecturas se sostienen sobre esa tabla: todas las tareas son de manipulación logística o alimentación de utillaje, no de proceso; las cifras de rendimiento las publica casi siempre el proveedor y no un tercero independiente; y ninguna fuente describe una línea de fabricación operada de forma autónoma de extremo a extremo.
El contraste financiero ordena la expectativa mejor que cualquier adjetivo. Figure AI cerró el 16 de septiembre de 2025 una Serie C de más de 1.000 millones de dólares con valoración posterior de 39.000 millones. Physical Intelligence levantó 600 millones con valoración de 5.600 millones, según The Robot Report del 25 de noviembre de 2025, y Skild AI 1.400 millones con valoración superior a 14.000 millones, según el mismo medio el 15 de enero de 2026. El único fabricante de humanoides con cuentas públicas, por su salida a bolsa vía SPAC, declaró 1,8 millones de dólares de ingresos y 140 millones de pérdida operativa en 2025, según The Robot Report del 7 de septiembre de 2026.
Mientras tanto, la robótica industrial convencional sigue siendo el volumen real. Según la International Federation of Robotics, en su nota del 25 de septiembre de 2025 sobre World Robotics 2025, en 2024 se instalaron 542.000 robots industriales en el mundo y el parque operativo alcanzó 4.664.000 unidades, con una densidad media mundial en manufactura de 177 robots por cada 10.000 empleados.
Por qué el nivel 4 presupone los niveles 1 a 3
La IA física es la que percibe, razona y actúa sobre el mundo real. En una fábrica empieza por capturar bien el dato de los equipos que ya existen. No es una preferencia estilística: es lo que se deduce de todo lo anterior, porque cada nivel de la escalera produce algo que el nivel 4 consume.
- Sin nivel 1 no hay percepción fiable. Sin captura por evento, marca de tiempo en origen y relojes sincronizados, los retardos se aprenden como dinámica y el modelo queda mal por construcción.
- Sin nivel 2 no hay verdad de referencia. Sin indicadores definidos y comparables no hay criterio contra el que evaluar si la política mejora algo.
- Sin nivel 3 no hay pares de acción y efecto. Sin registro de qué se hizo y qué ocurrió después no hay dato de intervención, ni contrafactual, ni métrica de deriva.
El modo de fallo que se deriva de saltarse esto es reconocible y caro: la demostración funciona con la pieza y la iluminación de la demostración, y en producción, con variabilidad de material, luz y referencia, el sistema se degrada. No se puede corregir, porque corregir exige el registro de observación, acción y resultado que produce el nivel 3, y nadie detecta la degradación porque medir el efecto es también una capacidad del nivel 3. El marco completo está en la guía IA física industrial: qué es, qué no es y por qué empieza por los datos y resumido en la ficha de IA física.
Qué debería hacer hoy una fábrica española
El punto de partida está medido. Según Metalindustria, el 22 de mayo de 2026, que recoge el III Barómetro de la digitalización y automatización industrial en España presentado en Advanced Factories 2026, solo el 3,3 % de las fábricas se declara totalmente digitalizada. Según el INE, en los datos publicados el 22 de octubre de 2025, el 21,1 % de las empresas de 10 o más empleados usa inteligencia artificial, y la Fundación Cotec sitúa la industria en el 17,5 % con la misma fecha. En robótica el dato es mejor: según el resumen ejecutivo de World Robotics 2025 de la IFR, de septiembre de 2025, España instaló 5.086 robots industriales en 2024 y adelantó a Francia como tercer mercado europeo. El ecosistema local también se ordena: Automática e Instrumentación informó el 4 de septiembre de 2026 de la creación de la asociación ÁNIMA, impulsada por AFM Cluster y AER Automation.
Sobre ese cuadro, lo razonable no es comprar nivel 4 sino construir lo que el nivel 4 consume. Cinco medidas, todas ejecutables con el parque de equipos existente, más una de calendario:
- Capturar por evento, no por sondeo lento. Estados de máquina con resolución de un segundo o mejor: una microparada de ocho segundos desaparece si se sondea cada treinta.
- Marca de tiempo en origen y relojes sincronizados. Nunca sellar en la ingesta. Sin reloj común el histórico permite contar, pero no explicar qué pasó primero.
- Contexto en cada valor. Identidad estable del activo, magnitud y unidad, escala, calidad del dato y versión de la definición de la señal. La aproximación estructurada está en el espacio de nombres unificado y en la guía de contextualización de datos industriales.
- Registrar acciones y efectos, no solo observaciones. Es lo único que convierte un histórico en material de entrenamiento para una política. Concepto en la ficha de bucle cerrado.
- Conservar los episodios que salieron mal. En el nivel 4 el valor del dato está en la cola de la distribución: fallos, recuperaciones e intervenciones manuales.
- Planificar el marco normativo con fechas. El Reglamento de Máquinas (UE) 2023/1230 se aplica desde el 20 de enero de 2027, según la ficha de EU-OSHA. Las normas ISO 10218-1:2025 e ISO 10218-2:2025, publicadas en febrero de 2025, sustituyen a las ediciones de 2011 y absorben el contenido de ISO/TS 15066 sobre operación colaborativa, según The Robot Report del 18 de febrero de 2025. Y según el calendario de la Comisión Europea consultado el 9 de septiembre de 2026, la aplicación general del Reglamento de IA empieza el 2 de agosto de 2026 y las reglas de alto riesgo para IA embebida en productos del Anexo I, que incluye maquinaria, se aplican desde el 2 de agosto de 2028. Añádase la serie ISA/IEC 62443 para la ciberseguridad de los sistemas de automatización y control.
Ninguna exige comprar un robot. Todas producen valor por sí mismas en los niveles 1 a 3, que es donde trabajamos, y son las que dejan a la planta en condiciones de evaluar el nivel 4 con criterio propio cuando llegue el momento.
Preguntas frecuentes sobre el nivel 4
¿Qué es un modelo del mundo y en qué se diferencia de un modelo predictivo?
Un modelo predictivo va de un vector de características a una salida acotada: probabilidad de fallo de un rodamiento, consumo previsto del turno, clase de un defecto. No contiene acciones, así que no responde a qué pasaría si se hiciese otra cosa. Un modelo del mundo aprende la dinámica del entorno: dado un estado y una acción, cuál es el siguiente estado y qué observación se espera. NVIDIA lo define en el paper de la plataforma Cosmos, publicado en arXiv el 7 de enero de 2025, como un modelo del mundo de propósito general que puede afinarse para obtener modelos especializados.
¿Qué es una política visión-lenguaje-acción?
Es un modelo que toma observaciones visuales y una instrucción en lenguaje natural y emite acciones de bajo nivel, del tipo incremento de pose o comando articular. El término se fija en RT-2, publicado por Google DeepMind en arXiv el 28 de julio de 2023, cuyo aporte fue expresar las acciones como tokens de texto e incorporarlas al entrenamiento de un modelo de visión y lenguaje. No sustituye al lazo de control clásico: se apoya sobre él, porque su frecuencia de inferencia es órdenes de magnitud más lenta.
¿Por qué un robot que funcionaba en la demostración falla en producción?
Porque la política se validó sobre una distribución que no es la de la planta. La revisión publicada en arXiv el 23 de octubre de 2025, incluida en el Annual Review of Control, Robotics, and Autonomous Systems de 2026, atribuye la brecha a las abstracciones y aproximaciones que todo simulador introduce. Hay además un agravante propio del control: la política decide qué estados visita, de modo que un error pequeño la lleva a estados poco representados, donde comete un error mayor. Corregirlo exige registro de observación, acción y resultado.
¿Sirve el histórico de mi planta para entrenar estos modelos?
Sirve para la percepción, es decir detectar, clasificar y estimar variables no medidas. Sirve para identificar la dinámica en el rango de operación ya visitado. Y sirve para validar, porque contiene casos raros que ninguna simulación habría propuesto. No basta para aprender una política, porque un histórico observacional no registra las acciones alternativas ni sus resultados: no contiene contrafactuales. Esa es la diferencia entre dato observacional y dato de intervención.
¿Hay humanoides trabajando en fábricas hoy?
Hay pruebas y pilotos documentados, que no son producción. Siemens describió el 16 de abril de 2026 una prueba de concepto en Erlangen, con 60 movimientos de tote por hora y tasa de manipulación autónoma superior al 90 %. BMW anunció el 27 de febrero de 2026 su primer piloto europeo en Leipzig. La cifra que ordena la expectativa es económica: The Robot Report publicó el 7 de septiembre de 2026 que Agility Robotics declaró 1,8 millones de dólares de ingresos y 140 millones de pérdida operativa en 2025.
¿Qué puede hacer hoy una fábrica española para estar preparada?
Trabajar el sustrato de dato, que es lo que estos modelos consumen. En orden: capturar por evento los estados de máquina con resolución de un segundo o mejor, poner la marca de tiempo en origen y sincronizar los relojes, guardar cada valor con identidad de activo, unidad y calidad, registrar las acciones con su efecto medido, y conservar los episodios que salieron mal. Según Metalindustria, el 22 de mayo de 2026, solo el 3,3 % de las fábricas españolas se declara totalmente digitalizada.
Para situar una planta concreta en la escalera, el test de madurez digital devuelve el nivel y el siguiente paso en diez preguntas, y la plataforma de datos industriales describe la arquitectura de captura, contexto y bucle cerrado sobre la que se apoya todo lo anterior. Si quieres revisar qué dato produce hoy tu parque de equipos y qué faltaría para sostener un modelo, escríbenos.