Artículo
IA física industrial: qué es, qué no es y por qué empieza por los datos
Guía de referencia sobre IA física industrial: qué es y qué no es frente a la IA generativa, el gemelo digital, la automatización clásica y la robótica programada; el bucle percibir, razonar y actuar en cuatro etapas; los horizontes de decisión de una planta; el sustrato de dato que exige cada nivel; la escalera de la IA física con criterios observables; el estado del arte con fuentes; y el calendario normativo europeo.
- Publicado
- 8 de septiembre de 2026
- Actualizado
- 9 de septiembre de 2026
- Formato
- Pillar
- Lectura
- 40 min
La IA física es la que percibe, razona y actúa sobre el mundo real. En una fábrica empieza por capturar bien el dato de los equipos que ya existen. Esta guía formaliza ese bucle, sitúa cada decisión de planta en su horizonte temporal, describe qué exige el dato en cada peldaño y ordena el camino en una escalera de cinco niveles con criterios observables. El nivel 4, el de los robots y las políticas autónomas, se explica al final como estado del arte del sector y con las fuentes en el propio texto.
Qué es la IA física y qué no es
La IA física es la que percibe, razona y actúa sobre el mundo real. En una fábrica empieza por capturar bien el dato de los equipos que ya existen. La definición del glosario de NVIDIA (consultado en septiembre de 2026) va en la misma línea: sistemas capaces de percibir, entender, razonar y ejecutar u orquestar acciones complejas en el mundo físico. La diferencia de esta guía es dónde pone el punto de partida: no en el robot, sino en el dato de la máquina que ya tienes.
Los tres verbos se entienden mejor con equipos que cualquier planta ya tiene. Un PLC lee temperaturas, presiones, finales de carrera y contadores de piezas cada pocos milisegundos: eso ya es percepción, y el problema es que se queda dentro del equipo. Cuando una línea se para, alguien cruza el aviso del autómata con el turno, la referencia en curso y el historial de la máquina para decidir si es una microparada o una avería que va a durar: ese cruce, hoy manual, es razonamiento. Y bajar la consigna de un compresor cuando la demanda cae, o abrir una orden de mantenimiento cuando la vibración sale de rango, es actuar. Percibir, razonar y actuar no son tecnologías, son capacidades: una planta puede tenerlas de forma manual, parcial o automatizada.
Conviene fijar también dónde entra el aprendizaje automático, porque decir «usamos IA» sin decir dónde no dice nada. Puede entrar en la percepción, cuando un modelo interpreta una imagen o una serie de vibración que un umbral fijo no sabría leer. En el modelo de la dinámica del proceso, cuando se identifica cómo responde una máquina a una entrada. En la política de decisión, que es donde viven las políticas autónomas del nivel 4. Y, con mucha menos frecuencia, en el propio objetivo, aprendiendo la función de coste. La regla que ordena el resto del artículo es sencilla: cuanto más cerca del actuador aprende el sistema, más exigente es la verificación que hace falta. Un clasificador de defectos se valida contra un conjunto etiquetado y sale barato; una política que mueve un eje se valida sobre casos no vistos y necesita una envolvente de seguridad independiente.
Qué no es la IA física
El término se usa hoy para vender casi cualquier cosa. La forma más rápida de delimitarlo es preguntar por las tres capacidades y por una cuarta que casi nadie exige: si el sistema mide el efecto de su propia acción.
| Enfoque | Qué percibe | Qué decide | Qué cambia en la planta |
|---|---|---|---|
| IA generativa | Una petición escrita y, como mucho, documentos o imágenes que se le adjuntan. | Qué texto, código o imagen produce a continuación. | Nada. La salida termina en la pantalla de una persona. |
| Gemelo digital | Dato real de la planta, que alimenta un modelo de la máquina o del proceso. | Nada por sí mismo: responde a preguntas de simulación que le plantea alguien. | Nada, salvo que exista un bucle explícito de vuelta a la planta. |
| Automatización clásica | Una o pocas variables medidas, comparadas con una consigna fija. | Una ley fija ajustada en la puesta en marcha, sin objetivo económico declarado. | La salida de un actuador, de forma inmediata y determinista. |
| Robótica programada | Su propia posición y, a veces, un sensor de presencia o de fuerza. | Nada: ejecuta la trayectoria enseñada, en el mismo orden, cada ciclo. | La pieza, siempre que llegue en la posición prevista. |
| IA física | El estado del proceso, estimado a partir de sensores ruidosos, parciales y con retardo. | La acción que mejor cumple un objetivo declarado con restricciones declaradas. | El proceso, y además mide el efecto de la acción para corregir la siguiente. |
De la tabla salen cuatro delimitaciones que conviene enunciar. La IA generativa produce contenido a partir de una petición y se queda en la pantalla; puede formar parte de un sistema de IA física como capa de razonamiento o de interfaz, pero por sí sola no cierra ningún bucle. El gemelo digital es una representación alimentada con dato real, valiosísima para razonar y para probar antes de tocar la planta, pero un gemelo sin bucle de vuelta es un espejo. La automatización clásica, el PID y la lógica de enclavamientos, es un caso particular y muy bien resuelto del bucle: percibe una variable, aplica una ley fija y actúa, sin objetivo económico declarado y sin memoria. Y la robótica programada ejecuta una trayectoria enseñada: no razona sobre lo que percibe, y por eso funciona de maravilla mientras la pieza llegue donde se espera.
Queda una quinta confusión, la más frecuente en 2026: un asistente conversacional con acceso de lectura al SCADA. Consultar el estado de una máquina en lenguaje natural es cómodo y tiene valor, pero sigue siendo una interfaz de lectura. Solo hay IA física cuando el sistema puede cerrar el bucle con una acción acotada, trazable, supervisada y con su efecto medido.
El bucle percibir, razonar, actuar
Una planta es un sistema dinámico, y describirla con la notación del control ahorra muchas discusiones. Hay un estado, lo que habría que saber del sistema en un instante para predecir su futuro: temperaturas, posiciones, desgaste, material en curso. Casi nunca es directamente observable. Hay acciones, lo que el sistema de control puede modificar: consignas, arranques, velocidades, órdenes de trabajo. Hay perturbaciones, lo que cambia el estado y no se controla: materia prima, ambiente, red eléctrica, personas. Y hay observaciones, lo que los sensores devuelven, que es ruidoso, parcial y llega con retardo.
Con esa notación, el bucle se descompone en cuatro etapas encadenadas. Son cuatro problemas de ingeniería distintos y conviene no mezclarlos, porque fallan por causas distintas y se arreglan con equipos distintos.
Adquisición y acondicionamiento
Convierte un fenómeno físico en un número con significado. El sensor traduce presión, temperatura, corriente o luz en una señal eléctrica, con su exactitud, su deriva, su ancho de banda y su montaje: un sensor bien elegido pero mal montado da dato malo con apariencia de bueno. Después viene el acondicionamiento, y aquí hay una regla que no admite excepción: el filtro antialias va antes del muestreo. Si la señal tiene contenido por encima de la mitad de la frecuencia de muestreo, ese contenido no desaparece, se pliega sobre la banda útil y aparece como una componente falsa que ningún tratamiento posterior puede separar.
El criterio de Nyquist fija el mínimo teórico de muestreo en el doble de la frecuencia máxima de interés, pero la práctica industrial trabaja con cinco a diez veces la frecuencia del fenómeno que se quiere reconstruir, porque no se busca solo evitar el alias sino ver la forma de la señal. La cuantificación añade su propio suelo de ruido: los bits nominales del convertidor no son los bits útiles. Y la etapa que la industria más subestima es la última: la marca de tiempo y el contexto. Un número sin instante y sin identidad de activo no es un dato, es una cifra.
Estimación de estado
Pasar de las observaciones al estado es un problema de inferencia, no de transporte de datos, y empieza por una pregunta previa: la observabilidad. Con los sensores instalados, ¿se puede reconstruir el estado que se quiere conocer? Si no es observable, ningún algoritmo lo recupera. Añadir modelo no sustituye a añadir sensor cuando lo que falta es información.
Los métodos van del filtrado clásico, cuando hay modelo y el ruido está razonablemente caracterizado, a los observadores no lineales y a los modelos aprendidos cuando el modelo físico no está disponible o es intratable. En lenguaje de planta, estimar estado es pasar de «la entrada digital 7 está a cero y el contador no avanza» a «la línea 3 lleva cuarenta segundos en microparada por falta de material aguas arriba». Ese salto es exactamente el que separa el nivel 1 del nivel 2 de la escalera.
Decisión: la política
Una política es una función que va del estado estimado a una acción, sujeta a restricciones y orientada a un objetivo. Las formas habituales, de menos a más maquinaria, son la ley de realimentación fija (PID, control en cascada), las reglas y árboles de decisión escritos por expertos, la optimización con modelo en horizonte deslizante y la política aprendida por imitación o por refuerzo. Lo que define a una política no es la técnica, sino que existan un objetivo declarado y unas restricciones declaradas. Un sistema que emite recomendaciones sin objetivo escrito no tiene política, tiene opiniones.
Actuación
La acción se ejecuta sobre actuadores reales, con saturación, zona muerta, histéresis, desgaste y retardo. Tres exigencias se olvidan casi siempre. La primera es la confirmación: escribir una consigna no es actuar; actuar es escribir y verificar en la señal medida que el equipo la aceptó y la ejecutó. La segunda es la autoridad: toda acción tiene un titular, alguien que la aprueba, alguien que puede revertirla y unos enclavamientos bajo los cuales no se ejecuta nunca. La tercera es el registro: qué dato la disparó, con qué versión de regla o de modelo, quién supervisó, qué se escribió y qué respondió el equipo.
Qué cambia frente a un PID y frente a un sistema experto
Un PID es un caso particular degenerado del bucle, y por eso funciona tan bien donde funciona. Su percepción es el error sobre una sola variable medida, sin estimación de estado. Su razonamiento es una ley lineal fija con tres parámetros ajustados en la puesta en marcha, sin modelo explícito del proceso y sin restricciones. Su acción es una salida sobre un actuador. Su horizonte es implícito y muy corto: reacciona al error ya producido, no anticipa. Y su adaptación es nula salvo resintonía manual. Nada de eso es un defecto, es su diseño, y sigue siendo la herramienta correcta para el lazo regulatorio. La IA física no sustituye al PID: vive por encima de él y le fija consignas.
Frente a un sistema experto la diferencia es otra. En el sistema experto el conocimiento lo escribe una persona una vez, y el cuello de botella clásico es precisamente ese: alguien tiene que enunciar cada regla. Además es determinista y categórico, mientras que la estimación de estado es probabilística y entrega una distribución. Y hay una diferencia que importa en planta: el sistema experto no sabe que no sabe. Ante un caso no contemplado, o no dispara ninguna regla o dispara la equivocada; un estimador con incertidumbre puede declarar baja confianza y ceder el control. Lo que el sistema experto hace mejor es ser auditable, explicable y reproducible, y por eso las capas de seguridad y los enclavamientos siguen siendo reglas y deben seguir siéndolo aunque la política sea aprendida.
De todo lo anterior sale el criterio que se usará en el resto del artículo: el bucle solo está cerrado si se mide el efecto de la acción. Si el efecto no se mide, no hay bucle cerrado: hay un recomendador. Esa frase es la que separa el nivel 2 del nivel 3 en toda la rúbrica.
Los horizontes de decisión y dónde vive el cómputo
Una planta no toma un tipo de decisión, toma cuatro, y cubren nueve o diez órdenes de magnitud en tiempo. La regla que las ordena tiene dos partes: el cómputo vive en el nivel más alto que cumpla la latencia y que permita al nivel inferior seguir degradando de forma segura si el superior desaparece.
En el lazo regulatorio, de microsegundos a milisegundos, se decide la conmutación del convertidor, la corriente y el par del motor, la interpolación de ejes y los enclavamientos de seguridad. Lo resuelven el variador, el CNC y el autómata, sin intervención humana. El white paper de 5G-ACIA y ZVEI (noviembre de 2019) sitúa los tiempos de ciclo habituales de la comunicación industrial periódica entre 10 ms y 0,5 ms. La restricción dominante no es el ancho de banda sino el determinismo: importa más el jitter que la media. Ese cómputo vive en el propio controlador, dentro del armario, y nunca al otro lado de una red no determinista.
En la supervisión, de 100 milisegundos a segundos, viven las alarmas, la detección de anomalía, el arranque y la parada de secuencia, la inspección de calidad en línea y la clasificación de parada. La restricción es distinta: tiene que seguir funcionando sin enlace hacia fuera de la planta. Por eso vive en el edge, en un gateway o en un PC industrial, con buffer local obligatorio. La optimización de turno, de minutos a horas, reprograma la secuencia, ajusta receta, mueve consumo energético o decide parar para mantenimiento; necesita cruzar producción, energía, calidad y mantenimiento, así que vive en la plataforma y tolera ida y vuelta por red. Y la planificación, de días a meses, decide capacidad, plan de mantenimiento, contratación de energía e inversión; necesita histórico largo y comparable, y es donde vive el entrenamiento de modelos, que nunca debe estar en el camino crítico de una decisión rápida.
La frontera que más se viola en la práctica es la primera: intentar cerrar un lazo de milisegundos a través de una plataforma. No falla por ancho de banda, falla por varianza del retardo. Y hay una segunda condición, menos visible, que es la del reloj. El mismo white paper de 5G-ACIA y ZVEI (noviembre de 2019) señala que el dominio de reloj de trabajo, donde se sitúan robots y control de movimiento, exige una sincronización igual o mejor que 1 microsegundo, con tendencia a 100 nanosegundos. La norma que lo resuelve es IEEE 1588-2019, el protocolo de sincronización de precisión aprobado por la IEEE Standards Association el 7 de noviembre de 2019, y el perfil de red determinista para automatización industrial, IEC/IEEE 60802, se publicó el 29 de junio de 2026 según el grupo de trabajo TSN de IEEE 802.1. Es decir: la infraestructura de tiempo que un bucle rápido necesita ya es norma publicada, no borrador.
Por qué empieza por los datos: el sustrato de cada nivel
Cada peldaño de la escalera exige un sustrato de dato distinto, y los requisitos son acumulativos: el nivel 3 necesita todo lo del 2 más lo suyo. Enunciarlos por separado evita la conversación estéril sobre cuántos datos hacen falta, que nunca tiene respuesta, y la sustituye por seis preguntas que sí la tienen: con qué frecuencia, con qué exactitud de reloj, con qué contexto, con qué completitud, durante cuánto tiempo y bajo qué gobierno.
En el nivel 1 no existe una frecuencia global, se fija por variable. Los estados discretos de máquina se capturan por evento con resolución de un segundo o mejor, porque una microparada de ocho segundos desaparece por completo si se sondea cada treinta y con ella desaparece la mayor pérdida de disponibilidad de muchas líneas. Los contadores, por evento o por flanco, nunca por diferencia de sondeos lentos. Las variables de proceso lentas aguantan bien un segundo. La potencia eléctrica para gestión energética pide un segundo para ver la firma de arranque y los picos: el agregado de facturación de quince minutos sirve para la factura y no sirve para explicar nada. Y la vibración para diagnóstico, si la banda de interés llega a decenas de kilohercios, ni se transmite en continuo ni hace falta: el espectro se calcula en el borde y lo que sube es el indicador con su ventana.
La marca de tiempo se pone en origen, lo más cerca posible del sensor, y nunca en el instante de ingesta. Con decenas de milisegundos de exactitud basta para OEE, energía y análisis de turno; para ordenar causalmente eventos entre equipos distintos, es decir para responder qué se disparó primero cuando la cascada de fallo dura menos de un segundo, hace falta milisegundo o mejor. Sin reloj común, el histórico permite contar pero no permite explicar. El contexto mínimo que viaja con cada valor es igual de concreto: identidad estable del activo (no la dirección del registro), magnitud y unidad, escala y rango, calidad del dato y versión de la definición de la señal. Y la completitud se mide por canal y por periodo, nunca en global, porque un 99 % agregado esconde un canal caído entero.
En el nivel 2 aparece un contexto que no es técnico sino de negocio, y es el que más proyectos hunde: orden y lote, producto o receta, turno y calendario de turnos, tiempo planificado, velocidad nominal del producto en curso, piezas buenas, rechazos, retrabajos y motivo de parada tomado de un catálogo cerrado. Sin velocidad nominal por producto no hay rendimiento, y sin rendimiento no hay OEE. En el nivel 3 el requisito cambia de naturaleza otra vez: ya no basta con latencia baja, hace falta latencia acotada y medida, cada acción declara la edad máxima que puede tener el dato que la justifica, y existe un registro inmutable de la decisión con su efecto posterior. Y en el nivel 4 la completitud deja de ser un porcentaje de muestras y pasa a ser cobertura de la distribución: diez mil repeticiones del caso normal no cubren el caso raro que decide si el sistema es desplegable.
Ese es el motivo por el que en una fábrica la IA física empieza por los datos, y no es un argumento comercial: es que la captura es la única parte del bucle que, si falta, invalida a las otras dos. El punto de partida de la industria española lo cuantifican tres fuentes recientes. Metalindustria (22 de mayo de 2026), recogiendo el III Barómetro de la digitalización y automatización industrial en España presentado en Advanced Factories 2026, cifra en un 3,3 % las fábricas que se declaran totalmente digitalizadas. El INE, en los datos definitivos de su encuesta sobre uso de TIC en las empresas del primer trimestre de 2025 (publicados el 22 de octubre de 2025), sitúa en el 21,1 % las empresas de 10 o más empleados que usan inteligencia artificial, y la Fundación Cotec (misma fecha) precisa que la industria se queda en el 17,5 %. Para comparar, Eurostat (11 de diciembre de 2025) da un 20,0 % en el conjunto de la UE, con Dinamarca en el 42,0 % y Finlandia en el 37,8 %.
La fotografía de la automatización previa apunta en la misma dirección. Según World Robotics 2025 de la International Federation of Robotics (septiembre de 2025), España instaló 5.086 robots industriales en 2024, un 1 % más, y adelantó a Francia como tercer mercado europeo por detrás de Alemania (26.982) e Italia (8.783). La densidad media mundial en manufactura fue de 177 robots por cada 10.000 empleados, con Europa en 148. En la nota de la IFR del 8 de abril de 2026, Corea del Sur lidera con 1.220 y Alemania alcanza 449. Un parque robotizado no es lo mismo que una planta conectada, pero da la escala del punto de partida: hay mucha máquina capaz de generar dato y poca planta capaz de usarlo.
Hay además un argumento económico que hace innecesario esperar al final. Conectar los equipos existentes y convertir sus señales en indicadores en tiempo real produce valor por sí mismo: paradas que se ven, consumos que se corrigen, calidad que se traza. Es la base del único resultado que Captia publica: más del 30 % de ahorro energético en empresas electrointensivas. Cada nivel que se sube se paga solo y deja la planta preparada para el siguiente.
La escalera de la IA física, nivel a nivel
La escalera de la IA física es el marco con el que ordenamos ese camino. Cinco niveles definidos por lo que la planta puede hacer con el dato, no por la tecnología que compra. Cada uno tiene criterios observables en una visita a planta, una señal que confirma que estás ahí y un siguiente paso concreto.
| Nivel | Qué puede hacer la planta con el dato | Señal de que estás ahí | Siguiente paso |
|---|---|---|---|
| 0 Aislada | Nada comparable: el dato vive en cada máquina y se lee en pantalla o en papel. | Para saber cuánto produjo una línea ayer hay que preguntar al turno o buscar un parte. | Inventariar equipos y señales y decidir qué se captura primero. |
| 1 Conectada | Ver el mismo dato desde un solo sitio, con hora y contexto, para todos los equipos. | Cualquier señal de planta se consulta desde el navegador con su histórico. | Convertir señales en indicadores: OEE, energía, paradas, calidad. |
| 2 Consciente | Saber qué pasa ahora en cada línea y por qué: indicadores y alertas en tiempo real. | La reunión de la mañana se hace sobre la pantalla, no sobre hojas de cálculo. | Cerrar el bucle: que el sistema proponga o ejecute acciones acotadas. |
| 3 Actuante | Decidir y ejecutar con supervisión: reglas, workflows, consignas de energía, órdenes de mantenimiento. | Una alerta abre una orden de trabajo o cambia una consigna sin que nadie la copie a mano. | Añadir percepción y autonomía donde el dato y el proceso ya lo aguantan. |
| 4 Física | Percibir, razonar y actuar de forma autónoma sobre el mundo real: robots, visión, agentes. | Sistemas que operan sobre la planta con supervisión por excepción. | Ampliar el alcance con los mismos cimientos: dato, contexto y trazabilidad. |
La escalera se usa de dos maneras. Como diagnóstico: se recorre la columna de señales y el primer nivel cuya señal no se cumple es el nivel real de la planta, aunque tenga un piloto brillante dos peldaños más arriba. Y como plan: la columna de siguiente paso dice qué hay que resolver antes de invertir en el peldaño siguiente. La regla de puntuación es estricta a propósito: un nivel se considera alcanzado cuando se cumplen sus criterios y los de todos los niveles inferiores. No se salta. Una planta puede tener líneas en niveles distintos; en ese caso se sitúa por la línea que arrastra al resto, no por la mejor.
Nivel 0: Aislada
El dato existe, pero vive en cada máquina. Se lee en la pantalla del panel o se apunta en un parte. No hay histórico comparable entre equipos ni una hora común, y la planta funciona por la experiencia de las personas, que es valiosa pero no se puede escalar ni auditar. Los criterios observables son incómodamente concretos: pedir el número de paradas de una línea el martes pasado sin abrir la interfaz de la máquina y ver qué ocurre; localizar el cuaderno o la hoja de cálculo del parte de turno y a la persona que lo custodia; comprobar en la misma reunión si dos personas dan dos cifras distintas de producción del mismo turno; y presenciar un cambio de turno para ver cómo se leen y se transcriben los contadores.
La señal de que estás aquí: para saber cuánto produjo una línea ayer hay que preguntar al turno o buscar un parte. El siguiente paso es el inventario de equipos, señales disponibles, protocolos que hablan y responsable de cada dato. No es un proyecto de software, es un trabajo de campo.
Nivel 1: Conectada
Los equipos hablan un lenguaje común y el dato llega a un solo sitio con hora y contexto. Se resuelve con protocolos industriales, una capa edge que aguanta cortes de red y un modelo de datos normalizado. Los criterios que se pueden verificar en una visita son cinco: existe una lista de señales con activo, unidad y frecuencia, mantenida por alguien con nombre y con fecha de última modificación; el dato de dos equipos distintos se puede representar en el mismo gráfico sobre el mismo eje de tiempo, y se comprueba haciendo la consulta en directo; los relojes están sincronizados y la desviación se puede medir viendo un mismo evento desde dos sistemas; se mide la disponibilidad del dato por canal, con un panel de huecos y no con la afirmación de que no hay huecos; y la captura sobrevive a la caída del enlace y luego rellena, lo que se demuestra enseñando una laguna reciente ya rellenada con su fecha.
La señal: cualquier señal de planta se consulta desde el navegador con su histórico, sin exportar nada. En la plataforma de Captia este nivel lo cubre Captia Connect. Si quieres el concepto sin producto, la referencia es la guía de qué es una plataforma de datos industriales y las piezas sobre unified namespace, historian industrial y buffering en el edge.
Nivel 2: Consciente
La planta sabe qué pasa. OEE, energía, paradas y calidad se calculan en tiempo real por línea y se comparan entre turnos y días. Los criterios observables se centran en la defendibilidad del número: el OEE se calcula a partir de dato capturado y no de introducción manual, y existe una definición escrita única con el origen declarado de cada término; las paradas llevan motivo y el porcentaje de tiempo «sin clasificar» es conocido y bajo, lo que se comprueba mirando el reparto de motivos del último mes; el operador de línea y la dirección miran el mismo número, y se verifica comparando en el momento la pantalla de línea y el informe mensual; la energía se puede imputar a línea o a producto y no solo a la factura; y alguien tomó una decisión concreta con ese dato en las últimas semanas, con fecha y responsable.
La señal: la reunión de la mañana se hace sobre la pantalla y no sobre hojas de cálculo, y las discusiones son sobre causas y no sobre cifras. Aquí trabajan los módulos de análisis y alertas de Captia.ai. La definición de OEE que sostiene todo esto está desarrollada en la guía de OEE.
Nivel 3: Actuante
El sistema decide y ejecuta con supervisión. Reglas que abren una orden de mantenimiento, workflows que escalan una incidencia, consignas de energía que se ajustan a la demanda, secuencias que se reordenan. Los criterios son los más exigentes de los tres primeros niveles: existe al menos una acción que el sistema propone o ejecuta y que queda registrada con su resultado medido; hay un supervisor identificado y un camino de reversión que ya se ha usado de verdad, con su registro; está definido y probado qué hace el sistema cuando el dato falta o está rancio; el efecto se mide contra una referencia declarada, antes y después o contra una línea de control; y los cambios de regla o de modelo pasan por versionado y aprobación, con historial y aprobador.
La señal: una alerta produce una acción sin que nadie la copie a mano en otro sistema, y existe el registro del efecto que tuvo. Es el bucle cerrado con workflows, Energy y Service dentro de la plataforma. Dos capacidades de este nivel se apoyan en piezas propias: mantenimiento predictivo e inspección visual con IA, que en cuanto disparan una acción registrada dejan de ser analítica y pasan a ser bucle.
Nivel 4: Física
Percibir, razonar y actuar de forma autónoma sobre el mundo real. Es el estado del arte del sector y se describe aquí en tercera persona: robots que modifican su plan a partir de lo que perciben en vez de ejecutar una trayectoria fija, políticas evaluadas cuantitativamente sobre casos que no estaban en el entrenamiento, envolventes de seguridad independientes del modelo aprendido, episodios de fallo reproducibles y una métrica de deriva con un umbral que dispara revisión. Esos cinco criterios son los que habría que poder demostrar, y sirven para leer con criterio cualquier demostración pública. Solo son alcanzables con los niveles 1 a 3 resueltos: sin dato conectado no hay percepción fiable, sin indicadores no hay verdad de referencia contra la que evaluar y sin bucle supervisado no hay pares de acción y efecto.
Cómo se sube de nivel: qué falla en cada transición
Los proyectos no fracasan por el peldaño en el que están, fracasan en la transición. Y el síntoma se parece siempre, mientras que la causa no. Enunciar la causa raíz técnica de cada transición es lo que permite resolverlas en orden.
De 0 a 1: el alcance se elige mal
El fallo más caro es conectar lo fácil y dejar fuera lo que importa: se integran los equipos que ya hablaban un protocolo cómodo y queda fuera la máquina antigua que causa la mitad de las paradas. La causa raíz es que el alcance se eligió por disponibilidad de protocolo y no por relevancia del activo, y el resultado es un histórico completo de lo que no falla. Los otros cuatro fallos de esta transición son técnicos y conocidos: llegan miles de señales con nombres que replican el direccionamiento del autómata, porque se copió la estructura del PLC en vez de modelar el activo; la marca de tiempo la pone el gateway al recibir, de modo que cualquier retención de red destruye el orden causal justo en los momentos de fallo, que es cuando la red va peor; se sondea periódicamente donde hacía falta captura por evento, y las microparadas desaparecen; y el tráfico de gestión se mete en la red de control, lo que aparece como paradas intermitentes sin causa aparente y quema la confianza en el proyecto entero. El orden de resolución es: relevancia del activo primero, modelo semántico segundo, reloj y captura por evento tercero, segmentación de red como condición previa a todo. La ingeniería completa de esta transición está en la pieza sobre cómo conectar los PLC que ya tienes.
De 1 a 2: hay dato y no hay pregunta
Se despliegan cuadros de mando que nadie abre a las tres semanas, porque se instrumentó primero y se definió el indicador después, así que los paneles responden a lo que era fácil de graficar. Después llegan los problemas de definición: dos OEE en la misma empresa por definiciones distintas de tiempo planificado, de velocidad nominal y de qué cuenta como rechazo; una velocidad nominal de catálogo en vez de la real del producto en curso, con lo que el rendimiento deja de correlacionar con nada; motivos de parada que son mayoritariamente «otros», porque el catálogo está mal dimensionado y se pide clasificar a quien no obtiene ninguna ventaja de clasificar bien; y horas locales mezcladas en los agregados, que dos veces al año producen turnos de 23 y de 25 horas y rompen los comparativos interanuales sin que nadie lo note. El orden de resolución invierte el instinto: primero la pregunta y la definición escrita, después el panel. Las capas de contexto, el modelo de activos y las trampas del OEE en tiempo real se desarrollan en la pieza sobre la planta que sabe qué le pasa.
De 2 a 3: se cierra el bucle sin medir el efecto
Es el fallo que define la transición: nadie definió línea base ni comparación, así que nadie puede decir si mejoró y la discusión la decide quien tiene más rango. A su lado hay cuatro más: latencia variable en el camino de la acción, porque el lazo pasa por una plataforma con colas y reintentos, y el síntoma se atribuye al algoritmo cuando es del transporte; actuación sin comportamiento seguro por defecto, porque no se declaró la edad máxima del dato; fatiga de alarmas, porque el umbral se calibró para no perder ningún caso y el coste de un falso positivo no es cero, es la atención del operador; y choque de responsabilidades, porque escribir una consigna toca a mantenimiento, a producción y a seguridad, y sin un titular de la acción el proyecto se queda indefinidamente en piloto. El orden: titular de la acción y camino de reversión antes que nada, después línea base, después cota de latencia, y solo entonces ampliar el catálogo de acciones. El desarrollo completo de esta transición está en la pieza sobre cómo se cierra un bucle industrial con supervisión.
De 2 a 4: el salto que se intenta y no funciona
Es el modo de fallo más caro. Se compra robot, visión autónoma o un agente que actúa, montado sobre una planta que está en nivel 2. La demostración funciona y el despliegue no: en condiciones controladas, con la pieza y la iluminación de la demo, el sistema cumple; en producción, con variabilidad de material, de luz y de referencia, se degrada. La causa raíz es que la política se validó sobre una distribución que no es la de la planta, y no se puede corregir, porque corregir requiere el registro de pares de observación, acción y resultado, que es exactamente lo que produce el nivel 3 y que aquí no existe. Después nadie detecta la degradación, porque medir el efecto de la acción es una capacidad del nivel 3 y sin ella no hay métrica de deriva; el gemelo o el simulador se construyen sin dato de planta, así que sus parámetros no corresponden a la máquina real; y cuando el sistema encuentra un caso que no sabe resolver no hay a quién devolver el control, porque la supervisión se pensó como una pantalla y no como una arquitectura.
Formulado en corto: el nivel 4 no es un producto que se instala encima del nivel 2, es lo que se puede intentar cuando los niveles 1, 2 y 3 existen, porque cada uno de ellos produce algo que el 4 consume. Para situar tu planta con criterio, el índice de preparación para IA física recorre estos criterios uno a uno, y el test de madurez digital da una primera aproximación en diez preguntas.
El estado del arte y por qué no se salta al nivel 4
El nivel 4 se explica aquí como estado del arte del sector, en tercera persona y con las fuentes en el texto. Merece explicarse en profundidad por dos razones: porque es donde está el dinero y el ruido, y porque entender cómo funciona por dentro es lo que permite ver por qué necesita los tres niveles anteriores.
Modelo predictivo frente a modelo del mundo
Los niveles 2 y 3 usan modelos predictivos: funciones que van de un vector de características a una salida acotada, como la probabilidad de fallo de un rodamiento en siete días o la clase del defecto en una imagen. No representan la dinámica del proceso, no contienen acciones y por tanto no responden a qué pasaría si se hiciera otra cosa. Un modelo del mundo sí aprende la dinámica: dado un estado latente y una acción, cuál es el siguiente estado y qué observación se espera, con su incertidumbre. El paper de la plataforma Cosmos de NVIDIA (arXiv 2501.03575, 7 de enero de 2025) lo define como un modelo del mundo de propósito general que puede afinarse en modelos del mundo especializados. NVIDIA presentó Cosmos en el CES el 6 de enero de 2025 y publicó Cosmos 3 el 31 de mayo de 2026 según su sala de prensa, con los pesos de las variantes Super y Nano bajo licencia abierta.
La consecuencia técnica es la que importa a una fábrica: un modelo del mundo necesita dato de acciones, no solo de observaciones. Un histórico que contiene variables de proceso pero no registra las intervenciones es dato puramente observacional: permite aprender qué suele pasar, no qué pasa si intervengo. Este es el motivo por el que el nivel 3 es prerrequisito del 4 y no un peldaño decorativo. El tratamiento largo de esta cuestión, con la comparación entre las familias de modelos y sus límites conocidos, está en la pieza sobre modelos del mundo y IA física.
Políticas visión-lenguaje-acción
El término lo fija RT-2 de Google DeepMind (arXiv 2307.15818, 28 de julio de 2023), que propone expresar las acciones como tokens de texto e incorporarlas directamente al conjunto de entrenamiento. Desde entonces la arquitectura dominante separa dos velocidades. NVIDIA describe Isaac GR00T N1 (arXiv 2503.14734, 18 de marzo de 2025) con un sistema de visión y lenguaje que razona y un transformador de difusión que genera acciones, entrenado sobre una mezcla heterogénea de trayectorias de robot reales, vídeo humano y datos sintéticos. Figure describe Helix (20 de febrero de 2025) con la misma separación y da los números: la política reactiva corre a 200 Hz, es decir cinco milisegundos por ciclo, y el razonamiento semántico a 7-9 Hz. Google DeepMind publicó Gemini Robotics 1.5 el 25 de septiembre de 2025 separando la acción del razonamiento encarnado, y Gemini Robotics 2 el 30 de julio de 2026, con control de cuerpo completo, una variante que corre en el propio dispositivo y adaptación a una morfología nueva con, según la compañía, unas pocas horas y menos de doscientos ejemplos.
Los límites que importan en una fábrica son cuatro. La frecuencia de inferencia acota el ancho de banda de control alcanzable, así que una política de este tipo se apoya sobre el lazo de milisegundos y no lo sustituye. La salida es probabilística, de modo que por debajo hace falta una envolvente de seguridad determinista que no dependa del modelo. El comportamiento fuera de distribución es difícil de acotar formalmente, y eso choca de frente con los requisitos de certificación de una celda compartida con personas. Y, sobre todo, una política de este tipo no resuelve el problema de saber en qué estado está la planta: consume percepción y la convierte en movimiento dentro de una tarea acotada.
La brecha entre simulación y planta es un problema de distribución
La explicación popular dice que la simulación falla porque no es suficientemente realista. La formulación correcta es otra. El trabajo de revisión sobre la brecha de realidad en robótica (arXiv 2510.20808, 23 de octubre de 2025, publicado también en el Annual Review of Control, Robotics, and Autonomous Systems de 2026) la atribuye a las abstracciones y aproximaciones que todo simulador introduce inevitablemente. Una política entrenada en simulación optimiza bajo la distribución de estados que induce el simulador, y al desplegarla encuentra otra. El agravante es propio del control: la política determina qué estados visita, así que un error pequeño la lleva a estados poco representados donde comete un error mayor, que la lleva más lejos todavía.
Las fuentes del desvío son varias y solo una es visual: parámetros dinámicos mal identificados como fricción, inercias, holguras, elasticidad, retardos y saturación del actuador; ruido, resolución y latencia de los sensores, que en simulación suelen ser ideales; el contacto y la deformación; y sí, también la apariencia. La técnica canónica para cruzarla es la aleatorización del dominio, definida por Tobin y otros (arXiv 1703.06907, 20 de marzo de 2017) como entrenar con imágenes simuladas que transfieren a imágenes reales aleatorizando el renderizado. Las otras dos son identificar el sistema con dato real para centrar la familia de parámetros y ajustar con episodios reales. Las tres requieren dato medido de la planta, y aquí reaparece el nivel 1: un retardo mal caracterizado se aprende como una dinámica que no existe.
De dónde sale el dato del nivel 4
La respuesta del sector tiene tres patas. La primera es la teleoperación: Open X-Embodiment (arXiv 2310.08864, 13 de octubre de 2023) agregó datos de 22 robots distintos recogidos por 21 instituciones, con demostraciones de 527 habilidades, y los modelos entrenados sobre ese conjunto muestran transferencia entre morfologías. La segunda es la mezcla heterogénea que ya describía GR00T N1: trayectorias reales, vídeo humano y datos sintéticos generados con modelos del mundo. La tercera es el coentrenamiento sobre tareas heterogéneas, que Physical Intelligence usa en pi-0.5 (arXiv 2504.16054, 22 de abril de 2025) para conseguir generalización a mundo abierto. Ninguna de las tres se parece a un histórico de planta, y esa es exactamente la cuestión: el histórico de planta sirve para la percepción, para identificar la dinámica en el rango de operación visitado y para definir la envolvente de operación normal, pero no basta por sí solo para aprender una política, porque no contiene las acciones alternativas ni sus resultados.
Qué hay realmente desplegado
Conviene leer las demostraciones con la misma exigencia con la que se lee un indicador. Siemens anunció el 16 de abril de 2026, en nota de prensa oficial, una prueba con el robot HMND 01 Alpha de Humanoid en su fábrica de electrónica de Erlangen, sobre la pila de IA física de NVIDIA: desapilado de contenedores en logística interna, con 60 movimientos por hora, más de ocho horas de disponibilidad y una tasa de éxito de manipulación autónoma superior al 90 %. Es una prueba de concepto y la propia nota lo dice. BMW anunció el 27 de febrero de 2026, en su sala de prensa, el primer piloto europeo de humanoides en su planta de Leipzig con el robot AEON de Hexagon, con fase piloto real desde el verano de 2026, y el 25 de junio de 2026 el uso de Figure 03 en Spartanburg para secuenciación de componentes en logística, sin etiquetarlo como producción plena. Figure, por su parte, publicó el 19 de noviembre de 2025 que su robot 02 completó en Spartanburg un despliegue de diez meses con más de 1.250 horas y más de 90.000 piezas: son cifras del proveedor, no auditadas por terceros.
El contraste financiero ayuda a calibrar. The Robot Report publicó el 7 de septiembre de 2026 que Agility Robotics declaró 1,8 millones de dólares de ingresos y 140 millones de pérdida operativa en 2025, en el contexto de su salida a bolsa mediante una fusión anunciada el 24 de junio de 2026 con una valoración previa de 2.500 millones. Es el único fabricante de humanoides con cuentas públicas, y muestra la distancia entre valoración e ingresos del sector. Mientras tanto, la robótica industrial convencional sigue creciendo a su ritmo: la IFR (septiembre de 2025) contabiliza 542.000 instalaciones en 2024 y un parque operativo de 4.664.000 unidades, y prevé 575.000 instalaciones en 2025 y superar las 700.000 en 2028. En España, el ecosistema de robótica humanoide e IA física se agrupó en la asociación ÁNIMA, impulsada por AFM Cluster y AER Automation, según Automática e Instrumentación (4 de septiembre de 2026).
La lectura conjunta es la que ordena la escalera. Lo que está desplegado en producción plena es automatización clásica y robótica programada. Lo que está en piloto son tareas de logística interna acotadas, en plantas que llevan años con su dato resuelto. Y lo que se vende como inminente es una capacidad que exige percepción fiable, verdad de referencia y pares de acción y efecto, es decir los niveles 1, 2 y 3. El recorrido completo de esa ola, con las rondas de financiación, los despliegues verificables y lo que cada fuente dice y no dice, está en el informe sobre la ola de la IA física en la industria.
Qué hace una plataforma de datos industriales
Los niveles 1 a 3 son los que cubre una plataforma de datos industriales, y conviene decir con precisión qué hace cada capa. El orden es válido con cualquier herramienta; los nombres son los de la plataforma de Captia.
- Nivel 1, captura: Captia Connect. Una capa edge junto a los equipos que lee Modbus, OPC UA, MQTT y el resto de protocolos de planta, pone la marca de tiempo en origen, normaliza el dato con su unidad, su activo y su calidad, lo guarda en local si cae la red y lo envía de forma segura cuando vuelve. Sin tocar la lógica del PLC ni los enclavamientos de seguridad. La comparación entre las dos familias de protocolo está en OPC UA frente a MQTT, y el trabajo de dar significado al dato en contextualización de datos industriales.
- Nivel 2, conciencia: Captia.ai. Sobre el histórico consolidado se calculan OEE, energía, paradas y calidad por línea, con pantallas web multiusuario y alertas por rol. Los módulos de análisis, detección de anomalías, mantenimiento predictivo y previsión, trabajan sobre ese mismo histórico; sin él no hay modelo que entrenar ni verdad de referencia contra la que evaluarlo. La interfaz de operación se explica en SCADA web.
- Nivel 3, bucle cerrado: reglas, workflows, Energy y Service. Reglas y workflows que convierten una alerta en una acción, consignas energéticas que se ajustan a la demanda y órdenes de mantenimiento que nacen del dato. Con un catálogo cerrado de acciones, edad máxima declarada del dato que las justifica, aprobación humana para las de mayor impacto, camino de reversión probado y registro del efecto medido.
Lo que una plataforma así no hace es igual de importante: no sustituye al control, no toca los enclavamientos y no cierra lazos de milisegundos. Vive por encima del lazo regulatorio, le fija consignas y le devuelve restricciones, y deja que cada horizonte de decisión siga funcionando cuando el de arriba desaparece.
Marco normativo europeo
El calendario del Reglamento europeo de inteligencia artificial está publicado por la Comisión Europea en su servicio de apoyo al AI Act, consultado en septiembre de 2026: entró en vigor el 1 de agosto de 2024, las prohibiciones y disposiciones generales se aplican desde el 2 de febrero de 2025, las reglas de propósito general y gobernanza desde el 2 de agosto de 2025 y la aplicación general desde el 2 de agosto de 2026. Los plazos que afectan a la industria son posteriores por el paquete Digital Omnibus: las reglas para los sistemas de alto riesgo del Anexo III se aplican el 2 de diciembre de 2027, y las de la IA embebida en productos regulados del Anexo I, donde entra la maquinaria, el 2 de agosto de 2028. En paralelo, el Reglamento (UE) 2023/1230 de máquinas, adoptado el 14 de junio de 2023 y aplicable desde el 20 de enero de 2027 según la ficha de EU-OSHA, sustituye a la Directiva 2006/42/CE. La planificación prudente usa esa fecha de 2027 para la IA embebida en máquinas, porque las propuestas sectoriales de aplazamiento se limitan hoy a la ciberseguridad.
Junto al marco horizontal están las normas técnicas que un proyecto de nivel 3 ya toca. ISO publicó en febrero de 2025 las nuevas ISO 10218-1:2025, de requisitos de seguridad para el fabricante del robot, e ISO 10218-2:2025, para el integrador de la célula; según The Robot Report (18 de febrero de 2025), la revisión integra los requisitos de aplicación colaborativa que antes vivían en la especificación técnica ISO/TS 15066. En ciberseguridad, la serie ISA/IEC 62443 define los requisitos para sistemas de automatización y control industrial en cuatro grupos, de la terminología a los requisitos de componente, y su parte IEC 62443-2-1:2024, de agosto de 2024, fija el programa de seguridad del propietario del activo con un modelo de madurez. Para la interoperabilidad de robótica, la especificación complementaria OPC 40010-1 en su versión 1.02, publicada por la OPC Foundation el 8 de septiembre de 2025, modela manipuladores, ejes, motores y controladores para gestión de activos y para integración vertical con MES y nube. La lectura práctica para una planta es que los cimientos de dato, reloj y trazabilidad que exigen los niveles 1 a 3 son los mismos que estas normas van a pedir documentados.
Errores comunes al empezar
Los proyectos que se quedan en piloto suelen compartir alguno de estos ocho errores. Ninguno es tecnológico: todos son de orden.
- Empezar por el nivel 4. Comprar un robot colaborativo o una cámara con IA para una planta que todavía apunta las paradas en papel. El piloto funciona en la demo y muere en producción porque no hay dato con el que integrarlo ni proceso que lo aproveche.
- Sustituir en vez de conectar. Cambiar PLC y máquinas que funcionan para tener equipos «compatibles con IA». El parque existente ya percibe y ya actúa; lo que falta es sacar el dato, y eso se hace con los protocolos que ya habla.
- Confundir dashboard con conciencia. Una pantalla con indicadores que nadie actualiza o que no comparten hora con el resto de sistemas es nivel 0 con mejor aspecto. El nivel 2 exige dato en tiempo real y comparable entre líneas y turnos.
- Elegir el alcance por protocolo y no por activo. Se conecta lo que era fácil y queda fuera la máquina que causa la mitad de las paradas. El resultado es un histórico impecable de lo que no falla.
- Poner la marca de tiempo en la ingesta. El sello lo pone el gateway al recibir, así que cualquier retención de red desplaza los eventos y destruye el orden causal justo cuando hay un fallo, que es cuando la red va peor.
- Cerrar el bucle sin límites y sin medida. Dejar que un sistema cambie consignas o cree órdenes sin catálogo de acciones autorizadas, sin edad máxima del dato, sin aprobación para las de impacto y sin medir el efecto. La autonomía se gana con historial de aciertos, no se concede el primer día.
- No nombrar un responsable del dato. Sin alguien que responda de que cada señal es correcta, tiene contexto y se mantiene, el histórico se degrada y cualquier modelo que se apoye en él razona sobre ruido. La causa más común de que un histórico de tres años no sirva no es técnica: es que alguien renombró o reescaló un tag y no quedó registrado.
- Medir el proyecto por la tecnología y no por lo que la planta puede hacer. «Tenemos IA» no es un resultado. «La línea 2 abre sus órdenes de mantenimiento sola y las paradas por avería bajaron frente a la línea base del trimestre anterior» sí lo es. La escalera está pensada para medir eso.
Preguntas frecuentes sobre IA física
¿Qué es la IA física?
La IA física es la que percibe, razona y actúa sobre el mundo real. En una fábrica empieza por capturar bien el dato de los equipos que ya existen. A diferencia de la IA que solo genera texto o imágenes, cierra un bucle con el entorno: lee sensores y máquinas, decide y ejecuta una acción que cambia algo en la planta, con supervisión humana en el grado que cada proceso exige.
¿Qué diferencia hay entre IA física e IA generativa?
La IA generativa produce contenido (texto, código, imágenes) a partir de una petición y se queda en la pantalla. La IA física trabaja sobre señales del mundo real y termina en una acción sobre él: una consigna, una orden, un movimiento. Pueden combinarse (un agente puede usar un modelo de lenguaje para razonar), pero lo que define a la IA física es el bucle percibir, razonar, actuar sobre el entorno, y que el efecto de la acción se mide.
¿Necesito robots para la IA física?
No para empezar. Los robots y la visión autónoma son el último nivel de la escalera, no el primero. Antes hay tres niveles que no requieren ningún hardware nuevo: conectar los equipos existentes, saber qué pasa en cada línea en tiempo real y cerrar el bucle con reglas y workflows supervisados. La mayoría del valor y del esfuerzo está en esos tres niveles.
¿Puedo hacer IA física con los PLC que ya tengo?
Sí. Un PLC en servicio ya percibe (entradas de sensores) y ya actúa (salidas a actuadores). Lo que falta casi siempre es sacar ese dato con hora y contexto a una capa común, sin tocar la lógica de control ni los enclavamientos de seguridad. Se lee con los protocolos que el PLC ya habla (Modbus, OPC UA, MQTT) y se construye encima. Sustituir el parque no es un requisito.
¿Qué es la escalera de la IA física?
Es un marco de cinco niveles para situar una planta según lo que puede hacer con su dato, no según la tecnología que compra: 0 Aislada, 1 Conectada, 2 Consciente, 3 Actuante y 4 Física. Cada nivel tiene criterios observables en una visita a planta, una señal que confirma que estás ahí y un siguiente paso concreto. Un nivel se considera alcanzado cuando se cumplen sus criterios y los de todos los niveles inferiores.
¿En qué nivel está la mayoría de las fábricas españolas?
Entre el 0 y el 1. Según Metalindustria (22 de mayo de 2026), que recoge el III Barómetro de la digitalización y automatización industrial en España presentado en Advanced Factories 2026, solo el 3,3 % de las fábricas se declara totalmente digitalizada. Y según el INE (22 de octubre de 2025), el 21,1 % de las empresas de 10 o más empleados usa inteligencia artificial; en la industria, la Fundación Cotec (misma fecha) sitúa el dato en el 17,5 %.
¿Qué necesita una pyme industrial antes de la IA física?
Tres cosas, en este orden: un inventario de equipos y señales con un responsable del dato; una capa de captura que lea los equipos existentes y guarde el dato con hora y contexto en un solo sitio; e indicadores en tiempo real (OEE, energía, paradas, calidad) sobre los que se pueda definir una regla y un workflow. Con eso hay base para cerrar el bucle y, más adelante, para percibir y actuar de forma autónoma.
¿Quién hace IA física para fábricas en España?
El nivel 4 (robots, humanoides, visión autónoma) lo desarrollan hoy grandes fabricantes y proveedores de plataformas robóticas. Los niveles 1 a 3, los cimientos, los cubren empresas de integración y plataformas de datos industriales. Captia Technology, con sede en Xàtiva, es una de ellas: su plataforma de datos industriales captura el dato de los equipos existentes (Captia Connect), lo convierte en indicadores y alertas (Captia.ai) y cierra el bucle con reglas, workflows y consignas supervisadas.
¿Qué es un modelo del mundo y en qué se diferencia de un modelo predictivo?
Un modelo predictivo va de un vector de características a una salida acotada: probabilidad de fallo, consumo previsto, clase del defecto. No contiene acciones, así que no responde a qué pasaría si hago otra cosa. Un modelo del mundo aprende la dinámica del entorno: dado un estado y una acción, cuál es el siguiente estado y qué observación se espera. Eso permite comparar acciones no ejecutadas y planificar dentro del modelo. El paper de la plataforma Cosmos de NVIDIA (arXiv 2501.03575, 7 de enero de 2025) lo define como un modelo del mundo de propósito general que puede afinarse en modelos del mundo especializados. La consecuencia práctica: un modelo del mundo necesita dato de acciones, no solo de observaciones.
¿Qué es una política visión-lenguaje-acción?
Es una política que toma imágenes y una instrucción en lenguaje natural y emite directamente acciones de bajo nivel. El término lo fija RT-2 de Google DeepMind (arXiv 2307.15818, 28 de julio de 2023), que trata las acciones como tokens de texto dentro del conjunto de entrenamiento. Las implementaciones actuales separan razonamiento y reacción: Figure describe Helix (20 de febrero de 2025) con un sistema reactivo a 200 Hz y un sistema de razonamiento semántico a 7-9 Hz. Esa frecuencia acota el ancho de banda de control alcanzable: una política de este tipo se apoya sobre el lazo de milisegundos, no lo sustituye.
¿Por qué falla el paso de la simulación a la planta?
Porque es un problema de distribución, no de realismo visual. El trabajo de revisión sobre la brecha de realidad en robótica (arXiv 2510.20808, 23 de octubre de 2025) lo atribuye a las abstracciones y aproximaciones que todo simulador introduce. Una política entrenada en simulación optimiza bajo la distribución de estados que induce el simulador, y al desplegarla encuentra otra. Además la política determina qué estados visita, así que un error pequeño la lleva a zonas poco representadas donde comete errores mayores. Las fuentes del desvío son la fricción, las inercias, las holguras, el retardo y el ruido de sensor, no solo la apariencia. Un simulador fotorrealista con la fricción equivocada sigue fallando.
¿Qué latencia y qué precisión de reloj hacen falta para cerrar un bucle?
Depende del horizonte de la decisión. El white paper de 5G-ACIA y ZVEI (noviembre de 2019) sitúa los ciclos de comunicación industrial periódica entre 10 ms y 0,5 ms, y exige al dominio de reloj de trabajo, donde viven robots y control de movimiento, una sincronización igual o mejor que 1 microsegundo con tendencia a 100 nanosegundos. Para OEE, energía y análisis de turno bastan decenas de milisegundos de exactitud en la marca de tiempo. Lo determinante no es la latencia media sino su varianza: un lazo con retardo variable no se puede sintonizar, o se vuelve lento para ser estable o oscila.
Si quieres saber en qué nivel de la escalera está tu planta y cuál es el siguiente paso, cuéntanos qué equipos tienes y te decimos qué dato se puede capturar ya y qué haría falta para cerrar el bucle. La arquitectura completa sobre la que trabajamos está descrita en la plataforma de datos industriales, y la definición corta del término, en la ficha de glosario de IA física.