Prof. Heping Chen
Faculty of Data and System Engineering — The University of Hong Kong
Sede: HKU Business School, Shanghai Centre
Documento de síntesis e insights preparado a partir de notas cortas y las láminas fotografiadas durante la sesión.
Carlos Calderón
Shanghái, agosto 2026
Introducción
Esta clase magistral del profesor Heping Chen (Faculty of Data and System Engineering, HKU) recorrió cerca de tres décadas de trabajo en robótica: desde los primeros tele-robots conectados por internet hasta los desarrollos más recientes en robótica asistida por inteligencia artificial física («Physical AI»). El hilo conductor de toda la sesión es una pregunta de fondo: ¿cómo lograr que un robot aprenda y actúe en el mundo físico de forma confiable, generalizable y económica en datos, en lugar de tener que ser reentrenado desde cero para cada tarea, cada entorno o cada máquina?
Este documento organiza el contenido en tópicos, resume los insights principales de cada uno y dedica una sección extendida al desarrollo que más interés generó: el modelo Generative Adversary Tri-Model (GAT) para programación transferible de robots, con una explicación en lenguaje sencillo de su funcionamiento.
1. Panorama general: robótica en la era de la IA
La sesión abrió situando la robótica como un campo que integra tres capas que deben funcionar juntas: infraestructura cibernética (computación de alto desempeño, análisis y visualización de datos), sensores/percepción, y robótica/automatización propiamente dicha, todo mediado por operadores y usuarios humanos. Estas capas se aplican a sistemas físicos muy distintos entre sí: logística, servicios, manufactura y entornos urbanos.
Insight
La robótica moderna no es solo «hardware que se mueve»: es un sistema ciber-físico donde cómputo, datos y sensores son tan determinantes como los actuadores. Los avances recientes en IA no reemplazan esta arquitectura, la potencian.
2. Tele-robots basados en internet
Uno de los ejes históricos del trabajo del profesor Chen es la teleoperación de robots a través de internet, con aplicaciones muy diversas: tele-diagnóstico de cáncer de mama (tele-medicina), tele-manufactura (operadores remotos controlando celdas de trabajo robóticas), tele-colaboración y entrenamiento entre instituciones (con ejemplos de colaboración entre Michigan State University, North Carolina A&T y Chinese University of Hong Kong), descubrimiento de fármacos (identificación de blancos, optimización de compuestos, pruebas preclínicas y ensayos clínicos) y monitoreo/protección ambiental inspirado en el comportamiento de enjambre de las abejas (bio-inspiración aplicada a redes de sensores y actuadores distribuidos).
Sobre esta base se construyó después el Tele-Robotic Control Protocol (TRCP), un protocolo diseñado para resolver dos problemas concretos de la teleoperación: la inestabilidad causada por retrasos de comunicación aleatorios, y la desinformación del operador por falta de sincronización entre el control que envía y el feedback que recibe. La solución combina un router TRCP dedicado con un ciclo de control basado en eventos (event-based reference) entre el operador, el joystick, la unidad de procesamiento de control y los módulos del robot, más un panel de monitoreo apoyado en IA (AI monitor, monitoreo de cuerdas/rope monitor, video monocular múltiple).
Insight
El problema de fondo de la teleoperación nunca ha sido «mover el robot a distancia», sino sincronizar de forma confiable el control y el feedback pese a la latencia de red. Es el mismo problema, en otra escala, que reaparece más adelante al conectar planificación de alto nivel (lenguaje) con ejecución física en tiempo real.
3. Manufactura guiada por CAD: CGTP
El CAD Guided Tool Planner (CGTP), desarrollado en el Robotics and Automation Lab de Michigan State University, es un software que traduce modelos CAD de una pieza en trayectorias ejecutables por un robot industrial. Sus cinco funciones centrales son: manipulación de la pieza, generación de la trayectoria del robot, manipulación del punto de la pistola/herramienta robótica, manipulación de la ruta del robot, y simulación de densidad de área (por ejemplo, para procesos de aspersión como el «chopper gun» en fabricación de materiales compuestos).
Este caso ejemplifica el enfoque «clásico» de programación robótica: la trayectoria se deriva analíticamente de la geometría CAD, de forma determinista y verificable, en oposición al enfoque basado en aprendizaje que se discute más adelante.
4. Micro y nano-robótica: reparación de máscaras EUV
Un segundo bloque técnico abordó la fabricación de semiconductores, específicamente el mantenimiento de las máscaras (masks) usadas en litografía ultravioleta extrema (EUV). Estas máscaras multicapa reflejan luz EUV para transferir patrones a las obleas de silicio, y son extremadamente sensibles a dos tipos de defecto: defectos duros (hard defects), que son problemas físicos permanentes de la estructura (rayones, huecos), y defectos blandos (soft defects), que son problemas temporales o reversibles como polvo, grasa o nanopartículas de fotorresistencia.
La reparación de estos defectos se realiza con nanorrobots operados mediante manipulación con feedback háptico y visualización 3D en tiempo real (Nano Manipulation with R-3D Display), apoyados en microscopía de fuerza atómica (AFM) para «empujar» partículas fuera de la superficie, y con procesamiento nano-mecánico para corregir defectos estructurales. En ambos casos se documentaron resultados de «antes y después» mostrando la limpieza efectiva de la superficie.
Insight
La misma lógica de teleoperación con feedback en tiempo real que se usa para tele-cirugía o tele-manufactura a escala humana se traslada, con los mismos principios de control, a la escala nanométrica. El desafío de sincronización control-feedback es independiente de la escala física.
5. Robots vestibles con músculo artificial
En el ámbito de la robótica asistida y de salud, se presentaron robots vestibles (wearables robots) habilitados por músculo artificial: blandos, flexibles, y diseñados para moverse de forma sincrónica con el usuario. Los resultados de prueba mostrados indican mejoras en la severidad de la sarcopenia (pérdida de masa y función muscular relacionada con la edad) de Nivel 3 a Nivel 1. Los prototipos incluyen un robot de tobillo (que imita los músculos gastrocnemios/sóleo y el tendón de Aquiles), una rodilla blanda (Soft Knee Robot) y un robot de asistencia de cadera (Hip Assistance Robot).
Insight
Este bloque conecta la robótica con la salud geriátrica de forma muy concreta: no se trata de exoesqueletos rígidos de asistencia industrial, sino de dispositivos blandos pensados para acompañar el movimiento natural del cuerpo, lo cual exige exactamente el tipo de «conciencia corporal» (embodiment) que se desarrolla en la sección siguiente.
6. Arquitectura clásica de control robótico
Antes de abordar el problema del aprendizaje, la clase presentó la jerarquía clásica con la que se controla un robot: Tasks → Task Scheduling → Action Planning → Path Planning → Trajectory Planning → Control System → Robot System → Sensory Information (con retroalimentación hacia el sistema de control). Esta jerarquía se puede leer en tres niveles de mando: comando lógico (planificación manual off-line, arriba), comando numérico (nivel intermedio) y ejecución basada en tiempo (control automático en tiempo real, abajo).
Sobre esta misma arquitectura se mostró después una versión ampliada centrada en el control por lenguaje natural (Natural Language based Control/Programming): un usuario humano habla, el habla se convierte en comandos de lenguaje natural, estos se procesan y traducen en comandos de lenguaje formal, que alimentan un planificador de tareas (task planner) y luego un planificador de movimiento (motion planner), hasta llegar al controlador y al sistema robótico, todo bajo un lazo cerrado de feedback sensorial que informa tanto al controlador como al planificador de tareas, y que debe lidiar además con eventos inesperados (unexpected events).
Insight
Esta arquitectura es la clave para entender por qué la irrupción de los LLM no resuelve por sí sola la robótica: un LLM puede ocupar el bloque de «procesamiento de lenguaje natural» y parte del «task planner», pero todo lo que va desde el motion planner hacia abajo, es decir, el contacto real con la física del mundo, exige algo que el lenguaje por sí solo no provee.
7. El desafío central: la brecha entre el lenguaje y el movimiento
7.1 Ochenta años buscando el «cuerpo» de la IA
El profesor Chen trazó una línea de tiempo de 80 años (1940–2010+) de la IA, desde los primeros modelos de McCulloch y Pitts (con pesos ajustables pero no aprendidos) hasta el aprendizaje profundo jerárquico actual, cruzándola con la evolución paralela del concepto de «embodiment» (“incorporado”, dentro del cuerpo): desde la cenestesia o «sentido del propio cuerpo» (Critchley, 1953), pasando por la primera propuesta formal del término «embodiment» (McCulloch, 1963), la idea de que la corporeidad es prerrequisito de la sensación y el conocimiento (Kant; Johnson, 1987), la cognición situada y corporeizada (Brooks, 1991) y el embodiment de software para inteligencia autónoma (Franklin, 1997), hasta los planteamientos actuales de embodiment para inteligencia autónoma.
7.2 Lo que faltaba: El famoso experimento del gato
A finales de los años 80 se identificó una carencia fundamental: la IA funcionaba como un «calculador simbólico aislado», sin cuerpo. El salto hacia la IA incorporada (Embodied AI) implica pasar a comportamientos reactivos inmersivos, de los cuales se derivan tanto la capacidad cognitiva semántica como la capacidad de movimiento coordinado. La definición que propuso el profesor Chen para embodiment es simple y potente: Inner Body Acting + External Environment Sensing (actuación del propio cuerpo + percepción del entorno externo).
Para ilustrarlo citó el célebre experimento de Richard Held (profesor de ciencia cognitiva del MIT): dos gatos reciben exactamente el mismo estímulo visual, pero uno se mueve activamente por su propio esfuerzo (viendo y controlando su cuerpo) mientras el otro es transportado pasivamente (sin control de su propio movimiento). El resultado es contundente: el gato activo aprende a caminar correctamente, mientras que el gato movido de forma pasiva pierde la capacidad de caminar, a pesar de haber «visto» lo mismo.
Insight central
Percibir no es suficiente para aprender a actuar: hace falta actuar para aprender a actuar. Este es el argumento biológico detrás de por qué un modelo entrenado solo con datos pasivos (texto, video, demostraciones grabadas) tiene un techo, y por qué la robótica necesita mecanismos que fuercen al sistema a relacionar su propia acción con sus consecuencias sensoriales.
7.3 Las cuatro dimensiones que le faltan a un LLM
Con este marco, la clase formalizó la brecha entre un modelo de lenguaje (LLM) y un generador de movimiento (Gap Between LLM and a Motion Generator), usando como ejemplo PaLM: ante la instrucción «I spilled my drink, can you help?», el modelo genera correctamente una secuencia lógica de pasos (buscar un trapo, buscar una esponja, ir al basurero, recoger la manzana, probar con la aspiradora…). Ese razonamiento es lógico (Logical) y ahí termina lo que un LLM puro domina bien.
Para convertir esa secuencia en acción robótica real hacen falta tres capacidades adicionales que el lenguaje no provee por sí mismo:
- Spatial — sensado del entorno y modelado del mundo (environment sensing, world modeling): saber dónde están las cosas y cómo es el espacio físico real.
- Temporal — actuación corporal en el tiempo (body acting): ejecutar el movimiento de forma continua y coordinada, no como una lista de instrucciones discretas.
- Interactions — interacción efectiva con el entorno: responder a la resistencia, textura, peso y comportamiento real de los objetos y superficies.
La síntesis de la clase fue el «Action Planner: LLM + Embodied Sensing»: un planificador de acción real necesita combinar el razonamiento lógico del lenguaje con sensado corporeizado (embodied sensing), es decir, con las tres dimensiones anteriores ancladas en el cuerpo del robot y su entorno.
8. El modelo GAT: Generative Adversary Tri-Model para programación transferible de robots
Esta es la propuesta central de la clase para resolver, en la práctica, la brecha descrita arriba: cómo «entrenar» a un robot para que actúe de forma correcta, segura y generalizable, sin depender de cantidades enormes de datos específicos de cada robot, cada tarea y cada entorno.
8.1 El problema que resuelve: ¿Por qué “entrenar” un robot es tan difícil?
Entrenar un robot para una tarea física con aprendizaje automático puro (Machine Learning) requiere enormes volúmenes de datos de ese robot específico, en ese entorno específico. Es costoso, lento, y lo aprendido no siempre se traslada bien a un robot distinto o a una situación nueva. La alternativa clásica, programar el robot con un modelo analítico basado en las leyes de la física, generaliza perfectamente (las leyes de Newton o de Lagrange son universales, valen para cualquier robot), pero es demasiado rígida: un modelo físico idealizado no captura bien la fricción real, el desgaste, el ruido de los sensores ni las imperfecciones del mundo real.
El modelo GAT nace de una idea simple: en lugar de elegir entre «aprender de datos» o «calcular con física», hacer que ambos enfoques se corrijan mutuamente, de forma cíclica y continua, hasta converger en un modelo que combina lo mejor de los dos.
8.2 Cómo funciona, explicado de forma sencilla
Imagina dos «asesores» trabajando juntos para enseñarle a un robot a moverse:
- El asesor de datos (Machine Learning model): es una red neuronal que aprende patrones observando ejemplos reales — sensores, cámaras, intentos previos del robot. Es flexible y se adapta a la complejidad del mundo real, pero puede «alucinar» movimientos que violan las leyes físicas si le faltan datos o si se enfrenta a una situación nueva.
- El asesor de física (Analytical model): es un modelo matemático construido sobre la ecuación de Euler-Lagrange (d/dt(∂L/∂q̇ ) − ∂L/∂q = Q), que describe con rigor cómo se comporta cualquier sistema mecánico en movimiento. Es universal y confiable, pero asume un mundo idealizado que no siempre coincide con la realidad (fricción exacta, masas exactas, superficies perfectas).
El modelo GAT hace que estos dos asesores dialoguen en un ciclo permanente, con dos correcciones cruzadas:
- Las salidas del modelo de aprendizaje se corrigen con el modelo analítico: cuando la red neuronal propone un movimiento, el modelo físico revisa si ese movimiento es físicamente posible y lo ajusta si no lo es. Es, en la práctica, un «árbitro» que mantiene al modelo de datos anclado a la realidad física.
- El modelo de aprendizaje se reinicializa con el modelo analítico: en lugar de que la red neuronal empiece a aprender desde cero (pesos aleatorios), arranca ya «informada» por el conocimiento físico, lo cual acelera muchísimo el aprendizaje y reduce la cantidad de datos reales que hace falta recolectar.
A su vez, el modelo analítico también se beneficia del lado de los datos: sus parámetros se afinan y describen a partir de datos reales («described by data»), de modo que va dejando de ser un modelo puramente idealizado y se acerca más a cómo se comporta el robot real. El diagrama de la lámina resume este ciclo con dos flechas curvas que van y vuelven entre el cilindro verde (modelo de aprendizaje) y el cilindro azul (modelo analítico), pasando por un punto de encuentro donde los datos calibran la física y la física corrige el aprendizaje.
El componente «Tri-» del nombre alude a que, además de estos dos modelos, el marco incorpora una capa de lógica de eventos discretos (DEDS — Discrete Event Dynamic System, señalada en el centro de la lámina con flechas cíclicas) que gobierna cuándo y cómo se activa cada ciclo de corrección, conectando esta arquitectura con la dimensión «Logical» que, según la sección anterior, un motor de movimiento necesita además de lo espacial, temporal y de interacción.
Por qué esto resuelve el problema del «entrenamiento»
Al anclar el aprendizaje en leyes físicas universales en lugar de depender solo de datos específicos de un robot, el conocimiento que el sistema adquiere deja de estar «pegado» a ese robot y a ese entorno particular. Las leyes físicas son las mismas para cualquier brazo robótico, cualquier piso, cualquier objeto: por eso el resultado es transferible (transferable robot programming) — se puede mover el modelo a un robot distinto, o a una tarea nueva, con mucho menos reentrenamiento que si todo el conocimiento viniera únicamente de datos.
8.3 Analogía para fijar la idea
Es similar a cómo aprende un instructor experimentado de manejo frente a un estudiante que solo memoriza rutas específicas. El estudiante que memoriza («modelo de datos puro») maneja bien en las calles que ya practicó, pero se pierde en una ciudad nueva. El instructor que entiende las leyes físicas de la conducción — fricción, inercia, distancias de frenado — («modelo analítico puro») puede manejar en cualquier ciudad, pero no conoce baches, semáforos rotos ni el tráfico real de hoy. El modelo GAT es, en esencia, un ciclo de retroalimentación permanente entre ambos: el instructor corrige al estudiante cuando propone algo físicamente peligroso, y el estudiante le aporta al instructor lo que solo se aprende manejando de verdad, calle por calle.
9. Síntesis final: el hilo que conecta toda la clase
Leída de principio a fin, la clase del profesor Chen traza una progresión coherente: comienza con la robótica remota clásica (telerobots, TRCP, CGTP), pasa por casos de aplicación muy concretos y ya maduros (reparación de máscaras EUV a escala nano, robots vestibles para salud), y culmina en el problema que hoy define el campo — cómo dotar a los robots de «cuerpo» e inteligencia física real, más allá de lo que un modelo de lenguaje puede ofrecer por sí solo.
El modelo GAT es la respuesta técnica concreta que se propuso a ese problema: en vez de escoger entre «pura física» o «puro dato», construir un ciclo donde ambos se disciplinan mutuamente, con una capa lógica adicional (DEDS) que organiza cuándo aplicar cada corrección. El resultado buscado es un robot que aprende más rápido, con menos datos, y cuyo conocimiento — al estar anclado en leyes físicas universales — se transfiere de un robot o una tarea a otra con mucha mayor facilidad que el aprendizaje puramente basado en datos.
Nota metodológica: este documento se elaboró a partir de las notas de Carlos Calderón y las fotografías de las láminas proyectadas durante la sesión (no de audio ni transcripción de la exposición oral). La explicación del modelo GAT en la sección 8 es una síntesis interpretativa construida a partir del contenido visual de esa lámina, integrada con el marco conceptual (embodiment, brecha LLM-movimiento) presentado en las láminas previas de la misma clase.


