nota de investigación

Aterrizaje de cohetes a pequeña escala: ¿Puede una política de guía aprendida superar a un enfoque clásico en simulación?

Small-Scale Rocket Landing: Can a Learned Guidance Policy Outperform a Classical Approach in Simulation?

publicado
lectura
34 min · 5,620 palabras
Registro de afirmaciones
39/40 afirmaciones verificadas · 18 fuentes

Ediciones: English · عربي · Français

Respuesta directa

Ninguna afirmación en este conjunto compara directamente una política de guía aprendida con RL contra una ley de guía clásica de optimización convexa en el mismo cohete a pequeña escala, las mismas métricas y las mismas condiciones de prueba, por lo que la pregunta planteada no puede responderse a partir de esta evidencia. Lo que muestran las afirmaciones, por separado, es que las políticas de guía con RL logran trayectorias precisas y eficientes en combustible en simulación 6-DOF para descenso y aterrizaje planetario propulsado [1], y que los métodos de optimización convexa como la convexificación sin pérdida y la convexificación sucesiva son la línea base establecida para la guía de descenso propulsado, valorados por su comportamiento determinista y garantías de optimalidad global [14][4]. Una nueva generación de métodos acelera los solucionadores convexos utilizando arranques en caliente aprendidos, lo que es un híbrido de los dos enfoques más que una comparación pura [4][11]. Los constructores que necesiten una respuesta para un vehículo específico de 10 kg y 100 m de apogeo tendrán que realizar ellos mismos el experimento comparativo directo, utilizando los métodos descritos a continuación como componentes básicos.

Por qué esta pregunta es difícil de responder a partir de trabajos publicados

La guía de descenso propulsado para un cohete, ya sea a gran escala o a pequeña escala, es un problema de control en el que un vehículo debe alcanzar una posición y velocidad objetivo mientras quema la menor cantidad posible de propelente, sujeto a límites físicos. Existen dos grandes familias de métodos para resolverlo: la optimización clásica de trayectorias, más a menudo optimización convexa, y las políticas aprendidas entrenadas con aprendizaje por refuerzo (RL). La pregunta de investigación indaga si una política de guía de red neuronal entrenada puede igualar o superar una ley clásica de optimización convexa, como la convexificación sin pérdida (LCvx), en un cohete reutilizable a pequeña escala, en precisión de aterrizaje y eficiencia de combustible.

Las afirmaciones recopiladas aquí describen sistemas de guía con RL y sistemas de guía con optimización convexa, pero ninguna de ellas pone a los dos lado a lado en el mismo vehículo, el mismo conjunto de escenarios y la misma métrica de precisión o combustible. Algunas afirmaciones describen el rendimiento de RL en un aterrizador planetario 6-DOF [1], otras describen ganancias en tiempo y satisfacción de restricciones para arranques en caliente aprendidos de solucionadores convexos [4][11], y otras describen optimización convexa utilizada sola [14][10]. Estos son sistemas diferentes, probados bajo condiciones diferentes, por lo que sus números no pueden colocarse en una escala común.

Esto es importante para un constructor porque las dos familias resuelven el problema de guía de manera diferente. Los métodos de optimización convexa, cuando son aplicables, ofrecen garantías: comportamiento determinista, optimalidad global y certificados de convergencia o inviabilidad [14]. Las políticas de RL no tienen estas garantías por construcción, pero se informa que producen trayectorias precisas y eficientes en combustible en simulación, y que son robustas al ruido y a la incertidumbre de parámetros [1]. Si esa robustez y precisión equivalen a un rendimiento comparable o mejor que una ley convexa específica como LCvx, en un vehículo pequeño específico, es exactamente la prueba comparativa directa que falta.

La escala del vehículo también importa, y ninguna de las afirmaciones se establece para un cohete de 10 kg y 100 m de apogeo específicamente. Los resultados de RL a continuación provienen de un aterrizador planetario 6-DOF [1], de un modelo de cohete de alta fidelidad [6], de escenarios lunares y de asteroides [3][8]. Los resultados de optimización convexa provienen de formulaciones de aterrizaje propulsado en Marte [14][4] y de un problema de aterrizaje propulsado de cohete con una restricción de ángulo de ataque [10]. Aplicar cualquiera de estos números a un vehículo a pequeña escala sin volver a probar sería una extrapolación que las fuentes no respaldan.

El resto de esta nota expone lo que cada familia de métodos realmente hace, qué se ha medido para cada una y qué necesitaría construir un equipo de dos personas para responder directamente a la pregunta original, ya que la literatura aún no la responde.

Cómo es una política de guía aprendida con RL

Una política de guía con RL para el aterrizaje de cohetes es una red neuronal entrenada para emitir comandos de empuje directamente a partir del estado estimado del vehículo. En un enfoque, se utiliza Proximal Policy Optimization (PPO) para aprender una política que mapea el estado estimado del aterrizador directamente a un empuje comandado para cada motor [1]. El entrenamiento utilizó un entorno de simulación 6-DOF para la tarea de descenso y aterrizaje, y la política resultante produjo trayectorias descritas como precisas y eficientes en combustible [1]. El sistema también mostró robustez al ruido y a la incertidumbre de parámetros del sistema [1].

Un detalle de ajuste específico informado para este sistema es que el uso de diferentes tasas de descuento para las recompensas terminales y de modelado mejora significativamente el rendimiento de la optimización [1]. Esto se afirma como una mejora general al procedimiento de entrenamiento, vinculada al diseño de modelado de recompensas utilizado en ese estudio particular de aterrizador 6-DOF, más que como un resultado aislado. Un constructor que adopte una estructura de recompensas similar, con una recompensa terminal por alcanzar el objetivo y una recompensa de modelado que guíe el comportamiento intermedio, debe esperar tener que ajustar estas dos tasas de descuento por separado en lugar de compartir un valor entre ellas.

Otros trabajos de guía con RL abordan problemas relacionados pero distintos utilizando el mismo algoritmo subyacente. Se adopta una implementación de código abierto del algoritmo de última generación Proximal Policy Optimization para llevar a cabo el proceso de entrenamiento de una red neuronal profunda para el diseño de trayectorias de misiones interplanetarias [7]. En ese mismo trabajo, el problema de control óptimo estocástico se reformula como un proceso de decisión de Markov en tiempo discreto, para cumplir con la formulación estándar requerida por el aprendizaje por refuerzo [7]. Este paso de reformulación, convertir un problema de control óptimo en tiempo continuo en una secuencia de decisiones discretas con estados, acciones y recompensas, es un requisito previo general para aplicar algoritmos de RL a cualquier problema de guía, no solo al caso interplanetario donde se describe.

Los enfoques basados en imágenes extienden la guía con RL a casos donde la política debe actuar sobre una entrada visual en lugar de una estimación de estado limpia. El meta-aprendizaje profundo por refuerzo basado en imágenes ha producido una política de guía en lazo cerrado que alcanza errores del orden de metros en diferentes escenarios, incluso cuando el entorno solo se observa parcialmente, para el aterrizaje lunar autónomo [3]. Un sistema de guía de meta-aprendizaje por refuerzo basado en imágenes relacionado, aplicado al problema diferente de guiar un impactador de asteroides, condujo correctamente la nave espacial hacia el punto de impacto final en más del 98% de 500 escenarios de prueba [8]. Ambos resultados describen un comportamiento de guía en lazo cerrado bajo incertidumbre sobre el estado real, lo cual es directamente relevante para un cohete a pequeña escala que también debe depender de una estimación de estado imperfecta, aunque ninguna de las afirmaciones trata sobre un aterrizaje de cohete en una plataforma de lanzamiento o barcaza.

Los algoritmos de RL estándar no son automáticamente confiables para esta clase de tarea de aterrizaje orientada a objetivos, y esta es una precaución importante para cualquiera que asuma que cualquier algoritmo de RL funcionará simplemente sin más. Se informa que PPO, SAC y DSAC fallan en escenarios de aterrizaje de cohetes orientados a objetivos porque dependen de una exploración extensiva, y la probabilidad de alcanzar el objetivo aleatoriamente disminuye exponencialmente con el tiempo [6]. Este modo de fallo es la razón por la que se han propuesto esquemas de entrenamiento especializados, descritos en la siguiente sección, específicamente para el control de aterrizaje de cohetes, en lugar de confiar únicamente en el entrenamiento de PPO, SAC o DSAC estándar.

Random Annealing Jump Start: un esquema de entrenamiento diseñado para este modo de fallo

Random Annealing Jump Start (RAJS) es un método de entrenamiento diseñado para superar el fallo de exploración de los algoritmos de RL estándar en el aterrizaje de cohetes orientado a objetivos. En RAJS, una política guía navega por el entorno durante un horizonte guía, y luego una política de exploración toma el control para completar los pasos restantes [6]. El horizonte guía se muestrea de una distribución uniforme cuyo límite superior se reduce a cero basándose en métricas de rendimiento [6]. Este diseño permite que la política de exploración comience cada vez más cerca del objetivo a medida que avanza el entrenamiento, ya que al principio del entrenamiento la política guía cubre la mayor parte de la trayectoria, y a medida que el rendimiento mejora, la participación de la política guía en cada episodio se reduce hasta desaparecer, entregando progresivamente más de la tarea a la política de exploración en entrenamiento.

El mecanismo aborda directamente el problema de exploración exponencial descrito para PPO, SAC y DSAC estándar. En lugar de pedirle a la política de exploración que tropiece con un estado objetivo raro desde un inicio completamente aleatorio, RAJS le da un inicio adelantado desde un estado alcanzado por una política guía competente, y solo retira gradualmente esa ventaja inicial. Esta elección de diseño es una respuesta directa a la causa declarada de fallo en los algoritmos de RL estándar, a saber, que la probabilidad de alcanzar el objetivo aleatoriamente disminuye exponencialmente con el tiempo [6].

En un modelo de cohete de alta fidelidad, RAJS elevó la tasa de éxito del control de aterrizaje de cohetes del 8% con un controlador de referencia al 97% [6]. Esta es una gran mejora, pero se informa para el modelo de cohete de alta fidelidad específico utilizado en ese estudio, no para un vehículo a pequeña escala de 10 kg y 100 m de apogeo. Un constructor que apunte a un cohete a pequeña escala debe tratar este número como evidencia de que el esquema de entrenamiento funciona en la clase de vehículo en la que se probó, y no debe asumir que el mismo salto del 8% al 97% ocurriría en un vehículo diferente sin volver a ejecutar el experimento.

El método RAJS también fue validado mediante una evaluación extensa y pruebas Hardware-in-the-Loop, que afirmaron la efectividad, la viabilidad en tiempo real y la suavidad del controlador propuesto [6]. Las pruebas Hardware-in-the-Loop son un paso significativo hacia el despliegue real porque ejercitan el controlador contra restricciones de tiempo e interfaz reales, no solo un reloj simulado. Sin embargo, esta validación se llevó a cabo en el modelo de cohete de alta fidelidad utilizado en ese artículo; la afirmación no establece que este resultado Hardware-in-the-Loop se haya obtenido en, o sea transferible a, un vehículo a pequeña escala de 10 kg. Un constructor que considere RAJS como un controlador de respaldo para un cohete a pequeña escala debe notar explícitamente este desajuste en la escala y fidelidad del vehículo en lugar de asumir que el resultado de tiempo real y suavidad se transfiere.

En conjunto, RAJS se interpreta mejor como una solución a un fallo conocido específico del entrenamiento de RL estándar en este dominio, evaluado en un modelo de vehículo, más que como una garantía general de rendimiento en todas las escalas de cohetes. Es una corrección en tiempo de entrenamiento, no un cambio en la ley de guía, y en principio se puede combinar con cualquiera de las ideas de modelado de recompensas o ajuste de tasas de descuento informadas en otros lugares para la guía con RL.

Guía clásica de optimización convexa: convexificación sin pérdida y sucesiva

La optimización convexa es el enfoque clásico establecido para la guía de descenso propulsado. La convexificación sin pérdida de restricciones no convexas de costo, dinámica y control se aplica a menudo al problema de guía de descenso propulsado 3-DoF [4]. La optimización convexa ha sido considerada un candidato principal para aplicaciones de guía autónoma a bordo debido a su comportamiento determinista, sus garantías de optimalidad global, su capacidad para proporcionar certificados de convergencia e inviabilidad, y la disponibilidad de algoritmos eficientes de método de punto interior (IPM) [14].

Estas propiedades (determinismo, garantías de optimalidad y certificados de convergencia) son exactamente lo que una política de RL no ofrece por construcción, ya que una red neuronal entrenada no proporciona ninguna garantía formal de que su salida sea óptima o siquiera factible para un escenario nuevo no visto. Esta es una diferencia estructural entre las dos familias más que una comparación medida, y vale la pena establecerla claramente para un constructor que decide en qué familia confiar para una fase de aterrizaje crítica para la seguridad.

La versión 6-DoF del problema de descenso propulsado es más difícil que la versión 3-DoF. Se sabe que es un desafío resolverlo rápida y confiablemente porque el problema es no lineal y no convexo, el esquema de discretización influye fuertemente en la validez de la solución, y la inicialización de la trayectoria de referencia determina si el algoritmo converge o diverge [4]. Un artículo anterior que describe la convexificación sucesiva para el aterrizaje propulsado de un cohete en Marte 6-DoF con tiempo final libre establece las mismas tres dificultades en términos casi idénticos: resolver el problema rápida y confiablemente es un desafío porque es no lineal y no convexo, porque la validez de la solución depende en gran medida de la precisión del esquema de discretización, y porque puede ser difícil seleccionar una trayectoria de referencia adecuada para inicializar un proceso de solución iterativo [14].

Ese trabajo de convexificación sucesiva también informa que, mediante el uso de solucionadores de método de punto interior (IPM), esta secuencia de subproblemas convexos puede resolverse rápida y confiablemente, permitiendo así una guía en tiempo real de mayor fidelidad para aterrizajes propulsados de cohetes en Marte [14]. Este es un resultado positivo específico para el entorno de aterrizaje propulsado en Marte y para solucionadores basados en IPM, y debe leerse como evidencia de que el enfoque de convexificación sucesiva, cuando se combina con solucionadores IPM, cumple con un requisito de tiempo real en ese entorno, no como una garantía de velocidad general independiente de la elección del solucionador.

Por separado, un método de programación convexa para el aterrizaje propulsado de un cohete con una restricción de ángulo de ataque mostró, en simulaciones numéricas, que puede encontrar una trayectoria de aterrizaje factible donde se satisface la restricción de ángulo de ataque, con un mejor rendimiento de convergencia en comparación con un método de linealización tradicional [10]. Esta es una comparación contra una línea base de linealización dentro de la familia de optimización convexa, no contra una política de RL, y demuestra que los métodos convexos en sí mismos continúan siendo refinados frente a técnicas convexas o linealizadas anteriores.

El aterrizaje de precisión bajo perturbaciones reales añade más dificultad más allá de los desafíos algorítmicos anteriores. El aterrizaje endoatmosférico está sujeto a condiciones perturbadoras que incluyen fluctuación del empuje del motor, incertidumbre del coeficiente aerodinámico, perturbación de la densidad atmosférica y perturbación del viento [5]. Este es el telón de fondo contra el cual cualquier ley de guía, aprendida o clásica, debe ser juzgada si está destinada a un cohete real y volador a pequeña escala en lugar de solo una simulación limpia, ya que un vehículo pequeño y ligero probablemente sea más sensible al viento y a la variación del empuje que un vehículo de lanzamiento grande, aunque ninguna afirmación establece esta comparación directamente.

Acelerando solucionadores convexos con aprendizaje: un híbrido, no un reemplazo

Una línea de trabajo separada no enfrenta a RL contra la optimización convexa, sino que utiliza el aprendizaje para hacer que la optimización convexa sea más rápida o más confiable. T-PDG mejora los tiempos de solución hasta en un orden de magnitud en comparación con la convexificación sin pérdida (LCvx) para el problema de guía de descenso propulsado con combustible mínimo 3-DoF [4]. Esta es una comparación de tiempo entre un método aumentado con aprendizaje y una línea base clásica, en una formulación de problema 3-DoF específica, no una comparación de precisión contra precisión de una política de RL contra LCvx.

El mecanismo detrás de esta aceleración es la predicción de qué restricciones estarán activas en la solución óptima. T-SCvx aprende a predecir el conjunto de restricciones activas o ajustadas en la solución del problema de control óptimo, creando un problema de tamaño reducido mínimo inicializado solo con las restricciones ajustadas, luego utiliza la solución para arrancar en caliente el solucionador de optimización directa [4]. Arrancar en caliente significa que el solucionador comienza más cerca de la respuesta, por lo que los tiempos de solución disminuyen; el tamaño reducido del problema, que contiene solo las restricciones ajustadas predichas en lugar del conjunto completo de restricciones, es lo que permite que el solucionador converja más rápido de lo que lo haría en la formulación completa de convexificación sin pérdida.

Un método relacionado, TOAST, sigue una filosofía similar de arranque en caliente pero se evalúa en problemas diferentes. A través de experimentos numéricos en un problema de rover lunar y un problema de guía de descenso propulsado en Marte de 3 grados de libertad, TOAST supera a los enfoques de referencia tanto en tiempos de cómputo como en satisfacción de restricciones de predicción de la red [11]. Nuevamente, esta es una comparación contra enfoques de referencia de arranque en caliente u optimización, no contra una política de guía con RL pura de extremo a extremo, y los dos problemas de prueba, un rover lunar y un caso de descenso propulsado en Marte 3-DoF, son distintos tanto del aterrizador planetario 6-DOF utilizado para la política de guía con RL en [1] como de cualquier cohete a pequeña escala.

Para un constructor, la lección práctica de esta familia de métodos es que el aprendizaje y la optimización convexa no son mutuamente excluyentes. Un sistema puede usar una red aprendida puramente para acelerar o estabilizar la convergencia de un solucionador convexo, manteniendo las garantías del solucionador, en lugar de reemplazar la toma de decisiones del solucionador con una red de extremo a extremo como en las políticas de guía con RL descritas anteriormente. Este camino híbrido vale la pena considerarlo como una tercera opción junto con RL pura y optimización convexa pura al diseñar el experimento comparativo del que trata esta nota en última instancia.

Aterrizaje de precisión bajo dispersión: leyes de guía diseñadas para la incertidumbre

La precisión y la robustez a la dispersión son requisitos centrales para cualquier cohete reutilizable a pequeña escala, ya que el hardware real nunca se comporta exactamente como su modelo de simulación. Un enfoque propuesto es un método novedoso de control de dispersión de trayectoria en línea basado en una Ley de Guía de Retroalimentación Óptima Parametrizada (POFGL) [5]. Esta es una ley de guía destinada específicamente a controlar cuánto se desvía la trayectoria real de un cohete de la planificada bajo perturbación, más que un optimizador de propósito general o una política aprendida, y se presenta como un método en línea, lo que significa que está destinado a ejecutarse continuamente durante el vuelo en lugar de resolverse una vez antes del lanzamiento.

Una limitación conocida de las leyes de guía de retroalimentación de este tipo es el comportamiento cerca del final del descenso. A medida que el tiempo restante tiende a cero, la sensibilidad de las trayectorias de comando de guía generadas aumentará significativamente e inevitablemente tenderá a infinito [5]. Esta es una propiedad estructural de la ley de guía cerca del contacto con el suelo, y cualquier implementación debe manejarla explícitamente, por ejemplo, cambiando el modo de guía o limitando la sensibilidad comandada a medida que el tiempo restante se acerca a cero, aunque la afirmación en sí no prescribe qué mitigación específica usar.

Este problema de dispersión se plantea en el contexto de las perturbaciones ya señaladas para el aterrizaje endoatmosférico: fluctuación del empuje del motor, incertidumbre del coeficiente aerodinámico, perturbación de la densidad atmosférica y perturbación del viento [5]. Estos son exactamente los tipos de perturbaciones que se esperaría que encontrara un cohete a pequeña escala, que es más ligero y más sensible al viento y a la variación del empuje que un vehículo de lanzamiento grande, en una prueba al aire libre, aunque ninguna afirmación hace esta comparación de escala directamente.

Ninguna de las afirmaciones en este conjunto informa un número de precisión de aterrizaje o consumo de combustible para POFGL que pueda colocarse junto al número de una política de RL bajo las mismas condiciones de prueba. El valor de esta sección para un constructor es el recordatorio de que las leyes de guía, independientemente de la familia de la que provengan, deben verificarse específicamente para el comportamiento a medida que el tiempo restante se acerca a cero y bajo modelos de perturbación realistas, no solo en una ejecución nominal sin perturbaciones, ya que una ley de guía que funciona bien en una simulación limpia puede fallar aún cerca del contacto con el suelo o bajo perturbaciones de viento y empuje que no fueron modeladas.

Qué se ha medido realmente, y contra qué línea base

Para mantener esta nota honesta, aquí está cada resultado cuantitativo o comparativo en el conjunto de afirmaciones, indicado con su propia línea base y condiciones, sin fusionar resultados de diferentes artículos.

  • RAJS elevó la tasa de éxito del control de aterrizaje de cohetes del 8% con un controlador de referencia al 97%, en un modelo de cohete de alta fidelidad, usando RL [6].
  • T-PDG mejora los tiempos de solución hasta en un orden de magnitud en comparación con LCvx, para el problema de guía de descenso propulsado con combustible mínimo 3-DoF [4].
  • TOAST supera a los enfoques de referencia en tiempo de cómputo y satisfacción de restricciones de predicción de la red, en un problema de rover lunar y un problema de guía de descenso propulsado en Marte 3-DoF [11].
  • El método de programación convexa con una restricción de ángulo de ataque tiene un mejor rendimiento de convergencia que un método de linealización tradicional, en simulaciones numéricas, y encuentra una trayectoria de aterrizaje factible que satisface esa restricción [10].
  • Un sistema de guía de meta-aprendizaje por refuerzo basado en imágenes condujo correctamente la nave espacial al punto de impacto final en más del 98% de 500 escenarios de prueba, para un problema de impactador de asteroides [8].
  • Una política de meta-aprendizaje profundo por refuerzo basada en imágenes alcanzó errores del orden de metros en diferentes escenarios, incluida la observabilidad parcial, para el aterrizaje lunar [3].
  • El modelo RAQResNet logró una pérdida de validación aproximadamente 300 veces menor que una arquitectura estándar con un número igual de parámetros entrenables, y 50 veces menor que una arquitectura estándar con el doble de parámetros entrenables [2].

Ninguno de estos resultados compara una política de guía con RL y una ley de guía convexa clásica en el mismo vehículo y la misma métrica de precisión o combustible. Cada número pertenece a su propio punto de referencia, tamaño de muestra y entorno del artículo, y mezclarlos en una clasificación única sería tergiversar la evidencia. Un constructor debe tratar cada uno de estos números estrictamente como un informe sobre el método, vehículo y escenario de prueba específicos nombrados junto a él, y no debe promediarlos ni combinarlos entre artículos para producir una clasificación reclamada entre la guía con RL y la guía con optimización convexa en general.

Infraestructura de aprendizaje relacionada que vale la pena conocer

Dos piezas de trabajo de infraestructura, aunque no son métodos de guía en sí mismos, son antecedentes relevantes para un equipo que construye y prueba políticas de guía con RL. Open Ant es una variante física del entorno Gymnasium Ant comúnmente utilizado, junto con una simulación [15]. El cuerpo del robot Open Ant está diseñado para parecerse al entorno Gymnasium Ant ampliamente utilizado [15], y está diseñado para ser construido y mantenido por investigadores de IA sin antecedentes en ingeniería robótica [15]. Este segundo punto es importante para un equipo pequeño de guía de cohetes: una plataforma diseñada explícitamente para investigadores no robóticos reduce la barrera de ingeniería para realizar experimentos físicos de RL, lo cual es directamente relevante si un equipo sin experiencia profunda en hardware aeroespacial quiere probar una política de guía en hardware real en lugar de solo en simulación.

Mecánicamente, Open Ant utiliza una cámara web aérea para rastrear marcadores fiduciales para calcular señales de recompensa y el vector de dirección de la hormiga [15]. El robot está conectado por cables a la alimentación de CA y a una computadora externa donde se ejecuta el agente [15]. Esto significa que el cálculo de la recompensa y la toma de decisiones del agente ocurren fuera del robot, dependiendo de sensores y cómputo externos en lugar de sistemas autónomos completamente integrados, lo que simplifica el hardware que un equipo de investigación necesita construir en comparación con un robot completamente autónomo.

En el lado del aprendizaje, se pueden aprender políticas de caminar competentes desde cero en aproximadamente una hora directamente de la experiencia del robot físico, para SARSA(λ) y Soft Actor-Critic (SAC) [15]. Por separado, Open Ant viene con una simulación MuJoCo, que se puede usar para aprender políticas competentes [15], y las políticas aprendidas en simulación se transfieren a la realidad para la plataforma Open Ant [15]. Juntos, estos dos resultados describen dos rutas independientes para obtener una política funcional en esta plataforma: entrenar directamente en el robot físico en aproximadamente una hora, o entrenar en la simulación MuJoCo y transferir el resultado al robot real. Ninguno de estos resultados trata sobre cohetes o guía, pero el patrón, un par simulación-hardware emparejado con transferencia sim-to-real demostrada, es exactamente lo que un equipo que construye un banco de pruebas de cohetes a pequeña escala para responder a la pregunta de RL versus optimización convexa necesitaría.

Por separado, Gym-μRTS se describe como un entorno de RL de ejecución rápida para la investigación de estrategia en tiempo real de juegos completos [17]. Esto no está relacionado con la guía de cohetes en el dominio, pero es evidencia de que los entornos de RL rápidos y especialmente diseñados son valorados en la comunidad de investigación de RL en general como una forma de hacer que la iteración sea barata, lo cual es una consideración para cualquier equipo que diseñe un entorno de entrenamiento de guía de cohetes desde cero. Ni Open Ant ni Gym-μRTS responden nada sobre la precisión del aterrizaje o la eficiencia del combustible; se incluyen aquí porque muestran cómo se ven la infraestructura de simulación-hardware emparejada y los bucles de entrenamiento rápidos en otros dominios, que es exactamente el tipo de infraestructura que un proyecto de comparación de guía de cohetes necesitaría construir por sí mismo.

Otros resultados de aprendizaje por refuerzo en problemas adyacentes

Algunas afirmaciones adicionales describen RL aplicado a problemas adyacentes a la guía de aterrizaje de cohetes, útiles para un constructor que decide qué técnicas de RL tomar prestadas. En el control transitorio de motores de cohete líquido, un controlador de aprendizaje por refuerzo profundo logró el rendimiento más alto en comparación con secuencias de lazo abierto cuidadosamente ajustadas y controladores PID [13]. El mismo estudio mostró que la política aprendida puede alcanzar diferentes puntos de operación en estado estacionario y adaptarse de manera convincente a parámetros cambiantes del sistema [13]. Este es un problema de control diferente, control transitorio del motor en lugar de guía de descenso, pero es evidencia de la misma literatura amplia de RL para sistemas de cohetes de que un controlador aprendido puede superar a las líneas base clásicas de lazo abierto y PID en al menos un subsistema de cohete, y muestra un controlador RL adaptándose en línea a parámetros cambiantes del sistema, una propiedad distinta pero relacionada en espíritu con la robustez al ruido y a la incertidumbre de parámetros informada para la política de guía de descenso 6-DOF.

En el lado del diseño de algoritmos de RL, los enfoques existentes para la selección de currículum o tareas en RL típicamente aproximan las diferencias de tareas utilizando señales centradas en el agente como el arrepentimiento o el desacuerdo de valor, pero estas señales son inherentemente dependientes de la política y sensibles al ruido [12]. Se propone Causal-Paced Deep Reinforcement Learning (CP-DRL) como un marco que aborda esta limitación aproximando la diferencia del modelo causal estructural (SCM) entre tareas utilizando solo datos de interacción [12]. Esta es una metodología general de RL, no específica de la guía de cohetes, pero es relevante si un constructor planea entrenar una política de guía a través de un currículum de escenarios de aterrizaje cada vez más difíciles, por ejemplo, dispersiones iniciales progresivamente mayores o perturbaciones de viento, y desea una forma basada en principios y robusta al ruido para elegir en qué escenario entrenar a continuación en lugar de depender de señales de arrepentimiento o desacuerdo de valor que la afirmación indica que son sensibles al ruido.

Finalmente, sobre el problema de recuperación del mundo real del que trata esta nota en última instancia, un artículo de diseño sobre el aterrizaje vertical retropropulsivo de una etapa de cohete reutilizable establece claramente que uno de los desafíos radica en la estrategia y los algoritmos de guía, navegación y control (GNC) de recuperación, en particular aquellos de la fase de aterrizaje propulsado, que deben permitir un aterrizaje preciso con márgenes de combustible bajos y dispersiones significativas [9]. Esto es un encuadre de la dificultad del problema, no una solución o un número, y se aplica a la recuperación de cohetes reutilizables a gran escala. Se indica aquí como contexto de por qué la cuestión de la guía es importante, independientemente de la escala: la tensión entre precisión, márgenes de combustible bajos y dispersiones significativas es la misma tensión que cualquier experimento de comparación de RL versus convexo a pequeña escala debe estar diseñado para sondear.

Ninguna de estas tres afirmaciones incide directamente en la comparación de RL versus convexo a pequeña escala, pero cada una reduce lo que un constructor debe esperar tomar prestado, y de dónde: técnicas de control y evidencia de adaptación en línea del trabajo de transitorios de motor, métodos de currículum de CP-DRL, y encuadre del problema del diseño de GNC de recuperación.

Límites y preguntas abiertas

La limitación central es directa: este conjunto de evidencia no contiene ningún experimento en el que una política de guía con RL y una ley de guía clásica de optimización convexa se ejecuten en el mismo cohete a pequeña escala, bajo los mismos escenarios de prueba, y se puntúen en las mismas métricas de precisión y combustible. Cada resultado cuantitativo anterior pertenece al modelo de vehículo, punto de referencia y línea base de su propio artículo, y los números no pueden combinarse en una clasificación entre las dos familias de métodos sin ir más allá de lo que afirma cualquier afirmación individual.

Una segunda limitación es el desajuste de escala. Los resultados de RL informados aquí provienen de una simulación de aterrizador planetario 6-DOF [1], un modelo de cohete de alta fidelidad [6], escenarios de impactador de asteroides y aterrizaje lunar [8][3], ninguno de los cuales se afirma que sea un cohete a pequeña escala de 10 kg y 100 m de apogeo. Del mismo modo, los resultados de optimización convexa provienen de aterrizaje propulsado en Marte y formulaciones 3-DoF o 6-DoF [14][4][10], no de un vehículo a pequeña escala. Aplicar los números informados de cualquiera de las familias a un cohete a pequeña escala es una extrapolación que las afirmaciones no respaldan, y un constructor debe volver a ejecutar los experimentos relevantes en el vehículo real de interés antes de sacar conclusiones.

Una tercera limitación se refiere a la confiabilidad del entrenamiento. Se informa que los algoritmos de RL estándar, incluidos PPO, SAC y DSAC, fallan en escenarios de aterrizaje de cohetes orientados a objetivos debido a la dependencia de una exploración extensiva [6]. Esto significa que un constructor no puede simplemente aplicar una implementación de PPO estándar, como se usa en otros lugares para el diseño de trayectorias interplanetarias [7], y esperar que tenga éxito en el aterrizaje sin un esquema de entrenamiento especializado como RAJS, o elecciones de modelado de recompensas como el ajuste de la tasa de descuento informado para el aterrizador planetario 6-DOF [1].

Una cuarta limitación se refiere a que las afirmaciones de robustez son específicas del escenario. Las pruebas Hardware-in-the-Loop para RAJS afirmaron la viabilidad en tiempo real y la suavidad en el modelo de cohete de alta fidelidad probado [6], y esto no debe leerse como evidencia para un vehículo de escala o fidelidad diferente. Del mismo modo, el problema de sensibilidad estructural a medida que el tiempo restante se acerca a cero, informado para POFGL [5], y la lista de perturbaciones endoatmosféricas [5], ambos se aplican a la ley de guía específica y al régimen de vuelo discutidos allí, y un constructor debe volver a verificar estos comportamientos para cualquier nueva ley de guía y vehículo en lugar de asumir que se transfieren.

Una quinta limitación, más general, es que las garantías de optimización convexa y los informes de rendimiento de RL no se miden en términos comparables incluso en principio dentro de este conjunto de evidencia. Las ventajas de la optimización convexa se describen como comportamiento determinista, garantías de optimalidad global y certificados de convergencia o inviabilidad [14], que son propiedades de la estructura del algoritmo, no números medidos en un conjunto de prueba. Las ventajas informadas de RL (precisión, eficiencia de combustible y robustez al ruido [1], o tasa de éxito en un vehículo específico [6]) son números empíricos de escenarios de prueba específicos. Una comparación justa necesitaría medir ambas familias en el mismo terreno empírico, por ejemplo, error de aterrizaje y combustible consumido en un conjunto de escenarios idéntico, lo que ninguna afirmación aquí proporciona.

Cómo construirlo o cómo usarlo

El siguiente procedimiento es para un equipo que quiera producir realmente la comparación directa faltante para un cohete a pequeña escala, utilizando los métodos descritos en las afirmaciones anteriores como componentes básicos. Cada elección de diseño más allá de lo que afirman las afirmaciones (valores de parámetros específicos, tipos de integrador) es solo ilustrativa, elegida para hacer el procedimiento concreto, y no se afirma que provenga de ninguna fuente citada.

  1. Definir el vehículo y el conjunto de escenarios. Fijar el vehículo: 10 kg de masa seca, 100 m de apogeo, con masa, empuje y propiedades aerodinámicas especificadas. Definir un conjunto fijo de condiciones iniciales (dispersiones de posición, velocidad, actitud) contra las que se probarán ambos métodos de guía, ya que ninguno de los artículos citados comparte un punto de referencia común que pueda reutilizar directamente.
  2. Construir la simulación. Implementar la dinámica de cuerpo rígido para el vehículo, en 3-DoF o 6-DoF dependiendo de la formulación que elija para la línea base clásica. Ninguna afirmación citada especifica un integrador o software de simulación; elija uno apropiado para sus necesidades de precisión y velocidad y documéntelo explícitamente para la reproducibilidad.
  3. Implementar primero la línea base clásica. Implementar la convexificación sin pérdida (LCvx), a menudo aplicada al problema de guía de descenso propulsado 3-DoF [4]. Si necesita 6-DoF, tenga en cuenta que se informa que es más difícil de resolver rápida y confiablemente, debido a la naturaleza no lineal y no convexa del problema, la influencia del esquema de discretización en la validez de la solución y el papel de la trayectoria de referencia en determinar la convergencia o divergencia [4][14].
  4. Verificar la línea base contra dificultades conocidas. Probar la sensibilidad del solucionador convexo al esquema de discretización y a la inicialización de la trayectoria de referencia, ya que ambos se nombran como causas de convergencia o divergencia [4][14]. Si se utiliza un solucionador de método de punto interior, verificar si cumple con un presupuesto de tiempo de solución en tiempo real, como se informó para el enfoque de convexificación sucesiva en el aterrizaje propulsado en Marte [14]. Registrar el tiempo de solución y la tasa de éxito en su conjunto de escenarios antes de tocar cualquier método aprendido.
  5. Elegir un algoritmo de RL y formular el MDP. Reformular el problema de guía como un proceso de decisión de Markov en tiempo discreto, siguiendo la misma reformulación realizada para un problema de control óptimo estocástico relacionado [7]. Usar Proximal Policy Optimization (PPO) como primer algoritmo, siguiendo su uso para el mapeo de estado a empuje en descenso y aterrizaje planetario propulsado 6-DOF [1]; prepárese para que falle por sí solo en una tarea de aterrizaje estrictamente orientada a objetivos, ya que se informa que los algoritmos de RL estándar, incluido PPO, fallan aquí debido a la dificultad de exploración [6].
  6. Si PPO solo falla, agregar un esquema de entrenamiento de exploración guiada. Implementar un esquema de entrenamiento en el espíritu de Random Annealing Jump Start: una política guía que navega por el entorno durante un horizonte guía muestreado, entregando a una política de exploración para el resto del episodio, con el límite superior del horizonte reduciéndose a cero a medida que mejora el rendimiento [6]. Este es el método del que se informa que elevó la tasa de éxito del 8% al 97% en un modelo de cohete de alta fidelidad [6]; trate ese número como evidencia de que la técnica funciona en ese vehículo, no como una garantía para el suyo propio.
  7. Ajustar la estructura de recompensas. Considerar el uso de diferentes tasas de descuento para la recompensa terminal versus la recompensa de modelado, ya que se informa que esto mejora el rendimiento de la optimización para un aterrizador planetario 6-DOF [1]. Validar esta elección de forma independiente para su propia formulación de recompensa, ya que la afirmación lo informa para el diseño de recompensa de un estudio específico.
  8. Agregar pruebas de robustez al ruido y a la incertidumbre de parámetros. Ejecutar tanto la política de RL entrenada como la línea base convexa contra ruido de sensor inyectado y parámetros de vehículo perturbados, ya que la robustez al ruido y a la incertidumbre de parámetros es una propiedad informada para el sistema de guía con RL 6-DOF [1]. Informar la tasa de éxito y el error de aterrizaje bajo cada nivel de perturbación para ambos métodos, en el mismo conjunto de perturbaciones, para que la comparación sea de igual a igual.
  9. Medir la precisión de aterrizaje y el uso de combustible para ambos métodos, lado a lado. Para cada uno de los escenarios fijos del paso 1, registrar el error de posición y velocidad final y el propelente total consumido, tanto para la política de RL como para la línea base convexa. Este es el experimento central que la literatura revisada no proporciona, así que diseñarlo cuidadosamente: mismos escenarios, mismos modelos de perturbación, mismas métricas, mismo vehículo.
  10. Considerar un enfoque híbrido de arranque en caliente como una tercera condición. Opcionalmente, implementar un arranque en caliente aprendido para el solucionador convexo, en el espíritu de T-PDG o T-SCvx, que aprenden a predecir el conjunto de restricciones activas o ajustadas en la solución óptima y utilizan esta predicción para construir un problema de tamaño reducido que arranca en caliente el solucionador [4]. Comparar su tiempo de solución contra LCvx simple, ya que se informa que T-PDG mejora los tiempos de solución hasta en un orden de magnitud en comparación con LCvx para el problema de combustible mínimo 3-DoF [4], e incluir este híbrido como una tercera condición junto con RL pura y optimización convexa pura.
  11. Realizar pruebas de estrés cerca del contacto con el suelo. Si se utiliza cualquier ley de guía de tipo retroalimentación, verificar el comportamiento a medida que el tiempo restante se acerca a cero, ya que se informa que la sensibilidad de las trayectorias comandadas aumenta bruscamente y tiende a infinito en ese régimen para una de esas leyes [5]. Limitar o cambiar el modo de guía cerca del contacto con el suelo según sea necesario, y documentar el cambio explícitamente ya que no está validado en la afirmación citada.
  12. Informar los resultados honestamente. Indicar el vehículo, el conjunto de escenarios y las métricas utilizadas, y no extrapolar sus resultados a pequeña escala a cohetes a gran escala o viceversa, ya que ninguno de los resultados citados se obtuvo en un vehículo de 10 kg y 100 m de apogeo. Si su política de RL necesita pruebas Hardware-in-the-Loop antes del vuelo, tenga en cuenta que dichas pruebas se han utilizado en otros lugares para verificar la viabilidad en tiempo real y la suavidad para un modelo de cohete diferente y de mayor fidelidad [6], y trate cualquier transferencia de ese resultado a su vehículo más pequeño como no verificada hasta que lo ejecute usted mismo.
function pipeline():
    baseline_result = run_LCvx(vehicle, scenarios)            # según [4]
    rl_policy = train_PPO(vehicle_MDP)                          # según [1],[7]
    if rl_policy.success_rate is low:
        rl_policy = train_with_guided_exploration(vehicle_MDP)  # según [6]
    rl_result = evaluate(rl_policy, scenarios)
    hybrid_result = run_warm_started_solver(vehicle, scenarios) # según [4], opcional
    compare(baseline_result, rl_result, hybrid_result)
    # esta comparación de tres vías es la evidencia faltante, no encontrada en ninguna afirmación citada

Lo que construiríamos

Construiríamos un pequeño arnés de comparación completamente simulado para un cohete de 10 kg y 100 m de apogeo, ya que la literatura revisada no contiene tal prueba comparativa directa. En unas pocas semanas, un equipo de dos personas podría implementar la dinámica de cuerpo rígido 3-DoF para el vehículo; implementar la convexificación sin pérdida (LCvx) como la línea base clásica, siguiendo la formulación descrita para el problema de guía de descenso propulsado con combustible mínimo 3-DoF [4]; y entrenar una política de guía basada en PPO que mapee el estado al empuje, siguiendo el enfoque de mapeo utilizado para el descenso y aterrizaje planetario propulsado 6-DOF [1], agregando un esquema de entrenamiento de exploración guiada en el espíritu de Random Annealing Jump Start si PPO simple no logra converger, ya que se informa que PPO estándar falla en tareas de aterrizaje orientadas a objetivos [6].

Juzgaríamos el resultado en función del error de posición y velocidad de aterrizaje y el propelente total utilizado, en un conjunto fijo de al menos 50 escenarios de condiciones iniciales con ruido de sensor inyectado y perturbación de parámetros, comparando la política de RL directamente contra la línea base LCvx en escenarios idénticos, ya que la robustez al ruido y a la incertidumbre de parámetros es una propiedad reclamada para la guía con RL en la literatura [1] pero nunca probada contra una línea base convexa. El éxito sería una tabla clara y reproducible del error de posición, error de velocidad y combustible utilizado para ambos métodos en todos los escenarios, más el tiempo de solución o tiempo de inferencia para cada uno.

Esto se ejecutaría enteramente en simulación en una sola estación de trabajo con una GPU moderna para el entrenamiento de PPO, probablemente por unos pocos cientos de dólares de cómputo dado el vehículo pequeño y las longitudes de episodio cortas. No requeriría hardware físico, aunque un seguimiento natural, tomando prestada la filosofía de simulación-hardware emparejada demostrada por la plataforma Open Ant [15], sería construir un pequeño banco de pruebas físico después para verificar si la clasificación simulada entre RL y LCvx sobrevive al contacto con un vehículo real.

Registro de afirmaciones

  1. methodrespaldada

    Proximal policy optimization (PPO) is used to learn a policy mapping the lander's estimated state directly to a commanded thrust for each engine.

    [1] Deep Reinforcement Learning for Six Degree-of-Freedom Planetary Powered Descent and Landing, abstract DOI 10.48550/arxiv.1810.08719
    Future Mars missions will require advanced guidance, navigation, and control algorithms for the powered descent phase to target specific surface locations and achieve pinpoint accuracy (landing error ellipse $<$ 5 m radius). The latter requires both a navigation system capable of…
  2. methodrespaldada

    Using different discount rates for terminal and shaping rewards significantly enhances optimization performance.

    [1] Deep Reinforcement Learning for Six Degree-of-Freedom Planetary Powered Descent and Landing, abstract DOI 10.48550/arxiv.1810.08719
    Future Mars missions will require advanced guidance, navigation, and control algorithms for the powered descent phase to target specific surface locations and achieve pinpoint accuracy (landing error ellipse $<$ 5 m radius). The latter requires both a navigation system capable of…
  3. resultrespaldada

    The RL policy results in accurate and fuel-efficient trajectories in a 6-DOF simulation environment.

    [1] Deep Reinforcement Learning for Six Degree-of-Freedom Planetary Powered Descent and Landing, abstract DOI 10.48550/arxiv.1810.08719
    Future Mars missions will require advanced guidance, navigation, and control algorithms for the powered descent phase to target specific surface locations and achieve pinpoint accuracy (landing error ellipse $<$ 5 m radius). The latter requires both a navigation system capable of…
  4. resultrespaldada

    The guidance system demonstrates robustness to noise and system parameter uncertainty.

    [1] Deep Reinforcement Learning for Six Degree-of-Freedom Planetary Powered Descent and Landing, abstract DOI 10.48550/arxiv.1810.08719
    Future Mars missions will require advanced guidance, navigation, and control algorithms for the powered descent phase to target specific surface locations and achieve pinpoint accuracy (landing error ellipse $<$ 5 m radius). The latter requires both a navigation system capable of…
  5. resultrespaldada

    T-PDG improves solution times by up to an order of magnitude compared to lossless convexification (LCvx) for the 3-DoF minimum fuel powered descent guidance problem.

    [4] Tight Constraint Prediction of Six-Degree-of-Freedom Transformer-based Powered Descent Guidance, abstract arXiv:2501.00930v1
    This work introduces Transformer-based Successive Convexification (T-SCvx), an extension of Transformer-based Powered Descent Guidance (T-PDG), generalizable for efficient six-degree-of-freedom (DoF) fuel-optimal powered descent trajectory generation. Our approach significantly e…
  6. methodrespaldada

    T-SCvx learns to predict the set of tight or active constraints at the optimal control problem's solution, creating a minimal reduced-size problem initialized with only the tight constraints, then uses the solution to warm-start the direct optimization solver.

    [4] Tight Constraint Prediction of Six-Degree-of-Freedom Transformer-based Powered Descent Guidance, abstract arXiv:2501.00930v1
    This work introduces Transformer-based Successive Convexification (T-SCvx), an extension of Transformer-based Powered Descent Guidance (T-PDG), generalizable for efficient six-degree-of-freedom (DoF) fuel-optimal powered descent trajectory generation. Our approach significantly e…
  7. resultrechazada

    T-SCvx enables onboard computation of real-time guidance trajectories, demonstrated by a 6-DoF Mars powered landing application problem.

    [4] Tight Constraint Prediction of Six-Degree-of-Freedom Transformer-based Powered Descent Guidance, section Tight Constraint Prediction of Six-Degree-of-Freedom Transformer-based Powered Descent Guidance
    Richard Linares Note: Rockwell International Career Development Professor and Associate Professor, Department of Aeronautics and Astronautics, 125 Massachusetts Avenue. Senior Member AIAA. Affiliation: Department of Aeronautics and Astronautics, Massachusetts Institute of Technol…
  8. limitationrespaldada

    6-DoF powered descent guidance is known to be challenging to solve quickly and reliably due to the nonlinear and non-convex nature of the problem, the discretization scheme heavily influencing solution validity, and reference trajectory initialization determining algorithm convergence or divergence.

    [4] Tight Constraint Prediction of Six-Degree-of-Freedom Transformer-based Powered Descent Guidance, section Tight Constraint Prediction of Six-Degree-of-Freedom Transformer-based Powered Descent Guidance
    6-DoF powered descent guidance is known to be challenging to solve quickly and reliably due to the nonlinear and non-convex nature of the problem, the discretization scheme heavily influencing solution validity, and reference trajectory initialization determining algorithm conver…
  9. methodrespaldada

    Lossless convexification of nonconvex cost, dynamics, and control constraints is often applied to the 3-DoF powered descent guidance problem.

    [4] Tight Constraint Prediction of Six-Degree-of-Freedom Transformer-based Powered Descent Guidance, section 2 Introduction
    For common classes of problems, application of Pontryagin’s Maximum Principle [8] yield analytical solutions, but these methods fall short for trajectory generation as they are applicable to a limited set of mission constraints and objective functions [9, 10, 11, 12]. Moreover, w…
  10. methodrespaldada

    A novel online trajectory dispersion control method based on a Parameterized Optimal Feedback Guidance Law (POFGL) is proposed.

    [5] Trajectory Dispersion Control for Precision Landing Guidance of Reusable Rockets, abstract arXiv:2504.11894v1
    This article is an engineering note, and formal abstract is omitted in accordance with the requirements of the journal. The main idea of this note is as follows. In endoatmospheric landing of reusable rockets, there exist various kinds of disturbances that can induce the trajecto…
  11. limitationrespaldada

    As the time-to-go tends to zero, the sensitivity of the generated guidance command trajectories will significantly increase and inevitably tend to infinity.

    [5] Trajectory Dispersion Control for Precision Landing Guidance of Reusable Rockets, section 1 Introduction
    The explicit guidance method attenuates the effect of disturbances by regenerating feasible and/or optimal trajectories at each guidance period. The representative explicit guidance methods mainly contain E-guidance [1], Apollo powered descent guidance [2], Zero-Effort-Miss/Zero-…
  12. factrespaldada

    Endoatmospheric landing is subjected to more disturbing conditions, including engine thrust fluctuation, aerodynamic coefficient uncertainty, atmospheric density perturbation, and wind disturbance.

    [5] Trajectory Dispersion Control for Precision Landing Guidance of Reusable Rockets, section 1 Introduction
    Precision landing guidance is a critical enabling technology for reusable rocket recovery. Compared with lunar landing [1, 2] and planetary landing [3, 4], endoatmospheric landing is subjected to more disturbing conditions, including engine thrust fluctuation, aerodynamic coeffic…
  13. resultrespaldada

    Random Annealing Jump Start (RAJS) elevates the success rate of rocket landing control from 8% with a baseline controller to 97% on a high-fidelity rocket model using RL.

    [6] Rocket Landing Control with Random Annealing Jump Start Reinforcement Learning, abstract arXiv:2407.15083v1
    Rocket recycling is a crucial pursuit in aerospace technology, aimed at reducing costs and environmental impact in space exploration. The primary focus centers on rocket landing control, involving the guidance of a nonlinear underactuated rocket with limited fuel in real-time. Th…
  14. methodrespaldada

    In RAJS, the guide policy navigates the environment for the guide horizon, followed by the exploration policy taking charge to complete remaining steps; the guide horizon is sampled from a uniform distribution with its upper bound annealing to zero based on performance metrics.

    [6] Rocket Landing Control with Random Annealing Jump Start Reinforcement Learning, abstract arXiv:2407.15083v1
    Rocket recycling is a crucial pursuit in aerospace technology, aimed at reducing costs and environmental impact in space exploration. The primary focus centers on rocket landing control, involving the guidance of a nonlinear underactuated rocket with limited fuel in real-time. Th…
  15. limitationrespaldada

    Standard RL algorithms, such as PPO, SAC and DSAC, fail in goal-oriented rocket landing scenarios due to their reliance on extensive exploration; the likelihood of randomly reaching the goal diminishes exponentially over time.

    [6] Rocket Landing Control with Random Annealing Jump Start Reinforcement Learning, section I Introduction
    RL offers a powerful paradigm to iteratively optimize policies for control problems by maximizing the expected cumulative rewards. It has shown remarkable success in various domains, including video games [1], board games [2], robotics [3], and autonomous driving [4]. In these pr…
  16. resultrespaldada

    The RAQResNet model achieved a validation loss approximately 300 times lower than the standard architecture with an equal number of trainable parameters and 50 times lower than the standard architecture with twice the number of trainable parameters.

    [2] Optimal Reusable Rocket Landing Guidance: A Cutting-Edge Approach Integrating Scientific Machine Learning and Enhanced Neural Networks, abstract DOI 10.1109/access.2024.3359417
    This study presents an innovative approach that utilizes scientific machine learning and two types of enhanced neural networks for modeling a parametric guidance algorithm within the framework of ordinary differential equations to optimize the landing phase of reusable rockets. O…
  17. resultrespaldada

    The resulting closed-loop guidance policy from image-based reinforcement meta-learning reaches errors in the order of meters in different scenarios, even when the environment is partially observed.

    [3] Image-Based Deep Reinforcement Meta-Learning for Autonomous Lunar Landing, abstract DOI 10.2514/1.a35072
    Future exploration and human missions on large planetary bodies (e.g., moon, Mars) will require advanced guidance navigation and control algorithms for the powered descent phase, which must be capable of unprecedented levels of autonomy. The advent of machine learning, and specif…
  18. resultrespaldada

    The proposed method is validated through extensive evaluation and Hardware-in-the-Loop testing, affirming the effectiveness, real-time feasibility, and smoothness of the proposed controller.

    [6] Rocket Landing Control with Random Annealing Jump Start Reinforcement Learning, section Rocket Landing Control with Random Annealing Jump Start Reinforcement Learning
    Additional enhancements, including cascading jump start, refined reward and terminal condition, and action smoothness regulation, further improve policy performance and practical applicability. The proposed method is validated through extensive evaluation and Hardware-in-the-Loop…
  19. methodrespaldada

    An open-source implementation of the state-of-the-art algorithm Proximal Policy Optimization is adopted to carry out the training process of a deep neural network.

    [7] Reinforcement Learning for Robust Trajectory Design of Interplanetary Missions, abstract DOI 10.2514/1.g005794
    This paper investigates the use of reinforcement learning for the robust design of low-thrust interplanetary trajectories in presence of severe uncertainties and disturbances, alternately modeled as Gaussian additive process noise, observation noise, and random errors in the actu…
  20. resultrespaldada

    Numerical results show that the guidance system can correctly drive the spacecraft toward the final impact point in more than 98% of the 500 test scenarios.

    [8] Image-Based Meta-Reinforcement Learning for Autonomous Guidance of an Asteroid Impactor, abstract DOI 10.2514/1.g006832
    This paper focuses on the use of meta-reinforcement learning for the autonomous guidance of a spacecraft during the terminal phase of an impact mission toward a binary asteroid system. The control policy is replaced by a convolutional-recurrent neural network, which is used to ma…
  21. factrespaldada

    One of the challenges lies in the recovery GNC strategy and algorithms, in particular those of the powered-landing phase, which must enable a precise landing with low fuel margins and significant dispersions.

    [9] Design of the landing guidance for the retro-propulsive vertical landing of a reusable rocket stage, abstract DOI 10.1007/s12567-022-00423-6
    Abstract Launcher reusability is the most effective way of reducing access to space costs, but remains a great technical challenge for the European aerospace industry. One of the challenges lies in the recovery GNC strategy and algorithms, in particular those of the powered-landi…
  22. resultrespaldada

    Numerical simulations show that the proposed method can find a feasible landing trajectory where the AOA constraint is satisfied and has a better convergence performance compared with the traditional linearization method.

    [10] A Convex Programming Method for Rocket Powered Landing With Angle of Attack Constraint, abstract DOI 10.1109/access.2020.2997235
    Real time trajectory planning is vital in rocket precision powered landing guidance. Due to the nonconvex angle of attack (AOA) constraint and other constraints, including nonlinear dynamics and thrust constraint, the powered landing trajectory planning problem is highly nonconve…
  23. resultrespaldada

    Through numerical experiments on a Lunar rover problem and a 3-degrees-of-freedom Mars powered descent guidance problem, we demonstrate that TOAST outperforms benchmark approaches in terms of both computation times and network prediction constraint satisfaction.

    [11] Constraint-Informed Learning for Warm Starting Trajectory Optimization, abstract DOI 10.13140/rg.2.2.35597.92646
    Future spacecraft and surface robotic missions require increasingly capable autonomy stacks for exploring challenging and unstructured domains, and trajectory optimization will be a cornerstone of such autonomy stacks. However, the nonlinear optimization solvers required remain t…
  24. limitationrespaldada

    Existing approaches typically approximate task differences using agent-centric signals, such as regret or value disagreement, but these are inherently policy-dependent and sensitive to noise.

    [12] Causal-Paced Deep Reinforcement Learning, section 1 Introduction
    Just as a child first learns to crawl before walking and running, intelligent behavior in complex environments is rarely acquired in a single leap. Instead, learning unfolds through a gradual accumulation of simpler skills that scaffold more advanced capabilities. This principle …
  25. methodrespaldada

    We propose Causal-Paced Deep Reinforcement Learning (CP-DRL), a framework that addresses this limitation by approximating the SCM difference between tasks using only interaction data.

    [12] Causal-Paced Deep Reinforcement Learning, section 1 Introduction
    While SCM-based comparison provides a principled way to quantify task differences, it relies on access to the true causal structure, which is rarely available in realistic RL environments (Zanga et al., 2022). In this work, we propose Causal-Paced Deep Reinforcement Learning (CP-…
  26. resultrespaldada

    Compared to carefully tuned open-loop sequences and PID controllers, the deep reinforcement learning controller achieves the highest performance.

    [13] A Reinforcement Learning Approach for Transient Control of Liquid Rocket Engines, abstract DOI 10.1109/taes.2021.3074134
    Nowadays, liquid rocket engines use closed-loop control at most near-steady operating conditions. The control of the transient phases is traditionally performed in open loop due to highly nonlinear system dynamics. This situation is unsatisfactory, in particular for reusable engi…
  27. resultrespaldada

    It is shown that the learned policy can reach different steady-state operating points and convincingly adapt to changing system parameters.

    [13] A Reinforcement Learning Approach for Transient Control of Liquid Rocket Engines, abstract DOI 10.1109/taes.2021.3074134
    Nowadays, liquid rocket engines use closed-loop control at most near-steady operating conditions. The control of the transient phases is traditionally performed in open loop due to highly nonlinear system dynamics. This situation is unsatisfactory, in particular for reusable engi…
  28. limitationrespaldada

    Solving this problem quickly and reliably is challenging because (a) it is nonlinear and non-convex, (b) the validity of the solution is heavily dependent on the accuracy of the discretization scheme, and (c) it can be difficult to select a suitable reference trajectory to initialize an iterative solution process.

    [14] Successive Convexification for 6-DoF Mars Rocket Powered Landing with Free-Final-Time, abstract arXiv:1802.03827v1
    In this paper, we employ successive convexification to solve the minimum-time 6-DoF rocket powered landing problem. The contribution of this paper is the development and demonstration of a free-final-time problem formulation that can be solved iteratively using a successive conve…
  29. resultrespaldada

    Through the use of Interior Point Method (IPM) solvers, this sequence can be solved quickly and reliably, thus enabling higher fidelity real-time guidance for rocket powered landings on Mars.

    [14] Successive Convexification for 6-DoF Mars Rocket Powered Landing with Free-Final-Time, section Successive Convexification for 6-DoF Mars Rocket Powered Landing with Free-Final-Time
    To deal with these issues, our algorithm (a) uses successive convexification to eliminate non-convexities, (b) computes the discrete linear-time-variant system matrices to ensure that the converged solution perfectly satisfies the original nonlinear dynamics, and (c) can be initi…
  30. factrespaldada

    Convex optimization has been considered a prime candidate for on-board autonomous guidance applications due to its deterministic behavior, its global optimality guarantees, its ability to provide certificates of convergence and infeasibility, and the availability of efficient interior point method (IPM) algorithms.

    [14] Successive Convexification for 6-DoF Mars Rocket Powered Landing with Free-Final-Time, section 1 Introduction
    Solving autonomous optimal landing guidance problems quickly and reliably is challenging for three reasons. First, they are nonlinear and non-convex. Second, for numerical implementations, the validity of the solution is heavily dependent on the accuracy of the discretization sch…
  31. methodrespaldada

    The stochastic optimal control problem is recast as a time-discrete Markov decision process to comply with the standard formulation of reinforcement learning.

    [7] Reinforcement Learning for Robust Trajectory Design of Interplanetary Missions, abstract DOI 10.2514/1.g005794
    This paper investigates the use of reinforcement learning for the robust design of low-thrust interplanetary trajectories in presence of severe uncertainties and disturbances, alternately modeled as Gaussian additive process noise, observation noise, and random errors in the actu…
  32. factrespaldada

    The Open Ant is a physical variant of the commonly used Gymnasium Ant environment, along with a simulation.

    [15] The Open Ant: A Robot Platform for Reinforcement Learning Research, section (top)
    The Open Ant: A Robot Platform for Reinforcement Learning Research arXiv is now an independent nonprofit! Learn more × License: CC BY 4.0 arXiv:2607.18488v1 [cs.RO] 20 Jul 2026 The Open Ant: A Robot Platform for Reinforcement Learning Research Elena Sorina Lupu, Patrick Spieler, …
  33. resultrespaldada

    Competent walking policies can be learned from scratch in approximately one hour directly from the physical robot’s experience for SARSA(λ) and Soft Actor-Critic (SAC).

    [15] The Open Ant: A Robot Platform for Reinforcement Learning Research, section (top)
    The Open Ant: A Robot Platform for Reinforcement Learning Research arXiv is now an independent nonprofit! Learn more × License: CC BY 4.0 arXiv:2607.18488v1 [cs.RO] 20 Jul 2026 The Open Ant: A Robot Platform for Reinforcement Learning Research Elena Sorina Lupu, Patrick Spieler, …
  34. resultrespaldada

    Policies learned in simulation transfer to reality for the Open Ant platform.

    [15] The Open Ant: A Robot Platform for Reinforcement Learning Research, section (top)
    The Open Ant: A Robot Platform for Reinforcement Learning Research arXiv is now an independent nonprofit! Learn more × License: CC BY 4.0 arXiv:2607.18488v1 [cs.RO] 20 Jul 2026 The Open Ant: A Robot Platform for Reinforcement Learning Research Elena Sorina Lupu, Patrick Spieler, …
  35. factrespaldada

    The Open Ant robot body is designed to look like the widely used Gymnasium Ant environment.

    [15] The Open Ant: A Robot Platform for Reinforcement Learning Research, section 1 Introduction
    Even in situations where adequate lab resources and expertise are available, the long delay caused by the assembly of the robot and troubleshooting before the first successful experiment can exhaust a considerable portion of a researcher’s typical residency. Consequently, experts…
  36. factrespaldada

    The Open Ant robot is designed to be built and maintained by AI researchers without backgrounds in robotics engineering.

    [15] The Open Ant: A Robot Platform for Reinforcement Learning Research, section 1 Introduction
    Even in situations where adequate lab resources and expertise are available, the long delay caused by the assembly of the robot and troubleshooting before the first successful experiment can exhaust a considerable portion of a researcher’s typical residency. Consequently, experts…
  37. methodrespaldada

    The Open Ant platform uses an overhead webcam to track fiducial markers to compute reward signals and the heading vector of the ant.

    [15] The Open Ant: A Robot Platform for Reinforcement Learning Research, section 1 Introduction
    Even in situations where adequate lab resources and expertise are available, the long delay caused by the assembly of the robot and troubleshooting before the first successful experiment can exhaust a considerable portion of a researcher’s typical residency. Consequently, experts…
  38. methodrespaldada

    The robot is connected by cables to AC power and to an external computer where the agent is running.

    [15] The Open Ant: A Robot Platform for Reinforcement Learning Research, section 1 Introduction
    Even in situations where adequate lab resources and expertise are available, the long delay caused by the assembly of the robot and troubleshooting before the first successful experiment can exhaust a considerable portion of a researcher’s typical residency. Consequently, experts…
  39. factrespaldada

    The Open Ant comes with a MuJoCo simulation, which can be used to learn competent policies.

    [15] The Open Ant: A Robot Platform for Reinforcement Learning Research, section 1 Introduction
    Even in situations where adequate lab resources and expertise are available, the long delay caused by the assembly of the robot and troubleshooting before the first successful experiment can exhaust a considerable portion of a researcher’s typical residency. Consequently, experts…
  40. factrespaldada

    Gym-μRTS is a fast-to-run RL environment for full-game RTS research.

    [17] Gym-$μ$RTS: Toward Affordable Full Game Real-time Strategy Games Research with Deep Reinforcement Learning, abstract arXiv:2105.13807v3
    In recent years, researchers have achieved great success in applying Deep Reinforcement Learning (DRL) algorithms to Real-time Strategy (RTS) games, creating strong autonomous agents that could defeat professional players in StarCraft~II. However, existing approaches to tackle fu…

Fuentes

  1. [1]
    Brian Gaudet, Richard Linares, Roberto Furfaro. Deep Reinforcement Learning for Six Degree-of-Freedom Planetary Powered Descent and Landing. arXiv (Cornell University), 2018.openalex · primary · DOI 10.48550/arxiv.1810.08719 · https://doi.org/10.48550/arxiv.1810.08719
  2. [2]
    Ugurcan Çelik, Mustafa Umut Demi̇rezen. Optimal Reusable Rocket Landing Guidance: A Cutting-Edge Approach Integrating Scientific Machine Learning and Enhanced Neural Networks. IEEE Access, 2024.openalex · primary · DOI 10.1109/access.2024.3359417 · https://doi.org/10.1109/access.2024.3359417
  3. [3]
    Andrea Scorsoglio, Andrea D’Ambrosio, Luca Ghilardi, Brian Gaudet, Fabio Curti, Roberto Furfaro. Image-Based Deep Reinforcement Meta-Learning for Autonomous Lunar Landing. Journal of Spacecraft and Rockets, 2021.openalex · primary · DOI 10.2514/1.a35072 · https://doi.org/10.2514/1.a35072
  4. [4]
    Julia Briden, Trey Gurga, Breanna Johnson, Abhishek Cauligi, Richard Linares. Tight Constraint Prediction of Six-Degree-of-Freedom Transformer-based Powered Descent Guidance. arXiv, 2025.arxiv · primary · https://arxiv.org/abs/2501.00930v1
  5. [5]
    Xinglun Chen, Ran Zhang, Huifeng Li. Trajectory Dispersion Control for Precision Landing Guidance of Reusable Rockets. arXiv, 2025.arxiv · primary · https://arxiv.org/abs/2504.11894v1
  6. [6]
    Yuxuan Jiang, Yujie Yang, Zhiqian Lan, Guojian Zhan, Shengbo Eben Li, Qi Sun, Jian Ma, Tianwen Yu, Changwu Zhang. Rocket Landing Control with Random Annealing Jump Start Reinforcement Learning. arXiv, 2024.arxiv · primary · https://arxiv.org/abs/2407.15083v1
  7. [7]
    Alessandro Zavoli, Lorenzo Federici. Reinforcement Learning for Robust Trajectory Design of Interplanetary Missions. Journal of Guidance Control and Dynamics, 2021.openalex · primary · DOI 10.2514/1.g005794 · https://doi.org/10.2514/1.g005794
  8. [8]
    Lorenzo Federici, Andrea Scorsoglio, Luca Ghilardi, Andrea D’Ambrosio, Boris Benedikter, Alessandro Zavoli. Image-Based Meta-Reinforcement Learning for Autonomous Guidance of an Asteroid Impactor. Journal of Guidance Control and Dynamics, 2022.openalex · primary · DOI 10.2514/1.g006832 · https://doi.org/10.2514/1.g006832
  9. [9]
    Afonso Botelho, Marc Martínez‐Estrada, Cristina Recupero, A. Fabrizi, Gabriele De Zaiacomo. Design of the landing guidance for the retro-propulsive vertical landing of a reusable rocket stage. CEAS Space Journal, 2022.openalex · primary · DOI 10.1007/s12567-022-00423-6 · https://doi.org/10.1007/s12567-022-00423-6
  10. [10]
    Lei Xie, Hongbo Zhang, Xiang Sean Zhou, Guojian Tang. A Convex Programming Method for Rocket Powered Landing With Angle of Attack Constraint. IEEE Access, 2020.openalex · primary · DOI 10.1109/access.2020.2997235 · https://doi.org/10.1109/access.2020.2997235
  11. [11]
    Julia Briden, Changrak Choi, Kyongsik Yun, Richard Linares, Abhishek Cauligi. Constraint-Informed Learning for Warm Starting Trajectory Optimization. arXiv (Cornell University), 2023.openalex · primary · DOI 10.13140/rg.2.2.35597.92646 · https://doi.org/10.13140/rg.2.2.35597.92646
  12. [12]
    Geonwoo Cho, Jaegyun Im, Doyoon Kim, Sundong Kim. Causal-Paced Deep Reinforcement Learning. arXiv, 2025.arxiv · primary · https://arxiv.org/abs/2507.02910v1
  13. [13]
    Günther Waxenegger-Wilfing, Kai Dresia, Jan C. Deeken, Michael Oschwald. A Reinforcement Learning Approach for Transient Control of Liquid Rocket Engines. IEEE Transactions on Aerospace and Electronic Systems, 2021.openalex · primary · DOI 10.1109/taes.2021.3074134 · https://doi.org/10.1109/taes.2021.3074134
  14. [14]
    Michael Szmuk, Behcet Acikmese. Successive Convexification for 6-DoF Mars Rocket Powered Landing with Free-Final-Time. arXiv, 2018.arxiv · primary · https://arxiv.org/abs/1802.03827v1
  15. [15]
    Elena Sorina Lupu, Patrick Spieler, Khurram Javed, Kris De Asis, John D. Martin, Martha Steenstrup, Joseph Modayil. The Open Ant: A Robot Platform for Reinforcement Learning Research. arXiv, 2026.arxiv · primary · https://arxiv.org/abs/2607.18488v1
  16. [16]
    Iat Hang Fong, Tengyue Li, Simon Fong, Raymond K. Wong, Antonio J. Tallón-Ballesteros. Predicting concentration levels of air pollutants by transfer learning and recurrent neural network. arXiv, 2025.arxiv · primary · https://arxiv.org/abs/2502.01654v1
  17. [17]
    Shengyi Huang, Santiago Ontañón, Chris Bamford, Lukasz Grela. Gym-$μ$RTS: Toward Affordable Full Game Real-time Strategy Games Research with Deep Reinforcement Learning. arXiv, 2021.arxiv · primary · https://arxiv.org/abs/2105.13807v3
  18. [18]
    Abdul Wahab, Raksha Kumaraswamy, Martha White. Value Bonuses using Ensemble Errors for Exploration in Reinforcement Learning. arXiv, 2026.arxiv · primary · https://arxiv.org/abs/2602.12375v1