note de recherche

Atterrissage de fusée à petite échelle : une politique de guidage apprise peut-elle surpasser une approche classique en simulation ?

Small-Scale Rocket Landing: Can a Learned Guidance Policy Outperform a Classical Approach in Simulation?

publié
lecture
34 min · 5,620 mots
Registre des affirmations
39/40 affirmations vérifiées · 18 sources

Éditions: English · عربي · Español

Réponse directe

Aucune affirmation de cet ensemble ne compare directement une politique de guidage RL apprise à une loi de guidage classique par optimisation convexe sur la même fusée à petite échelle, les mêmes métriques et les mêmes conditions de test, donc la question telle que posée ne peut pas être répondue à partir de ces preuves. Ce que les affirmations montrent, séparément, c'est que les politiques de guidage RL atteignent des trajectoires précises et économes en carburant en simulation 6-DOF pour la descente et l'atterrissage planétaires propulsés [1], et que les méthodes d'optimisation convexe telles que la convexification sans perte et la convexification successive sont la référence établie pour le guidage de descente propulsée, appréciées pour leur comportement déterministe et leurs garanties d'optimalité globale [14][4]. Une nouvelle génération de méthodes accélère les solveurs convexes en utilisant des démarrages à chaud appris, ce qui est un hybride des deux approches plutôt qu'une comparaison pure [4][11]. Les constructeurs qui ont besoin d'une réponse pour un véhicule spécifique de 10 kg et 100 m d'apogée devront mener eux-mêmes l'expérience de comparaison directe, en utilisant les méthodes décrites ci-dessous comme éléments de base.

Pourquoi il est difficile de répondre à cette question à partir des travaux publiés

Le guidage de descente propulsée pour une fusée, qu'elle soit à grande échelle ou à petite échelle, est un problème de contrôle dans lequel un véhicule doit atteindre une position et une vitesse cibles tout en brûlant le moins de propergol possible, sous réserve de limites physiques. Deux grandes familles de méthodes existent pour le résoudre : l'optimisation classique de trajectoire, le plus souvent l'optimisation convexe, et les politiques apprises entraînées par apprentissage par renforcement (RL). La question de recherche demande si une politique de guidage par réseau de neurones entraîné peut égaler ou surpasser une loi de guidage classique par optimisation convexe telle que la convexification sans perte (LCvx) sur une fusée réutilisable à petite échelle, en termes de précision d'atterrissage et d'efficacité énergétique.

Les affirmations rassemblées ici décrivent des systèmes de guidage RL et des systèmes de guidage par optimisation convexe, mais aucune ne met les deux côte à côte sur le même véhicule, le même ensemble de scénarios et la même métrique de précision ou de carburant. Certaines affirmations décrivent les performances du RL sur un atterrisseur planétaire 6-DOF [1], d'autres décrivent des gains de temps et de satisfaction de contraintes pour des démarrages à chaud appris de solveurs convexes [4][11], et d'autres décrivent l'optimisation convexe utilisée seule [14][10]. Ce sont des systèmes différents, testés dans des conditions différentes, donc leurs chiffres ne peuvent pas être placés sur une échelle commune.

Cela importe pour un constructeur car les deux familles résolvent le problème de guidage différemment. Les méthodes d'optimisation convexe, lorsqu'elles sont applicables, offrent des garanties : comportement déterministe, optimalité globale et certificats de convergence ou d'infaisabilité [14]. Les politiques RL ne portent pas ces garanties par construction, mais elles sont rapportées comme produisant des trajectoires précises et économes en carburant en simulation, et comme étant robustes au bruit et à l'incertitude des paramètres [1]. Savoir si cette robustesse et cette précision équivalent à des performances comparables ou supérieures à une loi convexe spécifique comme LCvx, sur un petit véhicule spécifique, est exactement le test de comparaison directe qui manque.

L'échelle du véhicule importe également, et aucune des affirmations n'est énoncée pour une fusée de 10 kg et 100 m d'apogée spécifiquement. Les résultats RL ci-dessous proviennent d'un atterrisseur planétaire 6-DOF [1], d'un modèle de fusée haute fidélité [6], de scénarios lunaires et d'astéroïdes [3][8]. Les résultats d'optimisation convexe proviennent de formulations d'atterrissage propulsé sur Mars [14][4] et d'un problème d'atterrissage propulsé de fusée avec une contrainte d'angle d'attaque [10]. Appliquer l'un de ces chiffres à un véhicule à petite échelle sans nouveau test serait une extrapolation que les sources ne soutiennent pas.

Le reste de cette note expose ce que chaque famille de méthodes fait réellement, ce qui a été mesuré pour chacune, et ce qu'une équipe de deux personnes devrait construire pour répondre directement à la question originale, puisque la littérature n'y répond pas encore.

À quoi ressemble une politique de guidage RL apprise

Une politique de guidage RL pour l'atterrissage de fusée est un réseau de neurones entraîné à produire des commandes de poussée directement à partir de l'état estimé du véhicule. Dans une approche, l'optimisation de politique proximale (PPO) est utilisée pour apprendre une politique qui mappe l'état estimé de l'atterrisseur directement à une poussée commandée pour chaque moteur [1]. L'entraînement a utilisé un environnement de simulation 6-DOF pour la tâche de descente et d'atterrissage, et la politique résultante a produit des trajectoires décrites comme précises et économes en carburant [1]. Le système a également montré une robustesse au bruit et à l'incertitude des paramètres du système [1].

Un détail de réglage spécifique rapporté pour ce système est que l'utilisation de taux d'actualisation différents pour les récompenses terminales et de façonnage améliore significativement les performances d'optimisation [1]. Ceci est énoncé comme une amélioration générale de la procédure d'entraînement, liée à la conception de récompense de façonnage utilisée dans cette étude particulière d'atterrisseur 6-DOF, plutôt que comme un résultat isolé. Un constructeur adoptant une structure de récompense similaire, avec à la fois une récompense terminale pour atteindre la cible et une récompense de façonnage qui guide le comportement intermédiaire, devrait s'attendre à devoir régler ces deux taux d'actualisation séparément plutôt que de partager une seule valeur entre eux.

D'autres travaux de guidage RL ciblent des problèmes connexes mais distincts en utilisant le même algorithme sous-jacent. Une implémentation open source de l'algorithme de pointe Proximal Policy Optimization est adoptée pour mener le processus d'entraînement d'un réseau de neurones profond pour la conception de trajectoire de missions interplanétaires [7]. Dans ce même travail, le problème de contrôle optimal stochastique est reformulé comme un processus de décision markovien à temps discret, pour se conformer à la formulation standard requise par l'apprentissage par renforcement [7]. Cette étape de reformulation, qui transforme un problème de contrôle optimal en temps continu en une séquence de décisions discrètes avec des états, des actions et des récompenses, est un prérequis général pour appliquer des algorithmes RL à tout problème de guidage, pas seulement le cas interplanétaire où elle est décrite.

Les approches basées sur l'image étendent le guidage RL aux cas où la politique doit agir sur une entrée visuelle plutôt que sur une estimation d'état propre. Le méta-apprentissage profond par renforcement basé sur l'image a produit une politique de guidage en boucle fermée qui atteint des erreurs de l'ordre du mètre dans différents scénarios, y compris lorsque l'environnement n'est que partiellement observé, pour l'atterrissage lunaire autonome [3]. Un système de guidage par méta-apprentissage par renforcement basé sur l'image connexe, appliqué au problème différent de guider un impacteur d'astéroïde, a correctement dirigé le vaisseau spatial vers le point d'impact final dans plus de 98 % des 500 scénarios de test [8]. Les deux résultats décrivent un comportement de guidage en boucle fermée sous incertitude quant à l'état réel, ce qui est directement pertinent pour une fusée à petite échelle qui doit également compter sur une estimation d'état imparfaite, bien qu'aucune des deux affirmations ne concerne l'atterrissage d'une fusée sur une rampe de lancement ou une barge.

Les algorithmes RL standard ne sont pas automatiquement fiables pour cette classe de tâche d'atterrissage orientée vers un objectif, et c'est une mise en garde importante pour quiconque suppose qu'un algorithme RL fonctionnera simplement sans ajustement. PPO, SAC et DSAC sont rapportés comme échouant dans les scénarios d'atterrissage de fusée orientés vers un objectif car ils reposent sur une exploration extensive, et la probabilité d'atteindre aléatoirement l'objectif diminue exponentiellement avec le temps [6]. Ce mode de défaillance est la raison pour laquelle des schémas d'entraînement spécialisés, décrits dans la section suivante, ont été proposés spécifiquement pour le contrôle d'atterrissage de fusée, plutôt que de se fier uniquement à l'entraînement PPO, SAC ou DSAC standard.

Random Annealing Jump Start : un schéma d'entraînement conçu pour ce mode de défaillance

Random Annealing Jump Start (RAJS) est une méthode d'entraînement conçue pour surmonter l'échec d'exploration des algorithmes RL standard dans l'atterrissage de fusée orienté vers un objectif. Dans RAJS, une politique guide navigue dans l'environnement pendant un horizon guide, puis une politique d'exploration prend le relais pour terminer les étapes restantes [6]. L'horizon guide est échantillonné à partir d'une distribution uniforme dont la borne supérieure diminue jusqu'à zéro en fonction des métriques de performance [6]. Cette conception permet à la politique d'exploration de commencer de plus en plus près de l'objectif à mesure que l'entraînement progresse, car au début de l'entraînement, la politique guide couvre la majeure partie de la trajectoire, et à mesure que les performances s'améliorent, la part de la politique guide dans chaque épisode diminue jusqu'à disparaître, confiant progressivement davantage de la tâche à la politique d'exploration en cours d'entraînement.

Le mécanisme cible directement le problème d'exploration exponentielle décrit pour PPO, SAC et DSAC standard. Au lieu de demander à la politique d'exploration de tomber sur un état objectif rare à partir d'un départ complètement aléatoire, RAJS lui donne un départ lancé à partir d'un état atteint par une politique guide compétente, et ne retire progressivement cette avance que lentement. Ce choix de conception est une réponse directe à la cause déclarée de l'échec des algorithmes RL standard, à savoir que la probabilité d'atteindre aléatoirement l'objectif diminue exponentiellement avec le temps [6].

Sur un modèle de fusée haute fidélité, RAJS a augmenté le taux de réussite du contrôle d'atterrissage de fusée de 8 % avec un contrôleur de base à 97 % [6]. Il s'agit d'une amélioration importante, mais elle est rapportée pour le modèle de fusée haute fidélité spécifique utilisé dans cette étude, pas pour un véhicule à petite échelle de 10 kg et 100 m d'apogée. Un constructeur ciblant une fusée à petite échelle devrait traiter ce chiffre comme une preuve que le schéma d'entraînement fonctionne sur la classe de véhicule sur laquelle il a été testé, et ne devrait pas supposer que le même saut de 8 % à 97 % se produirait sur un véhicule différent sans refaire l'expérience.

La méthode RAJS a également été validée par une évaluation extensive et des tests Hardware-in-the-Loop, qui ont affirmé l'efficacité, la faisabilité en temps réel et la fluidité du contrôleur proposé [6]. Les tests Hardware-in-the-Loop sont une étape significative vers un déploiement réel car ils exercent le contrôleur face à des contraintes de temps et d'interface réelles, pas seulement une horloge simulée. Cependant, cette validation a été effectuée sur le modèle de fusée haute fidélité utilisé dans cet article ; l'affirmation ne précise pas que ce résultat Hardware-in-the-Loop a été obtenu sur, ou est transférable à, un véhicule à petite échelle de 10 kg. Un constructeur considérant RAJS comme un contrôleur de secours pour une fusée à petite échelle devrait noter explicitement ce décalage d'échelle et de fidélité du véhicule plutôt que de supposer que le résultat de temps réel et de fluidité se transpose.

Pris ensemble, RAJS est mieux interprété comme une solution à un échec connu spécifique de l'entraînement RL standard dans ce domaine, évalué sur un modèle de véhicule, plutôt que comme une garantie générale de performance à travers les échelles de fusée. C'est une correction au moment de l'entraînement, pas un changement de loi de guidage, et elle peut en principe être associée à n'importe laquelle des idées de façonnage de récompense ou de réglage de taux d'actualisation rapportées ailleurs pour le guidage RL.

Guidage classique par optimisation convexe : convexification sans perte et successive

L'optimisation convexe est l'approche classique établie pour le guidage de descente propulsée. La convexification sans perte des contraintes non convexes de coût, de dynamique et de contrôle est souvent appliquée au problème de guidage de descente propulsée 3-DoF [4]. L'optimisation convexe a été considérée comme un candidat de premier plan pour les applications de guidage autonome embarqué en raison de son comportement déterministe, de ses garanties d'optimalité globale, de sa capacité à fournir des certificats de convergence et d'infaisabilité, et de la disponibilité d'algorithmes efficaces de point intérieur (IPM) [14].

Ces propriétés, le déterminisme, les garanties d'optimalité et les certificats de convergence, sont exactement ce qu'une politique RL n'offre pas par construction, car un réseau de neurones entraîné ne fournit aucune garantie formelle que sa sortie est optimale ou même réalisable pour un nouveau scénario non vu. Il s'agit d'une différence structurelle entre les deux familles plutôt que d'une comparaison mesurée, et il vaut la peine de l'énoncer clairement pour un constructeur qui décide à quelle famille faire confiance pour une phase d'atterrissage critique pour la sécurité.

La version 6-DoF du problème de descente propulsée est plus difficile que la version 3-DoF. Il est connu qu'il est difficile à résoudre rapidement et de manière fiable car le problème est non linéaire et non convexe, le schéma de discrétisation influence fortement la validité de la solution, et l'initialisation de la trajectoire de référence détermine si l'algorithme converge ou diverge [4]. Un article antérieur décrivant la convexification successive pour l'atterrissage propulsé de fusée sur Mars 6-DoF avec temps final libre énonce les trois mêmes difficultés en termes quasi identiques : résoudre le problème rapidement et de manière fiable est difficile car il est non linéaire et non convexe, car la validité de la solution dépend fortement de la précision du schéma de discrétisation, et car il peut être difficile de sélectionner une trajectoire de référence appropriée pour initialiser un processus de solution itératif [14].

Ce travail de convexification successive rapporte également que, grâce à l'utilisation de solveurs de méthode de point intérieur (IPM), cette séquence de sous-problèmes convexes peut être résolue rapidement et de manière fiable, permettant ainsi un guidage en temps réel de plus haute fidélité pour les atterrissages propulsés de fusée sur Mars [14]. Il s'agit d'un résultat positif spécifique au cadre d'atterrissage propulsé sur Mars et aux solveurs basés sur IPM, et il doit être interprété comme une preuve que l'approche de convexification successive, lorsqu'elle est associée à des solveurs IPM, répond à une exigence de temps réel dans ce cadre, et non comme une garantie de vitesse générale indépendante du choix du solveur.

Séparément, une méthode de programmation convexe pour l'atterrissage propulsé de fusée avec une contrainte d'angle d'attaque a montré, dans des simulations numériques, qu'elle peut trouver une trajectoire d'atterrissage réalisable où la contrainte d'angle d'attaque est satisfaite, avec de meilleures performances de convergence par rapport à une méthode de linéarisation traditionnelle [10]. Il s'agit d'une comparaison par rapport à une référence de linéarisation au sein de la famille de l'optimisation convexe, et non par rapport à une politique RL, et elle démontre que les méthodes convexes elles-mêmes continuent d'être affinées par rapport aux techniques convexes ou linéarisées antérieures.

L'atterrissage de précision sous perturbations réelles ajoute une difficulté supplémentaire au-delà des défis algorithmiques ci-dessus. L'atterrissage endoatmosphérique est soumis à des conditions perturbatrices incluant la fluctuation de la poussée du moteur, l'incertitude des coefficients aérodynamiques, la perturbation de la densité atmosphérique et la perturbation du vent [5]. C'est le contexte dans lequel toute loi de guidage, apprise ou classique, doit être jugée si elle est destinée à une véritable fusée volante à petite échelle plutôt qu'à une simple simulation propre, car un véhicule petit et léger est susceptible d'être plus sensible au vent et à la variation de poussée qu'un grand lanceur, même si aucune affirmation ne le dit directement.

Accélérer les solveurs convexes avec l'apprentissage : un hybride, pas un remplacement

Une ligne de travail distincte n'oppose pas le RL à l'optimisation convexe mais utilise plutôt l'apprentissage pour rendre l'optimisation convexe plus rapide ou plus fiable. T-PDG améliore les temps de solution jusqu'à un ordre de grandeur par rapport à la convexification sans perte (LCvx) pour le problème de guidage de descente propulsée à carburant minimum 3-DoF [4]. Il s'agit d'une comparaison de temps entre une méthode augmentée par l'apprentissage et une référence classique, sur une formulation de problème 3-DoF spécifique, et non d'une comparaison précision-contre-précision d'une politique RL par rapport à LCvx.

Le mécanisme derrière cette accélération est la prédiction des contraintes qui seront actives à la solution optimale. T-SCvx apprend à prédire l'ensemble des contraintes serrées ou actives à la solution du problème de contrôle optimal, créant un problème de taille réduite minimale initialisé uniquement avec les contraintes serrées, puis utilise la solution pour démarrer à chaud le solveur d'optimisation directe [4]. Le démarrage à chaud signifie que le solveur commence plus près de la réponse, ce qui explique la baisse des temps de résolution ; la taille réduite du problème, contenant uniquement les contraintes serrées prédites au lieu de l'ensemble complet des contraintes, est ce qui permet au solveur de converger plus rapidement qu'il ne le ferait sur la formulation complète de convexification sans perte.

Une méthode connexe, TOAST, suit une philosophie de démarrage à chaud similaire mais est évaluée sur des problèmes différents. Grâce à des expériences numériques sur un problème de rover lunaire et un problème de guidage de descente propulsée sur Mars à 3 degrés de liberté, TOAST surpasse les approches de référence en termes de temps de calcul et de satisfaction des contraintes de prédiction du réseau [11]. Encore une fois, il s'agit d'une comparaison par rapport à des approches de référence de démarrage à chaud ou d'optimisation, et non par rapport à une politique de guidage RL pure de bout en bout, et les deux problèmes de test, un rover lunaire et un cas de descente propulsée sur Mars 3-DoF, sont distincts à la fois de l'atterrisseur planétaire 6-DOF utilisé pour la politique de guidage RL dans [1] et de toute fusée à petite échelle.

Pour un constructeur, la leçon pratique de cette famille de méthodes est que l'apprentissage et l'optimisation convexe ne sont pas mutuellement exclusifs. Un système peut utiliser un réseau appris uniquement pour accélérer ou stabiliser la convergence d'un solveur convexe, en conservant les garanties du solveur, plutôt que de remplacer la prise de décision du solveur par un réseau de bout en bout comme dans les politiques de guidage RL décrites précédemment. Cette voie hybride mérite d'être considérée comme une troisième option aux côtés du RL pur et de l'optimisation convexe pure lors de la conception de l'expérience de comparaison dont il est finalement question dans cette note.

Atterrissage de précision sous dispersion : lois de guidage conçues pour l'incertitude

La précision et la robustesse à la dispersion sont des exigences centrales pour toute fusée réutilisable à petite échelle, car le matériel réel ne se comporte jamais exactement comme son modèle de simulation. Une approche proposée est une nouvelle méthode de contrôle de dispersion de trajectoire en ligne basée sur une loi de guidage de rétroaction optimale paramétrée (POFGL) [5]. Il s'agit d'une loi de guidage visant spécifiquement à contrôler la dispersion de la trajectoire réelle d'une fusée par rapport à sa trajectoire planifiée sous perturbation, plutôt qu'un optimiseur général ou une politique apprise, et elle est présentée comme une méthode en ligne, ce qui signifie qu'elle est destinée à fonctionner en continu pendant le vol plutôt que d'être résolue une fois avant le lancement.

Une limitation connue des lois de guidage de rétroaction de ce type est le comportement près de la fin de la descente. À mesure que le temps restant tend vers zéro, la sensibilité des trajectoires de commande générées augmentera significativement et tendra inévitablement vers l'infini [5]. Il s'agit d'une propriété structurelle de la loi de guidage près du toucher, et toute implémentation doit la gérer explicitement, par exemple en changeant de mode de guidage ou en plafonnant la sensibilité commandée à mesure que le temps restant approche de zéro, bien que l'affirmation elle-même ne prescrive pas quelle atténuation spécifique utiliser.

Ce problème de dispersion est énoncé dans le contexte des perturbations déjà notées pour l'atterrissage endoatmosphérique : fluctuation de la poussée du moteur, incertitude des coefficients aérodynamiques, perturbation de la densité atmosphérique et perturbation du vent [5]. Ce sont exactement les types de perturbations qu'une fusée à petite échelle, qui est plus légère et plus sensible au vent et à la variation de poussée qu'un grand lanceur, rencontrerait lors d'un test en extérieur, même si aucune affirmation ne fait cette comparaison d'échelle directement.

Aucune des affirmations de cet ensemble ne rapporte un chiffre de précision d'atterrissage ou de consommation de carburant pour POFGL qui pourrait être placé à côté du chiffre d'une politique RL dans les mêmes conditions de test. La valeur de cette section pour un constructeur est le rappel que les lois de guidage, quelle que soit leur famille, doivent être vérifiées spécifiquement pour leur comportement à mesure que le temps restant approche de zéro et sous des modèles de perturbation réalistes, et pas seulement dans un scénario nominal sans perturbation, car une loi de guidage qui fonctionne bien dans une simulation propre peut encore échouer près du toucher ou sous des perturbations de vent et de poussée qui n'ont pas été modélisées.

Ce qui a réellement été mesuré, et par rapport à quelle référence

Pour que cette note soit honnête, voici chaque résultat quantitatif ou comparatif dans l'ensemble d'affirmations, énoncé avec sa propre référence et ses propres conditions, sans fusionner les résultats de différents articles.

  • RAJS a augmenté le taux de réussite du contrôle d'atterrissage de fusée de 8 % avec un contrôleur de base à 97 %, sur un modèle de fusée haute fidélité, en utilisant RL [6].
  • T-PDG améliore les temps de solution jusqu'à un ordre de grandeur par rapport à LCvx, pour le problème de guidage de descente propulsée à carburant minimum 3-DoF [4].
  • TOAST surpasse les approches de référence en temps de calcul et en satisfaction des contraintes de prédiction du réseau, sur un problème de rover lunaire et un problème de guidage de descente propulsée sur Mars 3-DoF [11].
  • La méthode de programmation convexe avec contrainte d'angle d'attaque a de meilleures performances de convergence qu'une méthode de linéarisation traditionnelle, dans des simulations numériques, et trouve une trajectoire d'atterrissage réalisable satisfaisant cette contrainte [10].
  • Un système de guidage par méta-apprentissage par renforcement basé sur l'image a correctement dirigé le vaisseau spatial vers le point d'impact final dans plus de 98 % des 500 scénarios de test, pour un problème d'impacteur d'astéroïde [8].
  • Une politique de méta-apprentissage profond par renforcement basé sur l'image a atteint des erreurs de l'ordre du mètre dans différents scénarios, y compris en observabilité partielle, pour l'atterrissage lunaire [3].
  • Le modèle RAQResNet a atteint une perte de validation environ 300 fois inférieure à celle d'une architecture standard avec un nombre égal de paramètres entraînables, et 50 fois inférieure à celle d'une architecture standard avec deux fois le nombre de paramètres entraînables [2].

Aucun de ces résultats ne compare une politique de guidage RL et une loi de guidage convexe classique sur le même véhicule et la même métrique de précision ou de carburant. Chaque chiffre appartient à sa propre référence, taille d'échantillon et cadre, et les mélanger en un seul classement serait une mauvaise représentation des preuves. Un constructeur devrait traiter chacun de ces chiffres strictement comme un rapport sur la méthode, le véhicule et le scénario de test spécifiques nommés à côté, et ne devrait pas les moyenner ou les combiner entre articles pour produire un classement revendiqué entre le guidage RL et le guidage par optimisation convexe en général.

Infrastructure d'apprentissage connexe à connaître

Deux éléments d'infrastructure, bien que n'étant pas des méthodes de guidage elles-mêmes, constituent un contexte pertinent pour une équipe construisant et testant des politiques de guidage RL. L'Open Ant est une variante physique de l'environnement Gymnasium Ant couramment utilisé, accompagnée d'une simulation [15]. Le corps du robot Open Ant est conçu pour ressembler à l'environnement Gymnasium Ant largement utilisé [15], et il est conçu pour être construit et entretenu par des chercheurs en IA sans formation en ingénierie robotique [15]. Ce deuxième point importe pour une petite équipe de guidage de fusée : une plateforme explicitement conçue pour les chercheurs non roboticiens abaisse la barrière technique pour mener des expériences RL physiques, ce qui est directement pertinent si une équipe sans expérience approfondie en matériel aérospatial souhaite tester une politique de guidage sur du matériel réel plutôt que seulement en simulation.

Mécaniquement, l'Open Ant utilise une webcam aérienne pour suivre des marqueurs fiduciaires afin de calculer les signaux de récompense et le vecteur de direction de la fourmi [15]. Le robot est connecté par des câbles à l'alimentation secteur et à un ordinateur externe où l'agent s'exécute [15]. Cela signifie que le calcul de la récompense et la prise de décision de l'agent se font tous deux hors-bord, en s'appuyant sur une détection et un calcul externes plutôt que sur des systèmes embarqués entièrement autonomes, ce qui simplifie le matériel qu'une équipe de recherche doit construire par rapport à un robot entièrement autonome.

Du côté de l'apprentissage, des politiques de marche compétentes peuvent être apprises à partir de zéro en environ une heure directement à partir de l'expérience du robot physique, pour SARSA(λ) et Soft Actor-Critic (SAC) [15]. Séparément, l'Open Ant est livré avec une simulation MuJoCo, qui peut être utilisée pour apprendre des politiques compétentes [15], et les politiques apprises en simulation se transfèrent à la réalité pour la plateforme Open Ant [15]. Ensemble, ces deux résultats décrivent deux voies indépendantes pour obtenir une politique fonctionnelle sur cette plateforme : l'entraînement directement sur le robot physique en environ une heure, ou l'entraînement dans la simulation MuJoCo et le transfert du résultat au robot réel. Aucun de ces résultats ne concerne les fusées ou le guidage, mais le modèle, une paire simulation-matériel appariée avec un transfert sim-to-réel démontré, est exactement ce dont une équipe construisant un banc d'essai de fusée à petite échelle pour répondre à la question RL contre optimisation convexe aurait besoin.

Séparément, Gym-μRTS est décrit comme un environnement RL à exécution rapide pour la recherche en stratégie en temps réel sur jeu complet [17]. Cela n'a aucun rapport avec le guidage de fusée en termes de domaine, mais c'est une preuve que des environnements RL rapides et spécialisés sont valorisés dans la communauté de recherche RL en général comme un moyen de rendre l'itération peu coûteuse, ce qui est une considération pour toute équipe concevant un environnement d'entraînement de guidage de fusée à partir de zéro. Ni l'Open Ant ni Gym-μRTS ne répondent à quoi que ce soit sur la précision d'atterrissage ou l'efficacité énergétique ; ils sont inclus ici parce qu'ils montrent à quoi ressemblent une infrastructure simulation-matériel appariée et des boucles d'entraînement rapides dans d'autres domaines, ce qui est exactement le type d'infrastructure qu'un projet de comparaison de guidage de fusée devrait construire pour lui-même.

Autres résultats d'apprentissage par renforcement dans des problèmes adjacents

Quelques affirmations supplémentaires décrivent le RL appliqué à des problèmes adjacents au guidage d'atterrissage de fusée, utiles pour un constructeur décidant quelles techniques RL emprunter. Dans le contrôle transitoire d'un moteur-fusée liquide, un contrôleur par apprentissage par renforcement profond a atteint les performances les plus élevées par rapport à des séquences en boucle ouverte soigneusement réglées et à des contrôleurs PID [13]. La même étude a montré que la politique apprise peut atteindre différents points de fonctionnement en régime permanent et s'adapter de manière convaincante à des paramètres système changeants [13]. Il s'agit d'un problème de contrôle différent, le contrôle transitoire de moteur plutôt que le guidage de descente, mais c'est une preuve issue de la même littérature large sur le RL pour les systèmes de fusée qu'un contrôleur appris peut battre des références classiques en boucle ouverte et PID dans au moins un sous-système de fusée, et cela montre un contrôleur RL s'adaptant en ligne à des paramètres système changeants, une propriété distincte mais liée en esprit à la robustesse au bruit et à l'incertitude des paramètres rapportée pour la politique de guidage de descente 6-DOF.

Du côté de la conception d'algorithmes RL, les approches existantes de sélection de curriculum ou de tâche en RL approximativent généralement les différences de tâches en utilisant des signaux centrés sur l'agent tels que le regret ou le désaccord de valeur, mais ces signaux sont intrinsèquement dépendants de la politique et sensibles au bruit [12]. CP-DRL (Causal-Paced Deep Reinforcement Learning) est proposé comme un cadre qui répond à cette limitation en approximant la différence de modèle causal structurel (SCM) entre les tâches en utilisant uniquement des données d'interaction [12]. Il s'agit d'une méthodologie RL générale, non spécifique au guidage de fusée, mais elle est pertinente si un constructeur prévoit d'entraîner une politique de guidage à travers un curriculum de scénarios d'atterrissage de difficulté croissante, par exemple des dispersions initiales ou des perturbations de vent progressivement plus grandes, et souhaite une manière fondée et robuste au bruit de choisir sur quel scénario s'entraîner ensuite plutôt que de se fier à des signaux de regret ou de désaccord de valeur que l'affirmation déclare sensibles au bruit.

Enfin, sur le problème de récupération dans le monde réel dont il est finalement question dans cette note, un article de conception sur l'atterrissage vertical rétropropulsif d'un étage de fusée réutilisable déclare clairement que l'un des défis réside dans la stratégie et les algorithmes de guidage, navigation et contrôle (GNC) de récupération, en particulier ceux de la phase d'atterrissage propulsé, qui doivent permettre un atterrissage précis avec de faibles marges de carburant et des dispersions significatives [9]. Il s'agit d'une formulation de la difficulté du problème, et non d'une solution ou d'un chiffre, et elle s'applique à la récupération de fusée réutilisable à grande échelle. Elle est énoncée ici comme contexte pour expliquer pourquoi la question du guidage importe, indépendamment de l'échelle : la tension entre précision, faibles marges de carburant et dispersions significatives est la même tension que toute expérience de comparaison RL contre convexe à petite échelle doit être conçue pour sonder.

Aucune de ces trois affirmations ne porte directement sur la comparaison RL contre convexe à petite échelle, mais chacune précise ce à quoi un constructeur devrait s'attendre à emprunter, et d'où : techniques de contrôle et preuves d'adaptation en ligne issues du travail sur les transitoires de moteur, méthodes de curriculum issues de CP-DRL, et formulation du problème issues de la conception GNC de récupération.

Limites et questions ouvertes

La limitation centrale est directe : cet ensemble de preuves ne contient aucune expérience dans laquelle une politique de guidage RL et une loi de guidage classique par optimisation convexe sont exécutées sur la même fusée à petite échelle, dans les mêmes scénarios de test, et notées sur les mêmes métriques de précision et de carburant. Chaque résultat quantitatif ci-dessus appartient à son propre modèle de véhicule, référence et base de comparaison, et les chiffres ne peuvent pas être combinés en un classement entre les deux familles de méthodes sans aller au-delà de ce qu'une seule affirmation énonce.

Une deuxième limitation est le décalage d'échelle. Les résultats RL rapportés ici proviennent d'une simulation d'atterrisseur planétaire 6-DOF [1], d'un modèle de fusée haute fidélité [6], de scénarios d'impacteur d'astéroïde et d'atterrissage lunaire [8][3], dont aucun n'est déclaré être une fusée à petite échelle de 10 kg et 100 m d'apogée. De même, les résultats d'optimisation convexe proviennent d'atterrissage propulsé sur Mars et de formulations 3-DoF ou 6-DoF [14][4][10], et non d'un véhicule à petite échelle. Appliquer les chiffres rapportés de l'une ou l'autre famille à une fusée à petite échelle est une extrapolation que les affirmations ne soutiennent pas, et un constructeur doit refaire les expériences pertinentes sur le véhicule réel d'intérêt avant de tirer des conclusions.

Une troisième limitation concerne la fiabilité de l'entraînement. Les algorithmes RL standard, y compris PPO, SAC et DSAC, sont rapportés comme échouant dans les scénarios d'atterrissage de fusée orientés vers un objectif en raison de leur dépendance à une exploration extensive [6]. Cela signifie qu'un constructeur ne peut pas simplement appliquer une implémentation PPO standard, comme utilisée ailleurs pour la conception de trajectoire interplanétaire [7], et s'attendre à ce qu'elle réussisse l'atterrissage sans un schéma d'entraînement spécialisé tel que RAJS, ou des choix de façonnage de récompense tels que le réglage du taux d'actualisation rapporté pour l'atterrisseur planétaire 6-DOF [1].

Une quatrième limitation concerne les affirmations de robustesse qui sont spécifiques au scénario. Les tests Hardware-in-the-Loop pour RAJS ont affirmé la faisabilité en temps réel et la fluidité sur le modèle de fusée haute fidélité testé [6], et cela ne doit pas être interprété comme une preuve pour un véhicule d'échelle ou de fidélité différente. De même, le problème de sensibilité structurelle à mesure que le temps restant approche de zéro, rapporté pour POFGL [5], et la liste des perturbations endoatmosphériques [5], s'appliquent tous deux à la loi de guidage et au régime de vol spécifiques discutés, et un constructeur doit revérifier ces comportements pour toute nouvelle loi de guidage et tout nouveau véhicule plutôt que de supposer qu'ils se transfèrent.

Une cinquième limitation, plus générale, est que les garanties de l'optimisation convexe et les rapports de performance RL ne sont pas mesurés en termes comparables, même en principe, dans cet ensemble de preuves. Les avantages de l'optimisation convexe sont décrits comme un comportement déterministe, des garanties d'optimalité globale et des certificats de convergence ou d'infaisabilité [14], qui sont des propriétés de la structure de l'algorithme, et non des chiffres mesurés sur un ensemble de test. Les avantages rapportés du RL, précision, efficacité énergétique et robustesse au bruit [1], ou taux de réussite sur un véhicule spécifique [6], sont des chiffres empiriques provenant de scénarios de test spécifiques. Une comparaison équitable nécessiterait de mesurer les deux familles sur le même terrain empirique, par exemple l'erreur d'atterrissage et le carburant consommé sur un ensemble de scénarios identique, ce qu'aucune affirmation ici ne fournit.

Comment le construire, ou comment l'utiliser

La procédure suivante est destinée à une équipe qui souhaite réellement produire la comparaison directe manquante pour une fusée à petite échelle, en utilisant les méthodes décrites dans les affirmations ci-dessus comme éléments de base. Chaque choix de conception ci-dessous au-delà de ce que les affirmations énoncent (valeurs de paramètres spécifiques, types d'intégrateur) est uniquement illustratif, choisi pour rendre la procédure concrète, et n'est pas présenté comme provenant d'une source citée.

  1. Définir le véhicule et l'ensemble de scénarios. Fixer le véhicule : 10 kg de masse à sec, 100 m d'apogée, avec des propriétés de masse, poussée et aérodynamiques spécifiées. Définir un ensemble fixe de conditions initiales (dispersions de position, vitesse, attitude) que les deux méthodes de guidage seront testées, car aucun des articles cités ne partage une référence commune que vous puissiez réutiliser directement.
  2. Construire la simulation. Implémenter la dynamique du corps rigide pour le véhicule, en 3-DoF ou 6-DoF selon la formulation que vous choisissez pour la référence classique. Aucune affirmation citée ne spécifie d'intégrateur ou de logiciel de simulation ; choisissez-en un approprié à vos besoins de précision et de vitesse et documentez-le explicitement pour la reproductibilité.
  3. Implémenter d'abord la référence classique. Implémenter la convexification sans perte (LCvx), souvent appliquée au problème de guidage de descente propulsée 3-DoF [4]. Si vous avez besoin de 6-DoF, sachez qu'il est rapporté comme plus difficile à résoudre rapidement et de manière fiable, en raison de la nature non linéaire et non convexe du problème, de l'influence du schéma de discrétisation sur la validité de la solution et du rôle de la trajectoire de référence dans la détermination de la convergence ou de la divergence [4][14].
  4. Vérifier la référence par rapport aux difficultés connues. Tester la sensibilité du solveur convexe au schéma de discrétisation et à l'initialisation de la trajectoire de référence, car les deux sont nommés comme causes de convergence ou de divergence [4][14]. Si vous utilisez un solveur de méthode de point intérieur, vérifiez s'il respecte un budget de temps de résolution en temps réel, comme rapporté pour l'approche de convexification successive sur l'atterrissage propulsé sur Mars [14]. Enregistrez le temps de résolution et le taux de réussite sur votre ensemble de scénarios avant de toucher à une méthode apprise.
  5. Choisir un algorithme RL et formuler le MDP. Reformuler le problème de guidage comme un processus de décision markovien à temps discret, en suivant la même reformulation effectuée pour un problème de contrôle optimal stochastique connexe [7]. Utiliser Proximal Policy Optimization (PPO) comme premier algorithme, suivant son utilisation pour le mappage état-poussée dans la descente et l'atterrissage planétaires propulsés 6-DOF [1] ; soyez prêt à ce qu'il échoue seul dans une tâche d'atterrissage strictement orientée vers un objectif, car les algorithmes RL standard, y compris PPO, sont rapportés comme échouant ici en raison de la difficulté d'exploration [6].
  6. Si PPO seul échoue, ajouter un schéma d'entraînement à exploration guidée. Implémenter un schéma d'entraînement dans l'esprit de Random Annealing Jump Start : une politique guide qui navigue dans l'environnement pendant un horizon guide échantillonné, passant le relais à une politique d'exploration pour le reste de l'épisode, avec la borne supérieure de l'horizon diminuant jusqu'à zéro à mesure que les performances s'améliorent [6]. C'est la méthode rapportée pour augmenter le taux de réussite de 8 % à 97 % sur un modèle de fusée haute fidélité [6] ; traitez ce chiffre comme une preuve que la technique fonctionne sur ce véhicule, pas comme une garantie pour le vôtre.
  7. Régler la structure de récompense. Envisager d'utiliser des taux d'actualisation différents pour la récompense terminale et la récompense de façonnage, car cela est rapporté comme améliorant les performances d'optimisation pour un atterrisseur planétaire 6-DOF [1]. Validez ce choix indépendamment pour votre propre formulation de récompense, car l'affirmation le rapporte pour la conception de récompense d'une étude spécifique.
  8. Ajouter des tests de robustesse au bruit et à l'incertitude des paramètres. Exécuter à la fois la politique RL entraînée et la référence convexe contre du bruit de capteur injecté et des paramètres de véhicule perturbés, car la robustesse au bruit et à l'incertitude des paramètres est une propriété rapportée pour le système de guidage RL 6-DOF [1]. Rapporter le taux de réussite et l'erreur d'atterrissage pour chaque niveau de perturbation pour les deux méthodes, sur le même ensemble de perturbations, afin que la comparaison soit équitable.
  9. Mesurer la précision d'atterrissage et la consommation de carburant pour les deux méthodes, côte à côte. Pour chacun des scénarios fixes de l'étape 1, enregistrer l'erreur de position et de vitesse finale et le propergol total consommé, pour la politique RL et la référence convexe. C'est l'expérience centrale que la littérature examinée ne fournit pas, alors concevez-la soigneusement : mêmes scénarios, mêmes modèles de perturbation, mêmes métriques, même véhicule.
  10. Envisager une approche hybride de démarrage à chaud comme troisième condition. Optionnellement, implémenter un démarrage à chaud appris pour le solveur convexe, dans l'esprit de T-PDG ou T-SCvx, qui apprennent à prédire l'ensemble des contraintes serrées ou actives à la solution optimale et utilisent cette prédiction pour construire un problème de taille réduite qui démarre à chaud le solveur [4]. Comparez son temps de résolution par rapport à LCvx simple, car T-PDG est rapporté comme améliorant les temps de solution jusqu'à un ordre de grandeur par rapport à LCvx pour le problème à carburant minimum 3-DoF [4], et incluez cet hybride comme troisième condition aux côtés du RL pur et de l'optimisation convexe pure.
  11. Tester sous contrainte près du toucher. Si vous utilisez une loi de guidage de type rétroaction, vérifiez le comportement à mesure que le temps restant approche de zéro, car la sensibilité des trajectoires commandées est rapportée comme augmentant fortement et tendant vers l'infini dans ce régime pour une telle loi [5]. Plafonnez ou changez de mode de guidage près du toucher si nécessaire, et documentez le changement explicitement car il n'est pas lui-même validé dans l'affirmation citée.
  12. Rapporter les résultats honnêtement. Indiquez le véhicule, l'ensemble de scénarios et les métriques utilisés, et n'extrapolez pas vos résultats à petite échelle aux fusées à grande échelle ou vice versa, car aucun des résultats cités n'a été obtenu sur un véhicule de 10 kg et 100 m d'apogée. Si votre politique RL nécessite des tests Hardware-in-the-Loop avant le vol, notez que de tels tests ont été utilisés ailleurs pour vérifier la faisabilité en temps réel et la fluidité pour un modèle de fusée différent et de plus haute fidélité [6], et traitez tout transfert de ce résultat à votre véhicule plus petit comme non vérifié jusqu'à ce que vous l'exécutiez vous-même.
function pipeline():
    baseline_result = run_LCvx(vehicle, scenarios)            # selon [4]
    rl_policy = train_PPO(vehicle_MDP)                          # selon [1],[7]
    if rl_policy.success_rate is low:
        rl_policy = train_with_guided_exploration(vehicle_MDP)  # selon [6]
    rl_result = evaluate(rl_policy, scenarios)
    hybrid_result = run_warm_started_solver(vehicle, scenarios) # selon [4], optionnel
    compare(baseline_result, rl_result, hybrid_result)
    # cette comparaison à trois voies est la preuve manquante, non trouvée dans aucune affirmation citée

Ce que nous construirions

Nous construirions un petit harnais de comparaison entièrement simulé pour une fusée de 10 kg et 100 m d'apogée, car la littérature examinée ne contient aucun test de comparaison directe de ce type. En quelques semaines, une équipe de deux personnes pourrait implémenter la dynamique du corps rigide 3-DoF pour le véhicule ; implémenter la convexification sans perte (LCvx) comme référence classique, en suivant la formulation décrite pour le problème de guidage de descente propulsée à carburant minimum 3-DoF [4] ; et entraîner une politique de guidage basée sur PPO mappant l'état à la poussée, en suivant l'approche de mappage utilisée pour la descente et l'atterrissage planétaires propulsés 6-DOF [1], en ajoutant un schéma d'entraînement à exploration guidée dans l'esprit de Random Annealing Jump Start si PPO simple ne converge pas, car PPO standard est rapporté comme échouant dans les tâches d'atterrissage orientées vers un objectif [6].

Nous jugerions le résultat sur l'erreur de position et de vitesse d'atterrissage et le propergol total utilisé, sur un ensemble fixe d'au moins 50 scénarios de conditions initiales avec du bruit de capteur injecté et une perturbation des paramètres, en comparant la politique RL directement à la référence LCvx sur des scénarios identiques, car la robustesse au bruit et à l'incertitude des paramètres est une propriété revendiquée pour le guidage RL dans la littérature [1] mais jamais testée contre une référence convexe. Le succès serait un tableau clair et reproductible de l'erreur de position, de l'erreur de vitesse et du carburant utilisé pour les deux méthodes sur tous les scénarios, plus le temps de résolution ou le temps d'inférence pour chacun.

Cela s'exécuterait entièrement en simulation sur une seule station de travail avec un GPU moderne pour l'entraînement PPO, probablement pour quelques centaines de dollars de calcul compte tenu du petit véhicule et des courtes durées d'épisode. Cela ne nécessiterait pas de matériel physique, bien qu'un suivi naturel, empruntant la philosophie de simulation et matériel appariés démontrée par la plateforme Open Ant [15], serait de construire un petit banc d'essai physique par la suite pour vérifier si le classement simulé entre RL et LCvx survit au contact avec un véhicule réel.

Registre des affirmations

  1. methodétayée

    Proximal policy optimization (PPO) is used to learn a policy mapping the lander's estimated state directly to a commanded thrust for each engine.

    [1] Deep Reinforcement Learning for Six Degree-of-Freedom Planetary Powered Descent and Landing, abstract DOI 10.48550/arxiv.1810.08719
    Future Mars missions will require advanced guidance, navigation, and control algorithms for the powered descent phase to target specific surface locations and achieve pinpoint accuracy (landing error ellipse $<$ 5 m radius). The latter requires both a navigation system capable of…
  2. methodétayée

    Using different discount rates for terminal and shaping rewards significantly enhances optimization performance.

    [1] Deep Reinforcement Learning for Six Degree-of-Freedom Planetary Powered Descent and Landing, abstract DOI 10.48550/arxiv.1810.08719
    Future Mars missions will require advanced guidance, navigation, and control algorithms for the powered descent phase to target specific surface locations and achieve pinpoint accuracy (landing error ellipse $<$ 5 m radius). The latter requires both a navigation system capable of…
  3. resultétayée

    The RL policy results in accurate and fuel-efficient trajectories in a 6-DOF simulation environment.

    [1] Deep Reinforcement Learning for Six Degree-of-Freedom Planetary Powered Descent and Landing, abstract DOI 10.48550/arxiv.1810.08719
    Future Mars missions will require advanced guidance, navigation, and control algorithms for the powered descent phase to target specific surface locations and achieve pinpoint accuracy (landing error ellipse $<$ 5 m radius). The latter requires both a navigation system capable of…
  4. resultétayée

    The guidance system demonstrates robustness to noise and system parameter uncertainty.

    [1] Deep Reinforcement Learning for Six Degree-of-Freedom Planetary Powered Descent and Landing, abstract DOI 10.48550/arxiv.1810.08719
    Future Mars missions will require advanced guidance, navigation, and control algorithms for the powered descent phase to target specific surface locations and achieve pinpoint accuracy (landing error ellipse $<$ 5 m radius). The latter requires both a navigation system capable of…
  5. resultétayée

    T-PDG improves solution times by up to an order of magnitude compared to lossless convexification (LCvx) for the 3-DoF minimum fuel powered descent guidance problem.

    [4] Tight Constraint Prediction of Six-Degree-of-Freedom Transformer-based Powered Descent Guidance, abstract arXiv:2501.00930v1
    This work introduces Transformer-based Successive Convexification (T-SCvx), an extension of Transformer-based Powered Descent Guidance (T-PDG), generalizable for efficient six-degree-of-freedom (DoF) fuel-optimal powered descent trajectory generation. Our approach significantly e…
  6. methodétayée

    T-SCvx learns to predict the set of tight or active constraints at the optimal control problem's solution, creating a minimal reduced-size problem initialized with only the tight constraints, then uses the solution to warm-start the direct optimization solver.

    [4] Tight Constraint Prediction of Six-Degree-of-Freedom Transformer-based Powered Descent Guidance, abstract arXiv:2501.00930v1
    This work introduces Transformer-based Successive Convexification (T-SCvx), an extension of Transformer-based Powered Descent Guidance (T-PDG), generalizable for efficient six-degree-of-freedom (DoF) fuel-optimal powered descent trajectory generation. Our approach significantly e…
  7. resultrejetée

    T-SCvx enables onboard computation of real-time guidance trajectories, demonstrated by a 6-DoF Mars powered landing application problem.

    [4] Tight Constraint Prediction of Six-Degree-of-Freedom Transformer-based Powered Descent Guidance, section Tight Constraint Prediction of Six-Degree-of-Freedom Transformer-based Powered Descent Guidance
    Richard Linares Note: Rockwell International Career Development Professor and Associate Professor, Department of Aeronautics and Astronautics, 125 Massachusetts Avenue. Senior Member AIAA. Affiliation: Department of Aeronautics and Astronautics, Massachusetts Institute of Technol…
  8. limitationétayée

    6-DoF powered descent guidance is known to be challenging to solve quickly and reliably due to the nonlinear and non-convex nature of the problem, the discretization scheme heavily influencing solution validity, and reference trajectory initialization determining algorithm convergence or divergence.

    [4] Tight Constraint Prediction of Six-Degree-of-Freedom Transformer-based Powered Descent Guidance, section Tight Constraint Prediction of Six-Degree-of-Freedom Transformer-based Powered Descent Guidance
    6-DoF powered descent guidance is known to be challenging to solve quickly and reliably due to the nonlinear and non-convex nature of the problem, the discretization scheme heavily influencing solution validity, and reference trajectory initialization determining algorithm conver…
  9. methodétayée

    Lossless convexification of nonconvex cost, dynamics, and control constraints is often applied to the 3-DoF powered descent guidance problem.

    [4] Tight Constraint Prediction of Six-Degree-of-Freedom Transformer-based Powered Descent Guidance, section 2 Introduction
    For common classes of problems, application of Pontryagin’s Maximum Principle [8] yield analytical solutions, but these methods fall short for trajectory generation as they are applicable to a limited set of mission constraints and objective functions [9, 10, 11, 12]. Moreover, w…
  10. methodétayée

    A novel online trajectory dispersion control method based on a Parameterized Optimal Feedback Guidance Law (POFGL) is proposed.

    [5] Trajectory Dispersion Control for Precision Landing Guidance of Reusable Rockets, abstract arXiv:2504.11894v1
    This article is an engineering note, and formal abstract is omitted in accordance with the requirements of the journal. The main idea of this note is as follows. In endoatmospheric landing of reusable rockets, there exist various kinds of disturbances that can induce the trajecto…
  11. limitationétayée

    As the time-to-go tends to zero, the sensitivity of the generated guidance command trajectories will significantly increase and inevitably tend to infinity.

    [5] Trajectory Dispersion Control for Precision Landing Guidance of Reusable Rockets, section 1 Introduction
    The explicit guidance method attenuates the effect of disturbances by regenerating feasible and/or optimal trajectories at each guidance period. The representative explicit guidance methods mainly contain E-guidance [1], Apollo powered descent guidance [2], Zero-Effort-Miss/Zero-…
  12. factétayée

    Endoatmospheric landing is subjected to more disturbing conditions, including engine thrust fluctuation, aerodynamic coefficient uncertainty, atmospheric density perturbation, and wind disturbance.

    [5] Trajectory Dispersion Control for Precision Landing Guidance of Reusable Rockets, section 1 Introduction
    Precision landing guidance is a critical enabling technology for reusable rocket recovery. Compared with lunar landing [1, 2] and planetary landing [3, 4], endoatmospheric landing is subjected to more disturbing conditions, including engine thrust fluctuation, aerodynamic coeffic…
  13. resultétayée

    Random Annealing Jump Start (RAJS) elevates the success rate of rocket landing control from 8% with a baseline controller to 97% on a high-fidelity rocket model using RL.

    [6] Rocket Landing Control with Random Annealing Jump Start Reinforcement Learning, abstract arXiv:2407.15083v1
    Rocket recycling is a crucial pursuit in aerospace technology, aimed at reducing costs and environmental impact in space exploration. The primary focus centers on rocket landing control, involving the guidance of a nonlinear underactuated rocket with limited fuel in real-time. Th…
  14. methodétayée

    In RAJS, the guide policy navigates the environment for the guide horizon, followed by the exploration policy taking charge to complete remaining steps; the guide horizon is sampled from a uniform distribution with its upper bound annealing to zero based on performance metrics.

    [6] Rocket Landing Control with Random Annealing Jump Start Reinforcement Learning, abstract arXiv:2407.15083v1
    Rocket recycling is a crucial pursuit in aerospace technology, aimed at reducing costs and environmental impact in space exploration. The primary focus centers on rocket landing control, involving the guidance of a nonlinear underactuated rocket with limited fuel in real-time. Th…
  15. limitationétayée

    Standard RL algorithms, such as PPO, SAC and DSAC, fail in goal-oriented rocket landing scenarios due to their reliance on extensive exploration; the likelihood of randomly reaching the goal diminishes exponentially over time.

    [6] Rocket Landing Control with Random Annealing Jump Start Reinforcement Learning, section I Introduction
    RL offers a powerful paradigm to iteratively optimize policies for control problems by maximizing the expected cumulative rewards. It has shown remarkable success in various domains, including video games [1], board games [2], robotics [3], and autonomous driving [4]. In these pr…
  16. resultétayée

    The RAQResNet model achieved a validation loss approximately 300 times lower than the standard architecture with an equal number of trainable parameters and 50 times lower than the standard architecture with twice the number of trainable parameters.

    [2] Optimal Reusable Rocket Landing Guidance: A Cutting-Edge Approach Integrating Scientific Machine Learning and Enhanced Neural Networks, abstract DOI 10.1109/access.2024.3359417
    This study presents an innovative approach that utilizes scientific machine learning and two types of enhanced neural networks for modeling a parametric guidance algorithm within the framework of ordinary differential equations to optimize the landing phase of reusable rockets. O…
  17. resultétayée

    The resulting closed-loop guidance policy from image-based reinforcement meta-learning reaches errors in the order of meters in different scenarios, even when the environment is partially observed.

    [3] Image-Based Deep Reinforcement Meta-Learning for Autonomous Lunar Landing, abstract DOI 10.2514/1.a35072
    Future exploration and human missions on large planetary bodies (e.g., moon, Mars) will require advanced guidance navigation and control algorithms for the powered descent phase, which must be capable of unprecedented levels of autonomy. The advent of machine learning, and specif…
  18. resultétayée

    The proposed method is validated through extensive evaluation and Hardware-in-the-Loop testing, affirming the effectiveness, real-time feasibility, and smoothness of the proposed controller.

    [6] Rocket Landing Control with Random Annealing Jump Start Reinforcement Learning, section Rocket Landing Control with Random Annealing Jump Start Reinforcement Learning
    Additional enhancements, including cascading jump start, refined reward and terminal condition, and action smoothness regulation, further improve policy performance and practical applicability. The proposed method is validated through extensive evaluation and Hardware-in-the-Loop…
  19. methodétayée

    An open-source implementation of the state-of-the-art algorithm Proximal Policy Optimization is adopted to carry out the training process of a deep neural network.

    [7] Reinforcement Learning for Robust Trajectory Design of Interplanetary Missions, abstract DOI 10.2514/1.g005794
    This paper investigates the use of reinforcement learning for the robust design of low-thrust interplanetary trajectories in presence of severe uncertainties and disturbances, alternately modeled as Gaussian additive process noise, observation noise, and random errors in the actu…
  20. resultétayée

    Numerical results show that the guidance system can correctly drive the spacecraft toward the final impact point in more than 98% of the 500 test scenarios.

    [8] Image-Based Meta-Reinforcement Learning for Autonomous Guidance of an Asteroid Impactor, abstract DOI 10.2514/1.g006832
    This paper focuses on the use of meta-reinforcement learning for the autonomous guidance of a spacecraft during the terminal phase of an impact mission toward a binary asteroid system. The control policy is replaced by a convolutional-recurrent neural network, which is used to ma…
  21. factétayée

    One of the challenges lies in the recovery GNC strategy and algorithms, in particular those of the powered-landing phase, which must enable a precise landing with low fuel margins and significant dispersions.

    [9] Design of the landing guidance for the retro-propulsive vertical landing of a reusable rocket stage, abstract DOI 10.1007/s12567-022-00423-6
    Abstract Launcher reusability is the most effective way of reducing access to space costs, but remains a great technical challenge for the European aerospace industry. One of the challenges lies in the recovery GNC strategy and algorithms, in particular those of the powered-landi…
  22. resultétayée

    Numerical simulations show that the proposed method can find a feasible landing trajectory where the AOA constraint is satisfied and has a better convergence performance compared with the traditional linearization method.

    [10] A Convex Programming Method for Rocket Powered Landing With Angle of Attack Constraint, abstract DOI 10.1109/access.2020.2997235
    Real time trajectory planning is vital in rocket precision powered landing guidance. Due to the nonconvex angle of attack (AOA) constraint and other constraints, including nonlinear dynamics and thrust constraint, the powered landing trajectory planning problem is highly nonconve…
  23. resultétayée

    Through numerical experiments on a Lunar rover problem and a 3-degrees-of-freedom Mars powered descent guidance problem, we demonstrate that TOAST outperforms benchmark approaches in terms of both computation times and network prediction constraint satisfaction.

    [11] Constraint-Informed Learning for Warm Starting Trajectory Optimization, abstract DOI 10.13140/rg.2.2.35597.92646
    Future spacecraft and surface robotic missions require increasingly capable autonomy stacks for exploring challenging and unstructured domains, and trajectory optimization will be a cornerstone of such autonomy stacks. However, the nonlinear optimization solvers required remain t…
  24. limitationétayée

    Existing approaches typically approximate task differences using agent-centric signals, such as regret or value disagreement, but these are inherently policy-dependent and sensitive to noise.

    [12] Causal-Paced Deep Reinforcement Learning, section 1 Introduction
    Just as a child first learns to crawl before walking and running, intelligent behavior in complex environments is rarely acquired in a single leap. Instead, learning unfolds through a gradual accumulation of simpler skills that scaffold more advanced capabilities. This principle …
  25. methodétayée

    We propose Causal-Paced Deep Reinforcement Learning (CP-DRL), a framework that addresses this limitation by approximating the SCM difference between tasks using only interaction data.

    [12] Causal-Paced Deep Reinforcement Learning, section 1 Introduction
    While SCM-based comparison provides a principled way to quantify task differences, it relies on access to the true causal structure, which is rarely available in realistic RL environments (Zanga et al., 2022). In this work, we propose Causal-Paced Deep Reinforcement Learning (CP-…
  26. resultétayée

    Compared to carefully tuned open-loop sequences and PID controllers, the deep reinforcement learning controller achieves the highest performance.

    [13] A Reinforcement Learning Approach for Transient Control of Liquid Rocket Engines, abstract DOI 10.1109/taes.2021.3074134
    Nowadays, liquid rocket engines use closed-loop control at most near-steady operating conditions. The control of the transient phases is traditionally performed in open loop due to highly nonlinear system dynamics. This situation is unsatisfactory, in particular for reusable engi…
  27. resultétayée

    It is shown that the learned policy can reach different steady-state operating points and convincingly adapt to changing system parameters.

    [13] A Reinforcement Learning Approach for Transient Control of Liquid Rocket Engines, abstract DOI 10.1109/taes.2021.3074134
    Nowadays, liquid rocket engines use closed-loop control at most near-steady operating conditions. The control of the transient phases is traditionally performed in open loop due to highly nonlinear system dynamics. This situation is unsatisfactory, in particular for reusable engi…
  28. limitationétayée

    Solving this problem quickly and reliably is challenging because (a) it is nonlinear and non-convex, (b) the validity of the solution is heavily dependent on the accuracy of the discretization scheme, and (c) it can be difficult to select a suitable reference trajectory to initialize an iterative solution process.

    [14] Successive Convexification for 6-DoF Mars Rocket Powered Landing with Free-Final-Time, abstract arXiv:1802.03827v1
    In this paper, we employ successive convexification to solve the minimum-time 6-DoF rocket powered landing problem. The contribution of this paper is the development and demonstration of a free-final-time problem formulation that can be solved iteratively using a successive conve…
  29. resultétayée

    Through the use of Interior Point Method (IPM) solvers, this sequence can be solved quickly and reliably, thus enabling higher fidelity real-time guidance for rocket powered landings on Mars.

    [14] Successive Convexification for 6-DoF Mars Rocket Powered Landing with Free-Final-Time, section Successive Convexification for 6-DoF Mars Rocket Powered Landing with Free-Final-Time
    To deal with these issues, our algorithm (a) uses successive convexification to eliminate non-convexities, (b) computes the discrete linear-time-variant system matrices to ensure that the converged solution perfectly satisfies the original nonlinear dynamics, and (c) can be initi…
  30. factétayée

    Convex optimization has been considered a prime candidate for on-board autonomous guidance applications due to its deterministic behavior, its global optimality guarantees, its ability to provide certificates of convergence and infeasibility, and the availability of efficient interior point method (IPM) algorithms.

    [14] Successive Convexification for 6-DoF Mars Rocket Powered Landing with Free-Final-Time, section 1 Introduction
    Solving autonomous optimal landing guidance problems quickly and reliably is challenging for three reasons. First, they are nonlinear and non-convex. Second, for numerical implementations, the validity of the solution is heavily dependent on the accuracy of the discretization sch…
  31. methodétayée

    The stochastic optimal control problem is recast as a time-discrete Markov decision process to comply with the standard formulation of reinforcement learning.

    [7] Reinforcement Learning for Robust Trajectory Design of Interplanetary Missions, abstract DOI 10.2514/1.g005794
    This paper investigates the use of reinforcement learning for the robust design of low-thrust interplanetary trajectories in presence of severe uncertainties and disturbances, alternately modeled as Gaussian additive process noise, observation noise, and random errors in the actu…
  32. factétayée

    The Open Ant is a physical variant of the commonly used Gymnasium Ant environment, along with a simulation.

    [15] The Open Ant: A Robot Platform for Reinforcement Learning Research, section (top)
    The Open Ant: A Robot Platform for Reinforcement Learning Research arXiv is now an independent nonprofit! Learn more × License: CC BY 4.0 arXiv:2607.18488v1 [cs.RO] 20 Jul 2026 The Open Ant: A Robot Platform for Reinforcement Learning Research Elena Sorina Lupu, Patrick Spieler, …
  33. resultétayée

    Competent walking policies can be learned from scratch in approximately one hour directly from the physical robot’s experience for SARSA(λ) and Soft Actor-Critic (SAC).

    [15] The Open Ant: A Robot Platform for Reinforcement Learning Research, section (top)
    The Open Ant: A Robot Platform for Reinforcement Learning Research arXiv is now an independent nonprofit! Learn more × License: CC BY 4.0 arXiv:2607.18488v1 [cs.RO] 20 Jul 2026 The Open Ant: A Robot Platform for Reinforcement Learning Research Elena Sorina Lupu, Patrick Spieler, …
  34. resultétayée

    Policies learned in simulation transfer to reality for the Open Ant platform.

    [15] The Open Ant: A Robot Platform for Reinforcement Learning Research, section (top)
    The Open Ant: A Robot Platform for Reinforcement Learning Research arXiv is now an independent nonprofit! Learn more × License: CC BY 4.0 arXiv:2607.18488v1 [cs.RO] 20 Jul 2026 The Open Ant: A Robot Platform for Reinforcement Learning Research Elena Sorina Lupu, Patrick Spieler, …
  35. factétayée

    The Open Ant robot body is designed to look like the widely used Gymnasium Ant environment.

    [15] The Open Ant: A Robot Platform for Reinforcement Learning Research, section 1 Introduction
    Even in situations where adequate lab resources and expertise are available, the long delay caused by the assembly of the robot and troubleshooting before the first successful experiment can exhaust a considerable portion of a researcher’s typical residency. Consequently, experts…
  36. factétayée

    The Open Ant robot is designed to be built and maintained by AI researchers without backgrounds in robotics engineering.

    [15] The Open Ant: A Robot Platform for Reinforcement Learning Research, section 1 Introduction
    Even in situations where adequate lab resources and expertise are available, the long delay caused by the assembly of the robot and troubleshooting before the first successful experiment can exhaust a considerable portion of a researcher’s typical residency. Consequently, experts…
  37. methodétayée

    The Open Ant platform uses an overhead webcam to track fiducial markers to compute reward signals and the heading vector of the ant.

    [15] The Open Ant: A Robot Platform for Reinforcement Learning Research, section 1 Introduction
    Even in situations where adequate lab resources and expertise are available, the long delay caused by the assembly of the robot and troubleshooting before the first successful experiment can exhaust a considerable portion of a researcher’s typical residency. Consequently, experts…
  38. methodétayée

    The robot is connected by cables to AC power and to an external computer where the agent is running.

    [15] The Open Ant: A Robot Platform for Reinforcement Learning Research, section 1 Introduction
    Even in situations where adequate lab resources and expertise are available, the long delay caused by the assembly of the robot and troubleshooting before the first successful experiment can exhaust a considerable portion of a researcher’s typical residency. Consequently, experts…
  39. factétayée

    The Open Ant comes with a MuJoCo simulation, which can be used to learn competent policies.

    [15] The Open Ant: A Robot Platform for Reinforcement Learning Research, section 1 Introduction
    Even in situations where adequate lab resources and expertise are available, the long delay caused by the assembly of the robot and troubleshooting before the first successful experiment can exhaust a considerable portion of a researcher’s typical residency. Consequently, experts…
  40. factétayée

    Gym-μRTS is a fast-to-run RL environment for full-game RTS research.

    [17] Gym-$μ$RTS: Toward Affordable Full Game Real-time Strategy Games Research with Deep Reinforcement Learning, abstract arXiv:2105.13807v3
    In recent years, researchers have achieved great success in applying Deep Reinforcement Learning (DRL) algorithms to Real-time Strategy (RTS) games, creating strong autonomous agents that could defeat professional players in StarCraft~II. However, existing approaches to tackle fu…

Sources

  1. [1]
    Brian Gaudet, Richard Linares, Roberto Furfaro. Deep Reinforcement Learning for Six Degree-of-Freedom Planetary Powered Descent and Landing. arXiv (Cornell University), 2018.openalex · primary · DOI 10.48550/arxiv.1810.08719 · https://doi.org/10.48550/arxiv.1810.08719
  2. [2]
    Ugurcan Çelik, Mustafa Umut Demi̇rezen. Optimal Reusable Rocket Landing Guidance: A Cutting-Edge Approach Integrating Scientific Machine Learning and Enhanced Neural Networks. IEEE Access, 2024.openalex · primary · DOI 10.1109/access.2024.3359417 · https://doi.org/10.1109/access.2024.3359417
  3. [3]
    Andrea Scorsoglio, Andrea D’Ambrosio, Luca Ghilardi, Brian Gaudet, Fabio Curti, Roberto Furfaro. Image-Based Deep Reinforcement Meta-Learning for Autonomous Lunar Landing. Journal of Spacecraft and Rockets, 2021.openalex · primary · DOI 10.2514/1.a35072 · https://doi.org/10.2514/1.a35072
  4. [4]
    Julia Briden, Trey Gurga, Breanna Johnson, Abhishek Cauligi, Richard Linares. Tight Constraint Prediction of Six-Degree-of-Freedom Transformer-based Powered Descent Guidance. arXiv, 2025.arxiv · primary · https://arxiv.org/abs/2501.00930v1
  5. [5]
    Xinglun Chen, Ran Zhang, Huifeng Li. Trajectory Dispersion Control for Precision Landing Guidance of Reusable Rockets. arXiv, 2025.arxiv · primary · https://arxiv.org/abs/2504.11894v1
  6. [6]
    Yuxuan Jiang, Yujie Yang, Zhiqian Lan, Guojian Zhan, Shengbo Eben Li, Qi Sun, Jian Ma, Tianwen Yu, Changwu Zhang. Rocket Landing Control with Random Annealing Jump Start Reinforcement Learning. arXiv, 2024.arxiv · primary · https://arxiv.org/abs/2407.15083v1
  7. [7]
    Alessandro Zavoli, Lorenzo Federici. Reinforcement Learning for Robust Trajectory Design of Interplanetary Missions. Journal of Guidance Control and Dynamics, 2021.openalex · primary · DOI 10.2514/1.g005794 · https://doi.org/10.2514/1.g005794
  8. [8]
    Lorenzo Federici, Andrea Scorsoglio, Luca Ghilardi, Andrea D’Ambrosio, Boris Benedikter, Alessandro Zavoli. Image-Based Meta-Reinforcement Learning for Autonomous Guidance of an Asteroid Impactor. Journal of Guidance Control and Dynamics, 2022.openalex · primary · DOI 10.2514/1.g006832 · https://doi.org/10.2514/1.g006832
  9. [9]
    Afonso Botelho, Marc Martínez‐Estrada, Cristina Recupero, A. Fabrizi, Gabriele De Zaiacomo. Design of the landing guidance for the retro-propulsive vertical landing of a reusable rocket stage. CEAS Space Journal, 2022.openalex · primary · DOI 10.1007/s12567-022-00423-6 · https://doi.org/10.1007/s12567-022-00423-6
  10. [10]
    Lei Xie, Hongbo Zhang, Xiang Sean Zhou, Guojian Tang. A Convex Programming Method for Rocket Powered Landing With Angle of Attack Constraint. IEEE Access, 2020.openalex · primary · DOI 10.1109/access.2020.2997235 · https://doi.org/10.1109/access.2020.2997235
  11. [11]
    Julia Briden, Changrak Choi, Kyongsik Yun, Richard Linares, Abhishek Cauligi. Constraint-Informed Learning for Warm Starting Trajectory Optimization. arXiv (Cornell University), 2023.openalex · primary · DOI 10.13140/rg.2.2.35597.92646 · https://doi.org/10.13140/rg.2.2.35597.92646
  12. [12]
    Geonwoo Cho, Jaegyun Im, Doyoon Kim, Sundong Kim. Causal-Paced Deep Reinforcement Learning. arXiv, 2025.arxiv · primary · https://arxiv.org/abs/2507.02910v1
  13. [13]
    Günther Waxenegger-Wilfing, Kai Dresia, Jan C. Deeken, Michael Oschwald. A Reinforcement Learning Approach for Transient Control of Liquid Rocket Engines. IEEE Transactions on Aerospace and Electronic Systems, 2021.openalex · primary · DOI 10.1109/taes.2021.3074134 · https://doi.org/10.1109/taes.2021.3074134
  14. [14]
    Michael Szmuk, Behcet Acikmese. Successive Convexification for 6-DoF Mars Rocket Powered Landing with Free-Final-Time. arXiv, 2018.arxiv · primary · https://arxiv.org/abs/1802.03827v1
  15. [15]
    Elena Sorina Lupu, Patrick Spieler, Khurram Javed, Kris De Asis, John D. Martin, Martha Steenstrup, Joseph Modayil. The Open Ant: A Robot Platform for Reinforcement Learning Research. arXiv, 2026.arxiv · primary · https://arxiv.org/abs/2607.18488v1
  16. [16]
    Iat Hang Fong, Tengyue Li, Simon Fong, Raymond K. Wong, Antonio J. Tallón-Ballesteros. Predicting concentration levels of air pollutants by transfer learning and recurrent neural network. arXiv, 2025.arxiv · primary · https://arxiv.org/abs/2502.01654v1
  17. [17]
    Shengyi Huang, Santiago Ontañón, Chris Bamford, Lukasz Grela. Gym-$μ$RTS: Toward Affordable Full Game Real-time Strategy Games Research with Deep Reinforcement Learning. arXiv, 2021.arxiv · primary · https://arxiv.org/abs/2105.13807v3
  18. [18]
    Abdul Wahab, Raksha Kumaraswamy, Martha White. Value Bonuses using Ensemble Errors for Exploration in Reinforcement Learning. arXiv, 2026.arxiv · primary · https://arxiv.org/abs/2602.12375v1