أبحاث
الهبوط الصاروخي صغير النطاق: هل يمكن لسياسة توجيه متعلَّمة أن تتفوق على نهج كلاسيكي في المحاكاة؟
Small-Scale Rocket Landing: Can a Learned Guidance Policy Outperform a Classical Approach in Simulation?
الجواب المباشر
الجواب المباشر
لا توجد أي مطالبة (claim) في هذه المجموعة تقارن مباشرة بين سياسة توجيه متعلَّمة بالتعلم المعزز (RL) وقانون توجيه كلاسيكي قائم على التحسين المحدب (convex optimization) على نفس الصاروخ صغير النطاق، وبنفس المقاييس، وفي نفس ظروف الاختبار، لذا لا يمكن الإجابة عن السؤال كما طُرح استنادًا إلى هذه الأدلة. ما تُظهره المطالبات فعلاً، كلٌّ على حدة، هو أن سياسات التوجيه بالتعلم المعزز تحقق مسارات دقيقة وفعّالة من حيث استهلاك الوقود في محاكاة سداسية الحرية (6-DOF) للهبوط الكوكبي المدفوع [1]، وأن أساليب التحسين المحدب مثل lossless convexification و successive convexification تمثل خط الأساس المعتمد لتوجيه الهبوط المدفوع، وتُقدَّر لسلوكها الحتمي وضماناتها للأمثلية الشاملة [14][4]. وهناك جيل أحدث من الأساليب يسرّع حلّالات التحسين المحدب باستخدام بدايات دافئة متعلَّمة (learned warm starts)، وهو مزيج هجين بين النهجين وليس مقارنة خالصة بينهما [4][11]. أما من يحتاج لإجابة خاصة بمركبة محددة وزنها 10 كغ وأوج ارتفاعها 100 متر، فعليه إجراء التجربة المقارنة المباشرة بنفسه، مستعينًا بالأساليب الموصوفة أدناه كلبنات بناء.
لماذا يصعب الإجابة عن هذا السؤال من الأعمال المنشورة
توجيه الهبوط المدفوع لصاروخ، سواء كان بحجم كامل أو صغير النطاق، هو مسألة تحكم يجب فيها للمركبة أن تصل إلى موضع وسرعة مستهدفَين مع استهلاك أقل قدر ممكن من الدافع (propellant)، مع مراعاة قيود فيزيائية. توجد عائلتان واسعتان من الأساليب لحل هذه المسألة: التحسين الكلاسيكي للمسار، وغالبًا ما يكون عبر التحسين المحدب (convex optimization)، والسياسات المتعلَّمة المدربة بالتعلم المعزز (reinforcement learning، RL). يطرح سؤال البحث ما إذا كانت سياسة توجيه بشبكة عصبية مدرَّبة يمكن أن تضاهي أو تتفوق على قانون تحسين محدب كلاسيكي مثل lossless convexification (LCvx) على صاروخ صغير النطاق قابل لإعادة الاستخدام، من حيث دقة الهبوط وكفاءة استهلاك الوقود.
تصف المطالبات المجمَّعة هنا أنظمة توجيه بالتعلم المعزز وأنظمة توجيه بالتحسين المحدب، لكن لا يضع أي منها النهجين جنبًا إلى جنب على نفس المركبة، ونفس مجموعة السيناريوهات، ونفس مقياس الدقة أو الوقود. تصف بعض المطالبات أداء التعلم المعزز على مركبة هبوط كوكبية سداسية الحرية (6-DOF) [1]، وتصف مطالبات أخرى مكاسب في التوقيت وتحقيق القيود لبدايات دافئة متعلَّمة لحلّالات محدبة [4][11]، وتصف مطالبات أخرى التحسين المحدب المستخدم بمفرده [14][10]. هذه أنظمة مختلفة، اختُبرت في ظروف مختلفة، لذا لا يمكن وضع أرقامها على مقياس مشترك.
يهم هذا الأمر البنّاء (builder) لأن العائلتين تحلّان مسألة التوجيه بطرق مختلفة. أساليب التحسين المحدب، حيثما أمكن تطبيقها، تعطي ضمانات: سلوكًا حتميًا، وأمثلية شاملة، وشهادات تقارب أو عدم جدوى [14]. أما سياسات التعلم المعزز فلا تحمل هذه الضمانات بطبيعتها، لكن تشير التقارير إلى أنها تنتج مسارات دقيقة وفعّالة من حيث الوقود في المحاكاة، وأنها قوية (robust) في مواجهة الضوضاء وعدم اليقين في المعاملات [1]. أما ما إذا كانت هذه القوة والدقة تعادل أداءً مماثلاً أو أفضل من قانون محدب محدد مثل LCvx، على مركبة صغيرة محددة، فهذا بالضبط هو الاختبار المقارن المباشر المفقود.
حجم المركبة مهم أيضًا، ولا تُذكر أي من المطالبات خصيصًا لصاروخ وزنه 10 كغ وأوجه 100 متر. تأتي نتائج التعلم المعزز أدناه من مركبة هبوط كوكبية سداسية الحرية (6-DOF) [1]، ومن نموذج صاروخي عالي الدقة (high-fidelity) [6]، ومن سيناريوهات قمرية وسيناريوهات كويكبات [3][8]. أما نتائج التحسين المحدب فتأتي من صياغات هبوط مدفوع على المريخ [14][4] ومن مسألة هبوط صاروخي مدفوع مع قيد زاوية الهجوم [10]. تطبيق أي من هذه الأرقام على مركبة صغيرة النطاق دون إعادة الاختبار سيكون استقراءً لا تدعمه المصادر.
يستعرض بقية هذا التقرير ما تفعله كل عائلة من الأساليب فعليًا، وما تم قياسه لكل منها، وما يحتاج فريق مكوَّن من شخصين لبنائه للإجابة عن السؤال الأصلي مباشرة، إذ أن الأدبيات لا تجيب عنه بعد.
كيف تبدو سياسة توجيه متعلَّمة بالتعلم المعزز
سياسة توجيه بالتعلم المعزز لهبوط صاروخ هي شبكة عصبية مدرَّبة لإخراج أوامر دفع مباشرة من حالة المركبة المقدَّرة. في أحد الأساليب، يُستخدم Proximal Policy Optimization (PPO) لتعلّم سياسة تربط الحالة المقدَّرة للمركبة الهابطة مباشرة بأمر دفع لكل محرك [1]. استُخدم في التدريب بيئة محاكاة سداسية الحرية (6-DOF) لمهمة الهبوط والنزول، ونتجت عن ذلك مسارات وُصفت بأنها دقيقة وفعّالة من حيث الوقود [1]. أظهر النظام أيضًا قوة في مواجهة الضوضاء وعدم اليقين في معاملات النظام [1].
من التفاصيل المحددة المُبلَّغ عنها لهذا النظام أن استخدام معدلات خصم (discount rates) مختلفة للمكافأة النهائية (terminal reward) ومكافأة التشكيل (shaping reward) يعزز أداء التحسين بشكل ملحوظ [1]. هذا يُذكر كتحسين عام لإجراء التدريب، مرتبط بتصميم تشكيل المكافأة المستخدم في تلك الدراسة المحددة عن مركبة الهبوط سداسية الحرية، وليس كنتيجة معزولة وحيدة. على البنّاء الذي يعتمد بنية مكافأة مشابهة، تتضمن مكافأة نهائية للوصول إلى الهدف ومكافأة تشكيل توجّه السلوك الوسيط، أن يتوقع الحاجة لضبط معدلَي الخصم هذين بشكل منفصل بدلاً من مشاركة قيمة واحدة بينهما.
تستهدف أعمال أخرى في التوجيه بالتعلم المعزز مسائل ذات صلة لكنها مختلفة، باستخدام نفس الخوارزمية الأساسية. اعتُمد تطبيق مفتوح المصدر لخوارزمية Proximal Policy Optimization المتقدمة (state-of-the-art) لإجراء عملية تدريب شبكة عصبية عميقة لتصميم مسارات لمهام بين الكواكب [7]. في نفس هذا العمل، أُعيدت صياغة مسألة التحكم الأمثل العشوائي كعملية قرار ماركوفية منفصلة زمنيًا (time-discrete Markov decision process)، للتوافق مع الصياغة القياسية المطلوبة للتعلم المعزز [7]. خطوة إعادة الصياغة هذه، أي تحويل مسألة تحكم أمثل مستمرة زمنيًا إلى تسلسل من قرارات منفصلة تضم حالات وأفعالًا ومكافآت، هي شرط مسبق عام لتطبيق خوارزميات التعلم المعزز على أي مسألة توجيه، وليس فقط الحالة بين الكوكبية المذكورة فيها.
توسّع الأساليب القائمة على الصور نطاق التوجيه بالتعلم المعزز إلى الحالات التي يجب فيها للسياسة أن تعمل على مدخلات بصرية بدلاً من تقدير حالة نظيف. أنتج التعلم المعزز-الفوقي العميق القائم على الصور (image-based deep reinforcement meta-learning) سياسة توجيه ذات حلقة مغلقة تحقق أخطاء في حدود الأمتار عبر سيناريوهات مختلفة، بما في ذلك عند عدم مراقبة البيئة بشكل كامل (partially observed)، للهبوط القمري المستقل [3]. وقد أظهر نظام توجيه مشابه قائم على الصور بالتعلم المعزز-الفوقي، مُطبَّق على مسألة مختلفة هي توجيه مركبة اصطدام بكويكب، أنه وجَّه المركبة الفضائية بشكل صحيح نحو نقطة الاصطدام النهائية في أكثر من 98% من 500 سيناريو اختبار [8]. تصف كلتا النتيجتين سلوك توجيه بحلقة مغلقة في ظل عدم يقين بشأن الحالة الحقيقية، وهو أمر ذو صلة مباشرة بصاروخ صغير النطاق يجب أن يعتمد أيضًا على تقدير حالة غير كامل، رغم أن أيًا من المطالبتين لا تتعلق بهبوط صاروخ على منصة إطلاق أو صندل (barge).
خوارزميات التعلم المعزز القياسية ليست موثوقة تلقائيًا لهذا النوع من مهام الهبوط الموجهة نحو الهدف، وهذا تحذير مهم لمن يفترض أن أي خوارزمية تعلم معزز ستعمل ببساطة دون تعديل. تشير التقارير إلى أن PPO وSAC وDSAC تفشل في سيناريوهات هبوط صاروخي موجهة نحو الهدف لأنها تعتمد على استكشاف واسع، واحتمال الوصول إلى الهدف عشوائيًا يتضاءل بشكل أُسّي مع الوقت [6]. وهذا النمط من الفشل هو السبب وراء اقتراح مخططات تدريب متخصصة، تُوصف في القسم التالي، خصيصًا لهبوط الصواريخ، بدلاً من الاعتماد فقط على تدريب PPO أو SAC أو DSAC الجاهز.
Random Annealing Jump Start: مخطط تدريب مصمَّم لهذا النمط من الفشل
Random Annealing Jump Start (RAJS) هو أسلوب تدريب مصمَّم للتغلب على فشل الاستكشاف في خوارزميات التعلم المعزز القياسية في هبوط الصواريخ الموجه نحو الهدف. في RAJS، تتنقل سياسة توجيهية (guide policy) عبر البيئة لأفق توجيه (guide horizon) محدد، ثم تتولى سياسة استكشاف (exploration policy) إتمام الخطوات المتبقية [6]. يُؤخذ أفق التوجيه من توزيع منتظم يتقلص حدّه الأعلى تدريجيًا نحو الصفر بناءً على مقاييس الأداء [6]. يسمح هذا التصميم لسياسة الاستكشاف بأن تبدأ أقرب فأقرب إلى الهدف مع تقدم التدريب، إذ تغطي السياسة التوجيهية معظم المسار في بداية التدريب، ومع تحسن الأداء تتقلص حصة السياسة التوجيهية من كل حلقة (episode) تدريجيًا نحو الصفر، مسلّمةً المزيد من المهمة تدريجيًا إلى سياسة الاستكشاف قيد التدريب.
تستهدف هذه الآلية مباشرة مشكلة الاستكشاف الأُسّية الموصوفة لـ PPO وSAC وDSAC القياسية. فبدلاً من مطالبة سياسة الاستكشاف بالتعثر مصادفةً على حالة هدف نادرة انطلاقًا من بداية عشوائية تمامًا، يمنحها RAJS انطلاقة من حالة وصلت إليها سياسة توجيهية كفؤة، ولا يسحب هذه الميزة الانطلاقية إلا تدريجيًا. هذا الاختيار التصميمي استجابة مباشرة للسبب المذكور لفشل خوارزميات التعلم المعزز القياسية، وهو أن احتمال الوصول إلى الهدف عشوائيًا يتضاءل أُسّيًا مع الوقت [6].
على نموذج صاروخي عالي الدقة، رفع RAJS معدل نجاح التحكم في هبوط الصاروخ من 8% باستخدام متحكم أساسي (baseline controller) إلى 97% [6]. هذا تحسّن كبير، لكنه مُبلَّغ عنه للنموذج الصاروخي عالي الدقة المحدد المستخدم في تلك الدراسة، وليس لمركبة صغيرة النطاق وزنها 10 كغ وأوجها 100 متر. يجب على البنّاء الذي يستهدف صاروخًا صغير النطاق أن يعامل هذا الرقم كدليل على أن مخطط التدريب يعمل على فئة المركبة التي اختُبر عليها، وألا يفترض حدوث نفس القفزة من 8% إلى 97% على مركبة مختلفة دون إعادة إجراء التجربة.
خضع أسلوب RAJS أيضًا للتحقق من خلال تقييم موسّع واختبار Hardware-in-the-Loop، مما أكّد فعالية المتحكم المقترح وجدواه في الزمن الحقيقي وانسيابيته [6]. يُعد اختبار Hardware-in-the-Loop خطوة ذات مغزى نحو النشر الفعلي لأنه يختبر المتحكم في مواجهة قيود توقيت وواجهات حقيقية، لا مجرد ساعة محاكاة. غير أن هذا التحقق أُجري على النموذج الصاروخي عالي الدقة المستخدم في تلك الورقة؛ ولا تنص المطالبة على أن نتيجة Hardware-in-the-Loop هذه تحقّقت على مركبة صغيرة النطاق وزنها 10 كغ أو قابلة للنقل إليها. يجب على البنّاء الذي يفكر في اعتماد RAJS كمتحكم احتياطي لصاروخ صغير النطاق أن يلاحظ هذا التباين في حجم المركبة والدقة صراحةً، بدلاً من افتراض انتقال نتيجة الزمن الحقيقي والانسيابية.
وإجمالاً، يُقرأ RAJS على أفضل وجه كحل لمشكلة معروفة ومحددة تتعلق بفشل تدريب التعلم المعزز القياسي في هذا المجال، مُقيَّم على نموذج مركبة واحد، وليس كضمان عام للأداء عبر مقاييس صاروخية مختلفة. إنه إصلاح على مستوى وقت التدريب، لا تغيير في قانون التوجيه، ويمكن من حيث المبدأ دمجه مع أي من أفكار تشكيل المكافأة أو ضبط معدل الخصم المُبلَّغ عنها في أماكن أخرى للتوجيه بالتعلم المعزز.
التوجيه الكلاسيكي بالتحسين المحدب: lossless و successive convexification
التحسين المحدب (convex optimization) هو النهج الكلاسيكي المعتمد لتوجيه الهبوط المدفوع. غالبًا ما تُطبَّق lossless convexification للتكلفة والديناميكيات وقيود التحكم غير المحدبة على مسألة توجيه الهبوط المدفوع ثلاثية الحرية (3-DoF) [4]. اعتُبر التحسين المحدب مرشحًا رئيسيًا لتطبيقات التوجيه المستقل على متن المركبة بسبب سلوكه الحتمي، وضماناته للأمثلية الشاملة، وقدرته على تقديم شهادات تقارب أو عدم جدوى، وتوفر خوارزميات فعّالة لطريقة النقطة الداخلية (interior point method، IPM) [14].
هذه الخصائص، أي الحتمية، وضمانات الأمثلية، وشهادات التقارب، هي بالضبط ما لا تقدمه سياسة التعلم المعزز بطبيعتها، إذ إن الشبكة العصبية المدرَّبة لا تقدم أي ضمان رسمي بأن مخرجها أمثل أو حتى قابل للتحقيق في سيناريو جديد لم يُشاهَد من قبل. هذا فرق بنيوي بين العائلتين لا مقارنة مقيسة، ويستحق أن يُذكر صراحةً لبنّاء يقرر أي عائلة يثق بها لمرحلة هبوط حساسة من ناحية السلامة.
النسخة سداسية الحرية (6-DoF) من مسألة الهبوط المدفوع أصعب من النسخة ثلاثية الحرية. من المعروف أنه من الصعب حلّها بسرعة وموثوقية لأن المسألة غير خطية وغير محدبة، وأن مخطط التقطيع (discretization) يؤثر بشدة على صلاحية الحل، وأن تهيئة مسار مرجعي (reference trajectory initialization) تحدد ما إذا كانت الخوارزمية تتقارب أو تتباعد [4]. تذكر ورقة سابقة تصف successive convexification لهبوط صاروخي مريخي سداسي الحرية مدفوع بزمن نهائي حر (free-final-time) نفس الصعوبات الثلاث بصياغة شبه مطابقة: حلّ المسألة بسرعة وموثوقية أمر صعب لأنها غير خطية وغير محدبة، ولأن صلاحية الحل تعتمد بشدة على دقة مخطط التقطيع، ولأنه قد يصعب اختيار مسار مرجعي مناسب لتهيئة عملية حل تكرارية [14].
يشير ذلك العمل عن successive convexification أيضًا إلى أنه، من خلال استخدام حلّالات طريقة النقطة الداخلية (IPM)، يمكن حل هذه السلسلة من المسائل الفرعية المحدبة بسرعة وموثوقية، مما يمكّن من توجيه بزمن حقيقي أعلى دقة لعمليات الهبوط الصاروخي المدفوع على المريخ [14]. هذه نتيجة إيجابية خاصة بسياق الهبوط المدفوع على المريخ وبالحلّالات القائمة على IPM، وينبغي أن تُقرأ كدليل على أن نهج successive convexification، عند اقترانه بحلّالات IPM، يفي بمتطلب الزمن الحقيقي في ذلك السياق، وليس كضمان سرعة عام مستقل عن اختيار الحلّال.
وبشكل منفصل، أظهرت طريقة برمجة محدبة لهبوط صاروخي مدفوع مع قيد زاوية هجوم (angle-of-attack)، في محاكاة عددية، أنها يمكنها إيجاد مسار هبوط قابل للتحقيق يُلبي فيه قيد زاوية الهجوم، مع أداء تقارب أفضل مقارنةً بطريقة خطية تقليدية [10]. هذه مقارنة مقابل خط أساس خطّي (linearization) ضمن عائلة التحسين المحدب، وليست مقابل سياسة تعلم معزز، وتُظهر أن أساليب التحسين المحدب نفسها لا تزال تُصقَل مقارنةً بتقنيات محدبة أو خطية سابقة.
يضيف الهبوط الدقيق تحت اضطرابات حقيقية صعوبة إضافية تتجاوز التحديات الخوارزمية أعلاه. يخضع الهبوط داخل الغلاف الجوي (endoatmospheric landing) لظروف مضطربة تشمل تذبذب دفع المحرك، وعدم اليقين في معاملات الديناميكا الهوائية، واضطراب كثافة الغلاف الجوي، واضطراب الرياح [5]. هذه هي الخلفية التي يجب أن يُقاس بها أي قانون توجيه، متعلَّمًا كان أم كلاسيكيًا، إن كان مخصصًا لصاروخ صغير النطاق فعلي يطير، لا لمحاكاة نظيفة فقط، إذ من المرجح أن تكون مركبة صغيرة وخفيفة أكثر حساسية للرياح وتغير الدفع من مركبة إطلاق كبيرة، رغم أن أيًا من المطالبات لا تذكر هذه المقارنة مباشرة.
تسريع الحلّالات المحدبة بالتعلم: مزيج هجين لا بديل
هناك خط عمل منفصل لا يُقارن التعلم المعزز بالتحسين المحدب بل يستخدم التعلم لجعل التحسين المحدب أسرع أو أكثر موثوقية. تحسّن T-PDG أوقات الحل بمقدار يصل إلى مرتبة كبرى (order of magnitude) مقارنةً بـ lossless convexification (LCvx) لمسألة توجيه الهبوط المدفوع الأقل استهلاكًا للوقود ثلاثية الحرية (3-DoF) [4]. هذه مقارنة توقيتية بين طريقة معزَّزة بالتعلم وخط أساس كلاسيكي، على صياغة محددة ثلاثية الحرية، وليست مقارنة دقة مقابل دقة بين سياسة تعلم معزز و LCvx.
الآلية وراء هذا التسريع هي التنبؤ بالقيود التي ستكون فعّالة (active) عند الحل الأمثل. تتعلم T-SCvx التنبؤ بمجموعة القيود المشدودة أو الفعّالة عند حل مسألة التحكم الأمثل، فتنشئ مسألة مصغّرة الحجم مُهيأة بالقيود المشدودة فقط، ثم تستخدم الحل لبدء (warm-start) حلّال التحسين المباشر [4]. يعني البدء الدافئ (warm-starting) أن الحلّال يبدأ أقرب إلى الإجابة، وهذا سبب انخفاض أوقات الحل؛ أما تصغير حجم المسألة، بحيث تضم فقط القيود المشدودة المتنبَّأ بها بدلاً من مجموعة القيود الكاملة، فهو ما يتيح للحلّال التقارب أسرع مما كان سيحدث على صياغة lossless convexification الكاملة.
تتبع طريقة أخرى ذات صلة، هي TOAST، فلسفة بدء دافئ مشابهة لكن تُقيَّم على مسائل مختلفة. من خلال تجارب عددية على مسألة عربة قمرية (Lunar rover) ومسألة توجيه هبوط مدفوع مريخي ثلاثية الحرية (3-DoF)، تتفوق TOAST على الأساليب المرجعية (benchmark) من حيث أوقات الحساب وتحقيق قيود التنبؤ الشبكي [11]. مرة أخرى، هذه مقارنة مقابل أساليب بدء دافئ أو تحسين مرجعية، لا مقابل سياسة توجيه بالتعلم المعزز نقية من طرف إلى طرف، ومسألتا الاختبار، عربة قمرية ومسألة هبوط مدفوع مريخي ثلاثية الحرية، مختلفتان عن كل من مركبة الهبوط الكوكبية سداسية الحرية المستخدمة لسياسة التوجيه بالتعلم المعزز في [1] وعن أي صاروخ صغير النطاق.
بالنسبة للبنّاء، الدرس العملي من هذه العائلة من الأساليب هو أن التعلم والتحسين المحدب ليسا متنافيَين. يمكن لنظام أن يستخدم شبكة متعلَّمة فقط لتسريع أو تثبيت تقارب حلّال محدب، محافظًا على ضمانات الحلّال، بدلاً من استبدال اتخاذ القرار الخاص بالحلّال بشبكة من طرف إلى طرف كما في سياسات التوجيه بالتعلم المعزز الموصوفة سابقًا. هذا المسار الهجين يستحق الأخذ به كخيار ثالث إلى جانب التعلم المعزز الخالص والتحسين المحدب الخالص عند تصميم تجربة المقارنة التي يدور حولها هذا التقرير في النهاية.
الهبوط الدقيق تحت تشتّت الاضطرابات: قوانين توجيه مصمَّمة لعدم اليقين
تُعد الدقة والقوة في مواجهة تشتّت الاضطرابات (dispersion) متطلبات مركزية لأي صاروخ صغير النطاق قابل لإعادة الاستخدام، إذ إن العتاد الفعلي لا يتصرف أبدًا تمامًا كما يتصرف نموذج محاكاته. أحد الأساليب المقترحة هو طريقة تحكم جديدة في تشتّت المسار على الإنترنت (online) تعتمد على قانون توجيه تغذية راجعة أمثل بمعاملات (Parameterized Optimal Feedback Guidance Law، POFGL) [5]. هذا قانون توجيه يهدف تحديدًا إلى التحكم في مقدار انحراف مسار الصاروخ الفعلي عن المسار المخطط له تحت الاضطراب، وليس محسِّنًا عام الغرض أو سياسة متعلَّمة، ويُقدَّم كأسلوب على الإنترنت (online)، أي أنه مصمَّم للعمل باستمرار أثناء الطيران بدلاً من أن يُحل مرة واحدة قبل الإطلاق.
من القيود المعروفة لقوانين توجيه التغذية الراجعة من هذا النوع سلوكها قرب نهاية الهبوط. مع اقتراب الزمن المتبقي (time-to-go) من الصفر، تزداد حساسية مسارات أوامر التوجيه المولَّدة بشكل ملحوظ وتميل حتمًا إلى اللانهاية [5]. هذه خاصية بنيوية لقانون التوجيه قرب لحظة الهبوط، ويجب على أي تنفيذ التعامل معها صراحةً، على سبيل المثال عبر تبديل نمط التوجيه أو تحديد سقف لحساسية الأمر مع اقتراب الزمن المتبقي من الصفر، رغم أن المطالبة نفسها لا تحدد أي إجراء تخفيف بعينه.
تُذكر مشكلة التشتّت هذه على خلفية الاضطرابات التي سبق ذكرها للهبوط داخل الغلاف الجوي: تذبذب دفع المحرك، وعدم اليقين في معاملات الديناميكا الهوائية، واضطراب كثافة الغلاف الجوي، واضطراب الرياح [5]. هذه هي بالضبط أنواع الاضطرابات التي يُتوقع أن يواجهها صاروخ صغير النطاق، وهو أخف وزنًا وأكثر حساسية لتغير الرياح والدفع من مركبة إطلاق كبيرة، في اختبار خارجي، رغم أن أيًا من المطالبات لا يذكر هذه المقارنة بين المقاييس مباشرة.
لا تُبلغ أي من المطالبات في هذه المجموعة عن رقم لدقة الهبوط أو استهلاك الوقود لـ POFGL يمكن وضعه جنبًا إلى جنب مع رقم سياسة تعلم معزز تحت نفس ظروف الاختبار. قيمة هذا القسم للبنّاء هي التذكير بأن قوانين التوجيه، أيًا كانت العائلة التي تنتمي إليها، يجب أن تُفحَص تحديدًا من حيث السلوك مع اقتراب الزمن المتبقي من الصفر وتحت نماذج اضطراب واقعية، لا في تشغيل اسمي خالٍ من الاضطراب فقط، إذ قد يؤدي قانون توجيه جيد في محاكاة نظيفة لكنه قد يفشل قرب لحظة الهبوط أو تحت اضطرابات رياح ودفع لم تُنمذَج.
ما الذي قِيس فعليًا، ومقابل أي خط أساس
حفاظًا على الأمانة، إليك كل نتيجة كمّية أو مقارنة في مجموعة المطالبات، مذكورة بخط أساسها وظروفها الخاصة، دون دمج نتائج من أوراق مختلفة.
- رفع RAJS معدل نجاح التحكم في هبوط الصاروخ من 8% باستخدام متحكم أساسي إلى 97%، على نموذج صاروخي عالي الدقة، باستخدام التعلم المعزز [6].
- تحسّن T-PDG أوقات الحل بمقدار يصل إلى مرتبة كبرى مقارنةً بـ LCvx، لمسألة توجيه الهبوط المدفوع الأقل استهلاكًا للوقود ثلاثية الحرية [4].
- تتفوق TOAST على الأساليب المرجعية في وقت الحساب وتحقيق قيود التنبؤ الشبكي، على مسألة عربة قمرية ومسألة توجيه هبوط مدفوع مريخي ثلاثية الحرية [11].
- طريقة البرمجة المحدبة مع قيد زاوية الهجوم لها أداء تقارب أفضل من طريقة خطية تقليدية، في محاكاة عددية، وتجد مسار هبوط قابل للتحقيق يُلبي ذلك القيد [10].
- وجّه نظام توجيه بالتعلم المعزز-الفوقي القائم على الصور مركبة فضائية بشكل صحيح إلى نقطة الاصطدام النهائية في أكثر من 98% من 500 سيناريو اختبار، لمسألة مركبة اصطدام بكويكب [8].
- حققت سياسة التعلم المعزز-الفوقي العميق القائم على الصور أخطاءً في حدود الأمتار عبر سيناريوهات مختلفة، بما في ذلك عدم المراقبة الجزئية، للهبوط القمري [3].
- حقق نموذج RAQResNet خسارة تحقق (validation loss) أقل بنحو 300 مرة من بنية قياسية بعدد متساوٍ من المعاملات القابلة للتدريب، وأقل بـ 50 مرة من بنية قياسية بضعف عدد المعاملات القابلة للتدريب [2].
لا تقارن أي من هذه النتائج بين سياسة توجيه بالتعلم المعزز وقانون توجيه محدب كلاسيكي على نفس المركبة ونفس مقياس الدقة أو الوقود. ينتمي كل رقم إلى معيار مرجعي (benchmark) خاص بورقته، وحجم عيّنة خاص، وظروف خاصة، ودمج هذه الأرقام في ترتيب واحد سيسيء تمثيل الأدلة. يجب على البنّاء أن يعامل كل رقم من هذه الأرقام باعتباره تقريرًا صارمًا عن الطريقة والمركبة وسيناريو الاختبار المذكور بجانبه بالتحديد، وألا يُجري متوسطًا لها أو يجمعها عبر الأوراق لإنتاج ترتيب مزعوم بين التوجيه بالتعلم المعزز والتوجيه بالتحسين المحدب بشكل عام.
بنية تحتية للتعلم ذات صلة تستحق المعرفة
هناك عملان في البنية التحتية، وإن لم يكونا أساليب توجيه بحد ذاتهما، ذوا صلة كخلفية لفريق يبني ويختبر سياسات توجيه بالتعلم المعزز. Open Ant هو نسخة مادية لبيئة Gymnasium Ant المستخدمة بشكل شائع، إلى جانب محاكاة [15]. صُمم جسم روبوت Open Ant ليبدو مثل بيئة Gymnasium Ant واسعة الاستخدام [15]، وصُمم ليُبنى ويُصان من قبل باحثي الذكاء الاصطناعي دون خلفيات في هندسة الروبوتات [15]. هذه النقطة الثانية مهمة لفريق صغير معني بتوجيه الصواريخ: منصة مصممة صراحةً للباحثين غير المتخصصين في الروبوتات تخفّض الحاجز الهندسي أمام إجراء تجارب تعلم معزز فعلية، وهذا مهم مباشرة إن أراد فريق دون خبرة عميقة بعتاد الفضاء اختبار سياسة توجيه على عتاد حقيقي بدلاً من الاكتفاء بالمحاكاة.
ميكانيكيًا، يستخدم Open Ant كاميرا ويب علوية (overhead webcam) لتتبع علامات مرجعية (fiducial markers) لحساب إشارات المكافأة واتجاه حركة الروبوت [15]. الروبوت متصل بكابلات بطاقة تيار متردد (AC) وبحاسوب خارجي يعمل عليه العميل (agent) [15]. هذا يعني أن حساب المكافأة واتخاذ القرار الخاص بالعميل يحدثان خارج المركبة، معتمدَين على استشعار وحوسبة خارجيَين بدلاً من أنظمة مستقلة تمامًا على متن المركبة، مما يبسّط العتاد الذي يحتاج فريق بحثي إلى بنائه مقارنةً بروبوت مكتفٍ ذاتيًا بالكامل.
على صعيد التعلم، يمكن تعلّم سياسات مشي كفؤة من الصفر خلال حوالي ساعة واحدة مباشرة من خبرة الروبوت الفعلي، بالنسبة لـ SARSA(λ) و Soft Actor-Critic (SAC) [15]. وبشكل منفصل، يأتي Open Ant مع محاكاة MuJoCo، يمكن استخدامها لتعلّم سياسات كفؤة [15]، وتنتقل السياسات المتعلَّمة في المحاكاة إلى الواقع بالنسبة لمنصة Open Ant [15]. تصف هاتان النتيجتان معًا مسارين مستقلَّين للوصول إلى سياسة عاملة على هذه المنصة: التدريب مباشرة على الروبوت الفعلي في حوالي ساعة، أو التدريب في محاكاة MuJoCo ثم نقل النتيجة إلى الروبوت الحقيقي. لا تتعلق أي من هاتين النتيجتين بالصواريخ أو التوجيه، لكن النمط، وهو زوج متطابق من المحاكاة والعتاد مع انتقال محاكاة-إلى-واقع (sim-to-real) مُبرهَن عليه، هو بالضبط ما يحتاجه فريق يبني منصة اختبار صاروخية صغيرة النطاق للإجابة عن سؤال التعلم المعزز مقابل التحسين المحدب.
بشكل منفصل، يُوصف Gym-μRTS بأنه بيئة تعلم معزز سريعة التشغيل لأبحاث الاستراتيجية الآنية الكاملة (full-game real-time strategy) [17]. هذا لا صلة له بتوجيه الصواريخ من حيث المجال، لكنه دليل على أن بيئات التعلم المعزز السريعة والمصممة خصيصًا تُقدَّر في مجتمع أبحاث التعلم المعزز عمومًا كوسيلة لجعل التكرار (iteration) رخيصًا، وهذا اعتبار لأي فريق يصمم بيئة تدريب لتوجيه صاروخ من الصفر. لا يجيب Open Ant ولا Gym-μRTS عن أي شيء يخص دقة الهبوط أو كفاءة الوقود؛ وقد أُدرجا هنا لأنهما يوضحان كيف تبدو البنية التحتية المتطابقة بين المحاكاة والعتاد وحلقات التدريب السريعة في مجالات أخرى، وهو بالضبط نوع البنية التحتية التي يحتاج مشروع مقارنة توجيه الصواريخ إلى بنائها لنفسه.
نتائج أخرى في التعلم المعزز في مسائل مجاورة
هناك عدد قليل من المطالبات الإضافية التي تصف تطبيق التعلم المعزز على مسائل مجاورة لتوجيه هبوط الصواريخ، مفيدة لبنّاء يقرر أي تقنيات تعلم معزز يستعير. في التحكم الانتقالي (transient control) لمحرك صاروخي سائل، حقق متحكم بالتعلم المعزز العميق أعلى أداء مقارنةً بتسلسلات حلقة مفتوحة (open-loop) مضبوطة بعناية ومتحكمات PID [13]. أظهرت نفس الدراسة أن السياسة المتعلَّمة يمكنها الوصول إلى نقاط تشغيل مستقرة مختلفة والتكيف بشكل مقنع مع تغيّر معاملات النظام [13]. هذه مسألة تحكم مختلفة، تحكم انتقالي للمحرك بدلاً من توجيه هبوط، لكنها دليل من نفس الأدبيات الواسعة للتعلم المعزز المطبق على أنظمة الصواريخ على أن متحكمًا متعلَّمًا يمكن أن يتفوق على خطي أساس كلاسيكيَين، حلقة مفتوحة وPID، في نظام فرعي واحد على الأقل من نظم الصاروخ، وتُظهر تكيّف متحكم بالتعلم المعزز على الإنترنت مع تغيّر معاملات النظام، وهي خاصية مختلفة عن، لكنها ذات صلة روحًا بـ، القوة في مواجهة الضوضاء وعدم اليقين في المعاملات المُبلَّغ عنها لسياسة توجيه الهبوط سداسية الحرية.
على صعيد تصميم خوارزمية التعلم المعزز، تقارب الأساليب الحالية للمنهج التدريجي (curriculum) أو اختيار المهام في التعلم المعزز عادةً الفروق بين المهام باستخدام إشارات محورها العميل (agent-centric) مثل الندم (regret) أو تباين القيمة، لكن هذه الإشارات تعتمد على السياسة بطبيعتها وحساسة للضوضاء [12]. يُقترح Causal-Paced Deep Reinforcement Learning (CP-DRL) كإطار يعالج هذا القيد بتقريب الفرق في النموذج السببي البنيوي (structural causal model، SCM) بين المهام باستخدام بيانات التفاعل فقط [12]. هذه منهجية عامة للتعلم المعزز، لا خاصة بتوجيه الصواريخ، لكنها ذات صلة إن خطط بنّاء لتدريب سياسة توجيه عبر منهج تدريجي من سيناريوهات هبوط متزايدة الصعوبة، مثل تشتّتات ابتدائية أو اضطرابات رياح متزايدة الحجم تدريجيًا، ويريد طريقة مبدئية مقاومة للضوضاء لاختيار السيناريو التالي للتدريب عليه بدلاً من الاعتماد على إشارات الندم أو تباين القيمة التي تنص المطالبة على أنها حساسة للضوضاء.
وأخيرًا، فيما يخص مسألة الاستعادة الواقعية التي يدور حولها هذا التقرير في النهاية، تنص ورقة تصميم واحدة عن الهبوط العمودي بدفع رجعي (retro-propulsive) لمرحلة صاروخية قابلة لإعادة الاستخدام بوضوح على أن أحد التحديات يكمن في استراتيجية وخوارزميات التوجيه والملاحة والتحكم (Guidance, Navigation and Control، GNC) الخاصة بالاستعادة، وبخاصة تلك المتعلقة بمرحلة الهبوط المدفوع، والتي يجب أن تتيح هبوطًا دقيقًا بهوامش وقود منخفضة وتشتّتات كبيرة [9]. هذا إطار لصعوبة المسألة، لا حل ولا رقم، وينطبق على استعادة صاروخ قابل لإعادة الاستخدام بحجم كامل. يُذكر هنا كخلفية لأهمية سؤال التوجيه أصلاً، بمعزل عن الحجم: التوتر بين الدقة، وهوامش الوقود المنخفضة، والتشتّتات الكبيرة هو نفس التوتر الذي يجب أن تُصمَّم أي تجربة مقارنة صغيرة النطاق بين التعلم المعزز والتحسين المحدب لاستكشافه.
لا تتعلق أي من هذه المطالبات الثلاث مباشرة بالمقارنة الصغيرة النطاق بين التعلم المعزز والتحسين المحدب، لكن كل واحدة تحدد ما ينبغي للبنّاء توقع استعارته، ومن أين: تقنيات تحكم وأدلة على التكيف الفوري من عمل التحكم الانتقالي للمحرك، وأساليب منهج تدريجي من CP-DRL، وإطار للمسألة من تصميم الاستعادة GNC.
الحدود والأسئلة المفتوحة
القيد المركزي مباشر: لا تحتوي مجموعة الأدلة هذه على تجربة واحدة تُشغَّل فيها سياسة توجيه بالتعلم المعزز وقانون توجيه كلاسيكي بالتحسين المحدب على نفس الصاروخ صغير النطاق، تحت نفس سيناريوهات الاختبار، وتُقيَّمان بنفس مقاييس الدقة والوقود. تنتمي كل نتيجة كمّية أعلاه إلى نموذج مركبة، ومعيار مرجعي، وخط أساس خاص بورقتها، ولا يمكن دمج الأرقام في ترتيب بين عائلتَي الأساليب دون تجاوز ما تنص عليه أي مطالبة منفردة.
القيد الثاني هو تباين في المقياس (scale mismatch). تأتي نتائج التعلم المعزز المذكورة هنا من محاكاة مركبة هبوط كوكبية سداسية الحرية [1]، ونموذج صاروخي عالي الدقة [6]، وسيناريوهات اصطدام بكويكب وهبوط قمري [8][3]، ولا يُذكر أي منها كصاروخ صغير النطاق وزنه 10 كغ وأوجه 100 متر. كذلك تأتي نتائج التحسين المحدب من الهبوط المدفوع على المريخ وصياغات ثلاثية أو سداسية الحرية [14][4][10]، لا من مركبة صغيرة النطاق. تطبيق أرقام أي من العائلتين على صاروخ صغير النطاق استقراء لا تدعمه المطالبات، ويجب على البنّاء إعادة إجراء التجارب ذات الصلة على المركبة الفعلية المعنية قبل استخلاص الاستنتاجات.
القيد الثالث يتعلق بموثوقية التدريب. تشير التقارير إلى أن خوارزميات التعلم المعزز القياسية، بما فيها PPO وSAC وDSAC، تفشل في سيناريوهات هبوط صاروخي موجهة نحو الهدف بسبب الاعتماد على استكشاف واسع [6]. هذا يعني أن البنّاء لا يستطيع ببساطة تطبيق تنفيذ PPO جاهز، كما استُخدم في مكان آخر لتصميم مسار بين الكواكب [7]، وتوقّع نجاحه في الهبوط دون مخطط تدريب متخصص مثل RAJS، أو خيارات تشكيل مكافأة مثل ضبط معدل الخصم المُبلَّغ عنه لمركبة الهبوط الكوكبية سداسية الحرية [1].
القيد الرابع يتعلق بمطالبات القوة الخاصة بسيناريو محدد. أكد اختبار Hardware-in-the-Loop لـ RAJS الجدوى في الزمن الحقيقي والانسيابية على النموذج الصاروخي عالي الدقة الذي جرى اختباره [6]، ولا ينبغي قراءة هذا كدليل لمركبة بحجم أو دقة مختلفَين. كذلك، مشكلة الحساسية البنيوية مع اقتراب الزمن المتبقي من الصفر، المُبلَّغ عنها لـ POFGL [5]، وقائمة اضطرابات الهبوط داخل الغلاف الجوي [5]، تنطبق كلتاهما على قانون التوجيه ونظام الطيران المحدد الذي نوقشتا فيه، ويجب على البنّاء إعادة التحقق من هذه السلوكيات لأي قانون توجيه ومركبة جديدَين بدلاً من افتراض انتقالها.
القيد الخامس، الأكثر عمومية، هو أن ضمانات التحسين المحدب وتقارير أداء التعلم المعزز غير مقيسة على أساس قابل للمقارنة حتى من حيث المبدأ ضمن مجموعة الأدلة هذه. تُوصف مزايا التحسين المحدب بأنها سلوك حتمي، وضمانات أمثلية شاملة، وشهادات تقارب أو عدم جدوى [14]، وهي خصائص لبنية الخوارزمية، لا أرقام مقيسة على مجموعة اختبار. أما المزايا المُبلَّغ عنها للتعلم المعزز، أي الدقة وكفاءة الوقود والقوة في مواجهة الضوضاء [1]، أو معدل النجاح على مركبة محددة [6]، فهي أرقام تجريبية من سيناريوهات اختبار محددة. تحتاج مقارنة عادلة إلى قياس العائلتين على نفس الأساس التجريبي، على سبيل المثال خطأ الهبوط والوقود المستهلك عبر نفس مجموعة السيناريوهات، وهو ما لا تقدمه أي مطالبة هنا.
كيف يُبنى
كيفية بنائه، أو كيفية استخدامه
الإجراء التالي مخصص لفريق يريد إنتاج المقارنة المباشرة المفقودة فعليًا لصاروخ صغير النطاق، باستخدام الأساليب الموصوفة في المطالبات أعلاه كلبنات بناء. كل اختيار تصميمي أدناه يتجاوز ما تنص عليه المطالبات (قيم معاملات محددة، أنواع مكاملات) هو توضيحي فقط، اختير لجعل الإجراء ملموسًا، ولا يُزعَم أنه مأخوذ من أي مصدر مقتبَس.
- حدد المركبة ومجموعة السيناريوهات. ثبّت المركبة: كتلة جافة 10 كغ، أوج ارتفاع 100 متر، مع تحديد خصائص الكتلة والدفع والديناميكا الهوائية. حدد مجموعة ثابتة من الظروف الابتدائية (تشتّتات الموضع والسرعة والاتجاه) التي سيُختبَر عليها كلا أسلوبَي التوجيه، إذ لا تشترك أي من الأوراق المقتبسة في معيار مرجعي مشترك يمكن إعادة استخدامه مباشرة.
- ابنِ المحاكاة. نفّذ ديناميكيات الجسم الصلب للمركبة، بثلاث أو ست درجات حرية بحسب الصياغة التي تختارها لخط الأساس الكلاسيكي. لا تحدد أي مطالبة مقتبَسة مكاملًا أو برنامج محاكاة؛ اختر ما يناسب احتياجاتك من الدقة والسرعة ووثّقه صراحةً لأغراض إمكانية إعادة الإنتاج.
- نفّذ خط الأساس الكلاسيكي أولاً. نفّذ lossless convexification (LCvx)، التي كثيرًا ما تُطبَّق على مسألة توجيه الهبوط المدفوع ثلاثية الحرية [4]. إن احتجت ست درجات حرية، فاعلم أن الحل بسرعة وموثوقية أصعب في هذه الحالة، بسبب الطبيعة غير الخطية وغير المحدبة للمسألة، وتأثير مخطط التقطيع على صلاحية الحل، ودور المسار المرجعي في تحديد التقارب أو التباعد [4][14].
- تحقّق من خط الأساس مقابل الصعوبات المعروفة. اختبر حساسية الحلّال المحدب لمخطط التقطيع ولتهيئة المسار المرجعي، إذ إن كلاهما مذكور كسبب للتقارب أو التباعد [4][14]. إن استخدمت حلّال طريقة نقطة داخلية، تحقق من أنه يفي بميزانية وقت حل الزمن الحقيقي، كما هو مُبلَّغ عنه لنهج successive convexification على الهبوط المدفوع على المريخ [14]. سجّل وقت الحل ومعدل النجاح عبر مجموعة سيناريوهاتك قبل الانتقال إلى أي طريقة متعلَّمة.
- اختر خوارزمية تعلم معزز وصِغ عملية القرار الماركوفية (MDP). أعِد صياغة مسألة التوجيه كعملية قرار ماركوفية منفصلة زمنيًا، متبعًا نفس إعادة الصياغة التي أُجريت لمسألة تحكم أمثل عشوائي ذات صلة [7]. استخدم Proximal Policy Optimization (PPO) كخوارزمية أولى، متبعًا استخدامه لربط الحالة بالدفع في هبوط كوكبي مدفوع سداسي الحرية [1]؛ وكن مستعدًا لفشله بمفرده في مهمة هبوط صارمة موجهة نحو الهدف، إذ تشير التقارير إلى فشل خوارزميات التعلم المعزز القياسية بما فيها PPO هنا بسبب صعوبة الاستكشاف [6].
- إن فشل PPO بمفرده، أضف مخطط تدريب استكشاف موجَّه. نفّذ مخطط تدريب على غرار Random Annealing Jump Start: سياسة توجيهية تتنقل عبر البيئة لأفق توجيه مأخوذ عشوائيًا، تُسلِّم بعده إلى سياسة استكشاف لبقية الحلقة، مع تقلّص الحد الأعلى للأفق نحو الصفر مع تحسن الأداء [6]. هذا هو الأسلوب المُبلَّغ عنه لرفع معدل النجاح من 8% إلى 97% على نموذج صاروخي عالي الدقة [6]؛ عامل هذا الرقم كدليل على أن التقنية تعمل على تلك المركبة، لا كضمان لمركبتك.
- اضبط بنية المكافأة. فكّر في استخدام معدلات خصم مختلفة للمكافأة النهائية مقابل مكافأة التشكيل، إذ يُبلَّغ عن أن هذا يعزز أداء التحسين لمركبة هبوط كوكبية سداسية الحرية [1]. تحقّق من هذا الاختيار بشكل مستقل لصياغة مكافأتك الخاصة، إذ تُبلَّغ المطالبة عن هذا لتصميم مكافأة دراسة محددة.
- أضف اختبار القوة في مواجهة الضوضاء وعدم اليقين في المعاملات. شغّل كلاً من سياسة التعلم المعزز المدرَّبة وخط الأساس المحدب مقابل ضوضاء استشعار محقونة ومعاملات مركبة مضطربة، إذ تُذكر القوة في مواجهة الضوضاء وعدم اليقين في المعاملات كخاصية لنظام التوجيه بالتعلم المعزز سداسي الحرية [1]. سجّل معدل النجاح وخطأ الهبوط تحت كل مستوى اضطراب لكلا الأسلوبين، على نفس مجموعة الاضطرابات، لتكون المقارنة عادلة تمامًا.
- قِس دقة الهبوط واستهلاك الوقود لكلا الأسلوبين، جنبًا إلى جنب. لكل من السيناريوهات الثابتة من الخطوة 1، سجّل خطأ الموضع والسرعة النهائيَين وإجمالي الدافع المستهلك، لكل من سياسة التعلم المعزز وخط الأساس المحدب. هذه هي التجربة الأساسية التي لا توفرها الأدبيات المُستعرَضة، لذا صمّمها بعناية: نفس السيناريوهات، نفس نماذج الاضطراب، نفس المقاييس، نفس المركبة.
- فكّر في نهج بدء دافئ هجين كحالة ثالثة. نفّذ اختياريًا بدءًا دافئًا متعلَّمًا للحلّال المحدب، على غرار T-PDG أو T-SCvx، اللتين تتعلمان التنبؤ بمجموعة القيود المشدودة أو الفعّالة عند حل المسألة المثلى واستخدام هذا التنبؤ لبناء مسألة مصغّرة الحجم تبدأ دافئًا الحلّال [4]. قارن وقت حلّه بـ LCvx البسيطة، إذ يُبلَّغ عن تحسّن T-PDG لأوقات الحل بمقدار يصل إلى مرتبة كبرى مقارنةً بـ LCvx للمسألة ثلاثية الحرية الأقل استهلاكًا للوقود [4]، وأدرج هذا النهج الهجين كحالة ثالثة إلى جانب التعلم المعزز الخالص والتحسين المحدب الخالص.
- اختبر السلوك تحت الضغط قرب لحظة الهبوط. إن استخدمت أي قانون توجيه بأسلوب تغذية راجعة، تحقق من السلوك مع اقتراب الزمن المتبقي من الصفر، إذ يُبلَّغ عن أن حساسية المسارات الأمرية المولَّدة تزداد بشدة وتميل إلى اللانهاية في ذلك النظام لأحد هذه القوانين [5]. ضع سقفًا أو بدّل نمط التوجيه قرب لحظة الهبوط حسب الحاجة، ووثّق هذا التبديل صراحةً إذ لم يُتحقَّق منه بذاته في المطالبة المقتبَسة.
- أبلغ عن النتائج بأمانة. اذكر المركبة ومجموعة السيناريوهات والمقاييس المستخدمة، ولا تستقرئ نتائجك الصغيرة النطاق إلى صواريخ بحجم كامل أو العكس، إذ لم يُحصَل على أي من النتائج المقتبَسة على مركبة وزنها 10 كغ وأوجها 100 متر. إن احتاجت سياسة التعلم المعزز الخاصة بك اختبار Hardware-in-the-Loop قبل الطيران، لاحظ أن هذا الاختبار استُخدم في مكان آخر للتحقق من الجدوى في الزمن الحقيقي والانسيابية لنموذج صاروخي مختلف وأعلى دقة [6]، وعامل أي نقل لتلك النتيجة إلى مركبتك الأصغر باعتباره غير موثَّق حتى تختبره بنفسك.
function pipeline():
baseline_result = run_LCvx(vehicle, scenarios) # per [4]
rl_policy = train_PPO(vehicle_MDP) # per [1],[7]
if rl_policy.success_rate is low:
rl_policy = train_with_guided_exploration(vehicle_MDP) # per [6]
rl_result = evaluate(rl_policy, scenarios)
hybrid_result = run_warm_started_solver(vehicle, scenarios) # per [4], optional
compare(baseline_result, rl_result, hybrid_result)
# this three-way comparison is the missing evidence, not found in any cited claim
ما الذي سنبنيه
ما الذي كنا سنبنيه
كنا سنبني إطار مقارنة صغيرًا كامل المحاكاة لصاروخ وزنه 10 كغ وأوجه 100 متر، إذ لا تحتوي الأدبيات المُستعرَضة على أي اختبار مباشر من هذا النوع. في غضون بضعة أسابيع، يمكن لفريق من شخصين تنفيذ ديناميكيات جسم صلب ثلاثية الحرية للمركبة؛ وتنفيذ lossless convexification (LCvx) كخط الأساس الكلاسيكي، متبعًا الصياغة الموصوفة لمسألة توجيه الهبوط المدفوع الأقل استهلاكًا للوقود ثلاثية الحرية [4]؛ وتدريب سياسة توجيه قائمة على PPO تربط الحالة بالدفع، متبعةً نهج الربط المستخدم للهبوط الكوكبي المدفوع سداسي الحرية [1]، مع إضافة مخطط تدريب استكشاف موجَّه على غرار Random Annealing Jump Start إن فشل PPO البسيط في التقارب، إذ تشير التقارير إلى فشل PPO القياسي في مهام الهبوط الموجهة نحو الهدف [6].
كنا سنحكم على النتيجة بناءً على خطأ الموضع والسرعة عند الهبوط وإجمالي الدافع المستهلك، عبر مجموعة ثابتة من 50 سيناريو ابتدائي على الأقل مع ضوضاء استشعار محقونة واضطراب معاملات، مقارنين سياسة التعلم المعزز مباشرة بخط الأساس LCvx على نفس السيناريوهات، إذ إن القوة في مواجهة الضوضاء وعدم اليقين في المعاملات خاصية مزعومة للتوجيه بالتعلم المعزز في الأدبيات [1] لكنها لم تُختبَر قط مقابل خط أساس محدب. سيكون النجاح جدولاً واضحًا وقابلاً لإعادة الإنتاج لخطأ الموضع وخطأ السرعة والوقود المستهلك لكلا الأسلوبين عبر جميع السيناريوهات، إضافة إلى وقت الحل أو وقت الاستدلال لكل منهما.
سيعمل هذا بالكامل في المحاكاة على محطة عمل واحدة بمعالج رسومي (GPU) حديث لتدريب PPO، على الأرجح بتكلفة حوسبة أقل من بضع مئات من الدولارات نظرًا لصغر المركبة وقِصَر مدد الحلقات. لن يتطلب عتادًا فعليًا، رغم أن متابعة طبيعية، مستعيرةً فلسفة المحاكاة والعتاد المتطابقة التي أظهرتها منصة Open Ant [15]، ستكون بناء منصة اختبار فعلية صغيرة لاحقًا للتحقق مما إذا كان الترتيب المحاكى بين التعلم المعزز و LCvx يصمد عند التماس مع مركبة حقيقية.
الادعاءات والمراجعة
الادعاءات والمراجعة
- methodمدعوم
Proximal policy optimization (PPO) is used to learn a policy mapping the lander's estimated state directly to a commanded thrust for each engine.
[1] Deep Reinforcement Learning for Six Degree-of-Freedom Planetary Powered Descent and Landing, abstract DOI 10.48550/arxiv.1810.08719“Future Mars missions will require advanced guidance, navigation, and control algorithms for the powered descent phase to target specific surface locations and achieve pinpoint accuracy (landing error ellipse $<$ 5 m radius). The latter requires both a navigation system capable of…”
- methodمدعوم
Using different discount rates for terminal and shaping rewards significantly enhances optimization performance.
[1] Deep Reinforcement Learning for Six Degree-of-Freedom Planetary Powered Descent and Landing, abstract DOI 10.48550/arxiv.1810.08719“Future Mars missions will require advanced guidance, navigation, and control algorithms for the powered descent phase to target specific surface locations and achieve pinpoint accuracy (landing error ellipse $<$ 5 m radius). The latter requires both a navigation system capable of…”
- resultمدعوم
The RL policy results in accurate and fuel-efficient trajectories in a 6-DOF simulation environment.
[1] Deep Reinforcement Learning for Six Degree-of-Freedom Planetary Powered Descent and Landing, abstract DOI 10.48550/arxiv.1810.08719“Future Mars missions will require advanced guidance, navigation, and control algorithms for the powered descent phase to target specific surface locations and achieve pinpoint accuracy (landing error ellipse $<$ 5 m radius). The latter requires both a navigation system capable of…”
- resultمدعوم
The guidance system demonstrates robustness to noise and system parameter uncertainty.
[1] Deep Reinforcement Learning for Six Degree-of-Freedom Planetary Powered Descent and Landing, abstract DOI 10.48550/arxiv.1810.08719“Future Mars missions will require advanced guidance, navigation, and control algorithms for the powered descent phase to target specific surface locations and achieve pinpoint accuracy (landing error ellipse $<$ 5 m radius). The latter requires both a navigation system capable of…”
- resultمدعوم
T-PDG improves solution times by up to an order of magnitude compared to lossless convexification (LCvx) for the 3-DoF minimum fuel powered descent guidance problem.
[4] Tight Constraint Prediction of Six-Degree-of-Freedom Transformer-based Powered Descent Guidance, abstract arXiv:2501.00930v1“This work introduces Transformer-based Successive Convexification (T-SCvx), an extension of Transformer-based Powered Descent Guidance (T-PDG), generalizable for efficient six-degree-of-freedom (DoF) fuel-optimal powered descent trajectory generation. Our approach significantly e…”
- methodمدعوم
T-SCvx learns to predict the set of tight or active constraints at the optimal control problem's solution, creating a minimal reduced-size problem initialized with only the tight constraints, then uses the solution to warm-start the direct optimization solver.
[4] Tight Constraint Prediction of Six-Degree-of-Freedom Transformer-based Powered Descent Guidance, abstract arXiv:2501.00930v1“This work introduces Transformer-based Successive Convexification (T-SCvx), an extension of Transformer-based Powered Descent Guidance (T-PDG), generalizable for efficient six-degree-of-freedom (DoF) fuel-optimal powered descent trajectory generation. Our approach significantly e…”
- resultمرفوض
T-SCvx enables onboard computation of real-time guidance trajectories, demonstrated by a 6-DoF Mars powered landing application problem.
[4] Tight Constraint Prediction of Six-Degree-of-Freedom Transformer-based Powered Descent Guidance, section Tight Constraint Prediction of Six-Degree-of-Freedom Transformer-based Powered Descent Guidance“Richard Linares Note: Rockwell International Career Development Professor and Associate Professor, Department of Aeronautics and Astronautics, 125 Massachusetts Avenue. Senior Member AIAA. Affiliation: Department of Aeronautics and Astronautics, Massachusetts Institute of Technol…”
- limitationمدعوم
6-DoF powered descent guidance is known to be challenging to solve quickly and reliably due to the nonlinear and non-convex nature of the problem, the discretization scheme heavily influencing solution validity, and reference trajectory initialization determining algorithm convergence or divergence.
[4] Tight Constraint Prediction of Six-Degree-of-Freedom Transformer-based Powered Descent Guidance, section Tight Constraint Prediction of Six-Degree-of-Freedom Transformer-based Powered Descent Guidance“6-DoF powered descent guidance is known to be challenging to solve quickly and reliably due to the nonlinear and non-convex nature of the problem, the discretization scheme heavily influencing solution validity, and reference trajectory initialization determining algorithm conver…”
- methodمدعوم
Lossless convexification of nonconvex cost, dynamics, and control constraints is often applied to the 3-DoF powered descent guidance problem.
[4] Tight Constraint Prediction of Six-Degree-of-Freedom Transformer-based Powered Descent Guidance, section 2 Introduction“For common classes of problems, application of Pontryagin’s Maximum Principle [8] yield analytical solutions, but these methods fall short for trajectory generation as they are applicable to a limited set of mission constraints and objective functions [9, 10, 11, 12]. Moreover, w…”
- methodمدعوم
A novel online trajectory dispersion control method based on a Parameterized Optimal Feedback Guidance Law (POFGL) is proposed.
[5] Trajectory Dispersion Control for Precision Landing Guidance of Reusable Rockets, abstract arXiv:2504.11894v1“This article is an engineering note, and formal abstract is omitted in accordance with the requirements of the journal. The main idea of this note is as follows. In endoatmospheric landing of reusable rockets, there exist various kinds of disturbances that can induce the trajecto…”
- limitationمدعوم
As the time-to-go tends to zero, the sensitivity of the generated guidance command trajectories will significantly increase and inevitably tend to infinity.
[5] Trajectory Dispersion Control for Precision Landing Guidance of Reusable Rockets, section 1 Introduction“The explicit guidance method attenuates the effect of disturbances by regenerating feasible and/or optimal trajectories at each guidance period. The representative explicit guidance methods mainly contain E-guidance [1], Apollo powered descent guidance [2], Zero-Effort-Miss/Zero-…”
- factمدعوم
Endoatmospheric landing is subjected to more disturbing conditions, including engine thrust fluctuation, aerodynamic coefficient uncertainty, atmospheric density perturbation, and wind disturbance.
[5] Trajectory Dispersion Control for Precision Landing Guidance of Reusable Rockets, section 1 Introduction“Precision landing guidance is a critical enabling technology for reusable rocket recovery. Compared with lunar landing [1, 2] and planetary landing [3, 4], endoatmospheric landing is subjected to more disturbing conditions, including engine thrust fluctuation, aerodynamic coeffic…”
- resultمدعوم
Random Annealing Jump Start (RAJS) elevates the success rate of rocket landing control from 8% with a baseline controller to 97% on a high-fidelity rocket model using RL.
[6] Rocket Landing Control with Random Annealing Jump Start Reinforcement Learning, abstract arXiv:2407.15083v1“Rocket recycling is a crucial pursuit in aerospace technology, aimed at reducing costs and environmental impact in space exploration. The primary focus centers on rocket landing control, involving the guidance of a nonlinear underactuated rocket with limited fuel in real-time. Th…”
- methodمدعوم
In RAJS, the guide policy navigates the environment for the guide horizon, followed by the exploration policy taking charge to complete remaining steps; the guide horizon is sampled from a uniform distribution with its upper bound annealing to zero based on performance metrics.
[6] Rocket Landing Control with Random Annealing Jump Start Reinforcement Learning, abstract arXiv:2407.15083v1“Rocket recycling is a crucial pursuit in aerospace technology, aimed at reducing costs and environmental impact in space exploration. The primary focus centers on rocket landing control, involving the guidance of a nonlinear underactuated rocket with limited fuel in real-time. Th…”
- limitationمدعوم
Standard RL algorithms, such as PPO, SAC and DSAC, fail in goal-oriented rocket landing scenarios due to their reliance on extensive exploration; the likelihood of randomly reaching the goal diminishes exponentially over time.
[6] Rocket Landing Control with Random Annealing Jump Start Reinforcement Learning, section I Introduction“RL offers a powerful paradigm to iteratively optimize policies for control problems by maximizing the expected cumulative rewards. It has shown remarkable success in various domains, including video games [1], board games [2], robotics [3], and autonomous driving [4]. In these pr…”
- resultمدعوم
The RAQResNet model achieved a validation loss approximately 300 times lower than the standard architecture with an equal number of trainable parameters and 50 times lower than the standard architecture with twice the number of trainable parameters.
[2] Optimal Reusable Rocket Landing Guidance: A Cutting-Edge Approach Integrating Scientific Machine Learning and Enhanced Neural Networks, abstract DOI 10.1109/access.2024.3359417“This study presents an innovative approach that utilizes scientific machine learning and two types of enhanced neural networks for modeling a parametric guidance algorithm within the framework of ordinary differential equations to optimize the landing phase of reusable rockets. O…”
- resultمدعوم
The resulting closed-loop guidance policy from image-based reinforcement meta-learning reaches errors in the order of meters in different scenarios, even when the environment is partially observed.
[3] Image-Based Deep Reinforcement Meta-Learning for Autonomous Lunar Landing, abstract DOI 10.2514/1.a35072“Future exploration and human missions on large planetary bodies (e.g., moon, Mars) will require advanced guidance navigation and control algorithms for the powered descent phase, which must be capable of unprecedented levels of autonomy. The advent of machine learning, and specif…”
- resultمدعوم
The proposed method is validated through extensive evaluation and Hardware-in-the-Loop testing, affirming the effectiveness, real-time feasibility, and smoothness of the proposed controller.
[6] Rocket Landing Control with Random Annealing Jump Start Reinforcement Learning, section Rocket Landing Control with Random Annealing Jump Start Reinforcement Learning“Additional enhancements, including cascading jump start, refined reward and terminal condition, and action smoothness regulation, further improve policy performance and practical applicability. The proposed method is validated through extensive evaluation and Hardware-in-the-Loop…”
- methodمدعوم
An open-source implementation of the state-of-the-art algorithm Proximal Policy Optimization is adopted to carry out the training process of a deep neural network.
[7] Reinforcement Learning for Robust Trajectory Design of Interplanetary Missions, abstract DOI 10.2514/1.g005794“This paper investigates the use of reinforcement learning for the robust design of low-thrust interplanetary trajectories in presence of severe uncertainties and disturbances, alternately modeled as Gaussian additive process noise, observation noise, and random errors in the actu…”
- resultمدعوم
Numerical results show that the guidance system can correctly drive the spacecraft toward the final impact point in more than 98% of the 500 test scenarios.
[8] Image-Based Meta-Reinforcement Learning for Autonomous Guidance of an Asteroid Impactor, abstract DOI 10.2514/1.g006832“This paper focuses on the use of meta-reinforcement learning for the autonomous guidance of a spacecraft during the terminal phase of an impact mission toward a binary asteroid system. The control policy is replaced by a convolutional-recurrent neural network, which is used to ma…”
- factمدعوم
One of the challenges lies in the recovery GNC strategy and algorithms, in particular those of the powered-landing phase, which must enable a precise landing with low fuel margins and significant dispersions.
[9] Design of the landing guidance for the retro-propulsive vertical landing of a reusable rocket stage, abstract DOI 10.1007/s12567-022-00423-6“Abstract Launcher reusability is the most effective way of reducing access to space costs, but remains a great technical challenge for the European aerospace industry. One of the challenges lies in the recovery GNC strategy and algorithms, in particular those of the powered-landi…”
- resultمدعوم
Numerical simulations show that the proposed method can find a feasible landing trajectory where the AOA constraint is satisfied and has a better convergence performance compared with the traditional linearization method.
[10] A Convex Programming Method for Rocket Powered Landing With Angle of Attack Constraint, abstract DOI 10.1109/access.2020.2997235“Real time trajectory planning is vital in rocket precision powered landing guidance. Due to the nonconvex angle of attack (AOA) constraint and other constraints, including nonlinear dynamics and thrust constraint, the powered landing trajectory planning problem is highly nonconve…”
- resultمدعوم
Through numerical experiments on a Lunar rover problem and a 3-degrees-of-freedom Mars powered descent guidance problem, we demonstrate that TOAST outperforms benchmark approaches in terms of both computation times and network prediction constraint satisfaction.
[11] Constraint-Informed Learning for Warm Starting Trajectory Optimization, abstract DOI 10.13140/rg.2.2.35597.92646“Future spacecraft and surface robotic missions require increasingly capable autonomy stacks for exploring challenging and unstructured domains, and trajectory optimization will be a cornerstone of such autonomy stacks. However, the nonlinear optimization solvers required remain t…”
- limitationمدعوم
Existing approaches typically approximate task differences using agent-centric signals, such as regret or value disagreement, but these are inherently policy-dependent and sensitive to noise.
[12] Causal-Paced Deep Reinforcement Learning, section 1 Introduction“Just as a child first learns to crawl before walking and running, intelligent behavior in complex environments is rarely acquired in a single leap. Instead, learning unfolds through a gradual accumulation of simpler skills that scaffold more advanced capabilities. This principle …”
- methodمدعوم
We propose Causal-Paced Deep Reinforcement Learning (CP-DRL), a framework that addresses this limitation by approximating the SCM difference between tasks using only interaction data.
[12] Causal-Paced Deep Reinforcement Learning, section 1 Introduction“While SCM-based comparison provides a principled way to quantify task differences, it relies on access to the true causal structure, which is rarely available in realistic RL environments (Zanga et al., 2022). In this work, we propose Causal-Paced Deep Reinforcement Learning (CP-…”
- resultمدعوم
Compared to carefully tuned open-loop sequences and PID controllers, the deep reinforcement learning controller achieves the highest performance.
[13] A Reinforcement Learning Approach for Transient Control of Liquid Rocket Engines, abstract DOI 10.1109/taes.2021.3074134“Nowadays, liquid rocket engines use closed-loop control at most near-steady operating conditions. The control of the transient phases is traditionally performed in open loop due to highly nonlinear system dynamics. This situation is unsatisfactory, in particular for reusable engi…”
- resultمدعوم
It is shown that the learned policy can reach different steady-state operating points and convincingly adapt to changing system parameters.
[13] A Reinforcement Learning Approach for Transient Control of Liquid Rocket Engines, abstract DOI 10.1109/taes.2021.3074134“Nowadays, liquid rocket engines use closed-loop control at most near-steady operating conditions. The control of the transient phases is traditionally performed in open loop due to highly nonlinear system dynamics. This situation is unsatisfactory, in particular for reusable engi…”
- limitationمدعوم
Solving this problem quickly and reliably is challenging because (a) it is nonlinear and non-convex, (b) the validity of the solution is heavily dependent on the accuracy of the discretization scheme, and (c) it can be difficult to select a suitable reference trajectory to initialize an iterative solution process.
[14] Successive Convexification for 6-DoF Mars Rocket Powered Landing with Free-Final-Time, abstract arXiv:1802.03827v1“In this paper, we employ successive convexification to solve the minimum-time 6-DoF rocket powered landing problem. The contribution of this paper is the development and demonstration of a free-final-time problem formulation that can be solved iteratively using a successive conve…”
- resultمدعوم
Through the use of Interior Point Method (IPM) solvers, this sequence can be solved quickly and reliably, thus enabling higher fidelity real-time guidance for rocket powered landings on Mars.
[14] Successive Convexification for 6-DoF Mars Rocket Powered Landing with Free-Final-Time, section Successive Convexification for 6-DoF Mars Rocket Powered Landing with Free-Final-Time“To deal with these issues, our algorithm (a) uses successive convexification to eliminate non-convexities, (b) computes the discrete linear-time-variant system matrices to ensure that the converged solution perfectly satisfies the original nonlinear dynamics, and (c) can be initi…”
- factمدعوم
Convex optimization has been considered a prime candidate for on-board autonomous guidance applications due to its deterministic behavior, its global optimality guarantees, its ability to provide certificates of convergence and infeasibility, and the availability of efficient interior point method (IPM) algorithms.
[14] Successive Convexification for 6-DoF Mars Rocket Powered Landing with Free-Final-Time, section 1 Introduction“Solving autonomous optimal landing guidance problems quickly and reliably is challenging for three reasons. First, they are nonlinear and non-convex. Second, for numerical implementations, the validity of the solution is heavily dependent on the accuracy of the discretization sch…”
- methodمدعوم
The stochastic optimal control problem is recast as a time-discrete Markov decision process to comply with the standard formulation of reinforcement learning.
[7] Reinforcement Learning for Robust Trajectory Design of Interplanetary Missions, abstract DOI 10.2514/1.g005794“This paper investigates the use of reinforcement learning for the robust design of low-thrust interplanetary trajectories in presence of severe uncertainties and disturbances, alternately modeled as Gaussian additive process noise, observation noise, and random errors in the actu…”
- factمدعوم
The Open Ant is a physical variant of the commonly used Gymnasium Ant environment, along with a simulation.
[15] The Open Ant: A Robot Platform for Reinforcement Learning Research, section (top)“The Open Ant: A Robot Platform for Reinforcement Learning Research arXiv is now an independent nonprofit! Learn more × License: CC BY 4.0 arXiv:2607.18488v1 [cs.RO] 20 Jul 2026 The Open Ant: A Robot Platform for Reinforcement Learning Research Elena Sorina Lupu, Patrick Spieler, …”
- resultمدعوم
Competent walking policies can be learned from scratch in approximately one hour directly from the physical robot’s experience for SARSA(λ) and Soft Actor-Critic (SAC).
[15] The Open Ant: A Robot Platform for Reinforcement Learning Research, section (top)“The Open Ant: A Robot Platform for Reinforcement Learning Research arXiv is now an independent nonprofit! Learn more × License: CC BY 4.0 arXiv:2607.18488v1 [cs.RO] 20 Jul 2026 The Open Ant: A Robot Platform for Reinforcement Learning Research Elena Sorina Lupu, Patrick Spieler, …”
- resultمدعوم
Policies learned in simulation transfer to reality for the Open Ant platform.
[15] The Open Ant: A Robot Platform for Reinforcement Learning Research, section (top)“The Open Ant: A Robot Platform for Reinforcement Learning Research arXiv is now an independent nonprofit! Learn more × License: CC BY 4.0 arXiv:2607.18488v1 [cs.RO] 20 Jul 2026 The Open Ant: A Robot Platform for Reinforcement Learning Research Elena Sorina Lupu, Patrick Spieler, …”
- factمدعوم
The Open Ant robot body is designed to look like the widely used Gymnasium Ant environment.
[15] The Open Ant: A Robot Platform for Reinforcement Learning Research, section 1 Introduction“Even in situations where adequate lab resources and expertise are available, the long delay caused by the assembly of the robot and troubleshooting before the first successful experiment can exhaust a considerable portion of a researcher’s typical residency. Consequently, experts…”
- factمدعوم
The Open Ant robot is designed to be built and maintained by AI researchers without backgrounds in robotics engineering.
[15] The Open Ant: A Robot Platform for Reinforcement Learning Research, section 1 Introduction“Even in situations where adequate lab resources and expertise are available, the long delay caused by the assembly of the robot and troubleshooting before the first successful experiment can exhaust a considerable portion of a researcher’s typical residency. Consequently, experts…”
- methodمدعوم
The Open Ant platform uses an overhead webcam to track fiducial markers to compute reward signals and the heading vector of the ant.
[15] The Open Ant: A Robot Platform for Reinforcement Learning Research, section 1 Introduction“Even in situations where adequate lab resources and expertise are available, the long delay caused by the assembly of the robot and troubleshooting before the first successful experiment can exhaust a considerable portion of a researcher’s typical residency. Consequently, experts…”
- methodمدعوم
The robot is connected by cables to AC power and to an external computer where the agent is running.
[15] The Open Ant: A Robot Platform for Reinforcement Learning Research, section 1 Introduction“Even in situations where adequate lab resources and expertise are available, the long delay caused by the assembly of the robot and troubleshooting before the first successful experiment can exhaust a considerable portion of a researcher’s typical residency. Consequently, experts…”
- factمدعوم
The Open Ant comes with a MuJoCo simulation, which can be used to learn competent policies.
[15] The Open Ant: A Robot Platform for Reinforcement Learning Research, section 1 Introduction“Even in situations where adequate lab resources and expertise are available, the long delay caused by the assembly of the robot and troubleshooting before the first successful experiment can exhaust a considerable portion of a researcher’s typical residency. Consequently, experts…”
- factمدعوم
Gym-μRTS is a fast-to-run RL environment for full-game RTS research.
[17] Gym-$μ$RTS: Toward Affordable Full Game Real-time Strategy Games Research with Deep Reinforcement Learning, abstract arXiv:2105.13807v3“In recent years, researchers have achieved great success in applying Deep Reinforcement Learning (DRL) algorithms to Real-time Strategy (RTS) games, creating strong autonomous agents that could defeat professional players in StarCraft~II. However, existing approaches to tackle fu…”
المصادر
المصادر
- [1]Brian Gaudet, Richard Linares, Roberto Furfaro. Deep Reinforcement Learning for Six Degree-of-Freedom Planetary Powered Descent and Landing. arXiv (Cornell University), 2018.
- [2]Ugurcan Çelik, Mustafa Umut Demi̇rezen. Optimal Reusable Rocket Landing Guidance: A Cutting-Edge Approach Integrating Scientific Machine Learning and Enhanced Neural Networks. IEEE Access, 2024.
- [3]Andrea Scorsoglio, Andrea D’Ambrosio, Luca Ghilardi, Brian Gaudet, Fabio Curti, Roberto Furfaro. Image-Based Deep Reinforcement Meta-Learning for Autonomous Lunar Landing. Journal of Spacecraft and Rockets, 2021.
- [4]Julia Briden, Trey Gurga, Breanna Johnson, Abhishek Cauligi, Richard Linares. Tight Constraint Prediction of Six-Degree-of-Freedom Transformer-based Powered Descent Guidance. arXiv, 2025.
- [5]Xinglun Chen, Ran Zhang, Huifeng Li. Trajectory Dispersion Control for Precision Landing Guidance of Reusable Rockets. arXiv, 2025.
- [6]Yuxuan Jiang, Yujie Yang, Zhiqian Lan, Guojian Zhan, Shengbo Eben Li, Qi Sun, Jian Ma, Tianwen Yu, Changwu Zhang. Rocket Landing Control with Random Annealing Jump Start Reinforcement Learning. arXiv, 2024.
- [7]Alessandro Zavoli, Lorenzo Federici. Reinforcement Learning for Robust Trajectory Design of Interplanetary Missions. Journal of Guidance Control and Dynamics, 2021.
- [8]Lorenzo Federici, Andrea Scorsoglio, Luca Ghilardi, Andrea D’Ambrosio, Boris Benedikter, Alessandro Zavoli. Image-Based Meta-Reinforcement Learning for Autonomous Guidance of an Asteroid Impactor. Journal of Guidance Control and Dynamics, 2022.
- [9]Afonso Botelho, Marc Martínez‐Estrada, Cristina Recupero, A. Fabrizi, Gabriele De Zaiacomo. Design of the landing guidance for the retro-propulsive vertical landing of a reusable rocket stage. CEAS Space Journal, 2022.
- [10]Lei Xie, Hongbo Zhang, Xiang Sean Zhou, Guojian Tang. A Convex Programming Method for Rocket Powered Landing With Angle of Attack Constraint. IEEE Access, 2020.
- [11]Julia Briden, Changrak Choi, Kyongsik Yun, Richard Linares, Abhishek Cauligi. Constraint-Informed Learning for Warm Starting Trajectory Optimization. arXiv (Cornell University), 2023.
- [12]Geonwoo Cho, Jaegyun Im, Doyoon Kim, Sundong Kim. Causal-Paced Deep Reinforcement Learning. arXiv, 2025.
- [13]Günther Waxenegger-Wilfing, Kai Dresia, Jan C. Deeken, Michael Oschwald. A Reinforcement Learning Approach for Transient Control of Liquid Rocket Engines. IEEE Transactions on Aerospace and Electronic Systems, 2021.
- [14]Michael Szmuk, Behcet Acikmese. Successive Convexification for 6-DoF Mars Rocket Powered Landing with Free-Final-Time. arXiv, 2018.
- [15]Elena Sorina Lupu, Patrick Spieler, Khurram Javed, Kris De Asis, John D. Martin, Martha Steenstrup, Joseph Modayil. The Open Ant: A Robot Platform for Reinforcement Learning Research. arXiv, 2026.
- [16]Iat Hang Fong, Tengyue Li, Simon Fong, Raymond K. Wong, Antonio J. Tallón-Ballesteros. Predicting concentration levels of air pollutants by transfer learning and recurrent neural network. arXiv, 2025.
- [17]Shengyi Huang, Santiago Ontañón, Chris Bamford, Lukasz Grela. Gym-$μ$RTS: Toward Affordable Full Game Real-time Strategy Games Research with Deep Reinforcement Learning. arXiv, 2021.
- [18]Abdul Wahab, Raksha Kumaraswamy, Martha White. Value Bonuses using Ensemble Errors for Exploration in Reinforcement Learning. arXiv, 2026.