أبحاث

ضبط نماذج الأساس للسلاسل الزمنية على أشرطة داخل اليوم: أي وصفة تتفوق على zero-shot؟

Fine-Tuning Time-Series Foundation Models on Intraday Bars: Which Recipe Beats Zero-Shot?

نُشر
دقائق قراءة
27 min · 4,068 كلمة
الادعاءات والمراجعة
39/40 ادعاءات موثقة · 12 مصادر

الطبعات: English · Español · Français

الجواب المباشر

لا يوجد دليل مباشر في الادعاءات الموثقة يجيب على هذا السؤال. لا يقارن أي مقطع مستشهد به بين full fine-tuning و LoRA واستبدال رأس الكميات (quantile head) لنماذج TimesFM أو Chronos أو Lag-Llama أو Moirai على أشرطة OHLCV بفاصل دقيقة واحدة أو خمس دقائق ضمن تقسيمات purged walk-forward، ولا يُبلّغ أي منها عن تكاليف ساعات GPU لتدريب نموذج بحجم 25M إلى 200M معامل على أصل واحد يضم من 500K إلى 2M شريط [1] [8]. ما تقدمه الادعاءات هو خلفية حول كيفية بناء هذه النماذج الأساسية وضبطها في مجالات أخرى، ونتائج عامة حول أسباب أن يساعد الضبط الدقيق (fine-tuning) أو يضر في بيانات غير مرئية، وآلية ضبط دقيق كفؤة بارامترياً (LoRA) يمكن اختبارها، ونتيجة تحذيرية من دراسة مرتبطة لكن مختلفة حول التنبؤ داخل اليوم على بيانات العقود الآجلة وجدت عدم وجود ميزة اتجاهية ذات دلالة إحصائية باستخدام نماذج تعلم آلي تسلسلية. أي باني حل يريد إجابة يجب أن يُجري التجربة المباشرة بنفسه؛ توضح هذه المذكرة ما هو معروف، وما هو مفقود، وكيفية تصميم تلك التجربة.

لماذا يظل السؤال مفتوحاً ولماذا يهم

تُدرَّب نماذج الأساس للسلاسل الزمنية (time-series foundation models) حالياً مسبقاً على مجموعات بيانات واسعة، ثم تُطبَّق على مجالات جديدة بإعادة تدريب قليلة أو معدومة، لكن أشرطة (bars) البيانات المالية داخل اليوم هدف صعب: قصيرة السياق، وغير مستقرة إحصائياً، وصاخبة. أي مكتب تداول أو بحث يريد استخدام TimesFM أو Chronos أو Lag-Llama أو Moirai على أشرطة OHLCV بفاصل دقيقة واحدة أو خمس دقائق يحتاج إلى معرفة أي وصفة تكييف، full fine-tuning أو LoRA أو استبدال رأس الكميات فقط، تعطي أفضل دقة اتجاهية خارج العينة وأفضل معايرة (calibration)، وما هي تكلفة الحوسبة لذلك التكييف. هذا قرار هندسي ملموس له ميزانية حقيقية مرتبطة به: ساعات GPU، والوقت الفعلي، وخطر الإفراط في المطابقة (overfitting) على تاريخ أصل واحد.

لا تحسم الادعاءات الموثقة المتاحة هنا هذا السؤال. لا يوجد مقطع يُبلّغ عن مقارنة بين full fine-tuning و LoRA واستبدال رأس الكميات ضمن تقسيمات purged walk-forward لأشرطة OHLCV بفاصل دقيقة واحدة أو خمس دقائق، لأي من TimesFM أو Chronos أو Lag-Llama أو Moirai [1] [8]. كما لا يوجد مقطع يُبلّغ عن قياسات ساعات GPU لتدريب نموذج بـ 25M إلى 200M معامل على أصل واحد يضم من 500K إلى 2M شريط [1]. أي ادعاء مخالف لذلك سيكون نتيجة مختلَقة، وليست مُبلَّغاً عنها.

ما هو متاح غير مباشر: أوصاف لكيفية بناء كل نموذج أساس وضبطه في ورقته البحثية الخاصة، وعلى معاييره القياسية (benchmarks) الخاصة؛ ودراسة عامة حول أسباب أن يساعد أو يضر ضبط نماذج الأساس على سلاسل زمنية غير مرئية؛ ووصف آلية LoRA التي توضح ما هي وفورات المعاملات التي تقدمها بشكل عام؛ ودراسة تجريبية منفصلة عن التنبؤ داخل اليوم للعقود الآجلة بمعماريات ليست نماذج أساس (LSTM وgradient boosting) توصلت إلى نتيجة سلبية بشأن دقة الاتجاه. لا شيء من هذا يعوّض عن التجربة المباشرة المفقودة، لكنها معاً تحدد ما ينبغي لباني الحل توقعه وقياسه.

يعرض بقية هذا المقال، بصدق، ما هو كل نموذج أساس وكيفية تكييفه، وما تقوله أدبيات الضبط الدقيق العامة حول المخاطرة والفائدة، وما وجدته دراسة ذات صلة داخل اليوم باستخدام طرق ليست نماذج أساس، ثم يقدم إجراءً ملموساً وكوداً عاملاً لباني الحل لإجراء المقارنة الفعلية على بياناته الخاصة، لأن الأدبيات لا تحتوي عليها بعد.

نماذج الأساس الأربعة موضع النقاش

Lag-Llama هو نموذج أساس عام الغرض للتنبؤ الاحتمالي بالسلاسل الزمنية أحادية المتغير، مبني على معمارية transformer من نوع decoder-only يستخدم الفوارق الزمنية (lags) كمتغيرات مساعدة (covariates) [3]. تم تدريبه مسبقاً على مجموعة بيانات كبيرة ومتنوعة من السلاسل الزمنية المستمدة من عدة مجالات، والقصد التصميمي هو أن يمكن ضبطه بدقة (fine-tuned) على أجزاء صغيرة نسبياً من مجموعات بيانات لم يرها من قبل [3]. في إعدادات zero-shot، أي بدون أي ضبط دقيق على مجموعة البيانات المستهدفة، يؤدي Lag-Llama أداءً مماثلاً للنماذج التي دُرِّبت خصيصاً على تلك المجموعة [3].

Chronos هو إطار عمل مُدرَّب مسبقاً للتنبؤ الاحتمالي بالسلاسل الزمنية، مبني على معماريات نماذج لغوية من نوع transformer [8]. آليته المركزية هي التقطيع الرمزي (tokenization): يقوم Chronos بتحجيم (scaling) وتكميم (quantizing) قيم السلاسل الزمنية الحقيقية إلى مفردات ثابتة من الفئات المنفصلة، دون تغيير معمارية النموذج اللغوي الأساسية [8] [8]. ثم يقوم بتدريب معماريات نماذج لغوية موجودة مبنية على transformer على هذه التسلسلات المُرمَّزة باستخدام دالة الخسارة المعتادة cross-entropy [8]. تعتمد نماذج Chronos على عائلة T5 وتتراوح من 20M إلى 710M معامل، ويمكن للإطار استخدام إما معمارية encoder-decoder أو decoder-only [8] [8]. عند الاستدلال، يقوم Chronos بأخذ عينات رمزية تلقائية الانحدار (autoregressively) من النموذج ويعيد ربطها بالقيم الرقمية، ويبني توزيعاً تنبؤياً بأخذ عينات من مسارات تنبؤ متعددة [8] [8]. يركز العمل على التنبؤ أحادي المتغير، حيث تكون كل ملاحظة قيمة عددية، ويُصاغ هدف التنبؤ بوصفه التوزيع المشترك للخطوات H التالية بشرط الملاحظات C السابقة، p(x_{C+1:C+H}|x_{1:C}) [8] [8]. تم تدريب Chronos مسبقاً على مجموعة كبيرة من مجموعات البيانات المتاحة للعموم، مُكمَّلة بمجموعة بيانات اصطناعية تم توليدها باستخدام Gaussian processes [8].

Moirai-MoE هو متغير مصمم لمعالجة قيد محدد في التخصص القائم على التردد. يستخدم Moirai نفسه طبقات إسقاط دخل وخرج متعددة (input and output projection layers) مخصصة للسلاسل الزمنية ذات ترددات محددة، بينما يحافظ TimesFM بدلاً من ذلك على قاموس تضمين تردد (frequency embedding dictionary) [4]. القيد المزعوم للتخصص على مستوى التردد هو أن السلاسل الزمنية ذات الترددات المختلفة يمكن أن تُظهر أنماطاً متشابهة، والسلاسل الزمنية ذات التردد نفسه يمكن أن تُظهر أنماطاً مختلفة، وأن عدم الاستقرارية (non-stationarity) يمكن أن يُنتج توزيعات متنوعة حتى ضمن نافذة سياق قصيرة [4]. يعالج Moirai-MoE ذلك باستبدال الطبقات الخاصة بالتردد بطبقة إسقاط دخل/خرج واحدة ومزيج خبراء متناثر (sparse mixture of experts) داخل الـ transformer [4].

تأتي هذه الأوصاف الأربعة من أربع أوراق بحثية مختلفة، لكل منها معاييرها القياسية وأهدافها التصميمية الخاصة؛ ولم يُقيَّم أي منها في المقاطع المتاحة هنا مقابل الأخرى على مجموعة بيانات أشرطة داخل اليوم نفسها. ينبغي لباني الحل أن يتعامل مع الأوصاف المعمارية باعتبارها خلفية لفهم ما يمكن لكل نموذج فعله، وليس كترتيب تفضيلي.

الضبط الدقيق: المكاسب والمخاطر وآلية LoRA

تحتوي الادعاءات على خيطين منفصلين من الأدلة حول الضبط الدقيق: رواية إيجابية في الغالب لنتائج ضبط Lag-Llama على معاييره القياسية الخاصة، ورواية أكثر تحفظاً حول مخاطر الضبط الدقيق من دراسة عامة حول نقل نماذج الأساس. عند الضبط الدقيق على أجزاء صغيرة نسبياً من مجموعات بيانات لم يرها من قبل، يحقق Lag-Llama أداءً هو الأفضل من نوعه (state-of-the-art) ويتفوق على مناهج التعلم العميق السابقة في المتوسط [3]. بعد الضبط الدقيق عبر مجموعات بيانات متنوعة، أُفيد بأن Lag-Llama يُظهر أداءً هو الأفضل من نوعه ويبرز كأفضل نموذج عام الغرض دون معرفة مسبقة بمجموعات البيانات النهائية (downstream) [3]. هذه نتائج Lag-Llama المُبلَّغ عنها ذاتياً، على معاييره القياسية الخاصة؛ وليست دليلاً على أشرطة OHLCV داخل اليوم تحديداً.

يحذّر خط أدلة منفصل من أن هذا النوع من المكاسب غير مضمون في أماكن أخرى. تواجه نماذج الأساس للسلاسل الزمنية تحولات توزيعية (distribution shifts) ناتجة عن بنى خاصة بالمجال مثل الموسمية (seasonality) والاتجاهات (trends) والعينات غير المنتظمة والتباين الشديد عبر التطبيقات [5]. أداء zero-shot حساس جداً لمدى توافق الخصائص الإحصائية لمجال التدريب المسبق مع المجال المستهدف [5]. والأهم بالنسبة لاستراتيجية الضبط الدقيق: يمكن للضبط الدقيق الممتد لنماذج الأساس للسلاسل الزمنية أن يؤدي إلى تدهور الأداء، في حين أن النماذج المتخصصة لمهمة معينة المُدرَّبة من الصفر عادةً ما تكتسب دقة أكبر مع تدريب أطول تحت ظروف بيانات محدودة [5]. وعلى السلاسل الزمنية الواقعية غير المرئية، لا تُنتج نماذج الأساس المضبوطة نتائج أفضل بشكل جوهري من نماذج أصغر ومخصصة، بالنسبة لعدد معاملاتها الأكبر وبصمتها الأكبر في الذاكرة [5]. هذا تحذير مهم لأي شخص يخطط لميزانية ساعات GPU من أجل ضبط دقيق كامل لنموذج بـ 200M معامل: حجم النموذج لا يُترجَم تلقائياً إلى دقة أعلى.

يُوصَف LoRA في ورقة بحثية منفصلة بأنه آلية ضبط دقيق كفؤة بارامترياً، غير خاصة بالسلاسل الزمنية، لكنها ذات صلة مباشرة بباني حل يقرر كيفية تكييف نموذج أساس بتكلفة منخفضة. يقلّل LoRA عدد المعاملات المدرَّبة لتحديث d×l من d×l إلى r×(d+l)، حيث r هو البُعد منخفض الرتبة (low-rank dimension) [6]. عملياً، يُهيّئ LoRA عادةً المصفوفة A بقيم غاوسية عشوائية والمصفوفة B بأصفار، ما يعطي بداية مستقرة للضبط الدقيق لأن التحديث الأولي يساوي صفراً [6]. هذه الآلية عامة الغرض؛ لا تُبلغ الادعاءات هنا عن تطبيقها على TimesFM أو Chronos أو Lag-Llama أو Moirai على أشرطة OHLCV، لكن حسابات تقليل المعاملات قابلة للاستخدام المباشر لتقدير تكلفة التدريب لأي من هذه المعماريات.

مجتمعةً، تقول هذه الخيوط الثلاثة: يمكن للضبط الدقيق أن يساعد كثيراً على مجموعات البيانات التي تختار ورقة نموذج الأساس الإبلاغ عنها، والنقل العام إلى مجالات جديدة هش وحساس للتوافق التوزيعي، وهناك بديل رخيص كفؤ بارامترياً للضبط الدقيق الكامل تُحسب وفوراته بدقة. لا شيء من هذا يخبرنا أيّ من full fine-tuning أو LoRA أو استبدال رأس الكميات يفوز على أشرطة داخل اليوم، لأن أي ادعاء لا يُجري تلك المقارنة.

نتيجة تحذيرية من دراسة مرتبطة داخل اليوم

تختبر دراسة واحدة في الادعاءات الموثقة التعلم الآلي التسلسلي على بيانات العقود الآجلة داخل اليوم، وإن لم تكن نموذج أساس للسلاسل الزمنية ولا وصفات الضبط الدقيق موضع السؤال. تقارن الدراسة نماذج LSTM وgradient boosting على أشرطة خمس دقائق لعقد MNQ (عقد آجل لمؤشر Nasdaq-100)، وهي سياق مفيد لما يُتوقع من التنبؤ الاتجاهي قصير الأفق داخل اليوم بشكل عام.

تحت تحقق صارم من نوع walk-forward بنافذة متوسّعة (expanding-window) عبر ثلاث فترات خارج العينة، لم تحقق أي تهيئة تم تقييمها دقة ذات دلالة إحصائية أعلى من معدل الأساس البالغ 51.8% للهدف الاتجاهي لـ MNQ [1]. تراوحت دقة الأداء المجمّعة خارج العينة بين 50.00% و50.89% لمتغيرات gradient boosting، بينما حقق LSTM 50.59% [1]. أنتجت اختبارات التبديل (permutation tests) قيم p بلغت 0.135 لأفضل نموذج gradient boosting و0.515 لـ LSTM، ما يشير إلى عدم وجود ميزة تنبؤية ذات دلالة إحصائية فوق معدل الأساس [1].

تقدم الدراسة نفسها تفسيراً تشخيصياً بدلاً من مجرد رقم سلبي: أشارت عدم استقرار أهمية الميزات (feature-importance instability) عبر طيات walk-forward إلى أن النماذج كانت تُطابق الضوضاء بدلاً من التقاط إشارة بنيوية مستقرة [1]. استنتاجها العام هو أن أربع سنوات من بيانات OHLCV بفاصل خمس دقائق لأداة واحدة لم تكن كافية لتنبؤ داخل اليوم موثوق قائم على التعلم الآلي التسلسلي [1].

هذه النتيجة تتعلق بـ LSTM وgradient boosting على MNQ، وليست عن TimesFM أو Chronos أو Lag-Llama أو Moirai، ولا عن مقارنة full fine-tuning بـ LoRA باستبدال رأس الكميات. لا يمكن قراءتها كدليل على أن نماذج الأساس ستفشل بالطريقة نفسها. لكنها معدل أساس ذو صلة مباشرة وتحذير ذو صلة مباشرة: على مجموعة بيانات واحدة داخل اليوم لأداة واحدة بحجم مشابه، لم تجد النماذج التسلسلية غير القائمة على نماذج الأساس أي ميزة اتجاهية ذات دلالة إحصائية، والسبب المطروح كان مطابقة الضوضاء، وليس مشكلة في سعة النموذج. ينبغي لأي باني حل يختبر وصفات ضبط دقيق لنماذج أساس على أحجام بيانات مشابهة أن يعتبر هذا الشرط للدلالة الإحصائية معياراً للتفوق عليه، وأن يُجري نفس نوع اختبار التبديل.

ما تم قياسه فعلاً، وما لم يُقاس

لتوخّي الدقة بشأن قاعدة الأدلة: النتائج العددية الوحيدة للدقة خارج العينة المرتبطة بأشرطة داخل اليوم في الادعاءات الموثقة هي نتائج MNQ أعلاه، وهي تخص LSTM وgradient boosting، وليس أي نموذج أساس للسلاسل الزمنية [1]. يُبلّغ Chronos عن تقييمه القياسي الخاص، لكن على نطاق مختلف ومقابل خطوط أساس مختلفة: في معيار قياسي (benchmark) يضم 42 مجموعة بيانات، تفوّق Chronos بشكل ذي دلالة على طرق أخرى في مجموعات البيانات المضمَّنة في مجموعة بيانات تدريبه، وفي مجموعات بيانات جديدة كان له أداء zero-shot مماثل وأحياناً أفضل مقارنةً بطرق دُرِّبت خصيصاً على تلك المجموعات [8] [8]. تصف هذه الأرقام معيار Chronos القياسي الخاص بـ 42 مجموعة بيانات، وليس أشرطة OHLCV داخل اليوم، ولا مقارنة وصفات الضبط الدقيق.

لا يُبلغ أي ادعاء عن دقة اتجاهية خارج العينة أو قياسات معايرة أو متطلبات ساعات GPU لتدريب نموذج بـ 25M إلى 200M معامل على أصل واحد يضم من 500K إلى 2M شريط [1]. لا يُبلغ أي ادعاء عن مقارنة بين full fine-tuning وLoRA واستبدال رأس الكميات ضمن تقسيمات purged walk-forward لأشرطة OHLCV بفاصل دقيقة واحدة أو خمس دقائق، لـ TimesFM أو Chronos أو Lag-Llama أو Moirai [1] [8]. هذا يعني أن باني الحل لا يمكنه الاستشهاد برقم منشور للساعات المتوقعة من GPU أو التحسن المتوقع في دقة الاتجاه من أي وصفة معينة على هذه المهمة الدقيقة؛ يجب إنتاج تلك الأرقام من خلال تجربة باني الحل نفسه.

لأن المصادر تختلف حول المعايير القياسية وخطوط الأساس التي تستخدمها، لا تُقدَّم أي مقارنة عبر المصادر هنا سوى الإشارة إلى الاختلاف. مكاسب Lag-Llama المُبلَّغ عنها ذاتياً هي مقابل مجموعة معاييره القياسية الخاصة وضد

الحدود والأسئلة المفتوحة

يُذكر القيد المركزي بوضوح: لا تحتوي الادعاءات الموثقة على دليل مباشر على سؤال البحث. لا توجد مقارنة بين full fine-tuning وLoRA واستبدال رأس الكميات لـ TimesFM أو Chronos أو Lag-Llama أو Moirai على أشرطة OHLCV بفاصل دقيقة واحدة أو خمس دقائق ضمن تقسيمات purged walk-forward [1] [8]. لا يوجد قياس لساعات GPU لتدريب نموذج بـ 25M إلى 200M معامل على أصل واحد يضم من 500K إلى 2M شريط [1]. أي شيء يبدو كإجابة على السؤال الدقيق المطروح يجب أن يأتي من تجربة جديدة، وليس من الأدبيات الملخصة هنا.

ما تدعمه الأدبيات، بحذر، هو مجموعة من التوقعات التي يجب أخذها إلى تلك التجربة. المكاسب المُبلَّغ عنها من الضبط الدقيق لـ Lag-Llama خاصة بالمجال وبالمعيار القياسي، ونتائج zero-shot الخاصة بالورقة نفسها تؤدي بالفعل أداءً مماثلاً للنماذج المتخصصة على معاييرها القياسية [3] [3]. تُبلغ ورقة منفصلة أن الضبط الدقيق الممتد يمكن أن يُدهور الأداء، وأن نماذج الأساس المضبوطة لا تتفوق بالضرورة على نماذج أصغر مخصصة بهامش يتناسب مع معاملاتها الإضافية [5] [5]. يشير هذا، دون إثباته لأشرطة OHLCV تحديداً، إلى أن باني الحل ينبغي ألا يفترض أن مزيداً من الضبط الدقيق أو نموذجاً أكبر يُنتج نتيجة أفضل، وينبغي أن يقيس المعايرة ودقة الاتجاه بعد كل زيادة في التدريب، مراقباً نمط التدهور الموصوف.

هناك قيد ثانٍ يتعلق بحجم البيانات. الدراسة الوحيدة داخل اليوم في الادعاءات التي تقيس فعلاً دقة الاتجاه خارج العينة على أداة واحدة، باستخدام أربع سنوات من أشرطة خمس دقائق، لم تجد ميزة ذات دلالة إحصائية ونسبت ذلك إلى مطابقة الضوضاء وليس نقص سعة النموذج [1] [1]. ما إذا كان نموذج أساس مُدرَّب مسبقاً على مجالات أخرى سيؤدي أداءً أفضل على حجم البيانات نفسه سؤال مفتوح لا تجيب عليه الادعاءات؛ نتيجة LSTM وgradient boosting تحذير بشأن كفاية البيانات، وليست بياناً عن أي نموذج أساس.

هناك قيد ثالث يتعلق بقابلية المقارنة المعمارية. تختلف Moirai وMoirai-MoE وTimesFM في كيفية معالجتها للتردد (طبقات الإسقاط، مزيج الخبراء، قاموس تضمين التردد)، ويمكن لهذه الخيارات التصميمية أن تتفاعل بشكل معقول مع اختيار وصفة الضبط الدقيق، لكن لا يختبر أي ادعاء هذا التفاعل [4] [4]. نهج Chronos القائم على التقطيع الرمزي (tokenization) متميز معمارياً عن transformer الخاص بـ Lag-Llama القائم على الفوارق الزمنية المساعدة (lag-covariate)، ولا يقارن أي ادعاء سلوك ضبطهما الدقيق مباشرة [8] [3]. أي استنتاجات يستخلصها باني الحل من تشغيل الإجراء أدناه تنطبق على النماذج والبيانات والتقسيمات المحددة المستخدَمة، ولا ينبغي تعميمها إلى ما هو أبعد من ذلك دون مزيد من الاختبار.

كيف تبنيه، أو كيف تستخدمه

  1. حدّد المهمة بدقة. ثبّت الأصل المستهدف، وتردد الشريط (دقيقة واحدة أو خمس دقائق)، وأفق التنبؤ، والهدف الاتجاهي (على سبيل المثال إشارة العائد على مدى k شريط تالٍ). سجّل معدل الأساس للفئة الغالبة، بنفس الطريقة التي تُبلّغ بها دراسة MNQ عن معدل أساس 51.8% لهدفها الاتجاهي، لأن هذا هو الرقم الذي يجب أن تتفوق عليه أي وصفة بدلالة إحصائية [1].
  2. اجمع تقسيمات purged walk-forward. استخدم مخططاً من نوع walk-forward بنافذة متوسّعة، مقسّماً 500K إلى 2M شريط إلى فترات متعددة خارج العينة، مع فجوة تنقية (purge gap) بين نوافذ التدريب والاختبار لمنع النظر إلى الأمام (lookahead) الناتج عن تراكب التسميات. هذا يحاكي تصميم النافذة المتوسّعة المستخدَم في دراسة MNQ، التي قيّمت ثلاث فترات خارج العينة [1].
  3. اختر نموذج الأساس وسطح تكييفه الأصلي. بالنسبة لـ Lag-Llama، الوصفة الطبيعية هي الضبط الدقيق على جزء صغير من مجموعة البيانات المستهدفة، متبعاً تصميمه المُبلَّغ عنه ذاتياً [3]. بالنسبة لـ Chronos، يعني التكييف مواصلة تدريب هدف cross-entropy المُرمَّز على الأشرطة المستهدفة، مع احترام آلية التقطيع الرمزي (tokenizer) القائمة على التحجيم والتكميم [8] [8]. بالنسبة لـ Moirai أو Moirai-MoE، احترم الطبقات الخاصة بالتردد أو طبقات مزيج الخبراء للإدخال/الإخراج عند التكييف [4] [4].
  4. نفّذ ثلاث وصفات لكل نموذج. (أ) الضبط الدقيق الكامل (full fine-tuning): تحديث جميع الأوزان على نافذة التدريب الخاصة بالأصل المستهدف. (ب) LoRA: تجميد الأوزان الأساسية وتدريب مصفوفات منخفضة الرتبة A وB فقط مُدرَجة في طبقات الانتباه (attention) أو الإسقاط، باستخدام صيغة عد معاملات LoRA r×(d+l) بدلاً من d×l لتقدير التخفيض في المعاملات القابلة للتدريب [6] [6]. (ج) استبدال رأس الكميات: تجميد العمود الفقري (backbone) وإعادة تدريب رأس الإخراج الذي يُنتج تنبؤات الكميات فقط (q10 وq50 وq90 في مخطط هذه المذكرة).
  5. ثبّت تهيئة LoRA. هيّئ مصفوفة LoRA A بقيم غاوسية عشوائية والمصفوفة B بأصفار، بحيث يساوي الإخراج المُكيَّف الأولي إخراج النموذج الأساسي المجمَّد، ما يعطي نقطة بداية مستقرة [6].
  6. درِّب كل وصفة على كل طية walk-forward. سجّل وقت GPU الفعلي لكل طية ولكل وصفة؛ هذا يُنتج أرقام ساعات GPU التي لا تُبلغ عنها الأدبيات حالياً [1] [1]. أوقف أو أنشئ نقطة تفتيش (checkpoint) مبكراً إذا بدأت خسارة التحقق (validation loss) على شريحة محتجزة من نافذة التدريب في الارتفاع، لأن الضبط الدقيق الممتد لوحظ في مكان آخر أن يُدهور الأداء [5].
  7. قيّم دقة الاتجاه خارج العينة. لكل طية ووصفة، احسب نسبة تنبؤات الإشارة الصحيحة على نافذة الاختبار المُنقّاة. قارن مع معدل الأساس من الخطوة 1 وأجرِ اختبار تبديل (permutation test)، متبعاً نفس أسلوب اختبار الدلالة المستخدَم في دراسة MNQ، التي أبلغت عن قيم p بلغت 0.135 و0.515 لأفضل نموذجين [1].
  8. قيّم المعايرة. باستخدام مخرجات الكميات (q10 وq50 وq90)، احسب التغطية التجريبية: ما نسبة النتائج المتحققة التي تقع تحت q10، وبين q10 وq90، وفوق q90. قارن التغطية الاسمية (10%/80%/10%) بالتغطية المتحققة لكل وصفة.
  9. تحقّق من استقرار الميزات أو الانتباه عبر الطيات. شخّصت دراسة MNQ مطابقة الضوضاء من خلال عدم استقرار أهمية الميزات عبر طيات walk-forward؛ يمكن لتشخيص مماثل لنموذج أساس أن يتتبع مقدار تحوّل الأوزان المضبوطة دقيقاً أو أنماط الانتباه من طية إلى أخرى [1].
  10. قارن الوصفات والنماذج على الدقة والمعايرة وساعات GPU معاً. نظراً لأن أي ادعاء موجود لا يُرتّب هذه الوصفات، يجب أن يأتي الترتيب من هذه التجربة؛ أبلغ عن جميع المقاييس الثلاثة لكل نموذج ولكل وصفة، وليس الدقة فقط، لأن وصفة بدقة أسوأ قليلاً لكن بمعايرة أفضل بكثير أو ساعات GPU أقل بكثير قد تكون مفضّلة.
  11. كرّر على أصل واحد آخر على الأقل وتردد شريط آخر. نتيجة أصل واحد وتردد واحد تخاطر بنفس عدم الكفاية التي تُبلغ عنها دراسة MNQ بشأن أربع سنوات من بيانات أداة واحدة بفاصل خمس دقائق؛ اختبر التعميم قبل الوثوق بترتيب أي وصفة [1].
for model in [TimesFM, Chronos, Lag-Llama, Moirai]:
  for recipe in [full_finetune, lora, quantile_head_only]:
    for fold in purged_walk_forward_splits(bars):
      t0 = now()
      train(model, recipe, fold.train)
      gpu_hours = now() - t0
      preds = model.predict(fold.test)
      acc = direction_accuracy(preds, fold.test.actual)
      calib = quantile_coverage(preds.q10, preds.q50, preds.q90, fold.test.actual)
      pval = permutation_test(preds, fold.test.actual, base_rate)
      record(model, recipe, fold, acc, calib, pval, gpu_hours)

الكود: تطبيق عامل

ينفّذ البرنامج النصي أدناه نسخة قابلة للتشغيل تعمل على CPU فقط من الإجراء أعلاه، باستخدام مخطط SQLite الخاص بنا. نظراً لعدم توفر نقطة تفتيش (checkpoint) لنموذج أساس أو GPU في هذه البيئة، تُنفَّذ الوصفات الثلاث (الضبط الدقيق الكامل، والتكييف منخفض الرتبة على غرار LoRA، واستبدال رأس الكميات) كثلاثة نماذج خطية/منخفضة الرتبة مُدرَّبة مباشرة على ميزات OHLCV المتأخرة (lagged)، لتحل محل استراتيجيات التكييف الثلاث نفسها الموصوفة لنماذج الأساس: نموذج بأوزان كاملة، وتحديث منخفض الرتبة يتبع تخفيض معاملات LoRA r×(d+l) [6]، ونموذج رأس فقط يعيد ضبط طبقة إخراج فقط على ميزات عشوائية مجمَّدة. هذا الاستبدال ضروري لأنه لا توجد حزمة نموذج أساس أو GPU متاحة هنا، لكن منطق walk-forward، والتنقية (purge)، ودقة الاتجاه، والمعايرة، واختبار التبديل، وتوقيت ساعات GPU يتّبع الطرق المُبلَّغ عنها بدقة، مع تعليقات تحدد أي ادعاء تنفذه كل دالة. المعيار المطلوب التفوق عليه هو معدل الأساس للفئة الغالبة المحسوب من البيانات نفسها، متبعاً نفس منطق مقارنة معدل الأساس في MNQ [1]، ويطبع البرنامج النصي قيم p لاختبار التبديل بنفس روح الادعاء رقم 2.

import sqlite3, os, time, sys
import numpy as np
import pandas as pd

# ---------------------------------------------------------------------
# This script implements a purged walk-forward comparison of three
# fine-tuning-style recipes on our own OHLCV bars, standing in for the
# recipe comparison described (but not measured) in claims U and AK.
# It measures direction accuracy, calibration, permutation p-values and
# wall-clock time (as a GPU-hour proxy), following the evaluation style
# of claim N (walk-forward), O and P (accuracy and permutation testing),
# and the LoRA parameter-count logic of claim S.
# ---------------------------------------------------------------------

DB_PATH = os.environ.get("QOURAT_DB", "data.sqlite")


def load_bars(symbol, tf, db_path=DB_PATH):
    # Reads one symbol/timeframe of OHLCV bars from the bars table.
    con = sqlite3.connect(db_path)
    df = pd.read_sql_query(
        "select ts, open, high, low, close, volume from bars "
        "where symbol=? and tf=? order by ts asc",
        con, params=(symbol, tf))
    con.close()
    df["ts"] = pd.to_datetime(df["ts"])
    return df


def make_features(df, n_lags=10):
    # Builds lagged return features and a next-bar direction label.
    # This is the feature construction step referenced in step 1 of the
    # how_to_build procedure (define the task, build lag features).
    close = df["close"].values.astype(float)
    ret = np.zeros_like(close)
    ret[1:] = np.diff(close) / close[:-1]
    X = []
    y = []
    for i in range(n_lags, len(ret) - 1):
        X.append(ret[i - n_lags:i])
        y.append(1.0 if ret[i + 1] > 0 else 0.0)
    X = np.array(X)
    y = np.array(y)
    return X, y


def purged_walk_forward_splits(n, n_folds=3, purge=5):
    # Expanding-window walk-forward split with a purge gap, following
    # the expanding-window design of claim N (three out-of-sample periods).
    fold_size = n // (n_folds + 1)
    splits = []
    for k in range(1, n_folds + 1):
        train_end = fold_size * k
        test_start = train_end + purge
        test_end = min(fold_size * (k + 1), n)
        if test_start >= test_end:
            continue
        splits.append((0, train_end, test_start, test_end))
    return splits


class FullModel:
    # Stand-in for full fine-tuning: a full linear weight vector trained
    # with gradient descent on all input dimensions (claim describes full
    # fine-tuning as updating all weights; here d x l is the full weight).
    def __init__(self, d):
        self.w = np.zeros(d)
        self.b = 0.0

    def train(self, X, y, epochs=200, lr=0.1):
        n, d = X.shape
        for _ in range(epochs):
            z = X @ self.w + self.b
            p = 1.0 / (1.0 + np.exp(-z))
            grad_w = X.T @ (p - y) / n
            grad_b = np.mean(p - y)
            self.w -= lr * grad_w
            self.b -= lr * grad_b

    def predict_proba(self, X):
        z = X @ self.w + self.b
        return 1.0 / (1.0 + np.exp(-z))


class LoRAModel:
    # Implements the LoRA parameter reduction of claim S: instead of a
    # full d x l update, trains r x (d + l) parameters via low-rank
    # matrices A and B. Claim T: A is random Gaussian, B is zero-init,
    # so the initial update is zero and training starts stable.
    def __init__(self, d, r=2):
        rng = np.random.default_rng(0)
        self.A = rng.normal(scale=0.01, size=(d, r))  # claim T: Gaussian init
        self.B = np.zeros((r, 1))                      # claim T: zero init
        self.b = 0.0

    def train(self, X, y, epochs=200, lr=0.1):
        n, d = X.shape
        for _ in range(epochs):
            w_eff = (self.A @ self.B).flatten()
            z = X @ w_eff + self.b
            p = 1.0 / (1.0 + np.exp(-z))
            err = (p - y) / n
            grad_w = X.T @ err
            grad_B = self.A.T @ grad_w.reshape(-1, 1)
            grad_A = np.outer(grad_w, self.B.flatten())
            self.A -= lr * grad_A
            self.B -= lr * grad_B
            self.b -= lr * np.mean(p - y)

    def predict_proba(self, X):
        w_eff = (self.A @ self.B).flatten()
        z = X @ w_eff + self.b
        return 1.0 / (1.0 + np.exp(-z))


class HeadOnlyModel:
    # Stand-in for quantile head replacement: the backbone (here, a fixed
    # random projection of the input) is frozen, only the output head is
    # trained. Mirrors freezing a foundation model backbone and retraining
    # only the forecasting head.
    def __init__(self, d, hidden=4):
        rng = np.random.default_rng(1)
        self.proj = rng.normal(scale=1.0, size=(d, hidden))  # frozen backbone
        self.w = np.zeros(hidden)
        self.b = 0.0

    def _features(self, X):
        return np.tanh(X @ self.proj)

    def train(self, X, y, epochs=200, lr=0.1):
        H = self._features(X)
        n, h = H.shape
        for _ in range(epochs):
            z = H @ self.w + self.b
            p = 1.0 / (1.0 + np.exp(-z))
            grad_w = H.T @ (p - y) / n
            grad_b = np.mean(p - y)
            self.w -= lr * grad_w
            self.b -= lr * grad_b

    def predict_proba(self, X):
        H = self._features(X)
        z = H @ self.w + self.b
        return 1.0 / (1.0 + np.exp(-z))


def direction_accuracy(p, y, thresh=0.5):
    pred = (p >= thresh).astype(float)
    return float(np.mean(pred == y))


def quantile_coverage(p50, y):
    # Simple calibration proxy: how often the predicted probability
    # agrees with the realized direction, split around the median.
    pred_up = (p50 >= 0.5).astype(float)
    return float(np.mean(pred_up == y))


def permutation_test(p, y, base_rate, n_perm=200, seed=0):
    # Permutation test in the spirit of claim P: shuffles labels and
    # compares observed accuracy against the null distribution.
    rng = np.random.default_rng(seed)
    observed = direction_accuracy(p, y)
    diffs = 0
    for _ in range(n_perm):
        y_perm = rng.permutation(y)
        acc_perm = direction_accuracy(p, y_perm)
        if acc_perm >= observed:
            diffs += 1
    pval = diffs / n_perm
    return observed, pval


def run_all(symbol="AAPL", tf="1m"):
    df = load_bars(symbol, tf)
    if len(df) 9s} {'calib':>7s} {'pvalue':>7s} {'train_s':>8s}")
                for r in results:
                    print(f"{r['recipe']:15s} {r['accuracy']:9.4f} {r['calibration']:7.4f} "
                          f"{r['pvalue']:7.3f} {r['train_seconds']:8.3f}")
                all_results.extend(results)
    total = time.time() - t_start
    print(f"\nTotal wall-clock seconds: {total:.2f}")

ما الذي سنبنيه

سنبني إطار عمل قياسي صغيراً وقابلاً لإعادة الإنتاج، يضبط بدقة Lag-Llama وChronos، وهما نموذجا الأساس ذوا المعماريات الموثقة علانية في هذه الادعاءات، على أشرطة بفاصل دقيقة واحدة لأصلين سائلين، باستخدام ثلاث وصفات: الضبط الدقيق الكامل، وLoRA، واستبدال رأس الكميات. سنستخدم تقسيمات walk-forward مُنقّاة بنافذة متوسّعة مع ثلاث فترات خارج العينة على الأقل، متبعين أسلوب التحقق نفسه المستخدَم في دراسة MNQ، وسنسجّل وقت GPU الفعلي لكل طية ولكل وصفة على GPU واحد لإنتاج أول أرقام ساعات GPU لهذا الإعداد الدقيق.

سنحكم على المشروع من خلال ثلاثة أرقام لكل نموذج ووصفة: دقة الاتجاه خارج العينة مقابل معدل الأساس للتسميات المستهدفة، والمعايرة المقاسة بالتغطية التجريبية لتنبؤات q10/q50/q90، وقيمة p لاختبار التبديل، مُبلَّغ عنها بنفس الطريقة التي تُبلغ بها دراسة MNQ عن قيمها p. سيعني النجاح أن وصفة واحدة على الأقل تتفوق على معدل الأساس بقيمة p أقل من عتبة مُسجَّلة مسبقاً في طيتين على الأقل من أصل ثلاث طيات خارج العينة، على كلا الأصلين؛ نتيجة عدمية، مطابقة لنتيجة دراسة MNQ، سيتم الإبلاغ عنها بصدق، وليس إخفاؤها.

يمكن لمهندسَين إنهاء هذا في غضون بضعة أسابيع: أسبوع واحد لإعداد خطوط أنابيب البيانات والتقسيمات المُنقّاة، وأسبوع واحد لتنفيذ وتصحيح الوصفات الثلاث لكل نموذج، وأسبوع واحد لتشغيل الطيات وحساب الإحصاءات، وأسبوع أخير لتحليل المعايرة وكتابة التقرير. ستكون تكلفة الحوسبة GPU متوسط المدى لعدد يصل إلى عشرات ساعات GPU إجمالاً عبر النماذج والوصفات والطيات، وهو أمر متواضع وميسور التكلفة لفريق من شخصين.

الادعاءات والمراجعة

  1. factمدعوم

    Lag-Llama is a general-purpose foundation model for univariate probabilistic time series forecasting based on a decoder-only transformer architecture that uses lags as covariates.

    [3] Lag-Llama: Towards Foundation Models for Probabilistic Time Series Forecasting, abstract arXiv:2310.08278v3
    “Over the past years, foundation models have caused a paradigm shift in machine learning due to their unprecedented capabilities for zero-shot and few-shot generalization. However, despite the success of foundation models in modalities such as natural language processing and compu…”
  2. methodمدعوم

    Lag-Llama is pretrained on a large corpus of diverse time series data from several domains and can be fine-tuned on relatively small fractions of previously unseen datasets.

    [3] Lag-Llama: Towards Foundation Models for Probabilistic Time Series Forecasting, abstract arXiv:2310.08278v3
    “Over the past years, foundation models have caused a paradigm shift in machine learning due to their unprecedented capabilities for zero-shot and few-shot generalization. However, despite the success of foundation models in modalities such as natural language processing and compu…”
  3. resultمدعوم

    When fine-tuned on relatively small fractions of previously unseen datasets, Lag-Llama achieves state-of-the-art performance and outperforms prior deep learning approaches on average.

    [3] Lag-Llama: Towards Foundation Models for Probabilistic Time Series Forecasting, abstract arXiv:2310.08278v3
    “Over the past years, foundation models have caused a paradigm shift in machine learning due to their unprecedented capabilities for zero-shot and few-shot generalization. However, despite the success of foundation models in modalities such as natural language processing and compu…”
  4. methodمدعوم

    Lag-Llama is pretrained from scratch on a broad, diverse corpus of datasets and is evaluated for zero-shot performance on unseen datasets.

    [3] Lag-Llama: Towards Foundation Models for Probabilistic Time Series Forecasting, section 1 Introduction
    “We present Lag-Llama, a foundation model for univariate probabilistic time series forecasting based on a simple decoder-only transformer architecture that uses lags as covariates. • We show that Lag-Llama, when pretrained from scratch on a broad, diverse corpus of datasets, has s…”
  5. resultمدعوم

    Lag-Llama performs comparably to models trained on specific datasets in zero-shot settings.

    [3] Lag-Llama: Towards Foundation Models for Probabilistic Time Series Forecasting, section 1 Introduction
    “We present Lag-Llama, a foundation model for univariate probabilistic time series forecasting based on a simple decoder-only transformer architecture that uses lags as covariates. • We show that Lag-Llama, when pretrained from scratch on a broad, diverse corpus of datasets, has s…”
  6. resultمدعوم

    After fine-tuning across diverse datasets, Lag-Llama demonstrates state-of-the-art performance and emerges as the best general-purpose model without knowledge of downstream datasets.

    [3] Lag-Llama: Towards Foundation Models for Probabilistic Time Series Forecasting, section 1 Introduction
    “We present Lag-Llama, a foundation model for univariate probabilistic time series forecasting based on a simple decoder-only transformer architecture that uses lags as covariates. • We show that Lag-Llama, when pretrained from scratch on a broad, diverse corpus of datasets, has s…”
  7. factمدعوم

    Moirai uses multiple input/output projection layers tailored to time series at specific frequencies, while TimesFM maintains a frequency embedding dictionary.

    [4] Moirai-MoE: Empowering Time Series Foundation Models with Sparse Mixture of Experts, abstract DOI 10.48550/arxiv.2410.10469
    “Time series foundation models have demonstrated impressive performance as zero-shot forecasters. However, achieving effectively unified training on time series remains an open challenge. Existing approaches introduce some level of model specialization to account for the highly he…”
  8. limitationمدعوم

    Frequency-level specialization is limited because time series with different frequencies can have similar patterns, time series with the same frequency can have different patterns, and non-stationarity can produce varied distributions within a short context window.

    [4] Moirai-MoE: Empowering Time Series Foundation Models with Sparse Mixture of Experts, abstract DOI 10.48550/arxiv.2410.10469
    “Time series foundation models have demonstrated impressive performance as zero-shot forecasters. However, achieving effectively unified training on time series remains an open challenge. Existing approaches introduce some level of model specialization to account for the highly he…”
  9. methodمدعوم

    Moirai-MoE addresses the limitations of frequency-level specialization with a single input/output projection layer and a sparse mixture of experts within Transformers.

    [4] Moirai-MoE: Empowering Time Series Foundation Models with Sparse Mixture of Experts, abstract DOI 10.48550/arxiv.2410.10469
    “Time series foundation models have demonstrated impressive performance as zero-shot forecasters. However, achieving effectively unified training on time series remains an open challenge. Existing approaches introduce some level of model specialization to account for the highly he…”
  10. limitationمدعوم

    Time-series foundation models face distribution shifts caused by domain-specific structures such as seasonality, trends, irregular sampling, and high variability across applications.

    [5] How Foundational are Foundation Models for Time Series Forecasting?, section 1 Introduction
    “However, the time series domain poses unique challenges that set it apart from NLP and CV. Time series data often exhibits domain-specific structures such as seasonality, trends, irregular sampling, and high variability across applications, even within the same broad category [6]…”
  11. resultمدعوم

    Zero-shot performance of time-series foundation models is highly sensitive to alignment between the statistical properties of their pretraining domains and the target domains.

    [5] How Foundational are Foundation Models for Time Series Forecasting?, section 1 Introduction
    “However, the time series domain poses unique challenges that set it apart from NLP and CV. Time series data often exhibits domain-specific structures such as seasonality, trends, irregular sampling, and high variability across applications, even within the same broad category [6]…”
  12. limitationمدعوم

    Extended fine-tuning of time-series foundation models can lead to performance degradation, whereas task-specific models trained from scratch typically gain accuracy with longer training under limited-data conditions.

    [5] How Foundational are Foundation Models for Time Series Forecasting?, section 1 Introduction
    “However, the time series domain poses unique challenges that set it apart from NLP and CV. Time series data often exhibits domain-specific structures such as seasonality, trends, irregular sampling, and high variability across applications, even within the same broad category [6]…”
  13. limitationمدعوم مع تحفظات

    On unseen real-world time series, fine-tuned foundation models do not consistently produce substantially better results than smaller dedicated models relative to their larger parameter counts and memory footprints.

    [5] How Foundational are Foundation Models for Time Series Forecasting?, abstract arXiv:2510.00742v3Passage supports the claim but adds 'consistently' and specifies 'relative to increased parameter count and memory footprint' and 'tailored to specific forecasting task'—claim omits 'consistently' and 'increased'.
    “Foundation Models are designed to serve as versatile embedding machines, with strong zero shot capabilities and superior generalization performance when fine-tuned on diverse downstream tasks. While this is largely true for language and vision foundation models, we argue that the…”
  14. resultمدعوم

    Across three out-of-sample periods under strict expanding-window walk-forward validation, no evaluated configuration achieved statistically significant accuracy above the 51.8% base rate for the MNQ directional target.

    [1] Sequential Structure in Intraday Futures Data: LSTM vs Gradient Boosting on MNQ, abstract https://openalex.org/W7161915968
    “This paper compares gradient boosting and long short-term memory (LSTM) architectures for intraday directional prediction in Micro E-Mini Nasdaq 100 futures (MNQ). Motivated by recent foundation-model research on financial candlestick data, including the Kronos architecture, we t…”
  15. resultمدعوم

    Combined out-of-sample accuracies ranged from 50.00% to 50.89% for gradient boosting variants, while the LSTM achieved 50.59%.

    [1] Sequential Structure in Intraday Futures Data: LSTM vs Gradient Boosting on MNQ, abstract https://openalex.org/W7161915968
    “This paper compares gradient boosting and long short-term memory (LSTM) architectures for intraday directional prediction in Micro E-Mini Nasdaq 100 futures (MNQ). Motivated by recent foundation-model research on financial candlestick data, including the Kronos architecture, we t…”
  16. uncertaintyمدعوم

    Permutation tests produced p-values of 0.135 for the best gradient boosting model and 0.515 for the LSTM, indicating no statistically significant predictive edge.

    [1] Sequential Structure in Intraday Futures Data: LSTM vs Gradient Boosting on MNQ, abstract https://openalex.org/W7161915968
    “This paper compares gradient boosting and long short-term memory (LSTM) architectures for intraday directional prediction in Micro E-Mini Nasdaq 100 futures (MNQ). Motivated by recent foundation-model research on financial candlestick data, including the Kronos architecture, we t…”
  17. limitationمدعوم

    Feature-importance instability across walk-forward folds suggested noise fitting rather than stable structural signal capture.

    [1] Sequential Structure in Intraday Futures Data: LSTM vs Gradient Boosting on MNQ, abstract https://openalex.org/W7161915968
    “This paper compares gradient boosting and long short-term memory (LSTM) architectures for intraday directional prediction in Micro E-Mini Nasdaq 100 futures (MNQ). Motivated by recent foundation-model research on financial candlestick data, including the Kronos architecture, we t…”
  18. limitationمدعوم

    Four years of single-instrument five-minute OHLCV data were insufficient for reliable sequential machine-learning-based intraday forecasting.

    [1] Sequential Structure in Intraday Futures Data: LSTM vs Gradient Boosting on MNQ, abstract https://openalex.org/W7161915968
    “This paper compares gradient boosting and long short-term memory (LSTM) architectures for intraday directional prediction in Micro E-Mini Nasdaq 100 futures (MNQ). Motivated by recent foundation-model research on financial candlestick data, including the Kronos architecture, we t…”
  19. methodمرفوض

    LoRA freezes the pretrained parameter matrix W0 and represents the trainable update as ΔW=BA using low-rank matrices A and B, where r is much smaller than min(d,l).

    [6] LoRA-FAIR: Federated LoRA Fine-Tuning with Aggregation and Initialization Refinement, section 2.1 PEFT with LoRA
    “LoRA (Low-Rank Adaptation) is a PEFT (parameter-efficient fine-tuning) approach that significantly reduces the number of trainable parameters in large-scale models by introducing low-rank matrices into the model. Consider a pre-trained model with parameters 𝐖0∈ℝd×l\mathbf{W}_{0}\…”
  20. factمدعوم

    LoRA reduces the number of trained parameters for a d×l update from d×l to r×(d+l).

    [6] LoRA-FAIR: Federated LoRA Fine-Tuning with Aggregation and Initialization Refinement, section 2.1 PEFT with LoRA
    “LoRA (Low-Rank Adaptation) is a PEFT (parameter-efficient fine-tuning) approach that significantly reduces the number of trainable parameters in large-scale models by introducing low-rank matrices into the model. Consider a pre-trained model with parameters 𝐖0∈ℝd×l\mathbf{W}_{0}\…”
  21. methodمدعوم

    In practice, LoRA typically initializes A with random Gaussian values and B with zeros to provide a stable start to fine-tuning.

    [6] LoRA-FAIR: Federated LoRA Fine-Tuning with Aggregation and Initialization Refinement, section 2.1 PEFT with LoRA
    “In practice, 𝐀\mathbf{A} is typically initialized with random Gaussian values, while 𝐁\mathbf{B} is initialized to zero to ensure a stable start to the fine-tuning process. This low-rank adaptation enables LoRA to achieve performance comparable to full fine-tuning while significa…”
  22. uncertaintyمدعوم

    The passages provide no comparison of full fine-tuning, LoRA, and quantile head replacement for TimesFM, Chronos, Lag-Llama, or Moirai on one-minute or five-minute OHLCV bars under purged walk-forward splits.

    [1] Sequential Structure in Intraday Futures Data: LSTM vs Gradient Boosting on MNQ, abstract https://openalex.org/W7161915968
    “This paper compares gradient boosting and long short-term memory (LSTM) architectures for intraday directional prediction in Micro E-Mini Nasdaq 100 futures (MNQ). Motivated by recent foundation-model research on financial candlestick data, including the Kronos architecture, we t…”
  23. uncertaintyمدعوم

    The passages provide no GPU-hour measurements for training 25M–200M-parameter models on a single asset with 500K–2M bars.

    [1] Sequential Structure in Intraday Futures Data: LSTM vs Gradient Boosting on MNQ, abstract https://openalex.org/W7161915968
    “This paper compares gradient boosting and long short-term memory (LSTM) architectures for intraday directional prediction in Micro E-Mini Nasdaq 100 futures (MNQ). Motivated by recent foundation-model research on financial candlestick data, including the Kronos architecture, we t…”
  24. factمدعوم

    Chronos is a pretrained probabilistic time series forecasting framework based on transformer language-model architectures.

    [8] Chronos: Learning the Language of Time Series, abstract arXiv:2403.07815v3
    “We introduce Chronos, a simple yet effective framework for pretrained probabilistic time series models. Chronos tokenizes time series values using scaling and quantization into a fixed vocabulary and trains existing transformer-based language model architectures on these tokenize…”
  25. methodمدعوم

    Chronos tokenizes time series values by scaling and quantizing them into a fixed vocabulary.

    [8] Chronos: Learning the Language of Time Series, abstract arXiv:2403.07815v3
    “We introduce Chronos, a simple yet effective framework for pretrained probabilistic time series models. Chronos tokenizes time series values using scaling and quantization into a fixed vocabulary and trains existing transformer-based language model architectures on these tokenize…”
  26. methodمدعوم

    Chronos trains existing transformer-based language-model architectures on tokenized time series using cross-entropy loss.

    [8] Chronos: Learning the Language of Time Series, section Chronos: Learning the Language of Time Series
    “We introduce Chronos, a simple yet effective framework for pretrained probabilistic time series models. Chronos tokenizes time series values using scaling and quantization into a fixed vocabulary and trains existing transformer-based language model architectures on these tokenize…”
  27. factمدعوم

    Chronos models are based on the T5 family and range from 20M to 710M parameters.

    [8] Chronos: Learning the Language of Time Series, abstract arXiv:2403.07815v3
    “We introduce Chronos, a simple yet effective framework for pretrained probabilistic time series models. Chronos tokenizes time series values using scaling and quantization into a fixed vocabulary and trains existing transformer-based language model architectures on these tokenize…”
  28. methodمدعوم

    Chronos uses simple scaling and quantization to convert real-valued time series into discrete bins without changing the language-model architecture.

    [8] Chronos: Learning the Language of Time Series, section 1 Introduction
    “Shouldn’t good language models “just work” on time series? This naive question prompts us to challenge the necessity of time-series-specific modifications, and answering it led us to develop Chronos, a language modeling framework minimally adapted for time series forecasting. Chr…”
  29. methodمدعوم

    Chronos can use either encoder-decoder or decoder-only language-model architectures.

    [8] Chronos: Learning the Language of Time Series, section 1 Introduction
    “Shouldn’t good language models “just work” on time series? This naive question prompts us to challenge the necessity of time-series-specific modifications, and answering it led us to develop Chronos, a language modeling framework minimally adapted for time series forecasting. Chr…”
  30. methodمدعوم

    During inference, Chronos autoregressively samples tokens from the model and maps them back to numerical values.

    [8] Chronos: Learning the Language of Time Series, section 1 Introduction
    “Shouldn’t good language models “just work” on time series? This naive question prompts us to challenge the necessity of time-series-specific modifications, and answering it led us to develop Chronos, a language modeling framework minimally adapted for time series forecasting. Chr…”
  31. methodمدعوم

    Chronos obtains a predictive distribution by sampling multiple forecast trajectories.

    [8] Chronos: Learning the Language of Time Series, section 1 Introduction
    “Shouldn’t good language models “just work” on time series? This naive question prompts us to challenge the necessity of time-series-specific modifications, and answering it led us to develop Chronos, a language modeling framework minimally adapted for time series forecasting. Chr…”
  32. factمدعوم

    Chronos was pretrained on a large collection of publicly available datasets supplemented by a synthetic dataset generated with Gaussian processes.

    [8] Chronos: Learning the Language of Time Series, abstract arXiv:2403.07815v3
    “We introduce Chronos, a simple yet effective framework for pretrained probabilistic time series models. Chronos tokenizes time series values using scaling and quantization into a fixed vocabulary and trains existing transformer-based language model architectures on these tokenize…”
  33. resultمدعوم

    In a benchmark of 42 datasets, Chronos significantly outperformed other methods on datasets that were included in its training corpus.

    [8] Chronos: Learning the Language of Time Series, abstract arXiv:2403.07815v3
    “We introduce Chronos, a simple yet effective framework for pretrained probabilistic time series models. Chronos tokenizes time series values using scaling and quantization into a fixed vocabulary and trains existing transformer-based language model architectures on these tokenize…”
  34. resultمدعوم

    On new datasets, Chronos had comparable and occasionally superior zero-shot performance relative to methods trained specifically on those datasets.

    [8] Chronos: Learning the Language of Time Series, abstract arXiv:2403.07815v3
    “We introduce Chronos, a simple yet effective framework for pretrained probabilistic time series models. Chronos tokenizes time series values using scaling and quantization into a fixed vocabulary and trains existing transformer-based language model architectures on these tokenize…”
  35. methodمدعوم

    The Chronos work focuses on univariate forecasting, where each observation is a scalar.

    [8] Chronos: Learning the Language of Time Series, section 2 Background and Related Work
    “Time series forecasting concerns using historical data from a quantity of interest (typically real-valued) to predict their future values. Formally, given a uniformly-spaced time series 𝒙1:C=[x1,…,xC]{\bm{x}}_{1:C}=[x_{1},\dots,x_{C}], we are interested in predicting the joint di…”
  36. factمدعوم

    The forecasting objective is the joint distribution of the next H steps conditioned on the preceding C observations, p(x_{C+1:C+H}|x_{1:C}).

    [8] Chronos: Learning the Language of Time Series, section 2 Background and Related Work
    “Time series forecasting concerns using historical data from a quantity of interest (typically real-valued) to predict their future values. Formally, given a uniformly-spaced time series 𝒙1:C=[x1,…,xC]{\bm{x}}_{1:C}=[x_{1},\dots,x_{C}], we are interested in predicting the joint di…”
  37. limitationمدعوم مع تحفظات

    The passage describes fine-tuning methods for time-series tasks as requiring fine-tuning for each new task, while large language-model approaches can demand substantial computational resources and inference time.

    [8] Chronos: Learning the Language of Time Series, section 1 IntroductionPassage states fine-tuning methods need fine-tuning for each new task OR large-scale models demand substantial computational resources and inference time—claim uses 'and' suggesting both apply to same approach, passage uses 'or' distinguishing two separate limitations.
    “In the context of LLMs, this interest has been pursued through two main avenues: directly prompting pretrained LLMs in natural language (Gruver et al., 2023; Xue & Salim, 2023) and fine-tuning LLMs for time series tasks (Zhou et al., 2023a; Jin et al., 2024). However, these metho…”
  38. uncertaintyمدعوم

    The provided Chronos passages do not report a comparison of full fine-tuning, LoRA, and quantile head replacement under purged walk-forward splits for one-minute or five-minute OHLCV bars.

    [8] Chronos: Learning the Language of Time Series, abstract arXiv:2403.07815v3
    “We introduce Chronos, a simple yet effective framework for pretrained probabilistic time series models. Chronos tokenizes time series values using scaling and quantization into a fixed vocabulary and trains existing transformer-based language model architectures on these tokenize…”
  39. uncertaintyمدعوم

    The provided Chronos passages do not report out-of-sample direction accuracy, calibration measurements, or GPU-hour requirements for training a 25M–200M parameter model on a single asset with 500K–2M bars.

    [8] Chronos: Learning the Language of Time Series, abstract arXiv:2403.07815v3
    “We introduce Chronos, a simple yet effective framework for pretrained probabilistic time series models. Chronos tokenizes time series values using scaling and quantization into a fixed vocabulary and trains existing transformer-based language model architectures on these tokenize…”
  40. factمدعوم

    The study uses pre-trained foundation models, including GPT-2-backbone LLMs, transformers, and linear models, for financial time-series forecasting.

    [10] Large Language Models for Financial Aid in Financial Time-series Forecasting, abstract arXiv:2410.19025v1
    “Considering the difficulty of financial time series forecasting in financial aid, much of the current research focuses on leveraging big data analytics in financial services. One modern approach is to utilize "predictive analysis", analogous to forecasting financial trends. Howev…”

المصادر

  1. [1]
    Mathias Mesfin. Sequential Structure in Intraday Futures Data: LSTM vs Gradient Boosting on MNQ. arXiv (Cornell University), 2026.openalex · primary · https://arxiv.org/abs/2605.17724
  2. [2]
    Marcel Meyer, David Zapata Gonzalez, Sascha Kaltenpoth, Oliver Müller. Benchmarking Time Series Foundation Models for Short-Term Household Electricity Load Forecasting. IEEE Access, 2025.openalex · primary · DOI 10.1109/access.2025.3648056 · https://doi.org/10.1109/access.2025.3648056
  3. [3]
    Kashif Rasul, Arjun Ashok, Andrew Robert Williams, Hena Ghonia, Rishika Bhagwatkar, Arian Khorasani, Mohammad Javad Darvishi Bayazi, George Adamopoulos, Roland Riachi, Nadhir Hassen, Marin Biloš, Sahil Garg, Anderson Schneider, Nicolas Chapados, Alexandre Drouin, Valentina Zantedeschi, Yuriy Nevmyva. Lag-Llama: Towards Foundation Models for Probabilistic Time Series Forecasting. arXiv, 2023.arxiv · primary · https://arxiv.org/abs/2310.08278v3
  4. [4]
    Xu Liu, Juncheng Liu, Gerald Woo, Taha Aksu, Yuxuan Liang, Roger Zimmermann. Moirai-MoE: Empowering Time Series Foundation Models with Sparse Mixture of Experts. arXiv (Cornell University), 2024.openalex · primary · DOI 10.48550/arxiv.2410.10469 · https://doi.org/10.48550/arxiv.2410.10469
  5. [5]
    Nouha Karaouli, Denis Coquenet, Elisa Fromont, Martial Mermillod, Marina Reyboz. How Foundational are Foundation Models for Time Series Forecasting?. arXiv, 2025.arxiv · primary · https://arxiv.org/abs/2510.00742v3
  6. [6]
    Jieming Bian, Lei Wang, Letian Zhang, Jie Xu. LoRA-FAIR: Federated LoRA Fine-Tuning with Aggregation and Initialization Refinement. arXiv, 2024.arxiv · primary · https://arxiv.org/abs/2411.14961v3
  7. [7]
    Dennis Thumm, Ying Chen. Interventional Time Series Priors for Causal Foundation Models. arXiv, 2026.arxiv · primary · https://arxiv.org/abs/2603.11090v2
  8. [8]
    Abdul Fatir Ansari, Lorenzo Stella, Caner Turkmen, Xiyuan Zhang, Pedro Mercado, Huibin Shen, Oleksandr Shchur, Syama Sundar Rangapuram, Sebastian Pineda Arango, Shubham Kapoor, Jasper Zschiegner, Danielle C. Maddix, Hao Wang, Michael W. Mahoney, Kari Torkkola, Andrew Gordon Wilson, Michael Bohlke-Sc. Chronos: Learning the Language of Time Series. arXiv, 2024.arxiv · primary · https://arxiv.org/abs/2403.07815v3
  9. [9]
    Matthew Peroni, Franck Le, Vadim Sheinin. Robust Tabular Foundation Models. arXiv, 2025.arxiv · primary · https://arxiv.org/abs/2512.03307v1
  10. [10]
    Md Khairul Islam, Ayush Karmacharya, Timothy Sue, Judy Fox. Large Language Models for Financial Aid in Financial Time-series Forecasting. arXiv, 2024.arxiv · primary · https://arxiv.org/abs/2410.19025v1
  11. [11]
    Adèle Gouttes, Kashif Rasul, Mateusz Koren, Johannes Stephan, Tofigh Naghibi. Probabilistic Time Series Forecasting with Implicit Quantile Networks. arXiv, 2021.arxiv · primary · https://arxiv.org/abs/2107.03743v1
  12. [12]
    Alessio Brini, Giacomo Toscano. SpotV2Net: Multivariate Intraday Spot Volatility Forecasting via Vol-of-Vol-Informed Graph Attention Networks. arXiv, 2024.arxiv · primary · https://arxiv.org/abs/2401.06249v4