أبحاث
قرارات مصنّفة غير تلقائية الانحدار: كيف يُقارَن Laya بـ BERT في التصنيف على الجهاز (On-Device Classification)؟
Non-Autoregressive Typed Decisions: How Does Laya Compare to BERT for On-Device Classification?
الجواب المباشر
الجواب المباشر
لا تتضمن الادعاءات الموثّقة أي تجربة تُشغِّل Laya (LAYA، وهو Layer-wise Attention Aggregator أي مُجمِّع الانتباه عبر الطبقات) مقابل نموذج BERT-base مضبوط دقيقًا (fine-tuned) على نفس مهمة تصنيف النصوص الثنائية أو متعددة الفئات على الجهاز، مع قياسات زمن استجابة (latency) ودقة متطابقة، لذا لا توجد إجابة مباشرة لسؤال المقارنة في الأدلة. ما تُظهره الادعاءات، كلٌّ على حدة، هو أن LAYA رأس إخراج (output head) خفيف الوزن يُقيَّم على مجموعات بيانات تصنيف الصور، حيث يصل إلى أداء تنبؤي منافس ويقدّم تفسيرات واعية بالعمق (depth-aware explanations) [12]، بينما BERT المضبوط دقيقًا وعائلته (RoBERTa، DistilBERT) موثَّقان كمصنّفات قوية، منخفضة زمن الاستجابة ومنخفضة التكلفة على معايير النصوص مقارنةً بالمطالبة (prompting) عبر LLM، لا مقارنةً بـ LAYA [1]. ولأن المقارنة المُبلَّغ عنها الخاصة بـ LAYA هي مع رؤوس إخراج أخرى على مهام الصور، وأن مقارنات BERT المُبلَّغ عنها هي مع مطالبة LLM ومع متغيرات مُقطَّرة (distilled) أو هجينة كمّية (quantum-hybrid) من نفسه، لا يمكن لباني نظام أن يستنتج من هذه الادعاءات أيّهما سيفوز في معيار تصنيف نصوص على الجهاز. من يحتاج تلك الإجابة عليه أن يُجري الاختبار المباشر بنفسه؛ وتعرض هذه الملاحظة كيفية القيام بذلك، باستخدام الآليات والأرقام والتكاليف التي أبلغت عنها المصادر لكل جانب على حدة.
لماذا يهم هذا السؤال في التصنيف على الجهاز
تصنيف النصوص بمجموعة ثابتة من التصنيفات، مثل تحليل المشاعر (ثنائي) أو الموضوع (متعدد الفئات)، يُحَلّ تقليديًا باستخدام معماريات ترميز فقط (encoder-only) تشمل BERT وRoBERTa وDistilBERT [1]. تحقق هذه النماذج دقة تنبؤية قوية مع الحفاظ على زمن استجابة استدلال منخفض وبصمة حسابية متواضعة [1]. يضيف النشر على الجهاز قيودًا لا يفرضها النشر على الخادم: ذاكرة محدودة، وقدرة حوسبة محدودة، ومتطلبًا صارمًا على زمن الاستجابة لكل استدلال. لهذا السبب يستحق أي ادعاء بوجود بديل أرخص أو أسرع من BERT تدقيقًا قبل اعتماده للاستخدام على الجهاز، ولهذا السبب فإن دراسة تقيس فعليًا زمن الاستجابة والتكلفة جنبًا إلى جنب مع الدقة أكثر فائدة لباني نظام من دراسة تُبلغ عن الدقة وحدها.
أظهرت نماذج اللغة الكبيرة مثل GPT-4o وClaude Sonnet 4.5 قدرات قوية في الاستدلال المفتوح ومهام اللغة التوليدية [1]. لكن نماذج LLM تولّد المخرج رمزًا (token) تلو الآخر حتى عند إنتاج تصنيف فئة واحدة، مما يُدخِل زمن استجابة متأصلًا وتكاليف مبنية على الاستخدام [1]. دراسة تُقيّم نماذج LLM القائمة على المطالبة بدون أمثلة (zero-shot) وبأمثلة قليلة (few-shot) مقابل معماريات ترميز فقط مضبوطة دقيقًا بالكامل عبر أربعة معايير، وهي IMDB وSST-2 وAG News وDBPedia، بقياس macro F1 وزمن استجابة الاستدلال والتكلفة المالية، وجدت أن النماذج المضبوطة دقيقًا القائمة على الترميز من عائلة BERT تحقق أداء تصنيف منافسًا، وغالبًا ما يكون متفوقًا، بينما تعمل بتكلفة وزمن استجابة أقل بمقدار رتبة إلى رتبتَي حجم مقارنةً بمطالبة LLM بدون أمثلة أو بأمثلة قليلة [1]. يُرسّخ هذا نماذج عائلة BERT كخط أساس عملي للتصنيف على الجهاز أو الحساس للتكلفة، لا LLM، وهو خط الأساس الذي تستخدمه هذه الملاحظة عند مناقشة ما يحتاج بديل مرشح لـ BERT أن يتفوق عليه.
وعلى صعيد آخر، يطرح خط عمل مختلف سؤالًا حول ما إذا كانت الممارسة القياسية المتمثلة في أخذ التنبؤ من الطبقة المخفية الأخيرة فقط هي الخيار التصميمي الصحيح لمصنّف عصبي. تشتقّ معظم المعماريات تنبؤاتها في النهاية حصريًا من التمثيل الناتج عن الطبقة المخفية الأخيرة [12]. تُشير دراسات تجريبية ونظرية إلى أن طبقات مختلفة تلتقط جوانب متمايزة ومتكاملة من المُدخل: الطبقات المبكرة تُرمِّز أنماطًا محلية، والطبقات الوسطى تلتقط علاقات بنيوية، والطبقات الأعمق تمثّل دلالات متزايدة التجريد [12]. LAYA (Layer-wise Attention Aggregator) هو رأس إخراج جديد يجمّع التمثيلات الداخلية ديناميكيًا عبر الانتباه (attention)، وقد بُني للاستفادة من هذه الملاحظة بدلًا من تجاهلها [12].
السؤال العملي الذي يواجه باني نظام هو ما إذا كان استبدال رأس مصنّف قياسي بشيء مثل LAYA، أو استبدال LLM كامل بـ BERT مضبوط دقيقًا، يمنح مقايضة أفضل بين الدقة وكل مللي ثانية على هاتف أو رقاقة مدمجة. الأدلة المجمَّعة هنا تجيب على السؤال الثاني مباشرة ولا تجيب على السؤال الأول لتصنيف النصوص، لأن LAYA لم يُختبر إلا على مجموعات بيانات صور [12]. تتعامل بقية هذه الملاحظة مع هذين الجسمين من الأدلة كجسمين منفصلين موثَّقين جيدًا، وتصف الآلية والأرقام المُبلَّغ عنها لكل منهما، وتوضّح صراحةً أينما لا يلتقيان، ليعرف باني نظام يريد المقارنة المفقودة بالضبط أيَّ تجربة يُجريها وما الذي يحتاج ضبطه. تقدّم دراسة تُؤطِّر تقييم النموذج كمسألة قرار متعددة الأهداف وتُحلّل المقايضات باستخدام إسقاطات جبهة باريتو (Pareto frontier) ودالة منفعة معلمَنة تعكس أنظمة نشر مختلفة العدسة الصحيحة لهذا النوع من المقارنة بمجرد سدّ القياس المفقود [1].
ما هو BERT وما هو LAYA
يعتمد BERT على مُحوِّل (Transformer) ثنائي الاتجاه متعدد الطبقات، ويُدرَّب على نص عادي لمهام التنبؤ بالكلمة المُقنَّعة (masked word prediction) والتنبؤ بالجملة التالية (next sentence prediction) [6]. وهو أول نموذج تمثيل قائم على الضبط الدقيق (fine-tuning) يحقق نتائج متقدمة في مجموعة من مهام معالجة اللغة الطبيعية [6]. يعني هذا أن BERT يُدرَّب مسبقًا مرة واحدة على نص كبير غير مُوسَم باستخدام هدفين إشرافيين ذاتيين، ثم تُكيَّف الأوزان المُدرَّبة مسبقًا نفسها، أي تُضبط دقيقًا، لمهام لاحقة عديدة مختلفة ببيانات موسومة قليلة نسبيًا. هذه الوصفة ذات المرحلتين، التدريب المسبق ثم الضبط الدقيق، هي سبب كون BERT وسليلاته الخيار الافتراضي لتصنيف النصوص ذي التصنيفات الثابتة بدلًا من نموذج مُدرَّب من الصفر لكل مهمة.
آليًا، يُولّد BERT متجه تضمين (embedding) سياقيًا عبر مكدّس من كتل المُحوّل لكل رمز (token) مُدخَل، ويُضيف رمزًا خاصًا [CLS] في بداية جملة الإدخال لمهام التصنيف [5]. لتصنيف على مستوى الجملة، يُسقِط مصنّف خطي مُضاف تضمين [CLS] إلى متجه احتمالات غير مُطبَّع (unnormalized) عبر فئات الإخراج [5]. هذا هو رأس التصنيف القياسي: طبقة خطية واحدة مُتعلَّمة توضع فوق مخرج كتلة المُحوّل الأخيرة لرمز واحد مُحدَّد، تليها خطوة تطبيع تحوّل الدرجات غير المُطبَّعة إلى احتمالات فئات. المكدّس بأكمله، الترميز مع الرأس الخطي، يُدرَّب من طرف إلى طرف أثناء الضبط الدقيق، وهو ما يفسّر أن ضبط BERT دقيقًا لمهمة جديدة يتطلب تحديث كل معلماته ما لم يُستخدم متغير كفء المعلمات (parameter-efficient).
يتّخذ LAYA نظرة مختلفة لما يجب أن ينظر إليه الرأس. LAYA (Layer-wise Attention Aggregator) هو وحدة إخراج خفيفة الوزن تتعلم وزن ودمج كل التمثيلات المخفية بطريقة تعتمد على المُدخل [12]. يتعلم LAYA أوزان انتباه مشروطة بالمُدخل على السمات عبر الطبقات [12]. فبدلًا من أن يقرأ الرأس الطبقة المخفية الأخيرة فقط، كما يفعل مصنّف BERT القائم على [CLS]، يقرأ رأس LAYA كل طبقة مخفية ينتجها شبكة العمود الفقري (backbone) ويترك آلية انتباه تُقرِّر، لكل مُدخل فردي، مقدار الوزن الذي يجب أن يُمنح لتمثيل كل طبقة. يوفّر LAYA درجات إسناد على مستوى الطبقة (layer-attribution) جوهرية تُحدِّد صراحةً مساهمة كل تمثيل في القرار النهائي دون طرق تفسير لاحقة خارجية [12]، مما يعني أن أوزان الانتباه نفسها تعمل بمثابة تفسير للأعماق التي كان لها أهمية في التنبؤ المُعطى، دون الحاجة لأداة تفسيرية منفصلة.
يختلف التصميمان إذن عند النقطة نفسها التي يُتّخذ فيها قرار التصنيف. رأس مصنّف BERT ثابت ويقرأ تمثيلًا نهائيًا واحدًا، وهو تضمين [CLS] بعد كتلة المُحوّل الأخيرة [5]. أما رأس LAYA فهو بحد ذاته وحدة انتباه صغيرة قابلة للتدريب تقرأ كل التمثيلات الوسيطة وتُنتج ترجيحًا لكل مُدخل ولكل طبقة قبل إصدار التنبؤ النهائي [12]. يقوم كلا النهجين على عمود فقري (backbone) مستخرج للسمات، وهو ترميز في حالة BERT، لكن وصف LAYA في المصدر لا يُحدّد عمودًا فقريًا نصيًا؛ فالتجارب المُبلَّغ عنها تستخدم مجموعات بيانات تصنيف صور [12]. هذا التمييز، بين العمود الفقري والرأس، هو سبب حاجة أي مقارنة عادلة بين Laya وBERT لتصنيف النصوص إلى تحديد العمود الفقري الدقيق الذي يقوم عليه مُجمِّع LAYA قبل أن تُقارن أي أرقام دقة أو زمن استجابة. كما يعني أن وصف LAYA كمنافس لـ BERT دقيق جزئيًا فقط: فـ LAYA يستبدل رأس التصنيف، بينما يُوصف BERT عادةً ويُقاس كترميز كامل مع رأس معًا، لذا يحتاج اختبار عادل إلى تثبيت العمود الفقري وتبديل الرأس فقط، أو التوضيح صراحةً أن المعمارية بأكملها، بما فيها العمود الفقري، يجري تبديلها.
الآلية داخل LAYA: التجميع، والمُهايئات (adapters)، والتنبؤ
الحوسبة الداخلية لـ LAYA موصوفة بدقة كافية في المصدر لإعادة إنتاجها. يستبدل LAYA رأس المصنّف القياسي بمُجمِّع قائم على الانتباه: h_agg = sum_{i=1}^{L} alpha_i(x) g_i(h_i)، حيث alpha_i(x) هي معاملات قابلة للتعلم ومشروطة بالمُدخل [12]. بعبارة بسيطة، ينتج العمود الفقري L تمثيلًا مخفيًا، واحدًا لكل طبقة، وبدلًا من الاحتفاظ بالأخير فقط، يحسب LAYA مجموعًا مُرجَّحًا لكل هذه التمثيلات، حيث يعتمد الوزن الممنوح لكل طبقة على المُدخل المحدَّد x قيد المعالجة حاليًا، وليس على جدول ثابت مستقل عن المُدخل. هذا هو الادعاء البنيوي الأساسي للطريقة: الترجيح دالة للمُدخل، لذا يمكن لمُدخلين مختلفين يمرّان عبر نفس الشبكة المدرَّبة أن يعتمدا في النهاية على أعماق مختلفة من التمثيل.
قبل حساب المجموع المُرجَّح، يُوضَع تمثيل كل طبقة على أرضية مشتركة. تُعرَّف كل حالة مخفية في LAYA إلى فضاء كامن مشترك عبر مُهايئ (adapter) خفيف الوزن g_i(.)، لضمان قابلية المقارنة عبر الطبقات [12]. تهمّ خطوة المُهايئ هذه لأن الحالات المخفية من أعماق مختلفة للشبكة قد تختلف في المقياس أو الأبعاد أو الدقة الدلالية، وجمعها مباشرة دون إسقاطها أولًا في فضاء مشترك قد يسمح لطبقة ما بالهيمنة على المجموع لأسباب لا تتعلق بمدى فائدة تمثيلها فعليًا. يُوصف المُهايئ الخفيف بأنه صغير، مما يُبقي إجمالي معلمات LAYA وعبء الحوسبة الإضافي منخفضًا نسبيًا مقارنةً بالعمود الفقري الذي يقوم عليه، رغم أن المصدر لا يعطي عدد معلمات دقيقًا ولا صيغة لحجم المُهايئ نسبةً إلى البُعد المخفي للعمود الفقري.
مرحلة الإخراج هي خطوة خطية بسيطة متبوعة بلا-خطية (nonlinearity) تُطبَّق على التمثيل المُجمَّع. يُحسَب التنبؤ النهائي في LAYA كـ y_hat = phi(W h_agg + b) [12]. هذا مشابه بنيويًا لرأس تصنيف BERT نفسه، وهو إسقاط خطي متبوع بلا-خطية، مع اختلاف رئيسي في ما يُغذَّى إلى تلك الطبقة الخطية: يُدخِل BERT تضمين [CLS] من الطبقة الأخيرة فقط [5]، بينما يُدخِل LAYA المزيج المُجمَّع بالانتباه من كل التمثيلات المُهايَئة عبر الطبقات [12]. الآلية الإضافية في LAYA، بالمقارنة برأس قياسي، هي إذن المُهايئ لكل طبقة g_i وأوزان الانتباه المشروطة بالمُدخل alpha_i(x)؛ أما بقية طريقة إنتاج درجة الفئة النهائية فهي مصنّف خطي تقليدي مع لا-خطية phi تُطبَّق في النهاية.
ولأن أوزان الانتباه alpha_i(x) مُتعلَّمة وتعتمد على المُدخل، يمكن فحصها بعد التدريب لمعرفة الطبقات التي اعتمد عليها النموذج لأنواع مُدخلات معينة، ويعامل المصدر ذلك سمةً أساسية لا أثرًا جانبيًا. تُظهر تحليلات تفسيرية كمّية ونوعية أن درجات انتباه LAYA تعكس عن قرب المساهمة الفعلية لكل طبقة على حدة [12]. يكشف LAYA أنماطًا مُنظَّمة تعتمد على المهمة لاستخدام العمق، بينما يقدّم تفسيرات بديهية لكيفية مساهمة مستويات التجريد المختلفة في كل تنبؤ [12]. بالنسبة لباني نظام، يعني هذا أن اعتماد LAYA كرأس مصنّف ليس قرارًا مبنيًا على الدقة أو زمن الاستجابة فقط؛ بل يوفّر أيضًا تفسيرًا مدمجًا لكل تنبؤ حول أعماق الشبكة التي دفعت القرار، بتكلفة المُهايئ الإضافي ومعلمات الانتباه الموصوفة أعلاه. لم تُوصف أو تُقاس أي من هذه الآلية على عمود فقري نصي في الأدلة المجمَّعة هنا، لذا فإن تطبيقها على مكدّس بأسلوب BERT من كتل المُحوّل يمثل امتدادًا مباشرًا ومعقولًا يجب اختباره، لا شيئًا مُبلَّغًا عنه سابقًا.
ما جرى قياسه لنماذج عائلة BERT، وما لم يُقَس لـ LAYA على النصوص
أوضح مقارنة كمّية متاحة في الأدلة هي بين مُشفِّرات عائلة BERT المضبوطة دقيقًا ومطالبة LLM، لا بين BERT وLAYA. قاست الدراسة ذات الصلة macro F1 وزمن استجابة الاستدلال والتكلفة المالية عبر أربعة معايير، وهي IMDB وSST-2 وAG News وDBPedia، مقارنةً نماذج LLM القائمة على المطالبة بدون أمثلة وبأمثلة قليلة مثل GPT-4o وClaude Sonnet 4.5 مقابل معماريات ترميز فقط مضبوطة دقيقًا بالكامل [1]. كانت النتيجة أن النماذج المضبوطة دقيقًا القائمة على الترميز من عائلة BERT تحقق أداء تصنيف منافسًا، وغالبًا متفوقًا، بينما تعمل بتكلفة وزمن استجابة أقل بمقدار رتبة إلى رتبتَي حجم مقارنةً بمطالبة LLM بدون أمثلة أو بأمثلة قليلة [1]. تُؤطِّر الورقة نفسها تقييم النموذج كمسألة قرار متعددة الأهداف وتُحلّل المقايضات باستخدام إسقاطات جبهة باريتو ودالة منفعة معلمَنة تعكس أنظمة نشر مختلفة [1]، وهذه نقطة منهجية يمكن لباني نظام إعادة استخدامها: الدقة وحدها ليست العدسة الصحيحة عندما تختلف التكلفة وزمن الاستجابة بمقدار رتب حجم بين المرشحين. هذه المنهجية، لا الأرقام تحديدًا، هي الجزء الذي ينتقل بسلاسة إلى دراسة Laya مقابل BERT، لأنها تقدّم نموذجًا للتبليغ عن ثلاثة محاور معًا بدلًا من الدقة معزولة.
تضيف مصادر أخرى أرقامًا إضافية منفصلة عن متغيرات BERT دون مقارنتها بـ LAYA. يحقق TinyBERT 4 بأربع طبقات أكثر من 96.8% من أداء معلّمه BERT BASE على معيار GLUE، بينما يكون أصغر بـ 7.5 مرة وأسرع بـ 9.4 مرة في الاستدلال [7]. يؤدي TinyBERT 6 بست طبقات أداءً مماثلًا لمعلّمه BERT BASE [7]. تصف هذه الأرقام التقطير (distillation)، أي ضغط BERT BASE في نموذج طالب أصغر، وتُرسّخ أن دقة BERT يمكن الحفاظ عليها بجزء صغير من حجمها وزمن استجابتها عبر الضغط المعماري، وهذا ذو صلة مباشرة بالنشر على الجهاز رغم أنه لا يقول شيئًا عن LAYA. باني نظام يريد ميزانية حجم-زمن استجابة لجانب BERT من المقارنة لديه، في هذه الأرقام، نقطتَي مرجع محددتين مُقاستين بالفعل على GLUE: طالب من 4 طبقات أصغر بـ 7.5 مرة وأسرع بـ 9.4 مرة بأكثر من 96.8% من أداء المعلّم، وطالب من 6 طبقات بأداء مماثل.
يتطلب ضبط BERT دقيقًا لمهام معالجة لغة طبيعية محددة موارد حسابية عالية وزمن استدلال مكلفًا [2]، وهي تكلفة حفّزت نهجًا هجينًا كلاسيكيًا-كموميًا: يدمج نموذج BERT الهجين الكلاسيكي-الكمومي المقترح دارة كمومية ذات n-كيوبت مع نموذج BERT كلاسيكي لتصنيف النصوص [2]، مستخدمًا الدارة الكمومية لضبط النموذج الكلاسيكي دقيقًا [2]. يحقق نموذج BERT الهجين الكلاسيكي-الكمومي المقترح أداءً منافسًا، وفي بعض الحالات أفضل، من خطوط الأساس الكلاسيكية على مجموعات بيانات معيارية قياسية [2]. لكن الأجهزة الكمومية الحالية ليست مقاومة للأخطاء (fault-tolerant) بما يكفي لتحقيق تسريع حسابي فعلي، لذا تُجرى التجارب عبر محاكاة الدارات الكمومية [2]، ما يعني أن التنافسية المُبلَّغ عنها متعلقة بالدقة فقط، لا بأي ميزة زمن استجابة أو تكلفة مُثبتة على BERT الكلاسيكي المضبوط دقيقًا؛ والمحاكاة تعمل على أجهزة كلاسيكية، لذا لا يتوفر رقم زمن استجابة على الجهاز من هذه المقارنة أيضًا.
القياس المُبلَّغ عنه الخاص بـ LAYA يقع في مجال مختلف تمامًا. تُظهر التجارب على مجموعات بيانات تصنيف الصور أن LAYA يحقق أداءً تنبؤيًا منافسًا مع إنتاج تفسيرات واعية بالعمق ذات معنى [12]. لا يوجد اسم معيار، ولا رقم دقة مُعطى، ولا مهمة تصنيف نصوص متضمَّنة في هذا القياس؛ ينصّ الادعاء فقط على أن الأداء منافس وأن التفسيرات ذات معنى، على بيانات صور. ولأن أيًّا من المصادر لا يُبلغ عن macro F1 أو زمن الاستجابة أو التكلفة لـ LAYA على IMDB أو SST-2 أو AG News أو DBPedia أو أي معيار تصنيف نصوص آخر، ولأن أيًّا من المصادر لا يُشغِّل BERT وLAYA على نفس المهمة بنفس بروتوكول القياس، لا يوجد رقم مشترك في الأدلة يسمح لقارئ بوضع LAYA وBERT على نفس جبهة باريتو لتصنيف النصوص. هذه الفجوة هي النتيجة المحورية لهذه الملاحظة: ليس أن LAYA يخسر أو يفوز، بل أن المقارنة لم تُقَس، وأي بيان يخالف ذلك سيتجاوز ما تقوله المصادر.
عدم الاستقرار، وتكلفة الضبط الدقيق، ومقايضات BERT الأخرى الموثَّقة
باني نظام يختار بين BERT وأي رأس أو معمارية بديلة يحتاج أيضًا إلى معرفة أنماط فشل خاصة بضبط BERT دقيقًا، مستقلة عن المقارنة بـ LAYA. يظلّ ضبط BERT دقيقًا غير مستقر، خصوصًا عند استخدام BERTLarge على مجموعات بيانات صغيرة، حيث تؤدي عمليات تعلّم مطابقة بمصادر عشوائية (random seeds) مختلفة غالبًا إلى نماذج مختلفة اختلافًا كبيرًا [5]. يعني هذا أن أرقام الدقة المُبلَّغ عنها لتشغيل ضبط دقيق واحد لـ BERT قد تكون مضللة ما لم يُكرَّر التشغيل عبر عدة مصادر عشوائية، لأن تشغيلين من نفس الإعداد قد ينتهيان بمستويات دقة مختلفة جوهريًا لمجرد العشوائية في التهيئة أو ترتيب البيانات. هذا تحذير منهجي مباشر لأي شخص يصمم دراسة مقارنة: رقم دقة من مصدر عشوائي واحد لخط أساس BERT لا يكفي لاستخلاص استنتاج ضد طريقة منافسة مثل LAYA.
يحدّد المصدر نفسه أسبابًا محددة لعدم الاستقرار هذا وحلًا موثَّقًا. تشمل العوامل المسبّبة لعدم الاستقرار في ضبط BERT دقيقًا بعينات قليلة: استخدام طريقة تحسين غير قياسية مع تقدير تدرّج مُتحيِّز، وتطبيقية محدودة لأجزاء من شبكة BERT، واستخدام عدد محدَّد مسبقًا وصغير من تكرارات التدريب [5]. ضبط نموذج BERT المُدرَّب مسبقًا دقيقًا على مهمة وسيطة كبيرة يُثبّت الضبط الدقيق اللاحق على مجموعات بيانات صغيرة [5]. لباني نظام يعمل بمجموعة بيانات تصنيف صغيرة على الجهاز، يوفّر هذا وصفة محددة قابلة للتنفيذ: الضبط الدقيق أولًا على مهمة وسيطة أكبر ذات صلة قبل الضبط الدقيق على مجموعة البيانات الهدف الصغيرة، بدلًا من الضبط الدقيق المباشر على مجموعة البيانات الصغيرة من نقطة التحقق (checkpoint) المُدرَّبة مسبقًا الأساسية.
تتكرر التكلفة كموضوع عبر مصادر مستقلة متعددة، ليس فقط في مقارنة LLM مقابل الترميز. ينتج ضبط BERT دقيقًا أداءً مماثلًا للنماذج الكلاسيكية بتكلفة إضافية كبيرة في تصحيح المقالات آليًا (automated essay scoring) [9]. هذه نتيجة خاصة بمجال معين، تصحيح المقالات آليًا، لكنها تُعزّز النمط العام المُلاحَظ في مقارنة مطالبة LLM [1] والتحفيز الهجين الكمومي [2]: غالبًا ما تُطابَق دقة BERT من قِبل بدائل أرخص، ويجب أن يُوازن قرار استخدام BERT بين هذه التكلفة الإضافية والدقة المكتسبة، مهمةً بمهمة، بدلًا من افتراض أن BERT يستحق تكلفته دائمًا.
أخيرًا، توجد حجة بنيوية حول ما إذا كانت معماريات الترميز مثل BERT الشكل الحسابي الصحيح لمهمة مُعطاة، بمعزل عن الدقة. طبقات المُحوّل خطية في أبعاد المُدخل وتربيعية في طول المُدخل [10]. تتوسّع الشبكات المتكررة خطيًا في طول المُدخل وتربيعيًا في أبعاد المُدخل [10]. هذه المقايضة موثَّقة في تطبيق مختلف، نمذجة التسلسل للتحكم، حيث Decision Transformer هو خوارزمية تعلّم معزز غير متصل (offline RL) تُنمذج المسارات تلقائي الانحدار باستخدام معمارية GPT-2 [10]، وتُعاني مع مسائل التحكم المستمر مثل تثبيت البندول المقلوب وبندول Furuta [10]، بينما يستطيع Decision LSTM تحقيق أداء بمستوى الخبير في مهام تثبيت البندول المقلوب وبندول Furuta [10]. هذه النتيجة لا تنتقل مباشرة إلى تصنيف النصوص أو إلى LAYA، لكنها تُرسّخ، كنمط عام وقابل للتكرار، أن أفضل معمارية لمهمة تعتمد على شكل المُدخل، الطول مقابل الأبعاد، وأن التصميمات القائمة على المُحوّل ليست متفوقة عالميًا حتى عندما يكون البديل شبكة متكررة أبسط بكثير. يجب على باني نظام أن يعامل هذا كتحذير ضد افتراض أن ترميزًا قائمًا على المُحوّل هو تلقائيًا العمود الفقري الصحيح لكل إعداد تصنيف، على الجهاز أو غير ذلك، دون قياسه مباشرة مقابل البدائل على شكل المُدخل المحدَّد المطروح.
اعتبارات النشر على الجهاز: الخصوصية، والبصمة، وحالة المصدر المفتوح
إلى جانب أرقام الدقة وزمن الاستجابة الخام، يهمّ سياق النشر في قرار على الجهاز، ويتحدث أحد المصادر مباشرة عن هذا. طبيعة المصدر المفتوح للمُشفِّرات المضبوطة دقيقًا تُمكِّن النشر داخل المؤسسة (on-premise)، مقدِّمةً مزايا في الخصوصية وحوكمة البيانات وقابلية إعادة الإنتاج [1]. بالنسبة للتصنيف على الجهاز تحديدًا، تقترب هذه الخاصية من كونها متطلبًا: يجب أن تكون أوزان النموذج متاحة محليًا، ويجب ألا يعتمد الاستدلال على استدعاء شبكة إلى واجهة برمجية خارجية، وتحتاج المؤسسة التي تنشر النموذج إلى القدرة على إعادة إنتاج ومراجعة سلوكه. تُلبّي نماذج عائلة BERT المضبوطة دقيقًا هذا لأنها مفتوحة المصدر ويمكن تصديرها وتشغيلها محليًا [1]، في حين أن واجهات برمجة LLM القائمة على المطالبة، بالمقابل، تتطلب عادة رحلة ذهاب وإياب عبر الشبكة وتُفوتَر حسب الاستخدام، بما أن نماذج LLM تولّد المخرج رمزًا تلو الآخر حتى عند إنتاج تصنيف فئة واحدة، مما يُدخِل زمن استجابة متأصلًا وتكاليف مبنية على الاستخدام [1].
هذه الخاصية نفسها، الأوزان المفتوحة القابلة للتصدير والتشغيل محليًا، لم تُتناوَل لـ LAYA في الأدلة. تصف الادعاءات LAYA كوحدة إخراج خفيفة الوزن [12]، وخفيف الوزن يعني عمومًا عددًا صغيرًا من المعلمات الإضافية وحوسبة إضافية منخفضة نسبيًا للعمود الفقري الذي يقوم عليه، لكن لا يوجد ادعاء يذكر عدد معلمات LAYA أو بصمته في الذاكرة أو ما إذا كان التطبيق المرجعي متاحًا علنًا. باني نظام يُقيِّم LAYA للاستخدام على الجهاز سيحتاج إلى إثبات ذلك مباشرة من تطبيق LAYA بدلًا من الادعاءات الملخَّصة هنا، إذ لا تعطي أي من الادعاءات الموثَّقة رقمًا لذلك.
خُفِّضت بصمة الترميز فعلًا بشكل كبير داخل عائلة BERT عبر التقطير، وهو أمر ذو صلة مباشرة بميزانيات الجهاز. يحقق TinyBERT 4 أكثر من 96.8% من أداء BERT BASE على GLUE بحجم أصغر بـ 7.5 مرة واستدلال أسرع بـ 9.4 مرة [7]، ويؤدي TinyBERT 6 أداءً مماثلًا لـ BERT BASE [7]، ويصف كلاهما نقاط تحقق (checkpoints) أصغر قابلة للنشر تحافظ على وصفة الضبط الدقيق الخاصة بـ BERT ورأس تصنيفها القائم على [CLS] [5] بينما تُقلّص الحوسبة والذاكرة اللازمتين وقت الاستدلال. هذا هو المسار الأكثر تحديدًا وقابلية للتكرار في الأدلة نحو مصنّف من عائلة BERT منخفض زمن الاستجابة ومنخفض الذاكرة مناسب للاستخدام على الجهاز، وهو خط الأساس الطبيعي الذي ينبغي قياس أي تصميم رأس جديد، بما فيه LAYA، مقابله إذا كان الهدف هو النشر على الجهاز.
مُجمَلةً، تصف ادعاءات ذات صلة بالنشر نماذج عائلة BERT بأنها مفتوحة المصدر وقابلة للتصدير، وحافظة للخصوصية عند استضافتها ذاتيًا [1]، وقابلة للضغط دون خسارة دقة كبيرة عبر التقطير [7]، لكنها غير مستقرة عبر المصادر العشوائية على مجموعات بيانات صغيرة ما لم تُستخدم خطوة ضبط دقيق وسيطة [5]. لم تُوثَّق أيٌّ من خصائص النشر هذه، حالة المصدر المفتوح وعدد المعلمات وقابلية التصدير، لـ LAYA في الأدلة المجمَّعة هنا؛ فخصائص LAYA الموثَّقة معمارية، آلية تجميعه [12]، وتقييمية، دقة تنافسية وقابلية تفسير على مجموعات بيانات صور [12]، لا تشغيلية. هذا التفاوت في ما تم قياسه هو بحد ذاته نتيجة مهمة لباني نظام: المرشحان غير موصوفَين بعد على نفس المحاور، لذا لا يمكن اتخاذ قرار نشر على الجهاز من هذه الادعاءات وحدها، وسدّ هذه الفجوة هو بالضبط ما تشير إليه هذه الملاحظة كتجربة مفقودة.
الحدود والأسئلة المفتوحة
الحد المركزي لهذه القاعدة من الأدلة مذكور بوضوح: لا يُبلغ أي ادعاء عن تجربة مباشرة بين LAYA ونموذج BERT-base مضبوط دقيقًا على أي مهمة تصنيف نصوص، ثنائية أو متعددة الفئات، على الجهاز أو غير ذلك. التجارب الوحيدة المُبلَّغ عنها لـ LAYA هي على مجموعات بيانات تصنيف الصور، حيث يحقق أداءً تنبؤيًا منافسًا مع إنتاج تفسيرات واعية بالعمق ذات معنى [12]. مقارنات BERT المُبلَّغ عنها هي مع مطالبة LLM بدون أمثلة وبأمثلة قليلة [1]، ومع متغير هجين كمّي لضبطه الدقيق من نفسه [2]، ومع نسخة طالب مُقطَّرة من نفسه [7]، ومع نماذج كلاسيكية غير BERT في تصحيح المقالات [9]. لا تتضمن أيٌّ من هذه المقارنات LAYA، ولا تتضمن أيٌّ من مقارنات LAYA BERT أو بيانات نصية.
يتعلق حد ثانٍ بزمن الاستجابة تحديدًا، وهو المصطلح المذكور في سؤال البحث. الأرقام الوحيدة لزمن الاستجابة في الأدلة هي: نماذج عائلة BERT المضبوطة دقيقًا تعمل بزمن استجابة أقل بمقدار رتبة إلى رتبتَي حجم من مطالبة LLM بدون أمثلة وبأمثلة قليلة على IMDB وSST-2 وAG News وDBPedia [1]، وTinyBERT 4 أسرع بـ 9.4 مرة في الاستدلال من معلّمه BERT BASE على GLUE [7]. لا يُبلغ أي ادعاء عن رقم زمن استجابة استدلال لـ LAYA على أي مجموعة بيانات، صور أو نصوص، ولا يُبلغ أي ادعاء عن رقم زمن استجابة على الجهاز (بخلاف الخادم أو المُحاكاة) لأيٍّ من BERT أو LAYA. لا يستطيع باني نظام إذن الاستشهاد برقم زمن استجابة لـ LAYA على الإطلاق، بل فقط لنماذج عائلة BERT مقابل LLM أو مقابل نسخة مُقطَّرة من نفسها.
يتعلق حد ثالث بعدم تطابق المعمارية. يُوصف LAYA ويُقيَّم كرأس إخراج مرفق بعمود فقري غير محدَّد على مجموعات بيانات تصنيف صور [12]، بينما تصف نتائج عائلة BERT الملخَّصة هنا معمارية ترميز كاملة، وهدف تدريب مسبق، ووصفة ضبط دقيق معًا [6] [5]. تبديل الرأس فقط، أي الإبقاء على ترميز BERT كعمود فقري وإرفاق مُجمِّع بأسلوب LAYA بدلًا من المصنّف الخطي [CLS]، طريقة طبيعية لسدّ هذه الفجوة، لكنها لم تُنفَّذ في أيٍّ من الادعاءات الموثَّقة، لذا فإن نتيجتها، سواء تساعد أو تضر أو لا تُحدث فرقًا مقيسًا في الدقة أو زمن الاستجابة، غير معروفة من هذه الأدلة.
يتعلق حد رابع بقابلية تكرار أي مقارنة مستقبلية. بما أن ضبط BERT دقيقًا يظل غير مستقر عبر المصادر العشوائية على مجموعات بيانات صغيرة [5]، فإن أي دراسة مستقبلية تقارن BERT وLAYA على مجموعة بيانات بحجم على الجهاز صغيرة ستحتاج إلى الإبلاغ عن نتائج عبر مصادر عشوائية متعددة، لا تشغيل واحد، لتجنب الخلط بين تباين المصدر العشوائي وفرق معماري حقيقي. وبما أن نتائج BERT الهجينة الكمومية الحالية تعتمد على محاكاة الدارات الكمومية بدلًا من الأجهزة الفعلية [2]، ينبغي التحقق من أي ادعاء بميزة حسابية من مكونات غير قياسية لمعرفة ما إذا كان قد قيس على الجهاز الهدف الفعلي أو في المحاكاة فقط. وبما أن دراسة LLM مقابل الترميز استخدمت إطارًا متعدد الأهداف قائمًا على جبهة باريتو بدلًا من رقم دقة واحد [1]، ينبغي لدراسة Laya مقابل BERT المستقبلية اعتماد نفس التبليغ متعدد المحاور، الدقة وزمن الاستجابة وتكلفة الموارد معًا، بدلًا من الإبلاغ عن الدقة وحدها واعتبار المقارنة مكتملة.
كيف يُبنى
كيف نبنيه، أو كيف نستخدمه
1. حدِّد المهمة واختر معايير تطابق سؤال البحث. اختر مهمة ثنائية واحدة ومهمة متعددة الفئات واحدة لكي تغطي المقارنة كلا النظامين المذكورين في السؤال؛ تُسمّي الأدلة IMDB وSST-2 كمعيارَي مشاعر ذي طابع ثنائي وAG News وDBPedia كمعيارَي موضوع متعدد الفئات [1]. ثبّت مجموعة التصنيفات، وتقسيم التدريب/التحقق/الاختبار، ومقياس التقييم، macro F1، ليطابق المقياس المُستخدم بالفعل في مقارنة BERT مقابل LLM حتى تكون النتائج قابلة للمقارنة مع ذلك العمل السابق [1].
2. اختر عمودًا فقريًا مشتركًا لكلا الرأسين. بما أن LAYA موثَّق كرأس إخراج يقرأ كل الطبقات المخفية لعمود فقري [12]، وبما أن مصنّف BERT نفسه يقرأ فقط تضمين [CLS] النهائي [5]، فإن الاختبار الأكثر عدلًا يُثبّت العمود الفقري، مثل مُشفِّر BERT-base قياسي مُدرَّب مسبقًا على التنبؤ بالكلمة المُقنَّعة والتنبؤ بالجملة التالية [6]، ويُرفق رأسين مختلفين به: الرأس القياسي [CLS] مع خطي [5]، ومُجمِّع بأسلوب LAYA [12].
3. طبِّق الرأس الأساسي كما هو موصوف تمامًا. أضف رمز [CLS] في بداية المُدخل، مرّره عبر مكدّس المُحوّل، خذ تضمين [CLS] من الطبقة الأخيرة، وأسقطه عبر مصنّف خطي إلى درجات فئات غير مُطبَّعة [5]. هذا هو الإعداد المرجعي؛ لا تُعدِّله، لأن أي تغيير سيجعل المقارنة غير عادلة تجاه BERT.
4. طبِّق رأس LAYA وفق حوسبته المنشورة. اجمع الحالة المخفية h_i من كل طبقة من الطبقات L للعمود الفقري المشترك. أسقِط كل h_i إلى فضاء كامن مشترك بمُهايئ خفيف الوزن g_i(.) [12]. احسب معاملات انتباه مشروطة بالمُدخل alpha_i(x) [12]، وكوِّن المجموع h_agg = sum_i alpha_i(x) g_i(h_i) [12]. احسب التنبؤ النهائي كـ y_hat = phi(W h_agg + b) [12].
لكل مُدخل x:
h_1 ... h_L = backbone(x) # حالة مخفية واحدة لكل طبقة
لكل i في 1..L:
z_i = adapter_i(h_i) # g_i(.)، فضاء كامن مشترك
alpha = attention(x, z_1..z_L) # أوزان مشروطة بالمُدخل
h_agg = sum_i alpha_i * z_i
y_hat = phi(W * h_agg + b)5. اضبط كلا الإعدادين دقيقًا على نفس البيانات بنفس المُحسِّن (optimizer) وعدد الحقب (epochs)، مع تغيير الرأس فقط. بما أن ضبط النماذج المبنية على BERT دقيقًا معروف بعدم استقراره على مجموعات بيانات صغيرة عبر المصادر العشوائية [5]، شغِّل كل إعداد، الرأس الأساسي ورأس LAYA، عبر ثلاثة أو أربعة مصادر عشوائية مختلفة على الأقل وأبلغ عن التباين، لا رقم واحد.
6. إذا كانت أي مجموعة بيانات هدف صغيرة، طبِّق خطوة التثبيت الموثَّقة قبل تشغيل الضبط الدقيق النهائي: اضبط أولًا العمود الفقري المُدرَّب مسبقًا دقيقًا على مهمة وسيطة أكبر ذات صلة، ثم اضبط دقيقًا على مجموعة البيانات الهدف الصغيرة [5]. طبِّق هذا بشكل مطابق على كلا إعدادَي الرأس حتى لا يصبح متغيرًا مربكًا.
7. قِس الدقة باستخدام macro F1 على بيانات اختبار محجوزة لكلا الإعدادين، بمطابقة المقياس المُستخدم في دراسة BERT مقابل LLM حتى تقع النتائج في نفس الإطار المرجعي [1]. أبلغ عن المتوسط والتباين عبر المصادر العشوائية من الخطوة 5.
8. قِس زمن استجابة الاستدلال لكلا الإعدادين على أجهزة الجهاز الهدف الفعلية، لا خادم أو مُحاكٍ، بما أن قاعدة الأدلة تحذّر من أن النتائج المُحاكاة، كما في الحالة الهجينة الكمومية، لا تُثبت تسريعًا حقيقيًا للأجهزة [2]. سجّل زمن الجدار الحقيقي لكل مثال بحجم دفعة (batch size) ثابت يساوي واحدًا، مطابقًا لسيناريو النشر على الجهاز في سؤال البحث.
9. قِس بصمة الذاكرة وعدد المعلمات لكلا إعدادَي الرأس المرفقين بالعمود الفقري المشترك. استخدم أرقام الضغط بأسلوب TinyBERT، 7.5 مرة أصغر و9.4 مرة أسرع لطالب من 4 طبقات مقابل BERT BASE [7]، كمقياس مرجعي لما يبدو عليه فرق حجم أو سرعة ذو دلالة، حتى يمكن الحكم على فرق LAYA مقابل الرأس الأساسي مقابل مقدار معروف.
10. أبلغ عن النتائج كمقارنة متعددة الأهداف، لا جدول دقة واحد، باتباع إطار جبهة باريتو ودالة المنفعة المُستخدم في دراسة BERT مقابل LLM [1]. ارسم الدقة مقابل زمن الاستجابة لكلا إعدادَي الرأس وأوضِح بجلاء ما إذا كان أحدهما يهيمن على الآخر أو ما إذا كانت هناك مقايضة حقيقية.
11. نقاط فشل شائعة يجب التحقق منها قبل الوثوق بالنتيجة: تأكّد أن المُهايئ g_i يُطبَّق بنفس الطريقة على كل طبقة حتى لا تُمنح أي طبقة ميزة مقياس غير عادلة [12]؛ تأكّد أن معاملات الانتباه alpha_i(x) تعتمد فعليًا على المُدخل ولا تنهار إلى ترجيح ثابت مستقل عن المُدخل، بما أن قيمة قابلية تفسير LAYA تعتمد على صحة ذلك [12]؛ وتأكّد أن التباين بين المصادر العشوائية في رأس BERT الأساسي، الموثَّق كعدم استقرار معروف [5]، لا يُخلط عن طريق الخطأ بأثر حقيقي لرأس LAYA.
12. أبلغ عن مخرجات قابلية التفسير جنبًا إلى جنب مع الدقة وزمن الاستجابة إذا استُخدم LAYA، بما أن أوزان انتباهه مُصمَّمة لتعمل بمثابة تفسير إسناد على مستوى الطبقة دون طريقة لاحقة منفصلة [12]. تحقق نوعيًا مما إذا كان نمط استخدام الطبقة يبدو مُنظَّمًا ومعتمدًا على المهمة، كما أُبلغ عنه لتصنيف الصور [12]، أو ما إذا كان يبدو موحدًا أو مشوَّشًا على مهمة النصوص، بما أن هذا لم يُختبر سابقًا وسيكون ملاحظة جديدة تُنتجها هذه التجربة.
ما الذي سنبنيه
ما الذي سنبنيه
سنبني اختبارًا مباشرًا صغيرًا ومضبوطًا: نأخذ مُشفِّر BERT-base واحدًا مُدرَّبًا مسبقًا ونرفق به رأسين، المصنّف القياسي [CLS] مع خطي [5] ومُجمِّع انتباه بأسلوب LAYA مبني من الحوسبة المنشورة، h_agg = sum_i alpha_i(x) g_i(h_i) متبوعة بـ y_hat = phi(W h_agg + b) [12]. سنضبط كلا الإعدادين دقيقًا على مهمة ثنائية واحدة، SST-2، ومهمة متعددة الفئات واحدة، AG News، بما أن كلتيهما مذكورتان في مجموعة معايير BERT مقابل LLM القائمة [1]، عبر أربعة مصادر عشوائية لكل منهما، نظرًا لعدم الاستقرار الموثَّق لضبط BERT دقيقًا على بيانات صغيرة [5].
سنحكم على النتيجة على ثلاثة محاور معًا، باتباع الإطار متعدد الأهداف المُستخدم بالفعل في مقارنات BERT مقابل LLM [1]: macro F1 على بيانات اختبار محجوزة، وزمن استجابة الاستدلال لكل مثال مقيسًا على آلة واحدة ثابتة من فئة الجهاز (حاسوب محمول بمعالج CPU، للحفاظ على إعداد قابل للتكرار دون الحاجة لأجهزة متخصصة)، وعدد المعلمات المُضافة بواسطة كل رأس. سنستخدم BERT-base المضبوط دقيقًا غير المُعدَّل برأسه القياسي كخط أساس، ونعامل أرقام ضغط TinyBERT، 7.5 مرة أصغر و9.4 مرة أسرع من BERT BASE [7]، كمقياس مرجعي لما يُعدّ فرق زمن استجابة ذا دلالة.
في غضون بضعة أسابيع، يستطيع شخصان تطبيق كلا الرأسين، وتشغيل الضبط الدقيق عبر مهمتين وأربعة مصادر عشوائية، وإنتاج رسم دقة-مقابل-زمن-استجابة واحد لكل مهمة. التكلفة متواضعة: نقطة تحقق BERT-base مُدرَّبة مسبقًا واحدة، ومجموعتا بيانات عامتان صغيرتان، وتشغيلات ضبط دقيق على CPU أو GPU واحد، دون الحاجة لمحاكاة كمومية أو استدعاءات واجهة برمجة LLM. ستكون هذه أول مقارنة مباشرة مُبلَّغ عنها بين LAYA ومصنّف BERT-base مضبوط دقيقًا على بيانات نصية، تسدّ الفجوة الدقيقة التي تحدّدها هذه الملاحظة.
الادعاءات والمراجعة
الادعاءات والمراجعة
- factمدعوم
Large language models such as GPT-4o and Claude Sonnet 4.5 have demonstrated strong capabilities in open-ended reasoning and generative language tasks.
[1] Cost-Aware Model Selection for Text Classification: Multi-Objective Trade-offs Between Fine-Tuned Encoders and LLM Prompting in Production, abstract arXiv:2602.06370v1“Large language models (LLMs) such as GPT-4o and Claude Sonnet 4.5 have demonstrated strong capabilities in open-ended reasoning and generative language tasks, leading to their widespread adoption across a broad range of NLP applications. However, for structured text classificatio…”
- methodمدعوم
The paper evaluates zero- and few-shot prompt-based large language models and fully fine-tuned encoder-only architectures across four benchmarks (IMDB, SST-2, AG News, and DBPedia), measuring macro F1, inference latency, and monetary cost.
[1] Cost-Aware Model Selection for Text Classification: Multi-Objective Trade-offs Between Fine-Tuned Encoders and LLM Prompting in Production, abstract arXiv:2602.06370v1“Large language models (LLMs) such as GPT-4o and Claude Sonnet 4.5 have demonstrated strong capabilities in open-ended reasoning and generative language tasks, leading to their widespread adoption across a broad range of NLP applications. However, for structured text classificatio…”
- resultمدعوم
Fine-tuned encoder-based models from the BERT family achieve competitive, and often superior, classification performance while operating at one to two orders of magnitude lower cost and latency compared to zero- and few-shot LLM prompting.
[1] Cost-Aware Model Selection for Text Classification: Multi-Objective Trade-offs Between Fine-Tuned Encoders and LLM Prompting in Production, abstract arXiv:2602.06370v1“Large language models (LLMs) such as GPT-4o and Claude Sonnet 4.5 have demonstrated strong capabilities in open-ended reasoning and generative language tasks, leading to their widespread adoption across a broad range of NLP applications. However, for structured text classificatio…”
- methodمدعوم
The paper frames model evaluation as a multi-objective decision problem and analyzes trade-offs using Pareto frontier projections and a parameterized utility function reflecting different deployment regimes.
[1] Cost-Aware Model Selection for Text Classification: Multi-Objective Trade-offs Between Fine-Tuned Encoders and LLM Prompting in Production, section Cost-Aware Model Selection for Text Classification: Multi-Objective Trade-offs Between Fine-Tuned Encoders and LLM Promp“We frame model evaluation as a multi-objective decision problem and analyze trade-offs using Pareto frontier projections and a parameterized utility function reflecting different deployment regimes. Our results show that fine-tuned encoder-based models from the BERT family achiev…”
- factمدعوم
Fine-tuned encoders' open-source nature enables on-premise deployment, offering advantages in privacy, data governance, and reproducibility.
[1] Cost-Aware Model Selection for Text Classification: Multi-Objective Trade-offs Between Fine-Tuned Encoders and LLM Prompting in Production, section Cost-Aware Model Selection for Text Classification: Multi-Objective Trade-offs Between Fine-Tuned Encoders and LLM Promp“We frame model evaluation as a multi-objective decision problem and analyze trade-offs using Pareto frontier projections and a parameterized utility function reflecting different deployment regimes. Our results show that fine-tuned encoder-based models from the BERT family achiev…”
- factمدعوم
For fixed-label text classification, tasks have traditionally been addressed using encoder-only architectures including BERT, RoBERTa, and DistilBERT.
[1] Cost-Aware Model Selection for Text Classification: Multi-Objective Trade-offs Between Fine-Tuned Encoders and LLM Prompting in Production, section 1. Introduction“Despite this broad success, the applicability of LLMs to structured prediction problems warrants closer examination. In fixed-label text classification—where the objective is to assign each input to one of a predefined set of categories—performance alone is rarely the sole determ…”
- factمدعوم
Fine-tuned BERT, RoBERTa, and DistilBERT models achieve strong predictive accuracy while maintaining low inference latency and modest computational footprints.
[1] Cost-Aware Model Selection for Text Classification: Multi-Objective Trade-offs Between Fine-Tuned Encoders and LLM Prompting in Production, section 1. Introduction“Despite this broad success, the applicability of LLMs to structured prediction problems warrants closer examination. In fixed-label text classification—where the objective is to assign each input to one of a predefined set of categories—performance alone is rarely the sole determ…”
- factمدعوم
LLMs generate output token by token even when producing a single class label, introducing inherent latency and usage-based costs.
[1] Cost-Aware Model Selection for Text Classification: Multi-Objective Trade-offs Between Fine-Tuned Encoders and LLM Prompting in Production, section 1. Introduction“The growing reliance on LLMs for classification thus raises an important systems-level question: under what conditions does the generality of large, prompt-driven models justify their operational overhead relative to specialized, fine-tuned encoders? Unlike discriminative encoder…”
- resultمدعوم
The proposed hybrid classical-quantum BERT model achieves performance that is competitive with, and in some cases better than, the classical baselines on standard benchmark datasets.
[2] A Hybrid Classical-Quantum Fine Tuned BERT for Text Classification, abstract arXiv:2511.17677v1“Fine-tuning BERT for text classification can be computationally challenging and requires careful hyper-parameter tuning. Recent studies have highlighted the potential of quantum algorithms to outperform conventional methods in machine learning and text classification tasks. In th…”
- methodمدعوم
The hybrid approach integrates an n-qubit quantum circuit with a classical BERT model for text classification.
[2] A Hybrid Classical-Quantum Fine Tuned BERT for Text Classification, section A Hybrid Classical-Quantum Fine Tuned BERT for Text Classification“Abu Kaisar Mohammad Masum Naveed Mahmud M. Hassan Najafi Sercan Aygun Abstract Fine-tuning BERT for text classification can be computationally challenging and requires careful hyper-parameter tuning. Recent studies have highlighted the potential of quantum algorithms to outperfor…”
- methodمدعوم
The proposed hybrid classical-quantum approach uses an n-qubit quantum circuit to fine-tune a classical BERT model.
[2] A Hybrid Classical-Quantum Fine Tuned BERT for Text Classification, section Introduction“In this work, we propose a hybrid classical-quantum approach for classifying texts. We use an nn-qubit quantum circuit to fine-tune a classical BERT model. We perform a comprehensive evaluation of the proposed method for text classification on a variety of popular datasets. The B…”
- limitationمدعوم
Current quantum hardware is not yet fault-tolerant enough to achieve actual computational speedup, so experiments are performed with quantum circuit simulations.
[2] A Hybrid Classical-Quantum Fine Tuned BERT for Text Classification, section Introduction“In this work, we propose a hybrid classical-quantum approach for classifying texts. We use an nn-qubit quantum circuit to fine-tune a classical BERT model. We perform a comprehensive evaluation of the proposed method for text classification on a variety of popular datasets. The B…”
- factمدعوم
Fine-tuning BERT for specific NLP tasks requires high computational resources and expensive inference time.
[2] A Hybrid Classical-Quantum Fine Tuned BERT for Text Classification, section Introduction“Pre-trained language models such as BERT (Bidirectional Encoder Representations from Transformers) (Devlin et al. 2018), have demonstrated exceptional performance across various language comprehension challenges (Sun et al. 2019). The BERT model effectively learns universal langu…”
- methodمدعوم
BERT generates an embedding vector contextualized through a stack of Transformer blocks for each input token, and prepends a special [CLS] token to the input sentence for classification tasks.
[5] Revisiting Few-sample BERT Fine-tuning, section 2 Background and Related Work“BERT The Bidirectional Encoder Representations from Transformers (Devlin et al., 2019, BERT;) model is a Transformer encoder (Vaswani et al., 2017) trained on raw text using masked language modeling and next-sentence prediction objectives. It generates an embedding vector context…”
- methodمدعوم
For sentence-level classification, an added linear classifier projects the [CLS] embedding to an unnormalized probability vector over the output classes.
[5] Revisiting Few-sample BERT Fine-tuning, section 2 Background and Related Work“BERT The Bidirectional Encoder Representations from Transformers (Devlin et al., 2019, BERT;) model is a Transformer encoder (Vaswani et al., 2017) trained on raw text using masked language modeling and next-sentence prediction objectives. It generates an embedding vector context…”
- factمدعوم
Fine-tuning BERT remains unstable, especially when using BERTLarge on small datasets, where identical learning processes with different random seeds often result in significantly different models.
[5] Revisiting Few-sample BERT Fine-tuning, section 1 Introduction“Fine-tuning self-supervised pre-trained models has significantly boosted state-of-the-art performance on natural language processing (NLP) tasks (Liu, 2019; Yang et al., 2019a; Wadden et al., 2019; Zhu et al., 2020; Guu et al., 2020). One of the most effective models for this pro…”
- factمدعوم
Fine-tuning the pre-trained BERT model on a large intermediate task stabilizes later fine-tuning on small datasets.
[5] Revisiting Few-sample BERT Fine-tuning, section 2 Background and Related Work“Existing work (Phang et al., 2018; Lee et al., 2020; Dodge et al., 2020) shows that these seemingly benign factors can influence the results significantly, especially on small datasets (i.e., << 10K examples). Consequently, practitioners often conduct many random trials of fine-t…”
- factمدعوم
Factors causing instability in few-sample BERT fine-tuning include: the use of a non-standard optimization method with biased gradient estimation, limited applicability of parts of the BERT network, and the use of a pre-determined small number of training iterations.
[5] Revisiting Few-sample BERT Fine-tuning, abstract arXiv:2006.05987v3“This paper is a study of fine-tuning of BERT contextual representations, with focus on commonly observed instabilities in few-sample scenarios. We identify several factors that cause this instability: the common use of a non-standard optimization method with biased gradient estim…”
- factمدعوم
BERT is based on a multi-layer bidirectional Transformer and is trained on plain text for masked word prediction and next sentence prediction tasks.
[6] How to Fine-Tune BERT for Text Classification?, section 1 Introduction“Another kind of pre-training models is sentence-level. Howard and Ruder (2018) propose ULMFiT, a fine-tuning method for pre-trained language model that achieves state-of-the-art results on six widely studied text classification datasets. More recently, pre-trained language models…”
- factمدعوم
BERT is the first fine-tuning based representation model that achieves state-of-the-art results for a range of NLP tasks.
[6] How to Fine-Tune BERT for Text Classification?, section 2.1 Language Model Pre-training“More recently, the method of pre-training language models on a large network with a large amount of unlabeled data and fine-tuning in downstream tasks has made a breakthrough in several natural language understanding tasks, such as OpenAI GPT Radford et al. (2018) and BERT Devlin…”
- resultمدعوم
Fine-tuning BERT produces similar performance to classical models at significant additional cost in automated essay scoring.
[9] Should You Fine-Tune BERT for Automated Essay Scoring?, abstract DOI 10.18653/v1/2020.bea-1.15“Most natural language processing research now recommends large Transformer-based models with fine-tuning for supervised classification tasks; older strategies like bag-ofwords features and linear models have fallen out of favor.Here we investigate whether, in automated essay scor…”
- resultمدعوم
TinyBERT 4 with 4 layers achieves more than 96.8% the performance of its teacher BERT BASE on GLUE benchmark, while being 7.5x smaller and 9.4x faster on inference.
[7] TinyBERT: Distilling BERT for Natural Language Understanding, abstract DOI 10.18653/v1/2020.findings-emnlp.372“Language model pre-training, such as BERT, has significantly improved the performances of many natural language processing tasks.However, pre-trained language models are usually computationally expensive, so it is difficult to efficiently execute them on resourcerestricted device…”
- resultمدعوم
TinyBERT 6 with 6 layers performs on-par with its teacher BERT BASE.
[7] TinyBERT: Distilling BERT for Natural Language Understanding, abstract DOI 10.18653/v1/2020.findings-emnlp.372“Language model pre-training, such as BERT, has significantly improved the performances of many natural language processing tasks.However, pre-trained language models are usually computationally expensive, so it is difficult to efficiently execute them on resourcerestricted device…”
- factمدعوم
Transformer layers are linear in the input dimensionality and quadratic in the input length.
[10] How Crucial is Transformer in Decision Transformer?, section 2 Background“Recently Transformers [27] have become predominant in natural language processing and sequence modeling. Transformer is an architecture for auto-regressive sequence modeling that is purely based on the attention mechanism and does not contain any recurrent or convolutional struct…”
- factمدعوم
Recurrent networks scale linearly in the input length and quadratically in the input dimensionality.
[10] How Crucial is Transformer in Decision Transformer?, section 2 Background“Recently Transformers [27] have become predominant in natural language processing and sequence modeling. Transformer is an architecture for auto-regressive sequence modeling that is purely based on the attention mechanism and does not contain any recurrent or convolutional struct…”
- factمدعوم
LAYA (Layer-wise Attention Aggregator) is a novel output head that dynamically aggregates internal representations through attention.
[12] LAYA: Layer-wise Attention Aggregation for Interpretable Depth-Aware Neural Networks, abstract arXiv:2511.12723v2“Deep neural networks typically rely on the representation produced by their final hidden layer to make predictions, implicitly assuming that this single vector fully captures the semantics encoded across all preceding transformations. However, intermediate layers contain rich and…”
- methodمدعوم
LAYA learns input-conditioned attention weights over layer-wise features.
[12] LAYA: Layer-wise Attention Aggregation for Interpretable Depth-Aware Neural Networks, abstract arXiv:2511.12723v2“Deep neural networks typically rely on the representation produced by their final hidden layer to make predictions, implicitly assuming that this single vector fully captures the semantics encoded across all preceding transformations. However, intermediate layers contain rich and…”
- methodمدعوم
LAYA provides intrinsic layer-attribution scores that explicitly quantify the contribution of each representation to the final decision without external post-hoc explanation methods.
[12] LAYA: Layer-wise Attention Aggregation for Interpretable Depth-Aware Neural Networks, abstract arXiv:2511.12723v2“Deep neural networks typically rely on the representation produced by their final hidden layer to make predictions, implicitly assuming that this single vector fully captures the semantics encoded across all preceding transformations. However, intermediate layers contain rich and…”
- resultمدعوم
Experiments on image classification datasets show that LAYA achieves competitive predictive performance while producing meaningful depth-aware explanations.
[12] LAYA: Layer-wise Attention Aggregation for Interpretable Depth-Aware Neural Networks, abstract arXiv:2511.12723v2“Deep neural networks typically rely on the representation produced by their final hidden layer to make predictions, implicitly assuming that this single vector fully captures the semantics encoded across all preceding transformations. However, intermediate layers contain rich and…”
- factمدعوم
Most architectures ultimately derive their predictions exclusively from the representation produced by the last hidden layer.
[12] LAYA: Layer-wise Attention Aggregation for Interpretable Depth-Aware Neural Networks, section 1 Introduction“The remarkable success of deep neural networks in computer vision is largely attributable to their ability to learn hierarchical representations, progressively transforming raw visual inputs into increasingly abstract representations. Yet, despite differences in architecture and …”
- factمدعوم
Decision Transformer is an offline RL algorithm that auto-regressively models trajectories using the GPT-2 architecture.
[10] How Crucial is Transformer in Decision Transformer?, section 1 Introduction“Transformers [27] have shown impressive results across a number of problem domains in Natural Language Processing [5, 17, 3] and Computer Vision [6, 13]. Inspired by these results, [4, 11] framed Reinforcement Learning (RL) as a sequence modeling problem, in which Transformer pre…”
- resultمدعوم
Decision Transformer struggles with continuous control problems such as inverted pendulum and Furuta pendulum stabilization.
[10] How Crucial is Transformer in Decision Transformer?, abstract arXiv:2211.14655v1“Decision Transformer (DT) is a recently proposed architecture for Reinforcement Learning that frames the decision-making process as an auto-regressive sequence modeling problem and uses a Transformer model to predict the next action in a sequence of states, actions, and rewards. …”
- resultمدعوم
Decision LSTM is able to achieve expert-level performance on inverted pendulum and Furuta pendulum stabilization tasks.
[10] How Crucial is Transformer in Decision Transformer?, abstract arXiv:2211.14655v1“Decision Transformer (DT) is a recently proposed architecture for Reinforcement Learning that frames the decision-making process as an auto-regressive sequence modeling problem and uses a Transformer model to predict the next action in a sequence of states, actions, and rewards. …”
- factمدعوم
LAY A (Layer-wise Attention Aggregator) is a lightweight output module that learns to weight and combine all hidden representations in an input-dependent way.
[12] LAYA: Layer-wise Attention Aggregation for Interpretable Depth-Aware Neural Networks, section 1 Introduction“This work revisits the role of the output stage of deep neural networks. The central idea is that the output layer should not depend exclusively on the deepest representation, but should instead integrate information across depth while simultaneously exposing how different abstra…”
- methodمدعوم
LAY A replaces the standard classifier head with an attention-based aggregator: h_agg = sum_{i=1}^{L} alpha_i(x) g_i(h_i), where alpha_i(x) are learnable, input-conditioned coefficients.
[12] LAYA: Layer-wise Attention Aggregation for Interpretable Depth-Aware Neural Networks, section 1 Introduction“This work revisits the role of the output stage of deep neural networks. The central idea is that the output layer should not depend exclusively on the deepest representation, but should instead integrate information across depth while simultaneously exposing how different abstra…”
- methodمدعوم
Each hidden state in LAY A is mapped into a shared latent space through a lightweight adapter g_i(.), ensuring comparability across layers.
[12] LAYA: Layer-wise Attention Aggregation for Interpretable Depth-Aware Neural Networks, section 1 Introduction“This work revisits the role of the output stage of deep neural networks. The central idea is that the output layer should not depend exclusively on the deepest representation, but should instead integrate information across depth while simultaneously exposing how different abstra…”
- methodمدعوم
The final prediction in LAY A is computed as y_hat = phi(W h_agg + b).
[12] LAYA: Layer-wise Attention Aggregation for Interpretable Depth-Aware Neural Networks, section 1 Introduction“This work revisits the role of the output stage of deep neural networks. The central idea is that the output layer should not depend exclusively on the deepest representation, but should instead integrate information across depth while simultaneously exposing how different abstra…”
- resultمدعوم
Quantitative and qualitative interpretability analyses demonstrate that LAY A's attention scores closely reflect the actual contribution of individual layers.
[12] LAYA: Layer-wise Attention Aggregation for Interpretable Depth-Aware Neural Networks, section LAYA: Layer-wise Attention Aggregation for Interpretable Depth-Aware Neural Networks“Furthermore, quantitative and qualitative interpretability analyses demonstrate that LAYA’s attention scores closely reflect the actual contribution of individual layers, revealing structured, task-dependent patterns of depth utilization while providing intuitive explanations of …”
- resultمدعوم
LAY A reveals structured, task-dependent patterns of depth utilization while providing intuitive explanations of how different abstraction levels contribute to each prediction.
[12] LAYA: Layer-wise Attention Aggregation for Interpretable Depth-Aware Neural Networks, section LAYA: Layer-wise Attention Aggregation for Interpretable Depth-Aware Neural Networks“Furthermore, quantitative and qualitative interpretability analyses demonstrate that LAYA’s attention scores closely reflect the actual contribution of individual layers, revealing structured, task-dependent patterns of depth utilization while providing intuitive explanations of …”
- factمدعوم
Empirical and theoretical studies suggest that different layers capture distinct and complementary aspects of the input: early layers encode local patterns, middle layers capture structural relations, and deeper layers represent increasingly abstract semantics.
[12] LAYA: Layer-wise Attention Aggregation for Interpretable Depth-Aware Neural Networks, section 1 Introduction“However, empirical and theoretical studies suggest that different layers capture distinct and complementary aspects of the input: early layers encode local patterns, middle layers capture structural relations, and deeper layers represent increasingly abstract semantics (e.g., (Ba…”
المصادر
المصادر
- [1]Alberto Andres Valdes Gonzalez. Cost-Aware Model Selection for Text Classification: Multi-Objective Trade-offs Between Fine-Tuned Encoders and LLM Prompting in Production. arXiv, 2026.
- [2]Abu Kaisar Mohammad Masum, Naveed Mahmud, M. Hassan Najafi, Sercan Aygun. A Hybrid Classical-Quantum Fine Tuned BERT for Text Classification. arXiv, 2025.
- [3]Ji Xin, Raphael Tang, Yaoliang Yu, Jimmy Lin. BERxiT: Early Exiting for BERT with Better Fine-Tuning and Extension to Regression, 2021.
- [4]Dhendy Zaki Ridwan, Panji Peksi Brajangan. Vibration-Based Operational State Classification of Wheel Loaders: A Feasibility Study Using Decision Tree and Time-Frequency Features. 2025 2nd Beyond Technology Summit on Informatics International Conference (BTS-I2C), 2025.
- [5]Tianyi Zhang, Felix Wu, Arzoo Katiyar, Kilian Q. Weinberger, Yoav Artzi. Revisiting Few-sample BERT Fine-tuning. arXiv, 2020.
- [6]Chi Sun, Xipeng Qiu, Yige Xu, Xuanjing Huang. How to Fine-Tune BERT for Text Classification?. arXiv, 2019.
- [7]Xiaoqi Jiao, Yichun Yin, Lifeng Shang, Xin Ran Jiang, Xiao Dong Chen, Linlin Li. TinyBERT: Distilling BERT for Natural Language Understanding, 2020.
- [8]Xinjie Lin, Gang Xiong, Gaopeng Gou, Zhen Li, Junzheng Shi, Jing Hua Yu. ET-BERT: A Contextualized Datagram Representation with Pre-training Transformers for Encrypted Traffic Classification. Proceedings of the ACM Web Conference 2022, 2022.
- [9]Elijah Mayfield, Alan W. Black. Should You Fine-Tune BERT for Automated Essay Scoring?, 2020.
- [10]Max Siebenborn, Boris Belousov, Junning Huang, Jan Peters. How Crucial is Transformer in Decision Transformer?. arXiv, 2022.
- [11]Xiaoqi Jiao, Yichun Yin, Lifeng Shang, Xin Ran Jiang, Xiao Chen, Linlin Li. TinyBERT: Distilling BERT for Natural Language Understanding. arXiv (Cornell University), 2019.
- [12]Gennaro Vessio. LAYA: Layer-wise Attention Aggregation for Interpretable Depth-Aware Neural Networks. arXiv, 2025.
- [13]Shital Dupare, Prof. Jayant Adhikari. A Survey on Flood Predication and Classification using Machine learning. Zenodo (CERN European Organization for Nuclear Research), 2023.
- [14]Magdalena Rybicka, J. Villalba, N. Dehak, K. Kowalczyk. End-to-End Neural Speaker Diarization with an Iterative Refinement of Non-Autoregressive Attention-based Attractors. Interspeech, 2022.
- [15]Sergey S. Averyanov, Andrey S. Trofimov. Analysing Non-Ensemble Machine Learning Methods for Solving the Transient Classification Problem. Educational Data Mining, 2025.
- [16]Sajith Ranatunga, Rune Strand Ødegård, Knut Jetlund, Bjørn Arild Godager, C. Storie, J. Storie. From remote sensing to decision-making: a web-based platform for near-real-time land cover classification. International Journal of Digital Earth, 2026.
- [17]Jiatao Gu, Xiang Kong. Fully Non-autoregressive Neural Machine Translation: Tricks of the Trade, 2021.
- [18]Yakoub Bazi, Laila Bashmal, Mohamad Mahmoud Al Rahhal, Reham Al-Dayil, Naif Al Ajlan. Vision Transformers for Remote Sensing Image Classification. Remote Sensing, 2021.
- [19]Ce Zhou, Qian Li, Chen Li, Jun Yu, Yixin Liu, Guangjing Wang. A Comprehensive Survey on Pretrained Foundation Models: A History from BERT to ChatGPT. arXiv (Cornell University), 2023.
- [20]Zhuoyan Li, Hangxiao Zhu, Zhuoran Lu, Ming Yin. Synthetic Data Generation with Large Language Models for Text Classification: Potential and Limitations, 2023.