note de recherche

Décisions typées non autorégressives : comment Laya se compare-t-il à BERT pour la classification embarquée ?

Non-Autoregressive Typed Decisions: How Does Laya Compare to BERT for On-Device Classification?

publié
lecture
29 min · 4,899 mots
Registre des affirmations
40/40 affirmations vérifiées · 20 sources

Éditions: English · عربي · Español

Réponse directe

Les affirmations vérifiées n'incluent aucune expérience comparant Laya (LAYA, l'agrégateur d'attention par couche) à un modèle BERT-base affiné sur une même tâche de classification binaire ou multi-classes avec des mesures de latence et de précision appariées. Aucune réponse directe à la question de comparaison n'existe donc dans les preuves. Ce que montrent ces affirmations, séparément, c'est que LAYA est une tête de sortie légère évaluée sur des jeux de données de classification d'images, où elle atteint des performances prédictives compétitives et fournit des explications sensibles à la profondeur [12], tandis que BERT affiné et sa famille (RoBERTa, DistilBERT) sont documentés comme des classifieurs solides, à faible latence et faible coût sur des benchmarks textuels, comparés au prompting par LLM, non à LAYA [1]. Étant donné que la propre comparaison rapportée de LAYA porte sur d'autres têtes de sortie sur des tâches d'images, et que les comparaisons rapportées de BERT portent sur le prompting par LLM et sur des versions distillées ou hybrides quantiques de lui-même, un développeur ne peut pas déduire de ces affirmations lequel l'emporterait sur un benchmark de classification textuelle embarquée. Quiconque a besoin de cette réponse doit effectuer lui-même le test comparatif ; cette note expose comment, en utilisant les mécanismes, les chiffres et les coûts que les sources rapportent pour chaque côté séparément.

Pourquoi cette question est importante pour la classification embarquée

La classification de texte avec un ensemble fixe d'étiquettes, comme le sentiment (binaire) ou le sujet (multi-classes), est traditionnellement résolue avec des architectures encodeur seul, notamment BERT, RoBERTa et DistilBERT [1]. Ces modèles atteignent une forte précision prédictive tout en maintenant une faible latence d'inférence et une empreinte de calcul modeste [1]. Le déploiement embarqué ajoute des contraintes que n'a pas le déploiement serveur : mémoire limitée, calcul limité et une exigence stricte de latence par inférence. C'est pourquoi toute affirmation d'une alternative moins chère ou plus rapide à BERT mérite un examen attentif avant d'être adoptée pour un usage embarqué, et pourquoi une étude qui mesure réellement la latence et le coût parallèlement à la précision est plus utile pour un développeur qu'une étude qui ne rapporte que la précision.

Les grands modèles de langage tels que GPT-4o et Claude Sonnet 4.5 ont démontré de fortes capacités en raisonnement ouvert et en tâches génératives de langage [1]. Mais les LLM génèrent la sortie jeton par jeton, même lorsqu'ils produisent une seule étiquette de classe, ce qui introduit une latence inhérente et des coûts basés sur l'usage [1]. Une étude évaluant les LLM par prompting zero- et few-shot par rapport à des architectures encodeur seul entièrement affinées sur quatre benchmarks (IMDB, SST-2, AG News et DBPedia), mesurant le macro F1, la latence d'inférence et le coût monétaire, a constaté que les modèles encodeur de la famille BERT, affinés, atteignent des performances compétitives, et souvent supérieures, tout en opérant avec un coût et une latence inférieurs d'un à deux ordres de grandeur par rapport au prompting par LLM zero- et few-shot [1]. Cela établit les modèles de la famille BERT comme la référence pratique pour la classification embarquée ou sensible au coût, et non le LLM, et constitue le point de référence que cette note utilise lorsqu'elle discute de ce qu'une éventuelle alternative à BERT devrait surpasser.

Séparément, un autre axe de travail se demande si la pratique standard consistant à prendre une prédiction uniquement de la dernière couche cachée est le bon choix de conception pour un classifieur neuronal. La plupart des architectures dérivent finalement leurs prédictions exclusivement de la représentation produite par la dernière couche cachée [12]. Des études empiriques et théoriques suggèrent que différentes couches capturent des aspects distincts et complémentaires de l'entrée : les premières couches encodent les motifs locaux, les couches intermédiaires capturent les relations structurelles, et les couches plus profondes représentent des sémantiques de plus en plus abstraites [12]. LAYA (Layer-wise Attention Aggregator) est une nouvelle tête de sortie qui agrège dynamiquement les représentations internes via l'attention, conçue pour tirer parti de cette observation au lieu de la jeter [12].

La question pratique d'un développeur est de savoir si remplacer une tête de classifieur standard par quelque chose comme LAYA, ou remplacer un LLM complet par un BERT affiné, donne un meilleur compromis précision par milliseconde sur un téléphone ou une puce embarquée. Les preuves rassemblées ici répondent directement à la deuxième question et ne répondent pas à la première pour la classification de texte, car LAYA n'a été testé que sur des jeux de données d'images [12]. Le reste de cette note traite ces deux éléments comme deux corpus de preuves distincts et bien étayés, décrit le mécanisme et les chiffres rapportés pour chacun, et est explicite tout au long de là où ils ne se rencontrent pas, afin qu'un développeur qui souhaite la comparaison manquante sache exactement quelle expérience réaliser et ce qu'il faudrait contrôler. Une étude qui présente l'évaluation de modèle comme un problème de décision multi-objectif et analyse les compromis à l'aide de projections de frontière de Pareto et d'une fonction d'utilité paramétrée reflétant différents régimes de déploiement offre la bonne perspective pour ce type de comparaison une fois la mesure manquante comblée [1].

Ce qu'est BERT et ce qu'est LAYA

BERT est basé sur un Transformer bidirectionnel multicouche et entraîné sur du texte brut pour des tâches de prédiction de mots masqués et de prédiction de phrases suivantes [6]. C'est le premier modèle de représentation par affinage qui atteint des résultats de pointe pour une série de tâches de TALN [6]. Cela signifie que BERT est pré-entraîné une fois sur de grands textes non étiquetés en utilisant deux objectifs auto-supervisés, et les mêmes poids pré-entraînés sont ensuite adaptés, ou affinés, à de nombreuses tâches aval différentes avec relativement peu de données étiquetées. Cette recette en deux étapes, pré-entraînement puis affinage, est la raison pour laquelle BERT et ses descendants sont le choix par défaut pour la classification de texte à étiquettes fixes, plutôt qu'un modèle entraîné de zéro pour chaque tâche.

Mécaniquement, BERT génère un vecteur d'incorporation contextualisé à travers une pile de blocs Transformer pour chaque jeton d'entrée, et ajoute un jeton spécial [CLS] au début de la phrase d'entrée pour les tâches de classification [5]. Pour la classification au niveau de la phrase, un classifieur linéaire ajouté projette l'incorporation [CLS] en un vecteur de probabilités non normalisées sur les classes de sortie [5]. C'est la tête de classification standard : une seule couche linéaire apprise placée au-dessus de la sortie du dernier bloc Transformer pour un jeton désigné, suivie d'une étape de normalisation qui transforme les scores non normalisés en probabilités de classe. L'ensemble de la pile, encodeur plus tête linéaire, est entraîné de bout en bout lors de l'affinage, c'est pourquoi affiner BERT pour une nouvelle tâche nécessite de mettre à jour tous ses paramètres, sauf si une variante efficace en paramètres est utilisée.

LAYA adopte une vision différente de ce que la tête doit regarder. LAYA (Layer-wise Attention Aggregator) est un module de sortie léger qui apprend à pondérer et combiner toutes les représentations cachées d'une manière dépendante de l'entrée [12]. LAYA apprend des poids d'attention conditionnés par l'entrée sur les caractéristiques par couche [12]. Au lieu que la tête ne lise que la dernière couche cachée, comme le fait le classifieur basé sur [CLS] de BERT, la tête de LAYA lit chaque couche cachée produite par le réseau de base et laisse un mécanisme d'attention décider, pour chaque entrée individuelle, quel poids accorder à la représentation de chaque couche. LAYA fournit des scores d'attribution par couche intrinsèques qui quantifient explicitement la contribution de chaque représentation à la décision finale sans méthodes d'explication post-hoc externes [12], ce qui signifie que les poids d'attention eux-mêmes font office d'explication des profondeurs du réseau qui ont compté pour une prédiction donnée, sans outil d'interprétabilité séparé requis.

Les deux conceptions diffèrent donc exactement au point où une décision de classification est prise. La tête du classifieur de BERT est fixe et lit une seule représentation finale, l'incorporation [CLS] après le dernier bloc Transformer [5]. La tête de LAYA est elle-même un petit module d'attention entraînable qui lit toutes les représentations intermédiaires et produit une pondération par entrée et par couche avant de faire la prédiction finale [12]. Les deux approches se situent au-dessus d'un squelette d'extraction de caractéristiques, un encodeur dans le cas de BERT, et la description de LAYA dans la source ne spécifie pas de squelette d'encodeur de texte ; les expériences rapportées utilisent des jeux de données de classification d'images [12]. Cette distinction, squelette versus tête, est la raison pour laquelle une comparaison équitable de Laya et BERT pour la classification de texte devrait spécifier exactement sur quel squelette l'agrégateur de LAYA se place avant que des chiffres de précision ou de latence puissent être comparés. Cela signifie également que décrire LAYA comme un concurrent de BERT n'est qu'en partie exact : LAYA remplace la tête de classification, tandis que BERT est généralement décrit et évalué comme un encodeur complet plus tête, donc un test équitable devrait maintenir le squelette fixe et n'échanger que la tête, ou indiquer clairement que l'architecture entière, squelette compris, est échangée.

Le mécanisme interne de LAYA : agrégation, adaptateurs et prédiction

Le calcul interne de LAYA est décrit avec suffisamment de précision dans la source pour être reproduit. LAYA remplace la tête de classifieur standard par un agrégateur basé sur l'attention : h_agg = sum_{i=1}^{L} alpha_i(x) g_i(h_i), où alpha_i(x) sont des coefficients appris et conditionnés par l'entrée [12]. En termes simples, le squelette produit L représentations cachées, une par couche, et au lieu de ne conserver que la dernière, LAYA calcule une somme pondérée de toutes, où le poids donné à chaque couche dépend de l'entrée spécifique x actuellement traitée, et non d'un programme fixe indépendant de l'entrée. C'est l'affirmation structurelle centrale de la méthode : la pondération est fonction de l'entrée, donc deux entrées différentes passant par le même réseau entraîné peuvent finir par s'appuyer sur différentes profondeurs de représentation.

Avant que la somme pondérée ne soit calculée, la représentation de chaque couche est mise sur un pied d'égalité. Chaque état caché dans LAYA est projeté dans un espace latent partagé via un adaptateur léger g_i(.), garantissant la comparabilité entre couches [12]. Cette étape d'adaptateur est importante car les états cachés de différentes profondeurs d'un réseau peuvent différer en échelle, dimensionnalité ou granularité sémantique, et les additionner directement sans d'abord les projeter dans un espace partagé pourrait laisser une couche dominer l'agrégat pour des raisons sans rapport avec l'utilité réelle de sa représentation. L'adaptateur léger est décrit comme petit, ce qui maintient le surcoût total en paramètres et calcul de LAYA faible par rapport au squelette sur lequel il repose, bien que la source ne donne pas un nombre exact de paramètres ni une formule pour la taille de l'adaptateur par rapport à la dimension cachée du squelette.

La phase de sortie est une simple étape linéaire plus non-linéarité appliquée à la représentation agrégée. La prédiction finale dans LAYA est calculée comme y_hat = phi(W h_agg + b) [12]. C'est structurellement similaire à la propre tête de classification de BERT, une projection linéaire suivie d'une non-linéarité, avec la différence clé étant ce qui est alimenté dans cette couche linéaire : BERT alimente l'incorporation [CLS] unique de la dernière couche [5], tandis que LAYA alimente la combinaison agrégée par attention des représentations adaptées de toutes les couches [12]. Les mécanismes supplémentaires dans LAYA, par rapport à une tête standard, sont donc l'adaptateur par couche g_i et les poids d'attention conditionnés par l'entrée alpha_i(x) ; tout le reste de la façon dont le score de classe final est produit est un classifieur linéaire conventionnel avec une non-linéarité phi appliquée à la fin.

Parce que les poids d'attention alpha_i(x) sont appris et dépendent de l'entrée, ils peuvent être inspectés après entraînement pour voir sur quelles couches le modèle s'est appuyé pour quels types d'entrées, et la source traite cela comme une fonctionnalité de premier ordre plutôt qu'un effet secondaire. Des analyses d'interprétabilité quantitatives et qualitatives démontrent que les scores d'attention de LAYA reflètent étroitement la contribution réelle des couches individuelles [12]. LAYA révèle des motifs structurés et dépendants de la tâche d'utilisation de la profondeur tout en fournissant des explications intuitives de la manière dont différents niveaux d'abstraction contribuent à chaque prédiction [12]. Pour un développeur, cela signifie qu'adopter LAYA comme tête de classifieur n'est pas purement une décision de précision ou de latence ; cela offre également une explication intégrée, par prédiction, des profondeurs du réseau qui ont conduit la décision, au coût des paramètres supplémentaires d'adaptateur et d'attention décrits ci-dessus. Aucun de ces mécanismes n'a été décrit ou mesuré pour un squelette d'encodeur de texte dans les preuves rassemblées ici, donc l'appliquer à une pile de blocs Transformer de style BERT serait une extension directe et raisonnable à tester, pas quelque chose déjà rapporté.

Ce qui a été mesuré pour les modèles de la famille BERT, et ce qui n'a pas été mesuré pour LAYA sur du texte

La comparaison quantitative la plus claire disponible dans les preuves est entre les encodeurs affinés de la famille BERT et le prompting par LLM, pas entre BERT et LAYA. L'étude pertinente a mesuré le macro F1, la latence d'inférence et le coût monétaire sur quatre benchmarks (IMDB, SST-2, AG News et DBPedia), comparant les LLM par prompting zero- et few-shot tels que GPT-4o et Claude Sonnet 4.5 à des architectures encodeur seul entièrement affinées [1]. Le résultat était que les modèles encodeur de la famille BERT affinés atteignent des performances compétitives, et souvent supérieures, tout en opérant avec un coût et une latence inférieurs d'un à deux ordres de grandeur par rapport au prompting par LLM zero- et few-shot [1]. Le même article présente l'évaluation de modèle comme un problème de décision multi-objectif et analyse les compromis à l'aide de projections de frontière de Pareto et d'une fonction d'utilité paramétrée reflétant différents régimes de déploiement [1], ce qui est un point méthodologique qu'un développeur peut réutiliser : la précision seule n'est pas la bonne perspective lorsque la latence et le coût diffèrent par ordres de grandeur entre les candidats. Cette méthodologie, pas les chiffres spécifiques, est la partie qui se transfère bien à une étude Laya contre BERT, car elle donne un modèle pour rapporter trois axes ensemble plutôt que la précision isolément.

D'autres sources ajoutent d'autres chiffres séparés sur les variantes de BERT sans les comparer à LAYA. TinyBERT 4 avec 4 couches atteint plus de 96.8% de la performance de son enseignant BERT BASE sur le benchmark GLUE, tout en étant 7.5 fois plus petit et 9.4 fois plus rapide à l'inférence [7]. TinyBERT 6 avec 6 couches offre des performances comparables à son enseignant BERT BASE [7]. Ces chiffres décrivent la distillation, comprimant BERT BASE en un modèle étudiant plus petit, et établissent que la précision de BERT peut être préservée à une fraction de sa taille et de sa latence grâce à la compression architecturale, ce qui est directement pertinent pour le déploiement embarqué même si cela ne dit rien sur LAYA. Un développeur qui souhaite un budget taille-latence pour le côté BERT d'une comparaison a, dans ces chiffres, deux points de référence concrets déjà mesurés sur GLUE : un étudiant 4 couches 7.5 fois plus petit et 9.4 fois plus rapide avec plus de 96.8% de la performance de l'enseignant, et un étudiant 6 couches avec des performances comparables.

L'affinage de BERT pour des tâches de TALN spécifiques nécessite des ressources de calcul élevées et un temps d'inférence coûteux [2], un coût qui a motivé une approche hybride classique-quantique : le modèle BERT hybride classique-quantique proposé intègre un circuit quantique à n-qubits avec un modèle BERT classique pour la classification de texte [2], en utilisant le circuit quantique pour affiner le modèle classique [2]. Le modèle BERT hybride classique-quantique proposé atteint des performances compétitives, et dans certains cas meilleures, que les bases classiques sur des jeux de données de référence standard [2]. Cependant, le matériel quantique actuel n'est pas encore suffisamment tolérant aux pannes pour obtenir un véritable gain de calcul, donc les expériences sont réalisées avec des simulations de circuits quantiques [2], ce qui signifie que la compétitivité rapportée concerne la précision, non un avantage démontré en latence ou en coût par rapport à l'affinage classique de BERT ; la simulation s'exécute sur du matériel classique, donc aucun chiffre de latence embarquée n'est non plus disponible de cette comparaison.

La propre mesure rapportée de LAYA porte sur un domaine complètement différent. Les expériences sur des jeux de données de classification d'images montrent que LAYA atteint des performances prédictives compétitives tout en produisant des explications significatives et sensibles à la profondeur [12]. Aucun benchmark n'est nommé, aucun chiffre de précision n'est donné, et aucune tâche de classification de texte n'est impliquée dans cette mesure ; l'affirmation indique seulement que les performances sont compétitives et que les explications sont significatives, sur des données d'image. Parce qu'aucune des sources ne rapporte le macro F1, la latence ou le coût de LAYA sur IMDB, SST-2, AG News, DBPedia ou tout autre benchmark de classification de texte, et parce qu'aucune des sources n'exécute BERT et LAYA sur la même tâche avec le même protocole de mesure, il n'y a aucun chiffre partagé dans les preuves qui permettrait à un lecteur de placer LAYA et BERT sur la même frontière de Pareto pour la classification de texte. Cette lacune est le résultat central de cette note : non pas que LAYA perde ou gagne, mais que la comparaison n'a pas été mesurée, et toute affirmation contraire irait au-delà de ce que disent les sources.

Instabilité, coût d'affinage et autres compromis documentés de BERT

Un développeur choisissant entre BERT et une tête ou architecture alternative doit également connaître les modes de défaillance spécifiques à l'affinage de BERT, indépendamment de la comparaison avec LAYA. L'affinage de BERT reste instable, en particulier lors de l'utilisation de BERTLarge sur de petits jeux de données, où des processus d'apprentissage identiques avec des graines aléatoires différentes donnent souvent des modèles significativement différents [5]. Cela signifie que les chiffres de précision rapportés pour un seul affinage de BERT peuvent être trompeurs à moins que l'affinage n'ait été répété sur plusieurs graines, car deux exécutions de la même configuration peuvent aboutir à des niveaux de précision significativement différents uniquement en raison du caractère aléatoire de l'initialisation ou de l'ordre des données. C'est un avertissement méthodologique direct pour quiconque conçoit une étude comparative : un chiffre de précision mono-graine pour une baseline BERT ne suffit pas pour tirer une conclusion contre une méthode concurrente telle que LAYA.

La même source identifie des causes concrètes de cette instabilité et une atténuation documentée. Les facteurs contribuant à l'instabilité de l'affinage de BERT sur peu d'échantillons incluent : l'utilisation d'une méthode d'optimisation non standard avec une estimation biaisée du gradient, l'applicabilité limitée de certaines parties du réseau BERT, et l'utilisation d'un petit nombre prédéterminé d'itérations d'entraînement [5]. L'affinage du modèle BERT pré-entraîné sur une grande tâche intermédiaire stabilise l'affinage ultérieur sur de petits jeux de données [5]. Pour un développeur travaillant avec un petit jeu de données de classification embarquée, cela donne une recette spécifique et exploitable : affiner d'abord sur une tâche intermédiaire plus grande et connexe avant d'affiner sur le petit jeu de données cible, plutôt que d'affiner directement sur le petit jeu de données à partir du point de contrôle pré-entraîné de base.

Le coût est un thème récurrent dans plusieurs sources indépendantes, pas seulement la comparaison LLM contre encodeur. L'affinage de BERT produit des performances similaires aux modèles classiques à un coût supplémentaire significatif dans la notation automatique d'essais [9]. C'est un résultat spécifique à un domaine, la notation d'essais, mais il renforce le schéma général observé dans la comparaison du prompting par LLM [1] et la motivation hybride quantique [2] : la précision de BERT est souvent égalée par des alternatives moins chères, et la décision d'utiliser BERT devrait peser ce coût supplémentaire par rapport au gain de précision, tâche par tâche, plutôt que de supposer que BERT vaut toujours son coût.

Enfin, il existe un argument structurel sur pourquoi les architectures d'encodeur telles que BERT pourraient ou non être la bonne forme computationnelle pour une tâche donnée, indépendamment de la précision. Les couches Transformer sont linéaires dans la dimensionnalité d'entrée et quadratiques dans la longueur d'entrée [10]. Les réseaux récurrents sont linéaires dans la longueur d'entrée et quadratiques dans la dimensionnalité d'entrée [10]. Ce compromis est documenté dans une application différente, la modélisation de séquences pour le contrôle, où Decision Transformer est un algorithme de RL hors ligne qui modélise de manière autorégressive des trajectoires en utilisant l'architecture GPT-2 [10], et rencontre des difficultés avec des problèmes de contrôle continu tels que la stabilisation du pendule inversé et du pendule de Furuta [10], tandis que Decision LSTM parvient à atteindre des performances de niveau expert sur les tâches de stabilisation du pendule inversé et du pendule de Furuta [10]. Ce résultat ne se transfère pas directement à la classification de texte ou à LAYA, mais il établit, comme un schéma général et reproductible, que la meilleure architecture pour une tâche dépend de la forme de l'entrée (longueur versus dimensionnalité), et que les conceptions basées sur Transformer ne sont pas universellement supérieures aux alternatives, même lorsque l'alternative est un réseau récurrent beaucoup plus simple. Un développeur devrait considérer cela comme une mise en garde contre l'hypothèse qu'un encodeur basé sur Transformer est automatiquement le bon squelette pour chaque environnement de classification, embarqué ou non, sans le mesurer directement par rapport aux alternatives sur la forme d'entrée spécifique à traiter.

Considérations de déploiement embarqué : vie privée, empreinte et statut open-source

Au-delà des chiffres bruts de précision et de latence, le contexte de déploiement importe pour une décision embarquée, et une source en parle directement. La nature open-source des encodeurs affinés permet un déploiement sur site, offrant des avantages en matière de vie privée, de gouvernance des données et de reproductibilité [1]. Pour la classification embarquée spécifiquement, cette propriété est presque une exigence : les poids du modèle doivent être disponibles localement, l'inférence ne doit pas dépendre d'un appel réseau à une API externe, et l'organisation déployant le modèle doit être capable de reproduire et d'auditer son comportement. Les modèles affinés de la famille BERT satisfont cela car ils sont open-source et peuvent être exportés et exécutés localement [1], alors que les API de LLM par prompting, en revanche, nécessitent typiquement un aller-retour réseau et sont facturées à l'usage, car les LLM génèrent la sortie jeton par jeton même lorsqu'ils produisent une seule étiquette de classe, introduisant une latence inhérente et des coûts basés sur l'usage [1].

Cette même propriété, des poids ouverts pouvant être exportés et exécutés localement, n'est pas abordée pour LAYA dans les preuves. Les affirmations décrivent LAYA comme un module de sortie léger [12], et léger implique généralement un petit nombre de paramètres supplémentaires et un faible coût de calcul supplémentaire par rapport au squelette sur lequel il repose, mais aucune affirmation n'indique le nombre de paramètres, l'empreinte mémoire de LAYA, ou si l'implémentation de référence est publiée ouvertement. Un développeur évaluant LAYA pour un usage embarqué devrait établir cela directement à partir de l'implémentation de LAYA plutôt qu'à partir des affirmations résumées ici, car aucune des affirmations vérifiées ne donne de chiffre à ce sujet.

L'empreinte de l'encodeur a déjà été considérablement réduite au sein de la famille BERT grâce à la distillation, ce qui est directement pertinent pour les budgets embarqués. TinyBERT 4 atteignant plus de 96.8% de la performance GLUE de BERT BASE avec une taille 7.5 fois plus petite et une inférence 9.4 fois plus rapide [7], et TinyBERT 6 performant au niveau de BERT BASE [7], décrivent tous deux des points de contrôle déployables plus petits qui conservent la recette d'affinage de BERT et sa tête de classification basée sur [CLS] [5] tout en réduisant le calcul et la mémoire nécessaires au moment de l'inférence. C'est la voie la plus concrète et reproductible dans les preuves vers un classifieur de la famille BERT à faible latence et faible mémoire adapté à l'usage embarqué, et c'est la baseline naturelle contre laquelle toute nouvelle conception de tête, y compris LAYA, devrait être mesurée si l'objectif est le déploiement embarqué.

Pris ensemble, les affirmations pertinentes au déploiement décrivent les modèles de la famille BERT comme open-source, exportables, préservant la vie privée lorsqu'ils sont auto-hébergés [1], compressibles sans grande perte de précision grâce à la distillation [7], mais instables entre graines sur de petits jeux de données à moins d'utiliser une étape d'affinage intermédiaire [5]. Aucune de ces propriétés de déploiement (statut open-source, nombre de paramètres, exportabilité) n'est documentée pour LAYA dans les preuves rassemblées ici ; les propriétés documentées de LAYA sont architecturales (son mécanisme d'agrégation [12]) et évaluatives (précision compétitive et interprétabilité sur des jeux de données d'images [12]), pas opérationnelles. Cette asymétrie dans ce qui a été mesuré est elle-même un résultat important pour un développeur : les deux candidats ne sont pas encore décrits sur les mêmes axes, donc une décision de déploiement embarqué ne peut pas être prise à partir de ces seules affirmations, et combler cette lacune est exactement l'expérience manquante vers laquelle cette note pointe.

Limites et questions ouvertes

La limite centrale de cette base de preuves est énoncée clairement : aucune affirmation ne rapporte d'expérience comparative directe entre LAYA et un modèle BERT-base affiné sur une tâche de classification de texte, binaire ou multi-classes, embarquée ou non. Les seules expériences rapportées de LAYA portent sur des jeux de données de classification d'images, où il atteint des performances prédictives compétitives tout en produisant des explications significatives et sensibles à la profondeur [12]. Les comparaisons rapportées de BERT sont contre le prompting zero- et few-shot par LLM [1], contre une variante d'affinage hybride quantique de lui-même [2], contre une version étudiante distillée de lui-même [7], et contre des modèles classiques non-BERT dans la notation d'essais [9]. Aucune de ces comparaisons n'implique LAYA, et aucune des comparaisons de LAYA n'implique BERT ou des données textuelles.

Une deuxième limite concerne spécifiquement la latence, qui est le terme nommé dans la question de recherche. Les seuls chiffres de latence dans les preuves sont : les modèles affinés de la famille BERT opérant avec une latence inférieure d'un à deux ordres de grandeur au prompting zero- et few-shot par LLM sur IMDB, SST-2, AG News et DBPedia [1], et TinyBERT 4 étant 9.4 fois plus rapide à l'inférence que l'enseignant BERT BASE sur GLUE [7]. Aucune affirmation ne rapporte un chiffre de latence d'inférence pour LAYA sur un jeu de données, image ou texte, et aucune affirmation ne rapporte un chiffre de latence embarquée (par opposition à serveur ou simulé) pour BERT ou LAYA. Un développeur ne peut donc citer aucun chiffre de latence pour LAYA du tout, seulement pour les modèles de la famille BERT par rapport aux LLM ou à une version distillée d'eux-mêmes.

Une troisième limite concerne l'inadéquation des architectures. LAYA est décrit et évalué comme une tête de sortie attachée à un squelette non spécifié sur des jeux de données de classification d'images [12], tandis que les résultats de la famille BERT résumés ici décrivent une architecture d'encodeur complète, un objectif de pré-entraînement et une recette d'affinage ensemble [6] [5]. Échanger uniquement la tête, en gardant un encodeur BERT comme squelette et en attachant un agrégateur de style LAYA à la place du classifieur linéaire [CLS], est une manière naturelle de combler cette lacune, mais cela n'a été fait dans aucune des affirmations vérifiées, donc son résultat (si cela aide, nuit, ou ne fait aucune différence mesurable pour la précision ou la latence) est inconnu à partir de ces preuves.

Une quatrième limite concerne la reproductibilité de toute comparaison future. Étant donné que l'affinage de BERT reste instable entre graines aléatoires sur de petits jeux de données [5], toute future étude comparant BERT et LAYA sur un petit jeu de données à l'échelle embarquée devrait rapporter les résultats sur plusieurs graines, pas un seul affinage, pour éviter de confondre la variance due aux graines avec une véritable différence architecturale. Étant donné que les résultats actuels du BERT hybride quantique reposent sur des simulations de circuits quantiques plutôt que sur du matériel réel [2], toute affirmation d'un avantage computationnel provenant de composants non standard devrait être vérifiée pour savoir si elle a été mesurée sur le matériel cible réel ou seulement en simulation. Étant donné que l'étude LLM contre encodeur a utilisé un cadre multi-objectif avec frontière de Pareto plutôt qu'un seul chiffre de précision [1], une future étude Laya contre BERT devrait adopter le même rapport multi-axes (précision, latence et coût des ressources ensemble), plutôt que de rapporter la précision seule et de déclarer la comparaison complète.

Comment le construire, ou comment l'utiliser

1. Définir la tâche et choisir des benchmarks qui correspondent à la question de recherche. Choisir une tâche binaire et une tâche multi-classes afin que la comparaison couvre les deux régimes nommés dans la question ; les preuves nomment IMDB et SST-2 comme benchmarks de sentiment de style binaire, et AG News et DBPedia comme benchmarks de sujet multi-classes [1]. Fixer l'ensemble d'étiquettes, la division train/validation/test, et la métrique d'évaluation (macro F1) pour correspondre à la métrique déjà utilisée pour la comparaison BERT contre LLM afin que les résultats soient comparables à ces travaux antérieurs [1].

2. Choisir un squelette commun pour les deux têtes. Parce que LAYA est documenté comme une tête de sortie qui lit toutes les couches cachées d'un squelette [12], et que le propre classifieur de BERT ne lit que l'incorporation finale [CLS] [5], le test le plus équitable maintient le squelette fixe, par exemple un encodeur BERT-base standard pré-entraîné sur la prédiction de mots masqués et la prédiction de phrases suivantes [6], et attache deux têtes différentes : la tête standard [CLS] plus linéaire [5], et un agrégateur de style LAYA [12].

3. Implémenter la tête de référence exactement comme décrit. Ajouter le jeton [CLS] à l'entrée, le faire passer à travers la pile Transformer, prendre l'incorporation [CLS] de la dernière couche, et la projeter à travers un classifieur linéaire vers des scores de classe non normalisés [5]. C'est la configuration de référence ; ne pas la modifier, car tout changement rendrait la comparaison injuste pour BERT.

4. Implémenter la tête LAYA en suivant son calcul publié. Collecter l'état caché h_i de chacune des L couches du squelette commun. Projeter chaque h_i dans un espace latent partagé avec un adaptateur léger g_i(.) [12]. Calculer les coefficients d'attention conditionnés par l'entrée alpha_i(x) [12], et former l'agrégat h_agg = sum_i alpha_i(x) g_i(h_i) [12]. Calculer la prédiction finale comme y_hat = phi(W h_agg + b) [12].

pour chaque entrée x :
  h_1 ... h_L = squelette(x)          # un état caché par couche
  pour i de 1 à L :
    z_i = adaptateur_i(h_i)            # g_i(.), espace latent partagé
  alpha = attention(x, z_1..z_L)     # poids conditionnés par l'entrée
  h_agg = sum_i alpha_i * z_i
  y_hat = phi(W * h_agg + b)

5. Affiner les deux configurations sur les mêmes données avec le même optimiseur et le même nombre d'époques, en ne modifiant que la tête. Étant donné que l'affinage des modèles basés sur BERT est connu pour être instable sur de petits jeux de données entre graines aléatoires [5], exécuter chaque configuration (tête de référence et tête LAYA) sur au moins trois ou quatre graines aléatoires différentes et rapporter la dispersion, pas un seul chiffre.

6. Si un jeu de données cible est petit, appliquer l'étape de stabilisation documentée avant l'affinage final : d'abord affiner le squelette pré-entraîné sur une tâche intermédiaire plus large et connexe, puis affiner sur le petit jeu de données cible [5]. Appliquer cela de manière identique aux deux configurations de tête afin que cela ne devienne pas un facteur de confusion.

7. Mesurer la précision avec le macro F1 sur les données de test retenues pour les deux configurations, correspondant à la métrique utilisée dans l'étude BERT contre LLM afin que les résultats se situent dans le même cadre de référence [1]. Rapporter la moyenne et la dispersion entre graines de l'étape 5.

8. Mesurer la latence d'inférence pour les deux configurations sur le matériel embarqué cible réel, pas un serveur ou un simulateur, car la base de preuves avertit que les résultats simulés, comme dans le cas hybride quantique, n'établissent pas d'accélération sur du matériel réel [2]. Enregistrer le temps horloge par exemple à une taille de lot fixe de un, correspondant au scénario de déploiement embarqué dans la question de recherche.

9. Mesurer l'empreinte mémoire et le nombre de paramètres pour les deux configurations de tête attachées au squelette commun. Utiliser les chiffres de compression de style TinyBERT (7.5 fois plus petit et 9.4 fois plus rapide pour un étudiant 4 couches par rapport à BERT BASE [7]) comme échelle de référence pour ce qu'une différence de taille ou de vitesse significative représente, afin que la différence LAYA contre tête de référence puisse être jugée par rapport à une magnitude connue.

10. Rapporter les résultats comme une comparaison multi-objectif, pas un simple tableau de précision, en suivant le cadre de frontière de Pareto et de fonction d'utilité utilisé pour l'étude BERT contre LLM [1]. Tracer la précision en fonction de la latence pour les deux configurations de tête et indiquer clairement si l'une domine l'autre ou s'il existe un véritable compromis.

11. Points de défaillance courants à vérifier avant de se fier au résultat : confirmer que l'adaptateur g_i est appliqué de manière identique à chaque couche afin qu'aucune couche ne reçoive un avantage d'échelle injuste [12] ; confirmer que les coefficients d'attention alpha_i(x) sont réellement dépendants de l'entrée et ne s'effondrent pas en une pondération fixe indépendante de l'entrée, car la valeur d'interprétabilité de LAYA dépend de cela [12] ; et confirmer que la variance due aux graines dans la tête BERT de référence, documentée comme une instabilité connue [5], n'est pas confondue avec un effet réel de la tête LAYA.

12. Rapporter les sorties d'interprétabilité parallèlement à la précision et à la latence si LAYA est utilisé, car ses poids d'attention sont censés servir d'explication d'attribution par couche sans méthode post-hoc séparée [12]. Vérifier qualitativement si le motif d'utilisation des couches semble structuré et dépendant de la tâche, comme rapporté pour la classification d'images [12], ou s'il semble uniforme ou bruité sur la tâche de texte, car cela n'a pas été testé auparavant et est une nouvelle observation que cette expérience produirait.

Ce que nous construirions

Nous construirions un petit test comparatif contrôlé : prendre un seul encodeur BERT-base pré-entraîné et y attacher deux têtes : la tête standard [CLS] plus classifieur linéaire [5] et un agrégateur d'attention de style LAYA construit à partir du calcul publié : h_agg = sum_i alpha_i(x) g_i(h_i) suivi de y_hat = phi(W h_agg + b) [12]. Nous affinerions les deux configurations sur une tâche binaire, SST-2, et une tâche multi-classes, AG News, puisque les deux sont nommées dans l'ensemble de benchmarks existant BERT contre LLM [1], sur quatre graines aléatoires chacune, étant donné l'instabilité documentée de l'affinage de BERT sur de petites données [5].

Nous jugerions le résultat sur trois axes ensemble, suivant le cadre multi-objectif déjà utilisé pour les comparaisons BERT contre LLM [1] : macro F1 sur les données de test retenues, latence d'inférence par exemple mesurée sur une machine de classe embarquée fixe (un CPU d'ordinateur portable, pour garder la configuration reproductible sans nécessiter de matériel spécialisé), et nombre de paramètres ajoutés par chaque tête. Nous utiliserions le BERT-base affiné non modifié avec sa tête standard comme baseline, et traiterions les chiffres de compression TinyBERT (7.5 fois plus petit et 9.4 fois plus rapide que BERT BASE [7]) comme une échelle de référence pour ce qui constitue une différence de latence significative.

En quelques semaines, deux personnes peuvent implémenter les deux têtes, exécuter l'affinage sur deux tâches et quatre graines, et produire un graphique précision contre latence par tâche. Le coût est modeste : un point de contrôle BERT-base pré-entraîné, deux petits jeux de données publics, et des affinages sur CPU ou GPU simple, aucune simulation quantique ni appel d'API LLM n'est requis. Ce serait la première comparaison directe rapportée entre LAYA et un classifieur BERT-base affiné sur des données textuelles, comblant exactement la lacune que cette note identifie.

Registre des affirmations

  1. factétayée

    Large language models such as GPT-4o and Claude Sonnet 4.5 have demonstrated strong capabilities in open-ended reasoning and generative language tasks.

    [1] Cost-Aware Model Selection for Text Classification: Multi-Objective Trade-offs Between Fine-Tuned Encoders and LLM Prompting in Production, abstract arXiv:2602.06370v1
    Large language models (LLMs) such as GPT-4o and Claude Sonnet 4.5 have demonstrated strong capabilities in open-ended reasoning and generative language tasks, leading to their widespread adoption across a broad range of NLP applications. However, for structured text classificatio…
  2. methodétayée

    The paper evaluates zero- and few-shot prompt-based large language models and fully fine-tuned encoder-only architectures across four benchmarks (IMDB, SST-2, AG News, and DBPedia), measuring macro F1, inference latency, and monetary cost.

    [1] Cost-Aware Model Selection for Text Classification: Multi-Objective Trade-offs Between Fine-Tuned Encoders and LLM Prompting in Production, abstract arXiv:2602.06370v1
    Large language models (LLMs) such as GPT-4o and Claude Sonnet 4.5 have demonstrated strong capabilities in open-ended reasoning and generative language tasks, leading to their widespread adoption across a broad range of NLP applications. However, for structured text classificatio…
  3. resultétayée

    Fine-tuned encoder-based models from the BERT family achieve competitive, and often superior, classification performance while operating at one to two orders of magnitude lower cost and latency compared to zero- and few-shot LLM prompting.

    [1] Cost-Aware Model Selection for Text Classification: Multi-Objective Trade-offs Between Fine-Tuned Encoders and LLM Prompting in Production, abstract arXiv:2602.06370v1
    Large language models (LLMs) such as GPT-4o and Claude Sonnet 4.5 have demonstrated strong capabilities in open-ended reasoning and generative language tasks, leading to their widespread adoption across a broad range of NLP applications. However, for structured text classificatio…
  4. methodétayée

    The paper frames model evaluation as a multi-objective decision problem and analyzes trade-offs using Pareto frontier projections and a parameterized utility function reflecting different deployment regimes.

    [1] Cost-Aware Model Selection for Text Classification: Multi-Objective Trade-offs Between Fine-Tuned Encoders and LLM Prompting in Production, section Cost-Aware Model Selection for Text Classification: Multi-Objective Trade-offs Between Fine-Tuned Encoders and LLM Promp
    We frame model evaluation as a multi-objective decision problem and analyze trade-offs using Pareto frontier projections and a parameterized utility function reflecting different deployment regimes. Our results show that fine-tuned encoder-based models from the BERT family achiev…
  5. factétayée

    Fine-tuned encoders' open-source nature enables on-premise deployment, offering advantages in privacy, data governance, and reproducibility.

    [1] Cost-Aware Model Selection for Text Classification: Multi-Objective Trade-offs Between Fine-Tuned Encoders and LLM Prompting in Production, section Cost-Aware Model Selection for Text Classification: Multi-Objective Trade-offs Between Fine-Tuned Encoders and LLM Promp
    We frame model evaluation as a multi-objective decision problem and analyze trade-offs using Pareto frontier projections and a parameterized utility function reflecting different deployment regimes. Our results show that fine-tuned encoder-based models from the BERT family achiev…
  6. factétayée

    For fixed-label text classification, tasks have traditionally been addressed using encoder-only architectures including BERT, RoBERTa, and DistilBERT.

    [1] Cost-Aware Model Selection for Text Classification: Multi-Objective Trade-offs Between Fine-Tuned Encoders and LLM Prompting in Production, section 1. Introduction
    Despite this broad success, the applicability of LLMs to structured prediction problems warrants closer examination. In fixed-label text classification—where the objective is to assign each input to one of a predefined set of categories—performance alone is rarely the sole determ…
  7. factétayée

    Fine-tuned BERT, RoBERTa, and DistilBERT models achieve strong predictive accuracy while maintaining low inference latency and modest computational footprints.

    [1] Cost-Aware Model Selection for Text Classification: Multi-Objective Trade-offs Between Fine-Tuned Encoders and LLM Prompting in Production, section 1. Introduction
    Despite this broad success, the applicability of LLMs to structured prediction problems warrants closer examination. In fixed-label text classification—where the objective is to assign each input to one of a predefined set of categories—performance alone is rarely the sole determ…
  8. factétayée

    LLMs generate output token by token even when producing a single class label, introducing inherent latency and usage-based costs.

    [1] Cost-Aware Model Selection for Text Classification: Multi-Objective Trade-offs Between Fine-Tuned Encoders and LLM Prompting in Production, section 1. Introduction
    The growing reliance on LLMs for classification thus raises an important systems-level question: under what conditions does the generality of large, prompt-driven models justify their operational overhead relative to specialized, fine-tuned encoders? Unlike discriminative encoder…
  9. resultétayée

    The proposed hybrid classical-quantum BERT model achieves performance that is competitive with, and in some cases better than, the classical baselines on standard benchmark datasets.

    [2] A Hybrid Classical-Quantum Fine Tuned BERT for Text Classification, abstract arXiv:2511.17677v1
    Fine-tuning BERT for text classification can be computationally challenging and requires careful hyper-parameter tuning. Recent studies have highlighted the potential of quantum algorithms to outperform conventional methods in machine learning and text classification tasks. In th…
  10. methodétayée

    The hybrid approach integrates an n-qubit quantum circuit with a classical BERT model for text classification.

    [2] A Hybrid Classical-Quantum Fine Tuned BERT for Text Classification, section A Hybrid Classical-Quantum Fine Tuned BERT for Text Classification
    Abu Kaisar Mohammad Masum Naveed Mahmud M. Hassan Najafi Sercan Aygun Abstract Fine-tuning BERT for text classification can be computationally challenging and requires careful hyper-parameter tuning. Recent studies have highlighted the potential of quantum algorithms to outperfor…
  11. methodétayée

    The proposed hybrid classical-quantum approach uses an n-qubit quantum circuit to fine-tune a classical BERT model.

    [2] A Hybrid Classical-Quantum Fine Tuned BERT for Text Classification, section Introduction
    In this work, we propose a hybrid classical-quantum approach for classifying texts. We use an nn-qubit quantum circuit to fine-tune a classical BERT model. We perform a comprehensive evaluation of the proposed method for text classification on a variety of popular datasets. The B…
  12. limitationétayée

    Current quantum hardware is not yet fault-tolerant enough to achieve actual computational speedup, so experiments are performed with quantum circuit simulations.

    [2] A Hybrid Classical-Quantum Fine Tuned BERT for Text Classification, section Introduction
    In this work, we propose a hybrid classical-quantum approach for classifying texts. We use an nn-qubit quantum circuit to fine-tune a classical BERT model. We perform a comprehensive evaluation of the proposed method for text classification on a variety of popular datasets. The B…
  13. factétayée

    Fine-tuning BERT for specific NLP tasks requires high computational resources and expensive inference time.

    [2] A Hybrid Classical-Quantum Fine Tuned BERT for Text Classification, section Introduction
    Pre-trained language models such as BERT (Bidirectional Encoder Representations from Transformers) (Devlin et al. 2018), have demonstrated exceptional performance across various language comprehension challenges (Sun et al. 2019). The BERT model effectively learns universal langu…
  14. methodétayée

    BERT generates an embedding vector contextualized through a stack of Transformer blocks for each input token, and prepends a special [CLS] token to the input sentence for classification tasks.

    [5] Revisiting Few-sample BERT Fine-tuning, section 2 Background and Related Work
    BERT The Bidirectional Encoder Representations from Transformers (Devlin et al., 2019, BERT;) model is a Transformer encoder (Vaswani et al., 2017) trained on raw text using masked language modeling and next-sentence prediction objectives. It generates an embedding vector context…
  15. methodétayée

    For sentence-level classification, an added linear classifier projects the [CLS] embedding to an unnormalized probability vector over the output classes.

    [5] Revisiting Few-sample BERT Fine-tuning, section 2 Background and Related Work
    BERT The Bidirectional Encoder Representations from Transformers (Devlin et al., 2019, BERT;) model is a Transformer encoder (Vaswani et al., 2017) trained on raw text using masked language modeling and next-sentence prediction objectives. It generates an embedding vector context…
  16. factétayée

    Fine-tuning BERT remains unstable, especially when using BERTLarge on small datasets, where identical learning processes with different random seeds often result in significantly different models.

    [5] Revisiting Few-sample BERT Fine-tuning, section 1 Introduction
    Fine-tuning self-supervised pre-trained models has significantly boosted state-of-the-art performance on natural language processing (NLP) tasks (Liu, 2019; Yang et al., 2019a; Wadden et al., 2019; Zhu et al., 2020; Guu et al., 2020). One of the most effective models for this pro…
  17. factétayée

    Fine-tuning the pre-trained BERT model on a large intermediate task stabilizes later fine-tuning on small datasets.

    [5] Revisiting Few-sample BERT Fine-tuning, section 2 Background and Related Work
    Existing work (Phang et al., 2018; Lee et al., 2020; Dodge et al., 2020) shows that these seemingly benign factors can influence the results significantly, especially on small datasets (i.e., << 10K examples). Consequently, practitioners often conduct many random trials of fine-t…
  18. factétayée

    Factors causing instability in few-sample BERT fine-tuning include: the use of a non-standard optimization method with biased gradient estimation, limited applicability of parts of the BERT network, and the use of a pre-determined small number of training iterations.

    [5] Revisiting Few-sample BERT Fine-tuning, abstract arXiv:2006.05987v3
    This paper is a study of fine-tuning of BERT contextual representations, with focus on commonly observed instabilities in few-sample scenarios. We identify several factors that cause this instability: the common use of a non-standard optimization method with biased gradient estim…
  19. factétayée

    BERT is based on a multi-layer bidirectional Transformer and is trained on plain text for masked word prediction and next sentence prediction tasks.

    [6] How to Fine-Tune BERT for Text Classification?, section 1 Introduction
    Another kind of pre-training models is sentence-level. Howard and Ruder (2018) propose ULMFiT, a fine-tuning method for pre-trained language model that achieves state-of-the-art results on six widely studied text classification datasets. More recently, pre-trained language models…
  20. factétayée

    BERT is the first fine-tuning based representation model that achieves state-of-the-art results for a range of NLP tasks.

    [6] How to Fine-Tune BERT for Text Classification?, section 2.1 Language Model Pre-training
    More recently, the method of pre-training language models on a large network with a large amount of unlabeled data and fine-tuning in downstream tasks has made a breakthrough in several natural language understanding tasks, such as OpenAI GPT Radford et al. (2018) and BERT Devlin…
  21. resultétayée

    Fine-tuning BERT produces similar performance to classical models at significant additional cost in automated essay scoring.

    [9] Should You Fine-Tune BERT for Automated Essay Scoring?, abstract DOI 10.18653/v1/2020.bea-1.15
    Most natural language processing research now recommends large Transformer-based models with fine-tuning for supervised classification tasks; older strategies like bag-ofwords features and linear models have fallen out of favor.Here we investigate whether, in automated essay scor…
  22. resultétayée

    TinyBERT 4 with 4 layers achieves more than 96.8% the performance of its teacher BERT BASE on GLUE benchmark, while being 7.5x smaller and 9.4x faster on inference.

    [7] TinyBERT: Distilling BERT for Natural Language Understanding, abstract DOI 10.18653/v1/2020.findings-emnlp.372
    Language model pre-training, such as BERT, has significantly improved the performances of many natural language processing tasks.However, pre-trained language models are usually computationally expensive, so it is difficult to efficiently execute them on resourcerestricted device…
  23. resultétayée

    TinyBERT 6 with 6 layers performs on-par with its teacher BERT BASE.

    [7] TinyBERT: Distilling BERT for Natural Language Understanding, abstract DOI 10.18653/v1/2020.findings-emnlp.372
    Language model pre-training, such as BERT, has significantly improved the performances of many natural language processing tasks.However, pre-trained language models are usually computationally expensive, so it is difficult to efficiently execute them on resourcerestricted device…
  24. factétayée

    Transformer layers are linear in the input dimensionality and quadratic in the input length.

    [10] How Crucial is Transformer in Decision Transformer?, section 2 Background
    Recently Transformers [27] have become predominant in natural language processing and sequence modeling. Transformer is an architecture for auto-regressive sequence modeling that is purely based on the attention mechanism and does not contain any recurrent or convolutional struct…
  25. factétayée

    Recurrent networks scale linearly in the input length and quadratically in the input dimensionality.

    [10] How Crucial is Transformer in Decision Transformer?, section 2 Background
    Recently Transformers [27] have become predominant in natural language processing and sequence modeling. Transformer is an architecture for auto-regressive sequence modeling that is purely based on the attention mechanism and does not contain any recurrent or convolutional struct…
  26. factétayée

    LAYA (Layer-wise Attention Aggregator) is a novel output head that dynamically aggregates internal representations through attention.

    [12] LAYA: Layer-wise Attention Aggregation for Interpretable Depth-Aware Neural Networks, abstract arXiv:2511.12723v2
    Deep neural networks typically rely on the representation produced by their final hidden layer to make predictions, implicitly assuming that this single vector fully captures the semantics encoded across all preceding transformations. However, intermediate layers contain rich and…
  27. methodétayée

    LAYA learns input-conditioned attention weights over layer-wise features.

    [12] LAYA: Layer-wise Attention Aggregation for Interpretable Depth-Aware Neural Networks, abstract arXiv:2511.12723v2
    Deep neural networks typically rely on the representation produced by their final hidden layer to make predictions, implicitly assuming that this single vector fully captures the semantics encoded across all preceding transformations. However, intermediate layers contain rich and…
  28. methodétayée

    LAYA provides intrinsic layer-attribution scores that explicitly quantify the contribution of each representation to the final decision without external post-hoc explanation methods.

    [12] LAYA: Layer-wise Attention Aggregation for Interpretable Depth-Aware Neural Networks, abstract arXiv:2511.12723v2
    Deep neural networks typically rely on the representation produced by their final hidden layer to make predictions, implicitly assuming that this single vector fully captures the semantics encoded across all preceding transformations. However, intermediate layers contain rich and…
  29. resultétayée

    Experiments on image classification datasets show that LAYA achieves competitive predictive performance while producing meaningful depth-aware explanations.

    [12] LAYA: Layer-wise Attention Aggregation for Interpretable Depth-Aware Neural Networks, abstract arXiv:2511.12723v2
    Deep neural networks typically rely on the representation produced by their final hidden layer to make predictions, implicitly assuming that this single vector fully captures the semantics encoded across all preceding transformations. However, intermediate layers contain rich and…
  30. factétayée

    Most architectures ultimately derive their predictions exclusively from the representation produced by the last hidden layer.

    [12] LAYA: Layer-wise Attention Aggregation for Interpretable Depth-Aware Neural Networks, section 1 Introduction
    The remarkable success of deep neural networks in computer vision is largely attributable to their ability to learn hierarchical representations, progressively transforming raw visual inputs into increasingly abstract representations. Yet, despite differences in architecture and …
  31. factétayée

    Decision Transformer is an offline RL algorithm that auto-regressively models trajectories using the GPT-2 architecture.

    [10] How Crucial is Transformer in Decision Transformer?, section 1 Introduction
    Transformers [27] have shown impressive results across a number of problem domains in Natural Language Processing [5, 17, 3] and Computer Vision [6, 13]. Inspired by these results, [4, 11] framed Reinforcement Learning (RL) as a sequence modeling problem, in which Transformer pre…
  32. resultétayée

    Decision Transformer struggles with continuous control problems such as inverted pendulum and Furuta pendulum stabilization.

    [10] How Crucial is Transformer in Decision Transformer?, abstract arXiv:2211.14655v1
    Decision Transformer (DT) is a recently proposed architecture for Reinforcement Learning that frames the decision-making process as an auto-regressive sequence modeling problem and uses a Transformer model to predict the next action in a sequence of states, actions, and rewards. …
  33. resultétayée

    Decision LSTM is able to achieve expert-level performance on inverted pendulum and Furuta pendulum stabilization tasks.

    [10] How Crucial is Transformer in Decision Transformer?, abstract arXiv:2211.14655v1
    Decision Transformer (DT) is a recently proposed architecture for Reinforcement Learning that frames the decision-making process as an auto-regressive sequence modeling problem and uses a Transformer model to predict the next action in a sequence of states, actions, and rewards. …
  34. factétayée

    LAY A (Layer-wise Attention Aggregator) is a lightweight output module that learns to weight and combine all hidden representations in an input-dependent way.

    [12] LAYA: Layer-wise Attention Aggregation for Interpretable Depth-Aware Neural Networks, section 1 Introduction
    This work revisits the role of the output stage of deep neural networks. The central idea is that the output layer should not depend exclusively on the deepest representation, but should instead integrate information across depth while simultaneously exposing how different abstra…
  35. methodétayée

    LAY A replaces the standard classifier head with an attention-based aggregator: h_agg = sum_{i=1}^{L} alpha_i(x) g_i(h_i), where alpha_i(x) are learnable, input-conditioned coefficients.

    [12] LAYA: Layer-wise Attention Aggregation for Interpretable Depth-Aware Neural Networks, section 1 Introduction
    This work revisits the role of the output stage of deep neural networks. The central idea is that the output layer should not depend exclusively on the deepest representation, but should instead integrate information across depth while simultaneously exposing how different abstra…
  36. methodétayée

    Each hidden state in LAY A is mapped into a shared latent space through a lightweight adapter g_i(.), ensuring comparability across layers.

    [12] LAYA: Layer-wise Attention Aggregation for Interpretable Depth-Aware Neural Networks, section 1 Introduction
    This work revisits the role of the output stage of deep neural networks. The central idea is that the output layer should not depend exclusively on the deepest representation, but should instead integrate information across depth while simultaneously exposing how different abstra…
  37. methodétayée

    The final prediction in LAY A is computed as y_hat = phi(W h_agg + b).

    [12] LAYA: Layer-wise Attention Aggregation for Interpretable Depth-Aware Neural Networks, section 1 Introduction
    This work revisits the role of the output stage of deep neural networks. The central idea is that the output layer should not depend exclusively on the deepest representation, but should instead integrate information across depth while simultaneously exposing how different abstra…
  38. resultétayée

    Quantitative and qualitative interpretability analyses demonstrate that LAY A's attention scores closely reflect the actual contribution of individual layers.

    [12] LAYA: Layer-wise Attention Aggregation for Interpretable Depth-Aware Neural Networks, section LAYA: Layer-wise Attention Aggregation for Interpretable Depth-Aware Neural Networks
    Furthermore, quantitative and qualitative interpretability analyses demonstrate that LAYA’s attention scores closely reflect the actual contribution of individual layers, revealing structured, task-dependent patterns of depth utilization while providing intuitive explanations of …
  39. resultétayée

    LAY A reveals structured, task-dependent patterns of depth utilization while providing intuitive explanations of how different abstraction levels contribute to each prediction.

    [12] LAYA: Layer-wise Attention Aggregation for Interpretable Depth-Aware Neural Networks, section LAYA: Layer-wise Attention Aggregation for Interpretable Depth-Aware Neural Networks
    Furthermore, quantitative and qualitative interpretability analyses demonstrate that LAYA’s attention scores closely reflect the actual contribution of individual layers, revealing structured, task-dependent patterns of depth utilization while providing intuitive explanations of …
  40. factétayée

    Empirical and theoretical studies suggest that different layers capture distinct and complementary aspects of the input: early layers encode local patterns, middle layers capture structural relations, and deeper layers represent increasingly abstract semantics.

    [12] LAYA: Layer-wise Attention Aggregation for Interpretable Depth-Aware Neural Networks, section 1 Introduction
    However, empirical and theoretical studies suggest that different layers capture distinct and complementary aspects of the input: early layers encode local patterns, middle layers capture structural relations, and deeper layers represent increasingly abstract semantics (e.g., (Ba…

Sources

  1. [1]
    Alberto Andres Valdes Gonzalez. Cost-Aware Model Selection for Text Classification: Multi-Objective Trade-offs Between Fine-Tuned Encoders and LLM Prompting in Production. arXiv, 2026.arxiv · primary · https://arxiv.org/abs/2602.06370v1
  2. [2]
    Abu Kaisar Mohammad Masum, Naveed Mahmud, M. Hassan Najafi, Sercan Aygun. A Hybrid Classical-Quantum Fine Tuned BERT for Text Classification. arXiv, 2025.arxiv · primary · https://arxiv.org/abs/2511.17677v1
  3. [3]
    Ji Xin, Raphael Tang, Yaoliang Yu, Jimmy Lin. BERxiT: Early Exiting for BERT with Better Fine-Tuning and Extension to Regression, 2021.openalex · primary · DOI 10.18653/v1/2021.eacl-main.8 · https://doi.org/10.18653/v1/2021.eacl-main.8
  4. [4]
    Dhendy Zaki Ridwan, Panji Peksi Brajangan. Vibration-Based Operational State Classification of Wheel Loaders: A Feasibility Study Using Decision Tree and Time-Frequency Features. 2025 2nd Beyond Technology Summit on Informatics International Conference (BTS-I2C), 2025.semanticscholar · primary · DOI 10.1109/BTS-I2C67944.2025.11399347 · https://doi.org/10.1109/BTS-I2C67944.2025.11399347
  5. [5]
    Tianyi Zhang, Felix Wu, Arzoo Katiyar, Kilian Q. Weinberger, Yoav Artzi. Revisiting Few-sample BERT Fine-tuning. arXiv, 2020.arxiv · primary · https://arxiv.org/abs/2006.05987v3
  6. [6]
    Chi Sun, Xipeng Qiu, Yige Xu, Xuanjing Huang. How to Fine-Tune BERT for Text Classification?. arXiv, 2019.arxiv · primary · https://arxiv.org/abs/1905.05583v3
  7. [7]
    Xiaoqi Jiao, Yichun Yin, Lifeng Shang, Xin Ran Jiang, Xiao Dong Chen, Linlin Li. TinyBERT: Distilling BERT for Natural Language Understanding, 2020.openalex · primary · DOI 10.18653/v1/2020.findings-emnlp.372 · https://doi.org/10.18653/v1/2020.findings-emnlp.372
  8. [8]
    Xinjie Lin, Gang Xiong, Gaopeng Gou, Zhen Li, Junzheng Shi, Jing Hua Yu. ET-BERT: A Contextualized Datagram Representation with Pre-training Transformers for Encrypted Traffic Classification. Proceedings of the ACM Web Conference 2022, 2022.openalex · primary · DOI 10.1145/3485447.3512217 · https://doi.org/10.1145/3485447.3512217
  9. [9]
    Elijah Mayfield, Alan W. Black. Should You Fine-Tune BERT for Automated Essay Scoring?, 2020.openalex · primary · DOI 10.18653/v1/2020.bea-1.15 · https://doi.org/10.18653/v1/2020.bea-1.15
  10. [10]
    Max Siebenborn, Boris Belousov, Junning Huang, Jan Peters. How Crucial is Transformer in Decision Transformer?. arXiv, 2022.arxiv · primary · https://arxiv.org/abs/2211.14655v1
  11. [11]
    Xiaoqi Jiao, Yichun Yin, Lifeng Shang, Xin Ran Jiang, Xiao Chen, Linlin Li. TinyBERT: Distilling BERT for Natural Language Understanding. arXiv (Cornell University), 2019.openalex · primary · DOI 10.48550/arxiv.1909.10351 · https://doi.org/10.48550/arxiv.1909.10351
  12. [12]
    Gennaro Vessio. LAYA: Layer-wise Attention Aggregation for Interpretable Depth-Aware Neural Networks. arXiv, 2025.arxiv · primary · https://arxiv.org/abs/2511.12723v2
  13. [13]
    Shital Dupare, Prof. Jayant Adhikari. A Survey on Flood Predication and Classification using Machine learning. Zenodo (CERN European Organization for Nuclear Research), 2023.openalex · primary · DOI 10.5281/zenodo.21552694 · https://doi.org/10.5281/zenodo.21552694
  14. [14]
    Magdalena Rybicka, J. Villalba, N. Dehak, K. Kowalczyk. End-to-End Neural Speaker Diarization with an Iterative Refinement of Non-Autoregressive Attention-based Attractors. Interspeech, 2022.semanticscholar · primary · DOI 10.21437/interspeech.2022-10169 · https://doi.org/10.21437/interspeech.2022-10169
  15. [15]
    Sergey S. Averyanov, Andrey S. Trofimov. Analysing Non-Ensemble Machine Learning Methods for Solving the Transient Classification Problem. Educational Data Mining, 2025.semanticscholar · primary · DOI 10.1109/EDM65517.2025.11096849 · https://doi.org/10.1109/EDM65517.2025.11096849
  16. [16]
    Sajith Ranatunga, Rune Strand Ødegård, Knut Jetlund, Bjørn Arild Godager, C. Storie, J. Storie. From remote sensing to decision-making: a web-based platform for near-real-time land cover classification. International Journal of Digital Earth, 2026.semanticscholar · primary · DOI 10.1080/17538947.2026.2639785 · https://doi.org/10.1080/17538947.2026.2639785
  17. [17]
    Jiatao Gu, Xiang Kong. Fully Non-autoregressive Neural Machine Translation: Tricks of the Trade, 2021.openalex · primary · DOI 10.18653/v1/2021.findings-acl.11 · https://doi.org/10.18653/v1/2021.findings-acl.11
  18. [18]
    Yakoub Bazi, Laila Bashmal, Mohamad Mahmoud Al Rahhal, Reham Al-Dayil, Naif Al Ajlan. Vision Transformers for Remote Sensing Image Classification. Remote Sensing, 2021.openalex · primary · DOI 10.3390/rs13030516 · https://doi.org/10.3390/rs13030516
  19. [19]
    Ce Zhou, Qian Li, Chen Li, Jun Yu, Yixin Liu, Guangjing Wang. A Comprehensive Survey on Pretrained Foundation Models: A History from BERT to ChatGPT. arXiv (Cornell University), 2023.openalex · primary · DOI 10.48550/arxiv.2302.09419 · https://doi.org/10.48550/arxiv.2302.09419
  20. [20]
    Zhuoyan Li, Hangxiao Zhu, Zhuoran Lu, Ming Yin. Synthetic Data Generation with Large Language Models for Text Classification: Potential and Limitations, 2023.openalex · primary · DOI 10.18653/v1/2023.emnlp-main.647 · https://doi.org/10.18653/v1/2023.emnlp-main.647