nota de investigación
Non-Autoregressive Typed Decisions: How Does Laya Compare to BERT for On-Device Classification?
Respuesta directa
Respuesta directa
The verified claims do not include any experiment that runs Laya (LAYA, the Layer-wise Attention Aggregator) against a fine-tuned BERT-base model on the same on-device binary or multi-class text classification task with matched latency and accuracy measurements, so no direct answer to the comparison question exists in the evidence. What the claims do show, separately, is that LAYA is a lightweight output head evaluated on image classification datasets, where it reaches competitive predictive performance and gives depth-aware explanations [12], while fine-tuned BERT and its family (RoBERTa, DistilBERT) are documented as strong, low-latency, low-cost classifiers on text benchmarks compared against LLM prompting, not against LAYA [1]. Because LAYA's own reported comparison is against other output heads on image tasks, and BERT's reported comparisons are against LLM prompting and against distilled or quantum-hybrid variants of itself, a builder cannot infer from these claims which one would win on an on-device text classification benchmark. Anyone who needs that answer must run the head-to-head test themselves; this note lays out how, using the mechanisms, numbers, and costs that the sources do report for each side separately.
Why this question matters for on-device classification
La clasificación de texto con un conjunto fijo de etiquetas, como sentimiento (binario) o tema (multiclase), se resuelve tradicionalmente con arquitecturas solo de codificador como BERT, RoBERTa y DistilBERT [1]. Estos modelos logran una precisión predictiva sólida mientras mantienen una latencia de inferencia baja y huellas computacionales modestas [1]. El despliegue en el dispositivo añade restricciones que no existen en el despliegue en servidor: memoria limitada, cómputo limitado y un requisito estricto de latencia por inferencia. Por ello, cualquier afirmación de una alternativa más barata o más rápida a BERT merece escrutinio antes de ser adoptada para uso en el dispositivo, y un estudio que realmente mida la latencia y el costo junto con la precisión es más útil para un desarrollador que uno que solo reporte precisión.
Los modelos de lenguaje grandes como GPT-4o y Claude Sonnet 4.5 han demostrado capacidades sólidas en razonamiento abierto y tareas de lenguaje generativo [1]. Pero los LLM generan salida token por token incluso al producir una sola etiqueta de clase, lo que introduce latencia inherente y costos basados en el uso [1]. Un estudio que evaluó LLM con prompting de cero y pocos ejemplos frente a arquitecturas solo de codificador completamente ajustadas en cuatro puntos de referencia, IMDB, SST-2, AG News y DBPedia, midiendo macro F1, latencia de inferencia y costo monetario, encontró que los modelos basados en codificador ajustados de la familia BERT logran un rendimiento de clasificación competitivo y, a menudo, superior, mientras operan con uno a dos órdenes de magnitud menos de costo y latencia en comparación con el prompting de LLM de cero y pocos ejemplos [1]. Esto establece a los modelos de la familia BERT como la línea base práctica para clasificación en el dispositivo o sensible al costo, no al LLM, y es la línea base que esta nota usa al discutir lo que una posible alternativa a BERT necesitaría superar.
Por separado, una línea de trabajo diferente pregunta si la práctica estándar de tomar una predicción solo de la última capa oculta es la decisión de diseño correcta para un clasificador neuronal. La mayoría de las arquitecturas derivan sus predicciones exclusivamente de la representación producida por la última capa oculta [12]. Estudios empíricos y teóricos sugieren que diferentes capas capturan aspectos distintos y complementarios de la entrada: las capas tempranas codifican patrones locales, las capas medias capturan relaciones estructurales y las capas más profundas representan semántica cada vez más abstracta [12]. LAYA (Layer-wise Attention Aggregator) es una cabeza de salida novedosa que agrega dinámicamente representaciones internas mediante atención, construida para aprovechar esta observación en lugar de descartarla [12].
La pregunta práctica que enfrenta un desarrollador es si reemplazar una cabeza clasificadora estándar con algo como LAYA, o reemplazar un LLM completo con un BERT ajustado, proporciona una mejor relación precisión-por-milisegundo en un teléfono o un chip integrado. La evidencia recopilada aquí responde la segunda pregunta directamente y no responde la primera para clasificación de texto, porque LAYA solo ha sido probado en conjuntos de datos de imágenes [12]. El resto de esta nota trata estas como dos líneas de evidencia separadas y bien respaldadas, describe el mecanismo y los números reportados para cada una, y es explícita acerca de dónde no se encuentran, para que un desarrollador que quiera la comparación faltante sepa exactamente qué experimento ejecutar y qué necesitaría controlar. Un estudio que enmarca la evaluación de modelos como un problema de decisión multiobjetivo y analiza las compensaciones usando proyecciones de frontera de Pareto y una función de utilidad parametrizada que refleja diferentes regímenes de despliegue ofrece la lente adecuada para este tipo de comparación una vez que se complete la medición faltante [1].
What BERT is and what LAYA is
BERT se basa en un Transformer bidireccional de múltiples capas y se entrena en texto plano para tareas de predicción de palabras enmascaradas y predicción de la siguiente oración [6]. Es el primer modelo de representación basado en ajuste fino que logra resultados de última generación para un rango de tareas de PLN [6]. Esto significa que BERT se preentrena una vez en texto no etiquetado grande usando dos objetivos autosupervisados, y los mismos pesos preentrenados se adaptan, o ajustan, a muchas tareas posteriores diferentes con relativamente pocos datos etiquetados. Esa receta de dos etapas, preentrenar luego ajustar, es la razón por la que BERT y sus descendientes son la opción predeterminada para clasificación de texto de etiquetas fijas, en lugar de un modelo entrenado desde cero para cada tarea.
Mecánicamente, BERT genera un vector de incrustación contextualizado a través de una pila de bloques Transformer para cada token de entrada, y antepone un token especial [CLS] a la oración de entrada para tareas de clasificación [5]. Para clasificación a nivel de oración, un clasificador lineal añadido proyecta la incrustación [CLS] a un vector de probabilidad no normalizado sobre las clases de salida [5]. Esta es la cabeza clasificadora estándar: una única capa lineal aprendida situada sobre la salida del bloque Transformer final para un token designado, seguida de un paso de normalización que convierte las puntuaciones no normalizadas en probabilidades de clase. Toda la pila, codificador más cabeza lineal, se entrena de extremo a extremo durante el ajuste fino, razón por la cual ajustar BERT para una nueva tarea requiere actualizar todos sus parámetros a menos que se use una variante eficiente en parámetros.
LAYA tiene una visión diferente de lo que la cabeza debería observar. LAYA (Layer-wise Attention Aggregator) es un módulo de salida ligero que aprende a ponderar y combinar todas las representaciones ocultas de una manera dependiente de la entrada [12]. LAYA aprende pesos de atención condicionados a la entrada sobre características a nivel de capa [12]. En lugar de que la cabeza lea solo la última capa oculta, como hace el clasificador basado en [CLS] de BERT, la cabeza de LAYA lee cada capa oculta producida por la red troncal y deja que un mecanismo de atención decida, para cada entrada individual, cuánto peso debe recibir la representación de cada capa. LAYA proporciona puntuaciones intrínsecas de atribución por capa que cuantifican explícitamente la contribución de cada representación a la decisión final sin métodos externos de explicación post-hoc [12], lo que significa que los pesos de atención en sí mismos sirven como una explicación de qué profundidades de la red importaron para una predicción dada, sin requerir una herramienta de interpretabilidad separada.
Por lo tanto, los dos diseños difieren exactamente en el punto donde se toma una decisión de clasificación. La cabeza clasificadora de BERT es fija y lee una representación única y final, la incrustación [CLS] después del último bloque Transformer [5]. La cabeza de LAYA es en sí misma un pequeño módulo de atención entrenable que lee todas las representaciones intermedias y produce una ponderación por entrada y por capa antes de hacer la predicción final [12]. Ambos enfoques se sitúan sobre alguna red troncal extractora de características, un codificador en el caso de BERT, y la descripción de LAYA en la fuente no especifica una red troncal de codificador de texto; los experimentos reportados utilizan conjuntos de datos de clasificación de imágenes [12]. Esta distinción, red troncal versus cabeza, es la razón por la cual una comparación justa de Laya y BERT para clasificación de texto necesitaría especificar exactamente sobre qué red troncal se sitúa el agregador de LAYA antes de que se puedan comparar números de precisión o latencia. También significa que describir a LAYA como un competidor de BERT es solo parcialmente preciso: LAYA reemplaza la cabeza de clasificación, mientras que BERT generalmente se describe y evalúa como un codificador completo más cabeza, por lo que una prueba justa necesitaría mantener fija la red troncal e intercambiar solo la cabeza, o indicar claramente que se está intercambiando toda la arquitectura, incluida la red troncal.
The mechanism inside LAYA: aggregation, adapters, and prediction
El cómputo interno de LAYA se describe con suficiente precisión en la fuente como para reproducirlo. LAYA reemplaza la cabeza clasificadora estándar con un agregador basado en atención: h_agg = sum_{i=1}^{L} alpha_i(x) g_i(h_i), donde alpha_i(x) son coeficientes aprendibles condicionados a la entrada [12]. En términos simples, la red troncal produce L representaciones ocultas, una por capa, y en lugar de conservar solo la última, LAYA calcula una suma ponderada de todas ellas, donde el peso dado a cada capa depende de la entrada específica x que se está procesando, no de un esquema fijo independiente de la entrada. Esta es la afirmación estructural central del método: la ponderación es una función de la entrada, por lo que dos entradas diferentes que pasan por la misma red entrenada pueden terminar dependiendo de diferentes profundidades de representación.
Antes de calcular la suma ponderada, la representación de cada capa se coloca en un terreno común. Cada estado oculto en LAYA se asigna a un espacio latente compartido a través de un adaptador ligero g_i(.), asegurando la comparabilidad entre capas [12]. Este paso del adaptador es importante porque los estados ocultos de diferentes profundidades de una red pueden diferir en escala, dimensionalidad o granularidad semántica, y sumarlos directamente sin asignarlos primero a un espacio compartido podría permitir que una capa domine el agregado por razones no relacionadas con cuán útil es su representación. El adaptador ligero se describe como pequeño, lo que mantiene baja la sobrecarga total de parámetros y cómputo de LAYA en relación con la red troncal sobre la que se asienta, aunque la fuente no proporciona un recuento exacto de parámetros ni una fórmula para el tamaño del adaptador en relación con la dimensión oculta de la red troncal.
La etapa de salida es un simple paso lineal más no linealidad aplicado a la representación agregada. La predicción final en LAYA se calcula como y_hat = phi(W h_agg + b) [12]. Esto es estructuralmente similar a la propia cabeza clasificadora de BERT, una proyección lineal seguida de una no linealidad, con la diferencia clave siendo qué se alimenta a esa capa lineal: BERT alimenta la única incrustación [CLS] de la capa final [5], mientras que LAYA alimenta la combinación agregada por atención de todas las representaciones adaptadas de las capas [12]. La maquinaria adicional en LAYA, en relación con una cabeza estándar, es por lo tanto el adaptador por capa g_i y los pesos de atención condicionados a la entrada alpha_i(x); todo lo demás sobre cómo se produce la puntuación final de clase es un clasificador lineal convencional con una no linealidad phi aplicada al final.
Debido a que los pesos de atención alpha_i(x) se aprenden y dependen de la entrada, pueden inspeccionarse después del entrenamiento para ver en qué capas confió el modelo para qué tipos de entradas, y la fuente trata esto como una característica de primera clase en lugar de un efecto secundario. Los análisis de interpretabilidad cuantitativos y cualitativos demuestran que las puntuaciones de atención de LAYA reflejan estrechamente la contribución real de las capas individuales [12]. LAYA revela patrones estructurados y dependientes de la tarea de utilización de profundidad, mientras proporciona explicaciones intuitivas de cómo diferentes niveles de abstracción contribuyen a cada predicción [12]. Para un desarrollador, esto significa que adoptar LAYA como cabeza clasificadora no es puramente una decisión de precisión o latencia; también compra una explicación incorporada, por predicción, de qué profundidades de la red impulsaron la decisión, al costo de los parámetros adicionales del adaptador y atención descritos anteriormente. Ninguno de estos mecanismos se ha descrito o medido para una red troncal de codificador de texto en la evidencia recopilada aquí, por lo que aplicarlo a una pila de bloques Transformer al estilo BERT sería una extensión directa y razonable de probar, no algo ya reportado.
What was measured for BERT-family models, and what was not measured for LAYA on text
La comparación cuantitativa más clara disponible en la evidencia es entre codificadores de la familia BERT ajustados y el prompting de LLM, no entre BERT y LAYA. El estudio relevante midió macro F1, latencia de inferencia y costo monetario en cuatro puntos de referencia, IMDB, SST-2, AG News y DBPedia, comparando LLM con prompting de cero y pocos ejemplos como GPT-4o y Claude Sonnet 4.5 con arquitecturas solo de codificador completamente ajustadas [1]. El resultado fue que los modelos basados en codificador ajustados de la familia BERT logran un rendimiento de clasificación competitivo y, a menudo, superior, mientras operan con uno a dos órdenes de magnitud menos de costo y latencia en comparación con el prompting de LLM de cero y pocos ejemplos [1]. El mismo artículo enmarca la evaluación de modelos como un problema de decisión multiobjetivo y analiza las compensaciones usando proyecciones de frontera de Pareto y una función de utilidad parametrizada que refleja diferentes regímenes de despliegue [1], que es un punto metodológico que un desarrollador puede reutilizar: la precisión por sí sola no es la lente adecuada cuando la latencia y el costo difieren por órdenes de magnitud entre candidatos. Esta metodología, no los números específicos, es la parte que se transfiere limpiamente a un estudio de Laya versus BERT, porque proporciona una plantilla para reportar tres ejes juntos en lugar de la precisión de forma aislada.
Otras fuentes añaden números adicionales y separados sobre variantes de BERT sin compararlos con LAYA. TinyBERT 4 con 4 capas logra más del 96.8% del rendimiento de su maestro BERT BASE en el benchmark GLUE, mientras es 7.5 veces más pequeño y 9.4 veces más rápido en inferencia [7]. TinyBERT 6 con 6 capas funciona a la par de su maestro BERT BASE [7]. Estos números describen destilación, comprimiendo BERT BASE en un modelo estudiante más pequeño, y establecen que la precisión de BERT puede preservarse a una fracción de su tamaño y latencia mediante compresión arquitectónica, lo cual es directamente relevante para el despliegue en el dispositivo aunque no dice nada sobre LAYA. Un desarrollador que quiera un presupuesto de tamaño-latencia para el lado de BERT de una comparación tiene, en estos números, dos puntos de referencia concretos ya medidos en GLUE: un estudiante de 4 capas 7.5 veces más pequeño y 9.4 veces más rápido con más del 96.8% del rendimiento del maestro, y un estudiante de 6 capas con rendimiento a la par.
El ajuste fino de BERT para tareas específicas de PLN requiere altos recursos computacionales y tiempo de inferencia costoso [2], un costo que motivó un enfoque híbrido clásico-cuántico: el modelo híbrido clásico-cuántico BERT propuesto integra un circuito cuántico de n qubits con un modelo BERT clásico para clasificación de texto [2], usando el circuito cuántico para ajustar el modelo clásico [2]. El modelo híbrido clásico-cuántico BERT propuesto logra un rendimiento que es competitivo, y en algunos casos mejor, que las líneas base clásicas en conjuntos de datos de benchmark estándar [2]. Sin embargo, el hardware cuántico actual aún no es lo suficientemente tolerante a fallos para lograr una aceleración computacional real, por lo que los experimentos se realizan con simulaciones de circuitos cuánticos [2], lo que significa que la competitividad reportada es en precisión, no en ninguna ventaja demostrada de latencia o costo sobre el ajuste fino clásico de BERT; la simulación se ejecuta en hardware clásico, por lo que no hay un número de latencia en el dispositivo disponible de esta comparación tampoco.
La propia medición reportada de LAYA está en un dominio completamente diferente. Los experimentos en conjuntos de datos de clasificación de imágenes muestran que LAYA logra un rendimiento predictivo competitivo mientras produce explicaciones significativas y conscientes de la profundidad [12]. No hay un benchmark nombrado, ningún número de precisión dado, y ninguna tarea de clasificación de texto involucrada en esta medición; la afirmación solo indica que el rendimiento es competitivo y que las explicaciones son significativas, en datos de imágenes. Debido a que ninguna de las fuentes reporta el macro F1, la latencia o el costo de LAYA en IMDB, SST-2, AG News, DBPedia o cualquier otro benchmark de clasificación de texto, y debido a que ninguna de las fuentes ejecuta BERT y LAYA en la misma tarea con el mismo protocolo de medición, no hay un número compartido en la evidencia que permita a un lector colocar a LAYA y BERT en la misma frontera de Pareto para clasificación de texto. Esta brecha es el hallazgo central de esta nota: no que LAYA pierda o gane, sino que la comparación no se ha medido, y cualquier afirmación en contrario iría más allá de lo que dicen las fuentes.
Instability, fine-tuning cost, and other documented BERT trade-offs
Un desarrollador que elige entre BERT y cualquier cabeza o arquitectura alternativa también necesita conocer los modos de fallo que son específicos del ajuste fino de BERT, independientemente de la comparación con LAYA. El ajuste fino de BERT sigue siendo inestable, especialmente cuando se usa BERTLarge en conjuntos de datos pequeños, donde procesos de aprendizaje idénticos con diferentes semillas aleatorias a menudo resultan en modelos significativamente diferentes [5]. Esto significa que los números de precisión reportados para una sola ejecución de ajuste fino de BERT pueden ser engañosos a menos que la ejecución se haya repetido en múltiples semillas, porque dos ejecuciones de la misma configuración pueden llegar a niveles de precisión significativamente diferentes únicamente debido a la aleatoriedad en la inicialización o el orden de los datos. Esta es una advertencia metodológica directa para cualquiera que diseñe un estudio comparativo: un número de precisión de una sola semilla para una línea base de BERT no es suficiente para sacar una conclusión contra un método competidor como LAYA.
La misma fuente identifica causas concretas de esta inestabilidad y una mitigación documentada. Los factores que causan inestabilidad en el ajuste fino de BERT con pocas muestras incluyen: el uso de un método de optimización no estándar con estimación de gradiente sesgada, aplicabilidad limitada de partes de la red BERT, y el uso de un número predeterminado pequeño de iteraciones de entrenamiento [5]. Ajustar el modelo BERT preentrenado en una tarea intermedia grande estabiliza el ajuste fino posterior en conjuntos de datos pequeños [5]. Para un desarrollador que trabaja con un conjunto de datos de clasificación pequeño en el dispositivo, esto proporciona una receta específica y procesable: ajustar primero en una tarea intermedia más grande y relacionada antes de ajustar en el conjunto de datos objetivo pequeño, en lugar de ajustar directamente en el conjunto de datos pequeño desde el punto de control preentrenado base.
El costo es un tema recurrente en múltiples fuentes independientes, no solo en la comparación LLM versus codificador. El ajuste fino de BERT produce un rendimiento similar a los modelos clásicos a un costo adicional significativo en la calificación automatizada de ensayos [9]. Este es un resultado específico del dominio, la calificación automatizada de ensayos, pero refuerza el patrón general visto en la comparación de prompting de LLM [1] y la motivación del híbrido cuántico [2]: la precisión de BERT a menudo es igualada por alternativas más baratas, y la decisión de usar BERT debe sopesar ese costo adicional contra la precisión ganada, tarea por tarea, en lugar de asumir que BERT siempre vale su costo.
Finalmente, hay un argumento estructural sobre por qué las arquitecturas de codificador como BERT podrían o no ser la forma computacional correcta para una tarea dada, independientemente de la precisión. Las capas Transformer son lineales en la dimensionalidad de la entrada y cuadráticas en la longitud de la entrada [10]. Las redes recurrentes escalan linealmente en la longitud de la entrada y cuadráticamente en la dimensionalidad de la entrada [10]. Esta compensación está documentada en una aplicación diferente, modelado de secuencias para control, donde Decision Transformer es un algoritmo de RL fuera de línea que modela trayectorias de forma autorregresiva usando la arquitectura GPT-2 [10], y tiene dificultades con problemas de control continuo como la estabilización del péndulo invertido y el péndulo de Furuta [10], mientras que Decision LSTM es capaz de lograr un rendimiento a nivel de experto en tareas de estabilización del péndulo invertido y el péndulo de Furuta [10]. Este resultado no se transfiere directamente a la clasificación de texto o a LAYA, pero establece, como un patrón general y reproducible, que la mejor arquitectura para una tarea depende de la forma de la entrada, longitud versus dimensionalidad, y que los diseños basados en Transformer no son universalmente superiores a las alternativas incluso cuando la alternativa es una red recurrente mucho más simple. Un desarrollador debe tratar esto como una precaución contra asumir que un codificador basado en Transformer es automáticamente la red troncal correcta para cada entorno de clasificación, en el dispositivo o no, sin medirlo directamente contra alternativas en la forma de entrada específica en cuestión.
On-device deployment considerations: privacy, footprint, and open-source status
Más allá de los números brutos de precisión y latencia, el contexto de despliegue importa para una decisión en el dispositivo, y una fuente habla directamente de esto. La naturaleza de código abierto de los codificadores ajustados permite el despliegue local, ofreciendo ventajas en privacidad, gobernanza de datos y reproducibilidad [1]. Para la clasificación en el dispositivo específicamente, esta propiedad es casi un requisito: los pesos del modelo deben estar disponibles localmente, la inferencia no debe depender de una llamada de red a una API externa, y la organización que despliega el modelo debe poder reproducir y auditar su comportamiento. Los modelos ajustados de la familia BERT satisfacen esto porque son de código abierto y pueden exportarse y ejecutarse localmente [1], mientras que las API de LLM con prompting, por el contrario, típicamente requieren un viaje de ida y vuelta por red y se facturan por uso, ya que los LLM generan salida token por token incluso al producir una sola etiqueta de clase, introduciendo latencia inherente y costos basados en el uso [1].
Esta misma propiedad, pesos abiertos que pueden exportarse y ejecutarse localmente, no se aborda para LAYA en la evidencia. Las afirmaciones describen a LAYA como un módulo de salida ligero [12], y ligero generalmente implica un pequeño número de parámetros adicionales y bajo cómputo adicional en relación con la red troncal sobre la que se asienta, pero ninguna afirmación indica el recuento de parámetros de LAYA, la huella de memoria, o si la implementación de referencia se ha lanzado abiertamente. Un desarrollador que evalúe LAYA para uso en el dispositivo necesitaría establecer esto directamente a partir de la implementación de LAYA en lugar de las afirmaciones resumidas aquí, ya que ninguna de las afirmaciones verificadas proporciona un número para ello.
La huella del codificador ya se ha reducido sustancialmente dentro de la familia BERT mediante destilación, lo cual es directamente relevante para los presupuestos en el dispositivo. TinyBERT 4 logrando más del 96.8% del rendimiento de BERT BASE en GLUE con un tamaño 7.5 veces más pequeño y una inferencia 9.4 veces más rápida [7], y TinyBERT 6 funcionando a la par de BERT BASE [7], ambos describen puntos de control desplegables más pequeños que mantienen la receta de ajuste fino de BERT y su cabeza de clasificación basada en [CLS] [5] mientras reducen el cómputo y la memoria necesarios en el momento de la inferencia. Este es el camino más concreto y reproducible en la evidencia hacia un clasificador de la familia BERT de baja latencia y baja memoria adecuado para uso en el dispositivo, y es la línea base natural contra la cual se debe medir cualquier nuevo diseño de cabeza, incluido LAYA, si el objetivo es el despliegue en el dispositivo.
En conjunto, las afirmaciones relevantes para el despliegue describen a los modelos de la familia BERT como de código abierto, exportables, que preservan la privacidad cuando se autoalojan [1], comprimibles sin mucha pérdida de precisión mediante destilación [7], pero inestables entre semillas en conjuntos de datos pequeños a menos que se use un paso de ajuste fino intermedio [5]. Ninguna de estas propiedades de despliegue, estado de código abierto, recuento de parámetros, exportabilidad, está documentada para LAYA en la evidencia recopilada aquí; las propiedades documentadas de LAYA son arquitectónicas, su mecanismo de agregación [12], y evaluativas, precisión competitiva e interpretabilidad en conjuntos de datos de imágenes [12], no operativas. Esta asimetría en lo que se ha medido es en sí misma un hallazgo importante para un desarrollador: los dos candidatos aún no se describen en los mismos ejes, por lo que una decisión de despliegue en el dispositivo no puede tomarse solo a partir de estas afirmaciones, y cerrar esa brecha es exactamente el experimento faltante hacia el que apunta esta nota.
Limits and open questions
El límite central de esta base de evidencia se establece claramente: ninguna afirmación reporta un experimento cara a cara entre LAYA y un modelo BERT-base ajustado en ninguna tarea de clasificación de texto, binaria o multiclase, en el dispositivo o de otro tipo. Los únicos experimentos reportados de LAYA son en conjuntos de datos de clasificación de imágenes, donde logra un rendimiento predictivo competitivo mientras produce explicaciones significativas y conscientes de la profundidad [12]. Las comparaciones reportadas de BERT son contra prompting de LLM de cero y pocos ejemplos [1], contra una variante de ajuste fino híbrida cuántica de sí mismo [2], contra una versión estudiante destilada de sí mismo [7], y contra modelos clásicos no BERT en calificación de ensayos [9]. Ninguna de estas comparaciones involucra a LAYA, y ninguna de las comparaciones de LAYA involucra a BERT o datos de texto.
Un segundo límite se refiere específicamente a la latencia, que es el término nombrado en la pregunta de investigación. Los únicos números de latencia en la evidencia son: los modelos ajustados de la familia BERT operan con uno a dos órdenes de magnitud menos de latencia que el prompting de LLM de cero y pocos ejemplos en IMDB, SST-2, AG News y DBPedia [1], y TinyBERT 4 es 9.4 veces más rápido en inferencia que el maestro BERT BASE en GLUE [7]. Ninguna afirmación reporta un número de latencia de inferencia para LAYA en ningún conjunto de datos, imagen o texto, y ninguna afirmación reporta un número de latencia en el dispositivo (a diferencia de servidor o simulado) para BERT o LAYA. Por lo tanto, un desarrollador no puede citar una cifra de latencia para LAYA en absoluto, solo para los modelos de la familia BERT frente a LLM o frente a una versión destilada de sí mismos.
Un tercer límite se refiere a la falta de coincidencia arquitectónica. LAYA se describe y evalúa como una cabeza de salida unida a una red troncal no especificada en conjuntos de datos de clasificación de imágenes [12], mientras que los resultados de la familia BERT resumidos aquí describen una arquitectura de codificador completa, objetivo de preentrenamiento y receta de ajuste fino juntos [6] [5]. Intercambiar solo la cabeza, manteniendo un codificador BERT como red troncal y adjuntando un agregador de estilo LAYA en lugar del clasificador lineal [CLS], es una forma natural de cerrar esta brecha, pero no se ha hecho en ninguna de las afirmaciones verificadas, por lo que su resultado, si ayuda, perjudica o no hace una diferencia medible en precisión o latencia, se desconoce a partir de esta evidencia.
Un cuarto límite se refiere a la reproducibilidad de cualquier comparación futura. Dado que el ajuste fino de BERT sigue siendo inestable entre semillas aleatorias en conjuntos de datos pequeños [5], cualquier estudio futuro que compare BERT y LAYA en un conjunto de datos pequeño a escala de dispositivo necesitaría reportar resultados en múltiples semillas, no una sola ejecución, para evitar confundir la varianza de la semilla con una diferencia arquitectónica genuina. Dado que los resultados actuales del BERT híbrido cuántico se basan en simulaciones de circuitos cuánticos en lugar de hardware real [2], cualquier afirmación de una ventaja computacional de componentes no estándar debe verificarse si se midió en el hardware objetivo real o solo en simulación. Dado que el estudio de LLM versus codificador utilizó un marco de frontera de Pareto multiobjetivo en lugar de un solo número de precisión [1], un estudio futuro de Laya versus BERT debería adoptar el mismo informe multieje, precisión, latencia y costo de recursos juntos, en lugar de reportar solo la precisión y llamar a la comparación completa.
Práctica
How to build it, or how to use it
1. Defina la tarea y elija puntos de referencia que coincidan con la pregunta de investigación. Elija una tarea binaria y una tarea multiclase para que la comparación cubra ambos regímenes nombrados en la pregunta; la evidencia nombra IMDB y SST-2 como puntos de referencia de sentimiento binario y AG News y DBPedia como puntos de referencia de tema multiclase [1]. Fije el conjunto de etiquetas, la división entrenamiento/validación/prueba y la métrica de evaluación, macro F1, para que coincida con la métrica ya utilizada para la comparación BERT versus LLM, de modo que los resultados sean comparables con ese trabajo anterior [1].
2. Elija una red troncal compartida para ambas cabezas. Debido a que LAYA está documentado como una cabeza de salida que lee todas las capas ocultas de una red troncal [12], y el propio clasificador de BERT lee solo la incrustación [CLS] final [5], la prueba más justa mantiene fija la red troncal, por ejemplo, un codificador BERT-base estándar preentrenado en predicción de palabras enmascaradas y predicción de la siguiente oración [6], y le adjunta dos cabezas diferentes: la cabeza [CLS]-más-lineal estándar [5], y un agregador de estilo LAYA [12].
3. Implemente la cabeza de línea base exactamente como se describe. Anteponga el token [CLS] a la entrada, ejecútelo a través de la pila Transformer, tome la incrustación [CLS] de la capa final y proyéctela a través de un clasificador lineal para obtener puntuaciones de clase no normalizadas [5]. Esta es la configuración de referencia; no la modifique, ya que cualquier cambio haría que la comparación fuera injusta para BERT.
4. Implemente la cabeza LAYA siguiendo su cómputo publicado. Recoja el estado oculto h_i de cada una de las L capas de la red troncal compartida. Asigne cada h_i a un espacio latente compartido con un adaptador ligero g_i(.) [12]. Calcule los coeficientes de atención condicionados a la entrada alpha_i(x) [12], y forme el agregado h_agg = sum_i alpha_i(x) g_i(h_i) [12]. Calcule la predicción final como y_hat = phi(W h_agg + b) [12].
para cada entrada x:
h_1 ... h_L = red_troncal(x) # un estado oculto por capa
para i en 1..L:
z_i = adaptador_i(h_i) # g_i(.), espacio latente compartido
alpha = atencion(x, z_1..z_L) # pesos condicionados a la entrada
h_agg = suma_i alpha_i * z_i
y_hat = phi(W * h_agg + b)5. Ajuste ambas configuraciones en los mismos datos con el mismo optimizador y el mismo número de épocas, cambiando solo la cabeza. Debido a que se sabe que el ajuste fino de los modelos basados en BERT es inestable en conjuntos de datos pequeños entre semillas aleatorias [5], ejecute cada configuración, cabeza de línea base y cabeza LAYA, en al menos tres o cuatro semillas aleatorias diferentes y reporte la dispersión, no un solo número.
6. Si algún conjunto de datos objetivo es pequeño, aplique el paso de estabilización documentado antes de la ejecución de ajuste fino final: primero ajuste la red troncal preentrenada en una tarea intermedia más grande y relacionada, luego ajuste en el conjunto de datos objetivo pequeño [5]. Aplique esto idénticamente a ambas configuraciones de cabeza para que no se convierta en un factor de confusión.
7. Mida la precisión con macro F1 en datos de prueba no vistos para ambas configuraciones, coincidiendo con la métrica utilizada en el estudio de BERT versus LLM para que los resultados se sitúen en el mismo marco de referencia [1]. Reporte la media y la dispersión entre semillas del paso 5.
8. Mida la latencia de inferencia para ambas configuraciones en el hardware de dispositivo objetivo real, no en un servidor o un simulador, ya que la base de evidencia advierte que los resultados simulados, como en el caso del híbrido cuántico, no establecen una aceleración en hardware real [2]. Registre el tiempo de pared por ejemplo con un tamaño de lote fijo de uno, coincidiendo con el escenario de despliegue en el dispositivo de la pregunta de investigación.
9. Mida la huella de memoria y el recuento de parámetros para ambas configuraciones de cabeza adjuntas a la red troncal compartida. Use los números de compresión de estilo TinyBERT, 7.5 veces más pequeño y 9.4 veces más rápido para un estudiante de 4 capas versus BERT BASE [7], como una escala de referencia para lo que constituye una diferencia significativa de tamaño o velocidad, de modo que la diferencia LAYA-versus-cabeza-de-línea-base pueda juzgarse frente a una magnitud conocida.
10. Reporte los resultados como una comparación multiobjetivo, no como una sola tabla de precisión, siguiendo el marco de frontera de Pareto y función de utilidad utilizado para el estudio de BERT versus LLM [1]. Grafique la precisión contra la latencia para ambas configuraciones de cabeza y establezca claramente si una domina a la otra o si existe una compensación genuina.
11. Puntos de fallo comunes a verificar antes de confiar en el resultado: confirme que el adaptador g_i se aplica idénticamente a cada capa para que ninguna capa reciba una ventaja de escala injusta [12]; confirme que los coeficientes de atención alpha_i(x) son realmente dependientes de la entrada y no colapsan a una ponderación fija e independiente de la entrada, ya que el valor de interpretabilidad de LAYA depende de que esto sea cierto [12]; y confirme que la varianza de semilla en la cabeza BERT de línea base, documentada como una inestabilidad conocida [5], no se confunde con un efecto genuino de la cabeza LAYA.
12. Reporte las salidas de interpretabilidad junto con la precisión y la latencia si se usa LAYA, ya que se supone que sus pesos de atención funcionan como una explicación de atribución por capa sin un método post-hoc separado [12]. Verifique cualitativamente si el patrón de uso de capas parece estructurado y dependiente de la tarea, como se reportó para la clasificación de imágenes [12], o si parece uniforme o ruidoso en la tarea de texto, ya que esto no se probó anteriormente y es una observación nueva que este experimento produciría.
Lo que construiríamos
What we would build
Construiríamos una pequeña prueba controlada cara a cara: tomaríamos un único codificador BERT-base preentrenado y le adjuntaríamos dos cabezas, el clasificador [CLS]-más-lineal estándar [5] y un agregador de atención de estilo LAYA construido a partir del cómputo publicado, h_agg = sum_i alpha_i(x) g_i(h_i) seguido de y_hat = phi(W h_agg + b) [12]. Ajustaríamos ambas configuraciones en una tarea binaria, SST-2, y una tarea multiclase, AG News, ya que ambas están nombradas en el conjunto de benchmarks existente de BERT versus LLM [1], en cuatro semillas aleatorias cada una, dada la inestabilidad documentada del ajuste fino de BERT en datos pequeños [5].
Juzgaríamos el resultado en tres ejes juntos, siguiendo el marco multiobjetivo ya utilizado para las comparaciones de BERT versus LLM [1]: macro F1 en datos de prueba no vistos, latencia de inferencia por ejemplo medida en una máquina fija de clase de dispositivo (una CPU de laptop, para mantener la configuración reproducible sin necesidad de hardware especializado), y recuento de parámetros añadido por cada cabeza. Usaríamos el BERT-base ajustado sin modificar con su cabeza estándar como línea base, y trataríamos los números de compresión de TinyBERT, 7.5 veces más pequeño y 9.4 veces más rápido que BERT BASE [7], como una escala de referencia para lo que cuenta como una diferencia de latencia significativa.
En unas pocas semanas, dos personas pueden implementar ambas cabezas, ejecutar el ajuste fino en dos tareas y cuatro semillas, y producir un gráfico de precisión versus latencia por tarea. El costo es modesto: un punto de control BERT-base preentrenado, dos conjuntos de datos públicos pequeños y ejecuciones de ajuste fino en CPU o GPU única, no se requieren simulaciones cuánticas ni llamadas a API de LLM. Esta sería la primera comparación directa reportada entre LAYA y un clasificador BERT-base ajustado en datos de texto, llenando la brecha exacta que esta nota identifica.
Registro de afirmaciones
Registro de afirmaciones
- factrespaldada
Large language models such as GPT-4o and Claude Sonnet 4.5 have demonstrated strong capabilities in open-ended reasoning and generative language tasks.
[1] Cost-Aware Model Selection for Text Classification: Multi-Objective Trade-offs Between Fine-Tuned Encoders and LLM Prompting in Production, abstract arXiv:2602.06370v1“Large language models (LLMs) such as GPT-4o and Claude Sonnet 4.5 have demonstrated strong capabilities in open-ended reasoning and generative language tasks, leading to their widespread adoption across a broad range of NLP applications. However, for structured text classificatio…”
- methodrespaldada
The paper evaluates zero- and few-shot prompt-based large language models and fully fine-tuned encoder-only architectures across four benchmarks (IMDB, SST-2, AG News, and DBPedia), measuring macro F1, inference latency, and monetary cost.
[1] Cost-Aware Model Selection for Text Classification: Multi-Objective Trade-offs Between Fine-Tuned Encoders and LLM Prompting in Production, abstract arXiv:2602.06370v1“Large language models (LLMs) such as GPT-4o and Claude Sonnet 4.5 have demonstrated strong capabilities in open-ended reasoning and generative language tasks, leading to their widespread adoption across a broad range of NLP applications. However, for structured text classificatio…”
- resultrespaldada
Fine-tuned encoder-based models from the BERT family achieve competitive, and often superior, classification performance while operating at one to two orders of magnitude lower cost and latency compared to zero- and few-shot LLM prompting.
[1] Cost-Aware Model Selection for Text Classification: Multi-Objective Trade-offs Between Fine-Tuned Encoders and LLM Prompting in Production, abstract arXiv:2602.06370v1“Large language models (LLMs) such as GPT-4o and Claude Sonnet 4.5 have demonstrated strong capabilities in open-ended reasoning and generative language tasks, leading to their widespread adoption across a broad range of NLP applications. However, for structured text classificatio…”
- methodrespaldada
The paper frames model evaluation as a multi-objective decision problem and analyzes trade-offs using Pareto frontier projections and a parameterized utility function reflecting different deployment regimes.
[1] Cost-Aware Model Selection for Text Classification: Multi-Objective Trade-offs Between Fine-Tuned Encoders and LLM Prompting in Production, section Cost-Aware Model Selection for Text Classification: Multi-Objective Trade-offs Between Fine-Tuned Encoders and LLM Promp“We frame model evaluation as a multi-objective decision problem and analyze trade-offs using Pareto frontier projections and a parameterized utility function reflecting different deployment regimes. Our results show that fine-tuned encoder-based models from the BERT family achiev…”
- factrespaldada
Fine-tuned encoders' open-source nature enables on-premise deployment, offering advantages in privacy, data governance, and reproducibility.
[1] Cost-Aware Model Selection for Text Classification: Multi-Objective Trade-offs Between Fine-Tuned Encoders and LLM Prompting in Production, section Cost-Aware Model Selection for Text Classification: Multi-Objective Trade-offs Between Fine-Tuned Encoders and LLM Promp“We frame model evaluation as a multi-objective decision problem and analyze trade-offs using Pareto frontier projections and a parameterized utility function reflecting different deployment regimes. Our results show that fine-tuned encoder-based models from the BERT family achiev…”
- factrespaldada
For fixed-label text classification, tasks have traditionally been addressed using encoder-only architectures including BERT, RoBERTa, and DistilBERT.
[1] Cost-Aware Model Selection for Text Classification: Multi-Objective Trade-offs Between Fine-Tuned Encoders and LLM Prompting in Production, section 1. Introduction“Despite this broad success, the applicability of LLMs to structured prediction problems warrants closer examination. In fixed-label text classification—where the objective is to assign each input to one of a predefined set of categories—performance alone is rarely the sole determ…”
- factrespaldada
Fine-tuned BERT, RoBERTa, and DistilBERT models achieve strong predictive accuracy while maintaining low inference latency and modest computational footprints.
[1] Cost-Aware Model Selection for Text Classification: Multi-Objective Trade-offs Between Fine-Tuned Encoders and LLM Prompting in Production, section 1. Introduction“Despite this broad success, the applicability of LLMs to structured prediction problems warrants closer examination. In fixed-label text classification—where the objective is to assign each input to one of a predefined set of categories—performance alone is rarely the sole determ…”
- factrespaldada
LLMs generate output token by token even when producing a single class label, introducing inherent latency and usage-based costs.
[1] Cost-Aware Model Selection for Text Classification: Multi-Objective Trade-offs Between Fine-Tuned Encoders and LLM Prompting in Production, section 1. Introduction“The growing reliance on LLMs for classification thus raises an important systems-level question: under what conditions does the generality of large, prompt-driven models justify their operational overhead relative to specialized, fine-tuned encoders? Unlike discriminative encoder…”
- resultrespaldada
The proposed hybrid classical-quantum BERT model achieves performance that is competitive with, and in some cases better than, the classical baselines on standard benchmark datasets.
[2] A Hybrid Classical-Quantum Fine Tuned BERT for Text Classification, abstract arXiv:2511.17677v1“Fine-tuning BERT for text classification can be computationally challenging and requires careful hyper-parameter tuning. Recent studies have highlighted the potential of quantum algorithms to outperform conventional methods in machine learning and text classification tasks. In th…”
- methodrespaldada
The hybrid approach integrates an n-qubit quantum circuit with a classical BERT model for text classification.
[2] A Hybrid Classical-Quantum Fine Tuned BERT for Text Classification, section A Hybrid Classical-Quantum Fine Tuned BERT for Text Classification“Abu Kaisar Mohammad Masum Naveed Mahmud M. Hassan Najafi Sercan Aygun Abstract Fine-tuning BERT for text classification can be computationally challenging and requires careful hyper-parameter tuning. Recent studies have highlighted the potential of quantum algorithms to outperfor…”
- methodrespaldada
The proposed hybrid classical-quantum approach uses an n-qubit quantum circuit to fine-tune a classical BERT model.
[2] A Hybrid Classical-Quantum Fine Tuned BERT for Text Classification, section Introduction“In this work, we propose a hybrid classical-quantum approach for classifying texts. We use an nn-qubit quantum circuit to fine-tune a classical BERT model. We perform a comprehensive evaluation of the proposed method for text classification on a variety of popular datasets. The B…”
- limitationrespaldada
Current quantum hardware is not yet fault-tolerant enough to achieve actual computational speedup, so experiments are performed with quantum circuit simulations.
[2] A Hybrid Classical-Quantum Fine Tuned BERT for Text Classification, section Introduction“In this work, we propose a hybrid classical-quantum approach for classifying texts. We use an nn-qubit quantum circuit to fine-tune a classical BERT model. We perform a comprehensive evaluation of the proposed method for text classification on a variety of popular datasets. The B…”
- factrespaldada
Fine-tuning BERT for specific NLP tasks requires high computational resources and expensive inference time.
[2] A Hybrid Classical-Quantum Fine Tuned BERT for Text Classification, section Introduction“Pre-trained language models such as BERT (Bidirectional Encoder Representations from Transformers) (Devlin et al. 2018), have demonstrated exceptional performance across various language comprehension challenges (Sun et al. 2019). The BERT model effectively learns universal langu…”
- methodrespaldada
BERT generates an embedding vector contextualized through a stack of Transformer blocks for each input token, and prepends a special [CLS] token to the input sentence for classification tasks.
[5] Revisiting Few-sample BERT Fine-tuning, section 2 Background and Related Work“BERT The Bidirectional Encoder Representations from Transformers (Devlin et al., 2019, BERT;) model is a Transformer encoder (Vaswani et al., 2017) trained on raw text using masked language modeling and next-sentence prediction objectives. It generates an embedding vector context…”
- methodrespaldada
For sentence-level classification, an added linear classifier projects the [CLS] embedding to an unnormalized probability vector over the output classes.
[5] Revisiting Few-sample BERT Fine-tuning, section 2 Background and Related Work“BERT The Bidirectional Encoder Representations from Transformers (Devlin et al., 2019, BERT;) model is a Transformer encoder (Vaswani et al., 2017) trained on raw text using masked language modeling and next-sentence prediction objectives. It generates an embedding vector context…”
- factrespaldada
Fine-tuning BERT remains unstable, especially when using BERTLarge on small datasets, where identical learning processes with different random seeds often result in significantly different models.
[5] Revisiting Few-sample BERT Fine-tuning, section 1 Introduction“Fine-tuning self-supervised pre-trained models has significantly boosted state-of-the-art performance on natural language processing (NLP) tasks (Liu, 2019; Yang et al., 2019a; Wadden et al., 2019; Zhu et al., 2020; Guu et al., 2020). One of the most effective models for this pro…”
- factrespaldada
Fine-tuning the pre-trained BERT model on a large intermediate task stabilizes later fine-tuning on small datasets.
[5] Revisiting Few-sample BERT Fine-tuning, section 2 Background and Related Work“Existing work (Phang et al., 2018; Lee et al., 2020; Dodge et al., 2020) shows that these seemingly benign factors can influence the results significantly, especially on small datasets (i.e., << 10K examples). Consequently, practitioners often conduct many random trials of fine-t…”
- factrespaldada
Factors causing instability in few-sample BERT fine-tuning include: the use of a non-standard optimization method with biased gradient estimation, limited applicability of parts of the BERT network, and the use of a pre-determined small number of training iterations.
[5] Revisiting Few-sample BERT Fine-tuning, abstract arXiv:2006.05987v3“This paper is a study of fine-tuning of BERT contextual representations, with focus on commonly observed instabilities in few-sample scenarios. We identify several factors that cause this instability: the common use of a non-standard optimization method with biased gradient estim…”
- factrespaldada
BERT is based on a multi-layer bidirectional Transformer and is trained on plain text for masked word prediction and next sentence prediction tasks.
[6] How to Fine-Tune BERT for Text Classification?, section 1 Introduction“Another kind of pre-training models is sentence-level. Howard and Ruder (2018) propose ULMFiT, a fine-tuning method for pre-trained language model that achieves state-of-the-art results on six widely studied text classification datasets. More recently, pre-trained language models…”
- factrespaldada
BERT is the first fine-tuning based representation model that achieves state-of-the-art results for a range of NLP tasks.
[6] How to Fine-Tune BERT for Text Classification?, section 2.1 Language Model Pre-training“More recently, the method of pre-training language models on a large network with a large amount of unlabeled data and fine-tuning in downstream tasks has made a breakthrough in several natural language understanding tasks, such as OpenAI GPT Radford et al. (2018) and BERT Devlin…”
- resultrespaldada
Fine-tuning BERT produces similar performance to classical models at significant additional cost in automated essay scoring.
[9] Should You Fine-Tune BERT for Automated Essay Scoring?, abstract DOI 10.18653/v1/2020.bea-1.15“Most natural language processing research now recommends large Transformer-based models with fine-tuning for supervised classification tasks; older strategies like bag-ofwords features and linear models have fallen out of favor.Here we investigate whether, in automated essay scor…”
- resultrespaldada
TinyBERT 4 with 4 layers achieves more than 96.8% the performance of its teacher BERT BASE on GLUE benchmark, while being 7.5x smaller and 9.4x faster on inference.
[7] TinyBERT: Distilling BERT for Natural Language Understanding, abstract DOI 10.18653/v1/2020.findings-emnlp.372“Language model pre-training, such as BERT, has significantly improved the performances of many natural language processing tasks.However, pre-trained language models are usually computationally expensive, so it is difficult to efficiently execute them on resourcerestricted device…”
- resultrespaldada
TinyBERT 6 with 6 layers performs on-par with its teacher BERT BASE.
[7] TinyBERT: Distilling BERT for Natural Language Understanding, abstract DOI 10.18653/v1/2020.findings-emnlp.372“Language model pre-training, such as BERT, has significantly improved the performances of many natural language processing tasks.However, pre-trained language models are usually computationally expensive, so it is difficult to efficiently execute them on resourcerestricted device…”
- factrespaldada
Transformer layers are linear in the input dimensionality and quadratic in the input length.
[10] How Crucial is Transformer in Decision Transformer?, section 2 Background“Recently Transformers [27] have become predominant in natural language processing and sequence modeling. Transformer is an architecture for auto-regressive sequence modeling that is purely based on the attention mechanism and does not contain any recurrent or convolutional struct…”
- factrespaldada
Recurrent networks scale linearly in the input length and quadratically in the input dimensionality.
[10] How Crucial is Transformer in Decision Transformer?, section 2 Background“Recently Transformers [27] have become predominant in natural language processing and sequence modeling. Transformer is an architecture for auto-regressive sequence modeling that is purely based on the attention mechanism and does not contain any recurrent or convolutional struct…”
- factrespaldada
LAYA (Layer-wise Attention Aggregator) is a novel output head that dynamically aggregates internal representations through attention.
[12] LAYA: Layer-wise Attention Aggregation for Interpretable Depth-Aware Neural Networks, abstract arXiv:2511.12723v2“Deep neural networks typically rely on the representation produced by their final hidden layer to make predictions, implicitly assuming that this single vector fully captures the semantics encoded across all preceding transformations. However, intermediate layers contain rich and…”
- methodrespaldada
LAYA learns input-conditioned attention weights over layer-wise features.
[12] LAYA: Layer-wise Attention Aggregation for Interpretable Depth-Aware Neural Networks, abstract arXiv:2511.12723v2“Deep neural networks typically rely on the representation produced by their final hidden layer to make predictions, implicitly assuming that this single vector fully captures the semantics encoded across all preceding transformations. However, intermediate layers contain rich and…”
- methodrespaldada
LAYA provides intrinsic layer-attribution scores that explicitly quantify the contribution of each representation to the final decision without external post-hoc explanation methods.
[12] LAYA: Layer-wise Attention Aggregation for Interpretable Depth-Aware Neural Networks, abstract arXiv:2511.12723v2“Deep neural networks typically rely on the representation produced by their final hidden layer to make predictions, implicitly assuming that this single vector fully captures the semantics encoded across all preceding transformations. However, intermediate layers contain rich and…”
- resultrespaldada
Experiments on image classification datasets show that LAYA achieves competitive predictive performance while producing meaningful depth-aware explanations.
[12] LAYA: Layer-wise Attention Aggregation for Interpretable Depth-Aware Neural Networks, abstract arXiv:2511.12723v2“Deep neural networks typically rely on the representation produced by their final hidden layer to make predictions, implicitly assuming that this single vector fully captures the semantics encoded across all preceding transformations. However, intermediate layers contain rich and…”
- factrespaldada
Most architectures ultimately derive their predictions exclusively from the representation produced by the last hidden layer.
[12] LAYA: Layer-wise Attention Aggregation for Interpretable Depth-Aware Neural Networks, section 1 Introduction“The remarkable success of deep neural networks in computer vision is largely attributable to their ability to learn hierarchical representations, progressively transforming raw visual inputs into increasingly abstract representations. Yet, despite differences in architecture and …”
- factrespaldada
Decision Transformer is an offline RL algorithm that auto-regressively models trajectories using the GPT-2 architecture.
[10] How Crucial is Transformer in Decision Transformer?, section 1 Introduction“Transformers [27] have shown impressive results across a number of problem domains in Natural Language Processing [5, 17, 3] and Computer Vision [6, 13]. Inspired by these results, [4, 11] framed Reinforcement Learning (RL) as a sequence modeling problem, in which Transformer pre…”
- resultrespaldada
Decision Transformer struggles with continuous control problems such as inverted pendulum and Furuta pendulum stabilization.
[10] How Crucial is Transformer in Decision Transformer?, abstract arXiv:2211.14655v1“Decision Transformer (DT) is a recently proposed architecture for Reinforcement Learning that frames the decision-making process as an auto-regressive sequence modeling problem and uses a Transformer model to predict the next action in a sequence of states, actions, and rewards. …”
- resultrespaldada
Decision LSTM is able to achieve expert-level performance on inverted pendulum and Furuta pendulum stabilization tasks.
[10] How Crucial is Transformer in Decision Transformer?, abstract arXiv:2211.14655v1“Decision Transformer (DT) is a recently proposed architecture for Reinforcement Learning that frames the decision-making process as an auto-regressive sequence modeling problem and uses a Transformer model to predict the next action in a sequence of states, actions, and rewards. …”
- factrespaldada
LAY A (Layer-wise Attention Aggregator) is a lightweight output module that learns to weight and combine all hidden representations in an input-dependent way.
[12] LAYA: Layer-wise Attention Aggregation for Interpretable Depth-Aware Neural Networks, section 1 Introduction“This work revisits the role of the output stage of deep neural networks. The central idea is that the output layer should not depend exclusively on the deepest representation, but should instead integrate information across depth while simultaneously exposing how different abstra…”
- methodrespaldada
LAY A replaces the standard classifier head with an attention-based aggregator: h_agg = sum_{i=1}^{L} alpha_i(x) g_i(h_i), where alpha_i(x) are learnable, input-conditioned coefficients.
[12] LAYA: Layer-wise Attention Aggregation for Interpretable Depth-Aware Neural Networks, section 1 Introduction“This work revisits the role of the output stage of deep neural networks. The central idea is that the output layer should not depend exclusively on the deepest representation, but should instead integrate information across depth while simultaneously exposing how different abstra…”
- methodrespaldada
Each hidden state in LAY A is mapped into a shared latent space through a lightweight adapter g_i(.), ensuring comparability across layers.
[12] LAYA: Layer-wise Attention Aggregation for Interpretable Depth-Aware Neural Networks, section 1 Introduction“This work revisits the role of the output stage of deep neural networks. The central idea is that the output layer should not depend exclusively on the deepest representation, but should instead integrate information across depth while simultaneously exposing how different abstra…”
- methodrespaldada
The final prediction in LAY A is computed as y_hat = phi(W h_agg + b).
[12] LAYA: Layer-wise Attention Aggregation for Interpretable Depth-Aware Neural Networks, section 1 Introduction“This work revisits the role of the output stage of deep neural networks. The central idea is that the output layer should not depend exclusively on the deepest representation, but should instead integrate information across depth while simultaneously exposing how different abstra…”
- resultrespaldada
Quantitative and qualitative interpretability analyses demonstrate that LAY A's attention scores closely reflect the actual contribution of individual layers.
[12] LAYA: Layer-wise Attention Aggregation for Interpretable Depth-Aware Neural Networks, section LAYA: Layer-wise Attention Aggregation for Interpretable Depth-Aware Neural Networks“Furthermore, quantitative and qualitative interpretability analyses demonstrate that LAYA’s attention scores closely reflect the actual contribution of individual layers, revealing structured, task-dependent patterns of depth utilization while providing intuitive explanations of …”
- resultrespaldada
LAY A reveals structured, task-dependent patterns of depth utilization while providing intuitive explanations of how different abstraction levels contribute to each prediction.
[12] LAYA: Layer-wise Attention Aggregation for Interpretable Depth-Aware Neural Networks, section LAYA: Layer-wise Attention Aggregation for Interpretable Depth-Aware Neural Networks“Furthermore, quantitative and qualitative interpretability analyses demonstrate that LAYA’s attention scores closely reflect the actual contribution of individual layers, revealing structured, task-dependent patterns of depth utilization while providing intuitive explanations of …”
- factrespaldada
Empirical and theoretical studies suggest that different layers capture distinct and complementary aspects of the input: early layers encode local patterns, middle layers capture structural relations, and deeper layers represent increasingly abstract semantics.
[12] LAYA: Layer-wise Attention Aggregation for Interpretable Depth-Aware Neural Networks, section 1 Introduction“However, empirical and theoretical studies suggest that different layers capture distinct and complementary aspects of the input: early layers encode local patterns, middle layers capture structural relations, and deeper layers represent increasingly abstract semantics (e.g., (Ba…”
Fuentes
Fuentes
- [1]Alberto Andres Valdes Gonzalez. Cost-Aware Model Selection for Text Classification: Multi-Objective Trade-offs Between Fine-Tuned Encoders and LLM Prompting in Production. arXiv, 2026.
- [2]Abu Kaisar Mohammad Masum, Naveed Mahmud, M. Hassan Najafi, Sercan Aygun. A Hybrid Classical-Quantum Fine Tuned BERT for Text Classification. arXiv, 2025.
- [3]Ji Xin, Raphael Tang, Yaoliang Yu, Jimmy Lin. BERxiT: Early Exiting for BERT with Better Fine-Tuning and Extension to Regression, 2021.
- [4]Dhendy Zaki Ridwan, Panji Peksi Brajangan. Vibration-Based Operational State Classification of Wheel Loaders: A Feasibility Study Using Decision Tree and Time-Frequency Features. 2025 2nd Beyond Technology Summit on Informatics International Conference (BTS-I2C), 2025.
- [5]Tianyi Zhang, Felix Wu, Arzoo Katiyar, Kilian Q. Weinberger, Yoav Artzi. Revisiting Few-sample BERT Fine-tuning. arXiv, 2020.
- [6]Chi Sun, Xipeng Qiu, Yige Xu, Xuanjing Huang. How to Fine-Tune BERT for Text Classification?. arXiv, 2019.
- [7]Xiaoqi Jiao, Yichun Yin, Lifeng Shang, Xin Ran Jiang, Xiao Dong Chen, Linlin Li. TinyBERT: Distilling BERT for Natural Language Understanding, 2020.
- [8]Xinjie Lin, Gang Xiong, Gaopeng Gou, Zhen Li, Junzheng Shi, Jing Hua Yu. ET-BERT: A Contextualized Datagram Representation with Pre-training Transformers for Encrypted Traffic Classification. Proceedings of the ACM Web Conference 2022, 2022.
- [9]Elijah Mayfield, Alan W. Black. Should You Fine-Tune BERT for Automated Essay Scoring?, 2020.
- [10]Max Siebenborn, Boris Belousov, Junning Huang, Jan Peters. How Crucial is Transformer in Decision Transformer?. arXiv, 2022.
- [11]Xiaoqi Jiao, Yichun Yin, Lifeng Shang, Xin Ran Jiang, Xiao Chen, Linlin Li. TinyBERT: Distilling BERT for Natural Language Understanding. arXiv (Cornell University), 2019.
- [12]Gennaro Vessio. LAYA: Layer-wise Attention Aggregation for Interpretable Depth-Aware Neural Networks. arXiv, 2025.
- [13]Shital Dupare, Prof. Jayant Adhikari. A Survey on Flood Predication and Classification using Machine learning. Zenodo (CERN European Organization for Nuclear Research), 2023.
- [14]Magdalena Rybicka, J. Villalba, N. Dehak, K. Kowalczyk. End-to-End Neural Speaker Diarization with an Iterative Refinement of Non-Autoregressive Attention-based Attractors. Interspeech, 2022.
- [15]Sergey S. Averyanov, Andrey S. Trofimov. Analysing Non-Ensemble Machine Learning Methods for Solving the Transient Classification Problem. Educational Data Mining, 2025.
- [16]Sajith Ranatunga, Rune Strand Ødegård, Knut Jetlund, Bjørn Arild Godager, C. Storie, J. Storie. From remote sensing to decision-making: a web-based platform for near-real-time land cover classification. International Journal of Digital Earth, 2026.
- [17]Jiatao Gu, Xiang Kong. Fully Non-autoregressive Neural Machine Translation: Tricks of the Trade, 2021.
- [18]Yakoub Bazi, Laila Bashmal, Mohamad Mahmoud Al Rahhal, Reham Al-Dayil, Naif Al Ajlan. Vision Transformers for Remote Sensing Image Classification. Remote Sensing, 2021.
- [19]Ce Zhou, Qian Li, Chen Li, Jun Yu, Yixin Liu, Guangjing Wang. A Comprehensive Survey on Pretrained Foundation Models: A History from BERT to ChatGPT. arXiv (Cornell University), 2023.
- [20]Zhuoyan Li, Hangxiao Zhu, Zhuoran Lu, Ming Yin. Synthetic Data Generation with Large Language Models for Text Classification: Potential and Limitations, 2023.