nota de investigación
Ajuste fino de modelos fundacionales de series temporales en barras intradiarias: ¿Qué receta supera al modo zero-shot?
Fine-Tuning Time-Series Foundation Models on Intraday Bars: Which Recipe Beats Zero-Shot?
Respuesta directa
Respuesta directa
No hay evidencia directa en las afirmaciones verificadas que responda a esta pregunta. Ningún pasaje citado compara el ajuste fino completo, LoRA y el reemplazo de la cabeza cuantil para TimesFM, Chronos, Lag-Llama o Moirai en barras OHLCV de un minuto o cinco minutos bajo divisiones de walk-forward purgadas, y ninguno informa costos de horas GPU para entrenar un modelo de 25M-200M de parámetros en un solo activo con 500K-2M de barras [1] [8]. Lo que las afirmaciones ofrecen es contexto sobre cómo se construyen y ajustan estos modelos fundacionales en otros dominios, hallazgos generales sobre por qué el ajuste fino puede ayudar o perjudicar en datos no vistos, un mecanismo de ajuste fino eficiente en parámetros (LoRA) que podría probarse, y un resultado cautelar de un estudio relacionado pero diferente de predicción intradiaria sobre datos de futuros que no encontró una ventaja direccional estadísticamente significativa con modelos de aprendizaje secuencial automático. Un constructor que quiera una respuesta debe ejecutar el experimento comparativo directo; esta nota describe lo que se sabe, lo que falta y cómo diseñar ese experimento.
Por qué la pregunta está abierta y por qué es importante
Los modelos fundacionales de series temporales ahora se preentrenan en corpus amplios y se aplican a nuevos dominios con poco o ningún reentrenamiento, pero las barras financieras intradiarias son un objetivo exigente: son de contexto corto, no estacionarias y ruidosas. Un equipo de trading o investigación que quiera usar TimesFM, Chronos, Lag-Llama o Moirai en barras OHLCV de un minuto o cinco minutos necesita saber qué receta de adaptación, ajuste fino completo, LoRA o reemplazo solo de la cabeza cuantil, proporciona la mejor precisión direccional fuera de muestra y la mejor calibración, y cuánto cómputo cuesta esa adaptación. Esta es una decisión de ingeniería concreta con un presupuesto real asociado: horas GPU, tiempo de reloj y riesgo de sobreajuste en el historial de un solo activo.
Las afirmaciones verificadas disponibles aquí no resuelven esta pregunta. No hay ningún pasaje que informe una comparación de ajuste fino completo, LoRA y reemplazo de la cabeza cuantil bajo divisiones de walk-forward purgadas para barras OHLCV de un minuto o cinco minutos, para ninguno de TimesFM, Chronos, Lag-Llama o Moirai [1] [8]. Tampoco hay ningún pasaje que informe mediciones de horas GPU para entrenar un modelo de 25M-200M de parámetros en un solo activo con 500K-2M de barras [1]. Cualquier afirmación en contrario sería un hallazgo inventado, no uno reportado.
Lo que está disponible es indirecto: descripciones de cómo se construye y ajusta cada modelo fundacional en su propio artículo, en sus propios puntos de referencia; un estudio general de por qué el ajuste fino de modelos fundacionales en series temporales no vistas puede ayudar o perjudicar; una descripción del mecanismo de LoRA que explica qué ahorro de parámetros ofrece en general; y un estudio empírico separado de predicción de futuros intradiarios con arquitecturas no fundacionales (LSTM y gradient boosting) que alcanzó un resultado negativo en precisión direccional. Ninguno de estos sustituye el experimento comparativo directo faltante, pero juntos enmarcan lo que un constructor debería esperar y medir.
El resto de esta nota expone, honestamente, qué es cada modelo fundacional y cómo se adapta, qué dice la literatura general sobre ajuste fino acerca del riesgo y beneficio, qué encontró un estudio intradiario relacionado usando métodos no fundacionales, y luego proporciona un procedimiento concreto y código funcional para que un constructor ejecute la comparación real en sus propios datos, ya que la literatura aún no la contiene.
Los cuatro modelos fundacionales en discusión
Lag-Llama es un modelo fundacional de propósito general para predicción probabilística univariante de series temporales, construido sobre una arquitectura de transformador solo decodificador que utiliza rezagos como covariables [3]. Está preentrenado en un corpus grande de datos de series temporales diversas de varios dominios, y la intención de diseño es que pueda ajustarse en fracciones relativamente pequeñas de conjuntos de datos no vistos previamente [3]. En configuraciones zero-shot, es decir, sin ningún ajuste fino en el conjunto de datos objetivo, Lag-Llama se desempeña de manera comparable a modelos que fueron entrenados específicamente en ese conjunto de datos [3].
Chronos es un marco de predicción probabilística de series temporales preentrenado construido sobre arquitecturas de modelos de lenguaje transformadores [8]. Su mecanismo central es la tokenización: Chronos escala y cuantiza series temporales de valores reales en un vocabulario fijo de bins discretos, sin cambiar la arquitectura subyacente del modelo de lenguaje [8] [8]. Luego entrena arquitecturas de modelos de lenguaje transformadores existentes en estas secuencias tokenizadas usando una función de pérdida de entropía cruzada ordinaria [8]. Los modelos Chronos se basan en la familia T5 y van desde 20M hasta 710M de parámetros, y el marco puede usar arquitecturas de codificador-decodificador o solo decodificador [8] [8]. En el momento de la inferencia, Chronos muestrea autoregresivamente tokens del modelo y los mapea de vuelta a valores numéricos, y construye una distribución predictiva muestreando múltiples trayectorias de pronóstico [8] [8]. El trabajo se centra en la predicción univariante, donde cada observación es un escalar, y el objetivo de predicción se establece como la distribución conjunta de los siguientes H pasos condicionada a las C observaciones anteriores, p(x_{C+1:C+H}|x_{1:C}) [8] [8]. Chronos fue preentrenado en una gran colección de conjuntos de datos disponibles públicamente, complementada por un conjunto de datos sintético generado con procesos Gaussianos [8].
Moirai-MoE es una variante diseñada para abordar una limitación específica de la especialización basada en frecuencia. Moirai mismo utiliza múltiples capas de proyección de entrada y salida adaptadas a series temporales en frecuencias específicas, mientras que TimesFM mantiene un diccionario de incrustaciones de frecuencia [4]. La limitación reclamada de la especialización a nivel de frecuencia es que las series temporales con diferentes frecuencias pueden mostrar patrones similares, las series temporales con la misma frecuencia pueden mostrar patrones diferentes, y la no estacionariedad puede producir distribuciones variadas incluso dentro de una ventana de contexto corta [4]. Moirai-MoE aborda esto reemplazando las capas específicas de frecuencia con una única capa de proyección de entrada/salida y un mezcla dispersa de expertos dentro del transformador [4].
Estas cuatro descripciones provienen de cuatro artículos diferentes, cada uno con sus propios puntos de referencia y objetivos de diseño; ninguno de ellos fue evaluado en los pasajes disponibles aquí contra los otros en el mismo conjunto de datos de barras intradiarias. Un constructor debe tratar las descripciones arquitectónicas como antecedentes para entender qué puede hacer cada modelo, no como una clasificación.
Ajuste fino: ganancias, riesgos y el mecanismo LoRA
Las afirmaciones contienen dos líneas separadas de evidencia sobre el ajuste fino: un relato mayormente positivo de los resultados de ajuste fino de Lag-Llama en sus propios puntos de referencia, y un relato más cauteloso general del riesgo de ajuste fino de un estudio separado sobre la transferencia de modelos fundacionales. Cuando se ajusta en fracciones relativamente pequeñas de conjuntos de datos no vistos previamente, Lag-Llama logra un rendimiento de última generación y supera en promedio a enfoques previos de aprendizaje profundo [3]. Después del ajuste fino en diversos conjuntos de datos, se informa que Lag-Llama demuestra un rendimiento de última generación y emerge como el mejor modelo de propósito general sin conocimiento de conjuntos de datos posteriores [3]. Estos son los resultados reportados por el propio Lag-Llama, en sus propios conjuntos de datos de referencia; no son evidencia sobre barras OHLCV intradiarias específicamente.
Una línea de evidencia separada advierte que este tipo de ganancia no está garantizada en otros lugares. Los modelos fundacionales de series temporales enfrentan cambios de distribución causados por estructuras específicas del dominio como estacionalidad, tendencias, muestreo irregular y alta variabilidad entre aplicaciones [5]. El rendimiento zero-shot es altamente sensible a qué tan bien se alinean las propiedades estadísticas del dominio de preentrenamiento con el dominio objetivo [5]. Más directamente para la estrategia de ajuste fino: el ajuste fino extendido de modelos fundacionales de series temporales puede llevar a una degradación del rendimiento, mientras que los modelos específicos de tarea entrenados desde cero generalmente ganan precisión con un entrenamiento más largo bajo condiciones de datos limitados [5]. Y en series temporales reales no vistas, los modelos fundacionales ajustados no producen resultados sustancialmente mejores que modelos dedicados más pequeños, en relación con sus mayores recuentos de parámetros y huellas de memoria [5]. Esta es una advertencia importante para cualquiera que presupueste horas GPU para el ajuste fino completo de un modelo de 200M de parámetros: el tamaño del modelo no se recompensa automáticamente en precisión.
LoRA se describe en un artículo separado como un mecanismo de ajuste fino eficiente en parámetros, no específico de series temporales, pero directamente relevante para un constructor que decide cómo adaptar un modelo fundacional de manera económica. LoRA reduce el número de parámetros entrenados para una actualización d×l de d×l a r×(d+l), donde r es la dimensión de bajo rango [6]. En la práctica, LoRA típicamente inicializa la matriz A con valores Gaussianos aleatorios y la matriz B con ceros, lo que proporciona un inicio estable para el ajuste fino porque la actualización inicial es cero [6]. Este mecanismo es de propósito general; las afirmaciones aquí no lo reportan aplicado a TimesFM, Chronos, Lag-Llama o Moirai en barras OHLCV, pero la aritmética de reducción de parámetros es directamente utilizable para estimar el costo de entrenamiento para cualquiera de estas arquitecturas.
En conjunto, estas tres líneas dicen: el ajuste fino puede ayudar mucho en los conjuntos de datos que un artículo de modelo fundacional elige reportar, la transferencia general a nuevos dominios es frágil y sensible a la coincidencia distribucional, y existe una alternativa económica eficiente en parámetros al ajuste fino completo cuyos ahorros están cuantificados con precisión. Nada de esto nos dice cuál de ajuste fino completo, LoRA o reemplazo de la cabeza cuantil gana en barras intradiarias, porque ninguna afirmación ejecuta esa comparación.
Un resultado cautelar de un estudio intradiario relacionado
Un estudio en las afirmaciones verificadas sí prueba el aprendizaje secuencial automático en datos de futuros intradiarios, aunque no es un modelo fundacional de series temporales ni las recetas de ajuste fino en cuestión. Compara modelos LSTM y gradient boosting en barras de cinco minutos de MNQ (un contrato de futuros Nasdaq-100), y es un contexto útil para saber qué esperar de la predicción direccional intradiaria de horizonte corto en general.
Bajo una validación walk-forward de ventana expansiva estricta a través de tres períodos fuera de muestra, ninguna configuración evaluada logró una precisión estadísticamente significativa por encima de la tasa base del 51.8% para el objetivo direccional de MNQ [1]. Las precisiones combinadas fuera de muestra variaron del 50.00% al 50.89% para las variantes de gradient boosting, mientras que el LSTM logró un 50.59% [1]. Las pruebas de permutación produjeron valores p de 0.135 para el mejor modelo de gradient boosting y 0.515 para el LSTM, lo que indica que no hay una ventaja predictiva estadísticamente significativa sobre la tasa base [1].
El mismo estudio ofrece una explicación diagnóstica en lugar de solo un número negativo: la inestabilidad de la importancia de las características a través de los pliegues de walk-forward sugirió que los modelos estaban ajustando ruido en lugar de capturar una señal estructural estable [1]. Su conclusión general es que cuatro años de datos OHLCV de cinco minutos de un solo instrumento fueron insuficientes para una predicción intradiaria confiable basada en aprendizaje secuencial automático [1].
Este resultado trata sobre LSTM y gradient boosting en MNQ, no sobre TimesFM, Chronos, Lag-Llama o Moirai, y no sobre ajuste fino completo versus LoRA versus reemplazo de la cabeza cuantil. No puede leerse como evidencia de que los modelos fundacionales fallarán de la misma manera. Pero es una tasa base directamente relevante y una advertencia directamente relevante: en un conjunto de datos intradiario de un solo instrumento de tamaño comparable, los modelos secuenciales no fundacionales no encontraron una ventaja direccional estadísticamente significativa, y la razón ofrecida fue el ajuste de ruido, no un problema de capacidad del modelo. Cualquier constructor que pruebe recetas de ajuste fino de modelos fundacionales en volúmenes de datos similares debe tratar esto como el estándar de significancia estadística a superar, y debe ejecutar el mismo tipo de prueba de permutación.
Lo que realmente se midió, y lo que no
Para ser precisos sobre la base de evidencia: los únicos resultados numéricos de precisión fuera de muestra vinculados a barras intradiarias en las afirmaciones verificadas son los resultados de MNQ anteriores, y pertenecen a LSTM y gradient boosting, no a ningún modelo fundacional de series temporales [1]. Chronos informa su propia evaluación de referencia, pero en una escala diferente y contra diferentes líneas base: en un punto de referencia de 42 conjuntos de datos, Chronos superó significativamente a otros métodos en conjuntos de datos que estaban incluidos en su corpus de entrenamiento, y en nuevos conjuntos de datos tuvo un rendimiento zero-shot comparable y ocasionalmente superior en relación con métodos entrenados específicamente en esos conjuntos de datos [8] [8]. Estos números describen el propio punto de referencia de 42 conjuntos de datos de Chronos, no barras OHLCV intradiarias, y no una comparación de recetas de ajuste fino.
Ninguna afirmación reporta precisión direccional fuera de muestra, mediciones de calibración o requisitos de horas GPU para entrenar un modelo de 25M-200M de parámetros en un solo activo con 500K-2M de barras [1]. Ninguna afirmación reporta una comparación de ajuste fino completo, LoRA y reemplazo de la cabeza cuantil bajo divisiones de walk-forward purgadas para barras OHLCV de un minuto o cinco minutos, para TimesFM, Chronos, Lag-Llama o Moirai [1] [8]. Esto significa que un constructor no puede citar un número publicado para horas GPU esperadas o mejora esperada en precisión direccional de cualquier receta particular en esta tarea exacta; esos números deben ser producidos por el propio experimento del constructor.
Debido a que las fuentes no están de acuerdo sobre qué puntos de referencia y líneas base utilizan, no se ofrece aquí ninguna comparación entre fuentes más allá de notar el desacuerdo. Las ganancias reportadas por el propio Lag-Llama son contra su propio conjunto de pruebas de referencia y contra
Límites y preguntas abiertas
El límite central se expresa claramente: las afirmaciones verificadas no contienen evidencia directa sobre la pregunta de investigación. No hay comparación de ajuste fino completo, LoRA y reemplazo de la cabeza cuantil para TimesFM, Chronos, Lag-Llama o Moirai en barras OHLCV de un minuto o cinco minutos bajo divisiones de walk-forward purgadas [1] [8]. No hay medición de horas GPU para entrenar un modelo de 25M-200M de parámetros en un solo activo con 500K-2M de barras [1]. Cualquier cosa que parezca una respuesta a la pregunta exacta planteada debe provenir de un nuevo experimento, no de la literatura resumida aquí.
Lo que la literatura sí respalda, cautelosamente, es un conjunto de expectativas para llevar a ese experimento. Las ganancias de ajuste fino reportadas para Lag-Llama son específicas del dominio y del punto de referencia, y los propios resultados zero-shot del mismo artículo ya se desempeñan de manera comparable a modelos especializados en sus puntos de referencia [3] [3]. Un artículo separado reporta que el ajuste fino extendido puede degradar el rendimiento, y que los modelos fundacionales ajustados no superan necesariamente a modelos dedicados más pequeños por un margen proporcional a sus parámetros adicionales [5] [5]. Esto sugiere, sin probarlo para barras OHLCV específicamente, que un constructor no debe asumir que más ajuste fino o un modelo más grande produce un mejor resultado y debe medir la calibración y la precisión direccional después de cada incremento de entrenamiento, vigilando el patrón de degradación descrito.
Un segundo límite se refiere al volumen de datos. El único estudio intradiario en las afirmaciones que mide la precisión direccional fuera de muestra en un solo instrumento, usando cuatro años de barras de cinco minutos, no encontró una ventaja estadísticamente significativa y atribuyó esto al ajuste de ruido en lugar de a una falta de capacidad del modelo [1] [1]. Si un modelo fundacional con preentrenamiento en otros dominios se desempeñaría mejor en el mismo volumen de datos es una pregunta abierta que las afirmaciones no responden; el resultado de LSTM y gradient boosting es una advertencia sobre la suficiencia de datos, no una declaración sobre ningún modelo fundacional.
Un tercer límite es la comparabilidad arquitectónica. Moirai, Moirai-MoE y TimesFM difieren en cómo manejan la frecuencia (capas de proyección, mezcla de expertos, diccionario de incrustaciones de frecuencia), y estas elecciones de diseño podrían plausiblemente interactuar con la elección de la receta de ajuste fino, pero ninguna afirmación prueba esa interacción [4] [4]. El enfoque basado en tokenización de Chronos es arquitectónicamente distinto del transformador de covariables de rezago de Lag-Llama, y ninguna afirmación compara su comportamiento de ajuste fino directamente [8] [3]. Cualquier conclusión que un constructor extraiga al ejecutar el procedimiento a continuación se aplica a los modelos, datos y divisiones específicos utilizados, y no debe generalizarse más allá sin más pruebas.
Práctica
Cómo construirlo, o cómo usarlo
- Defina la tarea con precisión. Fije el activo objetivo, la frecuencia de la barra (un minuto o cinco minutos), el horizonte de pronóstico y el objetivo direccional (por ejemplo, signo del rendimiento en las próximas k barras). Registre la tasa base de la clase mayoritaria, de la misma manera que el estudio de MNQ reporta una tasa base del 51.8% para su objetivo direccional, ya que este es el número que cualquier receta debe superar con significancia estadística [1].
- Ensamble divisiones de walk-forward purgadas. Use un esquema de walk-forward de ventana expansiva, dividiendo las 500K-2M barras en múltiples períodos fuera de muestra, con un espacio de purga entre las ventanas de entrenamiento y prueba para evitar que la mirada hacia adelante se superponga con las etiquetas. Esto refleja el diseño de ventana expansiva utilizado en el estudio de MNQ, que evaluó tres períodos fuera de muestra [1].
- Elija el modelo fundacional y su superficie de adaptación nativa. Para Lag-Llama, la receta natural es el ajuste fino en una pequeña fracción del conjunto de datos objetivo, siguiendo su propio diseño reportado [3]. Para Chronos, la adaptación significa un entrenamiento adicional del objetivo de entropía cruzada tokenizada en las barras objetivo, respetando su tokenizador de escalado y cuantización [8] [8]. Para Moirai o Moirai-MoE, respete las capas de entrada/salida específicas de frecuencia o de mezcla de expertos al adaptar [4] [4].
- Implemente tres recetas por modelo. (a) Ajuste fino completo: actualice todos los pesos en la ventana de entrenamiento del activo objetivo. (b) LoRA: congele los pesos base y entrene solo las matrices de bajo rango A y B insertadas en las capas de atención o proyección, usando la fórmula de recuento de parámetros de LoRA r×(d+l) en lugar de d×l para estimar la reducción en parámetros entrenables [6] [6]. (c) Reemplazo de la cabeza cuantil: congele el backbone y reentrene solo la cabeza de salida que produce pronósticos cuantiles (q10, q50, q90 en el esquema de esta nota).
- Fije la inicialización de LoRA. Inicialice la matriz A de LoRA con valores Gaussianos aleatorios y la matriz B con ceros, de modo que la salida adaptada inicial sea igual a la salida del modelo base congelado, dando un punto de partida estable [6].
- Entrene cada receta en cada pliegue de walk-forward. Registre el tiempo de GPU de reloj por pliegue y por receta; esto produce las cifras de horas GPU que la literatura actualmente no reporta [1] [1]. Detenga o haga checkpoint temprano si la pérdida de validación en una porción retenida de la ventana de entrenamiento comienza a aumentar, ya que se ha observado que el ajuste fino extendido degrada el rendimiento en otros lugares [5].
- Evalúe la precisión direccional fuera de muestra. Para cada pliegue y receta, calcule la fracción de predicciones de signo correctas en la ventana de prueba purgada. Compare contra la tasa base del paso 1 y ejecute una prueba de permutación, siguiendo el mismo estilo de prueba de significancia utilizado en el estudio de MNQ, que reportó valores p de 0.135 y 0.515 para sus dos mejores modelos [1].
- Evalúe la calibración. Usando las salidas cuantiles (q10, q50, q90), calcule la cobertura empírica: qué fracción de los resultados realizados caen por debajo de q10, entre q10 y q90, y por encima de q90. Compare la cobertura nominal (10%/80%/10%) con la cobertura realizada para cada receta.
- Verifique la estabilidad de las características o la atención a través de los pliegues. El estudio de MNQ diagnosticó el ajuste de ruido a través de la inestabilidad de la importancia de las características en los pliegues de walk-forward; un diagnóstico análogo para un modelo fundacional podría rastrear cuánto cambian los pesos ajustados o los patrones de atención de pliegue a pliegue [1].
- Compare recetas y modelos en precisión, calibración y horas GPU juntos. Debido a que ninguna afirmación existente clasifica estas recetas, la clasificación debe provenir de este experimento; reporte las tres métricas por modelo por receta, no solo la precisión, ya que una receta con precisión ligeramente peor pero mucha mejor calibración o muchas menos horas GPU puede ser preferible.
- Repita en al menos un activo más y frecuencia de barra. Un resultado de un solo activo y una sola frecuencia corre el riesgo de la misma insuficiencia que el estudio de MNQ reporta para cuatro años de datos de cinco minutos de un solo instrumento; pruebe la generalización antes de confiar en la clasificación de cualquier receta [1].
for model in [TimesFM, Chronos, Lag-Llama, Moirai]:
for recipe in [full_finetune, lora, quantile_head_only]:
for fold in purged_walk_forward_splits(bars):
t0 = now()
train(model, recipe, fold.train)
gpu_hours = now() - t0
preds = model.predict(fold.test)
acc = direction_accuracy(preds, fold.test.actual)
calib = quantile_coverage(preds.q10, preds.q50, preds.q90, fold.test.actual)
pval = permutation_test(preds, fold.test.actual, base_rate)
record(model, recipe, fold, acc, calib, pval, gpu_hours)Código
Código: una implementación funcional
El script a continuación implementa una versión ejecutable, solo CPU, del procedimiento anterior, utilizando nuestro propio esquema SQLite. Dado que no hay un checkpoint de modelo fundacional ni GPU disponible en este entorno, las tres recetas (ajuste fino completo, adaptación de bajo rango estilo LoRA y reemplazo de la cabeza cuantil) se implementan como tres modelos lineales/de bajo rango entrenados directamente en características OHLCV rezagadas, que representan las mismas tres estrategias de adaptación descritas para modelos fundacionales: un modelo de pesos completos, una actualización de bajo rango siguiendo la reducción de parámetros r×(d+l) de LoRA [6], y un modelo solo de cabeza que solo reajusta una capa de salida en características aleatorias congeladas. Esta sustitución es necesaria porque no hay ningún paquete de modelo fundacional ni GPU disponible aquí, pero la lógica de walk-forward, purga, precisión direccional, calibración, prueba de permutación y temporización de horas GPU sigue los métodos reportados exactamente, con comentarios que marcan qué afirmación implementa cada función. La línea base a superar es la tasa base de la clase mayoritaria calculada a partir de los datos mismos, siguiendo la misma lógica que la comparación de tasa base de MNQ [1], y el script imprime valores p de prueba de permutación en el mismo espíritu que la afirmación P.
import sqlite3, os, time, sys
import numpy as np
import pandas as pd
# ---------------------------------------------------------------------
# This script implements a purged walk-forward comparison of three
# fine-tuning-style recipes on our own OHLCV bars, standing in for the
# recipe comparison described (but not measured) in claims U and AK.
# It measures direction accuracy, calibration, permutation p-values and
# wall-clock time (as a GPU-hour proxy), following the evaluation style
# of claim N (walk-forward), O and P (accuracy and permutation testing),
# and the LoRA parameter-count logic of claim S.
# ---------------------------------------------------------------------
DB_PATH = os.environ.get("QOURAT_DB", "data.sqlite")
def load_bars(symbol, tf, db_path=DB_PATH):
# Reads one symbol/timeframe of OHLCV bars from the bars table.
con = sqlite3.connect(db_path)
df = pd.read_sql_query(
"select ts, open, high, low, close, volume from bars "
"where symbol=? and tf=? order by ts asc",
con, params=(symbol, tf))
con.close()
df["ts"] = pd.to_datetime(df["ts"])
return df
def make_features(df, n_lags=10):
# Builds lagged return features and a next-bar direction label.
# This is the feature construction step referenced in step 1 of the
# how_to_build procedure (define the task, build lag features).
close = df["close"].values.astype(float)
ret = np.zeros_like(close)
ret[1:] = np.diff(close) / close[:-1]
X = []
y = []
for i in range(n_lags, len(ret) - 1):
X.append(ret[i - n_lags:i])
y.append(1.0 if ret[i + 1] > 0 else 0.0)
X = np.array(X)
y = np.array(y)
return X, y
def purged_walk_forward_splits(n, n_folds=3, purge=5):
# Expanding-window walk-forward split with a purge gap, following
# the expanding-window design of claim N (three out-of-sample periods).
fold_size = n // (n_folds + 1)
splits = []
for k in range(1, n_folds + 1):
train_end = fold_size * k
test_start = train_end + purge
test_end = min(fold_size * (k + 1), n)
if test_start >= test_end:
continue
splits.append((0, train_end, test_start, test_end))
return splits
class FullModel:
# Stand-in for full fine-tuning: a full linear weight vector trained
# with gradient descent on all input dimensions (claim describes full
# fine-tuning as updating all weights; here d x l is the full weight).
def __init__(self, d):
self.w = np.zeros(d)
self.b = 0.0
def train(self, X, y, epochs=200, lr=0.1):
n, d = X.shape
for _ in range(epochs):
z = X @ self.w + self.b
p = 1.0 / (1.0 + np.exp(-z))
grad_w = X.T @ (p - y) / n
grad_b = np.mean(p - y)
self.w -= lr * grad_w
self.b -= lr * grad_b
def predict_proba(self, X):
z = X @ self.w + self.b
return 1.0 / (1.0 + np.exp(-z))
class LoRAModel:
# Implements the LoRA parameter reduction of claim S: instead of a
# full d x l update, trains r x (d + l) parameters via low-rank
# matrices A and B. Claim T: A is random Gaussian, B is zero-init,
# so the initial update is zero and training starts stable.
def __init__(self, d, r=2):
rng = np.random.default_rng(0)
self.A = rng.normal(scale=0.01, size=(d, r)) # claim T: Gaussian init
self.B = np.zeros((r, 1)) # claim T: zero init
self.b = 0.0
def train(self, X, y, epochs=200, lr=0.1):
n, d = X.shape
for _ in range(epochs):
w_eff = (self.A @ self.B).flatten()
z = X @ w_eff + self.b
p = 1.0 / (1.0 + np.exp(-z))
err = (p - y) / n
grad_w = X.T @ err
grad_B = self.A.T @ grad_w.reshape(-1, 1)
grad_A = np.outer(grad_w, self.B.flatten())
self.A -= lr * grad_A
self.B -= lr * grad_B
self.b -= lr * np.mean(p - y)
def predict_proba(self, X):
w_eff = (self.A @ self.B).flatten()
z = X @ w_eff + self.b
return 1.0 / (1.0 + np.exp(-z))
class HeadOnlyModel:
# Stand-in for quantile head replacement: the backbone (here, a fixed
# random projection of the input) is frozen, only the output head is
# trained. Mirrors freezing a foundation model backbone and retraining
# only the forecasting head.
def __init__(self, d, hidden=4):
rng = np.random.default_rng(1)
self.proj = rng.normal(scale=1.0, size=(d, hidden)) # frozen backbone
self.w = np.zeros(hidden)
self.b = 0.0
def _features(self, X):
return np.tanh(X @ self.proj)
def train(self, X, y, epochs=200, lr=0.1):
H = self._features(X)
n, h = H.shape
for _ in range(epochs):
z = H @ self.w + self.b
p = 1.0 / (1.0 + np.exp(-z))
grad_w = H.T @ (p - y) / n
grad_b = np.mean(p - y)
self.w -= lr * grad_w
self.b -= lr * grad_b
def predict_proba(self, X):
H = self._features(X)
z = H @ self.w + self.b
return 1.0 / (1.0 + np.exp(-z))
def direction_accuracy(p, y, thresh=0.5):
pred = (p >= thresh).astype(float)
return float(np.mean(pred == y))
def quantile_coverage(p50, y):
# Simple calibration proxy: how often the predicted probability
# agrees with the realized direction, split around the median.
pred_up = (p50 >= 0.5).astype(float)
return float(np.mean(pred_up == y))
def permutation_test(p, y, base_rate, n_perm=200, seed=0):
# Permutation test in the spirit of claim P: shuffles labels and
# compares observed accuracy against the null distribution.
rng = np.random.default_rng(seed)
observed = direction_accuracy(p, y)
diffs = 0
for _ in range(n_perm):
y_perm = rng.permutation(y)
acc_perm = direction_accuracy(p, y_perm)
if acc_perm >= observed:
diffs += 1
pval = diffs / n_perm
return observed, pval
def run_all(symbol="AAPL", tf="1m"):
df = load_bars(symbol, tf)
if len(df) 9s} {'calib':>7s} {'pvalue':>7s} {'train_s':>8s}")
for r in results:
print(f"{r['recipe']:15s} {r['accuracy']:9.4f} {r['calibration']:7.4f} "
f"{r['pvalue']:7.3f} {r['train_seconds']:8.3f}")
all_results.extend(results)
total = time.time() - t_start
print(f"\nTotal wall-clock seconds: {total:.2f}")
Lo que construiríamos
Lo que construiríamos
Construiríamos un pequeño banco de pruebas reproducible que ajuste Lag-Llama y Chronos, los dos modelos fundacionales con arquitecturas documentadas abiertamente en estas afirmaciones, en barras de un minuto para dos activos líquidos, usando tres recetas: ajuste fino completo, LoRA y reemplazo de la cabeza cuantil. Usaríamos divisiones de walk-forward purgadas de ventana expansiva con al menos tres períodos fuera de muestra, siguiendo el mismo estilo de validación utilizado para el estudio de MNQ, y registraríamos el tiempo de GPU de reloj por pliegue y por receta en una sola GPU para producir las primeras cifras de horas GPU para esta configuración exacta.
Juzgaríamos el proyecto por tres números por modelo y receta: precisión direccional fuera de muestra contra la tasa base de las etiquetas objetivo, calibración medida como cobertura empírica de los pronósticos q10/q50/q90, y un valor p de prueba de permutación, reportado de la misma manera que el estudio de MNQ reporta sus valores p. El éxito significaría que al menos una receta supera la tasa base con un valor p por debajo de un umbral preregistrado en al menos dos de tres pliegues fuera de muestra, en ambos activos; un resultado nulo, que coincida con el hallazgo del estudio de MNQ, se reportaría honestamente, no se ocultaría.
Dos ingenieros podrían terminar esto en unas pocas semanas: una semana para configurar los pipelines de datos y las divisiones purgadas, una semana para implementar y depurar las tres recetas para cada modelo, una semana para ejecutar los pliegues y calcular las estadísticas, y una semana final para el análisis de calibración y la redacción. El costo de cómputo sería una sola GPU de gama media por un total del orden de decenas de horas GPU en todos los modelos, recetas y pliegues, lo cual es modesto y asequible para un equipo de dos personas.
Registro de afirmaciones
Registro de afirmaciones
- factrespaldada
Lag-Llama is a general-purpose foundation model for univariate probabilistic time series forecasting based on a decoder-only transformer architecture that uses lags as covariates.
[3] Lag-Llama: Towards Foundation Models for Probabilistic Time Series Forecasting, abstract arXiv:2310.08278v3“Over the past years, foundation models have caused a paradigm shift in machine learning due to their unprecedented capabilities for zero-shot and few-shot generalization. However, despite the success of foundation models in modalities such as natural language processing and compu…”
- methodrespaldada
Lag-Llama is pretrained on a large corpus of diverse time series data from several domains and can be fine-tuned on relatively small fractions of previously unseen datasets.
[3] Lag-Llama: Towards Foundation Models for Probabilistic Time Series Forecasting, abstract arXiv:2310.08278v3“Over the past years, foundation models have caused a paradigm shift in machine learning due to their unprecedented capabilities for zero-shot and few-shot generalization. However, despite the success of foundation models in modalities such as natural language processing and compu…”
- resultrespaldada
When fine-tuned on relatively small fractions of previously unseen datasets, Lag-Llama achieves state-of-the-art performance and outperforms prior deep learning approaches on average.
[3] Lag-Llama: Towards Foundation Models for Probabilistic Time Series Forecasting, abstract arXiv:2310.08278v3“Over the past years, foundation models have caused a paradigm shift in machine learning due to their unprecedented capabilities for zero-shot and few-shot generalization. However, despite the success of foundation models in modalities such as natural language processing and compu…”
- methodrespaldada
Lag-Llama is pretrained from scratch on a broad, diverse corpus of datasets and is evaluated for zero-shot performance on unseen datasets.
[3] Lag-Llama: Towards Foundation Models for Probabilistic Time Series Forecasting, section 1 Introduction“We present Lag-Llama, a foundation model for univariate probabilistic time series forecasting based on a simple decoder-only transformer architecture that uses lags as covariates. • We show that Lag-Llama, when pretrained from scratch on a broad, diverse corpus of datasets, has s…”
- resultrespaldada
Lag-Llama performs comparably to models trained on specific datasets in zero-shot settings.
[3] Lag-Llama: Towards Foundation Models for Probabilistic Time Series Forecasting, section 1 Introduction“We present Lag-Llama, a foundation model for univariate probabilistic time series forecasting based on a simple decoder-only transformer architecture that uses lags as covariates. • We show that Lag-Llama, when pretrained from scratch on a broad, diverse corpus of datasets, has s…”
- resultrespaldada
After fine-tuning across diverse datasets, Lag-Llama demonstrates state-of-the-art performance and emerges as the best general-purpose model without knowledge of downstream datasets.
[3] Lag-Llama: Towards Foundation Models for Probabilistic Time Series Forecasting, section 1 Introduction“We present Lag-Llama, a foundation model for univariate probabilistic time series forecasting based on a simple decoder-only transformer architecture that uses lags as covariates. • We show that Lag-Llama, when pretrained from scratch on a broad, diverse corpus of datasets, has s…”
- factrespaldada
Moirai uses multiple input/output projection layers tailored to time series at specific frequencies, while TimesFM maintains a frequency embedding dictionary.
[4] Moirai-MoE: Empowering Time Series Foundation Models with Sparse Mixture of Experts, abstract DOI 10.48550/arxiv.2410.10469“Time series foundation models have demonstrated impressive performance as zero-shot forecasters. However, achieving effectively unified training on time series remains an open challenge. Existing approaches introduce some level of model specialization to account for the highly he…”
- limitationrespaldada
Frequency-level specialization is limited because time series with different frequencies can have similar patterns, time series with the same frequency can have different patterns, and non-stationarity can produce varied distributions within a short context window.
[4] Moirai-MoE: Empowering Time Series Foundation Models with Sparse Mixture of Experts, abstract DOI 10.48550/arxiv.2410.10469“Time series foundation models have demonstrated impressive performance as zero-shot forecasters. However, achieving effectively unified training on time series remains an open challenge. Existing approaches introduce some level of model specialization to account for the highly he…”
- methodrespaldada
Moirai-MoE addresses the limitations of frequency-level specialization with a single input/output projection layer and a sparse mixture of experts within Transformers.
[4] Moirai-MoE: Empowering Time Series Foundation Models with Sparse Mixture of Experts, abstract DOI 10.48550/arxiv.2410.10469“Time series foundation models have demonstrated impressive performance as zero-shot forecasters. However, achieving effectively unified training on time series remains an open challenge. Existing approaches introduce some level of model specialization to account for the highly he…”
- limitationrespaldada
Time-series foundation models face distribution shifts caused by domain-specific structures such as seasonality, trends, irregular sampling, and high variability across applications.
[5] How Foundational are Foundation Models for Time Series Forecasting?, section 1 Introduction“However, the time series domain poses unique challenges that set it apart from NLP and CV. Time series data often exhibits domain-specific structures such as seasonality, trends, irregular sampling, and high variability across applications, even within the same broad category [6]…”
- resultrespaldada
Zero-shot performance of time-series foundation models is highly sensitive to alignment between the statistical properties of their pretraining domains and the target domains.
[5] How Foundational are Foundation Models for Time Series Forecasting?, section 1 Introduction“However, the time series domain poses unique challenges that set it apart from NLP and CV. Time series data often exhibits domain-specific structures such as seasonality, trends, irregular sampling, and high variability across applications, even within the same broad category [6]…”
- limitationrespaldada
Extended fine-tuning of time-series foundation models can lead to performance degradation, whereas task-specific models trained from scratch typically gain accuracy with longer training under limited-data conditions.
[5] How Foundational are Foundation Models for Time Series Forecasting?, section 1 Introduction“However, the time series domain poses unique challenges that set it apart from NLP and CV. Time series data often exhibits domain-specific structures such as seasonality, trends, irregular sampling, and high variability across applications, even within the same broad category [6]…”
- limitationrespaldada con límites
On unseen real-world time series, fine-tuned foundation models do not consistently produce substantially better results than smaller dedicated models relative to their larger parameter counts and memory footprints.
[5] How Foundational are Foundation Models for Time Series Forecasting?, abstract arXiv:2510.00742v3Passage supports the claim but adds 'consistently' and specifies 'relative to increased parameter count and memory footprint' and 'tailored to specific forecasting task'—claim omits 'consistently' and 'increased'.“Foundation Models are designed to serve as versatile embedding machines, with strong zero shot capabilities and superior generalization performance when fine-tuned on diverse downstream tasks. While this is largely true for language and vision foundation models, we argue that the…”
- resultrespaldada
Across three out-of-sample periods under strict expanding-window walk-forward validation, no evaluated configuration achieved statistically significant accuracy above the 51.8% base rate for the MNQ directional target.
[1] Sequential Structure in Intraday Futures Data: LSTM vs Gradient Boosting on MNQ, abstract https://openalex.org/W7161915968“This paper compares gradient boosting and long short-term memory (LSTM) architectures for intraday directional prediction in Micro E-Mini Nasdaq 100 futures (MNQ). Motivated by recent foundation-model research on financial candlestick data, including the Kronos architecture, we t…”
- resultrespaldada
Combined out-of-sample accuracies ranged from 50.00% to 50.89% for gradient boosting variants, while the LSTM achieved 50.59%.
[1] Sequential Structure in Intraday Futures Data: LSTM vs Gradient Boosting on MNQ, abstract https://openalex.org/W7161915968“This paper compares gradient boosting and long short-term memory (LSTM) architectures for intraday directional prediction in Micro E-Mini Nasdaq 100 futures (MNQ). Motivated by recent foundation-model research on financial candlestick data, including the Kronos architecture, we t…”
- uncertaintyrespaldada
Permutation tests produced p-values of 0.135 for the best gradient boosting model and 0.515 for the LSTM, indicating no statistically significant predictive edge.
[1] Sequential Structure in Intraday Futures Data: LSTM vs Gradient Boosting on MNQ, abstract https://openalex.org/W7161915968“This paper compares gradient boosting and long short-term memory (LSTM) architectures for intraday directional prediction in Micro E-Mini Nasdaq 100 futures (MNQ). Motivated by recent foundation-model research on financial candlestick data, including the Kronos architecture, we t…”
- limitationrespaldada
Feature-importance instability across walk-forward folds suggested noise fitting rather than stable structural signal capture.
[1] Sequential Structure in Intraday Futures Data: LSTM vs Gradient Boosting on MNQ, abstract https://openalex.org/W7161915968“This paper compares gradient boosting and long short-term memory (LSTM) architectures for intraday directional prediction in Micro E-Mini Nasdaq 100 futures (MNQ). Motivated by recent foundation-model research on financial candlestick data, including the Kronos architecture, we t…”
- limitationrespaldada
Four years of single-instrument five-minute OHLCV data were insufficient for reliable sequential machine-learning-based intraday forecasting.
[1] Sequential Structure in Intraday Futures Data: LSTM vs Gradient Boosting on MNQ, abstract https://openalex.org/W7161915968“This paper compares gradient boosting and long short-term memory (LSTM) architectures for intraday directional prediction in Micro E-Mini Nasdaq 100 futures (MNQ). Motivated by recent foundation-model research on financial candlestick data, including the Kronos architecture, we t…”
- methodrechazada
LoRA freezes the pretrained parameter matrix W0 and represents the trainable update as ΔW=BA using low-rank matrices A and B, where r is much smaller than min(d,l).
[6] LoRA-FAIR: Federated LoRA Fine-Tuning with Aggregation and Initialization Refinement, section 2.1 PEFT with LoRA“LoRA (Low-Rank Adaptation) is a PEFT (parameter-efficient fine-tuning) approach that significantly reduces the number of trainable parameters in large-scale models by introducing low-rank matrices into the model. Consider a pre-trained model with parameters 𝐖0∈ℝd×l\mathbf{W}_{0}\…”
- factrespaldada
LoRA reduces the number of trained parameters for a d×l update from d×l to r×(d+l).
[6] LoRA-FAIR: Federated LoRA Fine-Tuning with Aggregation and Initialization Refinement, section 2.1 PEFT with LoRA“LoRA (Low-Rank Adaptation) is a PEFT (parameter-efficient fine-tuning) approach that significantly reduces the number of trainable parameters in large-scale models by introducing low-rank matrices into the model. Consider a pre-trained model with parameters 𝐖0∈ℝd×l\mathbf{W}_{0}\…”
- methodrespaldada
In practice, LoRA typically initializes A with random Gaussian values and B with zeros to provide a stable start to fine-tuning.
[6] LoRA-FAIR: Federated LoRA Fine-Tuning with Aggregation and Initialization Refinement, section 2.1 PEFT with LoRA“In practice, 𝐀\mathbf{A} is typically initialized with random Gaussian values, while 𝐁\mathbf{B} is initialized to zero to ensure a stable start to the fine-tuning process. This low-rank adaptation enables LoRA to achieve performance comparable to full fine-tuning while significa…”
- uncertaintyrespaldada
The passages provide no comparison of full fine-tuning, LoRA, and quantile head replacement for TimesFM, Chronos, Lag-Llama, or Moirai on one-minute or five-minute OHLCV bars under purged walk-forward splits.
[1] Sequential Structure in Intraday Futures Data: LSTM vs Gradient Boosting on MNQ, abstract https://openalex.org/W7161915968“This paper compares gradient boosting and long short-term memory (LSTM) architectures for intraday directional prediction in Micro E-Mini Nasdaq 100 futures (MNQ). Motivated by recent foundation-model research on financial candlestick data, including the Kronos architecture, we t…”
- uncertaintyrespaldada
The passages provide no GPU-hour measurements for training 25M–200M-parameter models on a single asset with 500K–2M bars.
[1] Sequential Structure in Intraday Futures Data: LSTM vs Gradient Boosting on MNQ, abstract https://openalex.org/W7161915968“This paper compares gradient boosting and long short-term memory (LSTM) architectures for intraday directional prediction in Micro E-Mini Nasdaq 100 futures (MNQ). Motivated by recent foundation-model research on financial candlestick data, including the Kronos architecture, we t…”
- factrespaldada
Chronos is a pretrained probabilistic time series forecasting framework based on transformer language-model architectures.
[8] Chronos: Learning the Language of Time Series, abstract arXiv:2403.07815v3“We introduce Chronos, a simple yet effective framework for pretrained probabilistic time series models. Chronos tokenizes time series values using scaling and quantization into a fixed vocabulary and trains existing transformer-based language model architectures on these tokenize…”
- methodrespaldada
Chronos tokenizes time series values by scaling and quantizing them into a fixed vocabulary.
[8] Chronos: Learning the Language of Time Series, abstract arXiv:2403.07815v3“We introduce Chronos, a simple yet effective framework for pretrained probabilistic time series models. Chronos tokenizes time series values using scaling and quantization into a fixed vocabulary and trains existing transformer-based language model architectures on these tokenize…”
- methodrespaldada
Chronos trains existing transformer-based language-model architectures on tokenized time series using cross-entropy loss.
[8] Chronos: Learning the Language of Time Series, section Chronos: Learning the Language of Time Series“We introduce Chronos, a simple yet effective framework for pretrained probabilistic time series models. Chronos tokenizes time series values using scaling and quantization into a fixed vocabulary and trains existing transformer-based language model architectures on these tokenize…”
- factrespaldada
Chronos models are based on the T5 family and range from 20M to 710M parameters.
[8] Chronos: Learning the Language of Time Series, abstract arXiv:2403.07815v3“We introduce Chronos, a simple yet effective framework for pretrained probabilistic time series models. Chronos tokenizes time series values using scaling and quantization into a fixed vocabulary and trains existing transformer-based language model architectures on these tokenize…”
- methodrespaldada
Chronos uses simple scaling and quantization to convert real-valued time series into discrete bins without changing the language-model architecture.
[8] Chronos: Learning the Language of Time Series, section 1 Introduction“Shouldn’t good language models “just work” on time series? This naive question prompts us to challenge the necessity of time-series-specific modifications, and answering it led us to develop Chronos, a language modeling framework minimally adapted for time series forecasting. Chr…”
- methodrespaldada
Chronos can use either encoder-decoder or decoder-only language-model architectures.
[8] Chronos: Learning the Language of Time Series, section 1 Introduction“Shouldn’t good language models “just work” on time series? This naive question prompts us to challenge the necessity of time-series-specific modifications, and answering it led us to develop Chronos, a language modeling framework minimally adapted for time series forecasting. Chr…”
- methodrespaldada
During inference, Chronos autoregressively samples tokens from the model and maps them back to numerical values.
[8] Chronos: Learning the Language of Time Series, section 1 Introduction“Shouldn’t good language models “just work” on time series? This naive question prompts us to challenge the necessity of time-series-specific modifications, and answering it led us to develop Chronos, a language modeling framework minimally adapted for time series forecasting. Chr…”
- methodrespaldada
Chronos obtains a predictive distribution by sampling multiple forecast trajectories.
[8] Chronos: Learning the Language of Time Series, section 1 Introduction“Shouldn’t good language models “just work” on time series? This naive question prompts us to challenge the necessity of time-series-specific modifications, and answering it led us to develop Chronos, a language modeling framework minimally adapted for time series forecasting. Chr…”
- factrespaldada
Chronos was pretrained on a large collection of publicly available datasets supplemented by a synthetic dataset generated with Gaussian processes.
[8] Chronos: Learning the Language of Time Series, abstract arXiv:2403.07815v3“We introduce Chronos, a simple yet effective framework for pretrained probabilistic time series models. Chronos tokenizes time series values using scaling and quantization into a fixed vocabulary and trains existing transformer-based language model architectures on these tokenize…”
- resultrespaldada
In a benchmark of 42 datasets, Chronos significantly outperformed other methods on datasets that were included in its training corpus.
[8] Chronos: Learning the Language of Time Series, abstract arXiv:2403.07815v3“We introduce Chronos, a simple yet effective framework for pretrained probabilistic time series models. Chronos tokenizes time series values using scaling and quantization into a fixed vocabulary and trains existing transformer-based language model architectures on these tokenize…”
- resultrespaldada
On new datasets, Chronos had comparable and occasionally superior zero-shot performance relative to methods trained specifically on those datasets.
[8] Chronos: Learning the Language of Time Series, abstract arXiv:2403.07815v3“We introduce Chronos, a simple yet effective framework for pretrained probabilistic time series models. Chronos tokenizes time series values using scaling and quantization into a fixed vocabulary and trains existing transformer-based language model architectures on these tokenize…”
- methodrespaldada
The Chronos work focuses on univariate forecasting, where each observation is a scalar.
[8] Chronos: Learning the Language of Time Series, section 2 Background and Related Work“Time series forecasting concerns using historical data from a quantity of interest (typically real-valued) to predict their future values. Formally, given a uniformly-spaced time series 𝒙1:C=[x1,…,xC]{\bm{x}}_{1:C}=[x_{1},\dots,x_{C}], we are interested in predicting the joint di…”
- factrespaldada
The forecasting objective is the joint distribution of the next H steps conditioned on the preceding C observations, p(x_{C+1:C+H}|x_{1:C}).
[8] Chronos: Learning the Language of Time Series, section 2 Background and Related Work“Time series forecasting concerns using historical data from a quantity of interest (typically real-valued) to predict their future values. Formally, given a uniformly-spaced time series 𝒙1:C=[x1,…,xC]{\bm{x}}_{1:C}=[x_{1},\dots,x_{C}], we are interested in predicting the joint di…”
- limitationrespaldada con límites
The passage describes fine-tuning methods for time-series tasks as requiring fine-tuning for each new task, while large language-model approaches can demand substantial computational resources and inference time.
[8] Chronos: Learning the Language of Time Series, section 1 IntroductionPassage states fine-tuning methods need fine-tuning for each new task OR large-scale models demand substantial computational resources and inference time—claim uses 'and' suggesting both apply to same approach, passage uses 'or' distinguishing two separate limitations.“In the context of LLMs, this interest has been pursued through two main avenues: directly prompting pretrained LLMs in natural language (Gruver et al., 2023; Xue & Salim, 2023) and fine-tuning LLMs for time series tasks (Zhou et al., 2023a; Jin et al., 2024). However, these metho…”
- uncertaintyrespaldada
The provided Chronos passages do not report a comparison of full fine-tuning, LoRA, and quantile head replacement under purged walk-forward splits for one-minute or five-minute OHLCV bars.
[8] Chronos: Learning the Language of Time Series, abstract arXiv:2403.07815v3“We introduce Chronos, a simple yet effective framework for pretrained probabilistic time series models. Chronos tokenizes time series values using scaling and quantization into a fixed vocabulary and trains existing transformer-based language model architectures on these tokenize…”
- uncertaintyrespaldada
The provided Chronos passages do not report out-of-sample direction accuracy, calibration measurements, or GPU-hour requirements for training a 25M–200M parameter model on a single asset with 500K–2M bars.
[8] Chronos: Learning the Language of Time Series, abstract arXiv:2403.07815v3“We introduce Chronos, a simple yet effective framework for pretrained probabilistic time series models. Chronos tokenizes time series values using scaling and quantization into a fixed vocabulary and trains existing transformer-based language model architectures on these tokenize…”
- factrespaldada
The study uses pre-trained foundation models, including GPT-2-backbone LLMs, transformers, and linear models, for financial time-series forecasting.
[10] Large Language Models for Financial Aid in Financial Time-series Forecasting, abstract arXiv:2410.19025v1“Considering the difficulty of financial time series forecasting in financial aid, much of the current research focuses on leveraging big data analytics in financial services. One modern approach is to utilize "predictive analysis", analogous to forecasting financial trends. Howev…”
Fuentes
Fuentes
- [1]Mathias Mesfin. Sequential Structure in Intraday Futures Data: LSTM vs Gradient Boosting on MNQ. arXiv (Cornell University), 2026.
- [2]Marcel Meyer, David Zapata Gonzalez, Sascha Kaltenpoth, Oliver Müller. Benchmarking Time Series Foundation Models for Short-Term Household Electricity Load Forecasting. IEEE Access, 2025.
- [3]Kashif Rasul, Arjun Ashok, Andrew Robert Williams, Hena Ghonia, Rishika Bhagwatkar, Arian Khorasani, Mohammad Javad Darvishi Bayazi, George Adamopoulos, Roland Riachi, Nadhir Hassen, Marin Biloš, Sahil Garg, Anderson Schneider, Nicolas Chapados, Alexandre Drouin, Valentina Zantedeschi, Yuriy Nevmyva. Lag-Llama: Towards Foundation Models for Probabilistic Time Series Forecasting. arXiv, 2023.
- [4]Xu Liu, Juncheng Liu, Gerald Woo, Taha Aksu, Yuxuan Liang, Roger Zimmermann. Moirai-MoE: Empowering Time Series Foundation Models with Sparse Mixture of Experts. arXiv (Cornell University), 2024.
- [5]Nouha Karaouli, Denis Coquenet, Elisa Fromont, Martial Mermillod, Marina Reyboz. How Foundational are Foundation Models for Time Series Forecasting?. arXiv, 2025.
- [6]Jieming Bian, Lei Wang, Letian Zhang, Jie Xu. LoRA-FAIR: Federated LoRA Fine-Tuning with Aggregation and Initialization Refinement. arXiv, 2024.
- [7]Dennis Thumm, Ying Chen. Interventional Time Series Priors for Causal Foundation Models. arXiv, 2026.
- [8]Abdul Fatir Ansari, Lorenzo Stella, Caner Turkmen, Xiyuan Zhang, Pedro Mercado, Huibin Shen, Oleksandr Shchur, Syama Sundar Rangapuram, Sebastian Pineda Arango, Shubham Kapoor, Jasper Zschiegner, Danielle C. Maddix, Hao Wang, Michael W. Mahoney, Kari Torkkola, Andrew Gordon Wilson, Michael Bohlke-Sc. Chronos: Learning the Language of Time Series. arXiv, 2024.
- [9]Matthew Peroni, Franck Le, Vadim Sheinin. Robust Tabular Foundation Models. arXiv, 2025.
- [10]Md Khairul Islam, Ayush Karmacharya, Timothy Sue, Judy Fox. Large Language Models for Financial Aid in Financial Time-series Forecasting. arXiv, 2024.
- [11]Adèle Gouttes, Kashif Rasul, Mateusz Koren, Johannes Stephan, Tofigh Naghibi. Probabilistic Time Series Forecasting with Implicit Quantile Networks. arXiv, 2021.
- [12]Alessio Brini, Giacomo Toscano. SpotV2Net: Multivariate Intraday Spot Volatility Forecasting via Vol-of-Vol-Informed Graph Attention Networks. arXiv, 2024.