📈 Evaluación de Pronósticos

Cómo medir, comparar y mejorar la capacidad predictiva de modelos de series de tiempo

RMSE MASE DM Test Combinación
Módulo 11 de 12
💡 Piénsalo así: Evaluar pronósticos es como calificar a chefs: no basta con que un plato sea bueno una vez (un solo acierto). Necesitas probar muchos platos en diferentes días (múltiples horizontes) y comparar con otros chefs (modelos alternativos). El mejor chef es consistente, no el que hizo el mejor plato una vez.
  • Calcular e interpretar métricas de precisión: RMSE, MAE, MAPE, MASE.
  • Aplicar el test de Diebold-Mariano para comparar pronósticos de dos modelos.
  • Combinar pronósticos para mejorar la precisión (forecast combination).
  • Evaluar calibración de intervalos de predicción y distribuciones predictivas.
  • Métricas de Error de Pronóstico

    📏 RMSE y MAE

    RMSE = √[(1/H)·Σ(yₜ₊ₕ - ŷₜ₊ₕ)²]. Penaliza errores grandes al cuadrado. Es la métrica más común pero sensible a outliers. MAE = (1/H)·Σ|y - ŷ|. Es más robusta a outliers y más interpretable (unidades naturales).

    Intuición: RMSE es como un examen donde los errores grandes te cuestan mucho más. MAE es como un examen donde todos los errores cuentan igual. Si hay outliers en tus datos, prefiere MAE.

    Ejemplo: Pronóstico de inflación: error de 0.5% en un mes, -0.3% en otro, 2.1% en otro (outlier). RMSE = √[(0.25+0.09+4.41)/3] = √1.58 = 1.26%. MAE = (0.5+0.3+2.1)/3 = 0.97%. El outlier infla el RMSE.

    Peligro común: RMSE y MAE no son comparables entre series de diferente escala. Normaliza usando la media o el desvío de la serie. Tampoco dicen nada sobre si el pronóstico es mejor que un benchmark ingenuo.

    📊 MAPE y MASE

    MAPE = (100/H)·Σ|(yₜ - ŷₜ)/yₜ|. Se interpreta como porcentaje de error. Útil para comunicar a no técnicos pero problemático cuando yₜ ≈ 0 o cambia de signo.

    MASE = MAE_modelo / MAE_naive. Divide el MAE del modelo por el MAE de un pronóstico naive (random walk). Si MASE < 1, el modelo supera al naive. Es independiente de escala y funciona incluso con valores cercanos a cero.

    Intuición: MAPE dice "tu error es del X%". MASE dice "tu modelo es X veces mejor que simplemente usar la última observación". MASE es preferido en investigación académica.

    Peligro común: MAPE es infinito si yₜ=0 y no tiene sentido si yₜ puede ser negativo. MASE puede ser engañoso si el naive es muy malo (entonces MASE siempre < 1 aunque el modelo sea mediocre).

    ⚔️ Test de Diebold-Mariano (DM)

    Prueba si la diferencia en precisión entre dos modelos es estadísticamente significativa. Define la pérdida diferencial dₜ = L(e₁ₜ) - L(e₂ₜ) donde L es la función de pérdida (error cuadrado o absoluto). DM = d̄ / √(Var(d)/H). Bajo H₀ (igual precisión), DM ~ N(0,1) asintóticamente.

    Intuición: Si el modelo A tiene RMSE=2.1 y el modelo B tiene RMSE=2.0, ¿es B realmente mejor o es solo suerte? DM responde: ¿la diferencia es estadísticamente significativa?

    Ejemplo: DM = -2.5 con p-valor = 0.006. Rechazamos H₀ al 1%: el modelo B es significativamente mejor que el A. Si DM = -0.8, p-valor = 0.21: no hay evidencia suficiente para decir que B es mejor.

    Peligro común: DM asume que la serie de pérdidas dₜ es covariance-estacionaria. Para horizontes múltiples (h>1), usa la corrección de Harvey-Leybourne-Newbold (1997) y errores estándar HAC (Newey-West).

    DM = d / √(Var(d)) ~ N(0,1)

    🔮 Combinación de Pronósticos

    Combinar pronósticos de múltiples modelos (promedio simple, ponderado por varianza inversa, o por performance reciente) casi siempre reduce el error. El promedio simple a menudo supera a los modelos individuales y a las ponderaciones complejas.

    Intuición: Es como pedirle direcciones a varias personas y promediar: cada una comete errores, pero los errores se cancelan parcialmente. La combinación es especialmente útil cuando los modelos capturan diferentes señales.

    Ejemplo: Combina ARIMA (RMSE=2.1), VAR (RMSE=1.8), BVAR (RMSE=1.7) con promedio simple: RMSE combinado = 1.6, mejor que cualquier modelo individual.

    Peligro común: La combinación no funciona si todos los modelos están igual de mal (mismo sesgo). En ese caso, mejora primero los modelos individuales antes de combinarlos.

    Evaluación Avanzada

    📉 MCS (Model Confidence Set)

    Propuesto por Hansen, Lunde y Nason (2003, 2011). En lugar de elegir el "mejor modelo", MCS selecciona un conjunto de modelos que son estadísticamente indistinguibles en precisión. Los modelos fuera del MCS son significativamente peores.

    Intuición: Es como una carrera donde no declaras un único ganador, sino un grupo de corredores que llegaron igual. Todos los modelos en el MCS son igualmente buenos según los datos.

    Peligro: MCS usa bootstrap para la distribución del estadístico, lo que puede ser computacionalmente intensivo con muchos modelos. Requiere al menos T=50 observaciones fuera de muestra.

    📊 Fan Charts (Gráficos de Abanico)

    Visualizan la incertidumbre del pronóstico mostrando percentiles. El área central (ej. 50% de probabilidad) es la más oscura, y las colas (ej. 90% o 95%) son más claras. El Banco de Inglaterra popularizó los fan charts para comunicar incertidumbre de pronósticos de inflación y PIB.

    Evaluación: Un fan chart está bien calibrado si la cobertura empírica coincide con la nominal: un intervalo del 90% debe contener el valor real en el 90% de los casos. Esto se evalúa con el test de cobertura de Christoffersen (1998).

    Peligro: Los fan charts pueden dar una falsa sensación de precisión si la incertidumbre del modelo no está bien estimada (ej: varianza subestimada porque el modelo omite riesgos).

    Simulación: Comparación de Pronósticos

    Compara dos modelos de pronóstico y prueba si la diferencia es significativa.

    Presiona "DM Test" para simular y comparar pronósticos.
    Ejemplo Paso a Paso: Diebold-Mariano Test
    Paso 1: Obtener los errores de pronóstico de dos modelos

    Modelo A (ARIMA): errores e₁ₜ para t = 1,...,H. Modelo B (VAR): errores e₂ₜ. Supón que para h=1: e₁ = [0.5, -0.3, 2.1, -0.7, ...] y e₂ = [0.8, -0.1, 1.5, -0.4, ...]. Con H=100 observaciones fuera de muestra.

    Paso 2: Calcular la serie de pérdida diferencial

    Elige L(e) = e² (error cuadrado, función cuadrática). La pérdida diferencial es dₜ = e₁ₜ² - e₂ₜ². Para los primeros 4 períodos: d = [0.25-0.64, 0.09-0.01, 4.41-2.25, 0.49-0.16] = [-0.39, 0.08, 2.16, 0.33]. La media de d: d̄ = (-0.39+0.08+2.16+0.33+...)/100.

    Paso 3: Estimar la varianza de d̄

    Para h=1, Var(d̄) = Var(dₜ)/H. Para h>1, usa Newey-West con rezagos h-1. Supón que Var(d̄) = 0.04 (con corrección HAC). Entonces DM = d̄ / √(0.04) = d̄ / 0.2.

    Paso 4: Interpretar el DM

    Si d̄ = -0.15 (Modelo B tiene menor pérdida en promedio): DM = -0.15/0.2 = -0.75. p-valor = 0.45. No rechazamos H₀: no hay evidencia de que un modelo sea mejor que el otro. Si d̄ = -0.5: DM = -2.5, p-valor = 0.006 → Modelo B es significativamente mejor. Si d̄ es positivo y significativo, el Modelo A es mejor.

    Mini Quiz: Evaluación de Pronósticos
    💡 Responde las preguntas sobre evaluación de pronósticos.

    📌 Resumen del módulo

  • RMSE (penaliza errores grandes), MAE (robusto), MAPE (porcentaje), MASE (vs. naive).
  • Test de Diebold-Mariano: ¿la diferencia entre dos modelos es significativa?
  • Combinación de pronósticos: promediar múltiples modelos mejora la precisión.
  • Fan charts y MCS: evaluación avanzada de incertidumbre y selección de modelos.