📏 RMSE y MAE
RMSE = √[(1/H)·Σ(yₜ₊ₕ - ŷₜ₊ₕ)²]. Penaliza errores grandes al cuadrado. Es la métrica más común pero sensible a outliers. MAE = (1/H)·Σ|y - ŷ|. Es más robusta a outliers y más interpretable (unidades naturales).
Intuición: RMSE es como un examen donde los errores grandes te cuestan mucho más. MAE es como un examen donde todos los errores cuentan igual. Si hay outliers en tus datos, prefiere MAE.
Ejemplo: Pronóstico de inflación: error de 0.5% en un mes, -0.3% en otro, 2.1% en otro (outlier). RMSE = √[(0.25+0.09+4.41)/3] = √1.58 = 1.26%. MAE = (0.5+0.3+2.1)/3 = 0.97%. El outlier infla el RMSE.
Peligro común: RMSE y MAE no son comparables entre series de diferente escala. Normaliza usando la media o el desvío de la serie. Tampoco dicen nada sobre si el pronóstico es mejor que un benchmark ingenuo.
📊 MAPE y MASE
MAPE = (100/H)·Σ|(yₜ - ŷₜ)/yₜ|. Se interpreta como porcentaje de error. Útil para comunicar a no técnicos pero problemático cuando yₜ ≈ 0 o cambia de signo.
MASE = MAE_modelo / MAE_naive. Divide el MAE del modelo por el MAE de un pronóstico naive (random walk). Si MASE < 1, el modelo supera al naive. Es independiente de escala y funciona incluso con valores cercanos a cero.
Intuición: MAPE dice "tu error es del X%". MASE dice "tu modelo es X veces mejor que simplemente usar la última observación". MASE es preferido en investigación académica.
Peligro común: MAPE es infinito si yₜ=0 y no tiene sentido si yₜ puede ser negativo. MASE puede ser engañoso si el naive es muy malo (entonces MASE siempre < 1 aunque el modelo sea mediocre).
⚔️ Test de Diebold-Mariano (DM)
Prueba si la diferencia en precisión entre dos modelos es estadísticamente significativa. Define la pérdida diferencial dₜ = L(e₁ₜ) - L(e₂ₜ) donde L es la función de pérdida (error cuadrado o absoluto). DM = d̄ / √(Var(d)/H). Bajo H₀ (igual precisión), DM ~ N(0,1) asintóticamente.
Intuición: Si el modelo A tiene RMSE=2.1 y el modelo B tiene RMSE=2.0, ¿es B realmente mejor o es solo suerte? DM responde: ¿la diferencia es estadísticamente significativa?
Ejemplo: DM = -2.5 con p-valor = 0.006. Rechazamos H₀ al 1%: el modelo B es significativamente mejor que el A. Si DM = -0.8, p-valor = 0.21: no hay evidencia suficiente para decir que B es mejor.
Peligro común: DM asume que la serie de pérdidas dₜ es covariance-estacionaria. Para horizontes múltiples (h>1), usa la corrección de Harvey-Leybourne-Newbold (1997) y errores estándar HAC (Newey-West).
🔮 Combinación de Pronósticos
Combinar pronósticos de múltiples modelos (promedio simple, ponderado por varianza inversa, o por performance reciente) casi siempre reduce el error. El promedio simple a menudo supera a los modelos individuales y a las ponderaciones complejas.
Intuición: Es como pedirle direcciones a varias personas y promediar: cada una comete errores, pero los errores se cancelan parcialmente. La combinación es especialmente útil cuando los modelos capturan diferentes señales.
Ejemplo: Combina ARIMA (RMSE=2.1), VAR (RMSE=1.8), BVAR (RMSE=1.7) con promedio simple: RMSE combinado = 1.6, mejor que cualquier modelo individual.
Peligro común: La combinación no funciona si todos los modelos están igual de mal (mismo sesgo). En ese caso, mejora primero los modelos individuales antes de combinarlos.
📉 MCS (Model Confidence Set)
Propuesto por Hansen, Lunde y Nason (2003, 2011). En lugar de elegir el "mejor modelo", MCS selecciona un conjunto de modelos que son estadísticamente indistinguibles en precisión. Los modelos fuera del MCS son significativamente peores.
Intuición: Es como una carrera donde no declaras un único ganador, sino un grupo de corredores que llegaron igual. Todos los modelos en el MCS son igualmente buenos según los datos.
Peligro: MCS usa bootstrap para la distribución del estadístico, lo que puede ser computacionalmente intensivo con muchos modelos. Requiere al menos T=50 observaciones fuera de muestra.
📊 Fan Charts (Gráficos de Abanico)
Visualizan la incertidumbre del pronóstico mostrando percentiles. El área central (ej. 50% de probabilidad) es la más oscura, y las colas (ej. 90% o 95%) son más claras. El Banco de Inglaterra popularizó los fan charts para comunicar incertidumbre de pronósticos de inflación y PIB.
Evaluación: Un fan chart está bien calibrado si la cobertura empírica coincide con la nominal: un intervalo del 90% debe contener el valor real en el 90% de los casos. Esto se evalúa con el test de cobertura de Christoffersen (1998).
Peligro: Los fan charts pueden dar una falsa sensación de precisión si la incertidumbre del modelo no está bien estimada (ej: varianza subestimada porque el modelo omite riesgos).
Compara dos modelos de pronóstico y prueba si la diferencia es significativa.
Modelo A (ARIMA): errores e₁ₜ para t = 1,...,H. Modelo B (VAR): errores e₂ₜ. Supón que para h=1: e₁ = [0.5, -0.3, 2.1, -0.7, ...] y e₂ = [0.8, -0.1, 1.5, -0.4, ...]. Con H=100 observaciones fuera de muestra.
Elige L(e) = e² (error cuadrado, función cuadrática). La pérdida diferencial es dₜ = e₁ₜ² - e₂ₜ². Para los primeros 4 períodos: d = [0.25-0.64, 0.09-0.01, 4.41-2.25, 0.49-0.16] = [-0.39, 0.08, 2.16, 0.33]. La media de d: d̄ = (-0.39+0.08+2.16+0.33+...)/100.
Para h=1, Var(d̄) = Var(dₜ)/H. Para h>1, usa Newey-West con rezagos h-1. Supón que Var(d̄) = 0.04 (con corrección HAC). Entonces DM = d̄ / √(0.04) = d̄ / 0.2.
Si d̄ = -0.15 (Modelo B tiene menor pérdida en promedio): DM = -0.15/0.2 = -0.75. p-valor = 0.45. No rechazamos H₀: no hay evidencia de que un modelo sea mejor que el otro. Si d̄ = -0.5: DM = -2.5, p-valor = 0.006 → Modelo B es significativamente mejor. Si d̄ es positivo y significativo, el Modelo A es mejor.