🧪 VAR Bayesiano (BVAR)

Incorporando información a priori para mejorar estimaciones en VAR con datos limitados

Priors Minnesota Gibbs Densidades
Módulo 9 de 12
💡 Piénsalo así: Un VAR frecuentista es como intentar adivinar el peso de alguien solo con mirarlo: necesitas mucha experiencia previa (datos). Un BVAR es como preguntarle primero su altura, edad y contextura (priors) y luego ajustar con la vista. Si tienes poca experiencia (pocos datos), los priors te salvan del fracaso total.
  • Comprender por qué los VAR frecuentistas fallan con pocos datos y muchos parámetros (curse of dimensionality).
  • Aplicar el prior de Minnesota (Litterman, 1986) para encoger los coeficientes hacia un random walk.
  • Estimar un BVAR con el enfoque de Normal-Wishart conjugado.
  • Interpretar distribuciones predictivas completas en lugar de pronósticos puntuales.
  • Fundamentos Bayesianos para VAR

    🎯 Prior de Minnesota (Litterman)

    El prior de Minnesota es el más usado en BVAR. Su idea central: los coeficientes de rezagos propios (yₜ₋₁ en ecuación de yₜ) tienen media 1 (random walk) y los coeficientes de otras variables tienen media 0. La varianza se encoge con el rezago: a mayor rezago, mayor encogimiento.

    Intuición: Es como decir "lo más probable es que la serie sea un paseo aleatorio" y dejar que los datos demuestren lo contrario si hay evidencia suficiente. Reduce drásticamente la varianza de los coeficientes y evita el sobreajuste.

    Ejemplo: En un BVAR(4) con 3 variables, hay 3×3×4 = 36 coeficientes de rezagos más 3 constantes = 39 parámetros. Con datos trimestrales de 20 años (80 obs), hay 80×3 = 240 observaciones. Con MCO, 39 parámetros para 240 obs da estimaciones ruidosas. El prior de Minnesota estabiliza todo.

    Peligro común: Si el prior es demasiado ajustado (encogimiento excesivo), el BVAR se comporta como un random walk univariante e ignora las relaciones entre variables. Los hiperparámetros del prior deben calibrarse o estimarse.

    🔢 Normal-Wishart Conjugado

    Conjugacy significa que el posterior tiene la misma forma que el prior. Si el likelihood es Normal y el prior es Normal sobre β y Wishart sobre Σ (matriz de covarianza), entonces el posterior es Normal-Wishart. Esto permite calcular analíticamente el posterior sin MCMC.

    Intuición: Es como tener una fórmula cerrada para actualizar creencias. El posterior combina la información de los datos con los priors de manera óptima: el posterior medio es un promedio ponderado entre el prior y el MCO, donde la ponderación es la precisión relativa.

    Ejemplo: Si tienes 200 observaciones, los datos dominan al prior. Si tienes 20, el prior pesa mucho más. La varianza posterior siempre es menor que la varianza MCO (el prior agrega información).

    Peligro común: El conjugado asume que la varianza del error (Σ) es conocida o que sigue una distribución Inverse Wishart con grados de libertad suficientes. Si los priors sobre Σ son muy informativos, pueden sesgar las IRF.

    🔄 Gibbs Sampling y MCMC

    Cuando el prior no es conjugado (por ejemplo, Minnesota con encogimiento asimétrico o priors jerárquicos), se usa MCMC. El Gibbs sampler itera entre: muestrear β|Σ, datos y muestrear Σ|β, datos. Con suficientes iteraciones, la cadena converge a la distribución posterior.

    Intuición: Es como escalar una montaña alternando dos pasos: primero ajustas la pendiente (β) y luego la base (Σ). Cada paso condicional es fácil, y repitiéndolos suficientes veces convergen a la distribución conjunta.

    Ejemplo práctico: Gibbs muestrea β de una Normal multivariante y Σ de una Inverse Wishart. En la práctica se usan 10,000 iteraciones con 2,000 de burn-in. La convergencia se verifica con el test de Geweke o gráficos de trazas.

    Peligro común: La correlación entre iteraciones sucesivas (autocorrelación MCMC) reduce la muestra efectiva. Si la autocorrelación es alta (ρ > 0.9), necesitas más iteraciones o adelgazar la cadena (thinning).

    📊 Distribuciones Predictivas

    La principal ventaja del BVAR sobre el VAR es que obtienes la distribución predictiva completa (no solo el pronóstico puntual). Esto permite calcular intervalos de credibilidad, probabilidades de recesión, y escenarios completos.

    Intuición: El VAR frecuentista te dice: "el PIB crecerá 2.5%". El BVAR te dice: "el PIB crecerá 2.5%, con un 90% de probabilidad de estar entre 1.2% y 3.8%, y un 15% de probabilidad de recesión".

    Ejemplo: En política monetaria, el BVAR puede responder: "dada la incertidumbre, la probabilidad de que la inflación supere el 4% en 12 meses es del 25%". El VAR no puede dar esa respuesta directamente.

    Peligro común: La distribución predictiva del BVAR es tan buena como el modelo. Si el modelo está mal especificado (por ejemplo, no incluye una variable crucial), la distribución será incorrecta aunque sea completa.

    Ventajas vs. VAR Clásico

    ✅ BVAR vs VAR

    VAR: MCO ecuación por ecuación. Con n=5 variables y p=4 rezagos = 5×5×4+5 = 105 parámetros. Para estabilidad, necesitas T > 105 observaciones (~26 años trimestrales). BVAR: Funciona bien incluso con T pequeño (20-40 obs) gracias al encogimiento. Además, el BVAR da pronósticos mejores y distribuciones predictivas completas.

    📈 Evaluación de BVAR

    Se evalúan con: (1) log marginal likelihood (verosimilitud integrada sobre priors), (2) RMSE fuera de muestra, (3) cobertura de intervalos de credibilidad. Los BVAR sistemáticamente superan a los VAR en pronóstico, especialmente para horizontes largos y con datos limitados.

    Simulación: BVAR vs VAR

    Compara un VAR y un BVAR con pocos datos. Ajusta el tamaño de muestra.

    Presiona "Comparar" para ver VAR vs BVAR.
    Ejemplo Paso a Paso: Prior de Minnesota en Acción
    Paso 1: Especificar los hiperparámetros del prior

    En el prior de Minnesota, cada coeficiente βᵢⱼ(ℓ) (variable i, rezago ℓ de variable j) tiene media μ = 1 si i=j (rezago propio) y 0 si i≠j (otras variables). La varianza es σᵢⱼ(ℓ)² = (λ/ℓ)² · (σᵢ²/σⱼ²). λ controla el encogimiento general: λ = 0.2 es ajustado, λ = 0.5 es medio, λ = 1 es suave. ℓ penaliza rezagos lejanos: a mayor ℓ, más encogimiento.

    Paso 2: Estimar el VAR por MCO para calibrar σᵢ

    Antes de aplicar el prior, estima un AR(p) univariante para cada variable para obtener σᵢ² (varianza del error de cada ecuación). Estas escalan el prior para que variables con diferentes escalas tengan encogimiento comparable. Ejemplo: si el PIB tiene σ²=0.5 y la inflación tiene σ²=0.1, el ratio σ_PIB²/σ_infl² = 5 ajusta el encogimiento.

    Paso 3: Construir la distribución posterior

    Con prior Normal-Wishart conjugado, la media posterior es β̄ = (X'X + V₀⁻¹)⁻¹(X'Y + V₀⁻¹β₀) donde V₀ es la varianza del prior y β₀ es la media del prior. La varianza posterior es V̄ = (X'X + V₀⁻¹)⁻¹. Observa la relación: es un promedio ponderado entre los datos (X'X) y el prior (V₀⁻¹). Con T pequeño, V₀⁻¹ domina.

    Paso 4: Generar pronósticos y distribución predictiva

    Para generar la distribución predictiva: (a) muestrea β⁽ᵐ⁾ de la posterior Normal, (b) muestrea Σ⁽ᵐ⁾ de la posterior Inverse Wishart, (c) simula yₜ₊₁|β⁽ᵐ⁾, Σ⁽ᵐ⁾, datos. Repite M=10000 veces. El percentil 5 y 95 de las simulaciones dan el intervalo de credibilidad al 90%. La media de las simulaciones es el pronóstico puntual bayesiano.

    Mini Quiz: VAR Bayesiano
    💡 Responde las preguntas sobre BVAR.

    📌 Resumen del módulo

  • BVAR usa priors para encoger coeficientes y evitar sobreajuste cuando hay muchos parámetros y pocos datos.
  • Prior de Minnesota: los rezagos propios tienen media 1 (random walk), otros tienen media 0; varianza decrece con el rezago.
  • Normal-Wishart conjugado permite cálculo analítico del posterior (sin MCMC).
  • La distribución predictiva completa es la gran ventaja: pronósticos con intervalos de credibilidad y probabilidades de eventos.