🏗️ Estructura del DFM
X_{it} = λ_i' F_t + e_{it}. Cada serie X_{it} se descompone en una parte común (λ_i' F_t) y un componente idiosincrático e_{it}. F_t es un vector de r factores comunes que capturan la co-movimiento entre las series. λ_i son las cargas factoriales (pesos). Los factores típicamente siguen un VAR(1) o AR(1): F_t = A F_{t-1} + u_t. El número de factores r se elige mediante criterios de información.
🧮 PCA: Estimación de Factores
Cuando N es grande (>50), se estima F_t por Análisis de Componentes Principales (PCA). PCA encuentra las combinaciones lineales de X que maximizan la varianza explicada. El primer componente principal es la combinación con mayor varianza; el segundo es ortogonal al primero con la siguiente mayor varianza, etc. Los factores estimados F̂_t son los primeros r componentes principales. La consistencia requiere N,T → ∞.
🔢 Criterios de Bai-Ng (2002)
Bai y Ng desarrollaron 3 criterios de información para determinar r: IC_p1, IC_p2, IC_p3. Se basan en la varianza residual vs número de factores, penalizando por N y T. La idea: agregar un factor siempre reduce la suma de cuadrados residuales, pero el penalización evita sobreajuste. En la práctica, IC_p1 suele elegir entre 1-3 factores para datos macro de EE.UU.
🌊 Factores vs Ciclo Económico
El factor común F_t se interpreta como el "ciclo económico" o "actividad agregada". Las cargas factoriales λ_i indican qué tan sensible es cada serie al ciclo. Por ejemplo: empleo manufacturero puede tener carga 0.8 en el factor (muy cíclico), mientras que gasto en salud pública puede tener carga 0.1 (acíclico). Las series con cargas similares se agrupan en clusters económicos.
Ejemplo paso a paso: Estimación DFM con 50 series macro
Tomamos 50 series trimestrales de EE.UU. (PIB, empleo, industrial production, ventas, etc.) desde 1980 hasta 2020. Estandarizamos cada serie a media 0 y varianza 1 para que todas tengan el mismo peso en PCA. Esto es crucial porque las escalas son muy diferentes (PIB en billones vs tasa de desempleo en %).
Calculamos PCA para r = 1,...,10 y evaluamos IC_p1. Resultado: IC_p1 se minimiza en r = 2. Los primeros 2 factores explican el 45% de la varianza total. El tercer factor solo agrega 4% adicional. Decidimos usar r=2.
Factor 1: cargas altas positivas en PIB, empleo, y consumo (>0.7) — es el "factor de actividad real". Factor 2: cargas altas en precios, salarios y T-bills — es el "factor nominal/inflación". La correlación entre factores es aproximadamente 0 (son ortogonales por construcción de PCA).
Ahora podemos usar F̂_t como variables explicativas en una regresión, por ejemplo: π_t = α + β1 F1_t + β2 F2_t + ε_t. Como los factores resumen la información de 50 series, evitamos el problema de sobreparametrización. Además, el DFM filtra el ruido idiosincrático de cada serie.
Define la correlación entre las series y el número de factores subyacentes. Observa la proporción de varianza explicada acumulada.