⚙️ GMM: Método Generalizado de Momentos

El marco unificador de la econometría moderna

Momentos Matriz W J-Test
Módulo 11 de 12
💡 Piénsalo así: MCO minimiza la suma de errores al cuadrado. GMM es más general: minimiza una suma ponderada de condiciones de momento. Cada condición de momento es como una "pista" que relaciona los datos con los parámetros. Si tienes más pistas (momentos) que parámetros, GMM las combina óptimamente usando la matriz de ponderación W. El J-test te dice si las pistas son consistentes entre sí.
🎯 Al final de este módulo podrás:
GMM: Un marco unificador

📐 Condiciones de Momento

Un estimador de momentos busca el valor de β que hace que la media muestral de una función sea igual a su valor poblacional (que es cero). Formalmente: E[g(y, X, β)] = 0.

Ejemplo: En MCO, la condición de momento es E[X'(y - Xβ)] = 0. La versión muestral es (1/N) Σ X'_i (y_i - X_iβ) = 0.

En IV: E[Z'(y - Xβ)] = 0, donde Z son los instrumentos. Si hay más Z que regresores X, tenemos más condiciones que parámetros = sobreidentificación.

E[g(y, X, β)] = 0

⚖️ Matriz de Ponderación W

Cuando hay más condiciones de momento que parámetros (sobreidentificación), no podemos satisfacer todas exactamente. En lugar de eso, minimizamos la forma cuadrática ponderada:

Función objetivo: J(β) = g(β)' W g(β), donde W es la matriz de ponderación (simétrica y definida positiva).

¿Cómo elegir W? La W óptima es la inversa de la matriz de covarianza de las condiciones de momento: W_opt = Var[g(β)]⁻¹. Esto minimiza la varianza asintótica del estimador GMM.

J(β) = g(β)' W g(β)

🏗️ GMM en Dos Etapas

Etapa 1: Usar W = I (identidad) para obtener un estimador inicial consistente (aunque ineficiente) de β. Calcular los residuos y estimar la matriz de varianza-covarianza de las condiciones de momento.

Etapa 2: Usar W_opt = S⁻¹, donde S es la matriz de covarianza estimada en la etapa 1. Reestimar β minimizando J(β) con la W óptima. Este es el estimador GMM eficiente.

GMM iterativo: Repetir la etapa 2 hasta convergencia. Mejora las propiedades en muestras finitas y es equivalente a estimación por máxima verosimilitud en algunos casos.

β_2 = argmin g(β)' S⁻¹ g(β)

✅ J-Test de Sobreidentificación

El J-test (o test de Hansen/Sargan) prueba la validez de las condiciones de momento cuando hay sobreidentificación. H0: E[g(y,X,β)] = 0 (todas las condiciones son válidas).

Estadístico: J = N · J(β_GMM) ~ χ²(L - K), donde L = número de condiciones de momento y K = número de parámetros.

Interpretación: Si J es grande (p < 0.05), rechazamos H0: al menos un instrumento es inválido. Si J es pequeño (p > 0.1), no rechazamos: los instrumentos son válidos.

J = N · g(β)' W g(β) ~ χ²(L - K)

🔗 GMM y Otros Estimadores

MCO como GMM: Cuando L = K (exactamente identificado), W es irrelevante y el estimador GMM equivale a MCO.

IV/2SLS como GMM: 2SLS es un caso particular de GMM con L ≥ K y W = (Σ Z'Z)⁻¹. Pero no usa la W óptima (no considera la heterocedasticidad).

GMM heterocedástico: Con W óptima, GMM es robusto a heterocedasticidad de forma automática, a diferencia de 2SLS.

GMM en panel: Arellano-Bond es un GMM aplicado a paneles dinámicos (módulo 9).

MCO = GMM exactamente identificado

⚠️ Problemas Prácticos

Instrumentos débiles: Si la correlación entre instrumentos y variables endógenas es baja, GMM de 2 etapas puede tener sesgo. Preferir LIML o GMM continuamente actualizado (CUE).

Muchos instrumentos: Con muchos instrumentos, el estimador GMM puede sobreajustar y el J-test perder poder. Usar "collapsed" instruments o limitar rezagos.

No linealidad: GMM puede estimar modelos no lineales: E[g(y, X, β)] = 0 donde g() no es lineal en β (ej: β entra en un exponente). La minimización numérica es más compleja.

CUE: argmin g(β)' S(β)⁻¹ g(β)
Ejemplo paso a paso

Estimamos una función de producción Cobb-Douglas: ln(Y) = β0 + βK ln(K) + βL ln(L) + ε. El capital es endógeno (las empresas más productivas invierten más). Usamos 3 instrumentos: ln(K_t-1), ln(L_t-1), y el precio de la energía.

Paso 1: Definir las condiciones de momento

Tenemos L = 3 instrumentos y K = 2 parámetros (βK, βL, más la constante). Total: 4 condiciones de momento (Z'ε = 0), 3 parámetros → L - K = 1 sobreidentificación.

Paso 2: GMM etapa 1 (W = I)

Minimizamos J(β) = g(β)' I g(β) donde g(β) = (1/N) Σ Z_i (ln(Y_i) - β0 - βK ln(K_i) - βL ln(L_i)). Obtenemos βK = 0.35, βL = 0.60 (rendimientos crecientes a escala: 0.95).

Paso 3: GMM etapa 2 (W óptima)

Residuos de la etapa 1 → S = Var[g(β1)] → W = S⁻¹. Re-estimamos: βK = 0.32, βL = 0.58. Los errores estándar se reducen un 20% con la W óptima.

Paso 4: J-test de sobreidentificación

J = 500 * J(β_GMM) = 2.1. Con 1 grado de libertad (4 condiciones - 3 parámetros), p = 0.15. No rechazamos H0: los instrumentos son válidos. Podemos confiar en los resultados.

Simulación: MCO vs IV vs GMM

Genera datos con endogeneidad y compara estimadores.

Presiona "Simular" para ver resultados.
Mini Quiz: GMM
💡 Responde las preguntas sobre GMM.

Resumen del módulo

  • GMM minimiza condiciones de momento ponderadas: J(β) = g(β)' W g(β)
  • MCO e IV son casos particulares de GMM (exactamente identificados)
  • La matriz óptima W = Var[g(β)]⁻¹ minimiza la varianza asintótica (GMM de 2 etapas)
  • El J-test (Hansen/Sargan) prueba la validez de las condiciones de momento sobreidentificadas