📐 Condiciones de Momento
Un estimador de momentos busca el valor de β que hace que la media muestral de una función sea igual a su valor poblacional (que es cero). Formalmente: E[g(y, X, β)] = 0.
Ejemplo: En MCO, la condición de momento es E[X'(y - Xβ)] = 0. La versión muestral es (1/N) Σ X'_i (y_i - X_iβ) = 0.
En IV: E[Z'(y - Xβ)] = 0, donde Z son los instrumentos. Si hay más Z que regresores X, tenemos más condiciones que parámetros = sobreidentificación.
⚖️ Matriz de Ponderación W
Cuando hay más condiciones de momento que parámetros (sobreidentificación), no podemos satisfacer todas exactamente. En lugar de eso, minimizamos la forma cuadrática ponderada:
Función objetivo: J(β) = g(β)' W g(β), donde W es la matriz de ponderación (simétrica y definida positiva).
¿Cómo elegir W? La W óptima es la inversa de la matriz de covarianza de las condiciones de momento: W_opt = Var[g(β)]⁻¹. Esto minimiza la varianza asintótica del estimador GMM.
🏗️ GMM en Dos Etapas
Etapa 1: Usar W = I (identidad) para obtener un estimador inicial consistente (aunque ineficiente) de β. Calcular los residuos y estimar la matriz de varianza-covarianza de las condiciones de momento.
Etapa 2: Usar W_opt = S⁻¹, donde S es la matriz de covarianza estimada en la etapa 1. Reestimar β minimizando J(β) con la W óptima. Este es el estimador GMM eficiente.
GMM iterativo: Repetir la etapa 2 hasta convergencia. Mejora las propiedades en muestras finitas y es equivalente a estimación por máxima verosimilitud en algunos casos.
✅ J-Test de Sobreidentificación
El J-test (o test de Hansen/Sargan) prueba la validez de las condiciones de momento cuando hay sobreidentificación. H0: E[g(y,X,β)] = 0 (todas las condiciones son válidas).
Estadístico: J = N · J(β_GMM) ~ χ²(L - K), donde L = número de condiciones de momento y K = número de parámetros.
Interpretación: Si J es grande (p < 0.05), rechazamos H0: al menos un instrumento es inválido. Si J es pequeño (p > 0.1), no rechazamos: los instrumentos son válidos.
🔗 GMM y Otros Estimadores
MCO como GMM: Cuando L = K (exactamente identificado), W es irrelevante y el estimador GMM equivale a MCO.
IV/2SLS como GMM: 2SLS es un caso particular de GMM con L ≥ K y W = (Σ Z'Z)⁻¹. Pero no usa la W óptima (no considera la heterocedasticidad).
GMM heterocedástico: Con W óptima, GMM es robusto a heterocedasticidad de forma automática, a diferencia de 2SLS.
GMM en panel: Arellano-Bond es un GMM aplicado a paneles dinámicos (módulo 9).
⚠️ Problemas Prácticos
Instrumentos débiles: Si la correlación entre instrumentos y variables endógenas es baja, GMM de 2 etapas puede tener sesgo. Preferir LIML o GMM continuamente actualizado (CUE).
Muchos instrumentos: Con muchos instrumentos, el estimador GMM puede sobreajustar y el J-test perder poder. Usar "collapsed" instruments o limitar rezagos.
No linealidad: GMM puede estimar modelos no lineales: E[g(y, X, β)] = 0 donde g() no es lineal en β (ej: β entra en un exponente). La minimización numérica es más compleja.
Estimamos una función de producción Cobb-Douglas: ln(Y) = β0 + βK ln(K) + βL ln(L) + ε. El capital es endógeno (las empresas más productivas invierten más). Usamos 3 instrumentos: ln(K_t-1), ln(L_t-1), y el precio de la energía.
Tenemos L = 3 instrumentos y K = 2 parámetros (βK, βL, más la constante). Total: 4 condiciones de momento (Z'ε = 0), 3 parámetros → L - K = 1 sobreidentificación.
Minimizamos J(β) = g(β)' I g(β) donde g(β) = (1/N) Σ Z_i (ln(Y_i) - β0 - βK ln(K_i) - βL ln(L_i)). Obtenemos βK = 0.35, βL = 0.60 (rendimientos crecientes a escala: 0.95).
Residuos de la etapa 1 → S = Var[g(β1)] → W = S⁻¹. Re-estimamos: βK = 0.32, βL = 0.58. Los errores estándar se reducen un 20% con la W óptima.
J = 500 * J(β_GMM) = 2.1. Con 1 grado de libertad (4 condiciones - 3 parámetros), p = 0.15. No rechazamos H0: los instrumentos son válidos. Podemos confiar en los resultados.
Genera datos con endogeneidad y compara estimadores.