Ecuación de Selección
La decisión de participar está determinada por una variable latente z*ᵢ = wᵢγ + uᵢ. Observamos yᵢ solo si z*ᵢ > 0. Esto modela la primera etapa: ¿quién entra en la muestra?
Por ejemplo, en el mercado laboral, solo observamos salarios de quienes deciden trabajar. La ecuación de selección captura esa decisión usando variables w (como número de hijos, estado civil) que afectan la participación pero no el salario.
Ecuación de Outcome
El resultado de interés (salario, gasto, etc.) se modela como yᵢ = xᵢβ + εᵢ. El sesgo surge si los errores de ambas ecuaciones están correlacionados: corr(u, ε) ≠ 0.
La intuición es simple: si factores no observados que afectan la decisión de trabajar (ej: motivación) también afectan el salario, entonces la muestra de trabajadores no es aleatoria.
Inverse Mills Ratio (IMR)
λ(zγ) = φ(zγ)/Φ(zγ) es el cociente entre la función de densidad y la función de distribución acumulada de la normal. Se incluye como regresor en la ecuación de outcome para corregir el sesgo.
La IMR captura la probabilidad de ser seleccionado condicional a las características. Cuando la IMR es grande, significa que la observación es "atípica" en términos de selección y necesita un ajuste mayor.
Two-Step (Método de Heckman)
Paso 1: Estima un Probit para la ecuación de selección y calcula la IMR para cada observación. Paso 2: Incluye la IMR como regresor en la ecuación de outcome por OLS. El coeficiente de la IMR estima ρ·σε.
Ventaja: simple, rápido, funciona bien en muestras grandes. Desventaja: menos eficiente que ML, los errores estándar del paso 2 necesitan corrección.
Máxima Verosimilitud (ML)
Estima ambas ecuaciones simultáneamente asumiendo normalidad bivariada en (u, ε). Es más eficiente que two-step porque usa toda la información disponible de manera óptima.
Desventaja: puede no converger si ρ está cerca de ±1 o si la variable de exclusión es débil. En la práctica, muchos investigadores reportan ambos estimadores como chequeo de robustez.
Variable de Exclusión
Para identificar el modelo, necesitamos al menos una variable que afecte la selección (z* = wγ) pero no el outcome (y = xβ). Sin exclusión, el modelo se identifica solo por la no linealidad de la IMR, lo cual es frágil.
Ejemplo clásico: el número de hijos afecta la decisión de trabajar (selección) pero no el salario potencial (outcome). La validez de este supuesto es crucial para la credibilidad del modelo.
Ejemplo paso a paso: Salarios de mujeres casadas
Queremos estimar el retorno a la educación en salarios, pero solo observamos salarios de mujeres que trabajan. Usamos el modelo de Heckman con "número de hijos" como variable de exclusión.
Estimamos la decisión de trabajar: P(trabajar = 1) = Φ(γ₀ + γ₁·educ + γ₂·hijos). Educación afecta tanto selección como salario; hijos afecta solo selección. Obtenemos γ̂ y predecimos la IMR: λ̂ᵢ = φ(wᵢγ̂) / Φ(wᵢγ̂).
Para cada mujer en la muestra, calculamos λ̂ = φ(ẑ) / Φ(ẑ) donde ẑ = γ̂₀ + γ̂₁·educ + γ̂₂·hijos. Si una mujer tiene alta probabilidad de trabajar, su IMR es pequeña. Si es improbable que trabaje pero lo hace, su IMR es grande.
Regresionamos log(salario) sobre educación y la IMR: log(salario) = β₀ + β₁·educ + βλ·λ̂ + error. Si βλ es significativo, hay evidencia de sesgo de selección. β₁ es el retorno a educación corregido.
Supongamos que obtenemos β₁ = 0.12 y βλ = 0.35 (significativo). Esto significa que: (a) un año más de educación aumenta el salario en 12% (corregido por selección), y (b) hay sesgo de selección positivo — mujeres con mayor salario no observado tienen más probabilidad de trabajar. Si hubiéramos usado OLS simple (ignorando selección), el estimador estaría sesgado hacia arriba.
Controla la correlación ρ entre los errores de selección y outcome. Observa cómo OLS se sesga mientras Heckman corrige.