๐ญ Variable Latente
La idea fundamental de Logit/Probit es que existe una variable latente (no observada) Y* que determina la decisión. Y* = Xβ + ε representa un "índice de propensión". Solo observamos el resultado binario: Y=1 si Y* > 0, Y=0 si Y* ≤ 0.
Piensa en Y* como la utilidad neta de hacer algo: si los beneficios superan los costos (Y* > 0), la acción se realiza. La distribución de ε determina la forma funcional: logística para Logit, normal para Probit.
๐ Logit: Λ(t)
Logit asume que ε sigue una distribución logística estándar con media 0 y varianza π²/3. La función de enlace es Λ(t) = eᵀ/(1+eᵀ), que transforma cualquier número real en una probabilidad entre 0 y 1.
Ventaja: La forma cerrada permite calcular odds ratios fácilmente: P/(1-P) = eˆ(Xβ). Un cambio unitario en Xₖ multiplica el odds por eˆβₖ.
Colas: La logística tiene colas más pesadas que la normal, lo que significa que asigna mayor probabilidad a eventos extremos.
๐ Probit: Φ(t)
Probit asume que ε ~ N(0,1) (normal estándar). La función de enlace es Φ(t) = ∫_{-∞}ᵀ φ(z)dz, la FDA de la normal estándar.
Similitud: En la práctica, Logit y Probit dan resultados casi idénticos excepto en las colas. Los coeficientes de Probit son aproximadamente β_Probit ≈ β_Logit × 0.625 (para comparar, escala Amemiya).
Ventaja: La interpretación en términos de variable latente normal es más natural en algunos contextos (ej: teoría de utilidad aleatoria).
๐ Efectos Marginales
A diferencia de MCO, los coeficientes β en Logit/Probit NO son el efecto marginal. β mide el cambio en el índice latente Y*, no en P(Y=1).
El efecto marginal de Xₖ sobre P(Y=1) es: ∂P/∂Xₖ = βₖ · f(Xβ), donde f es la función de densidad (logística o normal). El efecto depende del punto de evaluación.
MEM vs AME: Se evalúa en la media de X (MEM, Marginal Effects at Means) o se promedia sobre todas las observaciones (AME, Average Marginal Effects). AME es generalmente preferido.
๐ง Estimación por MLE
Logit y Probit se estiman por Máxima Verosimilitud (MLE), no por MCO. La función de verosimilitud es L = Π[F(Xβ)]ᴵᵀ [1-F(Xβ)]⁷⁻ᴵᵀ.
No existe solución analítica cerrada; se usa optimización numérica (Newton-Raphson). Los errores estándar son asintóticos y se basan en la matriz de información.
Bondad de ajuste: No hay R² tradicional. Se usan pseudo-R² (McFadden) o porcentaje de clasificaciones correctas.
โ๏ธ Logit vs Probit — ¿Cuál elegir?
En la práctica, ambos dan resultados muy similares. La elección suele basarse en:
(1) Tradición disciplinaria: epidemiología y econometría usan Logit por los odds ratios; ciencias políticas prefieren Probit.
(2) Colas: si hay muchos eventos extremos, Logit puede ser mejor por sus colas más pesadas.
(3) Interpretación: Logit permite la interpretación directa de odds ratios, que es más intuitiva para muchos.
(4) Efectos múltiples: Probit multivariado es más fácil de extender que Logit multivariado.
Modelamos la probabilidad de que un estudiante apruebe un examen (Y=1) en función de las horas de estudio (X). Estimamos un Logit y obtenemos β₀ = -2.5, β₁ = 0.8.
Índice latente: Y* = -2.5 + 0.8 × 3 = -0.1. Probabilidad: P(aprobar) = Λ(-0.1) = e⁻⁰ยท¹/(1+e⁻⁰ยท¹) = 0.475. Hay un 47.5% de probabilidad de aprobar con 3 horas.
Y* = -2.5 + 0.8 × 5 = 1.5. P = Λ(1.5) = e¹ยท⁵/(1+e¹ยท⁵) = 0.818. Con 5 horas, la probabilidad sube a 81.8%.
Supongamos que la media de horas es 4. Y* en la media = -2.5 + 0.8×4 = 0.7. f(0.7) para Logit = Λ(0.7)·(1-Λ(0.7)) = 0.668×0.332 = 0.222. Efecto marginal = 0.8 × 0.222 = 0.178. Cada hora adicional de estudio aumenta la probabilidad de aprobar en 17.8 puntos porcentuales (en la media).
Odds ratio = eˆβ₁ = eˆ0.8 = 2.23. Por cada hora adicional de estudio, el odds de aprobar (P/(1-P)) se multiplica por 2.23. Es decir, si el odds inicial era 1:1 (50% de probabilidad), con una hora más sería 2.23:1 (69% de probabilidad).
Genera datos y compara el ajuste de Logit vs Probit. Observa la curva S de probabilidades.