📐 Tobit (Tipo I)
El modelo Tobit (Tobin, 1958) fue diseñado para variables dependientes que tienen un límite inferior (generalmente 0). La idea es que existe una variable latente Y* = Xβ + ε con ε ~ N(0, σ²), pero solo observamos Y = max(0, Y*).
¿Qué significa? Para observaciones con Y* > 0, vemos el valor real. Para Y* ≤ 0, vemos 0. Es como si hubiera una barrera en 0 que acumula todos los valores negativos. A diferencia de Logit/Probit (que solo modelan la probabilidad de cruzar la barrera), Tobit también modela cuánto se cruza.
✂️ Censurado vs Truncado
Censura: Observas la variable pero con un valor límite. Ej: gasto en salud que se reporta como "más de $10,000" cuando supera ese monto. Sabes que gastaron al menos eso, pero no cuánto exactamente.
Truncamiento: No observas nada si la variable está fuera del rango. Ej: encuesta solo a personas con ingreso > $50,000. No tienes información de quienes ganan menos.
Diferencia clave: En censura tienes información parcial (sabes que existe pero no el valor exacto). En truncamiento no tienes ninguna información de la observación excluida.
📊 Efectos Marginales en Tobit
Tobit tiene tres tipos de efectos marginales, y cada uno responde a una pregunta diferente:
(1) Sobre la variable latente Y*: ∂E[Y*|X]/∂X = β. Mide el efecto en la variable subyacente (como en MCO pero sobre Y*, no sobre Y observada).
(2) Sobre Y observada (incluyendo ceros): ∂E[Y|X]/∂X = β·Φ(Xβ/σ). Incorpora la probabilidad de no estar censurado.
(3) Sobre Y condicional a Y>0: ∂E[Y|X, Y>0]/∂X = β·[1 - (Xβ/σ)·λ - λ²], donde λ es el inverse Mills ratio.
🔄 Heckman Two-Step
El sesgo de selección ocurre cuando la muestra no es aleatoria. Ejemplo clásico: salarios de mujeres trabajadoras. Solo observamos salarios de quienes deciden trabajar, pero esa decisión no es aleatoria.
Paso 1: Estimar un Probit de selección (D = 1 si la persona trabaja, 0 si no). Calcular el inverse Mills ratio λ = φ(Zγ)/Φ(Zγ).
Paso 2: Incluir λ como regresor adicional en la ecuación de salario. Si el coeficiente de λ es significativo, hay sesgo de selección.
⚠️ ¿Por qué no usar MCO?
Si usas MCO en datos censurados, el estimador es inconsistente. La razón es que la relación entre X e Y es no lineal cerca del punto de censura.
Ejemplo: si Y* = 2 + 3X + ε y censuramos en 0, para valores bajos de X muchos Y* son negativos y los vemos como 0. MCO ignora esto y "aplana" la pendiente. El sesgo es mayor cuanto más proporción de datos está censurada.
Regla práctica: Si más del 20% de las observaciones están en el límite de censura, Tobit es muy superior a MCO.
📐 Extensiones: Tobit Tipo II-V
Existen varias extensiones del modelo Tobit básico (Tipo I):
Tipo II ( Heckman ): Dos ecuaciones: selección (Probit) y resultado (regresión). Los errores pueden estar correlacionados.
Tipo III: Selección con ecuaciones heterocedásticas.
Tipo IV (Tobit con censura a izquierda y derecha): Y = max(c, min(Y*, C)). Útil cuando hay límite inferior y superior. Ej: puntajes de tests con piso y techo.
Modelamos el gasto en ocio (Y) en función del ingreso (X). Muchas personas reportan gasto cero (no gastan en ocio). Censuramos en 0. El modelo es Y = max(0, β₀ + β₁X + ε), con ε ~ N(0, σ²).
Obtenemos β₀ = -5, β₁ = 0.8, σ = 4. El ingreso tiene un efecto positivo sobre el gasto latente en ocio. La constante negativa explica por qué muchos tienen gasto censurado en 0.
Para una persona con ingreso X = 10: Y* = -5 + 0.8×10 = 3. Probabilidad de gastar algo: P(Y > 0) = Φ(3/4) = Φ(0.75) = 0.773. Hay un 77.3% de probabilidad de que esta persona gaste algo en ocio (no censurado).
E[Y|X] = Φ(Xβ/σ)·(Xβ) + σ·φ(Xβ/σ). Para X=10: Φ(0.75)×3 + 4×φ(0.75) = 0.773×3 + 4×0.301 = 2.32 + 1.20 = 3.52. El gasto esperado en ocio es 3.52 unidades monetarias.
∂E[Y|X]/∂X = β×Φ(Xβ/σ) = 0.8×0.773 = 0.618. Un aumento de 1 unidad en ingreso aumenta el gasto esperado en ocio en 0.618. Compáralo con el efecto en Y*: β = 0.8. El efecto sobre Y observado es menor porque algunas personas siguen censuradas en 0.
Ajusta el punto de censura y observa cómo Tobit corrige el sesgo de OLS.