✂️ Tobit y Modelos Censurados

Cuando los datos se cortan en un punto, Tobit da la solución

Censura Truncamiento Heckman
Módulo 5 de 12
💡 Piénsalo así: Imagina que mides el tiempo que la gente pasa en el gimnasio, pero el gimnasio cierra a las 10pm. Ves "10pm" para todos los que se quedaron más, pero no sabes cuánto más se habrían quedado. Eso es censura: observas el límite, no el valor real. Tobit modela esto: estima la relación subyacente aunque tengas datos censurados en 0 (o en cualquier otro punto de corte).
🎯 Al final de este módulo podrás:
Modelo Tobit y Censura

📐 Tobit (Tipo I)

El modelo Tobit (Tobin, 1958) fue diseñado para variables dependientes que tienen un límite inferior (generalmente 0). La idea es que existe una variable latente Y* = Xβ + ε con ε ~ N(0, σ²), pero solo observamos Y = max(0, Y*).

¿Qué significa? Para observaciones con Y* > 0, vemos el valor real. Para Y* ≤ 0, vemos 0. Es como si hubiera una barrera en 0 que acumula todos los valores negativos. A diferencia de Logit/Probit (que solo modelan la probabilidad de cruzar la barrera), Tobit también modela cuánto se cruza.

Y = max(0, Xβ + ε)

✂️ Censurado vs Truncado

Censura: Observas la variable pero con un valor límite. Ej: gasto en salud que se reporta como "más de $10,000" cuando supera ese monto. Sabes que gastaron al menos eso, pero no cuánto exactamente.

Truncamiento: No observas nada si la variable está fuera del rango. Ej: encuesta solo a personas con ingreso > $50,000. No tienes información de quienes ganan menos.

Diferencia clave: En censura tienes información parcial (sabes que existe pero no el valor exacto). En truncamiento no tienes ninguna información de la observación excluida.

Censura: Y observada con límite | Truncamiento: Y no observada

📊 Efectos Marginales en Tobit

Tobit tiene tres tipos de efectos marginales, y cada uno responde a una pregunta diferente:

(1) Sobre la variable latente Y*: ∂E[Y*|X]/∂X = β. Mide el efecto en la variable subyacente (como en MCO pero sobre Y*, no sobre Y observada).

(2) Sobre Y observada (incluyendo ceros): ∂E[Y|X]/∂X = β·Φ(Xβ/σ). Incorpora la probabilidad de no estar censurado.

(3) Sobre Y condicional a Y>0: ∂E[Y|X, Y>0]/∂X = β·[1 - (Xβ/σ)·λ - λ²], donde λ es el inverse Mills ratio.

∂E[Y|X]/∂X = β·Φ(Xβ/σ)

🔄 Heckman Two-Step

El sesgo de selección ocurre cuando la muestra no es aleatoria. Ejemplo clásico: salarios de mujeres trabajadoras. Solo observamos salarios de quienes deciden trabajar, pero esa decisión no es aleatoria.

Paso 1: Estimar un Probit de selección (D = 1 si la persona trabaja, 0 si no). Calcular el inverse Mills ratio λ = φ(Zγ)/Φ(Zγ).

Paso 2: Incluir λ como regresor adicional en la ecuación de salario. Si el coeficiente de λ es significativo, hay sesgo de selección.

E[Y|X, selección] = Xβ + ρσλ

⚠️ ¿Por qué no usar MCO?

Si usas MCO en datos censurados, el estimador es inconsistente. La razón es que la relación entre X e Y es no lineal cerca del punto de censura.

Ejemplo: si Y* = 2 + 3X + ε y censuramos en 0, para valores bajos de X muchos Y* son negativos y los vemos como 0. MCO ignora esto y "aplana" la pendiente. El sesgo es mayor cuanto más proporción de datos está censurada.

Regla práctica: Si más del 20% de las observaciones están en el límite de censura, Tobit es muy superior a MCO.

MCO: β sesgado hacia cero con censura

📐 Extensiones: Tobit Tipo II-V

Existen varias extensiones del modelo Tobit básico (Tipo I):

Tipo II ( Heckman ): Dos ecuaciones: selección (Probit) y resultado (regresión). Los errores pueden estar correlacionados.

Tipo III: Selección con ecuaciones heterocedásticas.

Tipo IV (Tobit con censura a izquierda y derecha): Y = max(c, min(Y*, C)). Útil cuando hay límite inferior y superior. Ej: puntajes de tests con piso y techo.

Y = max(c, min(Y*, C)) (doble censura)
Ejemplo paso a paso

Modelamos el gasto en ocio (Y) en función del ingreso (X). Muchas personas reportan gasto cero (no gastan en ocio). Censuramos en 0. El modelo es Y = max(0, β₀ + β₁X + ε), con ε ~ N(0, σ²).

Paso 1: Estimar los parámetros por MLE

Obtenemos β₀ = -5, β₁ = 0.8, σ = 4. El ingreso tiene un efecto positivo sobre el gasto latente en ocio. La constante negativa explica por qué muchos tienen gasto censurado en 0.

Paso 2: Calcular la probabilidad de gasto censurado

Para una persona con ingreso X = 10: Y* = -5 + 0.8×10 = 3. Probabilidad de gastar algo: P(Y > 0) = Φ(3/4) = Φ(0.75) = 0.773. Hay un 77.3% de probabilidad de que esta persona gaste algo en ocio (no censurado).

Paso 3: Calcular el gasto esperado total

E[Y|X] = Φ(Xβ/σ)·(Xβ) + σ·φ(Xβ/σ). Para X=10: Φ(0.75)×3 + 4×φ(0.75) = 0.773×3 + 4×0.301 = 2.32 + 1.20 = 3.52. El gasto esperado en ocio es 3.52 unidades monetarias.

Paso 4: Efecto marginal del ingreso

∂E[Y|X]/∂X = β×Φ(Xβ/σ) = 0.8×0.773 = 0.618. Un aumento de 1 unidad en ingreso aumenta el gasto esperado en ocio en 0.618. Compáralo con el efecto en Y*: β = 0.8. El efecto sobre Y observado es menor porque algunas personas siguen censuradas en 0.

Simulación: OLS vs Tobit con Censura

Ajusta el punto de censura y observa cómo Tobit corrige el sesgo de OLS.

0.0
Presiona "Simular" para ver la comparación.
Mini Quiz: Tobit y Censura
💡 Responde las preguntas sobre Tobit y modelos censurados.

Resumen del módulo

  • El modelo Tobit usa una variable latente Y* y observa Y = max(0, Y*); útil para datos censurados en cero
  • Censura: observas el límite (información parcial); Truncamiento: no observas nada fuera del rango
  • Tobit tiene tres efectos marginales: sobre Y* (β), sobre Y (β·Φ), y sobre Y|Y>0
  • Heckman corrige sesgo de selección en dos etapas: Probit de selección + regresión con inverse Mills ratio