🎯 Variables Acotadas

Fractional logit, beta regression, two-part models, Dirichlet

[0,1] Proporciones Composicionales
Módulo 8 de 12
💡 Piénsalo así: Las variables acotadas en [0,1] son como el porcentaje del presupuesto que gastas en comida: no puede ser negativo ni superar el 100%. Usar OLS sería como permitir predicciones fuera de rango. El fractional logit (Papke-Wooldridge) es como una puerta que siempre se cierra entre 0 y 1, mientras que beta regression permite diferentes formas dentro del intervalo.
Teoría de Variables Acotadas

El Problema de Variables en [0,1]

Muchas variables en economía son proporciones o fracciones: tasa de desempleo, porcentaje del gasto en salud, participación laboral femenina, calificación crediticia. Están naturalmente acotadas entre 0 y 1 (o 0% y 100%).

OLS es inapropiado porque: (a) puede predecir valores fuera de [0,1], (b) asume varianza constante (heterocedasticidad inherente en proporciones), (c) los errores no son normales. Se necesitan modelos diseñados específicamente para este soporte.

Fractional Logit (Papke-Wooldridge, 1996)

E(y|x) = G(xβ) donde G es la función logística: G(z) = exp(z)/(1+exp(z)). Se estima por Quasi-Máxima Verosimilitud (QMLE) con la función Bernoulli. No requiere que y sea binaria, solo que esté en [0,1].

Ventajas: consistente incluso si la distribución verdadera no es Bernoulli (solo necesita que E(y|x) esté correctamente especificada). Errores estándar robustos (sandwich). Simple de implementar en cualquier software.

E(y|x) = exp(xβ) / (1 + exp(xβ))

Beta Regression (Ferrari-Cribari-Neto, 2004)

y ~ Beta(μ, φ) donde μ = E(y) = g(xβ) y φ es el parámetro de precisión. La función de densidad beta es flexible: puede ser simétrica, sesgada a la izquierda o derecha, en forma de U o de J, dependiendo de los parámetros.

Ventajas sobre fractional logit: modela explícitamente la varianza (vía φ) y puede capturar diferentes formas de la distribución. Desventaja: no maneja ceros exactos (y debe estar en (0,1), no incluir 0 o 1).

Two-Part Models

Parte 1 (selección): P(y > 0) = G(zγ), típicamente un logit/probit para modelar si y > 0. Parte 2 (intensidad): E(y|y > 0) = H(xβ), modela el valor esperado condicional a ser positivo.

Ideal cuando hay muchos ceros (exceso de masa en 0). Por ejemplo: gasto en salud donde muchas personas gastan exactamente 0. El two-part model descompone el efecto en: (a) efecto en la probabilidad de gastar, y (b) efecto en el monto gastado condicional a gastar.

Datos Composicionales y Regresión Dirichlet

Cuando y es un vector de proporciones que suman 1 (ej: % del presupuesto en comida, vivienda, transporte). La regresión Dirichlet modela cada componente y₁, ..., y_K como una distribución Dirichlet(α₁, ..., α_K).

Cada αⱼ = μⱼ·φ donde μⱼ es la media de la componente j y φ es la precisión. Las medias suman 1. Este modelo respeta la estructura de suma constante y permite que las proporciones estén correlacionadas negativamente (si gastas más en comida, gastas menos en otros).

Comparación y Elección del Modelo

Fractional logit: seguro, simple, funciona con ceros y unos. Beta regression: más flexible pero no acepta 0 ni 1 exactos. Two-part: ideal para exceso de ceros. Dirichlet: para vectores de proporciones.

Criterios de selección: AIC/BIC para comparación, validación cruzada, y sobre todo, inspección de predicciones (¿están en [0,1]? ¿capturan la heterocedasticidad?). Siempre comparar con OLS para mostrar por qué es inadecuado.

Ejemplo paso a paso: Tasa de participación laboral femenina

Queremos modelar la tasa de participación femenina en el mercado laboral por ciudad (variable en [0,1]). Covariables: educación promedio, tasa de fertilidad, ingreso per cápita.

Paso 1: Inspeccionar la variable dependiente

La tasa de participación está entre 0.32 y 0.78. Hay algunas ciudades con tasa = 0 (ninguna mujer trabaja) y otras cercanas a 1. Esto descarta Beta Regression pura (no tolera 0 exacto) y sugiere fractional logit o two-part.

Paso 2: Estimar Fractional Logit

E(participación|X) = exp(β₀ + β₁·educ + β₂·fertilidad + β₃·ingreso) / [1 + exp(...)]. Estimamos por QMLE Bernoulli con errores robustos. Obtenemos β₁ = 0.25 (educación aumenta participación), β₂ = -0.18 (fertilidad la reduce).

Paso 3: Interpretar efectos marginales

∂E(y|x)/∂educ = β₁·E(y|x)·(1-E(y|x)). Con E(y|x) = 0.5, el efecto marginal de un año más de educación promedio es 0.25·0.5·0.5 = 0.0625 (aumenta la participación en 6.25 puntos porcentuales). El efecto marginal depende del nivel de participación actual.

Comparar con OLS

OLS predice para algunos valores de X una participación > 1 o < 0, lo cual no tiene sentido. Además, los errores OLS son heterocedásticos (la varianza de una proporción es máxima cuando la media es 0.5 y mínima en los extremos). Fractional logit corrige ambos problemas automáticamente.

Simulación: Modelos para [0,1]

Compara OLS, fractional logit y beta regression para una variable dependiente en [0,1].

Presiona "Simular" para ver la comparación.
Mini Quiz: Variables Acotadas
💡 Responde las preguntas sobre variables acotadas.

Resumen del módulo