📐 Poisson
La regresión Poisson asume que Y (conteo) sigue una distribución Poisson con parámetro λ (tasa): P(Y=y) = e⁻λλᴵ/y!. La tasa λ depende de las X a través de un enlace logarítmico: λ = exp(Xβ).
Propiedad clave: En Poisson, E[Y] = Var[Y] = λ. Esta equidispersión es restrictiva. Si la varianza es mayor que la media, hay sobredispersión.
Ejemplo: Número de patentes de una empresa en un año, número de visitas al médico, número de accidentes de tráfico.
📊 Semi-elasticidad
En regresión Poisson, los coeficientes β se interpretan como semi-elasticidades. Como E[Y|X] = exp(Xβ), entonces ∂E[Y|X]/∂Xₖ = βₖ·E[Y|X].
Interpretación: Un cambio unitario en Xₖ multiplica el conteo esperado por exp(βₖ). O equivalentemente, cambia el conteo esperado en 100×βₖ% (para β pequeños).
Ejemplo: si β₁ = 0.05, cada unidad adicional de X aumenta el conteo esperado en aproximadamente 5%.
⚠️ Sobredispersión
La sobredispersión ocurre cuando Var[Y] > E[Y]. Es extremadamente común en datos reales. Las causas incluyen heterogeneidad no observada (cada individuo tiene su propia tasa) y correlación entre eventos.
Negativa Binomial (NB): Extiende Poisson añadiendo un parámetro de dispersión α: Var[Y] = μ + αμ². Cuando α → 0, NB → Poisson.
Detección: Si el coeficiente α es significativo en NB, hay sobredispersión y NB es preferible a Poisson. También se puede usar el test de sobredispersión de Cameron-Trivedi.
🚫 Zero-Inflated
Los modelos Zero-Inflated (ZI) son para situaciones donde hay más ceros de los que predice Poisson o NB. Ejemplo: número de veces que una persona fuma al día. Muchas personas no fuman (ceros estructurales), y entre los que fuman, el número de cigarrillos varía.
El modelo ZI combina dos procesos: (1) Un Logit/Probit que determina si Y puede ser >0 (fumador vs no fumador). (2) Un Poisson/NB que modela el conteo para quienes pueden tener >0.
Probabilidad de cero: P(Y=0) = π + (1-π)e⁻λ, donde π es la probabilidad del "estado cero siempre".
🔧 Estimación por MLE
Poisson, NB y ZI se estiman por MLE. La función de verosimilitud para Poisson es: ln L = Σ[Y·ln(λ) - λ - ln(Y!)].
Errores estándar robustos: Si hay sobredispersión pero usas Poisson, los coeficientes siguen siendo consistentes (estimador de quasi-MLE), pero los errores estándar están subestimados. Se recomienda usar errores estándar robustos (Hubert/White).
Bondad de ajuste: Se compara el log-likelihood del modelo contra el modelo nulo. AIC y BIC ayudan a elegir entre Poisson, NB y ZI.
📋 Exposición y Offset
Cuando la ventana de observación varía entre individuos, se usa un offset. Ejemplo: número de accidentes de auto en un año podría depender de los kilómetros recorridos.
El modelo con offset es: ln(E[Y|X]) = Xβ + ln(exposición). Esto es equivalente a modelar la tasa: E[Y|X]/exposición = exp(Xβ).
En la práctica, el offset se incluye como una variable con coeficiente fijado en 1. No se estima, se impone.
Modelamos el número de veces que una persona va al gimnasio por semana (Y) en función de la distancia al gimnasio en km (X). Usamos regresión Poisson con enlace log: ln(λ) = β₀ + β₁X.
Obtenemos β₀ = 1.5, β₁ = -0.2. Para una persona que vive a 2 km: ln(λ) = 1.5 - 0.2×2 = 1.1. Conteo esperado: λ = exp(1.1) = 3.0 visitas por semana.
β₁ = -0.2 significa que por cada km adicional de distancia, el conteo esperado se multiplica por exp(-0.2) = 0.819. Es decir, se reduce en un 18.1% (100% × (1 - 0.819)). Para una persona a 5 km: λ = exp(1.5 - 0.2×5) = exp(0.5) = 1.65 visitas.
Calculamos la media muestral de Y: 2.8, y la varianza: 4.2. Como Var > Media (4.2 > 2.8), hay indicios de sobredispersión. Estimamos NB y obtenemos α = 0.35 (significativo, p < 0.05). Concluimos que NB es preferible a Poisson.
Poisson: log-likelihood = -452, AIC = 908. NB: log-likelihood = -428, AIC = 860. El NB tiene mejor ajuste (AIC más bajo). Los coeficientes son similares (β₁_NB = -0.18), pero los errores estándar de NB son mayores (SE_NB = 0.06 vs SE_Poisson = 0.04), lo que refleja la incertidumbre adicional por la sobredispersión.
Genera datos de conteo y compara las estimaciones de Poisson, NB y OLS.