Función de Cuantil Condicional
Q_τ(y|x) = xβ(τ). El τ-ésimo cuantil de y condicional en x es una función lineal de x. Para τ = 0.5, estimamos la mediana condicional; para τ = 0.9, el percentil 90.
La gran ventaja es que cada cuantil tiene su propio vector de coeficientes β(τ). Esto permite que el efecto de una variable sea diferente en la cola baja vs alta de la distribución.
Check Function
La función de pérdida asimétrica ρ_τ(u) = u(τ - I(u < 0)) penaliza de forma diferente los errores positivos y negativos. Para τ = 0.9, los errores negativos (subestimaciones) pesan 9 veces más que los positivos.
Esto es clave: OLS minimiza errores al cuadrado (simétrico), mientras que la regresión cuantílica usa esta función asimétrica para "empujar" la línea hacia el cuantil deseado.
Estimador Koenker-Bassett (1978)
β̂(τ) = argmin Σ ρ_τ(yᵢ - xᵢβ). No tiene solución cerrada como OLS. Se resuelve mediante programación lineal (algoritmo simplex o de puntos interiores).
Es robusto a outliers en la variable dependiente: un valor extremo afecta menos a la mediana que a la media. Esto lo hace ideal para datos con colas pesadas o valores atípicos.
Heterogeneidad y Heterocedasticidad
Si el efecto de X es constante en toda la distribución, los coeficientes β(τ) serían iguales para todo τ. Si varían, hay evidencia de heterogeneidad. La regresión cuantílica es la herramienta natural para detectarla.
Bajo heterocedasticidad (varianza del error depende de X), OLS sigue siendo insesgado pero ineficiente, mientras que la regresión cuantílica revela cómo la dispersión cambia con X.
Quantile Treatment Effects (QTE)
QTE(τ) = Q_τ(y₁|x) - Q_τ(y₀|x). En lugar de preguntar "¿cuál es el efecto promedio del tratamiento?", preguntamos "¿cómo afecta el tratamiento a diferentes puntos de la distribución?"
Ejemplo: un programa de entrenamiento laboral podría aumentar el salario en el percentil 10 (los más pobres) pero no en el percentil 90. OLS diría "efecto promedio = X", perdiendo esta valiosa heterogeneidad.
Inferencia y Errores Estándar
Los errores estándar se estiman por bootstrap (recomendado) o por fórmulas asintóticas (más rápidas pero menos precisas con muestras pequeñas). El bootstrap es especialmente importante porque la varianza asintótica depende de la densidad del error.
En la práctica, se recomienda estimar varios cuantiles simultáneamente (τ = 0.1, 0.25, 0.5, 0.75, 0.9) y graficar los coeficientes para visualizar la heterogeneidad.
Ejemplo paso a paso: Retorno a educación por cuantiles
Queremos saber si el retorno a la educación (efecto de un año más de estudio en el salario) es igual para personas con salarios bajos y altos.
Seleccionamos τ = 0.10, 0.50 y 0.90. Esto nos dará el efecto de la educación en el percentil 10 (salarios bajos), la mediana y el percentil 90 (salarios altos). También estimamos OLS para comparar.
Para τ = 0.5 (mediana), minimizamos Σ ρ_0.5(yᵢ - xᵢβ) donde ρ_0.5(u) = |u|/2. Esto es equivalente a minimizar la suma de desviaciones absolutas (LAD regression). Para τ = 0.9, las observaciones con y < xβ (subestimadas) reciben peso 0.9, las sobrestimadas peso 0.1.
Supongamos que obtenemos: β̂_OLS = 0.10, β̂_0.10 = 0.14, β̂_0.50 = 0.10, β̂_0.90 = 0.06. Esto revela que el retorno a educación es mayor para salarios bajos (14%) que para salarios altos (6%).
¿Por qué el retorno a educación es decreciente? Una posible explicación: las personas con salarios altos tienen otras ventajas (redes, capital social) que hacen que la educación formal importe menos en el margen. Para salarios bajos, la educación es el principal canal de movilidad social. OLS daría 10% como "promedio", perdiendo esta historia.
Controla el nivel de heterocedasticidad. Observa cómo OLS da un solo coeficiente mientras la regresión cuantílica muestra efectos heterogéneos.