🔬 Post-Lasso Inference

Inferencia válida después de selección de variables con Lasso (Belloni-Chernozhukov-Hansen)

Post-selection Coverage Inference
Módulo 3 de 12
💡 Piénsalo así: Post-Lasso es como un detective que primero usa un detector de metales (Lasso) para localizar las pistas (variables) importantes, y luego interroga solo a esos sospechosos con un interrogatorio formal (OLS) que produce inferencia válida. Sin este proceso, las conclusiones serían sesgadas por haber "mirado" los datos primero.
Teoría: Post-Lasso y Selección

Post-Lasso (BCH 2014)

Intuición: Lasso selecciona variables, pero los coeficientes de Lasso tienen sesgo (están encogidos). Post-Lasso dice: usa Lasso solo para decidir QUÉ variables incluir, luego estima OLS solo con esas variables. Así obtienes coeficientes insesgados y puedes hacer inferencia válida.

Fórmula explicada: Paso 1: Lasso estima β̂ y selecciona el conjunto Ŝ = {j: β̂ⱼ ≠ 0}. Paso 2: OLS en Ŝ produce β̂_OLS con errores estándar válidos. La teoría de BCH demuestra que bajo esparsidad (pocos coeficientes no cero), β̂_OLS es √n-consistente y asintóticamente normal.

Caso real: Un estudio del efecto de reformas tributarias en el crecimiento económico. Con 50 años de datos (n=50) y 200 posibles controles (p=200), Lasso selecciona los controles relevantes, y Post-Lasso estima el efecto de la reforma con intervalos de confianza válidos.

Error común: Usar los coeficientes de Lasso directamente para inferencia. Los coeficientes de Lasso están sesgados hacia cero (encogimiento), por lo que los tests de hipótesis basados en ellos no son válidos.

Lasso → Ŝ = {j: β̂j ≠ 0} → OLS en Ŝ

Sesgo de Selección

Intuición: Si usas los mismos datos para seleccionar variables y para estimar, el p-valor de tus tests estará sesgado. Es como lanzar una moneda 100 veces, quedarte con las 5 rachas más largas, y luego decir "mira, estas rachas no pueden ser casualidad".

Fórmula explicada: El sesgo de selección surge porque E[β̂_naive - β] ≠ 0. La variable dependiente Y y los predictores se usan dos veces: para decidir qué entra y para estimar el efecto. Esto crea un sesgo de "data snooping" que infla la significancia aparente.

Caso real: En un estudio médico con 100 pacientes y 1,000 genes, si usas los mismos datos para seleccionar los genes asociados y para estimar su efecto, los intervalos de confianza serán irrealmente estrechos y encontrarás "genes significativos" que en realidad no lo son.

Error común: Pensar que el sesgo de selección es pequeño. En alta dimensión, el sesgo puede ser enorme y llevar a conclusiones completamente equivocadas.

Sesgo = E[β̂naive - β] ≠ 0

Partialling Out

Intuición: Imagina que quieres saber el efecto de la educación (D) en el salario (Y), controlando por experiencia, género, etc. Partialling out primero "limpia" Y y D de los controles, luego mira la relación entre los residuos. Es como aislar el efecto puro de D.

Fórmula explicada: El modelo es Y = θD + g(X) + ε. Primero estimas g(X) (la relación entre Y y los controles) y m(X) (la relación entre D y los controles). Luego: Y - ĝ(X) = θ(D - m̂(X)) + ε. El parámetro θ se estima haciendo OLS de los residuos de Y sobre los residuos de D.

Caso real: Para estimar el efecto de un programa de capacitación laboral (D) en el empleo (Y), partialling out primero elimina el efecto de edad, educación previa y región de los datos, y luego estima el efecto del programa sobre los datos "limpios".

Error común: Olvidar que el partialling out solo funciona si la relación entre controles y Y/D es aproximadamente lineal. Con relaciones no lineales, se necesita DML.

Y = θD + g(X) + ε

Inferencia Uniforme

Intuición: La inferencia uniforme significa que tus intervalos de confianza son válidos sin importar qué modelo "verdadero" generó los datos, siempre que sea esparso. No solo funcionan para un modelo específico, sino para toda una clase de modelos.

Fórmula explicada: Formalmente, P(θ ∈ IC) → 1 - α uniformemente sobre la clase de modelos esparsos. Esto es crucial porque en la práctica no sabes cuál es el modelo verdadero. La inferencia uniforme te protege contra el "worst-case scenario".

Caso real: Si estudias el efecto de 20 políticas públicas en distintos países, la inferencia uniforme garantiza que tus intervalos de confianza sean válidos aunque la estructura de cada país sea diferente.

Error común: Pensar que la inferencia uniforme es automática. Solo es válida bajo condiciones de esparsidad (el número de variables relevantes crece lentamente con n). Si el modelo no es esparso, Post-Lasso puede fallar.

P(θ ∈ IC) → 1 - α

Esparsidad Aproximada

Intuición: La esparsidad aproximada dice que aunque haya muchas variables, solo unas pocas tienen un efecto importante. Las demás tienen efectos tan pequeños que se pueden ignorar sin pérdida significativa. Es como organizar una fiesta: hay miles de personas en la ciudad, pero solo invitas a tus 20 amigos más cercanos.

Fórmula explicada: Formalmente, s = número de coeficientes |βⱼ| > c√(log(p)/n). La condición de esparsidad requiere que s << n (s crece más lento que n). Si esta condición no se cumple, Lasso no puede seleccionar correctamente y Post-Lasso falla.

Caso real: En un DGP con 100 variables donde 50 tienen efectos pequeños pero no cero, la esparsidad aproximada es dudosa. En este caso, métodos como Ridge o Elastic Net pueden funcionar mejor que Post-Lasso.

Error común: Asumir esparsidad sin verificarla. Si el modelo verdadero tiene muchos coeficientes moderados, Post-Lasso no funcionará bien y se necesitan métodos como DML.

s = dim(S∗) ≪ n

Comparación: Naive vs Post-Lasso

Intuición: La inferencia naive (seleccionar con Lasso y reportar los coeficientes de Lasso como si fueran OLS) produce intervalos de confianza demasiado estrechos y p-valores demasiado pequeños. Post-Lasso corrige esto y produce cobertura cercana al nivel nominal.

Fórmula explicada: En la simulación, comparamos dos enfoques: (1) Naive: estimar Lasso, seleccionar variables, calcular OLS en las seleccionadas y usar errores estándar OLS normales. (2) Post-Lasso: mismo proceso pero usando errores estándar ajustados por selección. La cobertura esperada es 95% en ambos, pero la naive suele dar ~85% mientras Post-Lasso da ~93%.

Caso real: Un investigador que usa naive reporta "el efecto es significativo al 5%" cuando en realidad el verdadero nivel de significancia es 15%. Post-Lasso corrige esta ilusión de significancia.

Error común: Confundir "cobertura" con "precisión". Post-Lasso produce intervalos más amplios (menos precisión aparente) pero más honestos (mejor cobertura).

Cobertura Naive < Cobertura Post-Lasso ≈ 95%
Ejemplo paso a paso

Queremos estimar el efecto causal de una variable D en Y controlando por 20 variables, pero solo 3 (X1, X2, X3) son confounders reales.

Paso 1: Lasso selecciona variables entre las 20 candidatas. Con λ=0.5, puede seleccionar X1, X2, X3 (las correctas) y quizá alguna de más.

La selección no es perfecta: Lasso puede incluir algunas falsas (falsos positivos) u omitir alguna relevante (falso negativo). Pero la teoría de BCH muestra que esto no afecta la validez asintótica de Post-Lasso.

Paso 2: Post-Lasso estima OLS solo en las variables seleccionadas por Lasso. Esto da coeficientes insesgados.

OLS no encoge los coeficientes, por lo que β̂_PL no tiene el sesgo de Lasso. Sin embargo, los errores estándar deben ajustarse porque la selección introduce incertidumbre adicional.

Paso 3: Comparamos la cobertura empírica de ambos métodos en 50 simulaciones.

La simulación ejecuta 50 experimentos independientes. En cada uno, genera datos nuevos, aplica Naive y Post-Lasso, y registra si el intervalo de confianza cubre el verdadero valor del parámetro.

Paso 4: Conclusión: Post-Lasso produce coberturas más cercanas al 95% nominal.

La inferencia naive subestima la incertidumbre porque ignora que las variables fueron seleccionadas mirando los datos. Post-Lasso reconoce esta incertidumbre adicional y produce intervalos más honestos.

Simulación: Naive vs Post-Lasso

Modelo de alta dimensión. Compara cobertura de inferencia naif (sin ajuste) vs Post-Lasso válida.

Presiona "Simular" para ver cobertura naif vs Post-Lasso.
Mini Quiz: Post-Lasso
💡 Responde las preguntas sobre Post-Lasso.