El problema p ≫ n
Intuición: Cuando hay más variables (p) que observaciones (n), la matriz de datos es "ancha". La regresión OLS no funciona porque no podemos invertir X'X (es singular). Además, aunque pudiéramos, los coeficientes estimados serían enormemente inestables y sobreajustados. En econometría, esto ocurre cuando trabajamos con datos de encuestas (n=500) pero incluimos interacciones, cuadráticos y efectos fijos (p=2,000).
Fórmula explicada: Si p > n, el rango de X es a lo sumo n, por lo que X'X es singular (determinante = 0). No existe (X'X)^{-1}. El Lasso resuelve esto añadiendo una restricción L1 que selecciona variables, pero los coeficientes seleccionados están sesgados hacia cero.
Caso real: Un estudio genético mide 500,000 SNPs (variables genéticas) en solo 2,000 pacientes. p=500,000 ≫ n=2,000. Sin corrección por múltiples pruebas, miles de SNPs parecerían significativos solo por azar.
Error común: Pensar que p ≫ n solo importa en ML. En econometría aplicada, ocurre al incluir interacciones de alto orden, efectos fijos por pares, o muchas variables instrumentales.
Múltiples Pruebas: Bonferroni
Intuición: Si hacemos 100 pruebas de hipótesis con α=0.05, esperamos 5 falsos positivos por azar. Bonferroni corrige esto dividiendo α entre el número de pruebas: cada prueba individual usa α/p. Si p=100, cada prueba requiere p < 0.0005 para ser significativa. Es muy conservador: reduce falsos positivos pero también pierde potencia para detectar señales reales.
Fórmula explicada: Bonferroni rechaza H_0j si p_j ≤ α/p. FWER (Familywise Error Rate) es la probabilidad de cometer al menos UN falso positivo entre todas las pruebas. P(FWER) ≤ α. Si p=1,000 y α=0.05, el umbral por prueba es 0.00005.
Caso real: Un estudio de 50 variables explicativas sobre crecimiento económico. Sin corrección, 2-3 variables aparecen significativas por azar. Con Bonferroni (α/50 = 0.001), solo las variables con evidencia muy fuerte sobreviven.
Error común: Usar Bonferroni cuando las pruebas NO son independientes. Bonferroni funciona en cualquier caso (es válido bajo cualquier dependencia), pero puede ser demasiado conservador con variables correlacionadas.
Múltiples Pruebas: FDR (Benjamini-Hochberg)
Intuición: FDR (False Discovery Rate) controla la PROPORCIÓN de falsos descubrimientos entre todos los descubrimientos, no la probabilidad de cometer ALGUN error. Es como decir: "de cada 100 variables que declaro significativas, acepto que hasta 5 sean falsas". Es más permisivo que Bonferroni y por tanto más potente (encuentra más señales reales).
Fórmula explicada: Benjamini-Hochberg: ordena los p-valores p_{(1)} ≤ p_{(2)} ≤ ... ≤ p_{(p)}. Encuentra el k máximo tal que p_{(k)} ≤ (k/p) × q, donde q es el nivel FDR deseado (típicamente 0.05). Rechaza todas las hipótesis con p-valor ≤ p_{(k)}.
Caso real: Un análisis de 500 genes relacionados con una enfermedad. Con FDR=0.1, declaramos 30 genes como significativos. Esperamos que 3 de esos 30 (10%) sean falsos positivos. Con Bonferroni, quizás solo declararíamos 5 genes, perdiéndonos 25 señales reales.
Error común: Asumir que FDR controla la probabilidad de que un resultado específico sea falso. FDR controla la proporción esperada de falsos entre todos los rechazos, no la probabilidad de que un rechazo individual sea falso.
Knockoffs (Barber-Candès)
Intuición: Knockoffs crean, para cada variable original X_j, una copia "fake" X̃_j con la MISMA estructura de correlación que las originales, PERO independiente de Y. Luego se comparan los coeficientes de X_j vs X̃_j: si X_j es genuinamente predictiva, su coeficiente será mayor que el de su knockoff. Es como tener un placebo para cada variable.
Fórmula explicada: Se construye X̃ (knockoffs) tal que X'X = X̃'X̃ y corr(X_j, X̃_j) se minimiza. Luego se corre Lasso sobre [X, X̃] y se calcula W_j = |Z_j| - |Z̃_j|, donde Z_j y Z̃_j son los coeficientes normalizados. Se seleccionan las variables con W_j > τ, donde τ se elige para controlar FDR al nivel deseado.
Caso real: En un experimento con 1,000 variables y n=200, los knockoffs permiten seleccionar las variables relevantes garantizando FDR ≤ 0.1, sin asumir esparsidad ni distribuciones paramétricas.
Error común: Pensar que los knockoffs son lo mismo que permutaciones. Las permutaciones rompen la correlación entre variables. Los knockoffs PRESERVAN la correlación entre variables (lo que es crucial para FDR válido).
Debiased Lasso
Intuición: El Lasso produce coeficientes sesgados hacia cero por la penalización L1. El debiased Lasso "corrige" este sesgo añadiendo un término que recoge los residuos del modelo original. Es como ajustar la mira de un rifle después de ver dónde impactaron las primeras balas. El resultado son estimaciones √n-consistentes y asintóticamente normales, permitiendo intervalos de confianza.
Fórmula explicada: β̂^u = β̂^Lasso + (1/n) M X'(Y - Xβ̂^Lasso), donde M es una matriz de escala que depende de la estructura de covarianza. El término (1/n)M X'(Y - Xβ̂^Lasso) es la corrección de sesgo que hace que β̂^u sea asintóticamente normal: √n(β̂^u - β*) → N(0, V).
Caso real: Estimar el efecto de 200 políticas públicas en el crecimiento económico con n=50 países. Lasso selecciona 5 políticas pero sus coeficientes están sesgados. Debiased Lasso proporciona intervalos de confianza del 95% para cada coeficiente, permitiendo decir "esta política tiene un efecto significativo entre 0.3 y 1.2 puntos porcentuales".
Error común: Usar debiased Lasso con n muy pequeño (ej. n < √p). La teoría asintótica requiere que n crezca suficientemente rápido respecto a p para que M sea estable.
Desparsificación de van de Geer
Intuición: La desparsificación (van de Geer, Bühlmann) es otro método para hacer inferencia válida después de Lasso. La idea es "invertir" la ecuación de Lasso usando el nodewise Lasso: para cada variable X_j, se predice X_j usando las demás variables. Esto da una matriz Θ que "desparsifica" el estimador Lasso original. Es computacionalmente eficiente y no requiere conocer la matriz de covarianza.
Fórmula explicada: Para cada j, se corre un Lasso de X_j sobre X_{-j} (nódwise regression). Los residuos de esta regresión forman la matriz Θ. Luego, β̂^u = β̂^Lasso + Θ X'(Y - Xβ̂^Lasso). La distribución asintótica es N(β*, σ²ΘΣΘ), permitiendo p-valores e intervalos de confianza.
Caso real: Con datos de precios de vivienda (p=400, n=100), el Lasso selecciona 20 predictores pero no podemos hacer inferencia. La desparsificación produce intervalos de confianza para los 400 coeficientes, revelando que solo 8 tienen efecto significativo distinto de cero.
Error común: Creer que desparsificación y debiased Lasso son equivalentes en práctica. Aunque la idea es similar, los detalles técnicos (cómo se construye M vs Θ) difieren y pueden dar resultados distintos en muestras finitas.
Estudiamos 100 variables potenciales predictoras del crecimiento económico con solo 50 países. Aplicamos corrección por múltiples pruebas.
Esto NO significa que 7 variables sean significativas. Con α=0.05 y 100 pruebas, esperamos 5 falsos positivos por azar (0.05 × 100 = 5). De las 7 detectadas, quizás solo 2 son señales genuinas y 5 son ruido.
Bonferroni es muy conservador. La variable que sobrevive tiene un p-valor de 0.0003, evidencia muy fuerte. Pero probablemente estamos perdiendo otras variables con efecto real pero menor (p.ej., p=0.001 no pasa el umbral de 0.0005).
Rechazamos las 4 hipótesis con menores p-valores. Esperamos que 0.4 de estos 4 (10%) sean falsos positivos. Hemos ganado 3 descubrimientos respecto a Bonferroni, aceptando un riesgo controlado.
Compara inferencia naive vs corregida (Bonferroni, BH). Observa las tasas de descubrimiento en 20 simulaciones.