📐 High-Dimensional Inference

p ≫ n, múltiples pruebas, knockoffs, debiased Lasso y desparsificación

p ≫ n FDR · Bonferroni Knockoffs
Módulo 10 de 12
💡 Piénsalo así: La alta dimensionalidad (p ≫ n) es como tratar de adivinar la personalidad de alguien con solo 3 fotos: tienes más preguntas (variables) que respuestas (datos). Bonferroni es como ser extremadamente estricto: solo aceptas una pista si es abrumadora. FDR es más pragmático: aceptas que algunas pistas sean falsas, pero controlas la proporción. Knockoffs son como crear gemelos falsos de tus variables para detectar señales genuinas. El debiased Lasso es como un corrector de tiro que ajusta la puntería después de que el Lasso ya eligió las variables importantes.
Teoría: Inferencia en Alta Dimensión

El problema p ≫ n

Intuición: Cuando hay más variables (p) que observaciones (n), la matriz de datos es "ancha". La regresión OLS no funciona porque no podemos invertir X'X (es singular). Además, aunque pudiéramos, los coeficientes estimados serían enormemente inestables y sobreajustados. En econometría, esto ocurre cuando trabajamos con datos de encuestas (n=500) pero incluimos interacciones, cuadráticos y efectos fijos (p=2,000).

Fórmula explicada: Si p > n, el rango de X es a lo sumo n, por lo que X'X es singular (determinante = 0). No existe (X'X)^{-1}. El Lasso resuelve esto añadiendo una restricción L1 que selecciona variables, pero los coeficientes seleccionados están sesgados hacia cero.

Caso real: Un estudio genético mide 500,000 SNPs (variables genéticas) en solo 2,000 pacientes. p=500,000 ≫ n=2,000. Sin corrección por múltiples pruebas, miles de SNPs parecerían significativos solo por azar.

Error común: Pensar que p ≫ n solo importa en ML. En econometría aplicada, ocurre al incluir interacciones de alto orden, efectos fijos por pares, o muchas variables instrumentales.

p ≫ n: más parámetros que observaciones

Múltiples Pruebas: Bonferroni

Intuición: Si hacemos 100 pruebas de hipótesis con α=0.05, esperamos 5 falsos positivos por azar. Bonferroni corrige esto dividiendo α entre el número de pruebas: cada prueba individual usa α/p. Si p=100, cada prueba requiere p < 0.0005 para ser significativa. Es muy conservador: reduce falsos positivos pero también pierde potencia para detectar señales reales.

Fórmula explicada: Bonferroni rechaza H_0j si p_j ≤ α/p. FWER (Familywise Error Rate) es la probabilidad de cometer al menos UN falso positivo entre todas las pruebas. P(FWER) ≤ α. Si p=1,000 y α=0.05, el umbral por prueba es 0.00005.

Caso real: Un estudio de 50 variables explicativas sobre crecimiento económico. Sin corrección, 2-3 variables aparecen significativas por azar. Con Bonferroni (α/50 = 0.001), solo las variables con evidencia muy fuerte sobreviven.

Error común: Usar Bonferroni cuando las pruebas NO son independientes. Bonferroni funciona en cualquier caso (es válido bajo cualquier dependencia), pero puede ser demasiado conservador con variables correlacionadas.

Bonferroni: rechazar si pj ≤ α/p

Múltiples Pruebas: FDR (Benjamini-Hochberg)

Intuición: FDR (False Discovery Rate) controla la PROPORCIÓN de falsos descubrimientos entre todos los descubrimientos, no la probabilidad de cometer ALGUN error. Es como decir: "de cada 100 variables que declaro significativas, acepto que hasta 5 sean falsas". Es más permisivo que Bonferroni y por tanto más potente (encuentra más señales reales).

Fórmula explicada: Benjamini-Hochberg: ordena los p-valores p_{(1)} ≤ p_{(2)} ≤ ... ≤ p_{(p)}. Encuentra el k máximo tal que p_{(k)} ≤ (k/p) × q, donde q es el nivel FDR deseado (típicamente 0.05). Rechaza todas las hipótesis con p-valor ≤ p_{(k)}.

Caso real: Un análisis de 500 genes relacionados con una enfermedad. Con FDR=0.1, declaramos 30 genes como significativos. Esperamos que 3 de esos 30 (10%) sean falsos positivos. Con Bonferroni, quizás solo declararíamos 5 genes, perdiéndonos 25 señales reales.

Error común: Asumir que FDR controla la probabilidad de que un resultado específico sea falso. FDR controla la proporción esperada de falsos entre todos los rechazos, no la probabilidad de que un rechazo individual sea falso.

FDR = E[V / R] ≤ q (Benjamini-Hochberg)

Knockoffs (Barber-Candès)

Intuición: Knockoffs crean, para cada variable original X_j, una copia "fake" X̃_j con la MISMA estructura de correlación que las originales, PERO independiente de Y. Luego se comparan los coeficientes de X_j vs X̃_j: si X_j es genuinamente predictiva, su coeficiente será mayor que el de su knockoff. Es como tener un placebo para cada variable.

Fórmula explicada: Se construye X̃ (knockoffs) tal que X'X = X̃'X̃ y corr(X_j, X̃_j) se minimiza. Luego se corre Lasso sobre [X, X̃] y se calcula W_j = |Z_j| - |Z̃_j|, donde Z_j y Z̃_j son los coeficientes normalizados. Se seleccionan las variables con W_j > τ, donde τ se elige para controlar FDR al nivel deseado.

Caso real: En un experimento con 1,000 variables y n=200, los knockoffs permiten seleccionar las variables relevantes garantizando FDR ≤ 0.1, sin asumir esparsidad ni distribuciones paramétricas.

Error común: Pensar que los knockoffs son lo mismo que permutaciones. Las permutaciones rompen la correlación entre variables. Los knockoffs PRESERVAN la correlación entre variables (lo que es crucial para FDR válido).

Wj = |Zj| - |Z̃j|

Debiased Lasso

Intuición: El Lasso produce coeficientes sesgados hacia cero por la penalización L1. El debiased Lasso "corrige" este sesgo añadiendo un término que recoge los residuos del modelo original. Es como ajustar la mira de un rifle después de ver dónde impactaron las primeras balas. El resultado son estimaciones √n-consistentes y asintóticamente normales, permitiendo intervalos de confianza.

Fórmula explicada: β̂^u = β̂^Lasso + (1/n) M X'(Y - Xβ̂^Lasso), donde M es una matriz de escala que depende de la estructura de covarianza. El término (1/n)M X'(Y - Xβ̂^Lasso) es la corrección de sesgo que hace que β̂^u sea asintóticamente normal: √n(β̂^u - β*) → N(0, V).

Caso real: Estimar el efecto de 200 políticas públicas en el crecimiento económico con n=50 países. Lasso selecciona 5 políticas pero sus coeficientes están sesgados. Debiased Lasso proporciona intervalos de confianza del 95% para cada coeficiente, permitiendo decir "esta política tiene un efecto significativo entre 0.3 y 1.2 puntos porcentuales".

Error común: Usar debiased Lasso con n muy pequeño (ej. n < √p). La teoría asintótica requiere que n crezca suficientemente rápido respecto a p para que M sea estable.

β̂u = β̂Lasso + M X'(Y - Xβ̂Lasso)

Desparsificación de van de Geer

Intuición: La desparsificación (van de Geer, Bühlmann) es otro método para hacer inferencia válida después de Lasso. La idea es "invertir" la ecuación de Lasso usando el nodewise Lasso: para cada variable X_j, se predice X_j usando las demás variables. Esto da una matriz Θ que "desparsifica" el estimador Lasso original. Es computacionalmente eficiente y no requiere conocer la matriz de covarianza.

Fórmula explicada: Para cada j, se corre un Lasso de X_j sobre X_{-j} (nódwise regression). Los residuos de esta regresión forman la matriz Θ. Luego, β̂^u = β̂^Lasso + Θ X'(Y - Xβ̂^Lasso). La distribución asintótica es N(β*, σ²ΘΣΘ), permitiendo p-valores e intervalos de confianza.

Caso real: Con datos de precios de vivienda (p=400, n=100), el Lasso selecciona 20 predictores pero no podemos hacer inferencia. La desparsificación produce intervalos de confianza para los 400 coeficientes, revelando que solo 8 tienen efecto significativo distinto de cero.

Error común: Creer que desparsificación y debiased Lasso son equivalentes en práctica. Aunque la idea es similar, los detalles técnicos (cómo se construye M vs Θ) difieren y pueden dar resultados distintos en muestras finitas.

√n(β̂u - β*) → N(0, σ2ΘΣΘ)
Ejemplo paso a paso

Estudiamos 100 variables potenciales predictoras del crecimiento económico con solo 50 países. Aplicamos corrección por múltiples pruebas.

Paso 1: Calculamos regresiones individuales de cada variable X_j contra Y. De 100 variables, 7 tienen p-valor < 0.05.

Esto NO significa que 7 variables sean significativas. Con α=0.05 y 100 pruebas, esperamos 5 falsos positivos por azar (0.05 × 100 = 5). De las 7 detectadas, quizás solo 2 son señales genuinas y 5 son ruido.

Paso 2: Aplicamos Bonferroni: umbral = 0.05/100 = 0.0005. Solo 1 variable sobrevive.

Bonferroni es muy conservador. La variable que sobrevive tiene un p-valor de 0.0003, evidencia muy fuerte. Pero probablemente estamos perdiendo otras variables con efecto real pero menor (p.ej., p=0.001 no pasa el umbral de 0.0005).

Paso 3: Aplicamos Benjamini-Hochberg con FDR=0.1. Ordenamos los 100 p-valores y encontramos que el mayor k con p_{(k)} ≤ (k/100)×0.1 es k=4.

Rechazamos las 4 hipótesis con menores p-valores. Esperamos que 0.4 de estos 4 (10%) sean falsos positivos. Hemos ganado 3 descubrimientos respecto a Bonferroni, aceptando un riesgo controlado.

Simulación: p=100, n=50

Compara inferencia naive vs corregida (Bonferroni, BH). Observa las tasas de descubrimiento en 20 simulaciones.

Presiona "Simular" para ver comparación.
Mini Quiz: High-Dimensional Inference
💡 Responde las preguntas sobre inferencia de alta dimensión.