📉 Regularización

Ridge, Lasso y Elastic Net para estimación en alta dimensión

L1 · L2 Coefficient Paths λ via CV
Módulo 2 de 12
💡 Piénsalo así: La regularización es como un entrenador personal para tu modelo: Lasso es como decir "usa solo los ejercicios (variables) más importantes, elimina el resto". Ridge es como decir "haz todos los ejercicios pero con moderación, sin exagerar ninguno". Elastic Net combina ambas filosofías.
Teoría: Ridge, Lasso, Elastic Net

Ridge (L2)

Intuición: Ridge añade una penalización proporcional al cuadrado de cada coeficiente. Esto "encoge" todos los coeficientes hacia cero, pero ninguno llega exactamente a cero. Es como apretar una esponja: toda el agua (magnitud) se reduce, pero ninguna gota desaparece por completo.

Fórmula explicada: La función a minimizar es RSS + λΣβⱼ². RSS mide el error de predicción. λΣβⱼ² es la penalización: cuando λ es grande, los coeficientes deben ser muy pequeños para mantener baja la penalización. Al elevar al cuadrado, los coeficientes grandes se penalizan mucho más que los pequeños.

Caso real: En econometría financiera, si tienes 50 indicadores económicos correlacionados para predecir el PIB, Ridge los usa todos pero reduce sus pesos, evitando que la multicolinealidad infle la varianza de las predicciones.

Error común: Ridge NO selecciona variables. Todos los predictores permanecen en el modelo, solo que con coeficientes más pequeños. Esto puede hacer el modelo menos interpretable si tienes cientos de variables.

min RSS + λΣβj2

Lasso (L1)

Intuición: Lasso usa el valor absoluto de los coeficientes como penalización. Esto tiene un efecto sorprendente: puede llevar coeficientes EXACTAMENTE a cero. Es como un chef que prueba 50 ingredientes y decide que solo 5 son esenciales, descartando el resto por completo.

Fórmula explicada: Minimiza RSS + λΣ|βⱼ|. La diferencia clave con Ridge es el valor absoluto vs el cuadrado. Geométricamente, la restricción de Lasso tiene esquinas (un diamante), y es en esas esquinas donde los coeficientes tocan el eje y se vuelven cero. Ridge tiene una restricción circular, sin esquinas, por lo que los coeficientes se reducen pero nunca a cero.

Caso real: En genética, con 10,000 genes y solo 200 muestras, Lasso selecciona los pocos genes realmente asociados con una enfermedad, ignorando el resto. Esto produce modelos interpretables y con mejor capacidad predictiva.

Error común: Cuando hay variables muy correlacionadas, Lasso tiende a elegir solo una del grupo, descartando las demás al azar. No es ideal cuando todas las variables correlacionadas son importantes.

min RSS + λΣ|βj|

Elastic Net

Intuición: Elastic Net combina Lasso y Ridge usando una mezcla controlada por el parámetro α. Es como un chef que selecciona los ingredientes clave (como Lasso) pero sin descartar grupos enteros de ingredientes relacionados (como Ridge).

Fórmula explicada: La penalización es αΣ|βⱼ| + (1-α)Σβⱼ². Cuando α=1, es Lasso puro. Cuando α=0, es Ridge puro. Valores intermedios mezclan ambos efectos. Esto permite que grupos de variables correlacionadas se seleccionen juntas, resolviendo la limitación de Lasso.

Caso real: En predicción de precios de viviendas, donde variables como "metros cuadrados", "número de habitaciones" y "tamaño del terreno" están correlacionadas, Elastic Net las retiene a todas mientras elimina variables irrelevantes como "color de la fachada".

Error común: α no se elige por validación cruzada tan a menudo como debiera. Muchos investigadores usan Lasso o Ridge por defecto sin probar Elastic Net, que suele funcionar mejor en la práctica.

αΣ|βj| + (1-α)Σβj2

Selección de λ

Intuición: λ controla cuánta regularización aplicamos. λ = 0 significa sin regularización (OLS puro). λ muy grande significa que todos los coeficientes se encogen casi a cero (sesgo enorme). El punto óptimo está en el medio, donde se minimiza el error de predicción.

Fórmula explicada: La validación cruzada (CV) prueba muchos valores de λ y elige el que minimiza el error promedio: λ_CV = argmin CV Error(λ). Para cada λ, se divide la muestra en K partes, se entrena en K-1 y se evalúa en la restante, repitiendo K veces.

Caso real: En la práctica, se prueba una grilla de 100 valores de λ desde muy pequeño hasta muy grande (en escala logarítmica). Se usa 5-fold o 10-fold CV y se selecciona el λ con menor error. A veces se usa el "1-SE rule": elegir el λ más grande cuyo error esté a menos de 1 error estándar del mínimo.

Error común: Usar el mismo λ para Lasso y Ridge. La escala óptima de λ es completamente distinta para L1 y L2. Para Lasso, λ suele ser más pequeño porque los coeficientes ya son más dispersos.

λCV = argmin CV Error(λ)

Tradeoff Sesgo-Varianza

Intuición: La regularización deliberadamente introduce algo de sesgo (los coeficientes se encogen hacia cero) a cambio de reducir drásticamente la varianza. Es como una navaja: más filo (menos sesgo) significa más riesgo de cortarte (más varianza).

Fórmula explicada: El error de predicción esperado se descompone como: Error = Sesgo² + Varianza + Ruido irreducible. Sin regularización (λ=0), el sesgo es mínimo pero la varianza puede ser enorme (especialmente con p grande). Al aumentar λ, el sesgo aumenta pero la varianza disminuye. El λ óptimo equilibra ambos.

Caso real: Imagina estimar el efecto de la educación en el salario. OLS te da un coeficiente puntual. En una muestra pequeña (n=50), ese coeficiente puede variar enormemente entre muestras. Ridge lo estabiliza (menos varianza), pero lo encoge un poco hacia cero (más sesgo).

Error común: Pensar que el mejor modelo es el de menor sesgo. En predicción, un modelo con algo de sesgo pero mucha menos varianza casi siempre funciona mejor.

E[Error] = Sesgo2 + Varianza + σ2

Coefficient Paths

Intuición: Los coefficient paths muestran cómo cambia cada coeficiente βⱼ a medida que variamos λ desde 0 (sin regularización) hasta valores grandes (máxima regularización). Es como ver una película del proceso de regularización.

Fórmula explicada: En Lasso, los paths son lineales a trozos: los coeficientes entran y salen del modelo (βⱼ = 0) en ciertos valores de λ. En Ridge, son curvas suaves que tienden a cero sin tocarlo nunca. El orden en que las variables "entran" al modelo cuando disminuimos λ revela su importancia relativa.

Caso real: En marketing, si graficas los coefficient paths de 20 variables para predecir ventas, verás que "precio" y "publicidad en TV" entran primero (con λ grande), mientras que "color del empaque" entra hasta el final (λ pequeño). Esto te dice cuáles variables son más importantes.

Error común: Interpretar la magnitud del coeficiente en el path como el "efecto causal" de la variable. Los coeficientes regularizados tienen sesgo y no representan efectos causales sin ajustes adicionales.

βj(λ) para j = 1,...,p
Ejemplo paso a paso

Imagina que queremos predecir el precio de una casa usando 10 variables, pero solo 3 son relevantes (metros², habitaciones, ubicación). Las otras 7 son ruido.

Paso 1: Generamos datos con 100 casas, 10 variables. Solo X1, X2, X3 afectan el precio (coeficientes reales: 2.5, -1.8, 0.9). Las otras 7 variables son ruido puro.

En la simulación de abajo, estos son los valores reales. Observa que X4 a X10 tienen coeficiente real = 0. No deberían influir en el precio.

Paso 2: Estimamos OLS (sin regularización) y vemos que asigna coeficientes NO cero a las variables irrelevantes. Esto es sobreajuste.

OLS intenta minimizar el error en los 100 datos que tenemos, pero al hacerlo, "aprende" patrones del ruido. Por eso asigna coeficientes como 0.3 o -0.2 a variables que realmente no importan.

Paso 3: Aplicamos Lasso con λ=10. Observa que muchos coeficientes irrelevantes se vuelven EXACTAMENTE cero.

Lasso hace selección automática de variables. Las únicas que sobreviven son las que realmente importan. ¡Pero cuidado! Con λ muy grande, también encoge los coeficientes relevantes, subestimando su verdadero efecto.

Paso 4: Comparamos con Ridge usando el mismo λ. Ridge encoge TODOS los coeficientes, pero ninguno llega a cero.

Ridge reduce la magnitud de todos los coeficientes por igual, incluyendo los de las variables irrelevantes. Es útil cuando todas las variables importan un poco, pero perjudicial cuando hay muchas variables irrelevantes porque añaden ruido.

Paso 5: Conclusión: ¿Cuándo usar cada uno? Si crees que pocas variables importan → Lasso. Si crees que todas importan un poco → Ridge. Si no estás seguro → Elastic Net.

En la práctica econométrica, Elastic Net suele ser la mejor opción porque la realidad rara vez es tan simple como "solo 3 variables importan" o "todas importan por igual".

Simulación: Coefficient Paths

Generamos datos con p=10 predictores (incluyendo irrelevantes). Desliza λ para ver cómo cambian los coeficientes.

10.0
Presiona "Actualizar" para ver los coeficientes OLS, Lasso y Ridge.
Mini Quiz: Regularización
💡 Responde las preguntas sobre regularización.