🎯 Ridge (L2)
Penaliza la suma de cuadrados de los coeficientes: λ∑βⱼ². Reduce todos los coeficientes pero no los lleva a cero. Ideal cuando muchos predictores tienen efecto pequeño. Mantiene todos los predictores en el modelo.
✂️ Lasso (L1)
Penaliza la suma de valores absolutos: λ∑|βⱼ|. Puede llevar coeficientes exactamente a cero, haciendo selección de variables automática. Ideal cuando pocos predictores son realmente importantes.
⚖️ Elastic Net
Combina L1 y L2: λ(α∑|βⱼ| + (1-α)∑βⱼ²). Lo mejor de ambos mundos. Funciona bien con grupos de variables correlacionadas. El parámetro α controla la mezcla.
📏 Bias-Variance Tradeoff
Al aumentar λ, aumentamos el sesgo (bias) pero reducimos la varianza. El λ óptimo minimiza el error de predicción fuera de muestra. Se encuentra con cross-validation.
Explora los conceptos con ejemplos practicos disponibles en la simulacion interactiva de este modulo.
Intuicion
Los modelos predictivos usan datos historicos para pronosticar valores futuros o desconocidos.
Formula clave
Cada modelo tiene su formulacion matematica para relacionar predictores con respuesta.
Paso a paso
Sigue la metodologia: entrenamiento, validacion, evaluacion.
Error comun: Sobreajuste
El sobreajuste ocurre cuando el modelo aprende ruido en vez de senal.
Ejemplo concreto
Aplica cada modelo a problemas reales de prediccion.
Conexion
Estos modelos avanzan hacia ML (Curso 5) y aplicaciones (Curso 6).