🔤 Encoding de Categóricas
One-hot encoding: crea una columna por categoría. Label encoding: asigna números 0,1,2... Target encoding: reemplaza por la media de la variable objetivo. Cada una tiene ventajas y desventajas.
📐 Escalado y Normalización
StandardScaler (media 0, var 1), MinMaxScaler (0-1) y RobustScaler (usa mediana y IQR). Los modelos basados en distancias (SVM, KNN) y redes neuronales requieren escalado.
🔗 Interacciones y Polinomiales
Crear nuevas variables multiplicando features existentes (interacciones) o elevando al cuadrado/cubo (polinomiales). sklearn tiene PolynomialFeatures. Crítico para modelos lineales que no capturan no-linealidad.
🎯 Selección de Features
Filter (correlación, chi-cuadrado), Wrapper (RFE, forward selection) y Embedded (Lasso, importancia de RF). Reduce dimensionalidad, mejora rendimiento y evita overfitting.
Explora los conceptos con ejemplos practicos disponibles en la simulacion interactiva de este modulo.
Intuicion
El ML permite a las computadoras aprender patrones de los datos sin ser programadas explicitamente para cada tarea.
Formula clave
Cada algoritmo tiene una funcion de perdida que optimiza durante el entrenamiento.
Paso a paso
El proceso sigue pasos: datos, modelo, entrenamiento, evaluacion.
Error comun: Data leakage
Cuando informacion del test afecta al entrenamiento: validacion invalida.
Ejemplo concreto
Aplica ML a problemas reales de clasificacion y regresion.
Conexion
ML se construye sobre estadistica inferencial y predictiva.