🔗 Pipeline (sklearn)
Encadena transformaciones y un estimador final. Garantiza que las transformaciones se apliquen consistentemente en train/test. Facilita GridSearch y evita data leakage. Método: pipeline.fit(X_train, y_train).
🔀 ColumnTransformer
Aplica diferentes transformaciones a diferentes columnas. Por ejemplo: estandarizar numéricas y one-hot codificar categóricas. Se combina con Pipeline para crear flujos completos y modulares.
🎯 GridSearchCV / RandomizedSearchCV
Búsqueda sistemática de hiperparámetros con validación cruzada. GridSearch prueba todas las combinaciones; RandomizedSearch muestrea aleatoriamente. Optuna y Hyperopt son alternativas más eficientes.
🤖 AutoML
Herramientas que automatizan selección de modelo, transformación de datos y ajuste de hiperparámetros. Frameworks: AutoGluon, H2O AutoML, TPOT, FLAML y Auto-sklearn. Ideales para prototipado rápido.
Explora los conceptos con ejemplos practicos disponibles en la simulacion interactiva de este modulo.
Intuicion
El ML permite a las computadoras aprender patrones de los datos sin ser programadas explicitamente para cada tarea.
Formula clave
Cada algoritmo tiene una funcion de perdida que optimiza durante el entrenamiento.
Paso a paso
El proceso sigue pasos: datos, modelo, entrenamiento, evaluacion.
Error comun: Data leakage
Cuando informacion del test afecta al entrenamiento: validacion invalida.
Ejemplo concreto
Aplica ML a problemas reales de clasificacion y regresion.
Conexion
ML se construye sobre estadistica inferencial y predictiva.