🎒 Bagging (Bootstrap Aggregating)
Crea múltiples muestras bootstrap (con reemplazo) del dataset original. Entrena un modelo en cada muestra y promedia las predicciones. Reduce la varianza sin aumentar el sesgo.
🌲 Random Forest
Extiende Bagging añadiendo aleatoriedad en las variables: cada árbol solo considera un subconjunto aleatorio de features en cada split. Esto descorrelaciona los árboles y mejora la precisión.
📊 OOB (Out-of-Bag)
Cada muestra bootstrap deja fuera ~37% de los datos. Esos datos sirven como validación interna sin necesidad de train/test split. El error OOB es un estimador insesgado del error de generalización.
⭐ Importancia de Variables
RF mide importancia por: (1) disminución media de impureza (Gini/entropía) al usar la variable, y (2) aumento del error OOB al permutar la variable. Útil para selección de features.
Explora los conceptos con ejemplos practicos disponibles en la simulacion interactiva de este modulo.
Intuicion
El ML permite a las computadoras aprender patrones de los datos sin ser programadas explicitamente para cada tarea.
Formula clave
Cada algoritmo tiene una funcion de perdida que optimiza durante el entrenamiento.
Paso a paso
El proceso sigue pasos: datos, modelo, entrenamiento, evaluacion.
Error comun: Data leakage
Cuando informacion del test afecta al entrenamiento: validacion invalida.
Ejemplo concreto
Aplica ML a problemas reales de clasificacion y regresion.
Conexion
ML se construye sobre estadistica inferencial y predictiva.