📉 Entropía
Mide el desorden en un nodo. Va de 0 (puro) a log2(k) (máxima impureza). La ganancia de información es la reducción de entropía al partir. Se prefiere en árboles con muchas clases.
📊 Índice Gini
Mide la probabilidad de clasificar incorrectamente un elemento si se etiqueta aleatoriamente según la distribución del nodo. Va de 0 (puro) a 1−1/k. Es más rápido computacionalmente que la entropía.
✂️ Poda (Pruning)
Reduce la complejidad del árbol cortando ramas con poca ganancia. La poda por costo-complejidad (CCP) balancea accuracy vs número de hojas usando un parámetro α.
⚠️ Overfitting
Árboles profundos memorizan el ruido. Se combate con profundidad máxima, mínimo de muestras por hoja y poda. Un árbol sin restricciones puede tener accuracy perfecto en train y pésimo en test.
Explora los conceptos con ejemplos practicos disponibles en la simulacion interactiva de este modulo.
Intuicion
El ML permite a las computadoras aprender patrones de los datos sin ser programadas explicitamente para cada tarea.
Formula clave
Cada algoritmo tiene una funcion de perdida que optimiza durante el entrenamiento.
Paso a paso
El proceso sigue pasos: datos, modelo, entrenamiento, evaluacion.
Error comun: Data leakage
Cuando informacion del test afecta al entrenamiento: validacion invalida.
Ejemplo concreto
Aplica ML a problemas reales de clasificacion y regresion.
Conexion
ML se construye sobre estadistica inferencial y predictiva.