🎯 K-Means
Divide los datos en K grupos. Asigna cada punto al centroide más cercano y recalcula centroides. Rápido y escalable. Limitación: sensible a inicialización y asume grupos esféricos.
🌳 Jerárquico (Aglomerativo)
Construye un dendrograma fusionando los pares más cercanos iterativamente. No requiere K. El corte del dendrograma define los clusters. Bueno para datos pequeños.
🔵 DBSCAN
Agrupa puntos densamente conectados. Detecta clusters de forma arbitraria y señala outliers como ruido. Requiere los parámetros ε (radio) y minPts. Ideal para datos con ruido.
📏 Silhouette y Elbow
Elbow: gráfica inercia vs K, busca el codo. Silhouette: mide qué tan similar es un punto a su cluster vs al vecino. Va de -1 (mal) a 1 (bien). El mejor K maximiza silhouette.
Explora los conceptos con ejemplos practicos disponibles en la simulacion interactiva de este modulo.
Intuicion
El ML permite a las computadoras aprender patrones de los datos sin ser programadas explicitamente para cada tarea.
Formula clave
Cada algoritmo tiene una funcion de perdida que optimiza durante el entrenamiento.
Paso a paso
El proceso sigue pasos: datos, modelo, entrenamiento, evaluacion.
Error comun: Data leakage
Cuando informacion del test afecta al entrenamiento: validacion invalida.
Ejemplo concreto
Aplica ML a problemas reales de clasificacion y regresion.
Conexion
ML se construye sobre estadistica inferencial y predictiva.