🌳 Árboles de Decisión

Preguntas que se bifurcan hasta encontrar la respuesta

CART Entropía Gini
Módulo 2 de 12
💡 Piénsalo así: Un árbol de decisión es como el juego de "20 preguntas". Cada pregunta divide el espacio de posibilidades hasta que puedes dar una respuesta. El algoritmo elige automáticamente las preguntas más informativas primero.

🎯 ¿Que aprenderas en este modulo?

Criterios de Partición

📉 Entropía

Mide el desorden en un nodo. Va de 0 (puro) a log2(k) (máxima impureza). La ganancia de información es la reducción de entropía al partir. Se prefiere en árboles con muchas clases.

📊 Índice Gini

Mide la probabilidad de clasificar incorrectamente un elemento si se etiqueta aleatoriamente según la distribución del nodo. Va de 0 (puro) a 1−1/k. Es más rápido computacionalmente que la entropía.

✂️ Poda (Pruning)

Reduce la complejidad del árbol cortando ramas con poca ganancia. La poda por costo-complejidad (CCP) balancea accuracy vs número de hojas usando un parámetro α.

⚠️ Overfitting

Árboles profundos memorizan el ruido. Se combate con profundidad máxima, mínimo de muestras por hoja y poda. Un árbol sin restricciones puede tener accuracy perfecto en train y pésimo en test.

Explicacion Detallada

Intuicion

El ML permite a las computadoras aprender patrones de los datos sin ser programadas explicitamente para cada tarea.

Formula clave

Cada algoritmo tiene una funcion de perdida que optimiza durante el entrenamiento.

Paso a paso

El proceso sigue pasos: datos, modelo, entrenamiento, evaluacion.

Error comun: Data leakage

Cuando informacion del test afecta al entrenamiento: validacion invalida.

Ejemplo concreto

Aplica ML a problemas reales de clasificacion y regresion.

Conexion

ML se construye sobre estadistica inferencial y predictiva.

Ejemplo paso a paso

Explora los conceptos con ejemplos practicos disponibles en la simulacion interactiva de este modulo.

Explicacion Detallada

Intuicion

El ML permite a las computadoras aprender patrones de los datos sin ser programadas explicitamente para cada tarea.

Formula clave

Cada algoritmo tiene una funcion de perdida que optimiza durante el entrenamiento.

Paso a paso

El proceso sigue pasos: datos, modelo, entrenamiento, evaluacion.

Error comun: Data leakage

Cuando informacion del test afecta al entrenamiento: validacion invalida.

Ejemplo concreto

Aplica ML a problemas reales de clasificacion y regresion.

Conexion

ML se construye sobre estadistica inferencial y predictiva.

Ejemplo paso a paso

Explora los conceptos con ejemplos practicos disponibles en la simulacion interactiva de este modulo.

Simulador: Partición con Gini

10 puntos mezclados (5 rojos, 5 azules). Elige el split que minimiza el Gini ponderado.

Haz clic en un split para calcular su Gini ponderado.
Mini Quiz: Árboles de Decisión
💡 Responde las preguntas sobre árboles de decisión.

📖 Resumen del modulo