Causal Tree
Intuición: Un Causal Tree es un árbol de decisión modificado para estimar efectos causales en lugar de predecir Y. En cada split, en lugar de minimizar el MSE de predicción, maximiza la heterogeneidad del efecto tratamiento entre los hijos izquierdo y derecho.
Fórmula explicada: El CATE (Conditional Average Treatment Effect) es τ(x) = E[Y(1) - Y(0) | X = x]. En cada nodo hoja, se estima como la diferencia de medias entre tratados y controles dentro de ese grupo. El árbol busca splits que maximicen la varianza de τ entre grupos.
Caso real: En un experimento de envío de cupones de descuento, un Causal Tree podría encontrar que el cupon funciona bien para clientes jóvenes de ciudades grandes, pero no para clientes mayores de zonas rurales. Esto permite personalizar la estrategia de marketing.
Error común: Usar árboles de predicción estándar para estimar efectos causales. Un árbol de predicción minimiza error de predicción, no encuentra heterogeneidad causal. Puede crear grupos con efectos causales mezclados.
Honest Splitting
Intuición: Honest splitting significa usar datos diferentes para dos tareas distintas: una parte para decidir cómo dividir el árbol (split) y otra para estimar los efectos en las hojas (estimation). Esto evita que la estimación del efecto esté contaminada por la búsqueda del split óptimo.
Fórmula explicada: Formalmente, S_split ∩ S_est = ∅. La muestra se divide aleatoriamente: la mitad para construir el árbol, la otra mitad para estimar τ en cada hoja. Sin honest splitting, el árbol tendería a crear hojas donde el efecto parece grande pero solo por casualidad (sobreajuste).
Caso real: Con n=1,000 pacientes, se usan 500 para decidir los splits del árbol y 500 para estimar el efecto del medicamento en cada subgrupo. Esto garantiza que la estimación del efecto no esté sesgada por la búsqueda de patrones.
Error común: Pensar que honest splitting desperdicia datos. Aunque se usa la mitad para cada tarea, la reducción de sesgo compensa con creces la pérdida de eficiencia.
GRF (Generalized RF)
Intuición: GRF es un marco general que extiende la idea de Causal Forest a cualquier parámetro que se pueda definir como solución de una ecuación de estimación. Incluye Causal Forest, Instrumental Forest, Quantile Forest, etc. Es como un toolkit de "bosques para todo".
Fórmula explicada: Para cada punto x, GRF estima θ(x) = argmin Σ wᵢ(x) ψ(Yᵢ; θ), donde wᵢ(x) son pesos basados en árboles (qué tan frecuentemente i cae en el mismo nodo que x) y ψ es una función de momento. Los árboles se construyen para maximizar la heterogeneidad de θ.
Caso real: GRF se usa para estimar elasticidades-precio heterogéneas (Causal Forest con logit), efectos de instrumentos variables (Instrumental Forest), o cuantiles del efecto tratamiento (Quantile Forest).
Error común: Tratar GRF como una "caja negra". Aunque es flexible, requiere entender la función de momento ψ para interpretar correctamente los resultados.
GATES y CLAN
Intuición: Después de estimar CATE para cada persona, GATES agrupa a las personas por su CATE estimado (bajo, medio, alto) y calcula el efecto promedio en cada grupo. CLAN describe las características de cada grupo, respondiendo "¿quiénes son los que más se benefician?".
Fórmula explicada: GATES: Ordena las personas por τ̂(x), crea G grupos (ej. 4 cuartiles), y estima E[τ(X) | G = g] para cada grupo. CLAN: Calcula E[Xⱼ | G = g] para cada variable Xⱼ, describiendo el perfil de cada grupo.
Caso real: Un programa de capacitación laboral. GATES muestra que el 25% de participantes con mayor CATE obtienen un efecto de +$500/mes, mientras que el 25% inferior obtiene solo +$50/mes. CLAN revela que el grupo alto son jóvenes con educación universitaria.
Error común: Interpretar GATES como evidencia de que la variable de segmentación (ej. "jóvenes") es la única que importa. GATES solo dice qué grupo se beneficia más, no por qué.
Diferencia: CF vs DML
Intuición: DML estima un solo ATE (efecto promedio) y permite flexibilidad en los controles. Causal Forest estima CATE (efecto individualizado) y se enfoca en la heterogeneidad. DML responde "¿funciona?" y CF responde "¿para quién funciona?".
Fórmula explicada: DML: θ es un escalar (efecto constante o ATE). CF: τ(x) varía con las covariables. CF puede verse como DML donde θ depende de x y se estima no paramétricamente con bosques. Ambos usan honestidad (CF: honest splitting, DML: cross-fitting).
Caso real: En un estudio de impacto de una política de subsidios: DML estima que el subsidio aumenta el empleo en 2% en promedio. CF descubre que el efecto es 5% para pequeñas empresas en zonas urbanas y 0% para grandes empresas en zonas rurales.
Error común: Usar CF para obtener un solo número (ATE). CF está diseñado para heterogeneidad. Si solo te interesa el efecto promedio, DML es más eficiente.
Inferencia en Causal Forest
Intuición: CF produce intervalos de confianza para cada CATE individual usando la varianza de los árboles (similar a Random Forest). También produce tests de heterogeneidad (Best Linear Projection) para saber si el efecto realmente varía con X.
Fórmula explicada: El error estándar de τ̂(x) se estima mediante la ley de total varianza: Var(τ̂(x)) = Var_bosques + Var_estimación. Los intervalos de confianza puntuales son válidos asintóticamente. Además, el test de Omni-bus heterogeneidad evalúa si τ(x) varía significativamente.
Caso real: Un CF estima que Juan (30 años, urbano) tiene un CATE de 3.2 ± 1.1 (IC 95%). María (50 años, rural) tiene un CATE de 0.8 ± 1.3. El test de heterogeneidad da p=0.003, confirmando que el efecto varía significativamente entre personas.
Error común: Comparar CATEs de dos individuos sin considerar la incertidumbre. Dos CATEs pueden estar dentro del margen de error de cada uno aunque sus estimaciones puntuales difieran.
Generamos datos donde el efecto de un tratamiento varía con las covariables X1 y X2.
Generamos n=200 personas. Cada una tiene dos características X1, X2. El tratamiento se asigna aleatoriamente (50% trata, 50% control).
Cada árbol elige aleatoriamente entre X1 y X2 para dividir (simplificación). En cada hoja, calcula la diferencia de medias entre tratados y controles. Esto es el CATE estimado para esa hoja.
El promedio reduce la varianza. Cada persona obtiene un CATE estimado que es el promedio de los efectos de los árboles en las hojas donde cayó.
GATES muestra nítidamente que el CATE real aumenta de G1 a G4, validando que el Causal Forest captura la heterogeneidad.
Generamos datos con efecto tratamiento heterogéneo. El Causal Forest estima CATE por unidad.