🎯 Propensity Score Matching

p(X), matching, IPTW, soporte común y bounds de Rosenbaum

Propensity Score Matching IPTW
Módulo 7 de 12
πŸ’‘ PiΓ©nsalo asΓ­: El propensity score es como la probabilidad de que una persona reciba un tratamiento basado en sus características. Matching es encontrar gemelos estadísticos: por cada persona tratada, buscamos una no tratada con la misma probabilidad de haber sido tratada. Así recreamos un experimento.
Conceptos de PSM

🎯 Propensity Score

El propensity score p(X) = P(T=1|X) es la probabilidad de recibir tratamiento dadas las covariables observables X. Rosenbaum & Rubin (1983) demostraron que si el tratamiento es ignorable dado X (selección en observables), entonces también es ignorable dado p(X).

Esto es crucial porque reduce el problema de matching de alta dimensión (muchas X) a un escalar (p(X)). Se estima típicamente con un logit o probit: P(T=1|X) = 1/(1+exp(-Xβ)).

p(X) = Logit o Probit

πŸ”— Matching Algorithms

Nearest Neighbor: empareja cada tratado con el control más cercano en propensity score. Puede ser 1:1 o 1:k. Caliper: solo permite matches dentro de una distancia máxima (ej. 0.05), evitando matches pobres. Kernel: usa todos los controles ponderados por la distancia en propensity score.

Cada método tiene trade-offs: Nearest Neighbor es simple pero puede tener matches pobres; Caliper mejora la calidad pero puede perder observaciones; Kernel usa toda la información pero asume suavidad.

βš–οΈ IPTW (Inverse Probability Weighting)

IPTW pondera cada observación por el inverso de la probabilidad de recibir el tratamiento que realmente recibió: w = T/p(X) + (1-T)/(1-p(X)). Esto crea una pseudo-población donde las covariables están balanceadas entre tratados y controles.

Intuición: si un tratado tiene baja probabilidad de ser tratado (p(X) pequeña), recibe mucho peso porque es "raro". Si un control tiene alta probabilidad de ser tratado (1-p(X) pequeña), también recibe mucho peso.

ATT = E[Y·T/p(X) - Y·(1-T)/(1-p(X))]

πŸ“Š Soporte Común y Balance

El soporte común (common support) es la región donde las distribuciones del propensity score de tratados y controles se superponen. Si no hay superposición, no podemos encontrar controles comparables para ciertos tratados, y el matching es inválido.

Los balance checks verifican que después del matching, las medias de las covariables sean similares entre grupos. Se usa la diferencia estandarizada: |X̄T - X̄C|/σ. Un valor < 0.1 indica buen balance.

Simulación: PSM

Genera datos con selección en observables y compara estimaciones con y sin matching.

Presiona "Simular PSM" para ver los resultados.
Ejemplo paso a paso: Matching para evaluar un programa de salud
Paso 1: El problema de selección

Queremos evaluar un programa de salud. Los participantes se autoseleccionan: los más saludables tienden a participar más. Comparar directamente participantes vs no participantes daría un estimador sesgado.

Paso 2: Estimamos el propensity score

Usamos un logit con covariables: edad, ingreso, educación, y salud inicial. El modelo predice la probabilidad de participar. Por ejemplo, una persona de 40 años con ingreso alto puede tener p=0.7.

Paso 3: Matching Nearest Neighbor

Para cada participante, encontramos un no-participante con propensity score similar. Si Juan tiene p=0.7, buscamos un control con p cercano a 0.7 (ej. 0.69). La distancia máxima permitida (caliper) es 0.05.

Paso 4: Resultados

ATE naive (sin matching) = 5.2 (sesgado, sobreestima por autoselección).
ATE con matching = 2.8 (corregido).
Efecto real = 3.0. El matching redujo el sesgo de selección sustancialmente.

Mini Quiz: Propensity Score
πŸ’‘ Responde las preguntas sobre propensity score y matching.

πŸ“ Resumen del módulo