π― Propensity Score
El propensity score p(X) = P(T=1|X) es la probabilidad de recibir tratamiento dadas las covariables observables X. Rosenbaum & Rubin (1983) demostraron que si el tratamiento es ignorable dado X (selección en observables), entonces también es ignorable dado p(X).
Esto es crucial porque reduce el problema de matching de alta dimensión (muchas X) a un escalar (p(X)). Se estima típicamente con un logit o probit: P(T=1|X) = 1/(1+exp(-Xβ)).
π Matching Algorithms
Nearest Neighbor: empareja cada tratado con el control más cercano en propensity score. Puede ser 1:1 o 1:k. Caliper: solo permite matches dentro de una distancia máxima (ej. 0.05), evitando matches pobres. Kernel: usa todos los controles ponderados por la distancia en propensity score.
Cada método tiene trade-offs: Nearest Neighbor es simple pero puede tener matches pobres; Caliper mejora la calidad pero puede perder observaciones; Kernel usa toda la información pero asume suavidad.
βοΈ IPTW (Inverse Probability Weighting)
IPTW pondera cada observación por el inverso de la probabilidad de recibir el tratamiento que realmente recibió: w = T/p(X) + (1-T)/(1-p(X)). Esto crea una pseudo-población donde las covariables están balanceadas entre tratados y controles.
Intuición: si un tratado tiene baja probabilidad de ser tratado (p(X) pequeña), recibe mucho peso porque es "raro". Si un control tiene alta probabilidad de ser tratado (1-p(X) pequeña), también recibe mucho peso.
π Soporte Común y Balance
El soporte común (common support) es la región donde las distribuciones del propensity score de tratados y controles se superponen. Si no hay superposición, no podemos encontrar controles comparables para ciertos tratados, y el matching es inválido.
Los balance checks verifican que después del matching, las medias de las covariables sean similares entre grupos. Se usa la diferencia estandarizada: |X̄T - X̄C|/σ. Un valor < 0.1 indica buen balance.
Genera datos con selección en observables y compara estimaciones con y sin matching.
Queremos evaluar un programa de salud. Los participantes se autoseleccionan: los más saludables tienden a participar más. Comparar directamente participantes vs no participantes daría un estimador sesgado.
Usamos un logit con covariables: edad, ingreso, educación, y salud inicial. El modelo predice la probabilidad de participar. Por ejemplo, una persona de 40 años con ingreso alto puede tener p=0.7.
Para cada participante, encontramos un no-participante con propensity score similar. Si Juan tiene p=0.7, buscamos un control con p cercano a 0.7 (ej. 0.69). La distancia máxima permitida (caliper) es 0.05.
ATE naive (sin matching) = 5.2 (sesgado, sobreestima por autoselección).
ATE con matching = 2.8 (corregido).
Efecto real = 3.0. El matching redujo el sesgo de selección sustancialmente.