π Adopción Escalonada
En muchos contextos reales, diferentes unidades reciben el tratamiento en diferentes momentos. Por ejemplo, una ley se implementa primero en algunos estados y luego en otros, o un programa se lanza en fases. Esto se llama adopción escalonada (staggered adoption).
En este diseño, las unidades tratadas temprano sirven como tratadas en algunos periodos y como controles en otros (para cohortes tardías). Esto crea una estructura compleja que el TWFE tradicional no maneja bien.
β οΈ Sesgo del TWFE con Efectos Heterogéneos
Cuando los efectos del tratamiento varían entre cohortes (diferentes grupos tratados) o en el tiempo (efectos dinámicos), el estimador TWFE usa comparaciones contaminadas. Específicamente, usa unidades ya tratadas como grupo de control para otras cohortes, lo que genera sesgo.
Este sesgo fue documentado por Goodman-Bacon (2021), que mostró que el TWFE es un promedio ponderado de DiD 2×2 entre pares de grupos, donde algunas ponderaciones pueden ser negativas.
π Goodman-Bacon Decomposition
La descomposición de Goodman-Bacon descompone el estimador TWFE en una suma ponderada de todos los posibles DiD 2×2 entre pares de grupos. Identifica tres tipos de comparaciones: (1) tratados vs never-treated, (2) tratados temprano vs tratados tardío (pre), (3) tratados tardío vs tratados temprano (post).
Las comparaciones del tipo (2) y (3) pueden tener ponderaciones negativas si los efectos son heterogéneos, lo que sesga el estimador. Esta descomposición ayuda a diagnosticar el problema.
π Sun & Abraham / Callaway & Sant'Anna
Sun & Abraham (2021) proponen un estimador que interactúa cohorte y tiempo relativo, usando unidades never-treated o not-yet-treated como grupo de control. El ATT general es un promedio ponderado de los ATTs por cohorte.
Callaway & Sant'Anna (2021) proponen un enfoque similar basado en matching por propensity score dentro de cada cohorte y tiempo. Ambos métodos evitan el sesgo del TWFE usando grupos de control nunca tratados o aún no tratados.
4 cohortes tratadas en diferentes momentos con efectos heterogéneos. Compara el sesgo del TWFE con el estimador corregido.
Una reforma educativa se implementa en diferentes estados de México en distintos años: Estado A (2018), Estado B (2019), Estado C (2020). El efecto de la reforma sobre las calificaciones puede ser diferente en cada estado y puede cambiar con el tiempo.
Si usamos TWFE con efectos fijos de estado y año, el estimador usará al Estado A (ya tratado) como "control" para medir el efecto en el Estado B en 2019. Pero el Estado A ya tiene el efecto de la reforma, contaminando la comparación.
Sun & Abraham usan solo estados no tratados o aún no tratados como grupo de control. Por ejemplo, para el Estado B en 2019, el control sería el Estado C (aún no tratado) y un Estado D (nunca tratado). Así evitamos la contaminación.
El ATT estimado por Sun & Abraham será un promedio de los efectos por estado, ponderado por su peso poblacional. Si el efecto en el Estado A es grande y en el Estado B es pequeño, TWFE dará un promedio sesgado, mientras que Sun & Abraham dará una estimación válida.