📐 MCO Simple
El modelo de regresión lineal simple postula una relación lineal entre Y (dependiente) y X (independiente): Y = β₀ + β₁X + ε. β₀ es el intercepto (valor de Y cuando X=0) y β₁ es la pendiente (cambio en Y ante un cambio unitario en X). El término ε captura todo lo que no explica el modelo.
📏 Estimador de Pendiente
La pendiente β̂₁ se estima como la covarianza muestral entre X e Y dividida por la varianza muestral de X. Intuitivamente: mide cuánto se mueven juntos X e Y, escalado por la dispersión de X.
📊 Notación Matricial
En forma matricial, el modelo se escribe Y = Xβ + ε, donde X es una matriz n×k (cada fila es una observación, cada columna un predictor), β es un vector k×1 de coeficientes, y ε es un vector n×1 de errores. La primera columna de X suele ser un vector de 1's para el intercepto.
📈 Interpretación de Coeficientes
β̂₁ mide el cambio esperado en Y ante un cambio unitario en X, manteniendo todo lo demás constante (ceteris paribus). Si β̂₁ = 2, significa que cuando X aumenta en 1 unidad, Y aumenta en promedio 2 unidades.
🎯 Bondad de Ajuste (R²)
El R² mide la proporción de la varianza de Y que es explicada por el modelo. R² = 1 - SSR/SST, donde SSR es la suma de residuos al cuadrado y SST es la suma total de cuadrados. R² = 1 significa ajuste perfecto; R² = 0 significa que el modelo no explica nada.
⚠️ Supuestos para invertir (X'X)
Para que (X'X)⁻¹ exista (es decir, que podamos calcular los coeficientes), la matriz X debe tener rango completo: ninguna columna puede ser combinación lineal de otras. Esto significa que no puede haber multicolinealidad perfecta y debemos tener más observaciones que parámetros (n > k).
Supón que tenemos datos de años de experiencia (X) y salario en miles (Y) para 5 personas:
x̄ = (1+2+3+4+5)/5 = 3. ȳ = (20+24+28+32+36)/5 = 28. Necesitamos las medias para calcular las desviaciones.
(1-3)(20-28)=(-2)(-8)=16, (2-3)(24-28)=(-1)(-4)=4, (3-3)(28-28)=0, (4-3)(32-28)=4, (5-3)(36-28)=16. Suma = 16+4+0+4+16 = 40.
(1-3)²=4, (2-3)²=1, (3-3)²=0, (4-3)²=1, (5-3)²=4. Suma = 4+1+0+1+4 = 10.
β̂₁ = 40/10 = 4. β̂₀ = ȳ - β̂₁·x̄ = 28 - 4·3 = 16. Interpretación: salario base = 16 mil, y cada año extra de experiencia añade 4 mil en promedio.
Valores ajustados: ŷ = 16+4x → [20,24,28,32,36]. SSR = Σ(yi-ŷi)² = 0 (ajuste perfecto). SST = Σ(yi-ȳ)² = (20-28)²+...+(36-28)² = 160. R² = 1-0/160 = 1. ¡Estos datos son perfectamente lineales!
Genera datos aleatorios y observa la línea de regresión MCO. Ajusta el nivel de ruido para ver cómo cambia el ajuste.