🧪 Test RESET de Ramsey
El Regression Specification Error Test (RESET) detecta errores de especificación: forma funcional incorrecta, omisión de variables relevantes o correlación con errores. Consiste en añadir potencias de Ŷ (Ŷ², Ŷ³) a la regresión original y testear si son conjuntamente significativas (F-test).
📊 Normalidad de residuos
Bajo los supuestos clásicos, los errores se distribuyen normalmente (para inferencia exacta en muestras pequeñas). Se evalúa con gráficos Q-Q (cuantiles teóricos vs observados) y el test Jarque-Bera: JB = n(S²/6 + (K-3)²/24), donde S es asimetría y K curtosis. JB ∼ χ²(2). H₀: normalidad.
⚡ Distancia de Cook
Cook's D mide cuánto cambia cada coeficiente estimado si eliminamos una observación. Dᵢ = (rᵢ²/k)·(hᵢ/(1-hᵢ)), donde rᵢ es el residuo studentizado y hᵢ el leverage (hat-value). Valores Dᵢ > 4/n se consideran influyentes.
📈 R² ajustado
El R² común siempre aumenta cuando añadimos variables, incluso si son irrelevantes. El R² ajustado penaliza por la cantidad de regresores: R̄² = 1 - (1-R²)·(n-1)/(n-k-1). Sirve para comparar modelos con diferente número de variables.
📋 AIC y BIC
Criterios de información para selección de modelos: AIC = -2ln(L) + 2k, BIC = -2ln(L) + k·ln(n). Penalizan la complejidad del modelo. El modelo con menor AIC/BIC es preferido. BIC penaliza más fuertemente la complejidad que AIC.
🔎 Leverage (Hat-values)
El leverage hᵢ mide cuán extrema es una observación en el espacio de los regresores. Se obtiene de la diagonal de la matriz sombrero H = X(X'X)⁻¹X'. Valores hᵢ > 2k/n se consideran altos. Una observación con alto leverage y gran residuo es peligrosamente influyente.
Estimamos log(PIB) = β₀ + β₁(años_educación) + β₂(inversión/PIB) y aplicamos diagnósticos.
Añadimos Ŷ² a la regresión. Obtenemos F=3.8 con p=0.03. Rechazamos H₀ (p<0.05): hay evidencia de error de especificación. Probablemente faltan términos cuadráticos o interacciones.
Calculamos asimetría S = -0.45 y curtosis K = 3.8. JB = 100(-0.45²/6 + (3.8-3)²/24) = 100(0.034 + 0.027) = 6.1. Con 2 gl, p=0.047. Rechazamos normalidad al 5%. Los residuos tienen colas pesadas.
Calculamos Dᵢ para cada observación. La observación #12 tiene D=0.52 > 4/100=0.04. Es influyente: al eliminarla, β̂₁ cambia de 0.21 a 0.18 (14% de cambio). Revisamos si es un error de datos o un caso válido.
Modelo original: R̄²=0.82, AIC=245, BIC=256. Modelo con término cuadrático: R̄²=0.85, AIC=236, BIC=250. El segundo modelo tiene mejor R̄² y menor AIC/BIC, así que lo preferimos.
Generamos datos y evaluamos normalidad, influencia y leverage.