🔍 Diagnóstico del Modelo

RESET, normalidad de residuos, valores influyentes y bondad de ajuste

RESET Normalidad Cook's D
Módulo 10 de 12
💡 Piénsalo así: Diagnosticar un modelo econométrico es como llevar el auto al taller: revisas frenos (RESET), alineación (normalidad) y piezas sueltas (influyentes).
  • Al final de este módulo podrás: Aplicar el test RESET de Ramsey para detectar error de especificación.
  • Evaluar la normalidad de los residuos con gráficos Q-Q y el test Jarque-Bera.
  • Identificar observaciones influyentes con la distancia de Cook (Cook's D).
  • Interpretar correctamente el R² ajustado y criterios de información (AIC, BIC).
  • Conceptos Fundamentales

    🧪 Test RESET de Ramsey

    El Regression Specification Error Test (RESET) detecta errores de especificación: forma funcional incorrecta, omisión de variables relevantes o correlación con errores. Consiste en añadir potencias de Ŷ (Ŷ², Ŷ³) a la regresión original y testear si son conjuntamente significativas (F-test).

    Y = β₀ + β₁X₁ + γ₁Ŷ² + γ₂Ŷ³ + u → F-test: H₀: γ₁=γ₂=0

    📊 Normalidad de residuos

    Bajo los supuestos clásicos, los errores se distribuyen normalmente (para inferencia exacta en muestras pequeñas). Se evalúa con gráficos Q-Q (cuantiles teóricos vs observados) y el test Jarque-Bera: JB = n(S²/6 + (K-3)²/24), donde S es asimetría y K curtosis. JB ∼ χ²(2). H₀: normalidad.

    JB = n·(S²/6 + (K-3)²/24) ∼ χ²(2)

    ⚡ Distancia de Cook

    Cook's D mide cuánto cambia cada coeficiente estimado si eliminamos una observación. Dᵢ = (rᵢ²/k)·(hᵢ/(1-hᵢ)), donde rᵢ es el residuo studentizado y hᵢ el leverage (hat-value). Valores Dᵢ > 4/n se consideran influyentes.

    Dᵢ = (β̂ - β̂₍ᵢ₎)'X'X(β̂ - β̂₍ᵢ₎)/k·σ̂²

    📈 R² ajustado

    El R² común siempre aumenta cuando añadimos variables, incluso si son irrelevantes. El R² ajustado penaliza por la cantidad de regresores: R̄² = 1 - (1-R²)·(n-1)/(n-k-1). Sirve para comparar modelos con diferente número de variables.

    R̄² = 1 - (1-R²)(n-1)/(n-k-1)

    📋 AIC y BIC

    Criterios de información para selección de modelos: AIC = -2ln(L) + 2k, BIC = -2ln(L) + k·ln(n). Penalizan la complejidad del modelo. El modelo con menor AIC/BIC es preferido. BIC penaliza más fuertemente la complejidad que AIC.

    AIC = -2ln(L) + 2k   BIC = -2ln(L) + k·ln(n)

    🔎 Leverage (Hat-values)

    El leverage hᵢ mide cuán extrema es una observación en el espacio de los regresores. Se obtiene de la diagonal de la matriz sombrero H = X(X'X)⁻¹X'. Valores hᵢ > 2k/n se consideran altos. Una observación con alto leverage y gran residuo es peligrosamente influyente.

    hᵢ = Xᵢ(X'X)⁻¹Xᵢ'   H = X(X'X)⁻¹X'
    Ejemplo paso a paso: Diagnóstico completo de un modelo

    Estimamos log(PIB) = β₀ + β₁(años_educación) + β₂(inversión/PIB) y aplicamos diagnósticos.

    Paso 1: Test RESET

    Añadimos Ŷ² a la regresión. Obtenemos F=3.8 con p=0.03. Rechazamos H₀ (p<0.05): hay evidencia de error de especificación. Probablemente faltan términos cuadráticos o interacciones.

    Paso 2: Normalidad (Jarque-Bera)

    Calculamos asimetría S = -0.45 y curtosis K = 3.8. JB = 100(-0.45²/6 + (3.8-3)²/24) = 100(0.034 + 0.027) = 6.1. Con 2 gl, p=0.047. Rechazamos normalidad al 5%. Los residuos tienen colas pesadas.

    Paso 3: Cook's D

    Calculamos Dᵢ para cada observación. La observación #12 tiene D=0.52 > 4/100=0.04. Es influyente: al eliminarla, β̂₁ cambia de 0.21 a 0.18 (14% de cambio). Revisamos si es un error de datos o un caso válido.

    Paso 4: Selección de modelo

    Modelo original: R̄²=0.82, AIC=245, BIC=256. Modelo con término cuadrático: R̄²=0.85, AIC=236, BIC=250. El segundo modelo tiene mejor R̄² y menor AIC/BIC, así que lo preferimos.

    Simulación: Diagnóstico interactivo

    Generamos datos y evaluamos normalidad, influencia y leverage.

    R² ajustado
    Jarque-Bera
    p-valor (normalidad)
    Cook's D máx
    Obs. influyentes
    Mini Quiz: Diagnóstico

    Resumen del módulo

  • RESET: test de especificación (potencias de Ŷ). Rechazar H₀ = mala especificación.
  • Normalidad: Q-Q plot + Jarque-Bera. JB grande = no normalidad.
  • Cook's D: mide influencia de cada observación. Dᵢ > 4/n = influyente.
  • R² ajustado, AIC, BIC: criterios para selección de modelos (menor AIC/BIC es mejor).
  • 💡 Responde las preguntas sobre diagnóstico.