π LSTM para Series Temporales
LSTM usa celdas de memoria con puertas (input, forget, output) que controlan el flujo de información. Intuición: A diferencia de un RNN básico (que sufre de vanishing gradient), LSTM tiene una "cinta transportadora" de memoria (cell state) que puede retener información por cientos de pasos. La puerta forget decide qué olvidar (ej. una tendencia que ya no es relevante), la input gate decide qué nueva información almacenar, y la output gate decide qué pasar a la siguiente capa. En finanzas, un LSTM con 50-100 unidades ocultas y ventanas de 60 días puede capturar dependencias a largo plazo que los modelos ARIMA no detectan. La arquitectura típica: input (ventana deslizante) β LSTM(units=50, return_sequences=True) β Dropout(0.2) β LSTM(units=25) β Dropout(0.2) β Dense(1).
π XGBoost para Dirección
XGBoost es gradient boosting con regularización L1/L2 y árboles ponderados secuencialmente. Intuición: XGBoost construye árboles de decisión de forma secuencial: cada nuevo árbol se enfoca en corregir los errores del anterior. Es como tener 1000 traders, donde cada nuevo trader se especializa en las situaciones donde los anteriores fallaron. La regularización L1/L2 evita overfitting (común en finanzas por el ruido). Para clasificación de dirección (sube/baja), XGBoost puede alcanzar 55-65% de acierto en mercados accionarios cuando se usan features adecuadas. Features típicas: retornos pasados, RSI, MACD, volumen relativo, volatilidad realizada, indicators de sentimiento.
π SHAP Values
SHAP descompone cada predicción en contribuciones de cada feature: f(x) = Οβ + Ξ£Οβ±Ό. Intuición: SHAP (SHapley Additive exPlanations) viene de la teoría de juegos cooperativos. Imagina que las features son jugadores en un equipo que genera una predicción. SHAP calcula cuánto contribuyó cada feature a la predicción, considerando todas las combinaciones posibles de features. El resultado es un valor SHAP por feature por predicción. Por ejemplo, para una predicción de "subida" del S&P 500: RSI_14 contribuyó +0.12 (señal de sobreventa), volumen relativo -0.05 (bajo volumen), volatilidad RV contribuyó +0.08 (volatilidad en aumento). Esto permite interpretar el modelo, algo crítico en finanzas reguladas.
π Feature Engineering
Features financieras: retornos log, RSI, MACD, bandas de Bollinger, volumen, volatilidad realizada. Intuición: La calidad de las features es más importante que el modelo. Features típicas: (1) Retornos: rβ, rβββ, ..., rββββ. (2) Indicadores técnicos: RSI (14 días), MACD (12, 26, 9), Bandas de Bollinger (20, 2Ο). (3) Volatilidad: RVβ (realizada intradiaria), GARCHβ (estimada), rango diario (high-low). (4) Volumen: volumen relativo a media 20 días, volumen en efectivo. (5) Features macro: tasas de interés, VIX, USD index. (6) Features de sentimiento: put/call ratio, noticias (NLP). La ventana deslizante (lookback) para LSTM es típicamente 20-60 días.
π Evaluación Realista
Walk-forward validation, backtesting con costos de transacción, métricas no solo RΒ². Intuición: En finanzas, el RΒ² no lo es todo. Un modelo con RΒ² = 0.03 puede ser rentable si acierta la dirección consistentemente. Métricas clave: (1) Accuracy de dirección (hit ratio). (2) Sharpe ratio de la estrategia derivada. (3) Máxima pérdida (max drawdown). (4) Profit factor (ganancias/pérdidas). La validación debe ser walk-forward: entrena con datos hasta t, predice t+1, desliza la ventana. Sin esto, el overfitting es inevitable. Además, hay que incluir costos de transacción (0.1-0.5% por operación) y slippage. Muchos modelos "rentables" en papel pierden dinero en la realidad por no considerar estos costos.
π Aplicaciones de ML Financiero
ML se usa en trading algorítmico, gestión de riesgos, detección de fraudes, y análisis de sentimiento. Intuición: En trading algorítmico, fondos como Renaissance Technologies y Two Sigma usan ML para identificar patrones de alta frecuencia (milliseconds a minutos). En riesgo de crédito, XGBoost es el estándar para predecir defaults con AUC > 0.85. En detección de fraudes, LSTM captura patrones temporales de transacciones sospechosas. En análisis de sentimiento, modelos de NLP (BERT, RoBERTa) analizan noticias financieras y tweets para predecir movimientos del mercado. El desafío: los mercados financieros son dinámicos (no estacionarios), así que los modelos requieren reentrenamiento frecuente (retraining mensual o semanal).
Entrena un XGBoost simulado (regresión logística) para predecir si mañana el mercado sube o baja.
Implementación completa: features β XGBoost β SHAP β backtest.
Para cada día t, calculamos: retornos rβ a rββββ, RSI(14), MACD(12,26,9), BB(20,2), volumen relativo (vol/volββ), rango diario (high-low)/close. Total: ~30 features. Normalizamos con z-score rolling (media y std ventana 252 días). Target binario: yβ = 1 si rβββ > 0, 0 en otro caso. Ventana de entrenamiento: 2015-2022 (2000 días), test: 2023 (252 días).
Hiperparámetros: n_estimators=500, max_depth=4, learning_rate=0.01, subsample=0.8, colsample_bytree=0.8, reg_lambda=1.0. Early stopping con 50 rondas. Accuracy en test: 56%. Matriz de confusión: verdaderos positivos (subidas acertadas) = 72, falsos positivos = 54, verdaderos negativos = 68, falsos negativos = 58. Precision = 57%, Recall = 55%. Las features más importantes (gain): RSI(14) 18%, volumen relativo 15%, retorno t-1 12%, rango diario 10%.
SHAP summary plot muestra: (1) RSI bajo < 30 contribuye positivamente a predecir subida (sobreventa), (2) volumen alto contribuye negativamente (distribución), (3) retorno positivo ayer contribuye positivamente (momentum). Para un día específico (ej. 15 marzo 2023): predicción = 0.62 (subida). SHAP decomposition: RSI(14)=32 β +0.15, volumen_rel=0.7 β +0.08, retorno_t-1=-0.5% β -0.03, rango=1.2% β +0.05, base=0.37. Total: 0.37 + 0.15 + 0.08 - 0.03 + 0.05 = 0.62.
Estrategia: largo si predicción > 0.55, corto si predicción < 0.45, cash en otro caso. Costos: 0.1% por operación. Resultados 2023: Sharpe ratio = 0.65 (vs buy&hold 0.40), max drawdown = -8% (vs -12%), profit factor = 1.4. Número de operaciones: 98 (40% del año en mercado). Sin costos, Sharpe = 0.82 β los costos reducen un 21% el rendimiento. Esto muestra la importancia de incluir costos en la evaluación.