Investigación · 2025 — 2026
Tesis: predicción de desvío de ruta con Gradient Boosting
Sistemas ciber-físico-sociales · co-simulación tráfico–red 5G
- Mi rol
- Investigador / Desarrollador ML
- Resultado clave
- 180corridas controladas · SUMO + OMNeT++
- Stack
- PythonCatBoostXGBoostscikit-learnPandasSUMOOMNeT++SQLDockerLinux
01
Contexto
En un sistema ciber-físico-social, el comportamiento de los conductores afecta la red celular. La tesis mide cómo la probabilidad de desvío de ruta modifica la tasa de caída de conexiones (CDR) por celda, con asesoría del Ph.D. Néstor Alzate Mejía.
02
Qué construí
- Entrené y calibré modelos CatBoost y XGBoost para predecir la probabilidad de desvío de ruta vehicular.
- Medí su impacto en la CDR por celda en una co-simulación tráfico–red 5G (SUMO + OMNeT++) con 180 corridas controladas.
- Diseñé un pipeline ETL reproducible (Bronze/Silver/Gold) que transforma trazas crudas de SUMO en datasets tabulares.
- Calibré las probabilidades con regresión isotónica y las evalué con ROC-AUC, Brier y ECE, además de validarlas contra una referencia analítica (MAE, RMSE, sesgo y correlación).
03
Arquitectura
Trazas SUMO
Movilidad vehicular
Bronze
Trazas crudas
Silver
Alineado por ventana y celda
Gold
Dataset tabular
CatBoost
XGBoost
Calibración
Probabilidad de desvío
CDR por celda
Co-simulación SUMO + OMNeT++
- Entrada
- Proceso
- Almacenamiento
- Salida
04
Decisiones técnicas
- Pipeline Bronze / Silver / Gold
- Las trazas crudas de SUMO pasan por capas sucesivas hasta quedar como datasets tabulares alineados por ventana de tiempo y celda.
- Sin fuga de datos
- La construcción de los datasets se diseñó para evitar data leakage, de modo que la evaluación del modelo sea honesta.
- Dos modelos para contrastar
- CatBoost y XGBoost se entrenan sobre los mismos datos para contrastar resultados y no depender de un solo algoritmo.
- Calibración probabilística
- La probabilidad aprendida de desvío se calibra (isotónica) para que sea consistente como probabilidad, no solo como puntaje.
- Evaluación más allá de la exactitud
- Además de ROC-AUC, se mide la validez probabilística con Brier y ECE, y la probabilidad aprendida se compara contra una referencia analítica y por perfil de comportamiento (propietario / empleado).
- Qué variables aportan de verdad
- El repositorio incluye reporte de importancia de variables y un estudio de ablación (AUC) para entender qué features sostienen el modelo.
- Ejecución reproducible
- Los modelos, el calibrador y las predicciones se persisten como artefactos (joblib, Parquet) y el pipeline se reproduce de forma local o con Docker.
05
Resultado
- Medición del impacto del desvío de ruta sobre la CDR por celda en 180 corridas controladas.
- Modelos evaluados con ROC-AUC, Brier, ECE, MAE y RMSE, con reportes y figuras generados por el pipeline.
- Pipeline reproducible, versionado y ejecutable con Docker.