Saltar al contenido
JAJose Arias
Todos los proyectos

Investigación · 2025 — 2026

Tesis: predicción de desvío de ruta con Gradient Boosting

Sistemas ciber-físico-sociales · co-simulación tráfico–red 5G

Mi rol
Investigador / Desarrollador ML
Resultado clave
180corridas controladas · SUMO + OMNeT++
Stack
PythonCatBoostXGBoostscikit-learnPandasSUMOOMNeT++SQLDockerLinux

01

Contexto

En un sistema ciber-físico-social, el comportamiento de los conductores afecta la red celular. La tesis mide cómo la probabilidad de desvío de ruta modifica la tasa de caída de conexiones (CDR) por celda, con asesoría del Ph.D. Néstor Alzate Mejía.

02

Qué construí

  • Entrené y calibré modelos CatBoost y XGBoost para predecir la probabilidad de desvío de ruta vehicular.
  • Medí su impacto en la CDR por celda en una co-simulación tráfico–red 5G (SUMO + OMNeT++) con 180 corridas controladas.
  • Diseñé un pipeline ETL reproducible (Bronze/Silver/Gold) que transforma trazas crudas de SUMO en datasets tabulares.
  • Calibré las probabilidades con regresión isotónica y las evalué con ROC-AUC, Brier y ECE, además de validarlas contra una referencia analítica (MAE, RMSE, sesgo y correlación).

03

Arquitectura

  1. Trazas SUMO

    Movilidad vehicular

  2. Bronze

    Trazas crudas

    Silver

    Alineado por ventana y celda

    Gold

    Dataset tabular

  3. CatBoost

    XGBoost

  4. Calibración

    Probabilidad de desvío

  5. CDR por celda

    Co-simulación SUMO + OMNeT++

Del dato crudo de simulación a la predicción calibrada.
  • Entrada
  • Proceso
  • Almacenamiento
  • Salida

04

Decisiones técnicas

Pipeline Bronze / Silver / Gold
Las trazas crudas de SUMO pasan por capas sucesivas hasta quedar como datasets tabulares alineados por ventana de tiempo y celda.
Sin fuga de datos
La construcción de los datasets se diseñó para evitar data leakage, de modo que la evaluación del modelo sea honesta.
Dos modelos para contrastar
CatBoost y XGBoost se entrenan sobre los mismos datos para contrastar resultados y no depender de un solo algoritmo.
Calibración probabilística
La probabilidad aprendida de desvío se calibra (isotónica) para que sea consistente como probabilidad, no solo como puntaje.
Evaluación más allá de la exactitud
Además de ROC-AUC, se mide la validez probabilística con Brier y ECE, y la probabilidad aprendida se compara contra una referencia analítica y por perfil de comportamiento (propietario / empleado).
Qué variables aportan de verdad
El repositorio incluye reporte de importancia de variables y un estudio de ablación (AUC) para entender qué features sostienen el modelo.
Ejecución reproducible
Los modelos, el calibrador y las predicciones se persisten como artefactos (joblib, Parquet) y el pipeline se reproduce de forma local o con Docker.

05

Resultado

  • Medición del impacto del desvío de ruta sobre la CDR por celda en 180 corridas controladas.
  • Modelos evaluados con ROC-AUC, Brier, ECE, MAE y RMSE, con reportes y figuras generados por el pipeline.
  • Pipeline reproducible, versionado y ejecutable con Docker.