Predicción de Abandono de Clientes (Churn), Beta Bank
Beta Bank identificó que estaba perdiendo clientes mes a mes y necesitaba anticipar qué clientes tenían mayor probabilidad de irse, para poder actuar antes. Se desarrolló un modelo de clasificación binaria entrenado sobre datos históricos de clientes, con foco en manejar el desbalance natural de clases (80% permanecen vs 20% abandonan) mediante técnicas de oversampling y undersampling, comparando 6 variantes de 3 algoritmos distintos, y optimizando hasta superar el umbral de calidad exigido (F1 ≥ 0.59), validando adicionalmente con AUC-ROC.
El problema
Predecir con antelación qué clientes probablemente abandonarán el banco, sobre un dataset con fuerte desbalance de clases (los que se van son minoría), exigiendo una métrica F1 mínima de 0.59.
La solución
Limpieza de datos (nulos en Tenure imputados a 0), codificación One-Hot de variables categóricas y escalado con StandardScaler. Partición estratificada 60/20/20. Entrenamiento de 3 modelos base sin balanceo (Árbol de Decisión, Random Forest, Regresión Logística), seguido de las mismas 3 con Oversampling y con Undersampling (6 variantes en total). Selección del mejor modelo por F1 en validación y evaluación final en el set de prueba nunca antes visto.
Limpieza de datos (imputación de nulos en Tenure) y análisis exploratorio del desbalance de clases (80% permanecen vs 20% abandonan).
Codificación One-Hot y escalado de variables, con partición estratificada 60/20/20 en train/valid/test. Entrenamiento de 3 modelos base (Árbol de Decisión F1=0.588, Random Forest F1=0.586, Regresión Logística F1=0.327).
Aplicación de Oversampling y Undersampling sobre los mismos 3 modelos (6 variantes en total), comparando por F1 y AUC-ROC en validación.
Selección de Random Forest con Oversampling (F1=0.630 en validación) como modelo final, y evaluación en el set de prueba nunca antes visto (F1=0.611, AUC-ROC=0.860).