Volver a proyectos
ML Ops Fintech 2025

Predicción de Abandono de Clientes (Churn), Beta Bank

Beta Bank identificó que estaba perdiendo clientes mes a mes y necesitaba anticipar qué clientes tenían mayor probabilidad de irse, para poder actuar antes. Se desarrolló un modelo de clasificación binaria entrenado sobre datos históricos de clientes, con foco en manejar el desbalance natural de clases (80% permanecen vs 20% abandonan) mediante técnicas de oversampling y undersampling, comparando 6 variantes de 3 algoritmos distintos, y optimizando hasta superar el umbral de calidad exigido (F1 ≥ 0.59), validando adicionalmente con AUC-ROC.

Predicción de Abandono de Clientes (Churn), Beta Bank
0.611
F1-score en test (Random Forest + Oversampling)
80% / 20%
Desbalance original de clases (permanecen / abandonan)
0.860
AUC-ROC en test

El problema

Predecir con antelación qué clientes probablemente abandonarán el banco, sobre un dataset con fuerte desbalance de clases (los que se van son minoría), exigiendo una métrica F1 mínima de 0.59.

La solución

Limpieza de datos (nulos en Tenure imputados a 0), codificación One-Hot de variables categóricas y escalado con StandardScaler. Partición estratificada 60/20/20. Entrenamiento de 3 modelos base sin balanceo (Árbol de Decisión, Random Forest, Regresión Logística), seguido de las mismas 3 con Oversampling y con Undersampling (6 variantes en total). Selección del mejor modelo por F1 en validación y evaluación final en el set de prueba nunca antes visto.

1

Limpieza de datos (imputación de nulos en Tenure) y análisis exploratorio del desbalance de clases (80% permanecen vs 20% abandonan).

2

Codificación One-Hot y escalado de variables, con partición estratificada 60/20/20 en train/valid/test. Entrenamiento de 3 modelos base (Árbol de Decisión F1=0.588, Random Forest F1=0.586, Regresión Logística F1=0.327).

3

Aplicación de Oversampling y Undersampling sobre los mismos 3 modelos (6 variantes en total), comparando por F1 y AUC-ROC en validación.

4

Selección de Random Forest con Oversampling (F1=0.630 en validación) como modelo final, y evaluación en el set de prueba nunca antes visto (F1=0.611, AUC-ROC=0.860).

Impacto medido

0.630
F1 en validación (Random Forest + Oversampling)
6
Variantes de modelos comparadas (3 algoritmos x balanceo)

Tecnologías utilizadas

Python 3.11 Pandas NumPy Scikit-Learn Conda

Selección de Región Óptima para Perforación Petrolera