La probabilidad de que un cliente se dé de baja
p = σ(β0 + β1·x),   σ(z) = 1/(1+e−z)
frontera: p = 0.5  ⇔  x* = −β0/β1
con β₀ = 0.00 y β₁ = 1.50

El caso. Movistar quiere anticipar el churn: que un cliente se dé de baja (y = 1) o siga contratado (y = 0). Solo usas una señal, la antigüedad del cliente x (en meses, estandarizada a ~[−3, 3]). La logística no predice un sí/no directo: estima una probabilidad de baja y luego decide por umbral 0.5.

β₀ 0.00
β₁ 1.50
  1. Sube |β₁| hacia 4 sin tocar β₀. La sigmoide se vuelve más vertical: la decisión se hace tajante y casi todos los votos caen cerca de la frontera.
  2. Mueve β₀ a izquierda y derecha. La frontera x* = −β₀/β₁ se desplaza: con β₀ positivo la baja llega antes (x* a la izquierda).
  3. Partes de accuracy ≈67%; busca el par (β₀, β₁) que la maximice. En torno a β₀≈−1.3, β₁≈1.2 la accuracy sube hasta ~85% y el log-loss baja a la vez: ambos mejoran juntos.
  4. Comprueba que lo entiendes
    ¿Por qué la sigmoide y no una recta? Una probabilidad vive en (0, 1); la sigmoide acota ahí cualquier valor de β₀+β₁x. Una recta se saldría de [0, 1] y daría "probabilidades" negativas o mayores que 1.

Lee así. Los puntos abajo (y=0, sigue) y arriba (y=1, baja) son clientes reales. La curva dorada es p(x); la línea gris marca p = 0.5 y la vertical marca la frontera x*. Al mover un slider se enciende su término (β₀ o β₁) en la ecuación.

β₀ sesgo: desplaza la curva y fija dónde cae la frontera. β₁ pendiente: cuánto pesa la antigüedad; su signo dice si la baja crece o decrece con x. σ función logística que convierte cualquier número en una probabilidad de (0, 1).
De la probabilidad a la decisión, y a sus errores
predice baja si  p ≥ umbral
precisión = TP/(TP+FP)  ·  recall = TP/(TP+FN)
F1 = 2·precisión·recall / (precisión + recall)

El caso. Ya tienes la logística entrenada: a cada uno de 200 clientes le asigna un score p, su probabilidad predicha de baja. Pero para actuar (llamar, ofrecer descuento) hace falta un sí/no: eso lo fija el umbral. Muévelo y mira cómo cambian los aciertos y los errores.

umbral 0.50
predicción del modelo
baja (p≥u)sigue (p<u)
real: baja 0TP aciertos 0FN se escapan
real: sigue 0FP falsas alarmas 0TN aciertos
accuracy
precisión
recall
especificidad
F1
  1. Baja el umbral hacia 0.1. Marcas baja a casi todos: el recall sube (no se escapa nadie) pero la precisión cae, se disparan las falsas alarmas (FP).
  2. Súbelo hacia 0.9. Solo avisas de los clientísimos de riesgo: precisión altísima, pero el recall se hunde y muchas bajas reales (FN) pasan desapercibidas.
  3. Comprueba que lo entiendes
    Si cada campaña de retención cuesta dinero pero perder un cliente cuesta mucho más, ¿subes o bajas el umbral? Lo bajas: priorizas el recall (cazar todas las bajas) aunque gastes en algunas falsas alarmas.
TP/TN aciertos (verde). FP avisas de una baja que no lo era. FN se te escapa una baja real (el error caro). El umbral no cambia el modelo: solo dónde cortas sus scores.
La curva que resume TODOS los umbrales a la vez
TPR = recall = TP/(TP+FN)  ·  FPR = FP/(FP+TN)
la ROC recorre (FPR, TPR) al barrer el umbral de 1 → 0

La idea. Cada umbral da una matriz de confusión, es decir un punto (FPR, TPR). Si barres el umbral de 1 a 0 obtienes toda la curva ROC. El mismo slider mueve el punto de operación sobre la curva: es la misma cosa vista de otra forma.

umbral 0.50
  1. Mueve el umbral y sigue el punto dorado sobre la curva. Umbral alto → abajo-izquierda (cauto, pocos avisos). Umbral bajo → arriba-derecha (avisas de casi todos).
  2. Fíjate en el AUC. No depende del umbral: mide la calidad del modelo entero. 0.5 es azar (la diagonal); 1.0 es separación perfecta.
  3. Comprueba que lo entiendes
    ¿Por qué comparar modelos por AUC y no por accuracy? Porque la accuracy depende del umbral y del desbalanceo de clases; el AUC resume el modelo a todos los umbrales de una vez, sin comprometerse con uno.
TPR (eje y) proporción de bajas reales cazadas. FPR (eje x) proporción de clientes fieles molestados por error. Diagonal = clasificar al azar. Esquina superior izquierda = el ideal (todo recall, cero falsas alarmas).
Para llevarte a casa
p = σ(β₀ + β₁·x)  →  decide si p > 0.5

La idea. La regresión logística modela una probabilidad, no una clase. La recta gris (regresión lineal) ajusta los 0/1 pero se escapa de [0, 1]: predice bajas negativas o superiores al 100%. La sigmoide dorada se queda siempre dentro: por eso es una probabilidad legítima.

De probabilidad a decisión. El umbral 0.5 parte la curva: por encima predices baja, por debajo permanencia. Mover el umbral (0.3, 0.7) cambia el equilibrio entre falsos positivos y falsos negativos, según lo que cueste cada error de negocio.

Cómo se entrena. No se minimiza el error cuadrático sino el log-loss: penaliza con fuerza estar muy seguro y equivocarse. Los β que lo minimizan son la mejor logística para tus datos.

Negocio. Movistar prioriza a los clientes con p alta para una oferta de retención. La logística además es interpretable: el signo de β₁ dice si la antigüedad protege o empuja al churn.

Garrido-Merchán — ecgarrido@comillas.edu — Machine Learning para Business Analytics — Regresión logística