La ecuación del ensemble
F(x) = ∑m=1M αm · hm(x)
modo boosting con M = 10 modelos base, α = 0.30

El caso. Amazon quiere predecir la demanda diaria (y) de un producto en función de su precio relativo (x, entre 0 y 1). Un solo modelo simple (un decision stump: un único corte) falla. La idea del ensemble es combinar M modelos débiles hm con pesos αm para formar uno fuerte: la curva dorada F(x).

modo
M 10
α 0.30
α = learning rate (solo relevante en boosting)
  1. Pon el modo en boosting y M = 1. El ajuste es burdo: F es casi plana (un único paso corto desde la media) y el badge marca «ajuste burdo». Ahora sube M hasta 40. El MSE de entrenamiento BAJA de forma monótona y F sigue el escalón real de la demanda.
  2. Con boosting, baja α a 0.05 y observa. Con α pequeño necesitas MUCHOS más M para el mismo ajuste: el learning rate regulariza, avanza a pasos cortos.
  3. Cambia el modo a bagging y mueve M. F sale suave y estable, pero su MSE de entrenamiento no baja tanto: promediar stumps reduce varianza, no el sesgo.
  4. Comprueba que lo entiendes
    Bagging ajusta los modelos en paralelo sobre muestras bootstrap y los promedia: baja la varianza. Boosting los ajusta en secuencia, cada uno corrigiendo el error del anterior: baja el sesgo, pero con M muy alto puede sobreajustar.

Lee así. Los puntos grises son las ventas observadas; la curva dorada es la predicción F(x) del ensemble. Sube M y se enciende el límite del sumatorio; mueve α y se enciende el peso de cada modelo.

hm(x) modelo base débil (un stump: un corte, media a cada lado). αm peso de cada modelo (1/M en bagging, α en boosting, aprendido en stacking). M cuántos modelos se combinan.
Para llevarte a casa
F(x) = ∑m αm hm(x): muchos débiles → uno fuerte

La idea. Un solo modelo débil no basta. Combinar muchos reduce el error de tres maneras distintas. La curva muestra cómo cae el MSE de entrenamiento al añadir modelos (M): boosting baja más rápido y más hondo, bagging se estabiliza pronto, stacking queda en medio.

Negocio. Así funcionan los modelos que Amazon o cualquier retailer usa en producción para demanda, riesgo o churn: casi nunca es un modelo único, sino un ensemble (XGBoost, LightGBM, Random Forest son exactamente esto).

El dial clave. En boosting, el par de diales M y α gobierna el equilibrio sesgo–varianza: α pequeño + M grande da el mejor ajuste sin saltos bruscos. Es el hiperparámetro que más toca un científico de datos.

Y ahora. Bagging promedia en paralelo (baja varianza), boosting corrige en secuencia (baja sesgo) y stacking aprende cómo mezclar los modelos. Tres recetas para el mismo fin: que el conjunto sea mejor que cualquiera de sus partes.

Garrido-Merchán — ecgarrido@comillas.edu — Machine Learning para Business Analytics — Ensembles