El caso. Amazon quiere predecir la demanda diaria (y) de un producto en función de su precio relativo (x, entre 0 y 1). Un solo modelo simple (un decision stump: un único corte) falla. La idea del ensemble es combinar M modelos débiles hm con pesos αm para formar uno fuerte: la curva dorada F(x).
Lee así. Los puntos grises son las ventas observadas; la curva dorada es la predicción F(x) del ensemble. Sube M y se enciende el límite del sumatorio; mueve α y se enciende el peso de cada modelo.
La idea. Un solo modelo débil no basta. Combinar muchos reduce el error de tres maneras distintas. La curva muestra cómo cae el MSE de entrenamiento al añadir modelos (M): boosting baja más rápido y más hondo, bagging se estabiliza pronto, stacking queda en medio.
Negocio. Así funcionan los modelos que Amazon o cualquier retailer usa en producción para demanda, riesgo o churn: casi nunca es un modelo único, sino un ensemble (XGBoost, LightGBM, Random Forest son exactamente esto).
El dial clave. En boosting, el par de diales M y α gobierna el equilibrio sesgo–varianza: α pequeño + M grande da el mejor ajuste sin saltos bruscos. Es el hiperparámetro que más toca un científico de datos.
Y ahora. Bagging promedia en paralelo (baja varianza), boosting corrige en secuencia (baja sesgo) y stacking aprende cómo mezclar los modelos. Tres recetas para el mismo fin: que el conjunto sea mejor que cualquiera de sus partes.