La descomposición del error de test
errortest ≈ sesgo²(d) + varianza(d) + ruido
complejidad del modelo: grado d   (↑d ⇒ ↓sesgo, ↑varianza)
con d = 3:

El caso. Una tienda online quiere un modelo que generalice a clientes nuevos, no que memorice a los del histórico. Ajustas un polinomio de grado d sobre unos 13 clientes de entrenamiento (puntos dorados) y lo mides sobre 50 clientes de test que el modelo nunca vio (puntos grises).

d 3
  1. Pon d = 1: el modelo es una recta rígida. El MSE de entrenamiento y el de test son AMBOS altos: la recta no captura la curva (subajuste, sesgo alto).
  2. Sube a d = 3. El MSE de train y el de test caen y quedan parecidos: buen ajuste, el gap es pequeño.
  3. Lleva d a 10–12. El MSE de train se desploma por debajo del ruido, pero el de test se dispara y la curva se vuelve ondulante (sobreajuste; el gap se abre).
  4. Comprueba que lo entiendes
    ¿Por qué un error de entrenamiento casi perfecto puede ser una mala noticia? Con d alto y pocos clientes, el polinomio pasa casi por cada punto: está memorizando el ruido del histórico, no la señal. Ese ajuste no se repite en clientes nuevos, así que el error de test se dispara.

Lee así. La curva dorada es el modelo ajustado sobre el entrenamiento. Al subir d se enciende ese término de la ecuación: baja el sesgo (la curva se pega a los puntos dorados) pero sube la varianza (se retuerce y falla en los grises).

d grado del polinomio = complejidad del modelo. MSE error cuadrático medio: el promedio de (predicho − real)². gap distancia entre el error de test y el de train: mide el sobreajuste.
Para llevarte a casa
minimiza el error de test, no el de entrenamiento

La idea. Un error de entrenamiento bajo no significa un buen modelo. Lo que le importa al negocio es el error sobre clientes nuevos: el error de test. Esa es la curva dorada en forma de U.

Las dos zonas malas. A la izquierda, poca complejidad: modelo demasiado simple, error alto en train y en test (subajuste, sesgo alto). A la derecha, mucha complejidad: memoriza el ruido, train casi 0 pero test disparado (sobreajuste, varianza alta).

El punto dulce. Está en complejidad intermedia: ni la recta rígida ni el polinomio ondulante. Ahí el error de test toca su mínimo. Se elige con validación, tratando d como un hiperparámetro.

Qué ayuda. Cuando sospechas sobreajuste: más datos (la U se aplana y el óptimo se desplaza a la derecha) y regularización (penalizar coeficientes grandes frena las ondulaciones sin tocar d).

Garrido-Merchán — ecgarrido@comillas.edu — Machine Learning para Business Analytics — Overfitting y underfitting