La capacidad crece con el grado del polinomio
capacidad ↑  con  d
nº de parámetros = d + 1
h(x) = ∑j=0d βj xj
con d = 3:

El caso. Una consultora modela la relación entre la inversión en marketing (x) y las ventas (y). Ajusta un polinomio de grado d. La capacidad del modelo es cuánto puede «retorcerse» su curva para pasar por los datos: aquí la gobiernas tú con el grado d.

d 3
  1. Deja d = 1: el modelo solo puede trazar una recta. La recta es rígida, no sigue la curvatura de los datos y el MSE de entrenamiento se queda alto (poca capacidad).
  2. Sube d paso a paso hasta 6–7. La curva se dobla cada vez más y el MSE de entrenamiento baja de forma monótona: más capacidad, mejor ajuste al train.
  3. Lleva d a 10–12. La curva se retuerce para acercarse a cada punto: ondula y se sale del rango de los datos, y el MSE de train toca su valor mínimo (una fracción del de la recta rígida).
  4. Comprueba que lo entiendes
    ¿Por qué más capacidad siempre reduce (o iguala) el error de entrenamiento? Porque un modelo de grado d contiene a todos los de grado menor: en el peor caso copia el mejor ajuste anterior, y con más libertad puede acercarse aún más a cada punto. Pero eso no significa un mejor modelo: al acercarse tanto a cada dato, la curva empieza a seguir el ruido en lugar de la señal — es el germen del sobreajuste que veremos con datos de test.

Lee así. Los puntos dorados son las observaciones (inversión, ventas). La curva dorada es el mejor ajuste de grado d. Sube d y el término d de la ecuación se enciende; el nº de parámetros es d + 1.

d grado del polinomio: el dial de capacidad (flexibilidad). d + 1 número de parámetros βj a estimar. βj pesos que la regresión elige para minimizar el error. MSE error cuadrático medio sobre los datos de entrenamiento.
Para llevarte a casa
capacidad = tamaño del espacio de hipótesis = nº de parámetros

La idea. La capacidad de un modelo es el tamaño de su espacio de hipótesis: cuántas funciones distintas puede representar. Con polinomios, subir el grado d añade parámetros (d + 1) y ensancha ese espacio: la curva puede retorcerse más.

Lo que ves. El MSE de entrenamiento baja de forma monótona con d (curva dorada): más capacidad siempre ajusta igual o mejor los datos que ya conoces, hasta tocar un suelo. Con capacidad suficiente, un modelo puede incluso pasar por todos los puntos y anular el error de train.

La trampa. Ajustar mejor el train no es ser mejor modelo. Con capacidad excesiva la curva memoriza el ruido en lugar de la señal: brilla en los datos vistos y falla en clientes nuevos.

Y ahora. El equilibrio real solo se ve con datos de test: ahí aparece el compromiso entre sesgo y varianza. Ese es el próximo tema.

Garrido-Merchán — ecgarrido@comillas.edu — Machine Learning para Business Analytics — Capacidad del modelo