La familia de curvas de grado d
Hd = { h(x) = ∑j=0d βj·xj : β ∈ ℝd+1 }
con d = 3:

El caso. Una consultora modela las ventas (y) de un cliente frente a su inversión en publicidad (x). Antes de tocar un solo dato debe elegir la familia de curvas con la que va a trabajar. Cada familia Hd es un espacio de hipótesis: el conjunto de formas que el modelo puede representar, aquí todos los polinomios de grado ≤ d.

d 3
  1. Pon d = 0 (constante) y luego d = 1 (recta). La familia no puede capturar la curvatura: solo caben rectas y planos, así que el MSE se queda alto (subajuste).
  2. Sube d hasta 3 (cúbica). La familia ya incluye la forma real de los datos y el MSE se desploma.
  3. Empuja d hasta 6. La familia es aún mayor, contiene a todas las anteriores y ajusta igual o mejor los datos, pero empieza a ondular entre los puntos.
  4. Comprueba que lo entiendes
    ¿Por qué H1 ⊂ H2 ⊂ H3 ⊂ …? Toda recta es una parábola con el coeficiente cuadrático a cero, y toda parábola es una cúbica con el coeficiente cúbico a cero. Basta poner a cero los coeficientes altos para recuperar cualquier familia de menor grado: por eso cada espacio contiene a los anteriores.

Lee así. Los puntos son las ventas observadas. La curva dorada gruesa es el mejor miembro de la familia (ajuste por mínimos cuadrados). Las curvas grises tenues son otros miembros de la misma familia Hd: distintos β, misma forma permitida. Al mover d se enciende el término d de la ecuación.

Hd el espacio de hipótesis: todas las curvas que el modelo puede representar. d el grado = qué familia eliges (0 constante, 1 recta, 2 parábola, 3 cúbica…). β los d+1 coeficientes: cada elección de β es un miembro concreto de la familia.
Para llevarte a casa
H0 ⊂ H1 ⊂ H2 ⊂ ⋅⋅⋅ ⊂ Hd

La idea. Elegir el espacio de hipótesis es elegir qué formas puede aprender el modelo antes de ver un solo dato. El aprendizaje solo puede recuperar una función que quepa dentro de la familia elegida.

Familias anidadas. Los polinomios cumplen H0 ⊂ H1 ⊂ H2 ⊂ …: cada grado añade una forma nueva sin perder las viejas. Por eso la capacidad del modelo crece con d, como los círculos concéntricos de la figura.

El equilibrio. Demasiado pequeño y la verdad no cabe: el modelo no puede acertar aunque quiera (sesgo, subajuste). Demasiado grande y cabe también el ruido: el modelo memoriza rarezas de la muestra (varianza, sobreajuste).

Y ahora. Esta tensión es exactamente la de capacidad y overfitting: en el próximo tema mediremos con validación cuál es el d que mejor generaliza, no el que mejor ajusta lo que ya viste.

Garrido-Merchán — ecgarrido@comillas.edu — Machine Learning para Business Analytics — Espacio de hipótesis