La función de coste con freno
L(β) = MSE(β) + λ · ∑j βj2
ŷ(x) = β0 + β1x + β2x2 + … + β9x9
con λ = —:

El caso. Mapfre ajusta el precio de una póliza con un modelo muy flexible: un polinomio de grado 9 sobre el tamaño del riesgo. Con pocos datos y sin frenos, esa flexibilidad se vuelve en contra: la curva (dorada) se retuerce para pasar por cada punto y memoriza el ruido en vez de la relación de fondo (línea gris discontinua). El término λ castiga coeficientes grandes.

λ
  1. Deja λ al mínimo. La curva se retuerce y pasa casi por cada punto: el MSE de entrenamiento es diminuto, pero el MSE de test se dispara y ‖β‖² es enorme (sobreajuste).
  2. Sube λ poco a poco. La curva se suaviza, ‖β‖² se encoge y el MSE de test baja hasta un mínimo.
  3. Lleva λ al máximo. La curva queda casi plana: subajuste, y tanto el MSE de train como el de test vuelven a subir.
  4. Comprueba que lo entiendes
    ¿Por qué penalizar ∑β2 combate el sobreajuste? Una curva que se retuerce mucho necesita coeficientes gigantes (pendientes bruscas). Al encoger los β, el modelo solo puede producir funciones más suaves, que no persiguen el ruido punto a punto y por eso generalizan mejor.

Lee así. Los puntos dorados son los datos de entrenamiento; la curva dorada es el ajuste; la línea gris discontinua es la verdad suave que queremos recuperar. Al mover el mando, el término λ de la ecuación se enciende.

λ intensidad del castigo a la complejidad (hiperparámetro). ∑β2 tamaño de los coeficientes (penalización L2). MSE error cuadrático medio: cuánto se aleja el ajuste de los datos.
Para llevarte a casa
L(β) = MSE(β) + λ·∑jβj2

La idea. Un modelo flexible no falla por ser potente, sino por no tener freno. La regularización L2 (Ridge) añade al coste un peaje λ·∑β2: cuanto mayor sea un coeficiente, más caro es mantenerlo. El ajuste se queda solo con la señal que de verdad paga su precio.

El dial clave. λ es el mando explícito del equilibrio sesgo–varianza. λ pequeño → mucha varianza (sobreajuste); λ grande → mucho sesgo (subajuste). El punto dulce es el fondo de la U del error de test, y se elige por validación, no a ojo.

Negocio. En pricing, scoring de crédito o previsión de demanda, regularizar es lo que hace que un modelo entrenado con el histórico siga acertando el mes que viene, en vez de memorizar el pasado.

Y ahora. L2 encoge todos los coeficientes hacia cero sin anular ninguno. Su primo L1 (Lasso) penaliza ∑|β| y además selecciona variables: pone a cero las inútiles, dándote un modelo más simple y legible.

Garrido-Merchán — ecgarrido@comillas.edu — Machine Learning para Business Analytics — Regularización