Las cuentas del bucle
iteraciones por época = ⌈N / B⌉   ·   pasos = E · ⌈N/B⌉
N = 600, B = 32, E = 1219 iteraciones/época · 228 pasos

El caso. Una telco quiere predecir el churn con dos variables. Arriba, las filas troceadas en batches: eso es una época. Abajo, el camino que recorren de verdad los dos pesos sobre la superficie de pérdida mientras el bucle gira.

El bucle — cuánto datos y en qué trozos
N 600
B 32
Cuánto entrenas y con qué paso
E 12
lr 0.50

Lee así. Baja B a 1: la barra se llena de trozos, los pasos se disparan y el camino se convierte en un garabato que orbita el mínimo sin posarse. Sube B hasta el tope: el camino sale recto y limpio, y con las mismas épocas se queda a medio camino porque da poquísimos pasos.

N filas de entrenamiento. B tamaño del batch: cuántas filas mira cada paso. E épocas: cuántas veces se recorre el dataset entero. iteración un batch procesado y un paso del optimizador. lr cuánto se mueve cada paso.
La ecuación de la regularización
L(w) = Ldatos(d)(w ; N, σ) + λ · ‖w‖2
d = 12, λ = 0.100, N = 25, σ = 0.12 → train 0.00 · val 0.00

El caso. Mapfre quiere predecir el coste de un siniestro con pocos expedientes. Un modelo demasiado flexible memoriza el ruido en vez de la tendencia; la regularización lo frena.

El modelo — complejidad y castigo
d 12
λ 0.100
Los datos — cuántos y cuán ruidosos
N 25
σ 0.12

Lee así. Con λ=0 y d al tope la curva se sale del gráfico. Sube λ y se calma; llévalo al extremo y se aplana: demasiado castigo también estropea. λ tiene su óptimo, como d.

Ldatos error sobre los expedientes conocidos. λ cuánto castigamos pesos grandes. ‖w‖2 tamaño de los pesos: penaliza la complejidad. N expedientes disponibles. σ ruido del negocio: parte del coste que ninguna variable explica.
Para llevarte a casa
L(w) = Ldatos(w) + λ · ‖w‖2

La idea. Aumentar la complejidad baja siempre el error de entrenamiento, pero el de validación dibuja una U: primero mejora, luego empeora. Regularizar mueve ese punto óptimo hacia modelos estables. La curva es siempre la misma muestra: 25 expedientes, σ=0.12, sin castigo (λ=0). Pasado el grado 18 el error de validación se sale del gráfico.

Negocio. Para Mapfre, un modelo que memoriza los pocos siniestros vistos falla con el próximo cliente. La regularización compra generalización: predicciones fiables sobre expedientes nuevos.

Y ahora. El mismo λ reaparecerá en redes profundas como weight decay y como primo del dropout. El principio no cambia: penalizar la complejidad para no memorizar el ruido.

Garrido-Merchán — ecgarrido@comillas.edu — Deep Learning para Business Analytics — Día 03 · Regularización