El bosque promedia muchos árboles
ŷ(x) = 1Bb=1B Tb(x)
Var(ŷ) ≈ ρ σ² + (1−ρ)B σ²
con B = 30 árboles:

El caso. Mapfre quiere estimar el coste esperado de siniestro (y, en miles de €) según la antigüedad del carné del conductor (x, estandarizada en [0,1]). Un solo árbol de decisión es inestable: cambia mucho si cambias los datos. La idea del random forest es entrenar muchos árboles sobre remuestreos bootstrap de la cartera y quedarte con su promedio.

B 30
  1. Pon B = 1 y pulsa varias veces "nueva muestra". La predicción es escalonada y salta de golpe en cada remuestreo: un árbol solo tiene mucha varianza.
  2. Sube B hasta 120 y vuelve a pulsar "nueva muestra". La línea dorada del bosque se vuelve suave y apenas se mueve al reseedear: el promedio ha domado la varianza.
  3. Arrastra B despacio de 1 a 120 mirando el MSE y la varianza. Al principio mejora muchísimo y luego se estanca: el suelo ρσ² no baja aunque añadas más árboles.
  4. Comprueba que lo entiendes
    ¿Por qué promediar reduce la varianza pero no el sesgo? Promediar estimadores ruidosos cancela el ruido (la media es más estable que cada árbol). Pero todos los árboles son poco profundos y comparten el mismo sesgo sistemático: no pueden capturar cierta curvatura de f. La media de muchas cosas sesgadas en la misma dirección sigue estando sesgada.

Lee así. Los puntos grises son la cartera; las líneas grises tenues son unos pocos árboles individuales (escalonados); la línea dorada gruesa es la media del bosque y la línea discontinua negra es la f verdadera. Al mover B se enciende el término B de las dos ecuaciones.

Tb(x) el árbol b entrenado sobre un remuestreo bootstrap. B número de árboles: más árboles = media más suave y estable. ρ correlación media entre árboles; σ² varianza de un árbol suelto. El suelo ρσ² es lo que el promedio no elimina.
Para llevarte a casa
Var(ŷ) ≈ ρ σ² + (1−ρ)B σ²

La idea. Un árbol de regresión es un buen predictor con baja tendencia pero alta varianza: reordena los datos y te da otra cosa. El bagging (bootstrap + averaging) entrena B árboles sobre remuestreos y promedia. La varianza del promedio cae como 1/B… hasta un suelo.

El suelo. Ese suelo horizontal es ρσ². Existe porque los árboles no son independientes: entrenados sobre remuestreos de la misma cartera, se parecen (correlación ρ > 0). Por muchos árboles que añadas, no bajas de ahí. Añadir árboles cuesta cómputo y ya no mejora.

El truco extra. Para descorrelacionar los árboles y bajar ρ (y con ello el suelo), el random forest submuestrea también las variables en cada corte. Menos ρ → suelo ρσ² más bajo → mejor bosque. Eso separa un random forest de un simple bagging de árboles.

Negocio. Cambias varianza por estabilidad: el coste estimado de siniestro deja de bailar con cada muestra nueva y es auditable y reproducible, justo lo que una aseguradora necesita para tarificar.

Garrido-Merchán — ecgarrido@comillas.edu — Machine Learning para Business Analytics — Random forests