La ecuación de la búsqueda
1*, λ2*) = arg minλ  Lval(λ)  con  N evaluaciones
bayesiana: elige el siguiente λ = arg maxλ  EI(λ)
estrategia grid · N = 16 · mejor L encontrada:

El caso. Un equipo de analítica busca los dos ajustes (hiperparámetros λ1 y λ2) que minimizan el error de validación de su modelo. Cada evaluación cuesta tiempo y dinero (reentrenar), así que la pregunta es: con un presupuesto de N pruebas, ¿cómo las repartimos?

plan
N 16
  1. Empieza en malla con N=16: cae en una rejilla 4×4 regular. Gasta pruebas en zonas malas y puede no acertar el valle estrecho.
  2. Cambia a azar con el mismo N. Cubre mejor cada eje por separado; suele hallar un valor más bajo que la malla con el mismo presupuesto.
  3. Cambia a bayesiana: arranca con unas pocas al azar y luego concentra las pruebas cerca del mínimo. Con menos evaluaciones llega tan cerca del óptimo como las otras con muchas más.
  4. Comprueba que lo entiendes
    La malla sufre la maldición de la dimensión: con d hiperparámetros y m valores por eje necesita md pruebas. El azar y la búsqueda bayesiana no dependen de esa rejilla; la bayesiana además aprende del pasado con un modelo sustituto (GP) y decide dónde mirar con EI.

Lee así. El fondo es el mapa de error (oscuro = bajo error = bueno). Las cruces son las pruebas realizadas; el anillo dorado es la mejor encontrada y la estrella marca el óptimo real. Sube N y el término N se enciende.

λ hiperparámetro (no se aprende: se busca). Lval error de validación a minimizar. N presupuesto de evaluaciones. GP proceso gaussiano: modelo sustituto que predice el error e incertidumbre. EI mejora esperada: cuánto se espera mejorar el mejor valor si pruebas ahí.
Para llevarte a casa
malla < azar < bayesiana  (a igualdad de presupuesto)

La idea. Buscar hiperparámetros es optimizar una función cara y sin fórmula: cada evaluación es reentrenar y medir en validación. Hay tres planes clásicos de reparto del presupuesto.

Negocio. Menos pruebas para la misma calidad = menos horas de cómputo y menos coste en la nube. En modelos caros (deep learning, grandes tabulares), la búsqueda bayesiana ahorra mucho.

El dial clave. La malla es exhaustiva pero explota con la dimensión; el azar cubre mejor cada eje; la bayesiana usa un modelo sustituto (GP) y la mejora esperada (EI) para explorar donde hay incertidumbre y explotar donde el error es bajo.

Y ahora. La curva muestra el mejor error hallado según el nº de evaluaciones: la bayesiana baja antes. Todo se hace sobre validación; el test se reserva para el final.

Garrido-Merchán — ecgarrido@comillas.edu — Machine Learning para Business Analytics — Búsqueda de hiperparámetros