La ecuación del vecino más cercano
ŷ(x) = voto mayoritario { yi : xiNk(x) }
d(x, xi) = √ ∑j(xj − xij)2 
con k = 7 vecinos:

El caso. El Corte Inglés quiere saber si un cliente comprará un producto premium. De cada cliente conoce dos señales: gasto medio mensual (x1) y nº de visitas (x2). kNN no entrena nada: para un cliente nuevo (punto dorado) mira a sus k clientes más parecidos y copia lo que hicieron.

k 7
x₁ 0.50
x₂ 0.55
  1. Deja el cliente en el centro y pon k = 1: decide un único vecino. La frontera es nerviosa: mueve el cliente un pelín y la decisión salta.
  2. Sube k hasta 25 sin mover el cliente. La decisión se vuelve estable y manda la clase mayoritaria de la zona.
  3. Lleva el cliente a una esquina de gasto muy alto. Casi todos sus vecinos son compradores → predice compra.
  4. Comprueba que lo entiendes
    ¿Por qué usamos k impar? Con dos clases, un k impar evita empates en la votación: siempre hay mayoría estricta.

Lee así. El fondo pinta la decisión de kNN en cada zona (dorado = compra). Las líneas unen al cliente con sus k vecinos que votan. Sube k y el término Nk de la ecuación se enciende.

Nk(x) los k puntos de entrenamiento más cercanos a x. d distancia euclídea: la longitud en línea recta entre dos clientes. k cuántos vecinos votan: pequeño = flexible, grande = suave.
Para llevarte a casa
ŷ(x) = voto de los k vecinos más cercanos

La idea. kNN es un modelo perezoso: no aprende parámetros, guarda los datos y decide en el momento por semejanza. Toda la magia está en la distancia y en k.

Negocio. Sirve para recomendar ("clientes como tú compraron…") y para scoring rápido cuando tienes buenos históricos y pocas dimensiones. Ojo: hay que escalar las variables, o el euro aplastará al número de visitas.

El dial clave. k gobierna el equilibrio sesgo–varianza: k pequeño se ajusta al ruido (sobreajuste), k grande difumina la frontera (subajuste). Se elige por validación, como un hiperparámetro.

Y ahora. Los árboles del siguiente tema también parten el espacio en regiones, pero con reglas legibles en vez de distancias.

Garrido-Merchán — ecgarrido@comillas.edu — Machine Learning para Business Analytics — kNN