La ecuación de la atención
αi = softmax( ei / τ ) = exp(ei/τ) / Σj exp(ej/τ)
c = Σi αi · hi
τ = 1.0,  e = (1.5, 0.8, 2.0, 0.5, -0.5) ⇒

El caso. Una empresa de turismo resume las reseñas de sus hoteles. Al generar cada palabra del resumen, la atención decide a qué palabras del original mirar más. Aquí, cinco palabras con su relevancia ei.

El mecanismo — cuán afilada es la mirada
τ 1.0
La reseña — el score de cada palabra
e1 1.5
e2 0.8
e3 2.0
e4 0.5
e5 -0.5

Lee así. τ→0 afila la atención (todo el peso a la palabra de mayor score); τ alta la reparte. Los cinco ei son la reseña: sube uno y verás que solo importa la diferencia entre scores.

αi peso de atención sobre la palabra i (suman 1). ei score de relevancia de cada palabra: la entrada. τ temperatura: cuán concentrada o repartida es la mirada.
Para llevarte a casa
αi = exp(ei/τ) / Σj exp(ej/τ)  ·  c = Σi αi hi

La idea. La atención es una media ponderada de las palabras del texto. Los pesos αi salen de un softmax sobre scores de relevancia: la query pregunta y cada palabra responde con más o menos peso. El grosor de cada flecha es su αi.

Negocio. Al resumir una reseña, el modelo se fija en «limpio» o «ruidoso» y no en las palabras de relleno. Eso da traducciones y resúmenes fieles: el cliente lee en segundos lo que de verdad opinan del hotel.

Y ahora. Esta misma operación, repetida en paralelo y apilada en capas, es el corazón del Transformer y de todos los grandes modelos de lenguaje. El principio no cambia: puntúa, normaliza con softmax, promedia.

Garrido-Merchán — ecgarrido@comillas.edu — Deep Learning para Business Analytics — Día 07 · Atención