El proceso directo de difusión
xt = √αt·x0 + √(1−αt)· ε
xt = 1.00·x0 + 0.00·ε   (αt = 1.00)

El caso. Una agencia de moda genera fotos de producto con un modelo de difusión. El truco: se aprende a quitar ruido paso a paso. Primero hay que ver el proceso directo, que ensucia una imagen limpia x0 hasta convertirla en ruido puro.

El proceso — nivel de ruido y schedule
t 0.30
s 0.008
La imagen — qué entra en el proceso
amp 1.00
semilla #1

Lee así. Sube t y la imagen se disuelve; s cambia el schedule (con s grande se ensucia antes). amp es el contraste de la foto que entra: una imagen apagada se pierde en el ruido mucho antes, aunque αt sea el mismo.

αt cuánta señal sobrevive (schedule coseno). x0 imagen limpia. ε ruido gaussiano N(0,1). SNR señal / ruido.
Para llevarte a casa
xt = √αt·x0 + √(1−αt)·ε

La idea. El proceso directo mezcla imagen y ruido con pesos √αt y √(1−αt). La red aprende a predecir ε en cada nivel; generar es recorrer la flecha al revés, de ruido puro (t=1) a imagen (t=0).

Negocio. La agencia describe el producto con un prompt y obtiene fotos de catálogo sin estudio ni sesión: variantes de color, fondo y luz en segundos, a coste marginal casi nulo.

Y ahora. Stable Diffusion y DALL·E hacen justo esto en el espacio latente y condicionados por texto. El principio no cambia: añadir ruido con un schedule y aprender a deshacerlo.

Garrido-Merchán — ecgarrido@comillas.edu — Deep Learning para Business Analytics — Día 12 · Difusión