El caso. Una agencia de moda genera fotos de producto con un modelo de difusión. El truco: se aprende a quitar ruido paso a paso. Primero hay que ver el proceso directo, que ensucia una imagen limpia x0 hasta convertirla en ruido puro.
Lee así. Sube t y la imagen se disuelve; s cambia el schedule (con s grande se ensucia antes). amp es el contraste de la foto que entra: una imagen apagada se pierde en el ruido mucho antes, aunque αt sea el mismo.
La idea. El proceso directo mezcla imagen y ruido con pesos √αt y √(1−αt). La red aprende a predecir ε en cada nivel; generar es recorrer la flecha al revés, de ruido puro (t=1) a imagen (t=0).
Negocio. La agencia describe el producto con un prompt y obtiene fotos de catálogo sin estudio ni sesión: variantes de color, fondo y luz en segundos, a coste marginal casi nulo.
Y ahora. Stable Diffusion y DALL·E hacen justo esto en el espacio latente y condicionados por texto. El principio no cambia: añadir ruido con un schedule y aprender a deshacerlo.