El coste esperado de la cascada
E[coste] = p·cbarato + (1−p)·(cbarato + ccaro)
E[coste] = 0.50·0.5 + (1−0.50)·(0.5 + 30) = 15.50 €/consulta × 1000 consultas

El caso. El servicio de atención al cliente recibe miles de consultas. Una cascada manda todo primero a un modelo barato y rápido; solo las consultas difíciles escalan al modelo caro y lento. Hay que equilibrar coste, latencia y calidad.

La cascada — lo que tú diseñas
p 0.50
ccaro 30
El negocio — lo que te viene dado
cbar 0.50
N 1000

Lee así. Sube p y el coste baja porque menos consultas escalan al caro; pero si el barato falla, la calidad cae. Abajo mueves el negocio: cbar es el suelo que pagas siempre (todas las consultas pasan por el barato) y N el volumen diario, que multiplica cualquier céntimo de diferencia.

p fracción que resuelve el modelo barato. cbarato coste del modelo barato. N consultas al día. ccaro coste del modelo caro (€ / 1000 tokens). Todas las consultas pasan por el barato; una fracción (1−p) escala además al caro.
Para llevarte a casa
E[coste] = p·cbarato + (1−p)·(cbarato + ccaro)

La idea. Una cascada enruta: el modelo barato responde si confía; si no, escala al caro. Ajustando el umbral de confianza mueves p y con ella el coste y la latencia esperados.

Negocio. Poner p alto abarata la factura y acelera la respuesta media, pero cada consulta mal resuelta por el barato es un cliente insatisfecho. El punto óptimo equilibra coste, latencia y calidad, no minimiza uno solo.

Y ahora. En producción se vigila la cola (una M/M/1 se satura si llegan más consultas de las que el sistema procesa) y la latencia por percentiles: no basta la media, el p95 es lo que sufre el peor cliente.

Garrido-Merchán — ecgarrido@comillas.edu — Deep Learning para Business Analytics — Día 17 · Producción