Setup. El asistente comercial de BBVA del deck: una petición atraviesa router (clasifica, modelo barato, ~300 tokens), recuperador (embedding + búsqueda vectorial, coste fijo pequeño), generador (el LLM grande que redacta con el contexto RAG) y validador (segunda pasada que revisa cumplimiento). Cada barra del panel superior es el coste real de esa etapa con los precios por millón de tokens del modelo asignado; el panel inferior proyecta el coste mensual (22 días laborables) según el volumen Q.
Juega. Mueve los sliders y observa que el desglose no es uniforme: el pipeline tiene un cuello de coste claro (el generador) y dos etapas casi gratuitas. La decisión cara no es "usar IA", es cuántos tokens caros pasan por el modelo caro.
Lee así. El lector da el coste por petición, el reparto porcentual y la factura mensual en dólares. Compáralo con la alternativa humana: una gestión del call center de ING cuesta ~€5,50; aquí hablamos de céntimos.
Mensaje. Conocer el desglose es imprescindible para saber dónde cortar: caché de prompt para el contexto repetido, modelo pequeño donde baste, validador solo para respuestas de riesgo. Las tres slides siguientes cuantifican cada palanca.
Términos. etapa: cada paso del pipeline con su modelo y sus tokens. pin, pout: precio por millón de tokens de entrada / salida. Q: volumen de peticiones por día. Mtok: millón de tokens.
Setup. El patrón de fallback en cascada del deck: un clasificador de complejidad (o el propio modelo barato con autoevaluación) intenta resolver cada consulta del asistente; si la confianza es baja, escala al modelo caro. Panel superior: coste esperado por consulta E[C] en función de p, con las líneas de referencia "todo al caro" y "todo al barato"; el punto dorado es tu configuración. Panel inferior: la calidad esperada Q̄ en función de la tasa de error e del detector, con qok = 0,95 y qmal = 0,55.
Juega. El triángulo de la slide es (p, Cc, e): más p = más ahorro; más Cc = más incentivo a la cascada; más e = más consultas complejas mal atendidas. En un churn telco con 80% de consultas repetitivas ("¿cuánto pago este mes?") la cascada es oro; en un asesor fiscal con todo complejo, no.
Mensaje. El routing inteligente es la palanca de coste más potente en producción, pero se dimensiona con dos números (p y e) que hay que medir sobre tráfico real, no suponer.
Términos. cascada: intentar primero el modelo barato y escalar si no basta. p: fracción de consultas que el barato resuelve bien. e: tasa de fallo del detector de insuficiencia. qok/qmal: calidad cuando la consulta acaba en el modelo adecuado / inadecuado.
Setup. La curva coste-calidad de la nota técnica, con los tres puntos de referencia del mercado 2026 marcados sobre ella: Haiku ($0,005/consulta), Sonnet ($0,03) y Opus ($0,15). La línea discontinua es el techo Qmax = 1; el punto dorado es tu presupuesto elegido y la zona sombreada es la calidad que ya has comprado.
Juega. El slider de $0 cambia de tarea: con el codo a la izquierda (tareas simples) los tres modelos están casi al mismo nivel de calidad y gana el barato; con el codo a la derecha (razonamiento), la brecha entre puntos se abre y el caro se justifica.
Mensaje. "¿Qué modelo uso?" es una pregunta mal planteada; la buena es "¿dónde está el codo de MI tarea?". Se responde midiendo calidad sobre un golden set a varios niveles de gasto, y de ahi sale la cascada de la slide anterior con números propios.
Términos. Qmax: techo de calidad alcanzable en la tarea. $0: escala del codo; gasto que compra el 63% del techo. golden set: conjunto de conversaciones ideales con las que se mide la calidad (Día 16).
Setup. Simulo 4 000 peticiones reales del chatbot (muestreadas con generador reproducible, semilla fija) cuya latencia por etapa es lognormal: mediana eμ y dispersión σ. Arriba: el histograma de latencias de UNA etapa con las marcas p50 (tinta), media (gris), p95 (dorado) y p99 (dorado oscuro), y la línea del SLA en 3 000 ms. Abajo: el p50 y el p95 del pipeline completo al encadenar S etapas en secuencia (cada punto se calcula sumando S muestras independientes, no con una fórmula pre-cocinada).
Juega. σ es el slider importante: representa tools externos inestables, reintentos ocultos, picos de carga del proveedor. Con σ alta, la distancia media–p99 se abre; eso es lo que el dashboard de producción vigila y lo que el incidente de ING del deck (picos a 12 s) ilustra.
Mensaje. En producción se piensa en percentiles. La media es una métrica de coste (factura = volumen × media); la experiencia y el SLA son percentiles. Y al encadenar etapas, la cola de la suma la domina la etapa más dispersa: optimiza la varianza, no solo la media.
Términos. TTFT: time-to-first-token, latencia antes del primer token (~0,7 s en Sonnet vía API). tps: tokens por segundo de decodificación (~60). p50/p95/p99: percentiles de latencia. SLA: acuerdo de nivel de servicio, contractual.
Setup. El asistente corporativo BBVA del deck tiene 4 subagentes (buscador, investigador, analista, redactor). Cuando el orquestador necesita varios a la vez puede encadenarlos o lanzarlos en paralelo. Simulo 3 000 peticiones (semilla reproducible): cada subagente tarda una lognormal con mediana 500 ms y la σ del slider. Arriba: latencia p50 y p95 de ambas estrategias en función de n, calculadas sobre la simulación. Abajo: las tres distribuciones para el n elegido (una etapa, máximo de n, suma de n).
Juega. El contraste es la imagen del día 15 (orquestador-subagentes) hecha número: la arquitectura en estrella no es estética, es la que permite paralelizar; una cadena lineal de subagentes hereda la suma de latencias completa.
Mensaje. El paralelismo es la única optimización de latencia que es gratis en coste. Su límite es la dependencia lógica (el redactor necesita lo que encuentre el buscador) y el rate limit del proveedor.
Términos. orquestador: agente principal que delega en subagentes (Día 15). fan-out: lanzar n subagentes a la vez. máx de n: latencia del paralelo; equivale al percentil 1−1/n de una etapa.
Setup. El patrón retry-con-backoff de la nota técnica, con su aritmética completa. Arriba: la disponibilidad compuesta 1−(1−q)r en función de r, con la línea del SLA de disponibilidad (99,5%, el contrato del caso ING del deck). Abajo: la latencia de cada escenario (éxito al intento 1, 2, ..., r) con sus probabilidades como barras, y la latencia esperada total. Todo se calcula con la enumeración exacta de escenarios, no por aproximación.
Juega. La política de reintentos tiene tres mandos y esta slide los hace visibles: r compra disponibilidad con rendimientos decrecientes, b compra estabilidad del proveedor a costa de latencia de cola, y q no lo controlas tú: lo controla el circuit breaker, que corta cuando q se hunde para no pagar la zona roja de esta slide.
Mensaje. Los cinco patrones del deck (timeout, retry, circuit breaker, fallback de modelo, mensaje canónico) son capas de la misma cebolla: cada una corta las pérdidas cuando la anterior no basta. Reintentar errores 4xx (lógicos) no entra: si el JSON era inválido, lo seguirá siendo a la tercera.
Términos. q: probabilidad de éxito de un intento. r: máximo de intentos. backoff: espera creciente entre reintentos (b, 2b, 4b...). circuit breaker: dejar de llamar a un servicio que falla repetidamente. 429/503: errores transitorios (rate limit / servicio no disponible); sí se reintentan.
Setup. El asistente de BBVA en hora punta: las peticiones llegan a tasa λ y el despliegue (instancias del orquestador + cuota de API) procesa a capacidad μ. Arriba: la curva codo W(λ) con tu punto de operación dorado y la asíntota vertical en λ = μ; la línea discontinua es el objetivo de 300 ms de espera interna. Abajo: L = λW y Lq (en cola) en función de la utilización ρ, con tu ρ marcada.
Juega. La pareja (λ, μ) resume todas las decisiones de capacidad: autoscaling (sube μ con la demanda), rate limiting (recorta λ para proteger W), colas de prioridad (reparte el W disponible). Fíjate en que TODO pasa cerca de ρ = 1; lejos del codo, la infraestructura es aburrida, que es como debe ser.
Mensaje. El SLA de latencia de las slides anteriores se gana o se pierde aquí: puedes tener el pipeline más rápido del mundo y arruinarlo con ρ = 0,95. Dimensionar = fijar W objetivo en el p95 y despejar μ con margen para la ráfaga.
Términos. λ: tasa de llegadas. μ: capacidad de servicio. ρ: utilización λ/μ. W: tiempo medio en el sistema (espera + servicio). L, Lq: peticiones dentro del sistema / esperando en cola. M/M/1: cola con llegadas Poisson, servicio exponencial, un servidor.
Setup. El asistente interno de empleados (caso 1 de la tabla del deck): muchas consultas se repiten ("¿días de vacaciones?", "¿cómo pido el certificado?"). Una caché semántica guarda la respuesta y la sirve en ~30 ms sin tocar el LLM ($0,022/petición, el ejemplo a mano del deck). Arriba: factura mensual sin caché vs con caché para tu TTL (barras), con el ahorro en euros. Abajo: las dos curvas enfrentadas en función del TTL, acierto h (dorado) y obsolescencia s (tinta), con tu TTL marcado.
Juega. Los cuatro sliders son las cuatro preguntas de negocio: ¿cuánto se repite mi tráfico? (hmax), ¿cada cuánto cambia la verdad? (τupd), ¿cuánto arriesgo a servir viejo? (TTL) y ¿cuánto facturo? (volumen). El cruce del panel inferior responde la pregunta del TTL para CADA tipo de contenido: FAQ de RRHH, TTL semanas; precios de Inditex, TTL minutos.
Mensaje. La caché es la palanca de coste n.º 2 tras el routing, y además mejora la latencia (los aciertos son instantáneos: suben el p50 de experiencia sin tocar el p95). Su riesgo no es técnico sino de frescura, y se gestiona por tipo de contenido.
Términos. h: tasa de acierto de caché. TTL: time-to-live, caducidad de cada entrada. hmax: repetitividad del tráfico (techo de h). obsolescencia s: probabilidad de servir una respuesta cuya fuente ya cambió. caché semántica: indexa por embedding, no por igualdad literal.
Setup. Ocho horas (480 min) del dashboard del asistente en producción, generadas con semilla reproducible: tasa de error por minuto con base 1% + ruido + un pico esporádico inocuo, y una degradación real inyectable en t = 120 (un MCP externo caído que eleva la tasa a ~6% con rampa de 10 min). Arriba: serie cruda, media móvil, umbral θ y alertas. Abajo: las curvas FP(θ) y D(θ) calculadas barriendo θ sobre esta misma serie, con tu θ marcado. Nada está pre-cocinado: cambiar la semilla recalcula todo.
Juega. Esto es el panel de "tasa de error" del dashboard de cuatro paneles del deck (faithfulness, latencia p95, coste/sesión, fallbacks). Cada panel tiene su versión de esta misma tensión FP/D; el de coste, por ejemplo, vigila el presupuesto por sesión del error 2 del deck (loops que queman $1 por conversación).
Mensaje. "No usar nunca un agente sin observabilidad en producción: depurar a oscuras es imposible" (nota técnica). Y observar no es solo loggear: es elegir umbrales con criterio económico explícito. El equipo que mide gana al equipo que improvisa.
Términos. θ: umbral de alerta. w: ventana de la media móvil. FP: falsos positivos (alertas sin incidente). D: tiempo de detección del incidente real. traza: registro completo {(contexto, acción, resultado)} de cada sesión (Langfuse, Phoenix, Helicone).
En una frase. Producción no es "funciona en el lab": es un sistema con factura desglosada por etapa, latencia prometida en percentiles, fallbacks en capas y un monitor cuyos umbrales tienen justificación económica. Todo lo de hoy son seis fórmulas cortas y la disciplina de medirlas sobre TU tráfico.