| Técnica | Datos | TCO 12 m |
|---|
Setup. Un banco tipo BBVA quiere un asistente interno sobre su normativa y con su tono. Sobre el LLM base fθ₀ hay cinco vías de adaptación (tabla de la nota técnica): prompting/few-shot y RAG no tocan θ; LoRA entrena adaptadores diminutos; SFT total y RLHF/DPO tocan muchos más pesos y muchos más euros. Arriba: cada técnica como un punto en el cuadrante datos × coste (ambos ejes log), con los puntos de RAG y LoRA moviéndose con tus sliders. Abajo: el TCO anual de RAG (crece con Q) contra el de LoRA (plano en Q), con su cruce Q* calculado en vivo.
Juega. El caso Telefónica del deck vive aquí: LoRA con 1 000 ejemplos son ≈2 050 € todo incluido (50 € de GPU, el resto datos) frente a los 10 000 € de GPU del full fine-tuning sin contar sus 50 000 ejemplos. Mueve Q y n y observa qué técnicas se mueven contigo y cuáles son rocas.
Lee así. El cuadrante es el mapa del día: hoy bajaremos a la matemática de LoRA (por qué 50 € bastan), de SFT (qué compra cada ejemplo), y de RLHF/DPO (qué pasa cuando la calidad es una preferencia y no una etiqueta).
Mensaje. Para el 90 % de los casos corporativos, la respuesta es RAG + LoRA. El resto del deck te da los números para defender esa frase delante de un comité de inversión.
Términos. TCO: coste total de propiedad (fijo + por consulta + etiquetado). RAG: recuperar documentos e inyectarlos en el prompt, sin tocar pesos. LoRA: adaptadores de rango bajo sobre el modelo congelado. Q*: volumen de consultas donde dos técnicas empatan en coste.
Setup. Una capa lineal de un LLM tipo Llama es una matriz W de 4096×4096. El full fine-tuning actualiza sus 16,7 millones de entradas (y hay cientos de capas). LoRA congela W y añade el rodeo B·A: comprimir la entrada de d dimensiones a r (matriz A), volver a expandir de r a d (matriz B). Arriba: las tres matrices dibujadas a escala real; el área de cada rectángulo es proporcional a su número de parámetros. Abajo: las mismas áreas como barras en escala logarítmica.
Juega. El dibujo a escala es el argumento de venta completo: con r = 8 y d = 4096, B y A juntas son una franja casi invisible pegada a un continente. Es la "gafa graduada" del deck: el cerebro (W) no se toca; la lente (BA) corrige la salida. Y como W no cambia, puedes tener N lentes (legal, riesgos, marketing) y cambiarlas en segundos sobre el mismo modelo base.
Lee así. El readout da los tres números que gobiernan el coste: parámetros congelados (d²), entrenables (2rd) y su cociente. La GPU solo necesita gradientes y estados de optimizador para los segundos: de ahí saldrá la slide de memoria.
Mensaje. LoRA no es un truco de compresión del modelo: es una parametrización del cambio. La pregunta de por qué un cambio de rango 8 basta para adaptar una matriz de rango 4096 la responde la slide siguiente, con una SVD de verdad.
Términos. rango r: número de direcciones independientes del cambio ΔW. down/up-projection: A comprime (r×d), B expande (d×r). α: escala fija de la corrección, no se aprende. congelar: excluir de gradientes y optimizador.
Setup. Genero una matriz M de 22×22 con estructura (cuatro patrones suaves de pesos 10, 4, 2 y 1) más ruido pequeño: el mismo aspecto que tiene el ΔW de un fine-tuning real. El JS calcula su SVD de verdad: diagonaliza MTM con rotaciones de Jacobi (un algoritmo clásico de álgebra numérica, ejecutado en tu navegador ahora mismo), extrae los 22 valores singulares y reconstruye Mr con las r capas más importantes. Arriba: M original y su reconstrucción lado a lado. Abajo: el espectro σk (barras, doradas las retenidas) y la curva de error E(r) con tu r marcado.
Juega. El espectro es la radiografía: cuatro barras grandes y un suelo plano de ruido. El error cae a plomo mientras recorres las barras grandes y se arrastra después: cada rango extra a partir del codo compra casi nada. Ese codo es el "r" que eliges en LoRA.
Lee así. El readout traduce a almacenamiento: M completa son 484 números; el formato factorizado son 45r (las uk, vk y σk). En la capa real de la slide anterior la misma cuenta es d² contra 2rd.
Mensaje. LoRA funciona porque los cambios que pide una adaptación (tono BBVA, formato de factura) son de rango efectivo bajo. No es un milagro de deep learning: es Eckart–Young aplicado al fine-tuning.
Términos. σk: valores singulares, la "importancia" de cada capa de rango 1. ‖·‖F: norma de Frobenius (raíz de la suma de cuadrados). Jacobi: método iterativo que anula entradas fuera de la diagonal con rotaciones 2×2. rango efectivo: cuántas σ sobresalen del ruido.
Setup. Esta es la slide del deck "LoRA forward pass" hecha manipulable. W = (1 2; 3 4) congelada, el adaptador con los valores exactos del deck (A = (0.1, 0.2), B = (0.5, 0.3)T) y tú controlas la entrada x y la escala α. Arriba: el plano de salida con la flecha tinta Wx (lo que decía el modelo base), la flecha dorada (α/r)B(Ax) colgada de su punta (la corrección del adaptador) y la flecha profunda W′x (lo que dice el modelo adaptado). Abajo: las mismas cantidades por componente, como barras.
Juega. La geometría cuenta la historia entera: Ax proyecta la entrada sobre la dirección que el adaptador vigila (un solo número con r = 1) y B decide hacia dónde empujar la salida con esa intensidad. Hay entradas invisibles para el adaptador (las ortogonales a A) y una única dirección de empuje (la de B).
Lee así. En producción hay dos opciones que el deck menciona: fusionar (W′ = W + (α/r)BA una sola vez, coste de inferencia idéntico al base) o mantener el rodeo separado para conmutar adaptadores por departamento sin recargar los 7B de parámetros.
Mensaje. El forward de LoRA es una perturbación aditiva de rango bajo sobre la salida original: nada más, y por eso es tan barato y tan seguro (apagar el adaptador devuelve el modelo base exacto).
Términos. Ax: proyección de la entrada en las r direcciones del adaptador. fusionar: sumar BA a W tras entrenar, para servir sin coste extra. conmutar adaptadores: cambiar de BA en caliente, mismo W base.
Setup. Dos preguntas de negocio en una slide. Primera: ¿cuánta calidad compra cada punto de rango? La curva superior es el modelo de saturación q(r) anclado en las cifras del deck (prompting 62, full FT 91, LoRA r = 8 ≈ 89). Segunda: ¿qué GPU necesito? Las barras inferiores calculan los bytes reales de full FT, LoRA y QLoRA para el modelo elegido (con sus L capas y dimensión d reales), contra las líneas de 24, 48 y 80 GB de las GPUs típicas.
Juega. El punto dulce del rango (el mínimo r que se queda a menos de 1 punto del techo) se marca solo: con estas cifras es r = 16, y r = 8 se queda a 2 puntos por 2× menos parámetros — por eso 8 y 16 son los valores por defecto en la industria. La memoria, en cambio, casi no depende de r: los adaptadores son ruido al lado del modelo base.
Lee así. Los badges del readout dicen si cada método cabe en cada GPU. La frase para el comité: "QLoRA convierte un clúster de 13 A100 en una sola tarjeta de estación de trabajo".
Mensaje. El rango se elige por la curva de calidad (codo en 8–16) y la técnica por la memoria (QLoRA si el modelo no cabe). Las dos decisiones son independientes y las dos están en esta pantalla.
Términos. Nθ: parámetros del modelo base. Nad: parámetros de los adaptadores, 4rdL. NF4: NormalFloat de 4 bits, la cuantización de QLoRA. punto dulce: mínimo r con q(r) ≥ q∞ − 1.
Setup. Un contact center tipo Telefónica quiere que el modelo responda con sus plantillas. El juguete: 4 tipos de prompt (saldo, queja, baja, oferta) y 6 plantillas de respuesta, con una verdad p*(y|x) fijada (la plantilla correcta sale con prob. 0,78; la genérica educada 0,12; el resto, ruido). El JS muestrea n pares (x, y) de esa verdad, ajusta el imitador p̂ por máxima verosimilitud y evalúa su cross-entropy de test exacta — y repite todo 24 veces por cada n para que veas la varianza. Arriba: CE(n) con su nube de réplicas y el suelo H*. Abajo: calidad relativa (eH*−CE; 100 % = imitador en el techo teórico) contra euros gastados (n × c), con el punto de rendimiento decreciente en oro.
Juega. La curva de arriba es la curva de aprendizaje más honesta que verás: sin trucos, es el MLE contra la verdad. Decae rápido, satura contra H*, y la nube de réplicas se estrecha como 1/√n.
Lee así. El deck dice "LoRA: 1K–10K ejemplos; SFT total: 50K+". Esta slide es el porqué económico: el valor marginal del ejemplo n-ésimo cae exponencialmente, así que el presupuesto de etiquetado óptimo se corta donde la curva del panel inferior se dobla, no donde se acaba el dinero.
Mensaje. SFT es imitación con saturación: compra mucho al principio y casi nada después. Cuando lo que falla ya no es qué responder sino cuál de dos respuestas válidas es mejor, el dato (x, y) se queda corto: hacen falta preferencias — siguiente slide.
Términos. p*(y|x): la verdad generadora del juguete. cxy, nx: conteos de entrenamiento. λ: suavizado de Laplace (evita log 0). H*: entropía condicional verdadera, suelo de la CE. CE: cross-entropy de test. calidad relativa: eH*−CE ∈ (0, 1]; 100 % cuando el imitador alcanza el techo.
Setup. El problema de la preferencia, con tus manos: cuatro estilos de respuesta de un asistente bancario (formal y resolutiva, seca, coloquial, burocrática evasiva) y un cliente enfadado. Tú votas pares A/B; cada voto entra como (yw, yl) en la verosimilitud de Bradley–Terry y el JS la maximiza por ascenso de gradiente (600 pasos, en milisegundos) tras cada clic. Arriba: los rewards aprendidos ri como barras. Abajo: la matriz completa de predicciones P(i ≻ j) que esos rewards implican.
Juega. Fíjate en lo que NO hay: ninguna nota, ninguna etiqueta correcta, ninguna respuesta de referencia. Solo "prefiero esta". Y de ese material tan pobre emerge una escala numérica continua que ordena los cuatro estilos y cuantifica las distancias.
Lee así. En OpenAI/Anthropic esto mismo se hace con rφ(x, y) = una red sobre el texto, decenas de miles de pares y anotadores profesionales. La matemática del ajuste es idéntica a la de esta página; solo cambia el tamaño.
Mensaje. Cuando la calidad es "cuál prefieres", el dato natural es el par de preferencia y el modelo natural es Bradley–Terry. Con el reward model en la mano, la pregunta siguiente es cómo usarlo para mover el LLM sin romperlo: RLHF, siguiente slide.
Términos. yw, yl: respuesta preferida (winner) y rechazada (loser). ri: reward latente de la respuesta i (centrados a media 0). σ: sigmoide. log-verosimilitud/voto: métrica de ajuste; log 0.5 = −0.69 es "no sé nada".
Setup. Simplifico el espacio de respuestas a una recta de "calidad latente" y (60 valores): π₀ es el modelo SFT (campana centrada en calidad media), rreal(y) es la calidad verdadera (sube y satura) y el reward model r̂(y) la estima bien… salvo un pico falso en la zona de respuestas burocráticas cortas, donde sobrevalora (el checkbox lo controla: así son los fallos reales de un RM entrenado con pocos pares). El JS calcula exactamente πβ ∝ π₀er̂/β, su KL contra π₀, y los dos rewards esperados. Arriba: π₀ (gris) y πβ (oro). Abajo: E[r̂] y E[rreal] como funciones de β, con tu β marcada.
Juega. El slider de β recorre el dilema central del alineamiento: a un lado, no aprender nada; al otro, optimizar tan fuerte el proxy que explotas sus errores. El panel inferior es la imagen que deberías recordar: las curvas proxy y real van juntas hasta una β crítica y luego divergen.
Lee así. En producción no puedes dibujar la curva real (no la conoces: por eso el RM existe). Se vigila el KL: si crece mucho, el modelo está explotando; InstructGPT usó exactamente este término β·KL para contenerlo, y es la receta detrás de ChatGPT.
Mensaje. RLHF = perseguir un proxy con un freno KL. El freno no es un detalle de implementación: es lo único que separa "alinear" de "hackear el reward".
Términos. π₀ = πSFT: política de referencia. r̂ = rφ: reward model (proxy). KL: nats de divergencia; 0 = idénticas. reward hacking: E[r̂] sube mientras E[rreal] baja. PPO: el algoritmo de RL que aproxima esta solución en el espacio real de secuencias.
Setup. El mismo banco, 6 respuestas candidatas al cliente enfadado: formal+resolutiva, seca, coloquial, burocrática, disculpas+solución, y una que alucina una política inexistente. πref es el modelo SFT (asigna probabilidad decente a casi todas, incluida la alucinación). El dataset de preferencias: 8 pares (yw, yl) donde las resolutivas ganan y la alucinación siempre pierde. El JS optimiza LDPO con descenso por gradiente explícito sobre los logíts. Arriba: πref (contorno gris) contra πθ (oro) tras tus pasos. Abajo: la curva de pérdida y los rewards implícitos resultantes.
Juega. Esto es todo el pipeline de alineamiento moderno en tres botones: sin RM explícito, sin rollouts, sin PPO; gradientes estables de una pérdida supervisada. Compara mentalmente con la slide RLHF: el objetivo es el mismo y β significa lo mismo; ha desaparecido la maquinaria, no la matemática.
Lee así. El deck lo resume: RLHF necesita 3 modelos (SFT → RM → PPO); DPO necesita 1 (SFT → DPO). Por eso DPO es el default 2026 y por eso su fila en la tabla de costes baja un orden de magnitud en infraestructura (los pares de preferencia siguen costando lo mismo).
Mensaje. DPO = el objetivo de RLHF resuelto en cerrado y convertido en clasificación de pares. Cuando alguien te proponga "hacer RLHF" en la empresa, la pregunta correcta es: ¿y por qué no DPO?
Términos. z, zref: logíts de la política y de la referencia (π = softmax(z)). s: margen del par en unidades de reward implícito. σ(−s): "cuánto queda por aprender" del par. ew, el: vectores indicadores del ganador y el perdedor.
| Componente | Coste año 1 | ¿En tu stack? |
|---|
Setup. El árbol de decisión del deck, hecho circuito: cuatro preguntas de negocio (sin jerga de ML) y un camino que se ilumina en oro según tus respuestas, de la raíz a la recomendación. La tabla en vivo suma el TCO del stack resultante con los costes de la primera slide, cerrando el círculo del día.
Juega. Prueba los 16 caminos posibles (son 4 bits). Verás que solo uno de ellos — preferencias + GPU — activa el peldaño caro, y que la GPU actúa de llave: sin ella, las necesidades de tono caen a few-shot y las de comportamiento a "consumir un modelo ya alineado por API".
Lee así. Caso Inditex: el stock cambia a diario (RAG) y el tono de marca importa (LoRA): stack RAG + LoRA. Caso Netflix moderando contenido: el comportamiento ES el producto: pares de preferencia + DPO. Caso consultoría pequeña: prompting + few-shot y a correr.
Mensaje. La adaptación corporativa no es una elección de técnica favorita: es un recorrido por la escalera de coste con cuatro preguntas de negocio. Empieza en RAG y sube solo cuando el negocio lo exige.
Términos. stack: combinación de técnicas apiladas sobre el mismo modelo base. llave GPU: sin cómputo de entrenamiento, todo lo que toque θ queda fuera. API gestionada: fine-tuning de pago por uso cuando no hay GPU propia.
En una frase. Adaptar un LLM corporativo es elegir el peldaño más bajo de la escalera que alcanza la calidad exigida: casi siempre RAG + LoRA; preferencias (DPO) solo cuando el comportamiento, y no el conocimiento, es el producto.