Arquitectura RAG empresarial: respuestas de IA en las que se puede confiar
Las demos de RAG funcionan en una semana y fracasan en producción por lo mismo: la calidad de la recuperación es un problema de ingeniería de datos disfrazado de IA.
La generación aumentada por recuperación se ha convertido en la arquitectura por defecto de la IA empresarial, y con razón: fundamenta las respuestas en tus documentos, se actualiza cuando ellos se actualizan y muestra su trabajo mediante citas. También es la arquitectura que con más frecuencia parece terminada al 80 % y nunca llega a producción, porque el 20 % restante es ingeniería de datos poco lucida.
El proceso y dónde se rompe cada etapa
| Etapa | Función | Fallo habitual |
|---|---|---|
| Ingesta | Extraer texto de los sistemas de origen | Tablas y PDF mal procesados; contenido descartado en silencio |
| Fragmentación | Dividir documentos en unidades recuperables | Cortes de tamaño fijo que rompen el contexto |
| Enriquecimiento | Añadir metadatos y permisos | Se omite, impidiendo filtrar y citar |
| Indexación | Guardar vectores e índice léxico | Solo vectores: fallan los identificadores exactos |
| Recuperación | Obtener candidatos | Top-k sin reordenación ni filtro de permisos |
| Generación | Responder con el contexto aportado | Sin instrucción de abstención; confianza inventada |
| Evaluación | Demostrar que funciona | Inexistente, sustituida por opiniones |
La fragmentación es una decisión de contenido, no un parámetro
La mejora de mayor impacto en casi todos los sistemas RAG es fragmentar mejor. Divide según la estructura del documento —encabezados, secciones, cláusulas, filas de tabla— y no por número de caracteres. Conserva la ruta de encabezados dentro de cada fragmento para que el pasaje recuperado lleve su propio contexto. Mantén las tablas íntegras y guarda un resumen breve junto a los fragmentos largos para mejorar la calidad del embedding.
Recupera en híbrido y luego reordena
La similitud vectorial por sí sola falla con identificadores exactos, referencias de pieza, códigos de política y negaciones. La búsqueda léxica por sí sola falla con las paráfrasis. Ejecuta ambas, fusiona los candidatos y reordena los mejores con un cross-encoder antes de pasar una ventana de contexto pequeña y de alta calidad al modelo. Enviar veinte fragmentos mediocres es peor que enviar cuatro buenos.
Los metadatos hacen el trabajo pesado
Casi toda pregunta empresarial está implícitamente delimitada: este año, esta región, este producto, esta versión de la política. Sin metadatos no puedes expresarlo y el sistema citará encantado una política derogada. Captura sistema de origen, tipo de documento, fechas de vigencia, versión, responsable, idioma y clasificación de sensibilidad en la ingesta: añadirlo después es caro.
Permisos: el motivo por el que los pilotos no se lanzan
Un sistema RAG que puede leerlo todo y lo usa todo el mundo es una brecha de datos con interfaz de chat. La regla no es negociable: aplica los permisos dentro de la consulta de recuperación, con la identidad del usuario, antes de que nada llegue al modelo. Filtrar después de generar no es un control: el contenido ya se ha usado.
Salvaguardas que reducen el daño de forma medible
- Fundamentación obligatoria. Instruye al modelo para responder solo con el contexto aportado y para admitir que no lo sabe; después comprueba que cumple.
- Citas por construcción. Cada afirmación enlaza al fragmento que la produjo y el enlace abre un documento que el usuario puede ver.
- Umbrales de abstención. Si la confianza de recuperación es baja, devuelve fuentes sin respuesta sintetizada.
- Defensa ante inyección de prompts. El contenido recuperado es entrada no confiable: nunca debe alterar instrucciones ni elevar permisos. El OWASP Top 10 para aplicaciones LLM es la referencia práctica.
- Revisión humana en dominios regulados antes de cualquier salida contractual o de cara al cliente.
Evaluación, o estás enviando una intuición
Construye el arnés de evaluación antes de ajustar nada. Reúne 200 preguntas reales con respuestas y documentos fuente juzgados por personas. Mide por separado si la recuperación encontró los pasajes correctos y si la respuesta fue fiel, completa y bien citada: una respuesta mala con buena recuperación y una respuesta mala por recuperación fallida exigen soluciones opuestas.
Coste y latencia
El coste en producción lo dominan el tamaño del contexto y la reordenación, no el modelo base. Reduce el contexto, cachea embeddings y respuestas repetidas y usa un modelo pequeño para clasificar y reescribir consultas, reservando el grande para la síntesis. Fija presupuestos por equipo y alerta ante anomalías: un agente en bucle de reintentos puede gastar el presupuesto de un trimestre en una noche.
Camino escalonado a producción
Semanas 1–4: un dominio documental, un grupo de usuarios, solo lectura. Ingesta con fragmentación estructural y metadatos completos, y conjunto de evaluación en pie.
Semanas 5–8: recuperación híbrida, reordenación y filtrado por permisos. Mide y ajusta la recuperación; resiste la tentación de cambiar de modelo.
Semanas 9–12: salvaguardas, interfaz de citas, registro y control de costes. Piloto con usuarios reales midiendo abstenciones y correcciones.
Los sistemas que triunfan no son los del mejor modelo, sino aquellos en los que alguien hizo bien los metadatos.
Preguntas frecuentes
¿Qué es la generación aumentada por recuperación (RAG)?
RAG combina un sistema de recuperación con un modelo de lenguaje: se buscan documentos relevantes en el momento de la consulta y se aportan como contexto, de modo que las respuestas se fundamentan en tu corpus y no en la memoria del modelo. El enfoque se introdujo en la investigación de Lewis y otros en 2020.
¿Por qué fracasan los pilotos de RAG en producción?
Casi siempre por la calidad de la recuperación y por los permisos, no por el modelo. Una fragmentación deficiente, la falta de metadatos, la ausencia de un conjunto de evaluación y la falta de filtrado por permisos producen respuestas seguras, erróneas y a veces no autorizadas.
¿Conviene hacer ajuste fino en lugar de RAG?
Resuelven problemas distintos. RAG aporta hechos que cambian; el ajuste fino moldea estilo, formato y comportamiento. La mayoría de los casos de uso empresariales necesitan RAG primero, y el ajuste fino rara vez arregla un problema de recuperación.
¿Cómo evitamos que un sistema RAG filtre documentos restringidos?
Filtrando por los permisos del usuario que consulta antes de recuperar, no después de generar. Los permisos deben aplicarse en la propia consulta de recuperación, con la identidad propagada de extremo a extremo.
¿Cómo se evalúa un sistema RAG?
Midiendo recuperación y generación por separado: con un conjunto de preguntas juzgadas por personas, se puntúan la exhaustividad y la precisión de los pasajes recuperados y, aparte, la fidelidad, la integridad y la corrección de las citas.