Back to Insights
AI & Automation

Arquitectura RAG empresarial: respuestas de IA en las que se puede confiar

14 min read

Las demos de RAG funcionan en una semana y fracasan en producción por lo mismo: la calidad de la recuperación es un problema de ingeniería de datos disfrazado de IA.

La generación aumentada por recuperación se ha convertido en la arquitectura por defecto de la IA empresarial, y con razón: fundamenta las respuestas en tus documentos, se actualiza cuando ellos se actualizan y muestra su trabajo mediante citas. También es la arquitectura que con más frecuencia parece terminada al 80 % y nunca llega a producción, porque el 20 % restante es ingeniería de datos poco lucida.

El proceso y dónde se rompe cada etapa

EtapaFunciónFallo habitual
IngestaExtraer texto de los sistemas de origenTablas y PDF mal procesados; contenido descartado en silencio
FragmentaciónDividir documentos en unidades recuperablesCortes de tamaño fijo que rompen el contexto
EnriquecimientoAñadir metadatos y permisosSe omite, impidiendo filtrar y citar
IndexaciónGuardar vectores e índice léxicoSolo vectores: fallan los identificadores exactos
RecuperaciónObtener candidatosTop-k sin reordenación ni filtro de permisos
GeneraciónResponder con el contexto aportadoSin instrucción de abstención; confianza inventada
EvaluaciónDemostrar que funcionaInexistente, sustituida por opiniones

La fragmentación es una decisión de contenido, no un parámetro

La mejora de mayor impacto en casi todos los sistemas RAG es fragmentar mejor. Divide según la estructura del documento —encabezados, secciones, cláusulas, filas de tabla— y no por número de caracteres. Conserva la ruta de encabezados dentro de cada fragmento para que el pasaje recuperado lleve su propio contexto. Mantén las tablas íntegras y guarda un resumen breve junto a los fragmentos largos para mejorar la calidad del embedding.

Recupera en híbrido y luego reordena

La similitud vectorial por sí sola falla con identificadores exactos, referencias de pieza, códigos de política y negaciones. La búsqueda léxica por sí sola falla con las paráfrasis. Ejecuta ambas, fusiona los candidatos y reordena los mejores con un cross-encoder antes de pasar una ventana de contexto pequeña y de alta calidad al modelo. Enviar veinte fragmentos mediocres es peor que enviar cuatro buenos.

Los metadatos hacen el trabajo pesado

Casi toda pregunta empresarial está implícitamente delimitada: este año, esta región, este producto, esta versión de la política. Sin metadatos no puedes expresarlo y el sistema citará encantado una política derogada. Captura sistema de origen, tipo de documento, fechas de vigencia, versión, responsable, idioma y clasificación de sensibilidad en la ingesta: añadirlo después es caro.

Permisos: el motivo por el que los pilotos no se lanzan

Un sistema RAG que puede leerlo todo y lo usa todo el mundo es una brecha de datos con interfaz de chat. La regla no es negociable: aplica los permisos dentro de la consulta de recuperación, con la identidad del usuario, antes de que nada llegue al modelo. Filtrar después de generar no es un control: el contenido ya se ha usado.

Salvaguardas que reducen el daño de forma medible

  • Fundamentación obligatoria. Instruye al modelo para responder solo con el contexto aportado y para admitir que no lo sabe; después comprueba que cumple.
  • Citas por construcción. Cada afirmación enlaza al fragmento que la produjo y el enlace abre un documento que el usuario puede ver.
  • Umbrales de abstención. Si la confianza de recuperación es baja, devuelve fuentes sin respuesta sintetizada.
  • Defensa ante inyección de prompts. El contenido recuperado es entrada no confiable: nunca debe alterar instrucciones ni elevar permisos. El OWASP Top 10 para aplicaciones LLM es la referencia práctica.
  • Revisión humana en dominios regulados antes de cualquier salida contractual o de cara al cliente.

Evaluación, o estás enviando una intuición

Construye el arnés de evaluación antes de ajustar nada. Reúne 200 preguntas reales con respuestas y documentos fuente juzgados por personas. Mide por separado si la recuperación encontró los pasajes correctos y si la respuesta fue fiel, completa y bien citada: una respuesta mala con buena recuperación y una respuesta mala por recuperación fallida exigen soluciones opuestas.

Coste y latencia

El coste en producción lo dominan el tamaño del contexto y la reordenación, no el modelo base. Reduce el contexto, cachea embeddings y respuestas repetidas y usa un modelo pequeño para clasificar y reescribir consultas, reservando el grande para la síntesis. Fija presupuestos por equipo y alerta ante anomalías: un agente en bucle de reintentos puede gastar el presupuesto de un trimestre en una noche.

Camino escalonado a producción

Semanas 1–4: un dominio documental, un grupo de usuarios, solo lectura. Ingesta con fragmentación estructural y metadatos completos, y conjunto de evaluación en pie.

Semanas 5–8: recuperación híbrida, reordenación y filtrado por permisos. Mide y ajusta la recuperación; resiste la tentación de cambiar de modelo.

Semanas 9–12: salvaguardas, interfaz de citas, registro y control de costes. Piloto con usuarios reales midiendo abstenciones y correcciones.

Los sistemas que triunfan no son los del mejor modelo, sino aquellos en los que alguien hizo bien los metadatos.

Preguntas frecuentes

¿Qué es la generación aumentada por recuperación (RAG)?

RAG combina un sistema de recuperación con un modelo de lenguaje: se buscan documentos relevantes en el momento de la consulta y se aportan como contexto, de modo que las respuestas se fundamentan en tu corpus y no en la memoria del modelo. El enfoque se introdujo en la investigación de Lewis y otros en 2020.

¿Por qué fracasan los pilotos de RAG en producción?

Casi siempre por la calidad de la recuperación y por los permisos, no por el modelo. Una fragmentación deficiente, la falta de metadatos, la ausencia de un conjunto de evaluación y la falta de filtrado por permisos producen respuestas seguras, erróneas y a veces no autorizadas.

¿Conviene hacer ajuste fino en lugar de RAG?

Resuelven problemas distintos. RAG aporta hechos que cambian; el ajuste fino moldea estilo, formato y comportamiento. La mayoría de los casos de uso empresariales necesitan RAG primero, y el ajuste fino rara vez arregla un problema de recuperación.

¿Cómo evitamos que un sistema RAG filtre documentos restringidos?

Filtrando por los permisos del usuario que consulta antes de recuperar, no después de generar. Los permisos deben aplicarse en la propia consulta de recuperación, con la identidad propagada de extremo a extremo.

¿Cómo se evalúa un sistema RAG?

Midiendo recuperación y generación por separado: con un conjunto de preguntas juzgadas por personas, se puntúan la exhaustividad y la precisión de los pasajes recuperados y, aparte, la fidelidad, la integridad y la corrección de las citas.

Fuentes y lecturas recomendadas

  1. Lewis y otros — Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks
  2. OWASP Top 10 para aplicaciones de modelos de lenguaje
  3. NIST — AI Risk Management Framework
  4. Karpukhin y otros — Dense Passage Retrieval

Tagged With:

RAG
IA
búsqueda vectorial
gobernanza

Ready to Transform Your Digital Experience?

Let's discuss how Kinematic Digital can help you achieve your business goals.