Architecture RAG en entreprise : des réponses d'IA sur lesquelles s'appuyer
Les démonstrations RAG réussissent en une semaine et échouent en production pour la même raison : la qualité de récupération est un problème d'ingénierie de données déguisé en IA.
La génération augmentée par récupération est devenue l'architecture par défaut de l'IA en entreprise, et à juste titre : elle ancre les réponses dans vos documents, se met à jour quand ils changent et montre son raisonnement par des citations. C'est aussi l'architecture qui semble le plus souvent terminée à 80 % et n'atteint jamais la production, car les 20 % restants relèvent d'une ingénierie de données peu spectaculaire.
Le pipeline et le point de rupture de chaque étape
| Étape | Rôle | Défaillance typique |
|---|---|---|
| Ingestion | Extraire le texte des systèmes sources | Tableaux et PDF dégradés ; contenus perdus silencieusement |
| Découpage | Diviser en unités récupérables | Découpes de taille fixe qui brisent le contexte |
| Enrichissement | Attacher métadonnées et droits | Omis, rendant filtrage et citation impossibles |
| Indexation | Stocker vecteurs et index lexical | Vecteurs seuls : les identifiants exacts échouent |
| Récupération | Obtenir les candidats | Top-k sans réordonnancement ni filtre de droits |
| Génération | Répondre à partir du contexte | Aucune consigne d'abstention ; assurance infondée |
| Évaluation | Prouver que cela fonctionne | Absente, remplacée par des opinions |
Le découpage est une décision éditoriale, pas un paramètre
L'amélioration la plus rentable dans presque tout système RAG consiste à mieux découper. Découpez selon la structure du document — titres, sections, clauses, lignes de tableau — et non selon un nombre de caractères. Conservez le chemin des titres dans chaque fragment afin qu'un passage récupéré transporte son propre contexte. Gardez les tableaux intacts et stockez un résumé court à côté des longs fragments pour améliorer la qualité des vecteurs.
Récupérez en hybride, puis réordonnez
La similarité vectorielle seule échoue sur les identifiants exacts, les références de pièces, les codes de politique et la négation. La recherche lexicale seule échoue sur la paraphrase. Exécutez les deux, fusionnez les candidats, puis réordonnez les meilleurs avec un cross-encoder avant de transmettre au modèle une fenêtre de contexte réduite et de haute qualité. Envoyer vingt fragments médiocres est pire qu'en envoyer quatre bons.
Les métadonnées font le gros du travail
Presque toute question métier est implicitement délimitée : cette année, cette région, ce produit, cette version de la politique. Sans métadonnées, cela ne peut s'exprimer, et le système citera volontiers une politique abrogée. Capturez à l'ingestion le système source, le type de document, les dates d'effet, la version, le responsable, la langue et la classification de sensibilité : l'ajouter après coûte cher.
Les droits : la raison pour laquelle les pilotes ne sortent jamais
Un système RAG qui peut tout lire et que tout le monde utilise est une fuite de données dotée d'une interface de discussion. La règle n'est pas négociable : appliquez les droits dans la requête de récupération, avec l'identité de l'utilisateur, avant que quoi que ce soit n'atteigne le modèle. Filtrer après génération n'est pas un contrôle : le contenu a déjà été utilisé.
Des garde-fous qui réduisent réellement le risque
- Ancrage obligatoire. Instruisez le modèle de ne répondre qu'à partir du contexte fourni et d'admettre son ignorance sinon — puis vérifiez qu'il obéit.
- Citations par construction. Chaque affirmation renvoie au fragment qui l'a produite, et le lien ouvre un document consultable par l'utilisateur.
- Seuils d'abstention. Si la confiance de récupération est faible, renvoyez les sources sans réponse synthétisée.
- Défense contre l'injection de prompt. Le contenu récupéré est une entrée non fiable : il ne doit jamais modifier les instructions ni élever les droits. Le Top 10 OWASP pour les applications LLM est la référence pratique.
- Revue humaine dans les domaines régulés avant toute sortie contractuelle ou destinée au client.
L'évaluation, sinon vous livrez une impression
Construisez le banc d'évaluation avant tout réglage. Réunissez 200 questions réelles avec réponses et documents sources validés par des humains. Mesurez séparément si la récupération a trouvé les bons passages et si la réponse était fidèle, complète et correctement citée : une mauvaise réponse issue d'une bonne récupération et une mauvaise réponse issue d'un échec de récupération appellent des correctifs opposés.
Coûts et latence
En production, les coûts sont dominés par la taille du contexte et le réordonnancement, pas par le modèle de base. Réduisez le contexte, mettez en cache les vecteurs et les réponses répétées, et utilisez un petit modèle pour la classification et la réécriture de requêtes en réservant le grand à la synthèse. Fixez des budgets par équipe et alertez sur les anomalies : un agent en boucle de reprise peut consommer un trimestre de budget en une nuit.
Un chemin progressif vers la production
Semaines 1–4 : un domaine documentaire, un groupe d'utilisateurs, lecture seule. Ingestion avec découpage structurel et métadonnées complètes, jeu d'évaluation en place.
Semaines 5–8 : récupération hybride, réordonnancement et filtrage par droits. Mesurez et ajustez la récupération ; résistez à l'envie de changer de modèle.
Semaines 9–12 : garde-fous, interface de citations, journalisation et maîtrise des coûts. Pilote avec de vrais utilisateurs, en suivant les abstentions et les corrections.
Les systèmes qui réussissent ne sont pas ceux dotés du meilleur modèle, mais ceux où quelqu'un a correctement traité les métadonnées.
Questions fréquentes
Qu'est-ce que la génération augmentée par récupération (RAG) ?
Le RAG associe un système de récupération à un modèle de langage : les documents pertinents sont recherchés au moment de la requête et fournis comme contexte, de sorte que les réponses reposent sur votre corpus et non sur la mémoire du modèle. L'approche a été introduite par Lewis et al. en 2020.
Pourquoi les projets pilotes RAG échouent-ils en production ?
Presque toujours à cause de la qualité de récupération et des permissions, pas du modèle. Un découpage médiocre, l'absence de métadonnées, l'absence de jeu d'évaluation et le défaut de filtrage par droits produisent des réponses assurées, fausses, et parfois non autorisées.
Faut-il faire du fine-tuning plutôt que du RAG ?
Ils règlent des problèmes différents. Le RAG apporte des faits qui changent ; le fine-tuning façonne le style, le format et le comportement. La plupart des cas d'usage en entreprise exigent d'abord du RAG, et le fine-tuning ne corrige presque jamais un défaut de récupération.
Comment empêcher un système RAG de divulguer des documents restreints ?
En filtrant selon les droits de l'utilisateur avant la récupération, et non après la génération. Les permissions doivent s'appliquer dans la requête de récupération elle-même, avec propagation de l'identité de bout en bout.
Comment évaluer un système RAG ?
En mesurant séparément récupération et génération : avec un jeu de questions évalué par des humains, on note le rappel et la précision des passages récupérés, puis la fidélité, l'exhaustivité et l'exactitude des citations.