🔧 Skills · Page 2/2
Le RAG expliqué
Retrieval-Augmented Generation — comment donner à un agent accès à votre base de connaissance sans le ré-entraîner
Pourquoi le RAG ?
Un LLM sait ce qu'il a appris pendant son entraînement — mais il ne connaît pas
votre documentation interne, vos contrats, votre historique client, ni les actualités d'hier.
Deux solutions existent. Le fine-tuning (ré-entraîner le modèle sur vos données) est
coûteux, lent, et peu adapté aux données qui changent souvent. Le RAG est plus flexible :
la base de connaissance reste externe, mise à jour facilement, et le modèle n'y touche pas.
❌ Sans RAG
« Quelle est notre politique de remboursement ? » → Le LLM invente une réponse générique ou dit qu'il ne sait pas.
✅ Avec RAG
« Quelle est notre politique de remboursement ? » → L'agent cherche dans votre PDF interne et cite la bonne clause.
Comment ça fonctionne ?
Le RAG se déroule en deux phases : une phase d'indexation (préparation des données)
et une phase de récupération (au moment de chaque question).
Phase 1 — Indexation (une seule fois)
Chunking
Découper les documents en morceaux
Chaque document (PDF, page web, article) est découpé en chunks de taille fixe — typiquement 200 à 500 mots. Chaque chunk sera indexé séparément.
Embedding
Convertir chaque chunk en vecteur numérique
Un modèle d'embedding transforme chaque chunk en une liste de nombres (un vecteur) qui représente son sens sémantique. Deux chunks au sens proche auront des vecteurs proches.
Stockage
Stocker dans une base vectorielle
Les vecteurs sont stockés dans une base de données spécialisée (Pinecone, Chroma, pgvector…) qui permet des recherches par similarité très rapides.
Phase 2 — Récupération (à chaque question)
Question
La question est elle aussi vectorisée
La question de l'utilisateur est transformée en vecteur avec le même modèle d'embedding.
Recherche
Les N chunks les plus similaires sont récupérés
La base vectorielle trouve les chunks dont le vecteur est le plus proche de la question (recherche par similarité cosinus). Typiquement 3 à 10 chunks.
Génération
Le LLM répond avec le contexte enrichi
Les chunks récupérés sont injectés dans le prompt : « Réponds à cette question en te basant sur les extraits suivants : [chunks] ». Le LLM génère une réponse ancrée dans les vrais documents.
Les limites du RAG
Qualité du chunking : si les documents sont mal découpés (trop courts, coupant une phrase importante en deux), la récupération sera mauvaise.
Questions multi-documents : le RAG est efficace pour des questions factuelles précises, moins pour des synthèses qui nécessitent de lire 50 documents entiers.
Données non textuelles : tableaux complexes, images, code — l'embedding textuel ne capture pas toujours bien le sens de ces contenus.
✅ Le RAG en pratique
Le RAG est aujourd'hui la technique standard pour créer des
chatbots d'entreprise
qui répondent avec précision sur une base documentaire interne : FAQ, documentation produit,
contrats, base de connaissance support… sans jamais exposer les données au modèle d'entraînement.