Créez un modèle d'intégration spécifique à un domaine en moins d'une journée

HuggingFace - 21/03
Un article de blog de NVIDIA sur Hugging Face
Retour aux articles

Créez un modèle d'intégration spécifique à un domaine en moins d'une journée

Entreprise + Article publié le 20 mars 2026
Si vous construisez un système RAG (Retrieval-Augmented Generation), vous vous êtes probablement heurté à ce mur : tout fonctionne… jusqu'à ce que ce ne soit plus le cas. Les modèles d'intégration à usage général sont formés pour comprendre Internet ; pas vos contrats, journaux de fabrication, formulations chimiques exclusives ou taxonomie interne. Ils capturent une large similarité sémantique, mais ils ne comprennent pas les distinctions fines qui comptent dans votre domaine. Le réglage fin d'un modèle d'intégration peut améliorer les performances de votre pipeline de récupération lorsque les modèles disponibles dans le commerce ne parviennent pas à capturer efficacement les nuances spécifiques au domaine. Malgré l’importance cruciale des intégrations pour les performances de RAG, le processus reste étonnamment fragmenté, les compétences requises sont spécialisées et l’investissement en temps est intimidant.

Avec un seul GPU et moins d'une journée de formation, vous pouvez transformer un modèle d'intégration à usage général en un modèle qui comprend réellement votre domaine, sans aucun étiquetage manuel requis. Pour vous aider à démarrer, nous publions également un ensemble de données de formation synthétique prêt à l'emploi généré à partir de la documentation publique de NVIDIA en utilisant ce pipeline précis. En utilisant ces données et la recette, nous avons constaté une amélioration de plus de 10 % dans Recall@10 et NDCG@10. Atlassian a appliqué cette recette pour affiner son ensemble de données JIRA, augmentant Recall@60 de 0,751 à 0,951, soit une amélioration de 26 % - sur un seul GPU.

🔗Liens rapides vers l'ensemble de données et les codes :

  1. Modèle d'intégration
  2. GitHub
  3. Ensemble de données synthétiques sur les documents publics de NVIDIA

🧑‍💻La recette des projets Open Source intègre :

  1. NeMo Data Designer pour la génération de données synthétiques
  2. NeMo Automodel pour l'intégration de la formation de modèles
  3. BEIR pour l'évaluation de la recherche d'informations
  4. NeMo Export-Deploy pour la conversion ONNX/TensorRT
  5. NVIDIA NIM pour le service d'inférence de production

📋Prérequis :

  • Un répertoire de documents de domaine (fichiers texte - .txt, .md ou similaire)
  • Une clé API NVIDIA valide (gratuite sur build.nvidia.com)
  • GPU NVIDIA Ampere ou plus récent avec au moins 80 Go de mémoire (avec capacité de calcul >= 8.0)
    • Ce tutoriel a été testé sur 1xA100 (80 Go) et 1xH100 (80 Go)

À la fin de cet article, vous saurez comment répondre :📄 Générez des données d'entraînement à partir de documents de domaine sans données étiquetées🎯 Utilisez l'exploration négative dure pour un entraînement contrastif efficace🔗 Améliorez la qualité d'intégration avec des requêtes multi-sauts⚙️ Affinez un modèle d'intégration bi-encodeur📊 Évaluez si le réglage fin améliore la récupération🚀 Déployez le modèle affiné dans votre pipeline

⚙️Configuration

Dans ce didacticiel, nous allons affiner le modèle de base Llama-Nemotron-Embed-1B-v2, un modèle d'intégration de 1 milliard de paramètres qui équilibre la qualité et le coût d'inférence. Pour commencer, suivez ce guide de configuration.

📚 Étape 1 : Générer des données de formation à partir de documents

Le réglage fin d'un modèle d'intégration nécessite des milliers de paires (requête, document pertinent). La plupart des cas d’utilisation ne disposent pas de ces données facilement disponibles. La création manuelle est coûteuse, lente et souvent biaisée par l'interprétation personnelle de l'annotateur de ce qui est « pertinent ». Au lieu d'étiqueter les données à la main, vous pouvez utiliser...
[Courte citation de 8% de l'article original]

Loading...