Des nouvelles ont été ajoutées en tête de listes.
Remontez pour les voir.
Inscription à la newsletter
NanoVDR : un modèle texte uniquement de 70 M qui récupère des documents visuels ainsi qu'un VLM 2B
HuggingFace -
22/03
Un article de blog de Zhuchenyang Liu sur Hugging Face
Retour aux articles
NanoVDR : un modèle texte uniquement de 70 M qui récupère des documents visuels ainsi qu'un VLM 2B
Article communautaire publié le 16 mars 2026
Article : NanoVDR : Distillation d'un outil de récupération de langage de vision 2B dans un encodeur de texte uniquement de 70 M pour la récupération de documents visuels
Et si la meilleure façon de chercher dans des documents visuels... était de ne pas les regarder du tout ?
La récupération visuelle de documents (VDR) a récemment fait des progrès impressionnants. Des modèles tels que ColPali (3B), DSE-Qwen2 (2B) et Tomoro-8B (8B) peuvent effectuer des recherches dans des images de documents (PDF, rapports financiers, articles scientifiques) à l'aide de requêtes en langage naturel. Mais il y a un hic : ces modèles utilisent le même modèle Vision-Language (VLM) de plusieurs milliards de paramètres pour coder à la fois les documents et les requêtes. Cela signifie même une simple requête textuelle telle que « Quel était le chiffre d'affaires du troisième trimestre ? » doit passer par un paramètre VLM 2–8B. Sur un seul thread CPU, cela représente 2,5 à 8 secondes par requête.
Nous nous sommes demandé : une requête textuelle a-t-elle vraiment besoin d’un modèle de vision ?
L'idée clé : les requêtes n'ont pas d'yeux
Voici l'asymétrie fondamentale que nous exploitons : les documents sont visuels, mais les requêtes ne sont que du texte.
Une page de document peut contenir des graphiques, des tableaux, des diagrammes, des équations, des mises en page multi-colonnes ; elle a véritablement besoin d'un modèle de vision puissant pour être comprise. Mais la question ? C'est une courte chaîne de texte. Il n'y a aucune information visuelle dans « Montrez-moi la répartition des revenus par segment ». Alors pourquoi l’appliquons-nous à un modèle de vision à 2 milliards de paramètres ?
NanoVDR prend cette asymétrie au sérieux. Nous conservons le lourd professeur VLM (Qwen3-VL-Embedding-2B) pour l'indexation de documents hors ligne : il s'exécute une fois par document, sur un GPU, et nous stockons les résultats. Mais pour le codage des requêtes en ligne, nous distillons les c... [Courte citation de 8% de l'article original]
Loading...
🍪
Le modèle économique de notre site repose sur l'affichage de publicités personnalisées basées sur l'utilisation de cookies publicitaires. En continuant votre visite sur notre site, vous consentez à l'utilisation de ces cookies.
Politique de confidentialité