Construire une revue tabulaire de style Harvey à partir de zéro, mais en mieux

HuggingFace - 09/04
Un article de blog d'Isaacus sur Hugging Face
Retour aux articles

Construire une revue tabulaire de style Harvey à partir de zéro, mais en mieux

Article communautaire publié le 9 avril 2026

tl;dr

Ce guide vous guide étape par étape dans la création d'une application de révision tabulaire de pointe en quelques minutes.

Le résultat final, présenté ci-dessous, offrira des fonctionnalités plus avancées que les propres outils d’examen tabulaire de Harvey et Legora, à une fraction du coût, tout en obtenant une plus grande précision, une latence plus faible et en garantissant l’absence d’hallucinations génératives.

Chaque classification, extraction et annotation sera directement fondée sur le texte des documents. Les backlinks et les panneaux permettront la navigation à travers et entre les structures de documents et les entités structurées.

Tout cela sera réalisé sans utiliser un seul modèle génératif, qui serait lent, coûteux et sujet aux hallucinations. Au lieu de cela, nous nous appuierons sur les modèles juridiques spécialisés d’enrichissement, d’intégration et d’extraction de pointe d’Isaacus.

Ce guide est open source et peut être utilisé, adapté, étendu et même commercialisé gratuitement. Vous pouvez suivre en reproduisant le code ici ou en clonant le livre de recettes Isaacus correspondant pour ce guide.

Introduction

Depuis des décennies, les tableaux font partie intégrante des flux de travail de révision juridique, permettant aux avocats de comparer les termes clés de plusieurs documents à la fois.

Avec l’avènement de modèles linguistiques avancés, il est désormais devenu possible d’automatiser l’un des éléments les plus chronophages de l’analyse juridique tabulaire : la transformation de documents non structurés en étiquettes et entités structurées.

Des sociétés de technologie juridique telles que Harvey, Legora et Clio ont commencé à publier leurs propres applications de révision tabulaire alimentées par l'IA pour faire exactement cela.

Ces applications finissent souvent par s’appuyer sur des modèles génératifs qui, bien que pratiques dans leur flexibilité, sont lents, inefficaces sur le plan informatique et sujets aux hallucinations.

Quel que soit le degré d’avancement d’un modèle génératif, il existe toujours une possibilité qu’il génère une extraction qui n’est pas contenue dans le texte à partir duquel il est censé extraire. Heureusement, il existe une meilleure façon de procéder à un examen tabulaire.

Au lieu d'amorcer des modèles génératifs pour une tâche pour laquelle ils n'ont jamais été formés, vous pouvez utiliser des modèles spécialisés d'enrichissement, d'extraction et de classification qui annotent directement les documents au niveau du jeton, offrant ainsi des scores de confiance statistiquement informatifs pour chaque annotation.

C’est l’approche que nous adoptons dans ce guide. Comme vous le verrez, l’utilisation de modèles adaptés finit par donner un produit final supérieur dans toutes les dimensions à ses concurrents basés sur la génération, de la précision et de l’efficacité jusqu’à la richesse et l’immersion de son interface.

Installation

Pour commencer, assurez-vous d'avoir un compte Isaacus et une clé API valide. Vous pouvez obtenir une clé API en suivant la première étape de notre guide de démarrage rapide API. Après avoir obtenu une clé API, définissez votreISAACUS_API_KEYvariable d'environnement à votre clé. Vous pouvez le faire en créant un.envfichier dans le même répertoire que votre code, puis chargez-le avecload_dotenv().

Installons et importons maintenant nos dépendances et configurons nos variables d'environnement et nos clients.

# Installer les dépendances. %pip install -q fastapi uvicorn isaacus qdrant-client dotenv httpx # Charger les dépendances. importer os importer json importer uuid importer threading à partir de la saisie importer Toute importation httpx importer uvicorn depuis dotenv importer load_dotenv depuis fastapi importer Body, FastAPI, HTTPException, BackgroundTasks depuis isaacus importer Isaacus depuis qdrant_client importer des modèles, QdrantClient depuis fastapi.responses importer HTMLResponse, PlainTextResponse depuis isaacus.types.ilgs.v1.document importer Document # Initialiser un client API Isaacus. load_dotenv() # Charge les variables d'environnement à partir des fichiers .env s'il y en a. isaacus_client = Isaacus(api_key=os.getenv("ISAACUS_API_KEY")) # Initialisez une application FastAPI. app = FastAPI(title="Isaacus Tabular Review Demo Server") app_state = {"docs": {}, "doc_order": []} app_lock = threading.RLock() # Initialisez notre magasin de vecteurs en mémoire Qdrant. vector_db = QdrantClient(":memory:", force_disable_check_same_thread=True)

Enrichissement

Normalement, créer quelque chose comme un graphe de connaissances nécessit...
[Courte citation de 8% de l'article original]

Loading...