Des nouvelles ont été ajoutées en tête de listes.
Remontez pour les voir.
Inscription à la newsletter
Ingénierie des données natives IA : des pipelines ETL au service de données agent
DEV -
13/06
TL;DR Les pipelines ETL découplés traditionnels (comme la "Modern Data Stack") sont trop fragiles...
TL;DR
Les pipelines ETL découplés traditionnels (comme la « Modern Data Stack ») sont trop fragiles et complexes pour gérer les données imprévisibles et fortement imbriquées générées par les fonctionnalités d'IA et LLM.
Le service de données agent résout ce problème en se concentrant sur le routage dynamique des requêtes et la découverte sémantique, permettant aux agents d'IA de découvrir et d'interroger les données de manière autonome à l'aide d'outils résistants aux schémas et d'une logique métier codifiée.
Vous pouvez créer une pile de données agentiques en associant le stockage S3 à la gestion JSON native de DuckDB et à la lecture Parquet indépendante du schéma (union_by_name = vrai), éliminant les étapes d'analyse sujettes aux échecs.
Le Model Context Protocol (MCP) ouvert remplace les outils LangChain personnalisés et piratés en fournissant une interface standard permettant aux agents de découvrir des schémas et d'exécuter des requêtes en toute sécurité.
Le protocole MCP (Model Context Protocol) ouvert et l'architecture intégrable de DuckDB permettent de connecter facilement des agents directement à vos données avec une surcharge d'infrastructure minimale et un calcul élastique basé sur la consommation.
Pendant des années, des tâches ETL interrompues ont alimenté mon téléavertisseur et mon café du matin.
Je suis ingénieur du personnel et, comme beaucoup d'entre vous, j'ai passé une partie ridicule de ma carrière à garder des pipelines de données. C’est un travail ingrat qui ressemble souvent à réparer des trous dans un navire en perdition. Vous n'êtes pas seul dans ce cas. Une enquête Forbes montre que les équipes chargées des données passent notoirement jusqu'à 80 % de leur temps à déplacer et à nettoyer les données au lieu d'effectuer le travail intéressant d'analyse. Et l’ampleur financière de ce goulot d’étranglement est stupéfiante : le marché des ETL devrait atteindre 20,1 milliards de dollars d’ici 2032, avec un TCAC de 13 %. Cela prouve qu’un capital industriel massif est investi pour résoudre ces goulots d’étranglement dans les pipelines, mais investir plus d’argent dans la même vieille architecture n’allait pas me sauver la vie.
Cette lutte constante contre les incendies était frustrante, mais gérable. Puis est venu le nouveau mandat : construire la base de données pour nos fonctionnalités de produits de nouvelle génération basées sur l'IA et le LLM. L’imprévisibilité des requêtes et la complexité des données, imbriquées partout en JSON, ont été la goutte d’eau qui a fait déborder le vase. Nos pipelines fragiles et codés à la main n’avaient aucune chance.
Nous avons dû jeter le vieux manuel de jeu. C'est l'histoire de ce voyage : les impasses, les débats architecturaux et la pile étonnamment simple et résiliente que nous avons construite. Voici comment nous sommes passés d’un ETL fragile à une plateforme de données véritablement agentique, où les agents d’IA peuvent interroger les données directement et en toute sécurité.
Les limites des pipelines ETL traditionnels
Vous connaissez la douleur. Vous recevez une alerte à 2 heures du matin en raison d'une panne de pipeline. Après une heure de recherche, vous trouvez la cause première : une équipe à mi-chemin de l'entreprise a ajouté une seule colonne d'apparence inoffensive à une réponse API. Ce petit changement de schéma en amont a provoqué une cascade de pannes, empoisonnant les tableaux de bord et érodant la confiance de vos partenaires commerciaux dans vos données.
Ces pipelines fragiles et étroitement couplés constituent une source massive de dette technique. Mais le problème s'est en réalité aggravé lorsque nous avons adopté ce que l'on appelle la « pile de données moderne ».
Nous avons dissocié l'ingestion de la transformation, en utilisant un outil pour extraire et charger les données dans l'entrepôt et un autre pour les transformer. C’était comme acheter un système stéréo audiophile haut de gamme. Vous achetez un préampli, un ampli de puissance, un DAC et des haut-parleurs séparés. Cela semble incroyable, mais tout à coup, ... [Courte citation de 8% de l'article original]
Loading...
🍪
Le modèle économique de notre site repose sur l'affichage de publicités personnalisées basées sur l'utilisation de cookies publicitaires. En continuant votre visite sur notre site, vous consentez à l'utilisation de ces cookies.
Politique de confidentialité