Félicitations à Docling, qui figure parmi les meilleurs référentiels GitHub du mois !
Les entreprises disposent d'une grande quantité de données : propriété intellectuelle et savoir-faire, données marketing, commerciales et client, politiques et procédures d'exploitation, etc. Le défi n'est donc pas de recueillir des données ni de générer des documents, mais d'en extraire des informations utiles qui pourront être exploitées pour notamment améliorer le service clientèle, accélérer le délai de rentabilisation et fluidifier l'exploitation. L'IA générative promet d'aider à relever ce défi, en transformant ces énormes quantités de données d'entreprise en informations stratégiques.
L'IA générative ne peut toutefois pas tenir cette promesse tant que les données sont stockées dans des formats que les grands modèles de langage (LLM) ne peuvent pas exploiter, comme le format PDF ou les formats de documents propriétaires tel que docx. Cet obstacle peut empêcher l'alignement du modèle sur les besoins de l'entreprise. Pour éliminer ce problème, il faut prétraiter les documents existants de façon à pouvoir les utiliser pour les pipelines de réglage fin ou la génération augmentée de récupération (RAG).
Ici, la simple reconnaissance optique des caractères (OCR) ou l'extraction de texte ne suffisent pas. Pour effectuer ce prétraitement, il faut extraire les données avec des techniques qui prennent en compte le contexte et les différents éléments. Par exemple, si un tableau s'étend sur plusieurs pages, il doit être extrait sous la forme d'un tableau unique. Si le document présente plusieurs colonnes de texte par page ou s'il contient des images et des tableaux, chaque élément doit être extrait de manière cohérente en préservant son contexte.
Au fil des années, divers outils Open Source ont été développés pour répondre à ces besoins, mais aucun ne couvre tous les aspects du problème. Cette approche fragmentée a contraint les entreprises à utiliser des pipelines complexes, à lier des outils disparates et à traiter les mêmes documents plusieurs fois à l'aide d'outils différents. Les solutions créées sont incohérentes, coûteuses et complexes à gérer, et la qualité de leurs résultats varie.
Nous avons rencontré les mêmes défis lorsque nous avons souhaité créer des pipelines d'ingestion de documents pour le réglage fin des modèles avec InstructLab. C'est à ce moment-là que nous avons découvert et adopté Docling, un projet développé par IBM Research, qui nous a permis de transformer efficacement notre workflow. Depuis son lancement en tant que projet Open Source à l'automne 2024, Docling est devenu un outil majeur dans le domaine du TLN, ce qui nous a conforté dans le choix que nous avions fait. Nous sommes ravis d'observer son influence croissante dans l'écosystème de l'IA générative Open Source.
Docling en quelques mots
Docling est un projet Open Source en amont et un outil qui permet d'analyser des documents dans divers formats (.pdf, .docx, .pptx, html, etc.), puis de les convertir vers des formats tels que Markdown ou JSON, afin de faciliter la préparation des contenus pour les applications d'IA générative. Il prend en charge l'OCR pour la conversion en PDF des documents numérisés, et s'utilise avec des outils comme LlamaIndex et LangChain pour la RAG et les tâches de questions-réponses.
Source : https://github.com/DS4SD/docling?tab=readme-ov-file
Essayez Docling
Installez simplement Docling à partir de votre gestionnaire de paquets, comme pip :
# pip install docling
Une fois l'outil installé, vous pouvez convertir des documents de manière programmatique dans votre module Python ou utiliser l'interface en ligne de commande de Docling.
from docling.document_converter import DocumentConverter source = "https://arxiv.org/pdf/2408.09869" # PDF path or URL converter = DocumentConverter() result = converter.convert(source) print(result.document.export_to_markdown()) # output: "### Docling Technical Report[...]" # docling https://arxiv.org/pdf/2206.01062Vous trouverez d'autres détails et façons de configurer la conversion de données dans le référentiel du projet.
Utilisation actuelle de Docling
La communauté InstructLab utilise déjà Docling pour permettre aux utilisateurs de soumettre des ensembles de données publics à la taxonomie du projet. Les utilisateurs peuvent se rendre sur https://ui.instructlab.ai/ et envoyer leurs ensembles de données en vue de leur inclusion dans les prochaines versions du modèle communautaire Open Source granite-lab d'InstructLab. Ce modèle se base sur le modèle de fondation Open Source Granite-7b, qui a été personnalisé avec InstructLab afin de l'enrichir des nouvelles connaissances et compétences qui ont été proposées par les membres de la communauté. La prochaine version de granite-lab utilise le modèle de fondation Open Source Granite-3.0-8b et est également personnalisée avec InstructLab. Ce service utilise Docling pour convertir les documents des utilisateurs en données au format requis pour la taxonomie d'InstructLab, ce qui simplifie le processus de contribution. Ces mêmes outils peuvent également être utilisés pour personnaliser les instances du modèle privé d'un utilisateur.
Red Hat et Docling
Nous avons lancé Red Hat Enterprise Linux AI (RHEL AI) et InstructLab plus tôt cette année pour proposer ces mêmes fonctionnalités aux entreprises. RHEL AI est une plateforme de modèles de fondation pour les entreprises, qui intègre des capacités d'IA générative Open Source et est optimisée pour un déploiement dans des environnements de cloud hybride. Cette plateforme associe les LLM Open Source Granite d'IBM et les outils InstructLab de Red Hat pour permettre aux spécialistes d'un domaine (et pas seulement aux data scientists) de procéder au réglage fin des modèles avec des connaissances propres à un secteur afin de les adapter aux besoins et données uniques de l'entreprise. Ces modèles peuvent ensuite être déployés et gérés dans un environnement de cloud hybride qui s'étend des datacenters de l'entreprise aux clouds publics et aux sites d'edge computing.
Nous avons soutenu IBM Research dans sa décision de proposer Docling sous forme de projet Open Source ainsi que son engagement continu en matière d'innovation dans ce domaine, visant à rendre l'IA générative plus accessible et réalisable. Dans les prochaines versions de RHEL AI, nous prévoyons d'inclure Docling sous forme de fonction prise en charge. Cette nouveauté offrira aux utilisateurs un moyen plus simple d'ingérer leurs données d'entreprise privées, stockées dans divers formats. Ils pourront ensuite les exploiter dans les processus de génération de données synthétiques d'InstructLab ainsi que d'entraînement dans RHEL AI, pour personnaliser et ajuster leurs propres instances de modèles.
Docling apporte à la communauté Open Source divers avantages et innovations que nous avons hâte de proposer aux utilisateurs de RHEL AI. La vitesse à laquelle les projets Open Source rendent l'IA générative plus accessible est tout simplement incroyable. Nous sommes ravis de soutenir ces communautés en amont et de proposer ces innovations à nos clients sous forme de fonctionnalités adaptées aux entreprises.
Regardez cette vidéo pour en savoir plus
Essai de produit
Red Hat Enterprise Linux AI | Essai de produit
À propos de l'auteur
William is a Product Manager in Red Hat's AI Business Unit and is a seasoned professional and inventor at the forefront of artificial intelligence. With expertise spanning high-performance computing, enterprise platforms, data science, and machine learning, William has a track record of introducing cutting-edge technologies across diverse markets. He now leverages this comprehensive background to drive innovative solutions in generative AI, addressing complex customer challenges in this emerging field. Beyond his professional role, William volunteers as a mentor to social entrepreneurs, guiding them in developing responsible AI-enabled products and services. He is also an active participant in the Cloud Native Computing Foundation (CNCF) community, contributing to the advancement of cloud native technologies.
Plus de résultats similaires
Les menaces liées à l'IA évoluent. Vos défenses doivent en faire autant.
Le point de bascule de l'IA : pourquoi la souveraineté n'est plus facultative
Standardizing the AI stack with PyTorch
Technically Speaking | Defining sovereign AI with open source
Parcourir par canal
Automatisation
Les dernières nouveautés en matière d'automatisation informatique pour les technologies, les équipes et les environnements
Intelligence artificielle
Actualité sur les plateformes qui permettent aux clients d'exécuter des charges de travail d'IA sur tout type d'environnement
Cloud hybride ouvert
Découvrez comment créer un avenir flexible grâce au cloud hybride
Sécurité
Les dernières actualités sur la façon dont nous réduisons les risques dans tous les environnements et technologies
Edge computing
Actualité sur les plateformes qui simplifient les opérations en périphérie
Infrastructure
Les dernières nouveautés sur la plateforme Linux d'entreprise leader au monde
Applications
À l’intérieur de nos solutions aux défis d’application les plus difficiles
Virtualisation
L'avenir de la virtualisation d'entreprise pour vos charges de travail sur site ou sur le cloud