Docling, qu'est-ce que c'est ?

Copier l'URL

Le projet Open Source Docling propose un outil qui convertit les documents en données structurées que les grands modèles de langage (LLM) peuvent exploiter. 

La plupart des données d'entreprise sont stockées dans des formats de fichiers que les systèmes d'IA ont du mal à lire et à exploiter. Pour intégrer ces documents à des workflows tels que la génération augmentée de récupération (RAG), le réglage fin ou l'IA agentique, les données doivent être converties vers un autre format tel que Markdown, du texte brut ou JSON.

Docling est un outil de traitement de documents pour l'IA générative. Il permet d'adapter les formats standards aux exigences du traitement machine. 

Découvrir Red Hat AI

Vidéo YouTube : How Docling turns documents into usable AI data (durée : 12 min 22 s)

Grâce à Docling, l'IA peut utiliser des documents PDF, des présentations, des feuilles de calcul, ou encore des fichiers audio et vidéo pour améliorer la précision et la transparence de ses résultats. Cet outil ne se contente pas d'extraire du texte : il comprend la mise en page, la hiérarchie des titres et les éléments complexes, comme les tableaux sur plusieurs pages, les images, les listes à puces et les en-têtes. 

La capacité de Docling à transformer des fichiers simplifie la préparation des données. Les documents hétérogènes et désorganisés sont convertis en données propres et structurées, prêtes à être intégrées aux pipelines de connaissances destinés aux LLM. La qualité des résultats ne dépend plus de celle des données d'entrée, car des algorithmes d'apprentissage profond permettent de conserver la structure des informations. 

Docling convertit notamment les fichiers PDF (Portable Document Format), DOCX (documents Microsoft Word), XLXS (feuilles de calcul Excel), PPTX (présentations PowerPoint) et HTML vers un format plus adapté à l'IA.

En savoir plus sur les capacités de traitement des documents de Docling

Génération augmentée de récupération

Pour être précis, un système de RAG doit avoir accès aux données ainsi qu'au contexte dans lequel elles s'inscrivent. Avant le lancement de Docling, il était difficile d'extraire des données d'un document sans en bouleverser la mise en page : les colonnes et les lignes pouvaient être mélangées, ou des notes de bas de page étaient séparées de leur paragraphe. Docling préserve la structure des documents, ce qui réduit les hallucinations et favorise la pertinence des systèmes de RAG. 

Réglage fin

Le réglage fin nécessite des extraits de texte propres dans un format cohérent. Les numéros de page désordonnés, les en-têtes répétitifs et les retours chariot incorrects peuvent perturber l'ingestion des données et corrompre le résultat. Docling agit comme un moteur automatisé de nettoyage des données : il élimine le bruit visuel pour créer des données propres et organisées que le modèle pourra ingérer. 

En savoir plus sur la RAG et le réglage fin

Protocole MCP

Le protocole MCP (Model Context Protocol) est un protocole Open Source qui permet une connexion bidirectionnelle et une communication standardisée entre des applications d'IA et des services externes. Il joue le rôle de traducteur universel entre les LLM et les outils. 

Docling inclut un serveur MCP (le composant qui convertit les documents) qui peut s'intégrer au client MCP (l'application d'IA qui demande l'accès aux données ou ressources externes, comme Claude Desktop, LM Studio ou Cursor) déjà déployé. Grâce à ce lien, l'application peut utiliser les capacités de Docling pour extraire des informations des documents et convertir les données. Le serveur MCP de Docling fonctionne avec tous les LLM et agents capables d'appeler des outils. 

4 principes clés à prendre en compte pour mettre en œuvre des technologies d'IA

Docling traite chaque document étape par étape, dans le cadre d'un seul pipeline :

  1. L'utilisateur envoie le fichier PDF original à Docling.
  2. Docling parcourt le document et analyse sa structure. Il interprète le texte en gras et en gros caractères comme des titres, les blocs de mots comme des paragraphes et les grilles de chiffres comme des tableaux. Il associe à chaque partie une étiquette DocTag (un code spécialisé et lisible par l'IA). 
  3. Le document passe par un pipeline qui comporte des étapes de reconnaissance optique des caractères (OCR), de reconnaissance des structures de tableau et d'analyse approfondie de la mise en page. Cette phase est personnalisable. L'utilisateur peut ajouter ou remplacer des modèles et compléter les paramètres de configuration. 
  4. Docling rassemble toutes les informations recueillies et génère un dossier numérique. Un modèle de post-traitement peaufine le document en organisant chaque élément dans un fichier propre, au format Markdown ou JSON. Le fichier final est au format DoclingDocument. 

Prise en charge de l'OCR et des documents numérisés

Docling prend en charge l'OCR, une technologie de conversion des images et du texte en données lisibles, modifiables et consultables par une machine. L'OCR analyse les zones claires et sombres d'une image pour identifier les lettres et les chiffres. Par exemple, cette technologie peut lire les chiffres sur la photo d'un reçu en vue de la création d'une note de frais.

Différences avec l'OCR 

Le développement de l'OCR a permis celui de Docling. Si cet outil s'appuie sur cette technologie, il offre toutefois des capacités plus avancées. 

L'OCR ne fait que transformer des pixels en texte. Cette technologie reconnaît les chiffres et les lettres, mais comprend mal la mise en page, la hiérarchie des titres et le formatage. Par exemple, il lui arrive de mélanger les colonnes et les lignes d'un tableau. 

Docling va plus loin. L'outil analyse les documents en tenant strictement compte de la mise en page, de la hiérarchie des titres et du formatage. Il reconnaît les en-têtes, les paragraphes, les graphiques, les tableaux, les équations et les listes. Il reproduit cette structure dans le fichier au format Markdown ou JSON qu'il génère. 

Docling utilise l'OCR pour extraire du texte brut, par exemple à partir d'une photocopie floue ou d'une note manuscrite. 

Exécution en local

Par défaut, Docling s'exécute en local sur la machine de l'utilisateur. Il s'agit d'un outil adapté aux documents sensibles, car les données restent toujours sur la machine. En outre, cette exécution en local permet de limiter les coûts. Puisque Docling exploite le matériel informatique plutôt que des outils de traitement basés dans le cloud, il est possible de lui envoyer des milliers de pages sans augmenter la facture mensuelle des services cloud.

Environnements air gap

Docling fonctionne bien dans les environnements air gap très sécurisés. Il faut toutefois une connexion à Internet pour télécharger les modèles d'IA de Docling et les transférer vers un réseau sécurisé avant de basculer l'outil en mode hors ligne. Dans cette configuration, ce logiciel professionnel d'analyse des documents est entièrement coupé du monde extérieur.

Au départ, Docling était un outil interne créé par IBM Research. En avril 2025, IBM en a fait don à la Linux® Foundation AI & Data Foundation. Docling est donc aujourd'hui un outil gratuit et indépendant de tout fournisseur qui continuera d'évoluer au fil des contributions de la communauté Open Source mondiale.

Sécurité d'utilisation

Docling est un projet hébergé par la Linux Foundation, un organisme de contrôle chargé de fournir des protections juridiques et de déployer des outils de cybersécurité pour rechercher en permanence des vulnérabilités dans le code. Cette double sécurité, à la fois technique et juridique, assure la fiabilité de l'outil pour les secteurs hautement réglementés, comme la santé et la finance.

Toutes les entreprises dont la documentation est éparpillée peuvent tirer parti de Docling. Voici quelques exemples de cas d'utilisation :

Services financiers
Souvent, les rapports trimestriels, les déclarations réglementaires et les formulaires contiennent des tableaux complexes et plusieurs colonnes de texte. Docling peut automatiser l'extraction des données financières afin d'isoler les tableaux et de les convertir en tableaux Markdown. Contrairement aux analystes qui passent des heures à copier-coller manuellement les chiffres dans des feuilles de calcul, un agent IA peut lire le fichier DoclingDocument généré et calculer instantanément les indicateurs de mesure.

Analyse et découverte de documents juridiques
Les cabinets d'avocats et les services juridiques doivent gérer des milliers de contrats, de fichiers et de documents. Ceux-ci contiennent souvent des images numérisées, des notes de bas de page et des annotations que les lecteurs de texte standards ont du mal à interpréter. Docling repère efficacement la structure du document et s'assure que les notes de bas de page restent bien contextualisées et reliées aux phrases concernées. Les données sont ainsi mieux préparées pour la RAG, ce qui permet aux avocats d'utiliser une interface de messagerie instantanée basée sur l'IA pour poser des questions complexes et obtenir des réponses précises. 

Recherche scientifique
Pour accélérer la recherche et le développement, les entreprises pharmaceutiques et les institutions de recherche doivent suivre la parution de milliers de journaux scientifiques et de livres blancs médicaux ainsi que les dépôts de brevet. Docling peut ingérer des publications scientifiques complexes mises en page sur plusieurs colonnes, analyser des formules mathématiques ainsi que mettre en correspondance des chiffres et des légendes spécifiques. Ces capacités améliorent la précision des données d'entraînement pour le réglage fin des LLM propres à un domaine. Les outils d'IA du secteur médical peuvent ainsi parcourir des millions de pages de recherche en même temps afin d'identifier de nouveaux schémas dans les interactions médicamenteuses ou les structures chimiques.

Organismes publics et de défense
Les services des organismes publics gèrent des manuels, des documents et des contrats hautement confidentiels qu'il n'est pas envisageable de traiter à l'aide de services d'IA basés dans le cloud public, comme ChatGPT. Parce qu'il s'exécute en local et est compatible avec les environnements air gap, Docling permet aux organismes publics de créer des outils d'IA internes et sécurisés qui analysent les documents et extraient les informations importantes tout en protégeant les données confidentielles. 

Connecter les modèles aux données avec Red Hat AI

Avant de télécharger Docling, il faut avoir installé Python et disposer d'un espace de stockage matériel suffisant pour les modèles de mise en page d'IA de Docling et PyTorch, un framework Open Source d'apprentissage profond. 

Pour télécharger Docling, il suffit ensuite d'exécuter une seule commande de terminal. Après, l'utilisateur peut l'associer à la messagerie instantanée basée sur l'IA de son choix et faire glisser des documents dans son interface pour commencer à l'utiliser.

Avant le lancement de Docling, l'extraction de données d'un document complexe prenait beaucoup de temps. Il fallait des centaines de lignes de code pour guider la logique de traitement : « si le fichier se termine par .pdf, fais ceci ; s'il contient une image, fais cela ». Docling et le protocole MCP ont considérablement simplifié ce processus.

Développer une application agentique pour Docling avec le protocole MCP

La gamme Red Hat® AI offre des fonctionnalités d'inférence rapides, flexibles et efficaces au moyen d'un serveur basé sur vLLM. Elle relie de manière fiable les modèles aux données pour unifier la personnalisation et le développement d'agents spécialisés sur une seule et même plateforme. L'association de Red Hat AI et Docling fournit les outils nécessaires pour transformer des documents complexes en informations utiles. Conçus sur une base Open Source, ces outils donnent un contrôle total sur les workflows d'IA, de bout en bout et à toutes les échelles. 

La gamme Red Hat AI inclut Red Hat AI Enterprise, une plateforme qui permet de déployer, gérer et mettre à l'échelle des opérations d'inférence d'IA, des workflows d'IA agentique et des applications basées sur l'IA dans tous types d'infrastructures.

Découvrir Red Hat AI

Blog

Artificial Intelligence (AI)

See how our platforms free customers to run AI workloads and models anywhere

Déployez l'IA avec Red Hat : bénéficiez de notre expertise, de nos formations et de notre assistance

Découvrez notre gamme unique de solutions d'IA. Red Hat AI peut vous aider à atteindre vos objectifs métier et informatiques grâce à l'intelligence artificielle.

En savoir plus

RAG et réglage fin

La génération augmentée de récupération (RAG) et le réglage fin sont deux méthodes différentes qui permettent d'améliorer les grands modèles de langage (LLM). Avec la RAG, le modèle n'est pas altéré, tandis que le réglage fin nécessite d'en ajuster les paramètres.

Comprendre l'AIOps

L'AIOps (AI for IT Operations, ou IA pour l'exploitation informatique) est une approche qui permet d'automatiser l'exploitation informatique grâce à l'apprentissage automatique et à d'autres techniques d'intelligence artificielle avancées.

L'apprentissage automatique, qu'est-ce que c'est ?

L'apprentissage automatique est une technique qui consiste à entraîner un ordinateur à identifier des schémas, à établir des prédictions et à apprendre à partir d'expériences passées sans programmation explicite.

IA/ML : ressources recommandées

Produit recommandé

  • Red Hat AI

    Des solutions flexibles qui accélèrent le développement et le déploiement de solutions d'IA dans les environnements de cloud hybride.