Cos'è Docling?
Docling è un progetto open source nonché uno strumento che converte i documenti in dati strutturati, utilizzabili dai modelli linguistici di grandi dimensioni (LLM) per l'elaborazione e l'apprendimento.
La maggior parte dei dati aziendali è archiviata in formati non facilmente interpretabili dall'IA, dai quali è complicato estrarre dati. Per utilizzare questi documenti in flussi di lavoro come la retrieval augmented generation (RAG), il fine-tuning o l'Agentic AI, è necessario convertirli in un formato come Markdown, testo normale o JSON.
In sostanza, Docling è uno strumento di elaborazione dei documenti pensato per l'IA generativa, in grado di allineare i formati dei documenti tradizionali ai requisiti dei dati per l'elaborazione automatica.
Video di YouTube: How Docling turns documents into usable AI data (12:22)
Cosa fa Docling?
Docling consente all'IA di utilizzare PDF, presentazioni, fogli di calcolo, file audio e video e altri tipi di documenti per ottenere risultati più accurati e trasparenti. Non si limita a estrarre il testo: interpreta la struttura del documento, la gerarchia degli elementi e contenuti complessi come tabelle distribuite su più pagine, immagini, elenchi puntati e intestazioni.
Docling semplifica la preparazione dei dati trasformando documenti eterogenei e complessi in flussi di conoscenze ordinati e pronti per gli LLM. Grazie ad algoritmi di deep learning che preservano la struttura dei documenti, riesce a ovviare al problema del "garbage in, garbage out" tipico dei moderni flussi di lavoro basati sull'IA, per il quale la qualità dei dati di input determina quella dell'output.
Docling converte file come PDF (Portable Document Format), DOCX (documenti Microsoft Word), XLSX (fogli di calcolo Excel), PPTX (presentazioni PowerPoint), HTML e molti altri in un formato più adatto all'elaborazione da parte dell'IA.
Docling e la RAG
Per garantire risultati accurati, un sistema RAG deve avere accesso sia ai dati sia al contesto in cui sono inseriti. Prima di Docling, era difficile mantenere la struttura di un documento durante l'estrazione dei dati: colonne e righe potevano essere confuse tra loro e una nota a piè di pagina poteva essere separata dal paragrafo a cui si riferiva. Docling preserva la struttura dei documenti, riducendo le "allucinazioni" e migliorando la pertinenza delle risposte fornite dai sistemi RAG.
Docling e il fine tuning
Il fine tuning ha bisogno di esempi di testo puliti e formattati in modo coerente. Numeri di pagina inseriti in modo casuale, intestazioni ripetute e interruzioni di riga non corrette possono creare problemi durante l'acquisizione dei dati e causare errori nei risultati. Docling è paragonabile a un sistema automatico di pulizia dei dati: elimina gli elementi di disturbo e trasforma i documenti in dati puliti e ben strutturati, pronti per l'elaborazione da parte del modello.
Docling e l’MCP
Il Model Context Protocol (MCP) è un protocollo open source che consente la connessione bidirezionale e la comunicazione standardizzata tra le applicazioni di IA e i servizi esterni. In pratica, funge da interprete universale tra gli LLM e gli strumenti con cui interagiscono.
Il server MCP ufficiale di Docling (il componente che converte i documenti) può integrarsi con il client MCP preferito (l'applicazione di IA che richiede l'accesso a dati o risorse esterne, come Claude Desktop, LM Studio o Cursor). Questa integrazione consente all'applicazione di sfruttare le funzionalità di Docling per estrarre informazioni dai documenti e convertirne i dati. Qualunque LLM o agente utilizzi, se supporta il tool calling, potrai utilizzare il server MCP di Docling.
4 elementi chiave da considerare per l'implementazione dell'IA
Come Docling gestisce documenti con strutture complesse
Docling elabora ogni documento in più fasi, attraverso un'unica pipeline:
- Tu inserisci il file PDF originale in Docling.
- Docling analizza il documento e ne identifica i diversi elementi. È in questa fase che riconosce un testo grande e in grassetto come un'intestazione, un blocco di testo come un paragrafo e una griglia di numeri come una tabella. Durante questa analisi della struttura del documento, a ogni elemento viene assegnato un DocTag, uno speciale codice leggibile dall'IA.
- Il documento viene quindi elaborato con una pipeline che applica il riconoscimento ottico dei caratteri (OCR), il riconoscimento della struttura delle tabelle e un'ulteriore analisi della struttura. Questa parte della pipeline è personalizzabile e consente di aggiungere o sostituire modelli, oltre a definire ulteriori parametri di configurazione.
- Docling raccoglie tutte le informazioni acquisite dal documento e genera una rappresentazione digitale. Un modello di post-elaborazione rifinisce quindi il risultato, organizzando i contenuti in un file Markdown o JSON pulito. Il file finale prende il nome di Docling Document.
Docling supporta l'OCR e i documenti acquisiti tramite scansione?
Sì, Docling offre un supporto completo per l'OCR, una tecnologia che converte immagini o testo in dati modificabili, ricercabili e leggibili dalle macchine. L'OCR individua lettere e numeri analizzando le aree chiare e scure dell'immagine. Ad esempio, se fotografi una ricevuta per allegarla a una nota spese, l'OCR è in grado di leggerne i numeri.
Docling e OCR a confronto
L'OCR è il punto di partenza, ma Docling va oltre, offrendo funzionalità molto più avanzate.
L'OCR è progettato per estrarre il testo dalle immagini. Sebbene riconosca lettere e numeri, interpreta solo in misura limitata la struttura, la gerarchia e la formattazione del documento. Ad esempio, può confondere righe e colonne all'interno di una tabella.
Docling porta le funzionalità dell'OCR a un livello superiore grazie a un'analisi approfondita della struttura, della gerarchia e della formattazione dei documenti. Riconosce intestazioni, paragrafi, grafici, tabelle, equazioni ed elenchi e mantiene questa organizzazione nell'output in formato Markdown o JSON.
Docling ricorre all'OCR quando è necessario estrarre direttamente il contenuto testuale del documento, ad esempio nel caso di una fotocopia di scarsa qualità o di una nota scritta a mano.
Docling può essere eseguito in locale?
Sì, per impostazione predefinita, Docling viene eseguito interamente sul computer dell'utente. Dal momento che i dati non escono mai dal computer, è adatto anche all'elaborazione di documenti contenenti informazioni sensibili. L'esecuzione in locale consente inoltre di contenere i costi: sfruttando le risorse hardware del computer anziché strumenti di elaborazione nel cloud, Docling può elaborare migliaia di pagine senza generare costi ricorrenti.
Docling è adatto agli ambienti "air-gap"?
Sì, Docling funziona perfettamente anche in ambienti altamente protetti e isolati dalla rete. È necessario però scaricare i modelli di IA di Docling da un sistema connesso a Internet, trasferirli nella rete sicura e configurare Docling per l'esecuzione in "modalità offline". Una volta completata la configurazione, puoi contare su un parser di documenti di livello enterprise completamente isolato dal mondo esterno.
Docling e la community open source
Docling è stato originariamente sviluppato da IBM Research come strumento interno. Nell'aprile 2025 IBM ha donato Docling alla Linux® Foundation AI & Data Foundation. Docling è quindi gratuito, indipendente dal fornitore e aperto ai contributi della community open source internazionale.
Docling è sicuro da utilizzare?
Docling fa parte della Linux Foundation, un'organizzazione che offre tutele legali e utilizza strumenti di sicurezza informatica per analizzare continuamente il codice alla ricerca di vulnerabilità. Questo duplice livello di protezione, legale e tecnica, lo rende adatto anche ad ambienti regolamentati, ad esempio nel settore sanitario e in quello finanziario.
Quali sono le applicazioni di Docling nei contesti reali?
Docling può essere utile a qualsiasi organizzazione che gestisca documentazione distribuita tra più fonti. Di seguito sono riportati alcuni scenari di utilizzo:
Servizi finanziari
Molte relazioni finanziarie trimestrali, documenti presentati alle autorità di regolamentazione e moduli contengono testo su più colonne e tabelle complesse. Docling può automatizzare l'estrazione dei dati finanziari isolando le tabelle e convertendole in formato Markdown. In questo modo, anziché perdere ore a copiare e incollare manualmente i dati nei fogli di calcolo, gli analisti possono affidare a un agente di IA la lettura del Docling Document e il calcolo immediato delle metriche.
Analisi e ricerca nei documenti legali
Studi legali e dipartimenti legali gestiscono migliaia di contratti, fascicoli e documenti che spesso contengono immagini acquisite tramite scansione, note a piè di pagina e note a margine, elementi che possono mettere in difficoltà i tradizionali strumenti di lettura del testo. Docling preserva con precisione la gerarchia del documento, mantenendo le note a piè di pagina associate alle frasi di riferimento e al relativo contesto. Questo rende i dati più adatti alla RAG, permettendo agli avvocati di interrogare un'interfaccia di chat basata sull'IA per ottenere risposte accurate anche a domande complesse.
Ricerca scientifica
Le aziende farmaceutiche e gli istituti di ricerca devono tenersi aggiornati consultando migliaia di riviste scientifiche, white paper medici e documenti brevettuali per accelerare la ricerca e lo sviluppo. Docling è in grado di elaborare pubblicazioni accademiche complesse con impaginazione su più colonne, analizzare formule matematiche e associare le figure alle rispettive didascalie. Questo permette di ottenere dati di addestramento di qualità superiore per il fine tuning di LLM specializzati. Di conseguenza, gli strumenti di IA per il settore medicale possono analizzare contemporaneamente milioni di pagine di ricerca per individuare nuovi modelli nelle interazioni tra farmaci o nelle strutture chimiche.
Pubblica amministrazione e difesa
Gli enti pubblici gestiscono manuali, contratti e documentazione altamente riservati, che non possono essere caricati su servizi di IA nel cloud pubblico, come ChatGPT, per analizzarli. Docling viene eseguito in locale e supporta gli ambienti "air-gap", pertanto consente di sviluppare strumenti di IA interni orientati alla sicurezza, in grado di analizzare i documenti, estrarre le informazioni tecniche più rilevanti e proteggere i dati riservati.
Inizia subito a usare Docling
Prima di scaricare Docling, verifica che Python sia installato sul tuo computer e che sia disponibile spazio su disco sufficiente per i modelli di IA di analisi del layout di Docling e per PyTorch, un framework open source per il deep learning.
Una volta completata la configurazione, per scaricare Docling basta un solo comando da terminale. A questo punto puoi integrare Docling con la tua interfaccia di chat basata sull'IA preferita e trascinare i documenti nella chat per avviarne automaticamente l'elaborazione.
Per comprendere appieno la semplicità di Docling, basta ricordare quanto fosse laboriosa l'estrazione dei dati da documenti in formati diversi. Spesso era necessario scrivere centinaia di righe di codice per gestire ogni possibile scenario, ad esempio: "Se il file termina con .pdf, esegui questa operazione. Se contiene un'immagine, esegui quest'altra". Oggi Docling e MCP semplificano notevolmente questo processo.
Il ruolo di Red Hat
Red Hat® AI è progettato per un'inferenza rapida, flessibile ed efficiente tramite un server basato su vLLM. Collega in modo affidabile i modelli ai dati per unificare la personalizzazione e lo sviluppo di agenti specializzati su un'unica piattaforma. Red Hat AI e Docling, insieme, offrono gli strumenti necessari per trasformare documenti complessi in informazioni fruibili. Basandosi entrambi su una piattaforma open source, garantiscono il pieno controllo dei flussi di lavoro dell'IA, end to end, in modo scalabile.
Red Hat AI Portfolio include Red Hat AI Enterprise, una piattaforma per il deployment, la gestione e la scalabilità dell'inferenza IA, i flussi di lavoro Agentic AI e le applicazioni basate sull'IA su qualsiasi infrastruttura.
Artificial Intelligence (AI)
See how our platforms free customers to run AI workloads and models anywhere