Docling이란?

URL 복사

Docling은 문서를 대규모 언어 모델(Large Language Model, LLM)이 사용하고 학습에 활용할 수 있는 정형 데이터로 변환하는 오픈소스 프로젝트이자 툴입니다. 

대부분의 조직 데이터는 AI가 읽고 데이터를 추출하기 어려운 파일 형식으로 존재합니다. 이러한 문서를 검색 증강 생성(Retrieval-augmented Generation, RAG), 미세 조정(fine-tuning) 또는 에이전틱(Agentic) AI와 같은 워크플로우에서 사용하려면 Markdown, 일반 텍스트 또는 JSON과 같은 형식으로 변환해야 합니다.

간단히 말해 Docling은 생성형 AI의 문서 처리를 돕는 툴이라고 할 수 있습니다. 이는 표준 문서 형식과 컴퓨터 중심 데이터 요구 사항 간의 간극을 메워줍니다. 

Red Hat AI 살펴보기

YouTube 동영상: Docling이 문서를 사용 가능한 AI 데이터로 변환하는 방식(12:22)

Docling은 AI가 PDF, 프레젠테이션, 스프레드시트, 오디오 및 영상 파일 등을 사용하여 더욱 정확하고 투명한 결과를 도출할 수 있도록 돕습니다. Docling은 단순한 텍스트 추출을 뛰어넘어 레이아웃과 계층 구조뿐만 아니라 여러 페이지로 구성된 표, 이미지, 글머리 기호, 헤더와 같은 복잡한 요소도 이해할 수 있습니다. 

Docling의 파일 변환 기능은 복잡하고 다양한 형식으로 된 문서를 LLM에 바로 사용할 수 있는 깔끔한 정보 파이프라인으로 변환하여 데이터 준비 작업을 간소화해 줍니다. 이는 딥러닝 알고리즘의 도움으로 구조를 보존함으로써 입력 데이터의 품질에 따라 결과물의 품질이 결정되는 현대 AI 워크플로우의 '가비지 인, 가비지 아웃(garbage in, garbage out)' 딜레마를 해결합니다. 

Docling은 PDF(Portable Document Format), DOCX(Microsoft Word 문서), XLSX(Excel 스프레드시트), PPTX (PowerPoint 프레젠테이션), HTML 등 다양한 파일을 AI가 더 쉽게 활용할 수 있는 형식으로 변환해 줍니다.

Docling의 문서 처리 능력에 대해 자세히 알아보기

Docling과 RAG

RAG 시스템이 정확하게 작동하려면 데이터와 그러한 데이터를 둘러싼 컨텍스트에 액세스할 수 있어야 합니다. Docling 이전에는 문서에서 데이터를 추출할 때 문서의 레이아웃을 보존하기가 어려웠습니다. 예를 들면 열과 행이 뒤섞이거나 각주가 해당 단락과 분리되는 등의 문제가 종종 발생했습니다. Docling은 문서의 구조를 보존하여 할루시네이션을 줄이고 RAG 시스템의 관련성을 높여줍니다. 

Docling과 미세 조정(fine-tuning)

미세 조정(fine-tuning)에는 클린하고 일관된 형식의 텍스트 예시가 필요합니다. 무작위 페이지 번호, 반복적인 헤더, 잘못된 줄바꿈 등은 데이터 수집 과정에서 혼란을 일으켜 출력에 오류가 포함될 수 있습니다. Docling을 자동화된 데이터 정제 엔진이라고 생각해 보세요. 이는 시각적 노이즈를 제거하고 모델이 학습할 수 있는 클린하고 체계적인 데이터를 제공합니다. 

RAG와 미세 조정(fine-tuning)의 차이점 알아보기

Docling과 MCP

모델 컨텍스트 프로토콜(MCP)은 AI 애플리케이션과 외부 서비스 간 양방향 연결 및 표준화된 통신을 지원하는 오픈소스 프로토콜입니다. 이는 LLM과 툴 사이에서 범용 번역기 역할을 합니다. 

Docling의 공식 MCP 서버(문서를 변환하는 구성 요소)는 선호하는 MCP 클라이언트(Claude Desktop, LM Studio, Cursor 등의 리소스 또는 외부 데이터에 대한 액세스 권한을 요청하는 AI 애플리케이션)에 연결될 수 있습니다. 이러한 연결을 통해 애플리케이션은 Docling의 기능을 사용하여 문서에서 정보를 추출하고 데이터를 변환할 수 있습니다. 어떤 LLM이나 에이전트를 사용하든 관계없이 툴 호출을 지원한다면 Docling MCP 서버를 사용할 수 있습니다. 

AI 기술 구현의 4가지 핵심 고려 사항

Docling은 단일 파이프라인을 통해 각 문서를 단계별로 처리합니다.

  1. 원본 PDF 파일을 Docling에 제공합니다.
  2. Docling은 문서 구문을 분석하여 다양한 부분을 파악합니다. 이 과정에서 Docling은 크고 굵은 텍스트는 헤더로, 단어 블록은 단락으로, 숫자 그리드는 표로 인식합니다. 이 레이아웃 분석 중에 각 부분에 AI가 읽을 수 있는 특수 코드인 DocTag로 레이블이 지정됩니다. 
  3. 문서는 광학 문자 인식(Optical Character Recognition, OCR), 표 구조 인식, 추가 레이아웃 분석을 적용하는 파이프라인을 통해 이동합니다. 파이프라인에서 이 부분은 사용자 정의할 수 있으므로 모델을 추가하거나 교체할 수 있으며 추가 구성 매개변수를 도입할 수도 있습니다. 
  4. Docling은 문서에 관해 학습한 모든 정보를 모아 디지털 폴더를 생성합니다. 후처리 모델이 문서를 다듬어서 잘 정리된 Markdown 또는 JSON 파일로 구성합니다. 이 최종적인 파일을 Docling 문서라고 합니다. 

Docling은 OCR 및 스캔 문서를 지원하나요?

예. Docling은 이미지나 텍스트를 편집 및 검색 가능하고 컴퓨터가 읽을 수 있는 데이터로 변환하는 기술인 OCR을 완전히 지원합니다. OCR은 이미지의 밝은 영역과 어두운 영역을 분석하여 문자와 숫자를 식별합니다. 예를 들어 영수증을 촬영해서 비용 보고서에 업로드하면 OCR이 해당 숫자를 읽을 수 있습니다.

Docling과 OCR의 비교 

Docling은 OCR에서 한 단계 더 발전한 형태입니다. Docling은 OCR을 기반으로 하지만 더 고급 기능을 제공합니다. 

OCR은 픽셀을 텍스트로 변환하는 데 초점을 맞춥니다. 숫자와 문자를 인식할 수는 있지만 레이아웃, 계층 구조, 형식을 이해하는 능력은 떨어집니다. 예를 들어 표의 열과 행을 혼동할 수 있습니다. 

Docling은 OCR의 기능을 한 단계 더 발전시켜 레이아웃, 계층 구조, 형식에 대한 깊이 있는 이해를 바탕으로 문서를 분석합니다. Docling은 헤더, 단락, 차트, 표, 수식, 목록을 인식할 수 있으며 이러한 구조를 유지한 상태로 출력을 Markdown 또는 JSON 파일로 생성합니다. 

Docling은 문서가 흐릿한 복사본이나 손 글씨 메모인 경우처럼 원시 텍스트 추출이 필요한 경우에 OCR을 사용합니다. 

Docling은 로컬로 실행 가능한가요?

예. Docling은 기본적으로 사용자의 컴퓨터에서 완전히 로컬로 실행됩니다. 데이터가 컴퓨터에 계속 유지되기 때문에 Docling을 사용하여 민감한 문서를 구문 분석할 수 있습니다. Docling은 로컬로 실행할 수 있으므로 비용 절감에 특히 도움이 됩니다. 클라우드 처리 툴 대신 컴퓨터 하드웨어를 사용하기 때문에 월별 요금 증가 없이 Docling으로 수천 페이지를 처리할 수 있습니다.

Docling은 에어갭(air-gapped) 환경에 적합한가요?

예. Docling은 고도의 보안이 적용된 에어갭 환경에서 매우 잘 작동합니다. 단, Docling의 AI 모델은 인터넷에 연결된 상태에서 다운로드한 후 보안 네트워크로 이동해야 합니다. 그런 다음 Docling을 '오프라인 모드'로 설정합니다. 이 설정을 완료하여 외부 세계와 완전히 차단된 엔터프라이즈급 문서 구문 분석기를 사용할 수 있습니다.

Docling은 원래 IBM Research에서 내부 툴로 개발되었습니다. IBM은 2025년 4월에 Docling을 Linux® Foundation AI & Data Foundation에 기부했습니다. 즉, Docling은 무료로 이용할 수 있으며 특정 벤더에 종속되지 않습니다. 또한 글로벌 오픈소스 커뮤니티의 기여를 통해 지속적으로 발전할 것입니다.

Docling은 사용하기에 안전한가요?

Docling은 Linux Foundation의 일부입니다. 이 관리 조직은 법적 보호를 제공하며 코드에서 취약성을 지속적으로 스캔하는 사이버 보안 툴을 배포합니다. 이 법적 보호와 기술적 보안의 이중 방어 계층 덕분에 의료 및 금융 산업과 같이 규제가 엄격한 환경에서도 안심하고 사용할 수 있습니다.

도큐멘테이션이 여러 위치에 분산되어 있는 조직이라면 Docling을 사용할 가치가 충분히 있습니다. 다음 활용 사례를 살펴보세요.

금융 서비스
다양한 분기별 수익 보고서, 규제 당국 제출 문서 및 서식은 여러 열로 이루어진 텍스트와 각양각색의 표로 가득합니다. Docling은 금융 데이터를 자동으로 추출하여 표를 분리해 내고 Markdown 그리드로 변환할 수 있습니다. 분석 담당자가 몇 시간씩 걸려서 숫자를 스프레드시트에 복사하고 붙여넣는 대신 AI 에이전트가 Docling 문서 출력을 읽고 즉시 지표를 계산할 수 있습니다.

법률 문서 분석 및 검색
로펌과 법무 부서는 수천 건의 계약, 파일, 문서를 관리합니다. 그런데 여기에는 일반적인 텍스트 리더가 인식하는 데 어려울 수 있는 스캔 이미지, 각주, 방주가 포함된 경우가 많습니다. Docling은 문서 계층 구조를 세밀하게 추적해 각주가 원래 문장과 연결되고 올바른 컨텍스트를 유지하도록 합니다. 이를 통해 데이터를 RAG에 더욱 적합하게 준비하므로, 변호사는 AI 채팅 인터페이스를 사용하여 복잡한 질문을 하고 정확한 답변을 얻을 수 있습니다. 

과학 연구
제약회사와 연구 기관은 연구 개발 속도를 높이기 위해 수천 건에 달하는 최신 과학 저널, 의학 백서, 특허 출원 내용을 지속적으로 파악해야 합니다. Docling은 여러 열로 이루어진 복잡한 학술 문헌을 이해하고, 수식을 분석하고, 그림과 캡션을 매칭할 수 있습니다. 이를 통해 더욱 정확한 학습 데이터를 생성하여 도메인별 LLM의 미세 조정(fine-tuning)에 활용할 수 있습니다. 그 결과 의료용 AI 툴은 수백만 페이지의 연구 자료를 동시에 스캔하여 약물 상호작용 또는 화학 구조에서 새로운 패턴을 발견할 수 있습니다.

정부 및 국방 기관
정부 부처는 극비로 분류된 매뉴얼, 계약, 문서를 처리합니다. 따라서 분석을 위해 ChatGPT 등의 퍼블릭 클라우드 AI 서비스에 이러한 파일을 업로드할 수는 없습니다. Docling은 로컬에서 실행되며 에어갭(air-gapped) 환경을 지원하므로, 정부 기관은 보안 중심의 자체 AI 툴을 구축하여 기밀 데이터를 안전하게 보호하면서 주요 기술 정보를 스캔하고 추출할 수 있습니다. 

Red Hat AI를 이용한 모델과 데이터의 연결

Docling을 다운로드하기 전에 먼저 컴퓨터에 Python이 설치되어 있고 하드웨어에 Docling의 레이아웃 모델과 PyTorch(오픈소스 딥러닝 프레임워크)를 저장할 수 있는 공간이 충분한지 확인하세요. 

준비되었으면 단 한 줄의 터미널 명령만 입력하여 손쉽게 Docling을 다운로드할 수 있습니다. 여기서 선호하는 AI 채팅 인터페이스와 연결하고 채팅 창으로 문서를 드래그 앤 드롭하면 Docling이 작업을 시작합니다.

과거에 다양한 형식의 문서에서 데이터를 추출하는 데 시간이 얼마나 많이 걸렸는지 생각해 보면 Docling이 제공하는 간소화의 이점이 더욱 크게 와닿을 것입니다. 그러한 프로세스를 수행하려면 '파일 확장자가 .pdf이면 이렇게 처리하고 이미지가 포함되어 있으면 저렇게 처리한다' 등의 처리 로직을 지시하기 위해 수백 줄의 코드를 작성해야 했습니다. Docling과 MCP 덕분에 이 프로세스가 훨씬 더 간단해졌습니다.

MCP로 Docling용 에이전틱 애플리케이션을 구축하는 방법

Red Hat® AI는 vLLM 기반 서버로 신속하고 유연하며 효율적인 추론 성능을 제공합니다. 모델과 데이터를 안정적으로 연결하여 하나의 플랫폼에서 전문 에이전트의 사용자 지정 및 개발을 통합합니다. Red Hat AI와 Docling의 조합은 복잡한 문서를 유용한 인텔리전스로 전환하는 데 필요한 툴을 제공합니다. 둘 다 오픈소스 기반으로 구축되어 규모와 상관없이 AI 워크플로우의 모든 과정을 완전히 제어할 수 있습니다. 

Red Hat AI Portfolio에 Red Hat AI Enterprise가 포함됩니다. Red Hat AI Enterprise는 모든 인프라에서 AI 추론, 에이전틱(Agentic) AI 워크플로우, AI 기반 애플리케이션을 배포, 관리, 확장할 수 있는 플랫폼입니다.

Red Hat AI 살펴보기

블로그

Artificial Intelligence (AI)

See how our platforms free customers to run AI workloads and models anywhere

Red Hat과 함께하는 AI 여정: 조직의 AI 여정을 위한 전문성, 교육 및 지원

Red Hat만의 AI 포트폴리오를 살펴보세요. Red Hat AI를 통해 인공지능(AI)을 활용하여 비즈니스 및 IT 목표를 달성할 수 있습니다.

추가 자료

RAG와 미세 조정(fine-tuning) 비교

RAG와 미세 조정(fine-tuning)은 모두 LLM을 향상하는 것을 목표로 하지만 서로 다른 방법을 사용합니다. RAG에서는 모델을 수정하지 않는 반면, 미세 조정(fine-tuning)에서는 매개 변수를 조정해야 합니다.

AIOps 설명

AIOps(IT 운영을 위한 AI)는 머신 러닝과 기타 고급 AI 기술로 IT 운영을 자동화하는 방식입니다.

머신 러닝이란?

머신 러닝이란 명시적으로 프로그래밍하지 않고도 패턴을 찾고, 예측하고, 경험을 통해 배우도록 컴퓨터를 학습시키는 기술입니다.

AI/ML 리소스

주요 제품

  • Red Hat AI

    하이브리드 클라우드 인프라에서 AI 솔루션의 개발과 배포를 가속화하는 유연한 솔루션.