Docling이 GitHub 월간 인기 리포지토리 순위에서 상위권에 오르게 된 것을 축하합니다!
조직은 지적 재산과 지식부터 마케팅, 영업 및 고객 데이터, 운영 정책과 절차 등 방대한 데이터를 보유하고 있습니다. 과제는 데이터를 수집하거나 문서를 생성하는 것이 아니라, 그 안에서 의미 있는 인사이트를 추출하는 것입니다. 실행 가능한 인사이트는 고객 서비스 개선, 고객 가치 창출 시간 단축, 원활한 운영 등으로 이어질 수 있습니다. 생성형 AI는 이러한 격차를 해소하여 조직의 방대한 데이터를 전략적 인사이트로 전환할 가능성을 제시합니다.
하지만 데이터가 대규모 언어 모델(LLM)이 직접 사용할 수 없는 형식에 갇혀 있다면 생성형 AI의 가능성을 실현할 수 없습니다. 데이터가 PDF 파일이나 DOCX와 같은 독점 문서 형식에 있는 경우가 이에 해당하며, 이는 모델을 조직의 요구 사항에 맞게 조정하는 데 장애물이 될 수 있습니다. 이러한 과제를 해결하려면 조직은 기존 문서를 미세 조정(fine-tuning) 파이프라인에서 사용하거나 검색 증강 생성(RAG)을 구축하는 데 활용할 수 있는 형식으로 사전 처리해야 합니다.
이는 단순한 OCR이나 텍스트 추출의 문제가 아닙니다. 이 사전 처리 단계에서 중요한 점은 컨텍스트와 요소를 인식하는 기술에 따라 데이터를 추출해야 한다는 것입니다. 예를 들어 표가 여러 페이지에 걸쳐 있다면 하나의 표로 추출해야 합니다. 또한 문서가 페이지마다 여러 텍스트 열로 구성되어 있거나 이미지와 표 같은 요소가 혼합되어 있는 경우에도 각 요소를 일관되게 추출하면서 해당 요소가 원래 놓여 있던 컨텍스트를 유지해야 합니다.
수년에 걸쳐 많은 오픈소스 툴이 이 과제의 한두 가지 측면을 해결하려고 시도했지만, 문제 전체를 다루는 툴은 없었습니다. 이러한 단편적인 접근 방식으로 인해 조직은 복잡한 파이프라인을 사용하고, 서로 분리된 툴을 상호 연결하고, 동일한 문서를 여러 툴로 여러 번 처리해야 했습니다. 그 결과 일관성을 확보하기 어렵고 컴퓨팅 비용과 유지 관리 부담이 커졌으며, 출력 품질도 일정하지 않았습니다.
Red Hat도 InstructLab으로 모델을 미세 조정하기 위해 문서를 처리하는 문서 수집 파이프라인을 만들 때 이와 같은 과제에 직면했습니다. 이때 IBM Research에서 개발한 프로젝트인 Docling을 발견해 도입했고, Docling은 Red Hat의 워크플로우에 획기적인 변화를 가져왔습니다. IBM이 2024년 가을 Docling을 오픈소스 프로젝트로 공개한 이후, 이 툴은 NLP 분야에서 주목받는 프로젝트로 자리 잡으며 Red Hat의 선제적 도입이 적절한 선택이었음을 보여주었습니다. Docling이 오픈소스 생성형 AI 에코시스템에서 영향력을 넓혀 가는 모습을 지켜보게 되어 매우 기쁩니다.
Docling 한눈에 보기
Docling은 업스트림 오픈소스 프로젝트이자 툴로, .pdf와 .docx부터 .pptx, html 등 다양한 문서를 파싱하고 Markdown이나 JSON 같은 형식으로 변환하여 생성형 AI 애플리케이션용 콘텐츠를 더 쉽게 준비할 수 있도록 지원합니다. 스캔 문서를 위한 고급 PDF 처리 및 광학 문자 인식(OCR)을 지원하며, RAG와 질의응답 태스크를 위해 LlamaIndex, LangChain 같은 툴과 통합됩니다.
출처: https://github.com/DS4SD/docling?tab=readme-ov-file
Docling 직접 체험하기
패키지 매니저(예: pip)에서 Docling을 설치하기만 하면 됩니다.
# pip install docling
설치가 완료되면 Python 모듈에서 프로그래밍 방식으로 문서를 변환하거나 Docling CLI를 사용할 수 있습니다.
from docling.document_converter import DocumentConverter source = "https://arxiv.org/pdf/2408.09869" # PDF 경로 또는 URL converter = DocumentConverter() result = converter.convert(source) print(result.document.export_to_markdown()) # 출력: "### Docling Technical Report[...]" # docling https://arxiv.org/pdf/2206.01062이 데이터 변환을 구성하는 다른 방법과 자세한 내용은 여기의 프로젝트 리포지토리에서 확인할 수 있습니다.
Docling의 실제 활용 사례
Docling은 이미 InstructLab 커뮤니티에서 사용자가 공개 데이터세트를 InstructLab 분류 체계에 제출하는 데 활용되고 있습니다. 사용자는 https://ui.instructlab.ai/에 접속하여 향후 버전의 오픈소스 InstructLab granite-lab 커뮤니티 모델에 포함될 데이터 세트를 제출할 수 있습니다. 이 granite-lab 모델은 오픈소스 Granite-7b 기반 모델을 바탕으로 하며, 커뮤니티 구성원이 제출한 새로운 지식과 기술을 추가하기 위해 InstructLab으로 커스터마이징되었습니다. 앞으로 출시될 granite-lab 릴리스는 오픈소스 Granite-3.0-8b 기반 모델을 사용하며, 현재 InstructLab으로 커스터마이징되고 있습니다. 이 서비스는 Docling을 사용하여 사용자의 문서를 InstructLab 분류 체계에 필요한 데이터 형식으로 변환함으로써 새로운 지식 문서를 더 쉽게 기여할 수 있도록 지원합니다. 동일한 툴을 사용하여 사용자의 비공개 모델 인스턴스를 커스터마이징할 수도 있습니다.
Red Hat과 Docling
Red Hat은 올해 초 Red Hat Enterprise Linux AI(RHEL AI)와 InstructLab을 도입하여 이러한 역량을 엔터프라이즈 고객에게도 제공하고자 했습니다. RHEL AI는 오픈소스 생성형 AI 역량을 통합하고 하이브리드 클라우드 환경 전반의 배포에 최적화된 엔터프라이즈 중심의 파운데이션 모델 플랫폼입니다. RHEL AI는 IBM의 오픈소스 Granite LLM을 Red Hat의 InstructLab 툴과 결합하여 데이터 사이언티스트뿐만 아니라 도메인 전문가도 산업별 지식으로 모델을 미세 조정하고 조직의 고유한 요구 사항과 데이터에 맞게 조정할 수 있도록 지원합니다. 이렇게 조정된 모델은 엔터프라이즈 데이터센터에서 퍼블릭 클라우드 및 엣지 환경에 이르는 하이브리드 클라우드 환경 전반에서 배포하고 관리할 수 있습니다.
Red Hat은 IBM Research가 Docling을 오픈소스로 공개하기로 한 결정을 환영하며, 생성형 AI를 더 쉽게 활용하고 구현할 수 있도록 이 분야의 혁신을 지속해 온 노력에 뜻을 같이합니다. 향후 RHEL AI 릴리스에서는 Docling을 지원 기능으로 포함하여 고객이 다양한 형식의 자체 비공개 엔터프라이즈 데이터를 더 간편하게 수집하고 이를 RHEL AI의 InstructLab 합성 데이터 생성 및 단계별 학습에 제공함으로써 자체 모델 인스턴스를 커스터마이징하고 튜닝할 수 있도록 지원할 예정입니다.
Red Hat은 Docling이 오픈소스 커뮤니티에 제공하는 혁신과 사용자 장점에 큰 기대를 갖고 있으며, 이러한 역량을 RHEL AI 사용자에게도 제공할 수 있기를 기대합니다. 오픈소스 프로젝트가 생성형 AI의 접근성을 높이는 속도는 놀라울 정도이며, Red Hat은 이러한 업스트림 커뮤니티를 지원하는 동시에 이 혁신을 엔터프라이즈 수준의 역량으로 고객에게 제공하게 되어 기쁘게 생각합니다.
영상으로 더 자세히 살펴보기
제품 체험판
Red Hat Enterprise Linux AI | 제품 체험판
저자 소개
William is a Product Manager in Red Hat's AI Business Unit and is a seasoned professional and inventor at the forefront of artificial intelligence. With expertise spanning high-performance computing, enterprise platforms, data science, and machine learning, William has a track record of introducing cutting-edge technologies across diverse markets. He now leverages this comprehensive background to drive innovative solutions in generative AI, addressing complex customer challenges in this emerging field. Beyond his professional role, William volunteers as a mentor to social entrepreneurs, guiding them in developing responsible AI-enabled products and services. He is also an active participant in the Cloud Native Computing Foundation (CNCF) community, contributing to the advancement of cloud native technologies.
유사한 검색 결과
빠르게 진화하는 AI 위협, 더 빠른 대응
AI 전환점 디지털 주권 확보가 더 이상 선택이 아닌 이유
Technically Speaking | Defining sovereign AI with open source
Technically Speaking | Inside open source AI strategy
채널별 검색
오토메이션
기술, 팀, 인프라를 위한 IT 자동화 최신 동향
인공지능
고객이 어디서나 AI 워크로드를 실행할 수 있도록 지원하는 플랫폼 업데이트
오픈 하이브리드 클라우드
하이브리드 클라우드로 더욱 유연한 미래를 구축하는 방법을 알아보세요
보안
환경과 기술 전반에 걸쳐 리스크를 감소하는 방법에 대한 최신 정보
엣지 컴퓨팅
엣지에서의 운영을 단순화하는 플랫폼 업데이트
인프라
세계적으로 인정받은 기업용 Linux 플랫폼에 대한 최신 정보
애플리케이션
복잡한 애플리케이션에 대한 솔루션 더 보기
가상화
온프레미스와 클라우드 환경에서 워크로드를 유연하게 운영하기 위한 엔터프라이즈 가상화의 미래