¡Felicitaciones a Docling por convertirse en uno de los principales repositorios del mes de GitHub!
Las empresas tienen un gran volumen de datos de diferentes tipos: propiedad intelectual, conocimiento, marketing, ventas, clientes, políticas, procedimientos operativos y mucho más. El desafío no es recopilar los datos ni generar documentos, sino extraer información valiosa de ellos. Dicha información permite mejorar el servicio de atención al cliente, agilizar la obtención de valor para el cliente y optimizar las operaciones, entre otros beneficios. La inteligencia artificial generativa promete solucionar este desafío al transformar la gran cantidad de datos empresariales en información estratégica.
Sin embargo, las promesas de la inteligencia artificial generativa no se pueden cumplir si los datos están estancados en formatos que un modelo de lenguaje de gran tamaño (LLM) no puede utilizar. Esto puede suceder cuando los datos se encuentran en un archivo PDF o en un documento con formato propietario, como .docx, lo que supone un obstáculo para adaptar el modelo a las necesidades de la empresa. Para resolver este desafío, las empresas deben procesar previamente los documentos actuales para que tengan formatos que puedan usarse en el perfeccionamiento o en la creación de resultados mediante la generación aumentada por recuperación (RAG).
No se trata de un reconocimiento óptico de caracteres (OCR) básico ni de una extracción de texto. Una parte importante de esta etapa de preprocesamiento es que los datos deben extraerse siguiendo técnicas que reconocen el contexto y distintos elementos. Por ejemplo, si una tabla ocupa varias páginas, debe extraerse como una sola; o bien, si el documento tiene un diseño de varias columnas de texto por página o combina elementos, como imágenes y tablas, cada uno de esos elementos debe extraerse de manera uniforme y mantener el reconocimiento del contexto de donde se extrae.
A lo largo de los años, muchas herramientas open source han intentado resolver uno o algunos aspectos de este desafío, pero ninguna soluciona el problema por completo. Este enfoque fragmentado ha obligado a las empresas a utilizar canales complejos, interconectar herramientas desarticuladas y procesar los mismos documentos varias veces con herramientas diferentes. Los resultados son poco uniformes, costosos en términos informáticos y difíciles de mantener, y la calidad de salida varía considerablemente.
Enfrentamos estos mismos desafíos cuando creamos canales de incorporación de documentos para procesar documentos y perfeccionar un modelo con InstructLab. Fue entonces cuando descubrimos y adoptamos Docling, un proyecto desarrollado en IBM Research, que revolucionó nuestro flujo de trabajo. Desde que IBM lanzó Docling como proyecto open source en 2024, esta herramienta se ha convertido en un recurso destacado en el área del NLP, lo que confirma que adoptarla desde el principio fue una buena decisión. Estamos encantados de ver su influencia cada vez mayor en el ecosistema de inteligencia artificial generativa open source.
Resumen de Docling
Docling es una herramienta y un proyecto open source upstream que permite analizar documentos, ya sean .pdf, .docx, .pptx, html, u otros, y convertirlos a formatos como Markdown o JSON, lo que facilita la preparación del contenido para las aplicaciones de inteligencia artificial generativa. Admite el OCR en el procesamiento avanzado de archivos PDF para los documentos escaneados y se integra a herramientas como LlamaIndex y LangChain para las tareas de RAG y de preguntas y respuestas.
Fuente: https://github.com/DS4SD/docling?tab=readme-ov-file
Prueba Docling en primera persona
Solamente debes instalar Docling desde tu administrador de paquetes, como pip:
# pip install docling
Una vez instalado, puedes realizar la conversión del documento mediante programación en tu módulo Python o utilizar la CLI de Docling.
from docling.document_converter import DocumentConverter source = "https://arxiv.org/pdf/2408.09869" # PDF path or URL converter = DocumentConverter() result = converter.convert(source) print(result.document.export_to_markdown()) # output: "### Docling Technical Report[...]" # docling https://arxiv.org/pdf/2206.01062Encuentra otras formas de configurar esta conversión de datos y obtén más información en el repositorio del proyecto aquí.
Docling en la actualidad
La comunidad de InstructLab ya utiliza Docling para que los usuarios envíen conjuntos de datos públicos a la taxonomía de Instructab. Los usuarios ingresan a https://ui.instructlab.ai/ y envían sus conjuntos de datos para incluirlos en versiones futuras del modelo open source de la comunidad granite-lab de InstructLab. Este modelo granite-lab utiliza el modelo base open source Granite-7b, que se ha personalizado con InstructLab para agregar nuevos conocimientos y habilidades que aportaron los miembros de la comunidad. La próxima versión de granite-lab utiliza el modelo base open source Granite-3.0-8b y se personaliza con InstructLab. Este servicio utiliza Docling para convertir los documentos de los usuarios al formato de datos que requiere la taxonomía de Instructlab, lo que simplifica el proceso de contribución de nuevos documentos de conocimiento. Estas mismas herramientas también se pueden usar para personalizar las instancias de modelos privados de un usuario.
Docling y Red Hat
Red Hat presentó Red Hat Enterprise Linux AI (RHEL AI) e InstructLab a principios de este año para llevar estas funciones a los clientes empresariales. RHEL AI es una plataforma de modelos base centrada en las empresas que integra funciones de inteligencia artificial generativa open source y está optimizada para implementarse en entornos de nube híbrida. Combina los LLM open source Granite de IBM con las herramientas de InstructLab de Red Hat, lo que permite que los especialistas en el área (no solo los analistas de datos) perfeccionen los modelos con el conocimiento específico del sector y los adapten a las necesidades y los datos únicos de la empresa. Luego, esos modelos se pueden implementar y gestionar en un entorno de nube híbrida que abarca desde los centros de datos empresariales hasta las nubes públicas y los entornos del extremo de la red.
Apoyamos la decisión de IBM Research de utilizar Docling, que es open source, así como su compromiso permanente con la innovación en este campo, lo que permite que la inteligencia artificial generativa sea más accesible y factible. En las próximas versiones de RHEL AI, queremos incluir Docling como una función compatible para que los clientes puedan incorporar sus propios datos empresariales privados en varios formatos, así como personalizar y ajustar las instancias de sus propios modelos mediante la generación de datos sintéticos de InstructLab y el entrenamiento en etapas en RHEL AI.
Estamos entusiasmados con la innovación y los beneficios para los usuarios que Docling aporta a la comunidad open source y esperamos ofrecer estas funciones a los usuarios de RHEL AI. La velocidad a la que los proyectos open source permiten que la inteligencia artificial generativa sea más accesible es asombrosa, por lo que nos complace respaldar a estas comunidades upstream y facilitar esta innovación a nuestros clientes como funciones listas para las empresas.
Mira este video para obtener más información
Prueba del producto
Red Hat Enterprise Linux AI | Versión de prueba del producto
Sobre el autor
William is a Product Manager in Red Hat's AI Business Unit and is a seasoned professional and inventor at the forefront of artificial intelligence. With expertise spanning high-performance computing, enterprise platforms, data science, and machine learning, William has a track record of introducing cutting-edge technologies across diverse markets. He now leverages this comprehensive background to drive innovative solutions in generative AI, addressing complex customer challenges in this emerging field. Beyond his professional role, William volunteers as a mentor to social entrepreneurs, guiding them in developing responsible AI-enabled products and services. He is also an active participant in the Cloud Native Computing Foundation (CNCF) community, contributing to the advancement of cloud native technologies.
Más como éste
Fortaleciendo la capa de defensa del código abierto: Red Hat se une a NVIDIA en la Open Secure AI Alliance
La nueva moneda de la velocidad empresarial
Technically Speaking | Defining sovereign AI with open source
Technically Speaking | Inside open source AI strategy
Navegar por canal
Automatización
Las últimas novedades en la automatización de la TI para los equipos, la tecnología y los entornos
Inteligencia artificial
Descubra las actualizaciones en las plataformas que permiten a los clientes ejecutar cargas de trabajo de inteligecia artificial en cualquier lugar
Nube híbrida abierta
Vea como construimos un futuro flexible con la nube híbrida
Seguridad
Vea las últimas novedades sobre cómo reducimos los riesgos en entornos y tecnologías
Edge computing
Conozca las actualizaciones en las plataformas que simplifican las operaciones en el edge
Infraestructura
Vea las últimas novedades sobre la plataforma Linux empresarial líder en el mundo
Aplicaciones
Conozca nuestras soluciones para abordar los desafíos más complejos de las aplicaciones
Virtualización
El futuro de la virtualización empresarial para tus cargas de trabajo locales o en la nube