Los equipos empresariales suelen tener dificultades con el "cuello de botella de datos" al diseñar aplicaciones de inteligencia artificial generativa (gen AI) como la generación aumentada por recuperación (RAG), ya que las herramientas tradicionales de procesamiento de documentos no logran gestionar miles de documentos complejos de manera eficiente. Esta publicación de blog explora cómo una infraestructura unificada —que combina Ray Data para la transmisión de alta velocidad y DoclingPágina disponible en Inglés (Español no está disponible) para el análisis preciso de documentos— elimina estos obstáculos. Al escalar estas herramientas en plataformas como Red Hat OpenShift AI o Anyscale, las organizaciones pueden transformar datos desordenados y no estructurados en información práctica en cuestión de horas en lugar de días, lo que sienta las bases de la confianza y la confiabilidad para la próxima ola de innovación en inteligencia artificial.

Anyscale es la empresa detrás de Ray, un marco de computación distribuida que ahora forma parte de PyTorch Foundation. Anyscale también ofrece una plataforma de inteligencia artificial. 

Red Hat OpenShift AI ofrece a las organizaciones una plataforma escalable para desarrollar e implementar inteligencia artificial. Utiliza KubeRay para ejecutar clústeres de Ray en Kubernetes, lo que ofrece una mayor confiabilidad y escalado automático. Al agregar Docling para el análisis de documentos, OpenShift AI permite a los equipos gestionar tareas de CPU y GPU en un solo sistema. Esto reduce la sobrecarga y acelera la entrega de aplicaciones de inteligencia artificial. 

La realidad del cuello de botella de datos de RAG

Las demostraciones hacen que crear inteligencia artificial generativa parezca sencillo, pero la realidad de la preparación y el procesamiento de datos es mucho más compleja. Imagina que tu equipo acaba de heredar decenas de miles de archivos PDF heredados y el CEO quiere que permitan realizar búsquedas en ellos lo antes posible. Procesar tal cantidad de documentos complejos, muchos de ellos con tablas e imágenes, puede convertirse rápidamente en un cuello de botella que tarda semanas en resolverse. La cruda realidad es que la mayoría de los proyectos de inteligencia artificial dedican la mayor parte de su tiempo a lidiar con la preparación de datos, en lugar de entrenar y ajustar modelos.

En muchos casos, el mayor obstáculo en el desarrollo de RAG es la ineficiencia de los pipelines de datos heredados. RAG mejora las respuestas de los modelos de lenguaje de gran tamaño (LLM) al recuperar contexto relevante de una base de conocimientos. Los documentos se procesan (se analizan, se fragmentan y se vectorizan) y se almacenan en una base de datos vectorial. En el momento de la consulta, se recuperan los fragmentos relevantes y se proporcionan como contexto al LLM, lo que mejora la precisión de la respuesta, ya que ahora se basan en los datos de tu organización, como se muestra aquí:

Figure 1: RAG data processing, retrieval, and generation workflow

Los marcos tradicionales de procesamiento de datos no suelen satisfacer las necesidades de la inteligencia artificial porque no pueden coordinar de manera eficaz los diferentes requisitos de cómputo del flujo de procesamiento de datos con el análisis y la vectorización de documentos. Para escalar la inteligencia artificial, los equipos empresariales deben adoptar una infraestructura unificada que gestione tanto el análisis intensivo de CPU como la vectorización intensiva de GPU en un solo proceso optimizado.

Escalado con Ray Data y Docling

Ray Data es una biblioteca de procesamiento distribuido diseñada específicamente para cargas de trabajo de inteligencia artificial y machine learning (ML). Su motor de ejecución de transmisión canaliza los datos entre las tareas de CPU y GPU, lo que mejora la utilización de la GPU y mantiene constante el uso de memoria. Al ser nativa de Python, elimina la sobrecarga de serialización al traducir datos entre diferentes entornos de lenguajes, lo que permite ciclos de iteración más rápidos para los pipelines de RAG.

Docling se encarga del análisis complejo que las herramientas tradicionales suelen hacer mal, lo que ayuda a garantizar que tu inteligencia artificial tenga el contexto adecuado para brindar respuestas útiles. Al analizar con precisión las tablas y los diseños en los PDF, Docling ayuda a conservar la estructura semántica que hace que la recuperación de RAG sea más útil. Al integrarse con Ray Data, cada nodo ejecuta una instancia de Docling con modelos expertos de inteligencia artificial integrados en memoria (para procesar diseños y tablas, por ejemplo), lo que permite un procesamiento de documentos distribuido de alto rendimiento.

Ray Data agiliza el procesamiento a gran escala al dividir los conjuntos de datos en bloques, que se transmiten a través de un clúster para permitir un paralelismo masivo. En esta arquitectura, un controlador de Ray Data gestiona el plan de ejecución y serializa el código de las tareas (como el procesamiento de Docling) para su distribución, mientras que los trabajadores de Ray se encargan del cómputo real. Estos nodos de trabajo leen los bloques de datos directamente desde el almacenamiento y ejecutan escrituras paralelas de los archivos JSON resultantes en el destino, por lo que el driver nunca se convierte en un cuello de botella, como se observa en esta arquitectura:

Figure 2: Ray distributed document processing with Docling

Arquitectura de procesamiento de datos de inteligencia artificial

  • Controlador de Ray: Gestiona las ObjectRefs y el plan de ejecución, serializando el código de Docling para los trabajadores.
  • Bloques de streaming: Los trabajadores de Ray extraen datos directamente del almacenamiento de entrada en paralelo.
  • Escritura en paralelo: Cada trabajador escribe su salida JSON procesada directamente en el almacenamiento, por lo que el controlador de Ray no se sobrecarga con el flujo de datos.

La integración gestiona automáticamente toda la complejidad distribuida, como la planificación, la recuperación ante fallos y la gestión de la memoria. El uso de cómputo heterogéneo permite que las CPU analicen los datos mientras las GPU generan las incorporaciones de forma simultánea, lo que ayuda a aprovechar de manera más eficiente los costosos recursos de GPU en todo el proceso.

Confiabilidad empresarial con Red Hat OpenShift AI

OpenShift AI proporciona la base empresarial a través de KubeRay, ya que orquesta clústeres de Ray en Kubernetes con funciones integradas de confiabilidad y seguridad. KubeRay gestiona las complejidades operativas, como el escalado automático dinámico de clústeres, la tolerancia a fallos y la recuperación automática en caso de que fallen los nodos de trabajo. Esto permite escalar de 10 a 100 nodos de forma transparente para satisfacer las demandas de grandes trabajos de ingesta.

El flujo de extremo a extremo es sencillo, tal como se muestra aquí:

Figure 1: RAG data processing, retrieval, and generation workflow

El proceso funciona así:

  1. Los documentos (por ejemplo, los PDF) llegan al almacenamiento de objetos (como S3 o PVC).
  2. El pipeline de Ray Data en OpenShift AI lee estos documentos y los distribuye entre los nodos de trabajo.
  3. Docling analiza los documentos en los nodos de trabajo y luego los fragmenta para el modelo de generación de incorporaciones.
  4. Se generan las incorporaciones en los nodos de GPU y se escriben en una base de datos vectorial como Milvus.
  5. Una aplicación RAG consulta la base de datos y proporciona contexto a un LLM para generar respuestas precisas.

La ejecución en OpenShift AI mantiene el procesamiento de datos dentro del clúster de Kubernetes, lo que ayuda a cumplir con los requisitos de residencia de datos y permite la implementación en nubes privadas virtuales o entornos locales. Esta infraestructura unificada reduce la sobrecarga operativa, ya que te permite ejecutar la preparación de datos y el despliegue de modelos en la misma plataforma.

Perspectivas futuras: Avanzar hacia soluciones con agentes

El futuro de la inteligencia artificial empresarial depende de ir más allá de las búsquedas simples hacia soluciones sofisticadas con agentes. Las organizaciones tendrán que fortalecer y mejorar aún más sus pipelines de datos para admitir los flujos de trabajo con agentes de varios pasos, en los que los agentes autónomos utilizan la generación aumentada por recuperación (RAG) y el ajuste fino aumentado por recuperación (RAFT) para resolver problemas complejos. Al combinar el contexto en tiempo real de la RAG con la capacidad de RAFT de "entrenar" a un modelo para que ignore mejor el ruido irrelevante, los equipos pueden crear agentes que sean significativamente más precisos y confiables.

Quienes inviertan hoy en arquitecturas escalables estarán mejor posicionados para implementar estas cadenas de inferencia avanzadas, en las que se suceden múltiples llamadas a modelos de lenguaje de gran tamaño (LLM) en secuencia con una asignación óptima de recursos. El cambio hacia la inteligencia artificial con agentes significa que la calidad de tus datos procesados es más crítica que nunca, ya que los agentes dependen de documentación precisa para ejecutar tareas en nombre de los usuarios. Una base sólida permite que estas implementaciones creativas de inteligencia artificial cumplan con los estándares empresariales de consistencia y seguridad.

En última instancia, el objetivo es facilitar que estos agentes de inteligencia artificial comprendan la información y actúen en consecuencia. Creemos que el éxito de la inteligencia artificial generativa comienza por hacer que la información compleja sea accesible a través de una base open source con gobernanza empresarial. Al establecer ahora una plataforma sólida y unificada, las empresas pueden ayudar a que sus iniciativas con agentes aporten valor a largo plazo y fomenten la confianza de sus usuarios.

Conclusión

Red Hat OpenShift AI y Anyscale proporcionan las herramientas necesarias para convertir documentos complejos en información procesable. Al eliminar el cuello de botella del procesamiento de datos con Ray Data y Docling, ayudamos a las organizaciones a centrarse en lo que más importa: resolver problemas del mundo real.

Inscríbete en Red Hat Summit 2026 para ponerte en contacto con nuestro equipo y explorar el futuro de la inteligencia artificial en producción. También puedes probar OpenShift AI en Red Hat Developer Sandbox con acceso sin costo durante 30 días a un entorno totalmente gestionado en el que puedes evaluar estas herramientas.

Producto

Red Hat AI

Red Hat AI ofrece soluciones flexibles y rentables que agilizan el desarrollo y la implementación de las herramientas de inteligencia artificial en todos los entornos de nube híbrida.

Sobre los autores

Ana Biazetti is a senior architect at Red Hat Openshift AI product organization, focusing on Model Customization, Fine Tuning and Distributed Training.

UI_Icon-Red_Hat-Close-A-Black-RGB

Navegar por canal

automation icon

Automatización

Las últimas novedades en la automatización de la TI para los equipos, la tecnología y los entornos

AI icon

Inteligencia artificial

Descubra las actualizaciones en las plataformas que permiten a los clientes ejecutar cargas de trabajo de inteligecia artificial en cualquier lugar

open hybrid cloud icon

Nube híbrida abierta

Vea como construimos un futuro flexible con la nube híbrida

security icon

Seguridad

Vea las últimas novedades sobre cómo reducimos los riesgos en entornos y tecnologías

edge icon

Edge computing

Conozca las actualizaciones en las plataformas que simplifican las operaciones en el edge

Infrastructure icon

Infraestructura

Vea las últimas novedades sobre la plataforma Linux empresarial líder en el mundo

application development icon

Aplicaciones

Conozca nuestras soluciones para abordar los desafíos más complejos de las aplicaciones

Virtualization icon

Virtualización

El futuro de la virtualización empresarial para tus cargas de trabajo locales o en la nube