Los equipos empresariales suelen tener dificultades con el "cuello de botella de datos" al diseñar aplicaciones de inteligencia artificial generativa (gen AI) como la generación aumentada por recuperación (RAG), ya que las herramientas tradicionales de procesamiento de documentos no logran gestionar miles de documentos complejos de manera eficiente. Esta publicación de blog explora cómo una infraestructura unificada —que combina Ray Data para la transmisión de alta velocidad y
Anyscale es la empresa detrás de Ray, un marco de computación distribuida que ahora forma parte de PyTorch Foundation. Anyscale también ofrece una plataforma de inteligencia artificial.
Red Hat OpenShift AI ofrece a las organizaciones una plataforma escalable para desarrollar e implementar inteligencia artificial. Utiliza KubeRay para ejecutar clústeres de Ray en Kubernetes, lo que ofrece una mayor confiabilidad y escalado automático. Al agregar Docling para el análisis de documentos, OpenShift AI permite a los equipos gestionar tareas de CPU y GPU en un solo sistema. Esto reduce la sobrecarga y acelera la entrega de aplicaciones de inteligencia artificial.
La realidad del cuello de botella de datos de RAG
Las demostraciones hacen que crear inteligencia artificial generativa parezca sencillo, pero la realidad de la preparación y el procesamiento de datos es mucho más compleja. Imagina que tu equipo acaba de heredar decenas de miles de archivos PDF heredados y el CEO quiere que permitan realizar búsquedas en ellos lo antes posible. Procesar tal cantidad de documentos complejos, muchos de ellos con tablas e imágenes, puede convertirse rápidamente en un cuello de botella que tarda semanas en resolverse. La cruda realidad es que la mayoría de los proyectos de inteligencia artificial dedican la mayor parte de su tiempo a lidiar con la preparación de datos, en lugar de entrenar y ajustar modelos.
En muchos casos, el mayor obstáculo en el desarrollo de RAG es la ineficiencia de los pipelines de datos heredados. RAG mejora las respuestas de los modelos de lenguaje de gran tamaño (LLM) al recuperar contexto relevante de una base de conocimientos. Los documentos se procesan (se analizan, se fragmentan y se vectorizan) y se almacenan en una base de datos vectorial. En el momento de la consulta, se recuperan los fragmentos relevantes y se proporcionan como contexto al LLM, lo que mejora la precisión de la respuesta, ya que ahora se basan en los datos de tu organización, como se muestra aquí:
Los marcos tradicionales de procesamiento de datos no suelen satisfacer las necesidades de la inteligencia artificial porque no pueden coordinar de manera eficaz los diferentes requisitos de cómputo del flujo de procesamiento de datos con el análisis y la vectorización de documentos. Para escalar la inteligencia artificial, los equipos empresariales deben adoptar una infraestructura unificada que gestione tanto el análisis intensivo de CPU como la vectorización intensiva de GPU en un solo proceso optimizado.
Escalado con Ray Data y Docling
Ray Data es una biblioteca de procesamiento distribuido diseñada específicamente para cargas de trabajo de inteligencia artificial y machine learning (ML). Su motor de ejecución de transmisión canaliza los datos entre las tareas de CPU y GPU, lo que mejora la utilización de la GPU y mantiene constante el uso de memoria. Al ser nativa de Python, elimina la sobrecarga de serialización al traducir datos entre diferentes entornos de lenguajes, lo que permite ciclos de iteración más rápidos para los pipelines de RAG.
Docling se encarga del análisis complejo que las herramientas tradicionales suelen hacer mal, lo que ayuda a garantizar que tu inteligencia artificial tenga el contexto adecuado para brindar respuestas útiles. Al analizar con precisión las tablas y los diseños en los PDF, Docling ayuda a conservar la estructura semántica que hace que la recuperación de RAG sea más útil. Al integrarse con Ray Data, cada nodo ejecuta una instancia de Docling con modelos expertos de inteligencia artificial integrados en memoria (para procesar diseños y tablas, por ejemplo), lo que permite un procesamiento de documentos distribuido de alto rendimiento.
Ray Data agiliza el procesamiento a gran escala al dividir los conjuntos de datos en bloques, que se transmiten a través de un clúster para permitir un paralelismo masivo. En esta arquitectura, un controlador de Ray Data gestiona el plan de ejecución y serializa el código de las tareas (como el procesamiento de Docling) para su distribución, mientras que los trabajadores de Ray se encargan del cómputo real. Estos nodos de trabajo leen los bloques de datos directamente desde el almacenamiento y ejecutan escrituras paralelas de los archivos JSON resultantes en el destino, por lo que el driver nunca se convierte en un cuello de botella, como se observa en esta arquitectura:
Arquitectura de procesamiento de datos de inteligencia artificial
- Controlador de Ray: Gestiona las ObjectRefs y el plan de ejecución, serializando el código de Docling para los trabajadores.
- Bloques de streaming: Los trabajadores de Ray extraen datos directamente del almacenamiento de entrada en paralelo.
- Escritura en paralelo: Cada trabajador escribe su salida JSON procesada directamente en el almacenamiento, por lo que el controlador de Ray no se sobrecarga con el flujo de datos.
La integración gestiona automáticamente toda la complejidad distribuida, como la planificación, la recuperación ante fallos y la gestión de la memoria. El uso de cómputo heterogéneo permite que las CPU analicen los datos mientras las GPU generan las incorporaciones de forma simultánea, lo que ayuda a aprovechar de manera más eficiente los costosos recursos de GPU en todo el proceso.
Confiabilidad empresarial con Red Hat OpenShift AI
OpenShift AI proporciona la base empresarial a través de KubeRay, ya que orquesta clústeres de Ray en Kubernetes con funciones integradas de confiabilidad y seguridad. KubeRay gestiona las complejidades operativas, como el escalado automático dinámico de clústeres, la tolerancia a fallos y la recuperación automática en caso de que fallen los nodos de trabajo. Esto permite escalar de 10 a 100 nodos de forma transparente para satisfacer las demandas de grandes trabajos de ingesta.
El flujo de extremo a extremo es sencillo, tal como se muestra aquí:
El proceso funciona así:
- Los documentos (por ejemplo, los PDF) llegan al almacenamiento de objetos (como S3 o PVC).
- El pipeline de Ray Data en OpenShift AI lee estos documentos y los distribuye entre los nodos de trabajo.
- Docling analiza los documentos en los nodos de trabajo y luego los fragmenta para el modelo de generación de incorporaciones.
- Se generan las incorporaciones en los nodos de GPU y se escriben en una base de datos vectorial como Milvus.
- Una aplicación RAG consulta la base de datos y proporciona contexto a un LLM para generar respuestas precisas.
La ejecución en OpenShift AI mantiene el procesamiento de datos dentro del clúster de Kubernetes, lo que ayuda a cumplir con los requisitos de residencia de datos y permite la implementación en nubes privadas virtuales o entornos locales. Esta infraestructura unificada reduce la sobrecarga operativa, ya que te permite ejecutar la preparación de datos y el despliegue de modelos en la misma plataforma.
Perspectivas futuras: Avanzar hacia soluciones con agentes
El futuro de la inteligencia artificial empresarial depende de ir más allá de las búsquedas simples hacia soluciones sofisticadas con agentes. Las organizaciones tendrán que fortalecer y mejorar aún más sus pipelines de datos para admitir los flujos de trabajo con agentes de varios pasos, en los que los agentes autónomos utilizan la generación aumentada por recuperación (RAG) y el ajuste fino aumentado por recuperación (RAFT) para resolver problemas complejos. Al combinar el contexto en tiempo real de la RAG con la capacidad de RAFT de "entrenar" a un modelo para que ignore mejor el ruido irrelevante, los equipos pueden crear agentes que sean significativamente más precisos y confiables.
Quienes inviertan hoy en arquitecturas escalables estarán mejor posicionados para implementar estas cadenas de inferencia avanzadas, en las que se suceden múltiples llamadas a modelos de lenguaje de gran tamaño (LLM) en secuencia con una asignación óptima de recursos. El cambio hacia la inteligencia artificial con agentes significa que la calidad de tus datos procesados es más crítica que nunca, ya que los agentes dependen de documentación precisa para ejecutar tareas en nombre de los usuarios. Una base sólida permite que estas implementaciones creativas de inteligencia artificial cumplan con los estándares empresariales de consistencia y seguridad.
En última instancia, el objetivo es facilitar que estos agentes de inteligencia artificial comprendan la información y actúen en consecuencia. Creemos que el éxito de la inteligencia artificial generativa comienza por hacer que la información compleja sea accesible a través de una base open source con gobernanza empresarial. Al establecer ahora una plataforma sólida y unificada, las empresas pueden ayudar a que sus iniciativas con agentes aporten valor a largo plazo y fomenten la confianza de sus usuarios.
Conclusión
Red Hat OpenShift AI y Anyscale proporcionan las herramientas necesarias para convertir documentos complejos en información procesable. Al eliminar el cuello de botella del procesamiento de datos con Ray Data y Docling, ayudamos a las organizaciones a centrarse en lo que más importa: resolver problemas del mundo real.
Inscríbete en Red Hat Summit 2026 para ponerte en contacto con nuestro equipo y explorar el futuro de la inteligencia artificial en producción. También puedes probar OpenShift AI en Red Hat Developer Sandbox con acceso sin costo durante 30 días a un entorno totalmente gestionado en el que puedes evaluar estas herramientas.
Producto
Red Hat AI
Sobre los autores
Ana Biazetti is a senior architect at Red Hat Openshift AI product organization, focusing on Model Customization, Fine Tuning and Distributed Training.
Más como éste
Las amenazas de la inteligencia artificial se mueven rápido. Tus defensas también deberían hacerlo.
La inteligencia artificial con agentes es una evolución de las aplicaciones
Technically Speaking | Defining sovereign AI with open source
Technically Speaking | Inside open source AI strategy
Navegar por canal
Automatización
Las últimas novedades en la automatización de la TI para los equipos, la tecnología y los entornos
Inteligencia artificial
Descubra las actualizaciones en las plataformas que permiten a los clientes ejecutar cargas de trabajo de inteligecia artificial en cualquier lugar
Nube híbrida abierta
Vea como construimos un futuro flexible con la nube híbrida
Seguridad
Vea las últimas novedades sobre cómo reducimos los riesgos en entornos y tecnologías
Edge computing
Conozca las actualizaciones en las plataformas que simplifican las operaciones en el edge
Infraestructura
Vea las últimas novedades sobre la plataforma Linux empresarial líder en el mundo
Aplicaciones
Conozca nuestras soluciones para abordar los desafíos más complejos de las aplicaciones
Virtualización
El futuro de la virtualización empresarial para tus cargas de trabajo locales o en la nube