La inteligencia artificial con agentes no solo impulsa la inteligencia artificial, sino que revoluciona por completo la infraestructura diseñada para la inferencia tradicional. La inteligencia artificial con agentes, que engloba a los sistemas que razonan, planifican, usan herramientas y ejecutan tareas de varios pasos de forma autónoma, pasa rápidamente de la fase de investigación a la de producción.
Este cambio no se limita a ofrecer una mayor capacidad de cómputo, sino que transforma radicalmente el rendimiento, la escala y la optimización de la infraestructura para los flujos de trabajo de razonamiento continuos y de varias etapas.
Sin embargo, los agentes representan cargas de trabajo fundamentalmente distintas: llaman a los modelos de forma repetida, se extienden a través de herramientas y fuentes de datos, y necesitan funcionar de manera continua y rentable.
Esto exige un nuevo tipo de infraestructura que abarque GPU de alto rendimiento para el razonamiento complejo, CPU para las tareas de inferencia, y funciones de orquestación y planificación inteligente para unificar todo.
Juntos, AMD y Red Hat hacen posible esta transición y ofrecen una base de infraestructura abierta y de alto rendimiento, diseñada para ayudar a las empresas a implementar la inteligencia artificial con agentes a gran escala.
Inferencia de inteligencia artificial de alto rendimiento con AMD Instinct MI355X y Red Hat AI 3.4
Las cargas de trabajo con agentes son, por naturaleza, de uso intensivo de inferencias. Cada paso de razonamiento, cada llamada a una herramienta y cada decisión que toma un agente constituyen una inferencia del modelo. Cuando los agentes orquestan flujos de trabajo complejos —como recuperar documentos, generar código y validar resultados—, pueden realizar decenas de llamadas de inferencia por tarea. Esto hace que el rendimiento y la capacidad de memoria de la GPU sean fundamentales.
Red Hat AI 3.4 ya admite la inferencia en AMD Instinct™ MI355X, la GPU insignia de AMD para centros de datos, basada en la arquitectura AMD CDNA™ 4. Con 288 GB de memoria HBM3E y un ancho de banda de 8 TB/s, esta GPU puede ejecutar los modelos open source más grandes de la actualidad —los modelos de vanguardia que sustentan el razonamiento avanzado de los agentes— con menos aceleradores, lo que reduce el costo total de propiedad. Fabricada con la tecnología de proceso de 3 nm de TSMC y con un rendimiento de hasta 5 PF en FP16, esta GPU ofrece la capacidad de procesamiento necesaria para escalar las cargas de trabajo con agentes de manera eficiente.
Gracias a la integración total de Red Hat AI con ROCm 7, las organizaciones pueden implementar la inferencia acelerada por AMD Instinct MI355X en Red Hat OpenShift mediante AMD GPU Operator, lo que agiliza la configuración del día 0. La compatibilidad ampliada con tipos de datos para MXFP6 y MXFP4 permite procesar modelos cuantizados de forma más eficiente, lo que ayuda a los equipos a ejecutar más agentes por GPU sin perder la calidad de razonamiento que los hace útiles.
En la práctica, esto permite a las empresas ejecutar modelos más grandes con menos aceleradores, lo que reduce la huella de la infraestructura, disminuye el consumo de energía y optimiza el costo por inferencia. En la inteligencia artificial con agentes, donde los flujos de trabajo pueden generar decenas de llamadas al modelo por tarea, esta eficiencia se traduce directamente en tiempos de respuesta más rápidos y un menor costo por interacción.
Expansión de la flexibilidad de implementación de la inteligencia artificial con la tarjeta PCIe AMD Instinct MI350P (versión preliminar)
Red Hat AI añade soporte en versión preliminar para el acelerador de tarjeta AMD Instinct MI350P PCIeⓇ, lo que lleva la arquitectura AMD CDNA™ 4 a la infraestructura de servidores estándar de los centros de datos. Con un formato PCIe de doble ranura, una potencia total de la placa (TBP, por sus siglas en inglés) configurable de 600 W y refrigeración por aire pasiva, estas tarjetas se integran a la perfección en los centros de datos empresariales sin requerir grandes modificaciones en la alimentación ni en la refrigeración.
Las tarjetas PCIe AMD Instinct MI350P admiten los formatos tradicionales de 16 y 8 bits, así como MXFP6 y MXFP4 para procesar modelos de manera eficiente. Gracias a sus 144 GB de memoria HBM3E y un ancho de banda de memoria máximo de hasta 4.0 TB/s, estas tarjetas permiten realizar inferencias de alto rendimiento en entornos donde los sistemas basados en Open Accelerator Module (OAM) no resultan prácticos. De este modo, las empresas de cualquier tamaño pueden incorporar tecnología de GPU de vanguardia a su infraestructura y ejecutar con facilidad cargas de trabajo basadas en modelos de cualquier tamaño.
Las tarjetas PCIe AMD Instinct MI350P permiten a las empresas ampliar la adopción de la inteligencia artificial en múltiples cargas de trabajo de forma gestionable, rentable y escalable. Estas tarjetas aceleradoras aportan flexibilidad a la implementación de la inteligencia artificial con agentes, lo que permite a las organizaciones ejecutar inferencias más cerca de los datos, reducir la latencia y admitir flujos de trabajo de agentes distribuidos en tiempo real sin tener que rediseñar la arquitectura de la infraestructura existente.
Tarjeta PCIe AMD Instinct MI350P
Inferencia distribuida y asignación de cargas de trabajo para la inteligencia artificial con agentes
La inteligencia artificial con agentes implica coordinar la infraestructura adecuada para cada parte del flujo de trabajo. Red Hat AI ofrece capacidades nativas de Kubernetes para implementar, escalar, supervisar y gestionar cargas de trabajo de inteligencia artificial en infraestructuras basadas en CPU y respaldadas por aceleradores. Los equipos de plataformas pueden configurar perfiles de aceleradores, habilitar el servicio de modelos respaldado por GPU de AMD, definir recursos de hardware a nivel de proyecto y utilizar las funciones de programación, cuotas de colas y gestión de cargas de trabajo de OpenShift para ubicar estas cargas en la infraestructura adecuada.
Para el servicio de modelos, Red Hat AI admite entornos de ejecución basados en KServe y vLLM en GPU de AMD, incluidos los aceleradores AMD Instinct, mientras que la infraestructura basada en CPU permite realizar tareas de organización, recuperación, preprocesamiento, enrutamiento e inferencia más ligera. OpenShift AI también incluye llm-d para la inferencia de inteligencia artificial distribuida a escala. llm-d amplía el servicio basado en vLLM con capacidades de inferencia distribuida nativas de Kubernetes, como la desagregación de prellenado y decodificación, o el enrutamiento con reconocimiento de la caché KV. Junto con las GPU AMD Instinct y las CPU AMD EPYC™, OpenShift AI y llm-d brindan a las empresas una base práctica para las plataformas de inteligencia artificial con agentes que pueden combinar el razonamiento acelerado por GPU con la ejecución eficiente de flujos de trabajo basados en CPU.
El resultado es un sistema más eficaz que optimiza el rendimiento, reduce el consumo innecesario de GPU y escala los servicios de inteligencia artificial sin aumentos lineales de costos.
Inferencia vLLM de alto rendimiento en CPU con AMD EPYC y AMD ZenDNN
No todas las llamadas de los agentes requieren una GPU. Los sistemas con agentes son intrínsecamente combinables: un solo flujo de trabajo puede dirigir el razonamiento complejo a un modelo grande en una GPU y asignar tareas más sencillas, como la clasificación, la extracción o el enrutamiento, a modelos más pequeños. Ejecutar cada llamada en una GPU resulta ineficiente cuando las CPU pueden gestionar de forma eficaz los pasos de menor latencia. En los sistemas de inteligencia artificial modernos, las CPU ya no son solo una infraestructura de soporte, sino un motor fundamental para la inferencia escalable.
Red Hat AI 3.4 incorpora vLLM-CPU con el backend ZenDNN, lo que lleva la inferencia de alto rendimiento en CPU a los procesadores AMD EPYC. ZenDNN ofrece kernels ajustados y primitivas optimizadas que permiten que marcos de trabajo como PyTorch se ejecuten de manera eficiente en las CPU AMD EPYC, lo que desbloquea un potente motor para las cargas de trabajo de inteligencia artificial escalables.
Al ampliar los marcos de trabajo nativos con mejoras de gráficos y operadores optimizados para AMD EPYC, que incluyen patrones fusionados, ejecución vectorizada y microkernels DLP de las bibliotecas de optimización de CPU de AMD (AOCL), esta solución permite una aceleración sin cambios en el código a través de ZenDNN por medio de upstream a vLLM. El resultado es una vía directa hacia una inferencia de alto rendimiento en la infraestructura existente, con una amplia compatibilidad a través de PyTorch torch.compile y soporte de upstream en vLLM 0.18.0.
Con la cuantificación INT8/INT4 y la integración optimizada de vLLM, los modelos de inteligencia artificial generativa (gen AI) pueden ejecutarse de manera eficiente en la infraestructura de CPU, lo que permite ofrecer soluciones de bajo costo y bajo consumo para cargas de trabajo híbridas que no estén estrictamente limitadas por la latencia. Esto permite ejecutar la inferencia de inteligencia artificial junto con la computación de propósito general en las flotas de CPU AMD EPYC existentes, lo que optimiza el uso de la infraestructura y reduce la necesidad de aceleradores dedicados en cada implementación.
La inferencia en CPU resulta especialmente valiosa en escenarios empresariales como el procesamiento por lotes en horas de menor actividad, cargas de trabajo híbridas en las que la inteligencia artificial es solo una parte del cómputo total, y una adopción de la inteligencia artificial con bajas barreras mediante el uso de la infraestructura, los conocimientos y los entornos refrigerados por aire existentes.
Los procesadores AMD de la serie 9005 están diseñados específicamente para el tipo de cómputo en paralelo y constante que exige la inteligencia artificial con agentes. Con hasta 192 núcleos (384 subprocesos SMT), un elevado ancho de banda de memoria, gran capacidad de caché, un rendimiento de núcleo más sólido y una amplia capacidad de E/S, proporcionan la potencia de CPU necesaria para gestionar la organización, la recuperación, el preprocesamiento, las llamadas a herramientas, el enrutamiento y la inferencia de modelos a escala.
El próximo procesador AMD EPYC de última generación, con nombre en código 'Venice', ampliará aún más estas capacidades con hasta 256 núcleos (512 subprocesos), compatibilidad con MRDIMM que ofrecen velocidades de memoria de hasta 12,8 MT/s y un ancho de banda de hasta 1,64 TB/s, junto con PCIe Gen 6 para una E/S de alto rendimiento.
En la práctica, esto permite a las GPU centrarse en el razonamiento complejo, mientras que las CPU AMD EPYC gestionan de manera eficiente el flujo de trabajo de los agentes asociados, lo que les permite atender múltiples solicitudes simultáneas, mantener una baja latencia y optimizar el uso general de la infraestructura.
Rendimiento: AMD EPYC 9R45 en acción
Para demostrar las capacidades del backend de ZenDNN, realizamos una evaluación comparativa del rendimiento utilizando el procesador AMD EPYC 9R45 de 96 núcleos. La evaluación se centró en un estándar de inferencia en CPU 'chat_lite' con una carga de trabajo de contexto corto de 128:128.
Configuración de la prueba
El entorno utilizó instancias m8a.metal-48xl de AWS. La arquitectura utilizó 5 instancias distintas de Red Hat AI Inference 3.4, cada una con 32 núcleos asignados y el almacenamiento en caché de prefijos habilitado para optimizar la capacidad de procesamiento. GuideLLM sirvió como herramienta principal de evaluación, dirigida a través de un balanceador de carga NGINX para coordinar la evaluación del rendimiento de vLLM-CPU.
Escalabilidad de alta capacidad de procesamiento
A medida que aumenta la concurrencia, AMD EPYC demuestra un escalamiento impresionante:
- Eficiencia cuantificada: El modelo W8A8 cuantificado alcanzó una capacidad de procesamiento media de aproximadamente 2421 tokens/s con una concurrencia de 160.
- Rendimiento máximo: En el mismo nivel de concurrencia, la capacidad de procesamiento P95 para el modelo cuantificado aumentó a más de 3260 tokens/s, lo que demuestra la capacidad del procesador para gestionar cargas de trabajo con agentes en ráfagas.
- Rendimiento básico: Incluso el modelo estándar FP16 Llama-3.1-8B mantuvo una capacidad de procesamiento media constante de aproximadamente 1500 tokens/s con una concurrencia de 160.
Latencia predecible para flujos de trabajo con agentes
Para que los agentes de inteligencia artificial respondan con rapidez, el tiempo hasta el primer token (TTFT) y la latencia entre tokens (ITL) son fundamentales:
- Capacidad de respuesta: El modelo cuantificado mantiene un TTFT medio notablemente bajo y se sitúa muy por debajo del umbral de 2 s, incluso con una concurrencia de 160.
- Fluidez: El ITL medio para el modelo cuantificado sigue siendo sumamente constante, manteniéndose en torno a 100 ms-130 ms en todo el espectro de pruebas.
- Eficiencia de extremo a extremo: La latencia media de extremo a extremo (E2E) para una generación completa en el modelo cuantificado fue de aproximadamente 16,8 segundos con la máxima concurrencia, en comparación con los más de 27 segundos de la versión no cuantificada.
Seguimos colaborando estrechamente con AMD en futuras versiones para ajustar y optimizar aún más el rendimiento en los procesadores AMD EPYC, con vLLM y ZenDNN integrados en Red Hat AI Inference. Mantente atento a nuevas actualizaciones a medida que estas optimizaciones estén disponibles.
La infraestructura que la inteligencia artificial con agentes exige
En Red Hat Summit 2026, AMD y Red Hat anunciaron una base integrada y lista para las empresas para la inteligencia artificial con agentes. A partir de una colaboración estratégica que ya ha llevado las GPU AMD Instinct y las CPU AMD EPYC al corazón de Red Hat AI, hemos creado de forma conjunta la base de computación para la inteligencia artificial empresarial con agentes.
El cambio de la inferencia a los agentes no es solo un cambio de software, sino un punto de inflexión en la infraestructura. Los agentes necesitan GPU de alta capacidad de procesamiento para el razonamiento complejo, CPU para tareas ligeras, formatos flexibles para diversas implementaciones y una planificación inteligente que adapte la computación a la demanda en tiempo real.
Ahora, AMD y Red Hat ofrecen esa base: la unidad de procesamiento gráfico (GPU) MI355X para la inferencia de modelos de frontera, el procesador AMD EPYC vLLM-CPU para realizar llamadas ligeras y rentables, y el procesador MI350P para llevar la aceleración por GPU a nuevos entornos. Todo desarrollado con open source. Todo listo para el entorno empresarial. Todo disponible en Red Hat AI.
La inteligencia artificial con agentes redefine cómo operan las empresas, y la infraestructura ahora es un diferenciador estratégico. Con los aceleradores AMD Instinct y los procesadores AMD EPYC profundamente integrados en Red Hat AI, las organizaciones pueden implementar plataformas de inteligencia artificial escalables, eficientes y abiertas, diseñadas para generar un impacto en el mundo real. Juntas, AMD y Red Hat no solo respaldan la era de la inteligencia artificial con agentes, sino que también ayudan a las empresas a ponerla en funcionamiento.
Recurso
La empresa adaptable: Motivos por los que la preparación para la inteligencia artificial implica prepararse para los cambios drásticos
Sobre los autores
Erwan Gallen is Senior Principal Product Manager, Generative AI, at Red Hat, where he follows Red Hat AI Inference Server product and manages hardware-accelerator enablement across OpenShift, RHEL AI, and OpenShift AI. His remit covers strategy, roadmap, and lifecycle management for GPUs, NPUs, and emerging silicon, ensuring customers can run state-of-the-art generative workloads seamlessly in hybrid clouds.
Before joining Red Hat, Erwan was CTO and Director of Engineering at a media firm, guiding distributed teams that built and operated 100 % open-source platforms serving more than 60 million monthly visitors. The experience sharpened his skills in hyperscale infrastructure, real-time content delivery, and data-driven decision-making.
Since moving to Red Hat he has launched foundational accelerator plugins, expanded the company’s AI partner ecosystem, and advised Fortune 500 global enterprises on production AI adoption. An active voice in the community, he speaks regularly at NVIDIA GTC, Red Hat Summit, OpenShift Commons, CERN, and the Open Infra Summit.
Priya Vasudevan is a Senior AI Product Manager focused on AI solutions, CPU-based AI inference, and Agentic AI. She works at the intersection of AI infrastructure, hardware, and enterprise software, helping bring scalable and efficient AI capabilities to real-world deployments.
Más como éste
Las amenazas de la inteligencia artificial se mueven rápido. Tus defensas también deberían hacerlo.
La inteligencia artificial con agentes es una evolución de las aplicaciones
Technically Speaking | Defining sovereign AI with open source
Technically Speaking | Inside open source AI strategy
Navegar por canal
Automatización
Las últimas novedades en la automatización de la TI para los equipos, la tecnología y los entornos
Inteligencia artificial
Descubra las actualizaciones en las plataformas que permiten a los clientes ejecutar cargas de trabajo de inteligecia artificial en cualquier lugar
Nube híbrida abierta
Vea como construimos un futuro flexible con la nube híbrida
Seguridad
Vea las últimas novedades sobre cómo reducimos los riesgos en entornos y tecnologías
Edge computing
Conozca las actualizaciones en las plataformas que simplifican las operaciones en el edge
Infraestructura
Vea las últimas novedades sobre la plataforma Linux empresarial líder en el mundo
Aplicaciones
Conozca nuestras soluciones para abordar los desafíos más complejos de las aplicaciones
Virtualización
El futuro de la virtualización empresarial para tus cargas de trabajo locales o en la nube