Os agentes de IA não apenas impulsionam a IA, mas viram de cabeça para baixo a infraestrutura desenvolvida para a inferência tradicional. Os agentes de IA, sistemas que raciocinam, planejam, utilizam ferramentas e executam tarefas de várias etapas de forma autônoma, estão passando rapidamente da pesquisa para a produção.
Essa mudança não se resume a mais computação: ela altera fundamentalmente o desempenho, a escala e a otimização da infraestrutura para fluxos de trabalho de raciocínio contínuos e em várias etapas.
No entanto, os agentes são cargas de trabalho fundamentalmente diferentes: eles chamam modelos repetidamente, distribuem-se por ferramentas e fontes de dados e precisam operar de maneira contínua e econômica.
Isso exige um novo tipo de infraestrutura, que inclua GPUs de alto desempenho para raciocínio complexo, CPUs para tarefas de inferência, orquestração e agendamento inteligente para unificar tudo.
Juntas, a AMD e a Red Hat viabilizam essa transição, entregando uma base de infraestrutura aberta e de alto desempenho, projetada para que as empresas operacionalizem os agentes de IA em escala.
Inferência de IA de alto rendimento com AMD Instinct MI355X e Red Hat AI 3.4
As cargas de trabalho dos agentes de IA são intensivas em inferência por natureza. Cada etapa de raciocínio, chamada de ferramenta e decisão de um agente é uma inferência de modelo. Quando os agentes orquestram fluxos de trabalho complexos, recuperando documentos, gerando código e validando saídas, eles podem realizar dezenas de chamadas de inferência por tarefa. Isso torna a taxa de transferência e a capacidade de memória da GPU críticas.
O Red Hat AI 3.4 agora oferece suporte à inferência no AMD Instinct™ MI355X, a principal GPU para data center da AMD, desenvolvida com a arquitetura AMD CDNA™ 4. Com 288 GB de memória HBM3E e 8 TB/s de largura de banda, ela pode processar os maiores modelos open source atuais — os modelos de fronteira por trás do raciocínio avançado de agentes —, utilizando menos aceleradores e reduzindo o custo total de propriedade. Desenvolvida com a tecnologia de processo de 3 nm da TSMC e entregando até 5 PF de desempenho em FP16, ela oferece a taxa de transferência necessária para escalar as cargas de trabalho de agentes de IA com eficiência.
Com a integração total do Red Hat AI com o ROCm 7, as organizações podem implantar a inferência acelerada por AMD Instinct MI355X no Red Hat OpenShift usando o AMD GPU Operator para simplificar a configuração do Dia 0. O suporte expandido a tipos de dados para MXFP6 e MXFP4 possibilita um serviço de modelo quantizado mais eficiente, permitindo que as equipes executem mais agentes por GPU sem sacrificar a qualidade de raciocínio que torna os agentes úteis.
Na prática, isso significa que as empresas podem executar modelos maiores com menos aceleradores, reduzindo a ocupação de infraestrutura, diminuindo o consumo de energia e melhorando o custo por inferência. Para os agentes de IA, em que os workflows podem gerar dezenas de chamadas de modelo por tarefa, essa eficiência se traduz diretamente em tempos de resposta mais rápidos e menor custo por interação.
Expanda a flexibilidade de implantação de IA com a placa PCIe AMD Instinct MI350P (preview)
O Red Hat AI adiciona suporte em preview ao acelerador de placa PCIeⓇ AMD Instinct MI350P, trazendo a arquitetura AMD CDNA™ 4 para a infraestrutura padrão de servidores de data center. Projetadas em formato PCIe de slot duplo, com consumo de energia total da placa (TBP) configurável de 600 W e resfriamento passivo a ar, essas placas se integram perfeitamente aos data centers corporativos sem exigir grandes reformulações de energia e refrigeração.
As placas PCIe AMD Instinct MI350P oferecem suporte aos formatos tradicionais de 16 e 8 bits, bem como a MXFP6 e MXFP4 para a entrega eficiente de modelos. Com 144 GB de memória HBM3E e largura de banda de pico de memória de até 4,0 TB/s, elas viabilizam inferências de alto desempenho em ambientes onde sistemas baseados em OAM (Open Accelerator Module) não são práticos. Isso significa que empresas de qualquer porte têm a capacidade de adicionar tecnologia de GPU de ponta à sua infraestrutura, executando com facilidade e eficiência cargas de trabalho baseadas em modelos de pequeno a grande porte.
As placas PCIe AMD Instinct MI350P permitem que as empresas expandam a adoção de IA em diversas cargas de trabalho de forma gerenciável, econômica e escalável. Essas placas aceleradoras proporcionam flexibilidade de implantação para os agentes de IA, permitindo que as organizações executem inferências mais perto dos dados, reduzam a latência e ofereçam suporte a fluxos de trabalho de agentes distribuídos em tempo real, sem a necessidade de rearquitetar a infraestrutura existente.
Placa PCIe AMD Instinct MI350P
Inferência distribuída e alocação de cargas de trabalho para agentes de IA
A tecnologia de agentes de IA envolve a coordenação da infraestrutura adequada para cada parte do fluxo de trabalho. Red Hat AI oferece recursos nativos do Kubernetes para implantar, escalar, monitorar e gerenciar cargas de trabalho de IA em infraestruturas baseadas em CPU e com suporte a aceleradores. As equipes de plataforma podem configurar perfis de aceleradores, habilitar a disponibilização de modelos baseados em GPUs AMD, definir recursos de hardware no nível do projeto e usar os recursos de agendamento, cota de fila e gerenciamento de cargas de trabalho do OpenShift para alocar cargas de trabalho na infraestrutura adequada.
Para a disponibilização de modelos, o Red Hat AI oferece suporte para runtimes baseados em KServe e vLLM em GPUs AMD, incluindo aceleradores AMD Instinct, enquanto a infraestrutura baseada em CPU pode ser usada para orquestração, recuperação, pré-processamento, roteamento e tarefas de inferência mais leves. O OpenShift AI também inclui o llm-d para inferência distribuída de IA em escala. O llm-d estende a disponibilização baseada em vLLM com recursos de inferência distribuída nativos do Kubernetes, como desagregação de pré-preenchimento e decodificação, ou roteamento baseado no reconhecimento de cache KV. Em conjunto com as GPUs AMD Instinct e as CPUs AMD EPYC™, o OpenShift AI e o llm-d oferecem às empresas uma base prática para plataformas de agentes de IA que podem combinar o raciocínio acelerado por GPU com a execução eficiente de fluxos de trabalho baseados em CPU.
O resultado é um sistema que melhora a eficiência, reduz o consumo desnecessário de GPU e escala os serviços de IA sem aumento linear de custos.
Inferência de vLLM de alto desempenho em CPU com AMD EPYC e AMD ZenDNN
Nem toda chamada de agente exige uma GPU. Os sistemas de agentes de IA são inerentemente combináveis: um único fluxo de trabalho pode direcionar o raciocínio complexo para um modelo grande em uma GPU, enquanto envia tarefas mais simples, como classificação, extração ou roteamento, para modelos menores. Executar todas as chamadas em uma GPU é ineficiente quando as CPUs podem processar etapas de menor latência com eficácia. Nos sistemas de IA modernos, as CPUs não são apenas uma infraestrutura de suporte, mas um mecanismo crítico para a inferência escalável.
O Red Hat AI 3.4 introduz o vLLM-CPU com o back-end ZenDNN, trazendo inferência de CPU de alto desempenho para os processadores AMD EPYC. O ZenDNN oferece kernels ajustados e primitivas otimizadas que permitem a execução eficiente de frameworks como o PyTorch em CPUs AMD EPYC, liberando um mecanismo poderoso para cargas de trabalho de IA escaláveis.
Ao estender frameworks nativos com otimizações de grafos e operadores para AMD EPYC, incluindo padrões fundidos, execução vetorizada e microkernels DLP da AMD Optimizing CPU Libraries (AOCL), a solução permite a aceleração sem alteração de código por meio do upstream do ZenDNN para o vLLM. O resultado é um caminho plug-and-play para inferência de alto rendimento na infraestrutura existente, com ampla compatibilidade via PyTorch torch.compile e suporte upstream no vLLM 0.18.0.
Com a quantização INT8/INT4 e a integração otimizada do vLLM, os modelos de IA generativa (gen AI) podem rodar com eficiência em infraestruturas de CPU, viabilizando soluções de baixo custo e baixo consumo de energia para cargas de trabalho híbridas sem restrições estritas de latência. Isso permite executar a inferência de IA juntamente com a computação de uso geral em frotas existentes de CPUs AMD EPYC, otimizando o uso da infraestrutura e reduzindo a necessidade de aceleradores dedicados em cada implantação.
A inferência em CPU é de grande valor para cenários corporativos, como processamento em lote fora do horário de pico, cargas de trabalho híbridas em que a IA representa apenas uma parte da computação total, e a adoção simplificada de IA com o uso de infraestrutura, habilidades e ambientes refrigerados a ar já existentes.
Os processadores da série AMD 9005 são desenvolvidos especificamente para o tipo de computação paralela e contínua que os agentes de IA exigem. Com até 192 núcleos (384 threads SMT), alta largura de banda de memória, grande capacidade de cache, desempenho de núcleo mais forte e E/S expansível, eles oferecem o poder de processamento de CPU necessário para lidar com orquestração, recuperação, pré-processamento, chamadas de ferramentas, roteamento e inferência de modelos em escala.
O futuro processador AMD EPYC de próxima geração, de codinome "Venice", ampliará ainda mais esses recursos com até 256 núcleos (512 threads), compatibilidade com MRDIMMs que oferecem velocidades de memória de até 12,8 MT/s e largura de banda de até 1,64 TB/s, além de PCIe Gen 6 para E/S de alto rendimento.
Na prática, isso permite que as GPUs se concentrem no raciocínio complexo, enquanto as CPUs AMD EPYC gerenciam de forma eficiente o fluxo de trabalho do agente, atendendo a múltiplas solicitações simultâneas, mantendo a baixa latência e otimizando a utilização geral da infraestrutura.
Desempenho: AMD EPYC 9R45 em ação
Para demonstrar os recursos do back-end ZenDNN, realizamos testes de benchmark de desempenho usando o processador AMD EPYC 9R45 de 96 núcleos. A avaliação se concentrou em um benchmark de inferência em CPU "chat_lite" com uma carga de trabalho de contexto curto de 128:128.
Configuração de teste
O ambiente utilizou instâncias AWS m8a.metal-48xl. A arquitetura utilizou cinco instâncias distintas do Red Hat AI Inference 3.4, cada uma com 32 núcleos alocados e cache de prefixo habilitado para otimizar a taxa de transferência. O GuideLLM serviu como a principal ferramenta de avaliação, direcionada por um balanceador de carga NGINX para orquestrar a avaliação de desempenho do vLLM-CPU.
Escalabilidade de alto rendimento
À medida que a concorrência aumenta, o AMD EPYC demonstra uma escalabilidade impressionante:
- Eficiência quantizada: o modelo W8A8 quantizado alcançou uma taxa de transferência média de aproximadamente 2.421 tokens/s com uma concorrência de 160.
- Desempenho máximo: no mesmo nível de concorrência, a taxa de transferência P95 do modelo quantizado subiu para mais de 3.260 tokens/s, demonstrando a capacidade do processador de lidar com cargas de trabalho de agentes em rajadas.
- Desempenho base: até mesmo o modelo FP16 Llama-3.1-8B padrão manteve uma taxa de transferência média constante de aproximadamente 1.500 tokens/s com uma concorrência de 160.
Latência previsível para fluxos de trabalho de agentes
Para que os agentes de IA sejam responsivos, o tempo até o primeiro token (TTFT) e a latência entre tokens (ITL) são essenciais:
- Responsividade: o modelo quantizado mantém um TTFT médio notavelmente baixo, permanecendo bem abaixo do limite de 2 s, mesmo com uma concorrência de 160.
- Fluidez: o ITL médio do modelo quantizado permanece altamente consistente, ficando em torno de 100 ms a 130 ms em todo o espectro de testes.
- Eficiência de ponta a ponta: a latência média de ponta a ponta (E2E) para uma geração completa no modelo quantizado foi de aproximadamente 16,8 segundos na concorrência máxima, em comparação com mais de 27 segundos na versão não quantizada.
Continuamos colaborando de perto com a AMD em lançamentos futuros para ajustar e otimizar ainda mais o desempenho nos processadores AMD EPYC, com vLLM e ZenDNN integrados ao Red Hat AI Inference. Fique atento para receber mais atualizações assim que essas otimizações forem disponibilizadas.
A infraestrutura que os agentes de IA exigem
No Red Hat Summit 2026, a AMD e a Red Hat anunciaram uma base integrada e pronta para o mercado corporativo para agentes de IA. Com base em uma colaboração estratégica que já levou as GPUs AMD Instinct e as CPUs AMD EPYC ao coração do Red Hat AI, formamos juntas a base computacional para agentes de IA corporativos.
A transição da inferência para os agentes não é apenas uma mudança de software, é um ponto de inflexão na infraestrutura. Os agentes precisam de GPUs de alto rendimento para raciocínio complexo, CPUs para tarefas leves, formatos flexíveis para diversas implantações e escalonamento inteligente para ajustar a computação à demanda em tempo real.
A AMD e a Red Hat agora oferecem essa base: o MI355X para inferência de modelos de fronteira, o AMD EPYC vLLM-CPU para chamadas leves e econômicas e o MI350P para levar a aceleração de GPU a novos ambientes. Tudo baseado em open source. Tudo pronto para o ambiente corporativo. Tudo disponível no Red Hat AI.
Os agentes de IA estão redefinindo a forma como as empresas operam, e a infraestrutura agora é um diferencial estratégico. Com os aceleradores AMD Instinct e os processadores AMD EPYC profundamente integrados ao Red Hat AI, as organizações podem implantar plataformas de IA abertas, eficientes e escaláveis, projetadas para causar impacto no mundo real. Juntas, a AMD e a Red Hat não apenas oferecem suporte à era dos agentes de IA, mas também ajudam as empresas a operacionalizá-la.
Recurso
A empresa adaptável: da prontidão para a IA à disrupção
Sobre os autores
Erwan Gallen is Senior Principal Product Manager, Generative AI, at Red Hat, where he follows Red Hat AI Inference Server product and manages hardware-accelerator enablement across OpenShift, RHEL AI, and OpenShift AI. His remit covers strategy, roadmap, and lifecycle management for GPUs, NPUs, and emerging silicon, ensuring customers can run state-of-the-art generative workloads seamlessly in hybrid clouds.
Before joining Red Hat, Erwan was CTO and Director of Engineering at a media firm, guiding distributed teams that built and operated 100 % open-source platforms serving more than 60 million monthly visitors. The experience sharpened his skills in hyperscale infrastructure, real-time content delivery, and data-driven decision-making.
Since moving to Red Hat he has launched foundational accelerator plugins, expanded the company’s AI partner ecosystem, and advised Fortune 500 global enterprises on production AI adoption. An active voice in the community, he speaks regularly at NVIDIA GTC, Red Hat Summit, OpenShift Commons, CERN, and the Open Infra Summit.
Priya Vasudevan is a Senior AI Product Manager focused on AI solutions, CPU-based AI inference, and Agentic AI. She works at the intersection of AI infrastructure, hardware, and enterprise software, helping bring scalable and efficient AI capabilities to real-world deployments.
Mais como este
Por que agentes de IA são a evolução das aplicações
O paradoxo agêntico e o argumento a favor da IA híbrida
Technically Speaking | Defining sovereign AI with open source
Technically Speaking | Inside open source AI strategy
Navegue por canal
Automação
Últimas novidades em automação de TI para empresas de tecnologia, equipes e ambientes
Inteligência artificial
Descubra as atualizações nas plataformas que proporcionam aos clientes executar suas cargas de trabalho de IA em qualquer ambiente
Nuvem híbrida aberta
Veja como construímos um futuro mais flexível com a nuvem híbrida
Segurança
Veja as últimas novidades sobre como reduzimos riscos em ambientes e tecnologias
Edge computing
Saiba quais são as atualizações nas plataformas que simplificam as operações na borda
Infraestrutura
Saiba o que há de mais recente na plataforma Linux empresarial líder mundial
Aplicações
Conheça nossas soluções desenvolvidas para ajudar você a superar os desafios mais complexos de aplicações
Virtualização
O futuro da virtualização empresarial para suas cargas de trabalho on-premise ou na nuvem