L'IA agentique ne se contente pas de faire progresser l'IA : elle révolutionne l'infrastructure conçue pour l'inférence traditionnelle. L'IA agentique, composée de systèmes qui raisonnent, planifient, exploitent des outils et exécutent des tâches complexes de manière autonome, passe rapidement de la recherche à la mise en production.
Cette évolution ne se limite pas à une augmentation de la puissance de calcul ; elle modifie fondamentalement les performances, l'évolutivité et l'optimisation requises de l'infrastructure pour des flux de travail de raisonnement continus et en plusieurs étapes.
Cependant, les agents constituent des charges de travail fondamentalement différentes. Ils sollicitent les modèles de manière répétée, se déploient sur divers outils et sources de données, et doivent s'exécuter en continu de manière rentable.
Cette exigence impose un nouveau type d'infrastructure, qui associe des GPU hautes performances pour le raisonnement complexe, des CPU pour les tâches d'inférence, ainsi que des fonctions d'orchestration et de planification intelligente pour unifier l'ensemble.
Ensemble, AMD et Red Hat facilitent cette transition en proposant un socle d'infrastructure ouvert et performant, conçu pour aider les entreprises à opérationnaliser l'IA agentique à grande échelle.
Inférence d'IA à haut débit avec AMD Instinct MI355X et Red Hat AI 3.4
Par nature, les charges de travail agentiques requièrent une forte capacité d'inférence. Chaque étape de raisonnement, chaque appel d'outil et chaque décision d'un agent constituent une inférence de modèle. Lorsque les agents orchestrent des flux de travail complexes (récupération de documents, génération de code, validation des résultats), ils peuvent générer des dizaines d'appels d'inférence par tâche. Le débit du GPU et la capacité de la mémoire s'avèrent donc essentiels.
Red Hat AI 3.4 prend désormais en charge l'inférence sur AMD Instinct™ MI355X, le GPU de centre de données phare d'AMD basé sur l'architecture AMD CDNA™ 4. Doté de 288 Go de mémoire HBM3E et de 8 To/s de bande passante, il prend en charge de grands modèles Open Source actuels (les modèles de pointe qui sous-tendent le raisonnement avancé des agents) en utilisant moins d'accélérateurs, ce qui réduit le coût total de possession. Gravé avec le procédé de fabrication en 3 nm de TSMC et offrant jusqu'à 5 PF de performance en FP16, ce GPU fournit le débit requis pour faire évoluer efficacement les charges de travail agentiques.
Grâce à l'intégration complète de Red Hat AI et de ROCm 7, les entreprises peuvent déployer l'inférence accélérée par AMD Instinct MI355X sur Red Hat OpenShift à l'aide de l'AMD GPU Operator afin de simplifier la configuration initiale (Day-0). La prise en charge étendue des types de données MXFP6 et MXFP4 permet de déployer plus efficacement des modèles quantifiés. Les équipes peuvent ainsi exécuter davantage d'agents par GPU sans compromettre la qualité du raisonnement qui fait leur utilité.
En pratique, cela permet aux entreprises d'exécuter des modèles plus volumineux avec moins d'accélérateurs, réduisant ainsi l'empreinte de l'infrastructure, la consommation d'énergie et le coût par inférence. Pour l'IA agentique, dont les flux de travail peuvent générer des dizaines d'appels de modèle par tâche, cette efficacité se traduit directement par des temps de réponse plus courts et un coût par interaction réduit.
Amélioration de la flexibilité du déploiement de l'IA avec la carte PCIe AMD Instinct MI350P (aperçu)
Red Hat AI intègre désormais la prise en charge en version préliminaire de l'accélérateur PCIeⓇ AMD Instinct MI350P, apportant ainsi l'architecture AMD CDNA™ 4 aux infrastructures de serveurs de centre de données standards. Conçues au format PCIe double emplacement avec une consommation totale configurable de 600 W (TBP) et un système de refroidissement par air passif, ces cartes s'intègrent de manière fluide dans les centres de données d'entreprise, sans exiger de remaniement majeur des installations d'alimentation et de refroidissement.
Les cartes PCIe AMD Instinct MI350P prennent en charge les formats traditionnels 16 bits et 8 bits ainsi que MXFP6 et MXFP4 pour un déploiement efficace des modèles. Dotées de 144 Go de mémoire HBM3E offrant une bande passante mémoire maximale de 4,0 To/s, elles permettent d'effectuer des inférences de haute performance dans les environnements où les systèmes basés sur des modules accélérateurs ouverts (OAM, Open Accelerator Module) ne conviennent pas. Cette flexibilité permet aux entreprises de toutes tailles d'intégrer des technologies GPU de pointe à leur infrastructure afin d'exécuter facilement et efficacement des charges de travail basées sur des modèles de toutes dimensions.
Les cartes PCIe AMD Instinct MI350P permettent aux entreprises d'étendre l'adoption de l'IA à de multiples charges de travail de manière gérable, rentable et évolutive. Ces cartes d'accélération apportent une grande flexibilité de déploiement pour l'IA agentique. Elles permettent aux entreprises d'exécuter l'inférence au plus près des données, de réduire la latence et de prendre en charge des flux de travail d'agents distribués en temps réel, sans qu'il soit nécessaire de restructurer l'infrastructure existante.
Carte PCIe AMD Instinct MI350P
Inférence distribuée et placement des charges de travail pour l'IA agentique
L'IA agentique implique la coordination de l'infrastructure adéquate pour chaque partie du workflow. Red Hat AI offre des fonctionnalités natives Kubernetes pour déployer, mettre à l'échelle, surveiller et gérer les charges de travail d'IA sur des infrastructures s'appuyant sur des accélérateurs ou des processeurs. Les équipes chargées de la plateforme peuvent configurer des profils d'accélérateurs, activer le service de modèles reposant sur des GPU AMD, définir des ressources matérielles au niveau du projet et utiliser les fonctionnalités de planification, de quotas de file d'attente et de gestion des charges de travail d'OpenShift afin de répartir les charges de travail sur l'infrastructure appropriée.
Pour le service de modèles, Red Hat AI prend en charge les environnements d'exécution basés sur KServe et vLLM sur les GPU AMD, y compris les accélérateurs AMD Instinct, tandis que l'infrastructure à base de processeurs permet de gérer l'orchestration, la récupération, le prétraitement, le routage et les tâches d'inférence plus légères. OpenShift AI inclut également llm-d pour l'inférence d'IA distribuée à grande échelle. llm-d étend le service basé sur vLLM grâce à des fonctionnalités d'inférence distribuée natives de Kubernetes, telles que la désagrégation du préremplissage et du décodage, ou le routage sensible au cache KV (KV-cache-aware). Associés aux GPU AMD Instinct et aux processeurs AMD EPYC™, OpenShift AI et llm-d fournissent aux entreprises un socle pratique pour concevoir des plateformes d'IA agentique capables d'associer un raisonnement accéléré par GPU à une exécution efficace des flux de travail basés sur les processeurs.
Ce résultat se traduit par un système plus performant qui accroît l'efficacité, réduit la consommation inutile de GPU et fait évoluer les services d'IA sans augmentation linéaire des coûts.
Inférence vLLM hautes performances sur processeur avec AMD EPYC et AMD ZenDNN
Les appels d'agent ne requièrent pas tous un GPU. Les systèmes agentiques s'avèrent intrinsèquement modulables. Un même flux de travail peut acheminer un raisonnement complexe vers un grand modèle sur un GPU, tout en confiant les tâches plus simples, telles que la classification, l'extraction ou le routage, à des modèles plus petits. L'exécution de chaque appel sur un GPU se révèle inefficace lorsque les processeurs peuvent gérer de manière optimale les étapes exigeant une faible latence. Dans les systèmes d'IA modernes, les processeurs ne se limitent plus au rôle d'infrastructure de support. Ils constituent désormais un moteur essentiel pour une inférence évolutive.
Red Hat AI 3.4 introduit vLLM-CPU avec le back-end ZenDNN, apportant ainsi une inférence hautes performances sur processeur aux processeurs AMD EPYC. ZenDNN fournit des noyaux optimisés et des primitives adaptées qui permettent à des frameworks tels que PyTorch de s'exécuter de manière efficace sur les processeurs AMD EPYC, libérant ainsi un moteur puissant pour les charges de travail d'IA évolutives.
En enrichissant les frameworks natifs avec des optimisations de graphes et d'opérateurs pour les processeurs AMD EPYC (notamment des modèles fusionnés, une exécution vectorisée et les micro-noyaux DLP des bibliothèques AOCL [AMD Optimizing CPU Libraries]), cette solution permet une accélération sans modification de code grâce à l'intégration en amont de ZenDNN dans vLLM. Cette intégration offre une solution prête à l’emploi vers une inférence à haut débit sur l'infrastructure existante, ainsi qu'une large compatibilité via PyTorch torch.compile et une prise en charge en amont dans vLLM 0.18.0.
Grâce à la quantification INT8/INT4 et à l'intégration optimisée de vLLM, les modèles d'IA générative (Gen AI) s'exécutent de manière efficace sur l'infrastructure de processeurs, offrant ainsi des solutions économiques et écoénergétiques pour les charges de travail hybrides sans contraintes strictes de latence. Cette approche permet d'exécuter l'inférence d'IA en parallèle de l'informatique générale sur les parcs de processeurs AMD EPYC existants. Elle optimise ainsi l'utilisation des infrastructures tout en réduisant le besoin d'accélérateurs dédiés pour chaque déploiement.
L'inférence sur processeur s'avère particulièrement pertinente pour certains cas d'usage en entreprise. C'est le cas du traitement par lots en heures creuses, des charges de travail hybrides où l'IA ne représente qu'une partie du calcul global, ou encore d'une adoption simplifiée de l'IA s'appuyant sur l'infrastructure, les compétences et les environnements refroidis par air existants.
Les processeurs de la gamme AMD 9005 sont conçus spécifiquement pour le calcul parallèle et continu qu'exige l'IA agentique. Avec un maximum de 192 cœurs (384 threads SMT), une large bande passante mémoire, une grande capacité de cache, des performances de cœur accrues et des E/S étendues, ils fournissent la puissance de traitement requise pour gérer l'orchestration, la récupération, le prétraitement, les appels d'outils, le routage et l'inférence de modèles à grande échelle.
Le futur processeur AMD EPYC de nouvelle génération, sous le nom de code « Venice », étendra encore ces capacités avec un maximum de 256 cœurs (512 threads). Il prendra en charge les modules MRDIMM, offrant des vitesses de mémoire allant jusqu'à 12,8 MT/s et une bande passante de 1,64 To/s, ainsi que la technologie PCIe Gen 6 pour des E/S à haut débit.
En pratique, cette répartition permet aux GPU de se concentrer sur le raisonnement complexe. Les processeurs AMD EPYC gèrent quant à eux efficacement le flux de travail des agents, ce qui permet de traiter de nombreuses requêtes simultanées tout en maintenant une faible latence et en optimisant l'utilisation globale des infrastructures.
Performances : AMD EPYC 9R45 en action
Afin de démontrer les capacités du back-end ZenDNN, nous avons réalisé des tests de performance à l'aide du processeur AMD EPYC 9R45 à 96 cœurs. L'évaluation portait sur un test de performance d'inférence CPU « chat_lite » avec une charge de travail à contexte court de 128:128.
Configuration de test
L'environnement s'appuyait sur des instances AWS m8a.metal-48xl. L'architecture s'appuyait sur 5 instances distinctes de Red Hat AI Inference 3.4, avec 32 cœurs alloués à chacune et l'activation de la mise en cache des préfixes pour optimiser le débit. GuideLLM a servi d'outil d'évaluation principal, routé via un équilibreur de charge NGINX pour orchestrer l'évaluation des performances vLLM-CPU.
Mise à l'échelle à haut débit
À mesure que le niveau de simultanéité augmente, AMD EPYC présente une mise à l'échelle impressionnante :
- Efficacité quantifiée : Le modèle W8A8 quantifié a atteint un débit moyen d'environ 2 421 tokens/s à un niveau de simultanéité de 160.
- Performances de pointe : Au même niveau de simultanéité, le débit P95 du modèle quantifié a dépassé 3 260 tokens/s, démontrant ainsi la capacité du processeur à gérer des charges de travail d'agents en rafale.
- Performances de base : Même le modèle FP16 Llama-3.1-8B standard a maintenu un débit moyen stable d'environ 1 500 tokens/s à un niveau de simultanéité de 160.
Latence prévisible pour les flux de travail d'agents
Pour que les agents d'IA paraissent réactifs, le délai d'obtention du premier token (TTFT) et la latence entre tokens (ITL) s'avèrent essentiels :
- Réactivité : Le modèle quantifié conserve un TTFT moyen remarquablement bas, restant bien en dessous du seuil de 2 s, même à un niveau de simultanéité de 160.
- Fluidité : L'ITL moyen du modèle quantifié demeure extrêmement régulier, oscillant entre 100 ms et 130 ms sur l'ensemble du spectre de test.
- Efficacité de bout en bout : La latence moyenne de bout en bout (E2E) pour une génération complète sur le modèle quantifié s'élevait à environ 16,8 secondes au niveau de simultanéité maximal, contre plus de 27 secondes pour la version non quantifiée.
Nous continuons de collaborer étroitement avec AMD sur les futures versions afin d'ajuster et d'optimiser davantage les performances sur les processeurs AMD EPYC, avec l'intégration de vLLM et de ZenDNN dans Red Hat AI Inference. Nous vous tiendrons informés des futures mises à jour à mesure que ces optimisations seront disponibles.
L'infrastructure requise par l'IA agentique
Lors du Red Hat Summit 2026, AMD et Red Hat ont annoncé un socle intégré et prêt pour l'entreprise destiné à l'IA agentique. Grâce à une collaboration stratégique qui a déjà placé les GPU AMD Instinct et les processeurs AMD EPYC au cœur de Red Hat AI, nous avons constitué ensemble le socle de calcul de l'IA agentique d'entreprise.
Le passage de l'inférence aux agents ne représente pas un simple changement logiciel, il constitue un point d'inflexion pour l'infrastructure. Les agents requièrent des GPU à haut débit pour le raisonnement complexe, des processeurs pour les tâches légères, des formats flexibles pour des déploiements diversifiés et une planification intelligente afin d'adapter les ressources de calcul à la demande en temps réel.
AMD et Red Hat fournissent désormais ce socle : le MI355X pour l'inférence de modèles de pointe, le processeur AMD EPYC vLLM-CPU pour des appels légers et économiques, et le MI350P pour apporter l'accélération GPU à de nouveaux environnements. Le tout reposant sur l'Open Source. Des solutions prêtes pour l'entreprise. L'ensemble est disponible sur Red Hat AI.
L'IA agentique redéfinit le fonctionnement des entreprises, et l'infrastructure constitue désormais un facteur de différenciation stratégique. Grâce aux accélérateurs AMD Instinct et aux processeurs AMD EPYC étroitement intégrés à Red Hat AI, les organisations peuvent déployer des plateformes d'IA évolutives, efficaces et ouvertes, conçues pour un impact concret. Ensemble, AMD et Red Hat ne se contentent pas de soutenir l'ère de l'IA agentique : ils aident les entreprises à la rendre opérationnelle.
Ressource
L'entreprise adaptable : quand s'adapter à l'IA signifie s'adapter aux changements
À propos des auteurs
Erwan Gallen is Senior Principal Product Manager, Generative AI, at Red Hat, where he follows Red Hat AI Inference Server product and manages hardware-accelerator enablement across OpenShift, RHEL AI, and OpenShift AI. His remit covers strategy, roadmap, and lifecycle management for GPUs, NPUs, and emerging silicon, ensuring customers can run state-of-the-art generative workloads seamlessly in hybrid clouds.
Before joining Red Hat, Erwan was CTO and Director of Engineering at a media firm, guiding distributed teams that built and operated 100 % open-source platforms serving more than 60 million monthly visitors. The experience sharpened his skills in hyperscale infrastructure, real-time content delivery, and data-driven decision-making.
Since moving to Red Hat he has launched foundational accelerator plugins, expanded the company’s AI partner ecosystem, and advised Fortune 500 global enterprises on production AI adoption. An active voice in the community, he speaks regularly at NVIDIA GTC, Red Hat Summit, OpenShift Commons, CERN, and the Open Infra Summit.
Priya Vasudevan is a Senior AI Product Manager focused on AI solutions, CPU-based AI inference, and Agentic AI. She works at the intersection of AI infrastructure, hardware, and enterprise software, helping bring scalable and efficient AI capabilities to real-world deployments.
Plus de résultats similaires
Les menaces liées à l'IA évoluent. Vos défenses doivent en faire autant.
L'avenir de l'IA nécessite une base hybride
Technically Speaking | Defining sovereign AI with open source
Technically Speaking | Inside open source AI strategy
Parcourir par canal
Automatisation
Les dernières nouveautés en matière d'automatisation informatique pour les technologies, les équipes et les environnements
Intelligence artificielle
Actualité sur les plateformes qui permettent aux clients d'exécuter des charges de travail d'IA sur tout type d'environnement
Cloud hybride ouvert
Découvrez comment créer un avenir flexible grâce au cloud hybride
Sécurité
Les dernières actualités sur la façon dont nous réduisons les risques dans tous les environnements et technologies
Edge computing
Actualité sur les plateformes qui simplifient les opérations en périphérie
Infrastructure
Les dernières nouveautés sur la plateforme Linux d'entreprise leader au monde
Applications
À l’intérieur de nos solutions aux défis d’application les plus difficiles
Virtualisation
L'avenir de la virtualisation d'entreprise pour vos charges de travail sur site ou sur le cloud