Témoignage client
Google Cloud et Red Hat aident une plateforme numérique à réduire les coûts de l'IA grâce à la flexibilité matérielle
Secteur :
médias et technologies
Région :
monde/plusieurs régions
Siège social :
Mountain View, Californie, États-Unis
Effectif :
plus de 180 000 employés
Présentation
Google Cloud propose une plateforme d'IA optimisée et entièrement intégrée à grande échelle, qui comprend notamment des puces spécialement conçues, des modèles d'IA générative, une plateforme de développement et des applications basées sur l'IA. L'entreprise a reçu le prix « AI Visionary Partner of the Year » dans le cadre des Red Hat Ecosystem Innovation Awards 2026.
Lorsqu'une plateforme numérique mondiale a eu besoin d'optimiser l'efficacité de ses charges de travail liées à la confiance et à la sécurité, elle a choisi Google Cloud et les services professionnels de Red Hat. L'équipe a mis au point une solution permettant de basculer entre les processeurs graphiques (GPU) et les unités de traitement de tenseur (TPU) de Google Cloud, et d'obtenir ainsi de meilleures performances avec les TPU. Leur utilisation permet également de réduire les coûts, avec 92 % d'économies pour l'exécution de charges de travail de sécurité et 62 % pour l'exécution de charges de travail d'IA générative. Ces avantages en matière de coûts et d'efficacité aident le client à protéger les utilisateurs et à préserver la confiance, tout en réduisant les délais de réponse pour améliorer l'expérience utilisateur.
Défi
Exécuter des systèmes de confiance et de sécurité de manière plus efficace et économique
Les plateformes numériques actuelles doivent impérativement disposer de systèmes de confiance et de sécurité, pour évaluer toutes les interactions des utilisateurs en temps réel afin d'éviter tout dommage, de garantir la conformité et de préserver la confiance.
Plateforme numérique opérant à l'échelle mondiale, le client avait besoin d'une solution d'inférence évolutive pour gérer les contenus basés sur l'IA, ainsi que pour optimiser les protocoles de confiance et de sécurité. Afin de garantir une réponse quasi instantanée, les systèmes de sécurité de l'entreprise doivent analyser les requêtes des utilisateurs du monde entier avec un objectif de latence strict de moins de 50 millisecondes. Contraint de réaliser des lancements plus rapides et moins coûteux à l'échelle mondiale, le client souhaitait atténuer les risques associés au manque de GPU et réduire les coûts d'exploitation. Il avait besoin d'une solution capable de réduire sa dépendance vis-à-vis de matériel spécifique tout en préservant un niveau élevé de performances pour ses grands modèles de langage.
Solution
Optimiser les charges de travail d'IA sur l'ensemble du matériel
Le client a travaillé en collaboration avec Google Cloud et Red Hat pour créer une solution à partir du moteur d'inférence vLLM sur les TPU les plus récentes de Google Cloud. Conçues par Google pour l'apprentissage automatique avec des réseaux de neurones, les TPU sont plus rapides et efficaces que les GPU. En parallèle, vLLM fournit le moteur de déploiement de l'inférence à haut débit dont l'équipe a besoin pour répondre aux objectifs stricts du client en matière de latence. La solution utilise vLLM avec Ray, un framework de calcul distribué et Open Source, comme couche d'orchestration afin de faciliter la distribution évolutive en ligne et l'inférence par lots.
L'équipe a choisi de travailler avec Red Hat pour son importante contribution au projet Open Source vLLM et l'intégration de ce dernier à sa gamme de produits. Dans le cadre de la stratégie d'adoption, les performances des TPU ont été comparées aux configurations existantes basées sur des GPU. L'équipe a optimisé le code de bas niveau du système, ce qui a permis d'obtenir un gain de performances de 400 % pour des données d'entrée comptant peu de caractères. Le projet a aussi montré que le passage des GPU aux TPU était plus simple avec Google Kubernetes Engine : il a simplement fallu mettre à jour les paramètres de configuration et utiliser une image de TPU générée par vLLM.
Logiciels et services utilisés par Google Cloud
Services professionnels de Red Hat
Résultats
Réduction des coûts et augmentation des performances de l'IA
Grâce au projet créé avec Google Cloud et Red Hat, le client peut désormais exécuter des charges de travail de confiance et de sécurité afin de répondre à ses objectifs stricts en matière de latence. « Avec de meilleures performances, on obtient de meilleures expériences utilisateur », explique Brittany Rockwell, directrice produit senior chez Google Cloud. « Nous avons montré au client que l'utilisation de TPU pour ses charges de travail de confiance et de sécurité permet non seulement d'accélérer les processus, mais aussi de réduire considérablement les coûts. »
Pour les charges de travail de sécurité qui traitent principalement les requêtes entrantes, la solution réduit les coûts de 92 % en remplaçant les GPU par des TPU, et accélère l'exécution de 400 %. En ce qui concerne les fonctions d'IA générative sensibles à la latence, la solution réduit les coûts de 62 % par rapport aux GPU. Le système traite les données d'entrée à grande échelle de manière rapide et économique : le traitement par lots pour la mise en correspondance d'entités a atteint un coût de 0,48 $ seulement pour 1 million de jetons textuels, avec un débit de 14 000 jetons textuels par seconde. Le client prévoit de provisionner des TPU au sein de ses clusters existants au cours des six prochains mois, et continue d'optimiser les performances de ses charges de travail typiques.
Ressources associées
Banco Bradesco utilise Microsoft Azure Red Hat® OpenShift® pour mettre à l'échelle l'IA générative
Capgemini accélère la modernisation des banques à l'aide d'un modèle basé sur Red Hat OpenShift
One Technology optimise l'efficacité des organismes publics grâce à l'automatisation stratégique des systèmes informatiques
Everpure aide un constructeur à distribuer ses applications trois fois plus rapidement grâce à une plateforme unifiée
Logicalis Spain aide Piñero à préserver l'expérience client avec les services de la gamme Red Hat Cloud Services
Les technologies Open Source soutiennent l'innovation. Nos clients en sont le meilleur exemple : ils utilisent les technologies Open Source pour changer la donne. Nous les appelons les « Innovateurs Open Source » et partageons fièrement leurs expériences.