Red Hat è orgogliosa di annunciare i risultati eccellenti dei più recenti benchmark MLPerf Inference v6.0, ottenuti grazie a una co-progettazione ingegneristica approfondita con NVIDIA. Questi risultati dimostrano che combinando la leadership open source di Red Hat con l'infrastruttura di IA all'avanguardia di NVIDIA, si ottiene una piattaforma versatile e collaudata pronta per qualsiasi carico di lavoro di inferenza aziendale (partendo da dati visivi e vocali fino al ragionamento complesso).
I nostri ultimi contributi si sono concentrati sulla massimizzazione del potenziale dei sistemi NVIDIA HGX H200 e NVIDIA HGX B200, e abbiamo dimostrato che l'ottimizzazione del software è di importanza critica tanto quanto la potenza pura, al fine di raggiungere il massimo ROI.
Sintesi dei risultati
Tra i modelli linguistici, visivi e vocali, lo stack di Red Hat ha fornito risultati di throughput e latenza di altissimo livello sull'infrastruttura di NVIDIA AI.
Categoria del modello | Modello | Configurazione della GPU | Scenario | Risultati principali |
Visivo | Qwen3-VL-235B | 8× NVIDIA B200 | Server | 67,9 campioni/sec |
Ragionamento | GPT-OSS-120B | 8× NVIDIA B200 | Offline | 93.071 token/sec |
Vocale | Whisper-Large-v3 | 8× NVIDIA H200 | Offline | 36.396 token/sec |
Qwen3-VL-235B (modello di visione multimodale)
Qwen3-VL-235B, un modello di linguaggio visivo multimodale di grandi dimensioni, con 235 miliardi di parametri, rappresenta una sfida significativa per i motori di inferenza, per via delle risoluzioni delle immagini altamente variabili. Utilizzando le GPU NVIDIA Blackwell eseguite su Red Hat Enterprise Linux (RHEL) con vLLM e NVIDIA Dynamo, abbiamo ottenuto il throughput offline più elevato della categoria. In particolare, il nostro contributo Blackwell ha superato del 50% il secondo miglior risultato nello scenario Server.
Principali successi ingegneristici:
- Miglioramenti basati su Triton. Le ottimizzazioni del vision encoder hanno reso l'elaborazione ViT più rapida del 30-40%.
- Kernel FlashInfer Mixture-of-Experts (MoE). Questi kernel specializzati hanno gestito l'architettura MoE con estrema efficienza.
- Attenzione multimodale FP8. Sfrutta i formati di dati avanzati di NVIDIA per ridurre il costo per token senza compromettere la precisione.
GPT-OSS-120B
Il nostro contributo per GPT-OSS-120B segna la prima volta in cui un modello di questa portata viene sottoposto a benchmarking su infrastruttura Kubernetes per MLPerf. Utilizzando Red Hat OpenShift AI e lo scheduler llm-d, abbiamo dimostrato che l'inferenza distribuita può essere estesa in modo efficace all'infrastruttura di NVIDIA AI (GPU H200 e B200) mantenendo rigidi requisiti di latenza.
Abbiamo adottato una duplice strategia per ottimizzare le prestazioni dell'inferenza. In primo luogo, la nostra pipeline di tuning degli iperparametri basata sull'ottimizzazione bayesiana su OpenShift ha identificato una configurazione ottimale per una singola replica che ha ridotto il tempo di rilascio del primo token (TTFT) P99 da 3,4 secondi a 2,1 secondi (miglioramento di circa il 38%), raggiungendo l'obiettivo sotto i 3s.
In secondo luogo, abbiamo ottimizzato le prestazioni multi-replica perfezionando la strategia di bilanciamento del carico e di assegnazione dei punteggi. Analizzando la distribuzione delle richieste tra le repliche, abbiamo migliorato l'utilizzo e ridotto al minimo la latenza di coda, consentendo una scalabilità più coerente sotto carico.
Whisper large-V3 (speech-to-text)
Abbiamo inviato i risultati di Whisper-large-v3 sulle GPU NVIDIA H200 e NVIDIA L40S, entrambe con Red Hat Enterprise Linux (RHEL) e vLLM.
- 8x H200 offline: 36.396 token al secondo: il miglior risultato per H200, il 13% più veloce rispetto all’invio successivo.
- 2x L40S offline: 3.647 token al secondo: il primo e unico invio L40S per Whisper in MLPerf Inference v6.0.
Questi risultati derivano da uno studio di ablazione sistematico sui parametri di configurazione per identificare le ottimizzazioni più rilevanti per l'inferenza Whisper. Il tuning della dimensione dei batch ha generato un aumento del throughput del 40% massimizzando l'utilizzo della GPU, la pianificazione asincrona ha contribuito per un ulteriore 12,8% eliminando i blocchi alla sincronizzazione CPU-GPU e i grafici CUDA hanno contribuito con un ulteriore 6%. Con la soluzione L40S ampiamente distribuita in ambienti sensibili ai costi, i nostri risultati mostrano che uno stack di inferenza open source offre prestazioni di riconoscimento vocale eccellenti su hardware di fascia alta così come su hardware più conveniente.
Maggiore efficienza e ROI
Lo stack software di Red Hat utilizza il software di inferenza NVIDIA Dynamo e i framework vLLM e llm-d di Red Hat AI per aumentare significativamente l’efficienza sull'infrastruttura di elaborazione accelerata NVIDIA. Ottimizzando ogni livello dello stack, dal kernel RHEL ai motori di inferenza, aiutiamo le aziende a ridurre il costo per token e a migliorare il ROI complessivo degli investimenti in NVIDIA. Sia per distribuzioni on-premise sia nel cloud, Red Hat offre una base comprovata e ad alte prestazioni per la prossima generazione di IA agentica e multimodale.
Vuoi ottenere i nostri risultati? Ecco come fare: repo.
Consulta i risultati completi di MLPerf Inference v6.0 su mlcommons.org ed esplora Red Hat AI.
Sull'autore
Ashish Kamra is an accomplished engineering leader with over 15 years of experience managing high-performing teams in AI, machine learning, and cloud computing. He joined Red Hat in March 2017, where he currently serves as the Senior Manager of AI Performance at Red Hat. In this role, Ashish heads up initiatives to optimize performance and scale of Red Hat OpenShift AI - an end to end platform for MLOps, specifically focusing on large language model inference and training performance.
Prior to Red Hat, Ashish held leadership positions at Dell EMC, where he drove the development and integration of enterprise and cloud storage solutions and containerized data services. He also has a strong academic background, having earned a Ph.D. in Computer Engineering from Purdue University in 2010. His research focused on database intrusion detection and response, and he has published several papers in renowned journals and conferences.
Passionate about leveraging technology to drive business impact, Ashish is pursuing a Part-time Global Online MBA at Warwick Business School to complement his technical expertise. In his free time, he enjoys playing table tennis, exploring global cuisines, and traveling the world.
Altri risultati simili a questo
Le minacce dell'IA si muovono rapidamente. Anche le tue difese dovrebbero farlo.
Il punto di svolta per l’IA: perché la sovranità non è più facoltativa
Technically Speaking | Defining sovereign AI with open source
Technically Speaking | Inside open source AI strategy
Ricerca per canale
Automazione
Novità sull'automazione IT di tecnologie, team e ambienti
Intelligenza artificiale
Aggiornamenti sulle piattaforme che consentono alle aziende di eseguire carichi di lavoro IA ovunque
Hybrid cloud open source
Scopri come affrontare il futuro in modo più agile grazie al cloud ibrido
Sicurezza
Le ultime novità sulle nostre soluzioni per ridurre i rischi nelle tecnologie e negli ambienti
Edge computing
Aggiornamenti sulle piattaforme che semplificano l'operatività edge
Infrastruttura
Le ultime novità sulla piattaforma Linux aziendale leader a livello mondiale
Applicazioni
Approfondimenti sulle nostre soluzioni alle sfide applicative più difficili
Virtualizzazione
Il futuro della virtualizzazione negli ambienti aziendali per i carichi di lavoro on premise o nel cloud