Red Hat è orgogliosa di annunciare i risultati eccellenti dei più recenti benchmark MLPerf Inference v6.0, ottenuti grazie a una co-progettazione ingegneristica approfondita con NVIDIA. Questi risultati dimostrano che combinando la leadership open source di Red Hat con l'infrastruttura di IA all'avanguardia di NVIDIA, si ottiene una piattaforma versatile e collaudata pronta per qualsiasi carico di lavoro di inferenza aziendale (partendo da dati visivi e vocali fino al ragionamento complesso).

I nostri ultimi contributi si sono concentrati sulla massimizzazione del potenziale dei sistemi NVIDIA HGX H200 e NVIDIA HGX B200, e abbiamo dimostrato che l'ottimizzazione del software è di importanza critica tanto quanto la potenza pura, al fine di raggiungere il massimo ROI.

Sintesi dei risultati

Tra i modelli linguistici, visivi e vocali, lo stack di Red Hat ha fornito risultati di throughput e latenza di altissimo livello sull'infrastruttura di NVIDIA AI.

Categoria del modello

Modello

Configurazione della GPU

Scenario

Risultati principali

Visivo

Qwen3-VL-235B

8× NVIDIA B200

Server

67,9 campioni/sec 

Ragionamento

GPT-OSS-120B

8× NVIDIA B200

Offline

93.071 token/sec

Vocale

Whisper-Large-v3

8× NVIDIA H200

Offline

36.396 token/sec 

Qwen3-VL-235B (modello di visione multimodale)

Qwen3-VL-235B, un modello di linguaggio visivo multimodale di grandi dimensioni, con 235 miliardi di parametri, rappresenta una sfida significativa per i motori di inferenza, per via delle risoluzioni delle immagini altamente variabili. Utilizzando le GPU NVIDIA Blackwell eseguite su Red Hat Enterprise Linux (RHEL) con vLLM e NVIDIA Dynamo, abbiamo ottenuto il throughput offline più elevato della categoria. In particolare, il nostro contributo Blackwell ha superato del 50% il secondo miglior risultato nello scenario Server.

Principali successi ingegneristici:

  • Miglioramenti basati su Triton. Le ottimizzazioni del vision encoder hanno reso l'elaborazione ViT più rapida del 30-40%.
  • Kernel FlashInfer Mixture-of-Experts (MoE). Questi kernel specializzati hanno gestito l'architettura MoE con estrema efficienza.
  • Attenzione multimodale FP8. Sfrutta i formati di dati avanzati di NVIDIA per ridurre il costo per token senza compromettere la precisione.

GPT-OSS-120B

Il nostro contributo per GPT-OSS-120B segna la prima volta in cui un modello di questa portata viene sottoposto a benchmarking su infrastruttura Kubernetes per MLPerf. Utilizzando Red Hat OpenShift AI e lo scheduler llm-d, abbiamo dimostrato che l'inferenza distribuita può essere estesa in modo efficace all'infrastruttura di NVIDIA AI (GPU H200 e B200) mantenendo rigidi requisiti di latenza.

Abbiamo adottato una duplice strategia per ottimizzare le prestazioni dell'inferenza. In primo luogo, la nostra pipeline di tuning degli iperparametri basata sull'ottimizzazione bayesiana su OpenShift ha identificato una configurazione ottimale per una singola replica che ha ridotto il tempo di rilascio del primo token (TTFT) P99 da 3,4 secondi a 2,1 secondi (miglioramento di circa il 38%), raggiungendo l'obiettivo sotto i 3s.

In secondo luogo, abbiamo ottimizzato le prestazioni multi-replica perfezionando la strategia di bilanciamento del carico e di assegnazione dei punteggi. Analizzando la distribuzione delle richieste tra le repliche, abbiamo migliorato l'utilizzo e ridotto al minimo la latenza di coda, consentendo una scalabilità più coerente sotto carico.

Whisper large-V3 (speech-to-text)

Abbiamo inviato i risultati di Whisper-large-v3 sulle GPU NVIDIA H200 e NVIDIA L40S, entrambe con Red Hat Enterprise Linux (RHEL) e vLLM.

  • 8x H200 offline: 36.396 token al secondo: il miglior risultato per H200, il 13% più veloce rispetto all’invio successivo.                                           
  • 2x L40S offline: 3.647 token al secondo: il primo e unico invio L40S per Whisper in MLPerf Inference v6.0.

Questi risultati derivano da uno studio di ablazione sistematico sui parametri di configurazione per identificare le ottimizzazioni più rilevanti per l'inferenza Whisper. Il tuning della dimensione dei batch ha generato un aumento del throughput del 40% massimizzando l'utilizzo della GPU, la pianificazione asincrona ha contribuito per un ulteriore 12,8% eliminando i blocchi alla sincronizzazione CPU-GPU e i grafici CUDA hanno contribuito con un ulteriore 6%. Con la soluzione L40S ampiamente distribuita in ambienti sensibili ai costi, i nostri risultati mostrano che uno stack di inferenza open source offre prestazioni di riconoscimento vocale eccellenti su hardware di fascia alta così come su hardware più conveniente.

Maggiore efficienza e ROI

Lo stack software di Red Hat utilizza il software di inferenza NVIDIA Dynamo e i framework vLLM e llm-d di Red Hat AI per aumentare significativamente l’efficienza sull'infrastruttura di elaborazione accelerata NVIDIA. Ottimizzando ogni livello dello stack, dal kernel RHEL ai motori di inferenza, aiutiamo le aziende a ridurre il costo per token e a migliorare il ROI complessivo degli investimenti in NVIDIA. Sia per distribuzioni on-premise sia nel cloud, Red Hat offre una base comprovata e ad alte prestazioni per la prossima generazione di IA agentica e multimodale.

Vuoi ottenere i nostri risultati? Ecco come fare: repo.

Consulta i risultati completi di MLPerf Inference v6.0 su mlcommons.org ed esplora Red Hat AI.


Sull'autore

Ashish Kamra is an accomplished engineering leader with over 15 years of experience managing high-performing teams in AI, machine learning, and cloud computing. He joined Red Hat in March 2017, where he currently serves as the Senior Manager of AI Performance at Red Hat. In this role, Ashish heads up initiatives to optimize performance and scale of Red Hat OpenShift AI - an end to end platform for MLOps, specifically focusing on large language model inference and training performance.

Prior to Red Hat, Ashish held leadership positions at Dell EMC, where he drove the development and integration of enterprise and cloud storage solutions and containerized data services. He also has a strong academic background, having earned a Ph.D. in Computer Engineering from Purdue University in 2010. His research focused on database intrusion detection and response, and he has published several papers in renowned journals and conferences.

Passionate about leveraging technology to drive business impact, Ashish is pursuing a Part-time Global Online MBA at Warwick Business School to complement his technical expertise. In his free time, he enjoys playing table tennis, exploring global cuisines, and traveling the world.

UI_Icon-Red_Hat-Close-A-Black-RGB

Ricerca per canale

automation icon

Automazione

Novità sull'automazione IT di tecnologie, team e ambienti

AI icon

Intelligenza artificiale

Aggiornamenti sulle piattaforme che consentono alle aziende di eseguire carichi di lavoro IA ovunque

open hybrid cloud icon

Hybrid cloud open source

Scopri come affrontare il futuro in modo più agile grazie al cloud ibrido

security icon

Sicurezza

Le ultime novità sulle nostre soluzioni per ridurre i rischi nelle tecnologie e negli ambienti

edge icon

Edge computing

Aggiornamenti sulle piattaforme che semplificano l'operatività edge

Infrastructure icon

Infrastruttura

Le ultime novità sulla piattaforma Linux aziendale leader a livello mondiale

application development icon

Applicazioni

Approfondimenti sulle nostre soluzioni alle sfide applicative più difficili

Virtualization icon

Virtualizzazione

Il futuro della virtualizzazione negli ambienti aziendali per i carichi di lavoro on premise o nel cloud