-
Prodotti e documentazione Red Hat AI
Una piattaforma di prodotti e servizi per lo sviluppo e il deployment dell'IA nel cloud ibrido.
Red Hat AI Enterprise
Crea, sviluppa e distribuisci applicazioni basate sull'IA nel cloud ibrido.
Red Hat AI Inference Server
Ottimizza le prestazioni dei modelli con vLLM per un'inferenza rapida e conveniente in modo scalabile.
Red Hat Enterprise Linux AI
Sviluppa, testa ed esegui modelli di IA generativa con funzionalità di inferenza ottimizzate.
Red Hat OpenShift AI
Crea e distribuisci applicazioni e modelli basati sull'IA in modo scalabile negli ambienti ibridi.
-
Formazione Concetti di base
-
Partner per l'IA
Scenario di utilizzo
Inferenza rapida ed efficiente con Red Hat AI
Ottimizza l'inferenza per ottenere modelli più veloci, efficienti e affidabili.
Scegli qualsiasi modello, su qualsiasi acceleratore e in qualsiasi ambiente cloud.
Ottimizza l'infrastruttura esistente per ridurre il costo per token e incrementare il throughput.
Ottieni una scalabilità dinamica con una distribuzione efficiente dell'inferenza e informazioni sui picchi di domanda imprevedibili.
L'inferenza è alla base dell'IA generativa, ma la crescente complessità dei modelli incide sui ritmi dell’inferenza, rallentandola e rendendo tutte le attività più complicate.
Per ottenere un'inferenza efficiente su vasta scala, i modelli richiedono grandi quantità di storage, memoria e potenza di elaborazione, che possono assorbire la maggior parte del tuo budget. Anche la rapida adozione dell'Agentic AI contribuisce all'aumento del carico di lavoro di calcolo.
Red Hat® AI ottimizza l'inferenza per ridurre i costi e consentire ai team di garantire scalabilità e di supportare in modo affidabile l'Agentic AI.
Scopri i vantaggi
Red Hat AI supporta un'inferenza coerente, rapida, conveniente e scalabile. Basata su tecnologie open source come vLLM e llm-d, offre la flessibilità necessaria per la scalabilità nel cloud ibrido con il modello e l'acceleratore che preferisci.
Ottieni deployment scalabili nel cloud ibrido
Garantisci la coerenza operativa tra diversi acceleratori hardware (GPU, TPU) ed esegui i modelli on premise, nel cloud o all'edge.
Scegli i tuoi modelli e acceleratori
Scegli qualsiasi combinazione di modelli e acceleratori hardware ottenendo un'esperienza operativa sempre coerente. Crea un'architettura Model-as-a-Service unificata senza riprogettare l'intero stack.
Comprimi e quantizza modelli di qualsiasi dimensione
Riduci l'utilizzo delle risorse e i relativi costi mantenendo al contempo un'elevata accuratezza nelle risposte del modello.
Aumenta il throughput riducendo il costo per token
Ottimizza l'infrastruttura esistente utilizzando vLLM e llm-d. Esegui l'inferenza e gli agenti a costi contenuti e in modo scalabile ottimizzando le risorse disponibili, la bassa latenza e il throughput elevato.
Gestisci l'intero ciclo di vita dei modelli
Adotta strumenti e framework di sviluppo che già conosci su un'unica piattaforma centralizzata basata su Kubernetes.
Garantisci operazioni affidabili e scalabili
Tutti i carichi di lavoro di inferenza sono gestiti tramite accesso controllato, applicazione di policy e osservabilità.
Models-as-a-Service con Red Hat AI
Scopri di più sui Models-as-a-Service open source progettati per garantire scalabilità e convenienza.
ROI del 233% con Red Hat AI
Da uno studio condotto da Forrester Consulting, commissionato da Red Hat, è emerso che un'organizzazione composita, basata sugli attuali clienti di Red Hat AI, ha realizzato un ROI del 233% distribuendo Red Hat AI.1
Scopri come funziona
Red Hat AI offre opzioni di deployment flessibili e con tecnologia open source per distribuire un'inferenza efficiente, controllata e a costi contenuti tra modelli, agenti e applicazioni.
Inferenza dei modelli di IA con Red Hat AI | Red Hat spiega. Durata del video: 4:19
Caratteristiche
Red Hat AI offre il pieno controllo su modelli, agenti e hardware, per migliorare l'inferenza in modo scalabile.
Ottimizza l'utilizzo di throughput e GPU
vLLM è un motore di inferenza progettato per ottimizzare il throughput e velocizzare i tempi di risposta degli acceleratori hardware. Avvalendosi dell'algoritmo PagedAttention, ottimizza l'utilizzo della GPU e accelera l'output delle applicazioni di IA generativa.
Sfrutta vLLM per ottimizzare il deployment di qualsiasi modello di IA gen su qualsiasi acceleratore IA, mantenendo al contempo un comportamento dell'inferenza controllato e prevedibile negli ambienti di produzione.
Accelera l'inferenza distribuita in modo scalabile
llm-d è un framework open source nativo di Kubernetes che accelera l'inferenza LLM distribuita in modo scalabile.
In sostanza, quando un modello di IA riceve query complesse con molti dati, llm-d fornisce un framework che velocizza l'elaborazione. Questa tipologia di architettura modulare e accessibile rende llm-d una piattaforma ottimale per l'inferenza LLM distribuita in modo scalabile. Ciò contribuisce alla scalabilità dell'inferenza senza sacrificare la coerenza, il controllo e la governance dei carichi di lavoro distribuiti.
Ottieni informazioni utili per raggiungere i rigorosi obiettivi del livello di servizio (SLO)
Utilizza le metriche e le informazioni dei modelli negli ambienti di produzione per individuare le opportunità di miglioramento dei modelli. Visualizza le metriche prestazionali specifiche del modello, come il tempo per il primo token (TTFT), il tasso di hit della KV-cache e l'utilizzo della GPU. Sfrutta queste metriche per monitorare le prestazioni, individuare le anomalie e accertarsi che l'inferenza rispetti i requisiti operativi, di sicurezza e delle policy.
Comprimi e quantizza i modelli per non limitare le risorse
Ottimizza la scelta di modelli fondativi o personalizzati con un toolkit di modelli diversificato. Adotta tecniche quali la quantizzazione o la sparsità per ridurre i requisiti hardware e i costi dell'inferenza.
Il toolkit include strumenti come LLM Compressor, che utilizza le ricerche più recenti sulla compressione dei modelli per rendere gli LLM più piccoli, più efficienti dal punto di vista energetico e più veloci. Ciò riduce i requisiti hardware migliorando l'efficienza, senza rinunciare all'accuratezza.
Inoltre, LLM Compressor è compatibile con altri strumenti e piattaforme. Supporta l'inferenza con l'ecosistema Hugging Face Transformers, favorendo la convalida dell'accuratezza prima del deployment. Si interfaccia anche con i framework di fine tuning, consentendo agli utenti di gestire la sparsità durante la supervisione dell'addestramento.
Lo strumento aiuta a raggiungere tutti i risultati elencati e al contempo garantisce la convalida, la riproducibilità e il controllo sul comportamento dei modelli prima del deployment.
Gestisci l'accesso ai modelli interni con una strategia open source e portatile
Red Hat AI integra un gateway API gestito che consente ai tecnici della piattaforma AI di configurare funzionalità Models-as-a-service (MaaS) interne e che costituisce una metodologia open source, modulare e indipendente dal fornitore per distribuire e utilizzare i modelli negli ambienti di cloud ibrido.
L'accesso gestito ai modelli tramite l'architettura MaaS centralizzata permette di controllare gli accessi a modelli specifici, di applicare le policy e di monitorare l'utilizzo da parte degli utenti, delle applicazioni e degli agenti, supportando così un utilizzo dei modelli affidabile, verificabile, basato su policy e scalabile.
Le modalità semplificate per l'utilizzo dei modelli di IA e delle risorse GPU permettono agli sviluppatori di ottimizzare l'accesso agli endpoint delle API e agli ingegneri della piattaforma di controllare, gestire e monitorare l'utilizzo degli accessi per i modelli ad alte prestazioni in hosting autonomo.
Se abbinata a una tecnologia di inferenza che supporta la scalabilità dei picchi di domanda imprevedibili di modelli e agenti, definire una strategia open source per gestire l'accesso ai modelli garantisce una base stabile per l'Agentic AI, il fine tuning e l'IA su vasta scala.
Scegli un modello di IA gen dalla nostra raccolta convalidata
Utilizza qualsiasi modello di IA gen o scegli nella nostra raccolta ottimizzata di modelli open source di terze parti, convalidati per essere eseguiti in modo efficiente sulla piattaforma Red Hat AI.
La convalida del modello di Red Hat AI si esegue tramite strumenti open source, quali GuideLLM, Language Model Evaluation Harness e vLLM . Ciò assicura la riproducibilità ai clienti e garantisce che i modelli siano convalidati, affidabili e distribuiti in modo coerente nei diversi ambienti.
Scegli tu i tuoi fornitori
Collaboriamo con fornitori di software e hardware e community open source per offrire una soluzione di IA completa.
Accedi ai prodotti e ai servizi dei partner testati, supportati e certificati per le nostre tecnologie.
Passaggi successivi
Prova la soluzione
Lorem ipsum dolor sit amet consectetur. Tristique sapien gravida adipiscing.
Acquista la soluzione
Lorem ipsum dolor sit amet consectetur. Tristique sapien gravida adipiscing.
Inizia subito
Lorem ipsum dolor sit amet consectetur. Tristique sapien gravida adipiscing.
Contatta Red Hat
1 Studio di Forrester Consulting, commissionato da Red Hat. "Forrester Total Economic Impact™ Of Red Hat AI". Febbraio 2026.