Cos'è l'inferenza dell’IA?

Copia URL

L'inferenza dell’IA è il momento in cui un modello di IA fornisce una risposta basata sui dati. Quella che genericamente chiamiamo IA è in realtà il prodotto dell'inferenza, il momento risolutivo con il quale si conclude un processo più lungo e complesso di machine learning.

L'addestramento dei modelli di IA con dati sufficienti aiuta a migliorare la velocità e la precisione dell'inferenza IA.

I vantaggi dell'inferenza IA

Ad esempio, affinché un modello di IA, addestrato con dati relativi agli animali come le differenze e le somiglianze, i comportamenti o le condizioni di salute, riesca a creare connessioni e a identificare schemi, è necessario un set di dati di grandi dimensioni.

Se l'addestramento è efficace, il modello può generare le inferenze, ad esempio identificare una razza canina, riconoscere il miagolio di un gatto o perfino segnalare la possibilità che un cavallo imbizzarrisca. Benché non abbia mai interagito con questi animali se non all'interno di un set di dati astratti, la quantità dei dati utilizzati per addestrare il modello consente di generare inferenze in un nuovo ambiente e in tempo reale.

Funzionano così anche le connessioni elaborate dal cervello umano. Libri, film e risorse online possono fornirci informazioni sui diversi animali. Possiamo guardare immagini e video e ascoltare i suoni emessi dagli animali. Quando poi visitiamo uno zoo, siamo capaci di inferire e di riconoscere un tipo di animale specifico. Anche se non siamo mai stati prima in un giardino zoologico, riusciremo a identificare l'animale grazie alle ricerche che abbiamo svolto. È lo stesso processo che mettono in atto i modelli di IA durante un'inferenza.

Scopri le novità e i prossimi sviluppi di Red Hat AI durante il prossimo evento dal vivo. Segui la prossima sessione live. 

Scopri le soluzioni Red Hat AI

L'inferenza IA è la fase operativa dell'intelligenza artificiale, ovvero il momento in cui il modello è in grado di applicare alle situazioni concrete ciò che ha appreso dall'addestramento. È questa abilità nell'identificare schemi e giungere a conclusioni che differenzia l'intelligenza artificiale dalle altre tecnologie. Questa capacità di dedurre può rivelarsi utile tanto nelle attività pratiche quotidiane quanto nella programmazione informatica più complessa.

Tuttavia, l'inferenza subisce molta pressione da modelli che continuano a crescere. Man mano che i modelli diventano più complessi, l'inferenza diventa più lenta.

Affinché l'inferenza funzioni al meglio, i modelli di IA devono eseguire molti calcoli in un breve periodo di tempo. Pertanto, fattori come le dimensioni del modello, il volume elevato degli utenti e la latenza possono limitare le prestazioni. Quando i modelli richiedono più dati e più memoria, hardware e acceleratori faticano a tenere il passo.

Ecco perché l'hardware e il software che supportano le tue funzionalità di inferenza dell'IA aziendale possono determinare il successo o il fallimento della tua strategia di IA.

Scopri di più sull'importanza dell'inferenza

Red Hat AI

A livello aziendale, l'inferenza IA può rivelarsi utile in numerose situazioni. Di seguito alcuni esempi.

Sanità: L'inferenza IA può aiutare gli operatori sanitari a confrontare l'anamnesi dei pazienti con i dati attuali e a individuare schemi e anomalie più rapidamente rispetto agli esseri umani. Come ad esempio un valore anomalo in un esame cerebrale o un battito cardiaco lievemente aritmico. L'inferenza IA può riconoscere i segnali che minacciano la salute del paziente con largo anticipo e in tempi più brevi. 

Settore finanziario: se addestrata con set di dati di grandi dimensioni in ambito bancario e creditizio, l'inferenza IA sarà in grado di identificare errori o dati insoliti in tempo reale, identificando in anticipo le frodi. Ciò permette di ottimizzare le risorse destinate al servizio clienti, di proteggere la privacy dei clienti e di migliorare la reputazione degli operatori del settore.

Settore automotive: Con l'introduzione dell'IA nel mondo delle automobili, le autovetture autonome stanno cambiando il nostro modo di guidare. L'inferenza IA è in grado di individuare i percorsi più efficienti per arrivare a una destinazione da un punto di partenza specifico, o di frenare all'approssimarsi di un segnale di stop, migliorando tanto il comfort quanto la sicurezza dei passeggeri del veicolo.

IA predittiva e IA generativa a confronto

Molti altri settori utilizzano l'inferenza IA in modi anche creativi. Può essere applicata in un fast food dove ordinare cibo senza scendere dall'auto, in una clinica veterinaria o all'accoglienza in un albergo. Molte aziende trovano nuove modalità per sfruttare questa tecnologia a proprio favore, per migliorare la precisione, risparmiare tempo e denaro e mantenere il proprio vantaggio rispetto ai competitor.

 Gli scenari di utilizzo dell'IA e del ML 

Il processo con il quale i dati vengono utilizzati per insegnare al modello come creare connessioni e identificare schemi è l'addestramento dell'IA. Se l'addestramento è il processo di insegnamento, l'inferenza è il modello IA in azione.

Cosa sono i modelli fondativi per l'IA? 

La maggior parte dell'addestramento dell'IA avviene nelle fasi iniziali della creazione del modello. Completato l'addestramento il modello potrà creare connessioni anche con dati mai utilizzati prima. Se il set di dati impiegato per l'addestramento è di grandi dimensioni, il modello potrà generare un numero di connessioni maggiore e quindi inferenze più accurate. Qualora il modello incontrasse difficoltà a produrre inferenze accurate dopo l'addestramento, il fine tuning potrà migliorarne la precisione e aggiungere ulteriori conoscenze.

L'addestramento e l'inferenza IA sono le modalità con le quali l'intelligenza artificiale emula le capacità del cervello umano, come quella di dedurre in base a prove e ragionamenti. 

Fattori come le dimensioni del modello possono modificare la quantità di risorse necessarie per manipolare il modello. 

Scopri in che modo i modelli più piccoli possono semplificare l'inferenza della GPU.

Le diverse tipologie di inferenza IA offrono vantaggi in svariati contesti.

  • Inferenza batch: l'inferenza batch prende il nome dal modo in cui riceve ed elabora i dati: in grandi gruppi. Questo approccio non produce inferenze in tempo reale, ma elabora i dati in base a una data frequenza, a volte ogni ora o anche giornalmente, secondo la loro quantità e l'efficienza del modello di IA. Possiamo definire queste inferenze anche "inferenze offline" o "inferenze statiche".
  • Inferenza online: l'inferenza online o "dinamica" può fornire una risposta in tempo reale, ma richiede hardware e software capaci di ridurre i limiti della latenza e di supportare previsioni ad alta velocità. L'utilità dell'inferenza online è tangibile soprattutto all'edge, perché l'intelligenza artificiale lavora in prossimità dei dati, come nel caso di uno smartphone, di un'automobile o di un ufficio remoto con connessione limitata.

    ChatGPT di OpenAI è un valido esempio di inferenza online che richiede un notevole supporto operativo iniziale per poter poi fornire risposte rapide e accurate.

  • Inferenza in streaming: l'inferenza in streaming descrive un sistema di IA che non viene necessariamente utilizzato per comunicare con gli esseri umani. Invece di prompt e richieste, il modello riceve un flusso costante di dati con i quali può fare previsioni e aggiornare il proprio database interno. Questo tipo di inferenza è in grado di monitorare le modifiche, mantenere la regolarità o anticipare eventuali problemi prima che si verifichino. 

Scopri come l'inferenza distribuita con vLLM può ridurre gli ostacoli

Un server di inferenza IA è il software che permette a un modello di IA di passare dalla fase di addestramento a quella operativa. Si avvale del machine learning per aiutare il modello ad applicare ciò che ha appreso e a utilizzarlo per generare inferenze.

Per ottenere risultati efficienti, è necessario che il server di inferenza IA e il modello di IA siano compatibili. Di seguito alcuni esempi di server di inferenza e i modelli con cui si integrano meglio:

  • Server di inferenza multimodale: questo tipo di server di inferenza è in grado di supportare più modelli contemporaneamente e quindi di ricevere dati in forma di codice, immagini o testo e di elaborare le diverse inferenze su un unico server. Utilizzando la GPU e la memoria CPU in modo più efficiente, un server di inferenza multimodale può supportare più di un modello, riuscendo così a rendere più scalabile l'hardware e a ottimizzare i costi.
  • Server di inferenza a modello singolo: questo server di inferenza supporta solo un modello, anziché diversi. Il processo di inferenza IA è specializzato nella comunicazione con un modello addestrato per uno scenario di utilizzo esclusivo. Può essere in grado di elaborare i dati in forma di testo o solo in forma di codice. La sua specificità lo rende particolarmente efficiente e in grado di facilitare le decisioni o l'elaborazione di vincoli delle risorse in tempo reale. 

Scopri i vantaggi e gli scenari di utilizzo di un'inferenza rapida ed efficiente

Scalabilità, risorse e costi sono i principali ostacoli all'esecuzione dell'inferenza IA.

  • Complessità: è più semplice insegnare a un modello a eseguire attività semplici come la creazione di un'immagine o la comunicazione a un cliente di una politica di restituzione. Per permettere ai modelli di apprendere dati più complessi, per poi individuare frodi finanziarie o identificare anomalie mediche, durante l'addestramento è necessario fornire più dati e successivamente più risorse che li supportino. 
     
  • Risorse: i modelli più complessi richiedono hardware e software specializzati per supportare la grande quantità di elaborazione dei dati che viene eseguita quando un modello genera inferenze. Un componente essenziale di queste risorse è la memoria della CPU, che viene spesso considerata come il centro di controllo del computer. Quando un modello si prepara a utilizzare i dati di addestramento di cui dispone per produrre una risposta, deve poter fare riferimento a questi dati, che si trovano nello spazio di memoria della CPU. 
     
  • Costo: tutti questi pezzi del puzzle che rendono possibile l'inferenza IA non sono economici. Se l'obiettivo è la scalabilità o il passaggio al più recente hardware in grado di supportare l'IA, le risorse necessarie a realizzarlo possono rivelarsi consistenti. Restare al passo con l'innovazione dell'IA può quindi risultare difficile per le aziende, perché i costi aumentano in proporzione alla maggiore complessità dei modelli e all'evoluzione dell'hardware.  

Un motore di inferenza specifico, noto come vLLM, aiuta a tenere a bada queste sfide. vLLM accelera l'output delle applicazioni di IA generativa sfruttando al meglio la memoria GPU. vLLM è una libreria di codice open source, gestita dalla community vLLM, che consente ai modelli linguistici di grandi dimensioni (LLM) di eseguire calcoli in modo più efficiente e scalabile. Utilizza strumenti come LLM Compressor per accelerare l'inferenza, alleggerendo il lavoro del team e delle risorse.

Che cos'è vLLM?

 

L'inferenza IA viene utilizzata in scenari di utilizzo con volumi alti e variabili elevate. Tuttavia, per distribuire gli LLM in modo coerente e scalabile è necessario disporre di molta potenza di elaborazione, risorse e competenze operative specializzate. vLLM può risolvere queste sfide utilizzando in modo più efficiente l'hardware necessario per supportare l'inferenza dell'IA in azienda. Questo è il motivo per cui vLLM è particolarmente interessante per i settori che hanno bisogno di flessibilità e controllo, oltre alla velocità.

vLLM e Ollama a confronto: quando utilizzare ciascun framework

Essendo una soluzione open source, vLLM consente alle aziende di: 

  • Possedere e gestire le proprie GPU.
  • Controllare i loro dati.
  • Sperimentare modelli all'avanguardia non appena vengono rilasciati.

È possibile distribuire vLLM su una vasta gamma di hardware, tra cui GPU NVIDIA e AMD, TPU di Google, Intel Gaudi e AWS Neuron. Inoltre, vLLM non si limita a un hardware specifico, il che significa che funziona nel cloud, nel data center o all'edge.  

Scopri come le organizzazioni famose stanno utilizzando vLLM per ottenere una scalabilità efficace in questi 3 scenari di utilizzo reali.

Scopri 3 scenari di utilizzo reali di vLLM

Per superare sfide come la latenza e i vincoli delle risorse, Mixture of Experts (MoE) crea una rete neurale che supporta un'inferenza più rapida su larga scala.

MoE è una tecnica di architettura dei modelli che accelera l'inferenza IA instradando le attività alla parte più adatta del modello.

I modelli MoE sono addestrati appositamente per rispondere in modo rapido e preciso a determinate sottocategorie di domande. Utilizza tecniche come la sparsità nella sua rete neurale alla base e nell'architettura di deep learning. In questo modo gli LLM si muovono in maniera più rapida e precisa in modo scalabile.

Scopri di più su MoE e su come accelerare l'inferenza

Con l'inferenza distribuita i modelli di IA elaborano i carichi di lavoro in modo più efficiente, suddividendo le attività di inferenza su un gruppo di dispositivi interconnessi. È l'equivalente software del proverbio: "L'unione fa la forza".

L'inferenza distribuita supporta un sistema che suddivide le richieste su un parco hardware costituito da server fisici e cloud, in cui parallelamente ogni server di inferenza elabora la parte assegnata e genera un output. Ne risulta un sistema resiliente e osservabile per l'erogazione di servizi basati sull'IA coerenti e scalabili.

L'inferenza distribuita è supportata su vLLM e utilizza tecniche come il parallelismo tensoriale e le architetture Mixture-of-Experts (MOE). 

Scopri di più sull'inferenza distribuita 

Red Hat® AI è progettato per un'inferenza rapida, flessibile ed efficiente tramite un server basato su vLLM. Collega in modo affidabile i modelli ai dati per unificare la personalizzazione e lo sviluppo di agenti specializzati su un'unica piattaforma. Realizzati su una base open source, i nostri prodotti offrono il pieno controllo dei flussi di lavoro dell'IA, dall'inizio alla fine, su qualsiasi scala. 

L'offerta Red Hat AI include Red Hat AI Inference, uno stack di inferenza che fornisce il controllo operativo necessario per l'esecuzione di qualsiasi modello su qualsiasi acceleratore nel cloud ibrido. Ottieni un'inferenza rapida, efficiente e conveniente in modo scalabile. 

Scopri le soluzioni Red Hat AI

L'adattabilità enterprise: predisporsi all'IA per essere pronti a un'innovazione radicale

Questo ebook, redatto da Michael Ferris, COO e CSO di Red Hat, illustra il ritmo del cambiamento e dell'innovazione tecnologica radicale con l'IA che i leader IT devono affrontare nella realtà odierna.

Continua a leggere

RAG e fine tuning

RAG e fine tuning hanno entrambi l'obiettivo di migliorare gli LLM, ma per farlo utilizzano metodi diversi. La RAG evita di alterare il modello, mentre il fine tuning richiede l'adeguamento dei parametri.

Introduzione ad AIOps

AIOps è un'intelligenza artificiale per le operazioni IT con un approccio specifico all'automazione delle operazioni IT che si avvale del machine learning e di altre tecniche di IA avanzate.

Cos'è il machine learning?

Il machine learning è una tecnica che permette di addestrare i computer a individuare schemi, eseguire analisi predittive e imparare dall'esperienza, senza alcuna programmazione esplicita.

AI/ML: risorse consigliate