Use Case

Schnelle, effiziente Inferenz mit Red Hat AI

Wenn Sie die Inferenz optimieren, werden Ihre Modelle schneller, intelligenter und zuverlässiger.

Wählen Sie ein beliebiges Modell auf einem beliebigen Beschleuniger in einer beliebigen Cloud-Umgebung aus.

Nutzen Sie die vorhandene Infrastruktur optimal, um die Kosten pro Token zu senken und den Durchsatz zu steigern.

Skalieren Sie dynamisch dank intelligenter verteilter Inferenz und Einblicken in unvorhersehbare Nachfrageschwankungen.

Inferenz ist das Kernstück generativer KI. Doch je komplexer die Modelle werden, desto langsamer wird die Inferenz, und die Dinge können kompliziert werden. 

Für Inferenz in großem Umfang benötigen Modelle viel Storage, Arbeitsspeicher und Rechenleistung, was einen Großteil Ihres Budgets verschlingen kann. Und die rasche Einführung agentischer KI erhöht die Compute Workload noch weiter.

Red Hat® AI optimiert die Inferenz, damit Sie kosteneffektiv arbeiten und Ihre Teams skalieren sowie agentische KI zuverlässig unterstützen können.

Ihre Möglichkeiten

Red Hat AI unterstützt schnelle, konsistente und kosteneffektive Inferenz in großem Umfang. Es basiert auf Open Source-Technologien wie vLLM und llm-d und bietet die Flexibilität, in der Hybrid Cloud mit dem Modell und Beschleuniger Ihrer Wahl zu skalieren. 

Modelle in der gesamten Hybrid Cloud bereitstellen und skalieren

Sorgen Sie für konsistente Abläufe über verschiedene Hardwarebeschleuniger (GPUs, TPUs) hinweg und führen Sie Modelle On-Premise, in der Cloud oder am Edge aus.

Modelle und Beschleuniger auswählen

Wählen Sie eine beliebige Kombination aus Modellen und Hardwarebeschleunigern bei konsistenter Benutzererfahrung. Entwickeln Sie eine einheitliche Model as a Service-Architektur, ohne den gesamten KI-Stack neu erstellen zu müssen.

Modelle beliebiger Größe komprimieren und quantisieren

Reduzieren Sie die Rechenauslastung und die damit verbundenen Kosten, ohne dabei Abstriche bei der Modellgenauigkeit zu machen. 

Durchsatz durch Senken der Kosten pro Token steigern

Nutzen Sie Ihre bestehende Infrastruktur optimal mit vLLM und llm-d. Durch die Optimierung der verfügbaren Ressourcen ermöglichen Ihnen niedrige Latenz und ein hoher Durchsatz kosteneffektive Inferenz und Agenten in großem Umfang.

Gesamten Modell-Lifecycle verwalten

Entwickeln Sie Modelle mit vertrauten Tools und Frameworks auf einer einzigen, zentralisierten Plattform mit einem Kubernetes-Kern.

Für zuverlässigen Betrieb in großem Umfang sorgen

Alle Inferenz-Workloads werden durch kontrollierten Zugriff, die Durchsetzung von Richtlinien und Beobachtbarkeit geregelt. 

Models as a Service mit Red Hat AI

Erfahren Sie mehr über Models as a Service, die von Grund auf skalierbar, offen und kosteneffizient sind.

233 % ROI mit Red Hat AI

Eine von Forrester Consulting im Auftrag von Red Hat durchgeführte Studie ergab, dass ein Verbundunternehmen – basierend auf aktuellen Kunden von Red Hat AI – durch den Einsatz von Red Hat AI einen ROI von 233 % erzielte.1

Funktionsweise

Red Hat AI bietet flexible, auf Open Source basierende Deployment-Optionen für eine effiziente, kosteneffektive und kontrollierte Inferenz für viele verschiedene Modelle, Agenten und Anwendungen. 

AI Model Inference with Red Hat AI | Red Hat Explains. Dauer des Videos: 4:19

Features

Red Hat AI bietet umfassende Kontrolle über Modelle, Agenten und Hardware zur Verbesserung der Inferenz in großem Umfang. 

vLLM

Maximierung von Durchsatz und GPU-Auslastung

vLLM ist eine Inferenz-Engine, die darauf ausgelegt ist, den Durchsatz zu maximieren und die Antwortzeiten von Hardwarebeschleunigern zu verkürzen. Es nutzt den PagedAttention-Algorithmus, um die GPU-Auslastung zu optimieren und die Ausgabe von generativen KI-Anwendungen zu beschleunigen. 

Nutzen Sie vLLM, um das Deployment beliebiger gen KI-Modelle auf beliebigen KI-Beschleunigern zu optimieren und gleichzeitig für ein kontrolliertes und vorhersehbares Inferenzverhalten in Produktivumgebungen zu sorgen.

llm-d

Beschleunigung der verteilten Inferenz in großem Umfang

llm-d ist ein Kubernetes-natives Open Source Framework, das die verteilte LLM-Inferenz in großem Umfang beschleunigt. 

Das heißt, wenn ein KI-Modell komplizierte Anfragen mit vielen Daten erhält, bietet llm-d ein Framework, das die Verarbeitung beschleunigt. Dank der zugänglichen, modularen Architektur eignet sich llm-d ideal als Plattform für verteilte LLM-Inferenz in großem Umfang. Dies ermöglicht eine skalierbare Inferenz unter Wahrung von Konsistenz, Kontrolle und Governance in verteilten Workloads.

Gen KI-spezifische Telemetrie

Einblicke in die Erfüllung strenger Service Level Objectives (SLOs)

Nutzen Sie Metriken und Insights aus den Modellen in der Produktion, um herauszufinden, wo und wie Ihre Modelle verbessert werden können. Lassen Sie modellspezifische Performance-Metriken wie Time to First Token, KV-Cache-Hitrate und GPU-Auslastung anzeigen. Nutzen Sie diese Metriken, um die Performance zu überwachen, Anomalien zu erkennen und sicherzustellen, dass die Inferenz den operativen, sicherheitstechnischen und richtlinienbezogenen Anforderungen entspricht. 

Toolkit zur Modelloptimierung

Komprimierung und Quantisierung von Modellen zur Reduzierung von Ressourcenbeschränkungen

Optimieren Sie Ihre Auswahl an benutzerdefinierten oder Basismodellen mit einem vielfältigen Modell-Toolkit. Setzen Sie Techniken wie Quantisierung oder Sparsity ein, um Hardwareanforderungen zu senken und Inferenzkosten zu reduzieren. 

Tools wie LLM Compressor sind im Toolkit enthalten. Es nutzt die aktuellsten Erkenntnisse aus der Forschung zur Modellkomprimierung, um LLMs kleiner, energieeffizienter und schneller zu machen. So lassen sich die Hardwareanforderungen reduzieren und die Effizienz steigern – ohne Verlust an Genauigkeit.

Über seine Kernfunktionen hinaus lässt sich LLM Compressor umfassend in andere Tools und Plattformen integrieren. Es unterstützt Inferenz innerhalb des Hugging Face Transformers-Ökosystems und ermöglicht so eine Genauigkeitsüberprüfung vor dem Deployment. Es lässt sich zudem mit Frameworks zum Fine Tuning verbinden, sodass Nutzende bei überwachtem Training Ressourcen schonen können.

Es trägt dazu bei, all das zu erreichen und gleichzeitig für Validierung, Reproduzierbarkeit und Kontrolle über das Modellverhalten vor dem Deployment zu sorgen.

Mehr über LLM Compressor erfahren

Model as a Service

Verwaltung des Zugangs zu internen Modellen mit einer offenen, portierbaren Strategie

Red Hat AI umfasst die Integration eines gemanagten API-Gateways, mit dem Engineers von KI-Plattformen interne MaaS-Funktionen (Models as a Service) einrichten können. Es bietet eine offene, modulare und anbieterunabhängige Möglichkeit, Modelle in Hybrid Cloud-Umgebungen bereitzustellen und zu betreiben.

Durch kontrollierten Zugang zu Modellen über eine zentralisierte MaaS-Architektur können Sie festlegen, wer auf bestimmte Modelle zugreifen kann, Richtlinien durchsetzen und die Nutzung für viele verschiedene Nutzende, Anwendungen und Agenten überwachen. Dies ermöglicht eine zuverlässige, auditierbare und richtliniengesteuerte Nutzung von Modellen in großem Umfang.

Dank vereinfachter Möglichkeiten zur Nutzung von KI-Modellen und GPU-Ressourcen können Entwicklungsteams den Zugriff auf API-Endpunkte optimieren, während Platform Engineers die Nutzung ihrer leistungsstarken, selbst gehosteten Modelle steuern, verwalten und überwachen können.

In Verbindung mit einem Inferenz-Stack, der den unvorhersehbaren Bedarf und den Umfang von Modellen und Agenten unterstützen kann, bildet eine offene Strategie zur Verwaltung des Modellzugriffs eine solide Grundlage für agentische KI, Fine Tuning und KI in großem Umfang.

Red Hat AI Modellkatalog

Auswahl eines gen KI-Modells aus unserer validierten Sammlung

Verwenden Sie ein beliebiges gen KI-Modell, oder wählen Sie aus unserer optimierten Sammlung von Open Source-Modellen von Drittanbietern aus, die für eine effiziente Ausführung auf der Red Hat AI Plattform validiert sind.

Die Validierung von Modellen in Red Hat AI erfolgt mit Open Source Tools wie GuideLLM, Language Model Evaluation Harness und vLLM. Dies unterstützt die Reproduzierbarkeit für Kunden und sorgt dafür, dass die Modelle validiert, zuverlässig und in beliebigen Umgebungen konsistent bereitgestellt werden.

Auswahl Ihrer bevorzugten Anbieter

Wir arbeiten mit Software- und Hardwareanbietern sowie mit Open Source Communities zusammen, um eine ganzheitliche KI-Lösung anzubieten. 

So erhalten Sie Zugriff auf unterstützte Partnerprodukte und -services, die für die Nutzung mit unseren Technologien getestet und zertifiziert sind.

Dell Technologies Logo
Cisco-Logo in quadratischer Form
Intel Logo
Nvidia Logo
AMD Logo

Nächste Schritte

Jetzt testen

Lorem ipsum dolor sit amet consectetur. Tristique sapien gravida adipiscing.

Jetzt kaufen

Lorem ipsum dolor sit amet consectetur. Tristique sapien gravida adipiscing.

Schneller Einstieg

Lorem ipsum dolor sit amet consectetur. Tristique sapien gravida adipiscing.

Sprechen Sie mit Red Hat

1 Studie von Forrester Consulting, im Auftrag von Red Hat: „Forrester Total Economic Impact™ Of Red Hat AI.“ Februar 2026.