LLM-Inferenz über die Grenzen eines einzelnen Knotens hinaus skalieren

llm-d ist ein Kubernetes-natives Framework für verteilte LLM-Inferenz, mit getrenntem Prefill und Decode und mit KV-Cache-Transfer. VSHN rollt llm-d auf Schweizer Cloud-Infrastruktur aus und betreibt es für Organisationen, die über einen einzelnen Knoten hinauswachsen, mit Daten, die in der Schweiz bleiben.

Beratung buchen
Kubernetes-nativ verteilte Inferenz
seit 2014 DevOps-Firma
ISO 27001 zertifiziert

Beratung und Architektur für llm-d

Produktionsreife llm-d-Topologien entwerfen und ausrollen, zugeschnitten auf deine Inferenz-Workloads. VSHN entwirft disaggregierte Serving-Stacks mit getrennten Prefill- und Decode-Phasen, optimiertem KV-Cache-Transfer und intelligentem Routing der Anfragen. Wir helfen dir bei der Wahl des Model-Server-Backends, der GPU-Zuteilung und des Clusteraufbaus in Kubernetes, für maximalen Durchsatz und minimale Latenz.

Intelligentes Scheduling der Inferenz

Die Routing-Schicht von llm-d nutzen, für ein Scheduling, das den Prefix-Cache berücksichtigt, und für Fairness zwischen Mandanten. VSHN konfiguriert produktionsreife Inferenz-Gateways mit lastabhängigem Routing, Prioritätswarteschlangen und Session Affinity, damit deine Anwendungen eine kurze Zeit bis zum ersten Token erreichen und GPU-Ressourcen zugleich fair über Teams und Workloads geteilt werden.

Prefill und Decode trennen

Prefill- und Decode-Phase auf eigene GPU-Pools aufteilen und damit die Zeit bis zum ersten Token und die Latenz zwischen den Tokens unabhängig voneinander optimieren. VSHN rollt die disaggregierte Architektur von llm-d aus, mit KV-Cache-Transfer zwischen den Knoten. So skalierst du jede Phase für sich, passend zum Profil deines Workloads und zu deinen Latenzvorgaben, auf Kubernetes-Infrastruktur.

Schweizer Cloud und GPU-Infrastruktur

LLM-Inferenz, Modellgewichte und Protokolle der Anfragen bleiben in Schweizer Rechenzentren. VSHN betreibt auf Exoscale, Cloudscale und weiteren Schweizer Cloud-Anbietern, was DSGVO-Konformität und Datenstandort für Organisationen sichert, die heikle Prompts und Antworten nicht in Hyperscaler-Regionen ausserhalb der Schweiz schicken können.

Kubernetes-nativer Betrieb

llm-d auf produktiven Kubernetes-Clustern betreiben, mit Helm-Charts, automatischer Skalierung und GitOps-Abläufen. VSHN rollt auf APPUiO, auf Red Hat OpenShift und auf Kubernetes-Plattformen im Unternehmen aus, mit den NVIDIA Device Plugins, GPU-Ressourcenkontingenten und horizontalem Autoscaling anhand der Queue-Tiefe und der Latenzvorgaben, damit Kosten und Leistung zusammenpassen.

Support und Incident Response rund um die Uhr

Inferenzlatenz, Durchsatz, Rate der Tokengenerierung und GPU-Auslastung über deine ganze Serving-Flotte hinweg beobachten. VSHN bindet Prometheus, Grafana und eigene Dashboards in deine Plattform ein, mit Betriebssupport rund um die Uhr und Incident Response nach SLA, damit Leistungsprobleme erkannt und behoben sind, bevor sie deine Nutzenden und deine Anwendungen treffen.

Häufige Fragen zu llm-d

Was ist llm-d, und wie unterscheidet es sich von vLLM?

llm-d ist ein quelloffenes, Kubernetes-natives Framework für verteilte Inferenz (eine gemeinsame Initiative von Red Hat, Google, IBM Research, CoreWeave, NVIDIA und weiteren Beitragenden), das über Model-Servern wie vLLM sitzt. Im März 2026 wurde es in die CNCF Sandbox aufgenommen. Während vLLM die Modellausführung auf einem Knoten übernimmt, ergänzt llm-d intelligentes Routing der Anfragen, die Trennung von Prefill und Decode sowie verteilte Verwaltung des KV-Cache über mehrere Knoten. Unterstützt werden Modelle wie Llama, Mistral und Apertus (das Schweizer KI-Grundlagenmodell unter Apache 2.0). VSHN rollt beide Technologien aus und hilft dir, die passende Architektur nach Grösse und Latenzvorgaben zu wählen.

Welche Plattformen unterstützt VSHN für llm-d-Workloads?

VSHN rollt llm-d-Workloads auf APPUiO (unserer verwalteten Kubernetes-Plattform), auf Red Hat OpenShift, auf privater Cloud-Infrastruktur im Unternehmen und bei souveränen Cloud-Partnern aus und betreibt sie dort. Alle Plattformen laufen in Schweizer oder europäischen Rechenzentren, mit einem SLA von bis zu 99,99 Prozent Verfügbarkeit. Wir helfen dir, die passende Plattform nach deinen Anforderungen an Compliance, Leistung und Budget zu wählen.

Welche Cloud-Anbieter stehen für llm-d zur Verfügung?

VSHN betreibt auf mehreren Schweizer Cloud-Anbietern, darunter Exoscale und Cloudscale, sowie bei europäischen souveränen Cloud-Partnern. Für Organisationen mit GPU-beschleunigten Workloads arbeiten wir mit Anbietern zusammen, die GPU-Instanzen in Schweizer Rechenzentren anbieten, in der Public wie in der Private Cloud. Die gesamte Infrastruktur läuft unter einem einzigen SLA, mit Support rund um die Uhr aus unserem Betriebsteam.

Wie verbessert die Trennung von Prefill und Decode die Leistung?

LLM-Anfragen sind ungleichförmig: eine kurze Frage braucht weit weniger Ressourcen als eine Anfrage, die ein langes Dokument verarbeitet. Die Prefill-Phase (das Verarbeiten des Prompts) ist rechenlastig, die Decode-Phase (das Erzeugen der Tokens nacheinander) speicherlastig. Die Trennung legt beide auf eigene GPU-Pools, sodass jede für sich skaliert und optimiert werden kann. VSHN richtet den KV-Cache-Transfer zwischen den Knoten ein und erreicht damit eine kürzere Zeit bis zum ersten Token und mehr Gesamtdurchsatz als monolithisches Serving, bei dem eine grosse Anfrage kleinere blockiert.

Wie kalkuliert und offeriert VSHN ein llm-d-Mandat?

Jedes Mandat beginnt mit einem kostenlosen Architekturgespräch, in dem wir deine Anforderungen an Model Serving, den GPU-Bedarf und die regulatorischen Randbedingungen aufnehmen. Danach liefert VSHN ein schriftliches Scope-Dokument mit einer Offerte in CHF, zum Festpreis oder nach Aufwand. Typische Mandate umfassen den Clusterentwurf, das Ausrollen von llm-d, den Aufbau der Observability mit Prometheus und Grafana sowie automatisierte Backups für Modellartefakte und Konfigurationsdaten. Verteiltes Serving arbeitet mit Modellen von zehn Gigabyte aufwärts, den Speicher dimensionieren wir entsprechend. In der Scoping-Phase entsteht keine Verpflichtung.

Wie stellt VSHN die Datenhoheit bei llm-d-Workloads sicher?

VSHN betreibt die gesamte llm-d-Infrastruktur in Schweizer Rechenzentren, betrieben von Schweizer oder europäischen souveränen Cloud-Anbietern. Modellgewichte, eingehende Prompts, erzeugte Antworten und Inferenz-Logs verlassen die gewählte Rechtsordnung nicht. Der betriebliche Zugriff erfolgt durch Engineers in der Schweiz, und für die Compliance-Berichterstattung liefern wir Audit-Trails.

Lässt sich llm-d in bestehende KI-Pipelines einbinden?

Ja. llm-d stellt über seine Gateway-Schicht eine zu OpenAI kompatible API bereit, bestehende Anwendungen mit OpenAI-Client-Bibliotheken können also ohne Codeänderung auf selbst betriebene Modelle wechseln. VSHN bindet llm-d ausserdem an LiteLLM-Gateways, an Pipelines für Retrieval Augmented Generation und an betreutes PostgreSQL mit pgvector als Vektorspeicher an, mit automatisierten Backups und einem SLA von bis zu 99,99 Prozent wie bei allen von VSHN betriebenen Datenbanken.

Welches Monitoring und welche Observability liefert VSHN für llm-d?

VSHN bindet Prometheus und Grafana in jede verwaltete Plattform ein, mit eigenen Dashboards für llm-d-spezifische Kennzahlen: Inferenzlatenz (p50, p95, p99), Tokens pro Sekunde, GPU-Auslastung, Queue-Tiefe und geschätzte Kosten pro Anfrage. Alarmregeln benachrichtigen dein Team und unser Operations Center rund um die Uhr, sobald Messwerte Schwellen überschreiten. So fallen Leistungsprobleme auf, bevor sie bei den Nutzenden ankommen.

Wie starte ich mit der llm-d-Beratung von VSHN?

Melde dich über das Formular unten für ein kostenloses Erstgespräch. Wir nehmen deine Anforderungen an Model Serving, an die Plattform und an die Compliance auf und schlagen dann eine Architektur auf APPUiO, OpenShift oder deiner bevorzugten Infrastruktur vor. Die Beratung zu llm-d ist Teil der breiteren Praxis von VSHN rund um den Betrieb von LLM. Das Gesamtbild steht auf llmops.ch.

Beratung zu llm-d buchen

Erzähl uns von deinen Anforderungen an verteilte Inferenz. VSHN bietet ein kostenloses Erstgespräch zur llm-d-Architektur, zur GPU-Dimensionierung und einen Vorschlag mit klarem Umfang für deine Installation auf Schweizer Infrastruktur.

Kostenloses Gespräch buchen

Oder stelle deine Frage