Skip to main content
NexPatch
Wissen · Vergleich

Sprachmodell selbst betreiben oder mieten?

Ob sich ein selbst betriebenes Sprachmodell oder eine Abrechnung pro Anfrage lohnt, hängt vom Anfragevolumen ab. Bei niedrigem Volumen ist die Abrechnung pro Anfrage meist günstiger, weil Fixkosten für Hardware und Personal entfallen. Bei hohem, dauerhaftem Volumen kehrt sich das Verhältnis um, weil Eigenbetrieb die laufenden Stückkosten senkt.

Eigenbetrieb
Schnittstelle
ab 100.000 Anfragen im Monat

Zwei Kostenmodelle mit unterschiedlicher Logik

Ob ein Unternehmen KI über eine Cloud API nutzt oder Modelle auf eigenen GPUs betreibt, wird oft nach Gefühl entschieden. Dabei folgen beide Wege einer klaren Logik, die sich rechnen lässt.

Bei der Abrechnung pro Token zahlen Sie für jede Anfrage. Eingaben und Ausgaben werden in Tokens gemessen, also in Wortbestandteilen, und mit einem festen Preis pro Million Tokens berechnet. Für den Start ist dieses Modell ideal: keine Investition, kein Betrieb, keine Wartezeit auf Hardware. Sie können am selben Tag beginnen. Mit jedem neuen Anwendungsfall wächst die Rechnung allerdings linear mit. Ein Assistent im Vertrieb, eine Dokumentenprüfung im Einkauf und ein Agent im Kundenservice addieren sich Monat für Monat.

Beim Eigenbetrieb kehrt sich die Logik um. Hardware, Strom, Kühlung, Wartung und Personal verursachen fixe Kosten, unabhängig davon, wie stark das System genutzt wird. Jede weitere Anfrage kostet dagegen fast nichts, solange die vorhandene Kapazität reicht. Der Eigenbetrieb belohnt Auslastung, die Abrechnung pro Token belohnt Zurückhaltung.

Daraus folgt die zentrale Frage jedes Kostenvergleichs: Wie viele Tokens verbraucht Ihr Unternehmen heute, und wie viele werden es in ein bis zwei Jahren sein?

Wo sich die Kostenlinien kreuzen

Trägt man beide Modelle über das monatliche Volumen auf, entsteht eine steigende Gerade für die Abrechnung pro Token und eine nahezu flache Linie für den Eigenbetrieb. Der Schnittpunkt ist der Break even. Unsere Auswertung im Beitrag „Das lokale KI Betriebssystem" kommt zu folgenden Schwellen:

•
Gegenüber Premium APIs, also den leistungsstärksten Modellen großer Cloud Anbieter, rechnet sich der Eigenbetrieb ab etwa 5 bis 10 Mio. Tokens pro Monat.
•
Gegenüber Budget APIs mit deutlich niedrigeren Preisen pro Token liegt die Schwelle bei etwa 50 bis 100 Mio. Tokens pro Monat.

Aufschlussreich ist der Blick auf die volle Laufzeit. Über 36 Monate gerechnet kommt der selbst gehostete Betrieb auf etwa 7,15 USD pro Mio. Tokens, die Nutzung über OpenAI auf etwa 6,90 USD. Beide Wege liegen damit erstaunlich nah beieinander. Der reine Preis pro Token trägt deshalb selten eine Entscheidung. Den Ausschlag geben Volumen, Auslastung, Datenschutz und die Frage, wer den Betrieb verantwortet.

Für Ihre eigene Situation lohnt es sich, die Werte mit realen Verbrauchsdaten durchzurechnen. Unser Kostenvergleichsrechner zeigt Ihnen, wo Ihr Unternehmen auf der Kurve liegt.

Vergleichstabelle: Eigenbetrieb gegen Abrechnung pro Token

KriteriumEigenbetrieb auf eigenen GPUsAbrechnung pro Token über Cloud API
KostenstrukturÜberwiegend fix: Hardware, Strom, Wartung, PersonalVariabel, wächst linear mit jeder Anfrage
StartaufwandBeschaffung, Einrichtung, AbsicherungGering, sofort nutzbar
Kosten pro zusätzlicher AnfrageNahezu null bis zur KapazitätsgrenzeKonstant pro Million Tokens
Wirtschaftlich abEtwa 5 bis 10 Mio. Tokens pro Monat gegenüber Premium APIs, etwa 50 bis 100 Mio. gegenüber Budget APIsUnterhalb dieser Schwellen
DatenhoheitDaten verlassen das eigene Netz nichtAbhängig von Anbieter, Vertrag und Rechtsordnung
BetriebsverantwortungIm Haus oder bei einem BetriebspartnerBeim API Anbieter
Anpassung an FachspracheFeintuning und eigene Modelle möglichEingeschränkt, je nach Anbieter
PlanbarkeitHoch, Kosten über die Laufzeit bekanntSchwankt mit Nutzung und Preisänderungen
AbhängigkeitVon Hardware und BetriebskompetenzVon Preisen, Modellversionen und Verfügbarkeit des Anbieters

Die Posten außerhalb der Rechnung

Viele Kostenvergleiche stellen den Preis einer GPU dem Preis pro Token gegenüber und hören dort auf. Damit fehlen genau die Posten, die im Alltag den Unterschied machen. Wer überwacht das System und bemerkt, wenn Antworten schlechter werden? Wer spielt Updates für Treiber, Laufzeitumgebung und Modelle ein und testet sie vorher? Wer reagiert nachts oder am Wochenende, wenn der Dienst steht? Wer pflegt Rechte, Protokolle und die Dokumentation für das nächste Audit?

On Premise verlagert operatives Risiko ins Haus. Das spricht nicht gegen den Eigenbetrieb, wohl aber für eine vollständige Rechnung. Zu den fixen Kosten gehören neben der Hardware auch Personalzeit für Betrieb und Bereitschaft, Redundanz oder Ersatzteile, Energie und Kühlung, Sicherheitsupdates sowie die Pflege der Anwendungen, die auf dem Modell aufsetzen. Wer diese Positionen nicht einpreist, vergleicht Äpfel mit halben Birnen.

Auf der Gegenseite fehlen in vielen Vergleichen ebenfalls Posten: Datenschutzprüfungen bei jedem neuen Anwendungsfall, Verträge mit Unterauftragnehmern und das Risiko, dass sich Preise oder Modellversionen ändern. Hinzu kommt die Rechtslage. Der US CLOUD Act gilt unabhängig vom Serverstandort. Ein europäisches Rechenzentrum eines US Anbieters schützt also nicht automatisch vor dem Zugriff US amerikanischer Behörden.

Für Unternehmen ohne eigenes Betriebsteam gibt es einen Mittelweg. Die Hardware steht im eigenen Rechenzentrum oder bei einem deutschen Hoster, der Betrieb liegt vertraglich bei einem Partner. So bleiben die Daten im Haus, ohne dass Ihre IT nachts Bereitschaft halten muss. Wie wir diesen Teil übernehmen, beschreiben wir unter KI Betrieb.

Auslastung und Software rechnen mit

Die Wirtschaftlichkeit des Eigenbetriebs hängt nicht nur an der Hardware, sondern daran, wie viele Anfragen sie in einer bestimmten Zeit verarbeitet. Die Software für die Modellbereitstellung spielt dabei eine größere Rolle, als viele erwarten. Eine aktuelle wissenschaftliche Messung zeigt bei zehn parallelen Nutzern rund 800 Tokens pro Sekunde mit vLLM gegenüber rund 150 Tokens pro Sekunde mit Ollama.

Für die Kostenrechnung bedeutet das: Dieselbe GPU kann je nach Software ein Vielfaches an Last tragen. Ein Werkzeug, das für Tests am Einzelplatz bequem ist, eignet sich nicht automatisch für den produktiven Betrieb mit vielen gleichzeitigen Nutzern. Wer den Eigenbetrieb kalkuliert, sollte deshalb nicht nur GPUs zählen, sondern die gesamte Bereitstellung planen: Laufzeitumgebung, Warteschlangen, Lastverteilung und ein Gateway, das Anfragen auf passende Modelle verteilt.

Ein solches Gateway ermöglicht auch hybrides Routing. Einfache Anfragen laufen auf einem kleinen lokalen Modell, vertrauliche Daten bleiben grundsätzlich im eigenen Netz, und nur ausgewählte Aufgaben mit öffentlichen Daten gehen bei Bedarf an eine externe API. So nutzen Sie die Stärken beider Kostenmodelle, ohne sich dauerhaft auf eines festzulegen.

Unsere Empfehlung in drei Stufen

Aus den Schwellenwerten und unserer Projekterfahrung leiten wir eine einfache Staffel ab:

1
Unter 5 Mio. Tokens pro Monat: Starten Sie in der Cloud, sofern Ihre Daten es zulassen. Nutzen Sie die Zeit, um Verbrauch, Anwendungsfälle und Qualität zu messen.
2
Ab 10 Mio. Tokens pro Monat oder bei regulierten Daten: Der Umstieg auf den Eigenbetrieb lohnt sich. Bei personenbezogenen, vertraulichen oder regulierten Daten kann er auch unterhalb dieser Schwelle die richtige Wahl sein.
3
Ab 50 Mio. Tokens pro Monat: Planen Sie mehrere GPUs, Lastverteilung und hybrides Routing, damit Kapazität und Kosten mit den Anwendungsfällen wachsen.

Zwischen 5 und 10 Mio. Tokens liegt eine Grauzone, in der Datenlage, Wachstumserwartung und interne Kompetenz entscheiden. Wichtig ist, die Entscheidung nicht einmalig zu treffen, sondern den Verbrauch laufend zu beobachten. Viele Unternehmen unterschätzen, wie schnell der Bedarf steigt, sobald der erste Anwendungsfall produktiv läuft und weitere Abteilungen nachziehen.

Die Kostenfrage entscheidet sich selten am Preis pro Token. Sie entscheidet sich am Volumen und daran, wer den Betrieb trägt.

Häufige Fragen

Quellen

  1. NexPatch AI: „Das lokale KI Betriebssystem", https://nexpatch.ai/de/blog/lokales-ki-betriebssystem-eigene-server-infrastruktur (Break even gegenüber Premium und Budget APIs, 36 Monats TCO)
  2. arXiv 2511.17593, Durchsatzmessung vLLM und Ollama bei zehn parallelen Nutzern, https://arxiv.org/abs/2511.17593
  3. US CLOUD Act (Clarifying Lawful Overseas Use of Data Act)

Wir verwenden Cookies

Wir verwenden Cookies und ähnliche Technologien, um Ihr Browsing-Erlebnis zu verbessern, den Website-Traffic zu analysieren und Inhalte zu personalisieren. Sie können wählen, welche Kategorien Sie akzeptieren möchten.

Erfahren Sie mehr in unserer Datenschutzerklärung und Impressum.