Skip to main content
NexPatch
Glossar3 Min. Lesezeit

Abrechnung pro Token erklärt: wie KI-Kosten entstehen

Ein Token ist die kleinste Texteinheit, in die ein Sprachmodell Text zerlegt, meist ein Wort oder ein Wortteil. Bei der Abrechnung pro Token zahlen Sie für jedes Token, das das Modell liest und schreibt, wobei Eingabe und Ausgabe in der Regel getrennt bepreist werden, sodass die Kosten mit der Nutzung wachsen.

Collage: Ein aufgeschlagenes Buch auf einer Tastatur, darüber schweben einzelne rot markierte Wörter.

Abrechnung pro Token erklärt: wie KI-Kosten entstehen

Ein Token ist die kleinste Texteinheit, in die ein Sprachmodell Text zerlegt, meist ein Wort oder ein Wortteil. Bei der Abrechnung pro Token zahlen Sie für jedes Token, das das Modell liest und schreibt, wobei Eingabe und Ausgabe in der Regel getrennt bepreist werden, sodass die Kosten mit der Nutzung wachsen.

Collage: Ein aufgeschlagenes Buch auf einer Tastatur, darüber schweben einzelne rot markierte Wörter.
Bild: Teresa Berndtsson / Letter Word Text Taxonomy / Licenced by CC-BY 4.0

Was ein Token ist

Sprachmodelle rechnen nicht mit Buchstaben oder ganzen Sätzen, sondern mit Token. Ein kurzes, häufiges Wort ist oft ein einziges Token, ein langes zusammengesetztes Fachwort wird in mehrere zerlegt. Wie viele Token ein Text ergibt, hängt vom Modell und von der Sprache ab. Für eine Kostenschätzung reicht deshalb keine Wortzahl, sondern nur eine Messung mit dem Modell, das tatsächlich eingesetzt wird.

Wie die Abrechnung pro Token funktioniert

Der Anbieter zählt bei jeder Anfrage zwei Mengen: die Eingabe-Token, also alles, was an das Modell geschickt wird, und die Ausgabe-Token, also die erzeugte Antwort. Beide werden getrennt gezählt und häufig unterschiedlich bepreist. Die Monatsrechnung ergibt sich aus Anfragen mal Eingabe-Token mal Eingabepreis plus Anfragen mal Ausgabe-Token mal Ausgabepreis.

Der unterschätzte Posten ist die Kontextlänge. Zur Eingabe gehört nicht nur die Frage, sondern alles, was das Modell für die Antwort sehen muss: Systemanweisungen, der bisherige Gesprächsverlauf und eingefügte Dokumente. Das wird bei jeder Anfrage erneut gezählt.

KostentreiberWirkung auf die RechnungStellschraube
Anzahl der Anfragenwächst linear mit der NutzungAnwendungsfall eng schneiden
Kontextlänge der Eingabewird bei jeder Anfrage neu berechnetnur relevante Textstellen mitschicken
Länge der Ausgabezählt je erzeugtem TokenAntwortformat vorgeben
Mehrstufige Abläufejeder Zwischenschritt ist eine eigene AnfrageSchritte zählen, bevor gebaut wird
Modellgrößegrößere Modelle sind je Token meist teurerkleinstes geeignetes Modell wählen

Abgrenzung zum Eigenbetrieb mit festen Kosten

Beim Eigenbetrieb läuft das Modell auf eigener oder dediziert reservierter Hardware. Es gibt keine Rechnung je Token, sondern feste Kosten für Hardware, Personal und Betrieb, die sich auf alle Anfragen verteilen.

KriteriumAbrechnung pro TokenEigenbetrieb mit festen Kosten
Kostenstrukturvariabel je Tokenfest, unabhängig vom Volumen
Planbarkeitschwankt mit der Nutzungim Voraus bekannt
Geeignet beiniedrigem oder stark schwankendem Volumenhohem, stabilem Volumen
Datenverbleibin der Regel beim Anbieterin der eigenen Infrastruktur
Vorlaufsofortiger StartAufbau erforderlich

Wie verbreitet beide Wege sind, zeigt die ifo Konjunkturumfrage 2026: 22,5 % der KI-Anwender nutzen ausschließlich kostenlose Systeme, 18,7 % betreiben eigene KI-Systeme, der Rest kauft extern zu. Wo der Umschlagpunkt liegt, lässt sich nicht pauschal sagen. Die ausführliche Gegenüberstellung steht im Vergleich Sprachmodell selbst betreiben oder mieten.

Praxisbeispiel aus unserer Arbeit

Ein typisches Muster sehen wir bei Wissensassistenten. Die Frage eines Mitarbeiters ist kurz, doch zu jeder Frage werden mehrere passende Textstellen aus Handbüchern mitgeschickt, damit die Antwort belegt ist. Die Eingabe ist dann oft ein Vielfaches der eigentlichen Frage. Steigt die Nutzung von einer Abteilung auf mehrere, wächst die Rechnung im selben Maß. Auf KI im eigenen Rechenzentrum entfällt dieser Effekt auf die Kosten, weil die Kapazität fest bezahlt ist.

Häufige Fragen

Warum nennt diese Seite keine Preise je Token?
Preise ändern sich häufig und unterscheiden sich je Anbieter und Modell. Jede konkrete Zahl wäre schnell veraltet. Belastbar ist nur eine Rechnung mit tagesaktuellen Preisen und Ihren eigenen Mengen.

Wie schätze ich meinen Tokenverbrauch vorab?
Messen Sie an einer Stichprobe echter Anfragen, wie viele Eingabe- und Ausgabe-Token entstehen, einschließlich Kontext. Multipliziert mit dem erwarteten Monatsvolumen ergibt das eine erste Größenordnung.

Veröffentlicht von

Philip Foitzik
Philip Foitzik
CSOO
Profile

Full-Stack Entwicklung

Von der Idee zur Produktion in Wochen

Next.js, React, TypeScript - co-gegründete Produkte mit staatlicher Förderung.

Unsere Arbeit ansehen

Verwandte Artikel

ZURÜCK ZUM BLOG

Wir verwenden Cookies

Wir verwenden Cookies und ähnliche Technologien, um Ihr Browsing-Erlebnis zu verbessern, den Website-Traffic zu analysieren und Inhalte zu personalisieren. Sie können wählen, welche Kategorien Sie akzeptieren möchten.

Erfahren Sie mehr in unserer Datenschutzerklärung und Impressum.