Abrechnung pro Token erklärt: wie KI-Kosten entstehen
Ein Token ist die kleinste Texteinheit, in die ein Sprachmodell Text zerlegt, meist ein Wort oder ein Wortteil. Bei der Abrechnung pro Token zahlen Sie für jedes Token, das das Modell liest und schreibt, wobei Eingabe und Ausgabe in der Regel getrennt bepreist werden, sodass die Kosten mit der Nutzung wachsen.

Was ein Token ist
Sprachmodelle rechnen nicht mit Buchstaben oder ganzen Sätzen, sondern mit Token. Ein kurzes, häufiges Wort ist oft ein einziges Token, ein langes zusammengesetztes Fachwort wird in mehrere zerlegt. Wie viele Token ein Text ergibt, hängt vom Modell und von der Sprache ab. Für eine Kostenschätzung reicht deshalb keine Wortzahl, sondern nur eine Messung mit dem Modell, das tatsächlich eingesetzt wird.
Wie die Abrechnung pro Token funktioniert
Der Anbieter zählt bei jeder Anfrage zwei Mengen: die Eingabe-Token, also alles, was an das Modell geschickt wird, und die Ausgabe-Token, also die erzeugte Antwort. Beide werden getrennt gezählt und häufig unterschiedlich bepreist. Die Monatsrechnung ergibt sich aus Anfragen mal Eingabe-Token mal Eingabepreis plus Anfragen mal Ausgabe-Token mal Ausgabepreis.
Der unterschätzte Posten ist die Kontextlänge. Zur Eingabe gehört nicht nur die Frage, sondern alles, was das Modell für die Antwort sehen muss: Systemanweisungen, der bisherige Gesprächsverlauf und eingefügte Dokumente. Das wird bei jeder Anfrage erneut gezählt.
| Kostentreiber | Wirkung auf die Rechnung | Stellschraube |
|---|---|---|
| Anzahl der Anfragen | wächst linear mit der Nutzung | Anwendungsfall eng schneiden |
| Kontextlänge der Eingabe | wird bei jeder Anfrage neu berechnet | nur relevante Textstellen mitschicken |
| Länge der Ausgabe | zählt je erzeugtem Token | Antwortformat vorgeben |
| Mehrstufige Abläufe | jeder Zwischenschritt ist eine eigene Anfrage | Schritte zählen, bevor gebaut wird |
| Modellgröße | größere Modelle sind je Token meist teurer | kleinstes geeignetes Modell wählen |
Abgrenzung zum Eigenbetrieb mit festen Kosten
Beim Eigenbetrieb läuft das Modell auf eigener oder dediziert reservierter Hardware. Es gibt keine Rechnung je Token, sondern feste Kosten für Hardware, Personal und Betrieb, die sich auf alle Anfragen verteilen.
| Kriterium | Abrechnung pro Token | Eigenbetrieb mit festen Kosten |
|---|---|---|
| Kostenstruktur | variabel je Token | fest, unabhängig vom Volumen |
| Planbarkeit | schwankt mit der Nutzung | im Voraus bekannt |
| Geeignet bei | niedrigem oder stark schwankendem Volumen | hohem, stabilem Volumen |
| Datenverbleib | in der Regel beim Anbieter | in der eigenen Infrastruktur |
| Vorlauf | sofortiger Start | Aufbau erforderlich |
Wie verbreitet beide Wege sind, zeigt die ifo Konjunkturumfrage 2026: 22,5 % der KI-Anwender nutzen ausschließlich kostenlose Systeme, 18,7 % betreiben eigene KI-Systeme, der Rest kauft extern zu. Wo der Umschlagpunkt liegt, lässt sich nicht pauschal sagen. Die ausführliche Gegenüberstellung steht im Vergleich Sprachmodell selbst betreiben oder mieten.
Praxisbeispiel aus unserer Arbeit
Ein typisches Muster sehen wir bei Wissensassistenten. Die Frage eines Mitarbeiters ist kurz, doch zu jeder Frage werden mehrere passende Textstellen aus Handbüchern mitgeschickt, damit die Antwort belegt ist. Die Eingabe ist dann oft ein Vielfaches der eigentlichen Frage. Steigt die Nutzung von einer Abteilung auf mehrere, wächst die Rechnung im selben Maß. Auf KI im eigenen Rechenzentrum entfällt dieser Effekt auf die Kosten, weil die Kapazität fest bezahlt ist.
Häufige Fragen
Warum nennt diese Seite keine Preise je Token?
Preise ändern sich häufig und unterscheiden sich je Anbieter und Modell. Jede konkrete Zahl wäre schnell veraltet. Belastbar ist nur eine Rechnung mit tagesaktuellen Preisen und Ihren eigenen Mengen.
Wie schätze ich meinen Tokenverbrauch vorab?
Messen Sie an einer Stichprobe echter Anfragen, wie viele Eingabe- und Ausgabe-Token entstehen, einschließlich Kontext. Multipliziert mit dem erwarteten Monatsvolumen ergibt das eine erste Größenordnung.

