corevision.systems / Wissen / Was ist ein Token — und warum kostet KI pro Token?

Was ist ein Token — und warum kostet KI pro Token?

Stand: 07/2026

Kurz gesagtEin Token ist die kleinste Texteinheit, mit der ein Sprachmodell arbeitet — meist ein Wortteil, im Deutschen grob ein halbes bis dreiviertel Wort. Cloud-KI-Anbieter rechnen pro verarbeitetem Token ab, für Eingabe und Ausgabe. Wer die Kostenlogik versteht, kann Cloud-Gebühren kalkulieren — und beurteilen, ab wann sich eine eigene KI im Haus rechnet.

Ein Großhändler lässt testweise alle eingehenden Lieferantenrechnungen von einer Cloud-KI auslesen und prüfen. Der Testmonat: begeisterte Anwender, überschaubare Rechnung. Sechs Monate später nutzen drei Abteilungen das System täglich, und die monatliche KI-Rechnung hat sich verzehnfacht. Nicht weil der Anbieter die Preise erhöht hätte — sondern weil pro Token abgerechnet wird und die Token-Menge mit jeder Nutzung wächst.

Wer KI-Kosten verstehen will, muss verstehen, was ein Token ist.

Die kleinste Einheit der Sprach-KI

Ein Sprachmodell liest Text nicht Wort für Wort und schon gar nicht Buchstabe für Buchstabe. Es zerlegt ihn in Tokens: häufige Wortbestandteile, die das Modell als Einheit behandelt. Ein kurzes, häufiges Wort wie „und“ ist ein einzelnes Token. Ein längeres Wort wird zerlegt — „Instandhaltungsintervall“ etwa in vier bis sechs Stücke.

Für die Praxis reicht eine Faustregel: Im Deutschen entsprechen 1.000 Wörter ungefähr 1.500 bis 2.000 Tokens. Deutsch ist dabei teurer als Englisch, weil unsere zusammengesetzten Wörter in mehr Stücke zerfallen — derselbe Inhalt kostet auf Deutsch oft 20 bis 40 Prozent mehr Tokens.

Warum pro Token bezahlt wird

Jedes Token, das ein Modell liest oder schreibt, kostet Rechenleistung auf teuren Spezialprozessoren. Die Abrechnung pro Token bildet diesen Aufwand direkt ab. Wichtig dabei: Bezahlt wird in beide Richtungen — für die Eingabe (Ihre Frage plus alles, was Sie mitschicken) und für die Ausgabe (die Antwort).

Das erklärt, warum KI-Kosten in der Praxis oft überraschen. Nicht die Frage ist teuer, sondern der Kontext: Wer einem Modell einen 80-seitigen Vertrag zur Analyse mitgibt, bezahlt diese 80 Seiten als Eingabe-Tokens — bei jeder einzelnen Anfrage aufs Neue. Auch RAG-Systeme schicken zu jeder Frage die gefundenen Dokumentabschnitte mit; gut gebaute Systeme halten diesen Kontext deshalb so knapp wie möglich, ohne Relevantes wegzulassen.

Das Kontextfenster: die zweite Token-Grenze

Tokens begrenzen nicht nur die Kosten, sondern auch die Kapazität. Jedes Modell hat ein Kontextfenster — die maximale Token-Menge, die es in einem Durchgang verarbeiten kann. Frage, mitgelieferte Dokumente, bisheriger Gesprächsverlauf und Antwort müssen alle hineinpassen. Moderne Modelle schaffen Hunderttausende Tokens, aber die Grenze bleibt real: Ganze Dokumentbestände passen nie hinein. Genau deshalb arbeitet man mit Suche und Auswahl (RAG), statt „einfach alles mitzuschicken“.

Was das für Ihre Kalkulation bedeutet

Für Entscheider ergeben sich drei praktische Konsequenzen:

  • Kosten skalieren mit der Nutzung. Ein erfolgreicher Pilot ist die günstigste Phase. Kalkulieren Sie Cloud-KI immer auf Basis des Vollausbaus: Nutzerzahl mal Anfragen mal typischer Kontextgröße.
  • Effizienz ist gestaltbar. Knappe Prompts, gut aufbereitete Dokumente und präzise Suche senken die Token-Menge pro Anfrage erheblich — gute Systemarchitektur spart bares Geld.
  • Es gibt einen Break-even. Ab einer gewissen Nutzungsintensität wird die eigene KI im Haus wirtschaftlicher: Auf eigener Hardware kostet das einzelne Token nichts mehr, die Kosten sind fix und planbar. Nebeneffekt: Die Daten bleiben im Unternehmen, was auch die DSGVO-Frage entschärft.

Tokens sind also mehr als ein technisches Detail — sie sind die Währung der Sprach-KI. Wer sie versteht, kann Angebote vergleichen, Kosten vorhersagen und den richtigen Zeitpunkt für den Schritt zur hauseigenen Lösung erkennen.

Häufige Fragen

Wie viele Tokens hat ein deutscher Text?

Als Faustregel entsprechen 1.000 deutsche Wörter etwa 1.500 bis 2.000 Tokens. Deutsche Texte brauchen wegen langer zusammengesetzter Wörter meist mehr Tokens als englische gleicher Länge.

Warum rechnen KI-Anbieter pro Token ab?

Weil der Rechenaufwand des Modells direkt von der Menge der verarbeiteten Tokens abhängt — je mehr Text hinein- und hinausgeht, desto mehr Rechenleistung wird verbraucht. Tokens sind damit die ehrlichste Maßeinheit für die tatsächliche Nutzung.

Was ist ein Kontextfenster?

Die maximale Menge an Tokens, die ein Modell in einem Durchgang verarbeiten kann — Frage, mitgelieferte Dokumente und Antwort zusammen. Ist das Fenster voll, muss gekürzt werden oder das Modell „vergisst" den Anfang.

Genug Theorie? Sprechen wir darüber, was das für Ihren Betrieb heißt.

Gespräch vereinbaren

KI-Brief aus Vorarlberg

Alle paar Wochen: was in der KI-Welt passiert ist — und was es für Ihren Betrieb heißt. Ehrlich eingeordnet, ohne Hype.

Anmelden