Token

Ein Token ist die kleinste Texteinheit, in die ein Sprachmodell Eingaben zerlegt, um sie zu verarbeiten - oft ein Wortteil, ein ganzes Wort oder ein Satzzeichen.

Kurz erklärt

Sprachmodelle verarbeiten Text nicht direkt als Buchstaben oder Wörter, sondern als Tokens - Einheiten, die durch einen vorab trainierten Tokenizer bestimmt werden. Häufige Wörter werden oft als ein einziges Token dargestellt, seltene oder zusammengesetzte Wörter dagegen in mehrere Tokens zerlegt. Als grobe Faustregel entsprechen etwa 100 Tokens im Englischen rund 75 Wörtern; bei anderen Sprachen wie Deutsch kann das Verhältnis abweichen.

Beispiel

Das Wort “Suchmaschinenoptimierung” wird von vielen Tokenizern nicht als ein einzelnes Token behandelt, sondern in mehrere Teiltokens zerlegt, etwa “Such”, “maschinen” und “optimierung” - je nachdem, wie häufig diese Bestandteile im Trainingsdatensatz vorkamen.

Warum ist das relevant?

Der Zugang zu vielen kommerziellen Sprachmodellen wird nach Anzahl verarbeiteter Tokens abgerechnet, sowohl für die Eingabe als auch für die generierte Ausgabe. Auch das Kontextfenster eines Modells - wie viel Text es gleichzeitig “im Blick” haben kann - wird in Tokens gemessen, nicht in Wörtern oder Zeichen.

Häufige Missverständnisse

Ein Token entspricht nicht zuverlässig einem Wort - je nach Sprache, Fachvokabular und Tokenizer kann die tatsächliche Anzahl an Tokens pro Wort stark variieren, was gerade bei nicht-englischen Sprachen wie Deutsch oft zu höheren Tokenkosten führt als erwartet. Auch Sonderzeichen, Leerzeichen und Formatierung verbrauchen Tokens, was bei der Gestaltung von Prompts und der Kostenkalkulation berücksichtigt werden sollte.

Weiterführende Inhalte