Transformer

Der Transformer ist eine neuronale Netzarchitektur, die 2017 vorgestellt wurde und die Grundlage praktisch aller modernen großen Sprachmodelle bildet.

Kurz erklärt

Transformer wurden 2017 im Paper “Attention Is All You Need” von Forschern bei Google eingeführt. Ihr zentrales Element ist der sogenannte Attention-Mechanismus, mit dem das Modell für jedes Wort in einem Text bewerten kann, wie relevant jedes andere Wort im Kontext für das Verständnis ist - unabhängig von deren Abstand im Text. Das ermöglicht deutlich effizienteres Training auf sehr großen Textmengen als frühere Architekturen wie rekurrente neuronale Netze.

Beispiel

Im Satz “Die Bank am Fluss war überflutet” hilft der Attention-Mechanismus dem Modell zu erkennen, dass sich “Bank” hier wahrscheinlich auf ein Flussufer bezieht statt auf ein Geldinstitut - basierend auf dem umgebenden Kontext “Fluss” und “überflutet”.

Warum ist das relevant?

Praktisch alle bekannten großen Sprachmodelle - von GPT über Claude bis zu offenen Modellen wie Llama - basieren auf der Transformer-Architektur. Das Verständnis dieser Grundlage erklärt, warum aktuelle KI-Modelle bestimmte Stärken (Kontextverständnis über lange Texte) und Schwächen (begrenztes Kontextfenster, hoher Rechenaufwand bei langen Eingaben) aufweisen.

Häufige Missverständnisse

“Transformer” im KI-Kontext hat nichts mit Übersetzungssoftware oder den gleichnamigen Spielzeugrobotern zu tun - der Name bezieht sich auf die Fähigkeit der Architektur, Eingabedaten durch mehrere Verarbeitungsschichten schrittweise umzuwandeln (zu “transformieren”). Auch ist ein Transformer selbst kein fertiges Produkt, sondern eine zugrunde liegende Architektur, auf deren Basis unterschiedlichste konkrete Modelle trainiert werden können.

Weiterführende Inhalte