Wie Transformers wirklich funktionieren
Wenn du mit Claude oder ChatGPT chattest, läuft im Hintergrund eine Architektur, die 2017 eigentlich nur für maschinelle Übersetzung gedacht war – der Transformer. Seitdem hat er praktisch jede andere Architektur in der Sprachverarbeitung verdrängt, und mittlerweile auch in Bildverarbeitung und Audio Fuß gefasst. Bevor wir uns ansehen, was einen Transformer besonders macht, lohnt sich ein kurzer Rückblick: Was gab es vorher, und warum wurde es abgelöst?
Backpropagation – wie neuronale Netze überhaupt lernen
Jedes neuronale Netz, egal welche Architektur, lernt nach demselben Grundprinzip. Das Netz macht eine Vorhersage, vergleicht sie mit dem richtigen Ergebnis und berechnet daraus einen Fehlerwert. Backpropagation ist die Methode, mit der das Netz herausfindet, wie stark jedes einzelne Gewicht im Netz zu diesem Fehler beigetragen hat.
Man kann sich das wie eine Kette von Verantwortlichkeiten vorstellen. Stell dir eine Fabrik mit mehreren Produktionsstufen vor, an deren Ende ein fehlerhaftes Produkt herauskommt. Um herauszufinden, welche Station den Fehler verursacht hat, arbeitet man rückwärts durch die Kette: Zuerst schaut man sich die letzte Station an, dann die vorletzte, und so weiter, bis man beim Anfang ankommt. Bei jeder Station berechnet man, wie stark ihr Beitrag zum Endfehler war.
Mathematisch passiert das über die Kettenregel der Ableitung. Das Netz berechnet für jedes Gewicht einen Gradienten, also die Richtung und Stärke, in die man dieses Gewicht verändern müsste, um den Fehler zu verringern. Anschließend werden alle Gewichte ein kleines Stück in diese Richtung angepasst. Das Ganze passiert nicht einmal, sondern millionen- oder milliardenfach über riesige Mengen an Trainingsdaten, bis das Netz brauchbare Vorhersagen macht.
Backpropagation selbst ist architekturunabhängig – sie funktioniert bei einem einfachen Feed-Forward-Netz genauso wie bei einem CNN, einem RNN oder einem Transformer. Der Unterschied liegt darin, wie die Architektur aufgebaut ist und wie Information durch sie hindurchfließt. Und genau da kommen RNNs, CNNs und LSTMs ins Spiel.
CNNs – gut für Muster, die überall gleich aussehen
Convolutional Neural Networks wurden ursprünglich für Bilder entwickelt. Die Grundidee: Ein kleiner Filter wird über das Bild geschoben und sucht überall nach demselben Muster, zum Beispiel einer Kante oder einer bestimmten Textur. Der große Vorteil ist, dass ein einmal gelerntes Muster überall im Bild erkannt werden kann, egal an welcher Position es auftaucht.
Für Text wurden CNNs ebenfalls eingesetzt, aber mit einer Einschränkung: Ein Filter schaut sich immer nur ein kleines, festes Fenster von Wörtern gleichzeitig an. Um Beziehungen zwischen weit auseinanderliegenden Wörtern zu erfassen, braucht man entweder sehr viele Schichten übereinander oder größere Filter – beides wird schnell unhandlich.
RNNs – Text als Kette, ein Wort nach dem anderen
Recurrent Neural Networks wurden speziell für Sequenzen entwickelt, also für Daten, bei denen die Reihenfolge wichtig ist – wie bei Sprache. Die Grundidee: Das Netz liest ein Wort nach dem anderen und trägt dabei einen internen Zustand mit sich, eine Art Gedächtnis, das zusammenfasst, was es bisher gelesen hat. Bei jedem neuen Wort wird dieser Zustand aktualisiert und fließt zusammen mit dem neuen Wort in die nächste Berechnung ein.
Das Problem dabei: Je länger der Satz, desto mehr Informationen müssen komprimiert und über viele Schritte weitergetragen werden. Stell dir vor, du sollst eine Nachricht mündlich durch eine lange Menschenkette weitergeben. Nach zwanzig Personen ist oft nur noch eine verwässerte Version der ursprünglichen Nachricht übrig. Genau das passiert bei RNNs mit Informationen aus frühen Teilen eines langen Satzes – sie gehen tendenziell verloren, ein Phänomen, das als verschwindender Gradient bekannt ist.
Ein zweites Problem betrifft das Training selbst: Weil jedes Wort erst verarbeitet werden kann, wenn das vorherige fertig ist, lässt sich ein RNN nicht gut parallelisieren. Das Training dauert entsprechend lange, besonders bei langen Sequenzen und großen Datenmengen.
LSTMs – RNNs mit eingebautem Gedächtnismanagement
Long Short-Term Memory-Netze, kurz LSTMs, wurden entwickelt, um genau das erste Problem zu entschärfen. Ein LSTM besitzt neben dem normalen Zustand noch eine Art separaten Speicherpfad, den sogenannten Zellzustand, sowie mehrere kleine Steuerungseinheiten, die man Gates nennt. Diese Gates entscheiden bei jedem Schritt gezielt: Was aus dem bisherigen Gedächtnis wird behalten, was wird verworfen, und was aus dem neuen Wort wird überhaupt aufgenommen.
Das lässt sich mit einem Aktenordner vergleichen, den jemand kontinuierlich pflegt: Alte, nicht mehr relevante Notizen werden herausgenommen, wichtige alte Informationen bleiben erhalten, und neue Informationen werden gezielt ergänzt statt einfach oben draufgelegt. Dadurch können LSTMs deutlich längere Abhängigkeiten im Text erfassen als klassische RNNs.
Trotzdem bleibt das Grundproblem bestehen: Auch LSTMs verarbeiten Wort für Wort, sequentiell, und sind damit weiterhin schwer zu parallelisieren. Bei sehr langen Texten stößt man weiterhin an Grenzen.
Und dann kam der Transformer
Der Transformer löst beide Probleme auf einen Schlag. Statt Informationen Schritt für Schritt durch eine Kette zu tragen, betrachtet er die gesamte Sequenz gleichzeitig und lässt jedes Wort direkt mit jedem anderen Wort in Beziehung treten, egal wie weit sie auseinander liegen. Das nennt man Self-Attention, und es ist der eigentliche Kerngedanke der ganzen Architektur.
Die Kernidee: ein Meeting, in dem jeder zuhört, wem er will
Stell dir jedes Wort in einem Satz als Teilnehmer in einem Meeting vor. Statt streng der Reihe nach zu sprechen wie bei einem RNN, darf jeder Teilnehmer selbst entscheiden, wem er gerade am meisten Aufmerksamkeit schenkt, unabhängig davon, ob dieser Teilnehmer ganz am Anfang oder Ende des Satzes sitzt. Genau das macht Self-Attention: Jedes Wort bildet eine gewichtete Zusammenfassung aus allen anderen Wörtern im Kontext.
Dieses Bild trägt uns durch den Rest des Artikels.
Self-Attention im Detail: Query, Key, Value
Für jedes Wort berechnet das Modell drei Vektoren mithilfe gelernter Gewichte:
Query, kurz Q – wonach dieses Wort gerade sucht. Key, kurz K – was dieses Wort anzubieten hat. Value, kurz V – die eigentliche Information, die transportiert wird.
Die Relevanz zwischen zwei Wörtern ergibt sich aus dem Skalarprodukt von Query und Key. Für die gesamte Sequenz lässt sich das in einer kompakten Formel zusammenfassen:
Attention(Q, K, V) = softmax(Q mal K transponiert, geteilt durch die Wurzel aus der Key-Dimension) mal V
Die Softmax-Funktion wandelt die Ähnlichkeitswerte in eine Wahrscheinlichkeitsverteilung um – sie sagt aus, wie stark jedes Wort jedes andere Wort gerade beachtet. Die Division durch die Wurzel der Key-Dimension ist ein technischer Kniff, der verhindert, dass die Zahlen bei hochdimensionalen Vektoren zu groß werden und das Training dadurch instabil wird.
Konkretes Beispiel: Im Satz "Die Uhr, die ich gestern gekauft habe, tickt laut" muss das Wort "tickt" stark auf "Uhr" achten, um zu wissen, worauf es sich bezieht, obwohl sechs Wörter dazwischenliegen. Ein RNN müsste diese Information über sechs Schritte hinweg mitschleppen, mit dem Risiko, dass sie unterwegs verwässert. Bei Self-Attention ist der Weg zwischen "tickt" und "Uhr" immer gleich kurz, egal wie viele Wörter dazwischen stehen.
Multi-Head Attention – mehrere Blickwinkel gleichzeitig
Ein einzelner Attention-Mechanismus lernt nur eine Art von Beziehung. Multi-Head Attention führt deshalb mehrere Attention-Berechnungen parallel aus, typischerweise acht bei kleineren Modellen, deutlich mehr bei großen. Jeder dieser sogenannten Heads schaut sich die Beziehungen zwischen Wörtern aus einem eigenen kleinen Blickwinkel an, und am Ende werden alle Ergebnisse wieder zusammengeführt.
In der Praxis spezialisieren sich einzelne Heads oft auf unterschiedliche Muster. Manche erkennen eher grammatikalische Beziehungen wie Subjekt und Verb, andere eher inhaltliche Nähe zwischen Begriffen. Das wird dem Modell nicht vorgegeben, sondern entsteht von selbst während des Trainings.
Feed-Forward-Schichten, Residual-Verbindungen und Normalisierung
Nach der Attention-Berechnung durchläuft jedes Wort noch ein kleines, eigenes neuronales Netz, unabhängig von allen anderen Wörtern. Dieses Netz besteht meist aus zwei einfachen Schichten: Die erste vergrößert die Darstellung des Wortes auf eine höhere Dimension, dazwischen sitzt eine nichtlineare Funktion, und die zweite Schicht bildet das Ergebnis wieder auf die ursprüngliche Größe zurück. Während Attention dafür sorgt, dass Wörter Informationen austauschen, passiert hier keine Kommunikation zwischen Wörtern mehr – jedes Wort wird für sich allein weiterverarbeitet. Man kann sich das wie zwei getrennte Arbeitsschritte vorstellen: Erst tauschen sich alle Teilnehmer im Meeting aus (Attention), danach zieht sich jeder einzeln zurück, um das Gehörte für sich zu verarbeiten (Feed-Forward).
Damit sich viele solcher Blöcke – oft fünfzig, hundert oder mehr – übereinanderstapeln lassen, ohne dass das Training zusammenbricht, braucht es zwei zusätzliche Mechanismen.
Der erste sind Residual-Verbindungen, manchmal auch Skip-Connections genannt. Die Idee: Statt dass eine Schicht ihren Input komplett durch eine neue Repräsentation ersetzt, wird der ursprüngliche Input einfach zum Output addiert. Die Schicht muss also nicht mehr die komplette Information neu erzeugen, sondern lernt nur noch, was zusätzlich verändert werden soll – eine Art Korrektur statt einer kompletten Neuberechnung. Das hat einen sehr konkreten Effekt beim Training: Bei der Backpropagation kann der Gradient über diese Addition praktisch ungehindert durch die Schicht zurückfließen, weil die Ableitung einer Addition einfach eins ist. Ohne Residual-Verbindungen würden Gradienten in sehr tiefen Netzen mit jeder Schicht kleiner werden und irgendwann fast verschwinden, wodurch frühe Schichten kaum noch etwas lernen. Genau das Problem, das RNNs bei langen Sequenzen haben, hätten Transformer ohne Residuals bei vielen Schichten.
Der zweite Mechanismus ist Layer Normalization. Dabei werden die Werte innerhalb einer Schicht so skaliert, dass sie einen stabilen Mittelwert und eine stabile Streuung haben, bevor sie in die nächste Schicht weitergegeben werden. Ohne das können die Zahlen von Schicht zu Schicht immer größer oder kleiner werden, was das Training instabil macht und die Lernrate stark einschränken würde. In modernen Transformer-Implementierungen wird diese Normalisierung meist vor der eigentlichen Teilschicht angewendet, statt danach, weil sich das in der Praxis als deutlich stabiler beim Training sehr tiefer Modelle herausgestellt hat.
Ein vollständiger Transformer-Block läuft also so ab: Normalisierung, dann Attention, dann Addition des ursprünglichen Inputs, dann wieder Normalisierung, dann das Feed-Forward-Netz, dann wieder Addition des Inputs von davor. Erst dieses Zusammenspiel aus Attention, Feed-Forward, Residuals und Normalisierung macht es überhaupt möglich, Netze mit derart vielen Schichten zuverlässig zu trainieren.
Positional Encoding – woher weiß das Modell die Reihenfolge?
Ein interessantes Detail: Self-Attention allein weiß gar nicht, in welcher Reihenfolge die Wörter stehen. Ohne zusätzliche Hilfe wäre für das Modell "Hund beißt Mann" dasselbe wie "Mann beißt Hund". Deshalb wird vor der ersten Schicht zusätzliche Positionsinformation in die Wortvektoren eingebaut, entweder über feste mathematische Muster oder über zusätzlich gelernte Werte. Moderne Modelle nutzen häufig ein Verfahren namens RoPE, das die Positionsinformation elegant direkt in die Query- und Key-Vektoren einrechnet.
Encoder, Decoder, und warum heutige Sprachmodelle nur einen Decoder benutzen
Das ursprüngliche Transformer-Paper beschreibt eine Architektur mit zwei Teilen, gedacht für Übersetzung. Der Encoder liest den kompletten Eingabesatz auf einmal und darf dabei in beide Richtungen schauen. Der Decoder erzeugt die Ausgabe Wort für Wort und darf beim Erzeugen eines Wortes nur auf bereits erzeugte Wörter schauen, nicht auf zukünftige. Das nennt man maskierte Attention: Zukünftige Wörter werden beim Berechnen einfach ausgeblendet.
Modelle wie BERT nutzen nur den Encoder-Teil und eignen sich gut für Aufgaben wie Textklassifikation. Moderne Sprachmodelle wie Claude oder GPT dagegen bestehen nur aus dem Decoder-Teil. Sie sagen bei jedem Schritt vorher, wie wahrscheinlich jedes mögliche nächste Wort ist, basierend auf allem, was vorher im Text stand. Ein separater Encoder wird dafür gar nicht gebraucht, der gesamte bisherige Text läuft einfach durch denselben, maskierten Stapel an Schichten.
Warum das Ganze so erfolgreich ist
Drei Eigenschaften erklären, warum Transformers RNNs und LSTMs so gründlich abgelöst haben.
Erstens Parallelisierbarkeit. RNNs müssen Wort für Wort verarbeitet werden, weil jeder Schritt vom vorherigen abhängt. Attention berechnet dagegen alle Beziehungen zwischen allen Wörtern gleichzeitig als eine große Matrixberechnung, was sich hervorragend auf moderner Rechenhardware wie GPUs parallelisieren lässt. Das Training wird dadurch drastisch schneller.
Zweitens gleichbleibend kurze Wege. Bei einem RNN muss Information über viele Schritte weitergereicht werden, um zwei weit entfernte Wörter zu verknüpfen, mit dem Risiko, dass dabei etwas verloren geht. Bei Attention ist der Weg zwischen zwei beliebigen Wörtern immer gleich kurz, unabhängig von ihrem Abstand im Text.
Drittens Skalierbarkeit. Die Architektur zeigt bemerkenswert verlässliche Verbesserungen, wenn man mehr Daten, mehr Parameter und mehr Rechenleistung einsetzt. Das ist einer der Haupttreiber hinter der Entwicklung immer größerer Sprachmodelle in den letzten Jahren.
Der Preis dafür: Weil jedes Wort mit jedem anderen Wort verglichen wird, wächst der Rechenaufwand von Self-Attention quadratisch mit der Länge des Textes. Das macht sehr lange Kontexte rechnerisch aufwendig und ist der Grund, warum es mittlerweile einen ganzen Forschungszweig zu effizienteren Attention-Varianten gibt.
Fazit
RNNs und LSTMs verarbeiten Text Schritt für Schritt und tragen dabei ein komprimiertes Gedächtnis mit sich, was bei langen Texten an Grenzen stößt und sich schlecht parallelisieren lässt. CNNs erkennen zwar Muster unabhängig von der Position, tun sich aber schwer damit, weit entfernte Beziehungen im Text zu erfassen. Der Transformer löst beide Probleme, indem er jedem Wort erlaubt, direkt und gleichzeitig mit jedem anderen Wort in Beziehung zu treten, über den Self-Attention-Mechanismus. Multi-Head-Aufbau, Feed-Forward-Schichten, Residual-Verbindungen, Normalisierung und Positionsinformation sind die zusätzlichen Bausteine, die das Ganze trainierbar und praktisch nutzbar machen. Wer verstehen will, warum heutige Sprachmodelle so funktionieren, wie sie funktionieren, kommt an diesen Grundlagen nicht vorbei.