Wort für Wort
Ein Sprachmodell wie ChatGPT wirkt, als würde es antworten. Tatsächlich macht es etwas viel Schlichteres: Es sagt immer nur das nächste Wort voraus und hängt es an. Danach wieder das nächste. Genau das probierst du hier aus.
In Stufe 6 hast du gesehen, wie Wörter aufeinander achten. Aber wie entsteht daraus Text? Der Mechanismus ist einfach: Das Modell schaut auf das, was bisher dasteht, und schätzt für jedes mögliche nächste Wort, wie wahrscheinlich es ist. Dann wird eines davon angehängt, und der Vorgang beginnt von vorn mit dem nun längeren Text.
Unser Modell hier ist ein Winzling: Es wurde nur mit dem Text von Grimms Märchen trainiert und merkt sich dabei bloß, welches Wort dort oft auf die letzten paar Wörter folgte. Kein Verstehen, keine Bedeutung, nur Statistik. Genau deshalb kannst du ihm bei der Arbeit zusehen.
Bisheriger Text
Welches Wort kommt als Nächstes?
Dieses Wort kennt der Winzling nicht, es stand so nicht in den Märchen. Wähle oben einen Anfang oder tippe ein anderes Wort.
Warum es nach ein paar Wörtern abdriftet
Der Anfang klingt oft erstaunlich echt („Es war einmal ein …"), doch bald rutscht der Satz ins Wirre oder dreht sich im Kreis. Das liegt nicht an einem Fehler im Programm. Es zeigt gerade, dass hier nichts verstanden wird. Der Winzling schaut nur auf die letzten ein bis zwei Wörter und vergisst alles davor. Ein echtes Sprachmodell nutzt denselben Grundtrick, schaut dabei aber auf tausende vorherige Wörter zugleich und hat aus Milliarden Sätzen gelernt. Daher wirkt es, als würde es verstehen.
Für Technik-Fans: Was steckt wirklich drin?
Streng genommen ist unser Winzling kein neuronales Netz: keine Schichten, keine Neuronen, keine Gewichte. Er ist nur eine Häufigkeitstabelle. Beim „Training" wurde gezählt, welches Wort im Märchentext auf welche zwei Vorgänger folgt.
- Modelltyp
- Trigramm-Sprachmodell mit Bigramm-Rückfall
- Trainingstext
- Grimms Märchen (Project Gutenberg #77905), ca. 4 270 Sätze / 104 000 Wörter
- Gelernte Einträge
- 6 137 Wort-Tripel + 4 518 Wort-Paare mit ihren Wahrscheinlichkeiten
- Modellgröße
- ca. 0,75 MB (eine einzige Textdatei)
- Gedächtnis
- genau 2 Wörter
Zum Vergleich ein echtes Modell wie GPT-3: ein neuronales Netz mit 96 Schichten und rund 175 Milliarden einstellbaren Werten (Parameter), trainiert auf hunderte Milliarden Wörter, mit einem Gedächtnis von tausenden Wörtern gleichzeitig. Derselbe Grundgedanke, nur viele Größenordnungen darüber.
Jetzt weißt du, was „ein Wort vorhersagen" bedeutet. Aber ein Modell, das bloß Märchen weitererzählt, beantwortet noch keine Frage. Wie wird aus diesem Wort-für-Wort-Automaten ein Chatbot, der auf deine Eingabe eingeht? Das ist der nächste Schritt.