Die Chat-Vorlage
Ein Chatbot wie ChatGPT scheint auf deine Frage zu antworten. In Stufe 7 hast du aber gesehen: So ein Modell hängt nur Wort für Wort an. Wie wird daraus ein Gespräch? Der Trick ist eine unsichtbare Vorlage rund um deine Frage.
Das Modell aus Stufe 7 hat Märchen weitererzählt, aber keine Frage beantwortet. Ein Chatbot benutzt denselben Mechanismus: Er vervollständigt Text. Der Unterschied liegt darin, welchen Text er zu sehen bekommt und womit er trainiert wurde.
Wähle eine Frage. Darunter siehst du, was das Modell wirklich bekommt: deine Frage, eingepackt in Spezial-Tokens. Mit „Schritt für Schritt zeigen" beobachtest du, wie der Text danach Wort für Wort wächst und wie zwei verschieden trainierte Modelle ihn unterschiedlich fortsetzen.
So entsteht jedes Wort, Schritt für Schritt
Der ganze Text, den das Modell jedes Mal liest Beide starten mit derselben Frage im selben Format. Was sie daraus machen, ist verschieden.
Für eigene Fragen kennt der Pflichtteil keine fertige Antwort. Der Mechanismus bleibt aber derselbe: deine Frage wird eingepackt, und das Modell hängt Wort für Wort an.
Die Kernidee
Ein Chatbot entsteht in zwei Trainings nacheinander:
Grundtraining
Das Modell liest gewaltige Textmengen und lernt dabei die Sprache: welches Wort wahrscheinlich auf welches folgt. Heraus kommt ein Basismodell, das Text weiterschreibt.
Instruction-Tuning
Danach geht es noch einmal durch Millionen
chat-formatierte Beispiele und lernt die
Struktur: Nach <|user|> steht eine
Frage, nach <|assistant|> folgt eine hilfreiche Antwort.
„Das Instruct-Modell wurde zusätzlich mit Millionen chat-formatierter Beispiele trainiert."
Fast jeder Chatbot, den du benutzt, ist so ein Instruct-Modell: ChatGPT, Gemini, Copilot und Co. Das reine Basismodell würde dir nie so antworten, es würde nur weiter Text schreiben.
Warum der Chatbot trotzdem nicht „antwortet"
Beide Modelle tun dasselbe: Sie hängen das wahrscheinlichste nächste Wort
an, genau wie der Winzling in Stufe 7. Weil das
Instruct-Modell aber auf das Chat-Format trainiert ist, ist
die wahrscheinlichste Fortsetzung nach dem <|assistant|>-Token
eine hilfreiche Antwort. Die Höflichkeit steckt in der
Vorlage und im Training, nicht in einem
Verstehen.
Für Technik-Fans: Tokens statt Wörter
Wir tun hier so, als wären die Bausteine ganze Wörter. Echte Modelle rechnen mit Tokens: kleinere Stücke, oft Wortteile. Ein seltenes Wort wird in mehrere Tokens zerlegt, ein häufiges ist ein einziges.
Vervollständigen → ein Wort, vier Tokens
Auch die Spezial-Tokens <|user|> und
<|assistant|> sind je ein eigenes Token,
das das Modell im Training gelernt hat. Genau daran erkennt das
Instruct-Modell, dass jetzt eine Antwort kommen soll, und am Stopp-Token
<|end|>, wann es aufhören muss.
Das Instruct-Modell antwortet jetzt hilfreich. Aber woher weiß es, welche von vielen möglichen Antworten die beste ist, also höflich, ehrlich und nützlich? Dafür braucht es ein Signal, das von Menschen kommt. Das ist die letzte Stufe.