
Bild: Olkeri
Von Olkeri.space
Was ist ein großes Sprachmodell? Wie LLMs wirklich funktionieren, einfach erklärt
Ein klarer, nichttechnischer Leitfaden dazu, was große Sprachmodelle sind, wie sie trainiert werden, warum sie halluzinieren und was sie können und nicht können.
Diesen Artikel lesen auf: Français · English · Español
Ein großes Sprachmodell, meist als LLM abgekürzt, ist ein Computerprogramm, das darauf trainiert wurde, Text vorherzusagen. Dieser eine Satz erklärt weit mehr über moderne künstliche Intelligenz, als die meisten Menschen erwarten, denn nahezu jedes KI-Produkt, von dem heute die Rede ist, vom Chatbot über Programmierassistenten bis zum automatisierten Kundendienst, beruht auf dieser einen Idee.
Dieser Leitfaden erklärt, was ein LLM ist, wie es gebaut wird, warum es sich so verhält, wie es sich verhält, und wo seine tatsächlichen Grenzen liegen. Mathematik wird nicht benötigt.
Was ein großes Sprachmodell wirklich ist:
Ein LLM ist ein sehr großes statistisches Modell der Sprache. Während des Trainings werden ihm enorme Textmengen gezeigt, verbunden mit einer einzigen sich wiederholenden Aufgabe: Sage anhand von allem Bisherigen voraus, was als Nächstes kommt. Über Milliarden von Wiederholungen hinweg passt das Modell interne Zahlen an, die Parameter genannt werden, bis seine Vorhersagen sehr gut werden.
Moderne Modelle enthalten Hunderte Milliarden solcher Parameter. Es handelt sich nicht um Fakten in einer Datenbank. Es sind Gewichte, die Muster kodieren: welche Wörter auf welche folgen, wie Fragen sich zu Antworten verhalten, worin sich der Ton einer Vertragsklausel von dem eines Rezepts unterscheidet, wie Quelltext aufgebaut ist.
Wenn Sie eine Frage eintippen, schlägt das Modell nichts nach. Es erzeugt eine plausible Fortsetzung Ihres Textes, Token für Token, wobei ein Token ungefähr einem Wortfragment entspricht. Alles, was ein LLM tut, einschließlich Schlussfolgern, Übersetzen und Programmieren, geht aus diesem Vorhersageprozess hervor.
Wie ein LLM trainiert wird:
Das Training verläuft in Stufen, und wer sie versteht, versteht den Großteil des Modellverhaltens.
Die erste Stufe ist das Vortraining. Das Modell liest einen sehr großen Textbestand: Bücher, Webseiten, Code-Repositories, Nachschlagewerke und mehr. Dabei lernt es Grammatik, Fakten, Stile, Denkmuster und Strukturen. Diese Stufe ist mit Abstand die teuerste; sie erfordert Tausende spezialisierter Chips über Wochen oder Monate, weshalb nur gut finanzierte Organisationen Spitzenmodelle von Grund auf bauen.
Die zweite Stufe ist das Feintuning. Ein vortrainiertes Modell setzt bereitwillig jeden Text fort, auch unbrauchbaren oder schädlichen. Das Feintuning bringt ihm anhand kuratierter Beispiele guter Antworten bei, sich wie ein Assistent zu verhalten.
Die dritte Stufe ist die Ausrichtung, häufig mit menschlichem Feedback. Menschen vergleichen Modellausgaben und geben an, welche besser sind. Das Modell wird anschließend so angepasst, dass es die von Menschen bevorzugten Antworten erzeugt: hilfreicher, ehrlicher, weniger schädlich. Hier wird aus einem reinen Textvorhersager etwas, mit dem man sinnvoll sprechen kann.
Warum der Transformer entscheidend war:
Nahezu alle aktuellen Modelle nutzen eine Architektur namens Transformer, die 2017 von Google-Forschern vorgestellt wurde. Ihr Kernmechanismus ist die Aufmerksamkeit, die es dem Modell erlaubt, zu gewichten, wie relevant jeder Teil der Eingabe für jeden anderen ist.
Frühere Ansätze verarbeiteten Text streng der Reihe nach und taten sich schwer damit, weit auseinanderliegende Gedanken zu verknüpfen. Aufmerksamkeit erlaubt es einem Modell, ein Pronomen mit einem drei Absätze zuvor genannten Namen zu verbinden oder eine Funktionsdefinition mit ihrer späteren Verwendung in einer Datei. Ebenso wichtig: Transformer trainieren effizient auf moderner paralleler Hardware, was die Skalierung auf die heutigen Modellgrößen erst praktikabel gemacht hat.
Das Kontextfenster und warum es zählt:
Das Kontextfenster gibt an, wie viel Text ein Modell gleichzeitig berücksichtigen kann, gemessen in Token. Alles im Fenster, Ihre Frage, der bisherige Gesprächsverlauf, eingefügte Dokumente, ist das, was das Modell tatsächlich sehen kann.
Frühe Modelle verarbeiteten einige Tausend Token, etwa einen langen Artikel. Aktuelle Modelle bewältigen Hunderttausende, was ganzen Büchern oder großen Codebasen entspricht. Ein größeres Fenster bedeutet, dass Sie einem Modell einen vollständigen Vertrag oder ein ganzes Repository übergeben können statt nur Bruchstücke.
Was außerhalb des Fensters liegt, existiert für das Modell nicht. Deshalb verlieren lange Gespräche frühere Details, und deshalb müssen Systeme, die auf große Archive zugreifen, die relevanten Stellen heraussuchen und ins Fenster stellen, statt sich auf ein Gedächtnis zu verlassen.
Warum Modelle halluzinieren:
Halluzination, wenn ein Modell etwas Falsches mit völliger Überzeugung behauptet, ist in der Praxis die folgenreichste Einschränkung.
Die Ursache ist struktureller Natur, kein Fehler, der sich einfach beheben lässt. Das Modell ist darauf trainiert, plausiblen Text zu erzeugen, und eine flüssige, selbstsichere, falsche Antwort ist statistisch oft plausibler als ein Eingeständnis von Unsicherheit. Das Modell besitzt keinen eingebauten Mechanismus, um eine Behauptung an der Wirklichkeit zu prüfen. Es hat Muster, kein Wissen im menschlichen Sinne.
Das Halluzinationsrisiko steigt stark bei entlegenen Fakten, konkreten Zahlen, Zitaten, Quellenangaben und aktuellen Ereignissen. Es sinkt, wenn dem Modell das Ausgangsmaterial direkt gegeben wird, worin die gesamte Logik von Retrieval-Systemen besteht.
Die praktische Regel lautet: Ein LLM ist verlässlich, wenn es über von Ihnen geliefertem Text schlussfolgert, und unzuverlässig als Ersatz für eine Datenbank oder eine Suchmaschine.
Trainingsdaten haben einen Stichtag:
Das Wissen eines Modells endet dort, wo seine Trainingsdaten enden. Fragen Sie nach etwas, das danach geschah, sagt es entweder, dass es das nicht weiß, oder es rät, was schlimmer ist. Produkte, die aktuelle Ereignisse zu kennen scheinen, rufen in der Regel Live-Suchergebnisse ab und stellen sie ins Kontextfenster, statt sich an sie zu erinnern.
Worin LLMs wirklich gut sind:
Das Muster erfolgreicher Einsätze ist bemerkenswert einheitlich. LLMs sind hervorragend darin, Text umzuformen: zusammenfassen, umschreiben, übersetzen, strukturierte Daten aus unstrukturierten Dokumenten ziehen, Anforderungen in Code überführen, entwerfen und umformatieren.
Stark sind sie dort, wo ein solider Entwurf viel Zeit spart und ein Mensch das Ergebnis prüft. Am schwächsten sind sie dort, wo Genauigkeit nicht verhandelbar ist, wo eine Überprüfung unmöglich ist oder wo ein selbstsicherer Fehler teuer zu stehen kommt.
Was als Nächstes kommt:
Die Front bewegt sich in drei Richtungen. Modelle, die vor der Antwort länger nachdenken und bei schweren Problemen Zeit gegen Genauigkeit tauschen. Multimodale Modelle, die Bilder, Audio und Video ebenso selbstverständlich verarbeiten wie Text. Und Agenten, die in Software handeln, statt nur Text zu erzeugen.
Nichts davon ändert das Grundbild. Darunter sagt das System weiterhin voraus, was als Nächstes kommt, außerordentlich gut und in enormem Maßstab. Das zu verstehen macht den Unterschied aus zwischen dem wirksamen Einsatz dieser Werkzeuge und dem Überraschtwerden von ihnen.