Transformer

Der Transformer ist eine Architektur neuronaler Netze, die Google-Forschende 2017 vorstellten. Sie revolutionierte die Sprachverarbeitung und ist die Grundlage der heutigen großen Modelle. Seine Kernidee ist der „Attention“-Mechanismus, mit dem das Modell abwägt, welche Wörter eines Textes füreinander am wichtigsten sind – egal wie weit sie auseinanderstehen – und so den Kontext weit besser erfasst als frühere Techniken. Zudem verarbeitet er Text parallel statt Wort für Wort, was das Training in großem Maßstab viel effizienter macht. Das „T“ in GPT ist die Familie großer Sprachmodelle von OpenAI, die hinter ChatGPT steckt. Es erzeugt Text, indem es Einheit für Einheit die wahrscheinlichste Fortsetzung vorhersagt. Mehr im Glossar → steht genau für „Transformer“. Obwohl er für Sprache entstand, wird er heute auch für Bilder, Audio und andere Bereiche genutzt. Er ist, ohne Übertreibung, das technische Bauteil, das die aktuelle Welle generativer Künstliche Intelligenz ist die Fähigkeit eines Computersystems, Aufgaben zu erledigen, die wir mit menschlicher Intelligenz verbinden – etwa Sprache verstehen, Bilder erkennen oder Entscheidungen treffen. Mehr im Glossar → möglich machte.