Pyucation
← Zurück zu allen Fragen

Wie funktioniert die Transformer-Architektur hinter ChatGPT & Co.?

Fast alle modernen Sprachmodelle basieren auf der Transformer-Architektur aus dem Jahr 2017. Ihr Kernprinzip ist die sogenannte Self-Attention. Das Modell gewichtet für jedes Wort, wie relevant alle anderen Wörter im Satz für dessen Bedeutung sind, und kann so Zusammenhänge über lange Textabschnitte hinweg erfassen. Das unterscheidet Transformer von älteren Modellarchitekturen und erklärt, warum aktuelle Sprachmodelle so kohärente Antworten liefern können.

Das erfährst du in der Folge zusätzlich:

  • Das Original-Paper von 2017 zum Nachlesen
  • Wie Self-Attention im Detail funktioniert

Mehr dazu in Folge 19: Transformers - Wie funktionieren Sprachmodelle? →