← Zurück zu allen Fragen
Wie funktioniert die Transformer-Architektur hinter ChatGPT & Co.?
Fast alle modernen Sprachmodelle basieren auf der Transformer-Architektur aus dem Jahr 2017. Ihr Kernprinzip ist die sogenannte Self-Attention. Das Modell gewichtet für jedes Wort, wie relevant alle anderen Wörter im Satz für dessen Bedeutung sind, und kann so Zusammenhänge über lange Textabschnitte hinweg erfassen. Das unterscheidet Transformer von älteren Modellarchitekturen und erklärt, warum aktuelle Sprachmodelle so kohärente Antworten liefern können.
Das erfährst du in der Folge zusätzlich:
- Das Original-Paper von 2017 zum Nachlesen
- Wie Self-Attention im Detail funktioniert
Mehr dazu in Folge 19: Transformers - Wie funktionieren Sprachmodelle? →
Verwandte Fragen
- Was ist das Context Window eines Sprachmodells?
- Was sind Halluzinationen bei KI und warum passieren sie?
- Was sind Parameter bei einem KI-Modell?
- Wie viel Arbeitsspeicher (RAM/VRAM) braucht man für ein KI-Modell?
- Was sind Reasoning-Modelle und was ist Chain of Thought?
- Was ist der Unterschied zwischen Künstlicher Intelligenz, Machine Learning und Deep Learning?
- Was ist der Unterschied zwischen Google und ChatGPT?
- Was ist ein Token bei einem Sprachmodell?
- Was ist Quantisierung bei KI-Modellen?
- Was ist RAG (Retrieval Augmented Generation)?
- Was sind Embeddings und wozu braucht man sie?
- Wie lernt ein neuronales Netz aus seinen Fehlern?