← Zurück zur Übersicht
← Zurück zur Übersicht
Wissensfolge 3. September 2026 6 Min.
Mixture of Experts (MoE) einfach erklärt: Wie moderne KI-Modelle Rechenkosten sparen
Rechenzeit sparen, indem man statt allen Parametern eines Modells nur einen Bruchteil verwendet
Worum geht’s in dieser Folge?
Mixture of Experts (MoE) steckt inzwischen hinter fast jedem grossen Sprachmodell, weil diese Architektur Rechenkosten spart. Es erklärt ausserdem, warum bei modernen Modellen plötzlich zwei Parameterzahlen angegeben werden.
DeepSeek-V3 zum Beispiel hat 671 Milliarden Parameter, nutzt pro Token aber nur 37 Milliarden davon.
Wie diese Architektur funktioniert, was ein Router in einem Sprachmodell macht und wie die sogenannten Experten im Training entstehen, erkläre ich in dieser Folge.
Wir schauen uns auch, wie immer, Probleme dieser Architektur an, z.B. warum Modelle dadurch schneller, aber nicht kleiner werden.
Themen dieser Folge:
- Router und Experten: Wie MoE die Rechenlast aufteilt
- Gesamtparameter vs. aktive Parameter
- Probleme wie Load Balancing
Shownotes
- Mixture of Experts (MoE) Architektur einfach erklärt
- Wie die Verwendung von Teilnetzen Rechenzeit spart