← Zurück zu allen Fragen
Was ist Mixture of Experts (MoE) bei KI-Modellen?
Mixture of Experts ist eine Architektur, bei der ein Sprachmodell aus vielen kleinen Teilnetzen, den sogenannten Experten, besteht. Ein Router entscheidet pro Token, welche wenigen Experten aktiviert werden, statt das gesamte Modell zu nutzen. Dadurch besitzt das Modell zwar sehr viele Parameter insgesamt, verwendet für jede einzelne Berechnung aber nur einen Bruchteil davon und spart so Rechenkosten.
Das erfährst du in der Folge zusätzlich:
- Unterschied zwischen Gesamtparametern und aktiven Parametern
- Warum Load Balancing zwischen den Experten ein zentrales Problem ist
Verwandte Fragen
- Was ist das Context Window eines Sprachmodells?
- Was sind Halluzinationen bei KI und warum passieren sie?
- Was sind Parameter bei einem KI-Modell?
- Wie viel Arbeitsspeicher (RAM/VRAM) braucht man für ein KI-Modell?
- Was sind Reasoning-Modelle und was ist Chain of Thought?
- Wie funktioniert die Transformer-Architektur hinter ChatGPT & Co.?
- Was ist der Unterschied zwischen Künstlicher Intelligenz, Machine Learning und Deep Learning?
- Was ist der Unterschied zwischen Google und ChatGPT?
- Was ist ein Token bei einem Sprachmodell?
- Was ist Quantisierung bei KI-Modellen?
- Was ist RAG (Retrieval Augmented Generation)?
- Was sind Embeddings und wozu braucht man sie?
- Wie lernt ein neuronales Netz aus seinen Fehlern?
- Kann ich ein LLM lokal und kostenlos auf meinem PC betreiben?
- Was ist eine Kostenfunktion und wie lernen KI-Modelle damit?