← Zurück zu allen Fragen
Was ist Quantisierung bei KI-Modellen?
Quantisierung verkleinert ein KI-Modell, indem die Genauigkeit seiner Zahlenwerte reduziert wird, etwa von FP32 auf FP16 oder INT8. Dadurch sinkt der Speicherbedarf des Modells oft drastisch, ohne dass zu viel Qualität verloren geht. Erst durch Quantisierung lassen sich große Sprachmodelle überhaupt auf normalen PCs, Macs oder Smartphones lokal betreiben.
Das erfährst du in der Folge zusätzlich:
- Was FP32, FP16 und INT8 konkret bedeuten
- Vor- und Nachteile der Quantisierung
Mehr dazu in Folge 46: So läuft KI auf deinem PC - Quantisierung von LLMs erklärt →
Verwandte Fragen
- Was ist das Context Window eines Sprachmodells?
- Was sind Halluzinationen bei KI und warum passieren sie?
- Was sind Parameter bei einem KI-Modell?
- Wie viel Arbeitsspeicher (RAM/VRAM) braucht man für ein KI-Modell?
- Was sind Reasoning-Modelle und was ist Chain of Thought?
- Wie funktioniert die Transformer-Architektur hinter ChatGPT & Co.?
- Was ist der Unterschied zwischen Künstlicher Intelligenz, Machine Learning und Deep Learning?
- Was ist der Unterschied zwischen Google und ChatGPT?
- Was ist ein Token bei einem Sprachmodell?
- Was ist RAG (Retrieval Augmented Generation)?
- Was sind Embeddings und wozu braucht man sie?
- Wie lernt ein neuronales Netz aus seinen Fehlern?