Pyucation
← Zurück zu allen Fragen

Was ist Quantisierung bei KI-Modellen?

Quantisierung verkleinert ein KI-Modell, indem die Genauigkeit seiner Zahlenwerte reduziert wird, etwa von FP32 auf FP16 oder INT8. Dadurch sinkt der Speicherbedarf des Modells oft drastisch, ohne dass zu viel Qualität verloren geht. Erst durch Quantisierung lassen sich große Sprachmodelle überhaupt auf normalen PCs, Macs oder Smartphones lokal betreiben.

Das erfährst du in der Folge zusätzlich:

  • Was FP32, FP16 und INT8 konkret bedeuten
  • Vor- und Nachteile der Quantisierung

Mehr dazu in Folge 46: So läuft KI auf deinem PC - Quantisierung von LLMs erklärt →