Yapay zeka araştırmacıları yakın zamanda, kuantizasyon sürecini ağırlık iyileştirmesiyle akıllıca birleştiren Kuantizasyon‑Farkındalıklı İyileştirme (QAH) yöntemini tanıttılar. Bu yaklaşım, büyük modellerin 4 bit'e sıkıştırılmasını sağlarken tahmin hatasını azaltıyor ve yürütme hızını önemli ölçüde artırıyor.
Karşılaştırmalı deneylerde, QAH ile sıkıştırılmış model, orijinal 32 bit sürümüne kıyasla GLUE ve SuperGLUE gibi standart kıyaslama testlerinde daha yüksek puanlar elde etti. Ayrıca bellek tüketimi sekiz kata kadar azaldı ve uç sunuculardaki dağıtım maliyetleri gözle görülür şekilde düştü. Bu başarı, düşük maliyetli ve ölçeklenebilir yapay zeka uygulamalarının geliştirilmesinin yolunu açabilir.

