پژوهشگران هوش مصنوعی اخیراً روش Quantization‑Aware Healing (QAH) را معرفی کردهاند که بهصورت هوشمندانه فرآیند کوانتیزیشن را با بهبود وزنها ترکیب میکند. این رویکرد باعث میشود مدلهای بزرگ بهصورت ۴‑بیتی فشرده شوند، در حالی که خطای پیشبینی کاهش یافته و سرعت اجرا بهطور چشمگیری افزایش مییابد.
در آزمایشهای مقایسهای، مدل فشردهشده با QAH بر روی معیارهای استانداردی مانند GLUE و SuperGLUE نمرات بالاتری نسبت به نسخهٔ اصلی با ۳۲‑بیت بهدست آورد. علاوه بر این، مصرف حافظه تا ۸ برابر کاهش یافت و هزینهٔ استقرار در سرورهای لبه (edge) بهطور قابلتوجهی پایین آمد. این دستاورد میتواند مسیر توسعهٔ برنامههای هوش مصنوعی کمهزینه و مقیاسپذیر را هموار سازد.

