تعد نماذج الترانسفورمر (Transformer)، وخاصة بنى وحدة فك الترميز فقط (decoder-only)، الأساس للأدوات المتقدمة التي تعمل من خلال التنبؤ بالرمز التالي بناءً على البيانات السابقة. يتطلب الفهم الدقيق لآليات هذه النماذج فحص أربع ركائز أساسية: عملية التوليد ذاتي الانحدار (autoregressive)، مرحلتا التعبئة المسبقة وفك الترميز (prefill and decode)، إدارة ذاكرة التخزين المؤقت للمفتاح والقيمة (KV Cache)، وتحليل استهلاك الذاكرة في هذه العملية.
وفي هذا الصدد، لا يعتمد تحسين الاستدلال (inference) في الذكاء الاصطناعي على الفهم النظري للنموذج فحسب، بل يعتمد أيضًا على الإدارة السليمة لموارد الذاكرة أثناء معالجة الرموز. وتعمل تقنيات مثل KV Cache على زيادة سرعة استجابة النموذج بشكل كبير عن طريق تقليل الحمل الحسابي.

