Transformer modelləri, xüsusilə yalnız dekoder arxitekturaları, əvvəlki məlumatlara əsasən növbəti tokeni proqnozlaşdırmaqla işləyən qabaqcıl alətlərin təməlidir. Bu modellərin mexanikasını dəqiq başa düşmək dörd əsas sütunun araşdırılmasını tələb edir: avtoreqressiv generasiya prosesi, prefill və dekodlaşdırma mərhələləri, açar-dəyər keşinin (KV Cache) idarə olunması və bu prosesdə yaddaş sərfiyyatının təhlili.
Bu baxımdan, süni intellektdə nəticə çıxarma prosesinin optimallaşdırılması təkcə modelin nəzəri dərkindən deyil, həm də tokenlərin işlənməsi zamanı yaddaş resurslarının düzgün idarə olunmasından asılıdır. KV Cache kimi texnikalar hesablama yükünü azaltmaqla modelin cavab sürətini əhəmiyyətli dərəcədə artırır.

