Büyük Dil Modellerinde (LLM'ler) çıkarım sürecinin optimizasyonu ve hassas değerlendirmesi, yapay zeka alanındaki geliştiriciler için temel zorluklardan biridir. Model performansının doğru bir şekilde anlaşılmasını sağlamak için, genel çıkarım metrikleri, tekil isteklerin ölçümü, sistem senkronizasyonu ve bellek analizi de dahil olmak üzere sekiz hayati yön dikkate alınmalıdır.
Bu alandaki kritik metriklerden biri, bir isteğin başından sonuna kadar işlenmesi için geçen süreyi temsil eden gecikmedir. Ayrıca, CUDA olaylarını kullanarak GPU iş yüklerini analiz etmek, eşzamanlı istekleri yönetmek ve token başına maliyeti doğru bir şekilde hesaplamak, tek makineli ortamlarda ve çok makineli kümelerde model performansını değerlendirmenin diğer ana eksenleri arasındadır.

