در بهروزرسانیهای اخیر حوزه هوش مصنوعی، فناوری vLLM در محیط TRL (Testing and Research Lab) معرفی شده است که بهطور همزمان چند مدل را روی یک GPU اجرا میکند. این روش نوین موجب افزایش چشمگیر بهرهوری منابع سختافزاری شده و از هدررفت ظرفیت پردازشگرهای گرافیکی جلوگیری میکند.
با بهکارگیری سیستم co-located vLLM، امکان استفاده همزمان و بهینه از GPUها فراهم شده است که در نهایت هزینههای پردازشی را کاهش داده و کارایی پروژههای هوش مصنوعی مبتنی بر مدلهای بزرگ زبانی را بیشتر میکند.

