BigCodeBench سامانهای جدید برای ارزیابی مدلهای هوش مصنوعی در حوزه تولید کد است که جایگزین HumanEval شده است. این نسل جدید با معیارها و دادههای گستردهتر، دقت بیشتری در سنجش توانایی مدلها ارائه میدهد.
هدف BigCodeBench ارتقاء کیفیت ارزیابی و پیشرفت مدلهای هوش مصنوعی است تا بتوانند کدهای بهتری تولید کنند و محدودیتهای نسلهای قبلی را رفع نمایند.

