پروژه بزرگ BigCode که با هدف توسعه مدلهای پیشرفته در حوزه هوش مصنوعی کد نویسی فعالیت میکند، از روشهای حذف دادههای تقریباً تکراری در مقیاس بزرگ استفاده میکند. این تکنیک به کاهش حجم دادههای ورودی و افزایش کیفیت آموزش مدلها کمک میکند.
حذف دادههای نزدیک به تکراری باعث میشود دادههای بیکیفیت یا مشابه به میزان قابل توجهی کاهش پیدا کنند و در نتیجه مدلهای توسعه یافته عملکرد بهتری در پردازش و تولید کدهای کامپیوتری خواهند داشت.

