مجموعات البيانات
المدوّنة العربية للتدريب المسبق
2T tokens
مدوّنة عربية خاصة تضم 2 تريليون رمز، وهي أكبر مجموعة بيانات نظيفة بُنيت خصيصًا للتدريب المسبق لنماذج اللغة العربية الكبيرة. تقوم عليها النماذج الأساسية لـ Kawn Lab وهي غير منشورة للعموم.
لنتحدث عمّا تحاول بناءه.
أخبرنا بالمشكلة، وسنخبرك بصراحة إن كان الذكاء الاصطناعي هو الحل الصحيح.