TF-IDF تقييم تصنيف النصوص العربية ببيانات التسرّب: قياس التسرّب على مستوى أوكلاهوما وكفاية خطوط الأساس الخطية المعتمدةعلى

المؤلفون

  • البهلول عبود كلية تقنية المعلومات، جامعة غريان، غريان، ليبيا المؤلف
  • وليد حسن الهيئة الليبية للبحث العلمي ، طرابلس ، ليبيا المؤلف

DOI:

https://doi.org/10.65422/loujas.v2i2.341

الكلمات المفتاحية:

: تصنيف النصوص العربية؛ تسرّب البيانات؛ التقييم المُجمَّع؛ TF-IDF على مستوى المحارف؛ Linear SVM؛ الاختبارات الإحصائية؛ قابلية إعادة الإنتاج

الملخص

يتزايد حجم النصوص العربية المنشورة على الإنترنت بصورة مستمرة، مما يزيد الحاجة إلى أنظمة فعّالة لتصنيفها ضمن فئات ذات دلالة. ومع ذلك، غالباً ما تُغفَل مشكلة منهجية دقيقة تتمثل في تسرّب البيانات على مستوى الوثيقة؛ إذ قد تُقسَّم الوثائق الطويلة إلى مقاطع أقصر، فتنتقل أجزاء من الوثيقة نفسها إلى كلٍّ من مجموعتي التدريب والاختبار، الأمر الذي يؤدي إلى تقديرات متفائلة وغير واقعية لأداء النماذج. تتناول هذه الدراسة هذه الظاهرة بوصفها القضية الرئيسة للبحث.

اعتمدت الدراسة على متن عربي متعدد المجالات جرى بناؤه خصيصاً لهذا الغرض، ويتكون من 1000 مقطع نصي مستخرج من 183 وثيقة مصدرية موزعة على سبع فئات موضوعية. وجرى أولاً قياس مقدار التشوه الذي يسببه التسرّب في نتائج التقييم. فقد حقق نموذج Linear SVM المُحسَّن دقة ظاهرية بلغت 0.9800 عند استخدام تقسيم عشوائي ساذج للبيانات، في حين انخفضت الدقة إلى 0.8528 عند استخدام تقسيم مُجمَّع يعتمد على معرّف الوثيقة. ويشير هذا الفرق، البالغ نحو 12.7 نقطة مئوية، إلى مقدار التضخم الناتج عن التسرّب، بينما تراوح هذا التضخم بين نحو 11.9 و30.4 نقطة مئوية عبر النماذج المختلفة.

كما أظهرت النتائج أن التسرّب يؤدي إلى تقليص الفروق الحقيقية بين النماذج، بحيث يبدو مصنّف Naive Bayes الضعيف أقلَّ بعداً عن أفضل النماذج مما هو عليه في الواقع. وعند اعتماد بروتوكول التقييم النزيه، كشفت دراسة الاستئصال أن تمثيل TF-IDF القائم على المحارف وحدها يضاهي التمثيل المدمج المعتمد على الكلمات والمحارف، بل ويتفوق عليه قليلاً في مقياس Macro F1 محققاً 0.7801 مقابل 0.7713، في حين أسهمت سمات الكلمات بصورة رئيسة في تحسين الإحكام (Precision).

وأظهرت اختبارات McNemar وتقنية Bootstrap المجمّعة على مستوى الوثيقة أن الفروق بين أقوى النماذج الخطية ليست ذات دلالة إحصائية. كما حقق خط أساس fastText دقة بلغت 0.6497، في حين قدّم نموذجا المحولات العربية المدربان مسبقاً AraBERT وMARBERT أداءً مقارباً للنموذج الخطي دون أن يتفوّقا عليه. كذلك كشف التحليل على مستوى الفئات أن فئة «عام» تمثل عاملاً بنيوياً مُربكاً، حيث أدى استبعادها إلى رفع الدقة إلى 0.9349.

وبصورة عامة، تُظهر النتائج أن اعتماد تقييم يراعي تسرّب البيانات، إلى جانب استخدام تمثيل TF-IDF الغني بالوحدات الجزئية ومصنّف Linear SVM، يوفر خط أساس قوياً ونزيهاً وعملياً لتصنيف النصوص العربية.

التنزيلات

منشور

2026-07-05

كيفية الاقتباس

TF-IDF تقييم تصنيف النصوص العربية ببيانات التسرّب: قياس التسرّب على مستوى أوكلاهوما وكفاية خطوط الأساس الخطية المعتمدةعلى . (2026). مجلة جامعة ليبيا المفتوحة للعلوم التطبيقية (LOUJAS), 2(2), 22-46. https://doi.org/10.65422/loujas.v2i2.341

المؤلفات المشابهة

1-10 من 71

يمكنك أيضاً إبدأ بحثاً متقدماً عن المشابهات لهذا المؤلَّف.