تطوير نظام ذكاء اصطناعي قائم على التعلم العميق للكشف عن التضليل العلمي في المنصات الرقمية

م. شروق العواودة – جامعة الشرق الأوسط – عمان – الأردن
أ. آية الجعفري- جامعة الشرق الأوسط – عمان – الأردن

16 Views

تهدف الدراسة إلى تطوير وتقييم نظام للكشف عن التضليل العلمي باللغة العربية من خلال الضبط الدقيق لنموذج AraBERT-base-v2، وتحليل أثر الإيقاف المبكر وطول التسلسل النصي في الأداء، إلى جانب تفسير أبرز الخصائص اللغوية المرتبطة بالمحتوى المضلل وبيان حدود استخدام البيانات المترجمة.

المنهجية: اعتمدت الدراسة تصميمًا مختلطًا يوظف تكاملًا منهجيًا بين المنهجين الكمي والكيفي (النوعي) ، مدعومًا بقراءة كيفية تفسيرية. تكوّنت القاعدة الأولية من 23,546 سجلًا، منها 123 مادة عربية جُمعت من منصات: أكيد، وشييك، وتيقن، و23,423 سجلًا أجنبيًا من مجموعتي GossipCop وPolitiFact ضمن FakeNewsNet. وبعد التنظيف، استُبقي73 مادة عربية للتحليل الوصفي والتفسيري، في حين تُرجمت البيانات الأجنبية آليًا إلى العربية باستخدام نموذج MarianMT ‏(Helsinki-NLP/opus-mt-en-ar)، ثم نُظفت وطُبعت لغويًا. بلغ الحجم النهائي المستخدم في تجارب النموذج 21,595 سجلًا، قُسمت إلى 17,276 سجلًا للتدريب و4,319 سجلًا للتحقق. واعتمد التصنيف الثنائي إلى محتوى حقيقي ومضلل على الوسوم الأصلية للمصادر، ثم أُجري الضبط الدقيق لنموذج AraBERT-base-v2 عبر ثلاث تجارب: النموذج الأساسي، والإيقاف المبكر، وزيادة طول التسلسل إلى 512 رمزًا.

النتائج: أظهرت النتائج أن النموذج الأساسي حقق أعلى دقة (80.9%) في تصنيف الأخبار العلمية، إلا أنه عانى من فرط التكيف. في المقابل، أسهم تطبيق Early Stopping  في تحسين التوازن بين الأداء والاستقرار بدقة بلغت 75.7% مع تعزيز القدرة على التعميم، أما زيادة طول التسلسل إلى 512 Token فقد أدت إلى انخفاض الدقة (73.1%) نتيجة إدخال معلومات غير ذات صلة، كما أظهرت النتائج تفوق النموذج في اكتشاف الأخبار العلمية المزيفة مقارنة بالحقيقية.

الخلاصة: توصلت هذه الدراسة إلى أن نموذج AraBERT يُعد أداة فعّالة في تصنيف الأخبار العلمية المضللة باللغة العربية، إلا أن تحقيق أداء مثالي يتطلب توازنًا دقيقًا بين جودة البيانات واستراتيجيات التدريب المستخدمة. كما تؤكد النتائج أهمية توظيف تقنيات التنظيم، مثل Early Stopping؛ للحد من فرط التكيف وتعزيز قدرة النموذج على التعميم، في حين أن زيادة طول التسلسل النصي لا تضمن بالضرورة تحسنًا في الأداء. وبناءً على ذلك، توصي الدراسة بالتركيز على تحسين جودة البيانات وتنوعها، إلى جانب الضبط الدقيق لمعلمات النموذج، بما يسهم في تطوير أنظمة أكثر كفاءة وموثوقية في البيئات التطبيقية الواقعية.

6 Downloads