تُعد عملية تقييم النماذج التنبؤية في حقل تعلم الآلة (Machine Learning) حجر الزاوية الذي تتكئ عليه موثوقية الأنظمة الذكية وجدواها التطبيقية؛ إذ لا يقتصر نجاح النموذج على قدرته على معالجة البيانات وتوليد المخرجات، بل يمتد جوهرياً إلى دقة قياس أدائه عبر مقاييس إحصائية تعكس طبيعة المشكلة محل الدراسة بدقة متناهية. وفي بيئات العالم الحقيقي المعقدة، نادراً ما تتطابق توزيعات الفئات المستهدفة، حيث تبرز معضلة البيانات غير المتوازنة (Imbalanced Datasets) كواحدة من أكثر التحديات شيوعاً وإرباكاً للباحثين والممارسين، مما يُبطل فاعلية المقاييس التقليدية ويفرض استخدام أدوات تحليلية أكثر حساسية وتخصصاً.
يمثل منحنى الدقة والاسترجاع (Precision-Recall Curve) إحدى أرقى الأدوات المنهجية والبيانية لتقييم خوارزميات التصنيف الثنائي، لا سيما حينما تكتسب الفئة النادرة أهمية استثنائية تفوق الفئة المهيمنة، كما هو الحال في كشف الاحتيال المالي، وتشخيص الأمراض النادرة، وتتبع التهديدات السيبرانية. يقدم هذا المنحنى تقييماً شاملاً لأداء النموذج عبر جميع عتبات القرار الممكنة، متجاوزاً الانحيازات الإحصائية التي قد تقع فيها مقاييس أخرى، ليتيح للمهندسين والعلماء فهم الطبيعة الديناميكية للمفاضلة بين الدقة والشمولية واختيار نقطة التشغيل المثلى التي تحقق أقصى عائد تشغيلي وأقل نسبة خطأ ممكنة.
يهدف هذا الدليل المرجعي الشامل إلى سبر أغوار منحنى الدقة والاسترجاع في لغة بايثون من منظور رياضي، ونظري، وتطبيقي متكامل؛ حيث نتدرج من تفكيك المصفوفات الإحصائية والأسس الرياضية، مروراً بالمقارنات المعمقة مع منحنيات أخرى كمنحنى خاصية تشغيل المستقبِل، ووصولاً إلى التنفيذ البرمجي المتقدم، وتفسير المساحات تحت المنحنيات، واستراتيجيات معايرة الاحتمالات، والتعامل مع التصنيفات متعددة الفئات، مدعوماً بأرقى الممارسات الهندسية والتحليلية المعتمدة في الأوساط الأكاديمية والصناعية.
- 1. مقدمة إلى مقاييس تقييم نماذج التصنيف في تعلم الآلة
- 2. الأسس الرياضية والنظرية لمقياسي الدقة والاسترجاع
- 3. المقارنة المنهجية: منحنى PR في مواجهة منحنى ROC
- 4. إعداد بيئة العمل البرمجية واستيراد المكتبات الأساسية
- 5. توليد وتجهيز مجموعات البيانات التجريبية ذات التوزيع غير المتوازن
- 6. بناء نموذج التصنيف واستخراج الاحتمالات التنبؤية
- 7. الحساب الرياضي لنقاط المنحنى عبر Scikit-Learn
- 8. رسم وتخصيص منحنى الدقة والاسترجاع برمجياً
- 9. حساب وتفسير المساحة تحت منحنى الدقة والاسترجاع (PR AUC)
- 10. استراتيجيات اختيار عتبة القرار المثلى (Optimal Threshold)
- 11. المقارنة البصرية لأداء خوارزميات متعددة عبر منحنيات PR
- 12. التطبيقات المتقدمة والتعامل مع المشكلات المعقدة
- خاتمة
- References
1. مقدمة إلى مقاييس تقييم نماذج التصنيف في تعلم الآلة
1.1 مفهوم التصنيف الثنائي وبنية مصفوفة الارتباك
يقوم التصنيف الثنائي (Binary Classification) في جوهره على تقسيم فضاء البيانات إلى فئتين متمايزتين، يُصطلح عادة على تسميتهما بالفئة الإيجابية (Positive Class) والفئة السلبية (Negative Class). ولتقييم قدرة الخوارزمية على التمييز بين هاتين الفئتين، تُستخدم مصفوفة الارتباك (Confusion Matrix) كأداة إحصائية أساسية تلخص نتائج المقارنة بين القيم الفعلية والتنبؤات الصادرة عن النموذج. تتألف هذه المصفوفة المربعة من أربعة عناصر محورية تمثل تقاطع الحقيقة الموضوعية بالحكم التنبؤي، وهي الإيجابيات الصحيحة (True Positives – TP)، والسلبيات الصحيحة (True Negatives – TN)، والإيجابيات الكاذبة (False Positives – FP)، والسلبيات الكاذبة (False Negatives – FN).
تشير الإيجابيات الصحيحة إلى الحالات التي تنتمي بنيوياً إلى الفئة الإيجابية ونجح النموذج في تصنيفها كذلك، بينما تعبر السلبيات الصحيحة عن الحالات السلبية التي صنفها النموذج بنجاح كحالات سلبية. وفي المقابل، تظهر الأخطاء التنبؤية عبر نمطين إحصائيين متمايزين؛ الأول هو خطأ النوع الأول (Type I Error) أو الإيجابيات الكاذبة، ويحدث عندما ينسب النموذج حالة سلبية بالأساس إلى الفئة الإيجابية، كإطلاق إنذار أمني كاذب. أما النمط الثاني فهو خطأ النوع الثاني (Type II Error) أو السلبيات الكاذبة، ويقع عندما يفشل النموذج في رصد الحالة الإيجابية ويصنفها كحالة سلبية، كإغفال تشخيص ورم خبيث لدى مريض مصاب.
إن عملية التصنيف في خوارزميات تعلم الآلة المعاصرة لا تنتج أحكاماً قاطعة بصورة فورية، بل تُنتج قيماً احتمالية مستمرة تقع في المجال بين الصفر والواحد الصحيح [0, 1]، تعبر عن درجة ثقة الخوارزمية في انتماء العينة للفئة الإيجابية. وهنا يبرز مفهوم عتبة اتخاذ القرار (Decision Threshold)، وهي القيمة الحدية التي يُفصل عندها بين الإيجاب والسلب؛ فإذا تجاوز الاحتمال المحسوب هذه العتبة يُصنف الكائن إيجابياً، وما دون ذلك يُصنف سلبياً. ويؤدي تغيير هذه العتبة إلى إعادة توزيع ديناميكية لعناصر مصفوفة الارتباك الأربعة، مما يستلزم تحليلاً رياضياً يتجاوز الاعتماد على عتبة افتراضية ثابتة كعتبة 0.5 التقليدية.
1.2 قصور مقياس الدقة العامة (Accuracy) في البيانات غير المتوازنة
يُعد مقياس الدقة العامة (Accuracy)، المعرف بنسبة إجمالي التنبؤات الصائبة (TP + TN) إلى إجمالي عدد العينات الكلي، المقياس الأكثر بديهية واستخداماً في الأوساط التمهيدية لتعلم الآلة. ومع ذلك، يعاني هذا المقياس من قصور منهجي فادح عند تطبيقه على مجموعات بيانات تتسم بعدم التوازن الإحصائي (Class Imbalance)؛ أي عندما يفوق عدد عينات إحدى الفئات عدد عينات الفئة الأخرى بفارق شاسع. يُعرف هذا القصور في الأدبيات الإحصائية باسم مفارقة الدقة (Accuracy Paradox)، حيث يمكن لنموذج غير كفء على الإطلاق أن يحقق نسبة دقة عامة متناهية في الارتفاع بمجرد التنبؤ الدائم بالفئة المهيمنة.
لتوضيح هذه المعضلة حسابياً، إذا كانت مجموعة بيانات فحص طبي تتضمن 990 عينة سليمة (سلبية) مقابل 10 عينات مصابة بمرض خطير (إيجابية)، فإن نموذجاً ساذجاً يتنبأ بأن جميع المرضى أصحاء بصورة مطلقة سيحقق دقة عامة تصل إلى 99%. وعلى الرغم من هذه النسبة الإحصائية البراقة ظاهرياً، إلا أن النموذج يُعد فاشلاً كلياً من الناحية التطبيقية والوظيفية، حيث تبلغ نسبة استرجاعه للحالات المصابة 0%، متسبباً في عواقب كارثية تتمثل في ترك الحالات المصابة دون علاج. تنبع هذه المشكلة من الوزن المتكافئ الذي تمنحه معادلة الدقة العامة لكل من السلبيات الصحيحة والإيجابيات الصحيحة دون اعتبار للتكلفة التمييزية لكل فئة.
تفرض هذه الهيمنة الساحقة للفئة السالبة على المقاييس الإجمالية ضرورة الابتعاد عن مقياس الدقة العامة في السيناريوهات غير المتكافئة، واللجوء إلى مقاييس تقييم مشتقة تفصل بين أداء النموذج على الفئة الإيجابية وأدائه على الفئة السلبية. ومن هنا تنشأ الحاجة الملحة لمنهجيات تعزل تأثير الفئة السالبة المهيمنة وتركز بصرامة على قدرة الخوارزمية التمييزية، وهو ما يمهد الطريق لتبني مقاييس موجهة ترتكز على فضاءات أداء مستقلة عن حجم الفئة غير المستهدفة.
1.3 الدافع الرياضي والعملي لمنحنى الدقة والاسترجاع
ينبثق الدافع الرياضي لتطوير واعتماد منحنى الدقة والاسترجاع من ضرورة تقييم النماذج الإحصائية مع التركيز المركز على الفئة الإيجابية النادرة ذات الأهمية الحسابية والعملية القصوى. في التطبيقات الحساسة كتحليل التزييف المالي، والكشف عن الاختراقات الشبكية، والتنقيب عن النفط، يمثل رصد الحالات الإيجابية الهدف الأوحد للنظام، في حين تُعد السلبيات الصحيحة مجرد خلفية إحصائية واسعة النطاق لا تحمل قيمة وظيفية مضافة تستدعي مكافأة النموذج على رصدها بشكل مفرط في معادلات التقييم.
يوفر منحنى الدقة والاسترجاع إطاراً بصرياً وديناميكياً يستعرض كيفية تبدل كفاءة النموذج ونقاوة تنبؤاته مع التدرج المستمر لعتبات اتخاذ القرار من 1 إلى 0. فبدلاً من تقديم لقطة إحصائية ثابتة ومفردة لأداء النموذج عند عتبة اعتباطية، يقوم المنحنى برسم المشهد الكامل للاستجابة التنبؤية، كاشفاً بوضوح عن المناطق التي يبدأ فيها النموذج بالتدهور، وتلك التي يحتفظ فيها بدرجة موثوقية عالية. يتيح هذا التمثيل للباحثين والمحللين استكشاف المساحة الكاملة للقرارات المتاحة للخوارزمية قبل اتخاذ قرار النشر البرمجي في البيئة الإنتاجية.
إلى جانب ذلك، تبرز الأهمية المعاصرة لمنحنى الدقة والاسترجاع في مقارنة الخوارزميات التنبؤية المعقدة كشبكات التعلم العميق (Deep Neural Networks) ونماذج تعزيز التدرج (Gradient Boosting Models)؛ حيث تفشل المقاييس التقليدية في رصد الفروق الدقيقة في ذيول التوزيع الاحتمالي (Probability Tails). ومن ثم، فإن هذا المنحنى يمثل المعيار الذهبي المعتمد لتقييم مصنفات البيانات الشحيحة، حيث يُخضع الخوارزمية لاختبار صارم يكشف مدى قدرتها على اصطياد الإشارات النادرة من بين ضجيج الفئات المهيمنة بكفاءة إحصائية لا تقبل التشكيك.
2. الأسس الرياضية والنظرية لمقياسي الدقة والاسترجاع
2.1 الصياغة الرياضية لمقياس الدقة (Precision)
يُعرف مقياس الدقة (Precision)، والذي يُطلق عليه في الإحصاء الرياضي مسمى القيمة التنبؤية الإيجابية (Positive Predictive Value – PPV)، بأنه النسبة المئوية للحالات الإيجابية الحقيقية من بين إجمالي الحالات التي توقع النموذج أنها إيجابية. يتم التعبير عن هذا المقياس رياضياً بالمعادلة التالية:
Precision = TP / (TP + FP)
حيث يمثل البسط عدد الإيجابيات الصحيحة، بينما يمثل المقام مجموع الإيجابيات الصحيحة والإيجابيات الكاذبة معاً، وهو ما يمثل الحجم الكلي للتنبؤات الإيجابية التي أصدرها المصنف. يعكس هذا المقياس في جوهره درجة يقين وثقة النظام في قراراته الإيجابية؛ فإذا كانت الدقة تساوي 0.95، فإن ذلك يعني رياضياً أنه عندما يعلن النموذج عن وجود حالة إيجابية، فإنه يكون محقاً بنسبة 95% وتكون نسبة الخطأ الناتجة عن الإنذارات الكاذبة 5% فقط.
يترتب على وجود الإيجابيات الكاذبة (FP) في مقام المعادلة انخفاض طردي في قيمة الدقة كلما ارتفع معدل وقوع خطأ النوع الأول. تبرز أهمية تعظيم هذا المقياس في التطبيقات التي تترتب فيها تكلفة مالية، أو تشغيلية، أو اجتماعية باهظة على الإنذار الكاذب. فعلى سبيل المثال، في أنظمة ترشيح البريد العشوائي (Spam Filtering)، يؤدي تصنيف بريد إلكتروني هام جداً ورسمي كبريد عشوائي (خطأ إيجابي كاذب) إلى عواقب وخيمة للمستخدم، مما يستوجب ضبط النموذج لتحقيق أعلى معدل دقة ممكن لضمان عدم حجب الرسائل الحيوية.
2.2 الصياغة الرياضية لمقياس الاسترجاع (Recall/Sensitivity)
يُعرف مقياس الاسترجاع (Recall)، والذي يُطلق عليه أيضاً في الأدبيات الطبية والإحصائية الحساسية (Sensitivity) أو المعدل الإيجابي الحقيقي (True Positive Rate – TPR)، بأنه نسبة الحالات الإيجابية الحقيقية التي تم رصدها واسترجاعها بنجاح إلى إجمالي الحالات الإيجابية الفعلية الموجودة في البيانات الأصلية. يُصاغ هذا المقياس رياضياً وفق العلاقة التالية:
Recall = TP / (TP + FN)
حيث يحتوي المقام هنا على مجموع الإيجابيات الصحيحة والسلبيات الكاذبة، وهو ما يمثل الحجم المطلق للفئة الإيجابية في الواقع الموضوعي بغض النظر عن تنبؤات الخوارزمية. يقيس الاسترجاع الشمولية والقدرة الاستكشافية للمصنف، معبراً عن مدى فاعلية النموذج في عدم إفلات الحالات الحرجة من راداره التنبؤي.
يرتبط تدهور مقياس الاسترجاع ارتباطاً وثيقاً بزيادة السلبيات الكاذبة (FN)؛ فكلما عجز النموذج عن اكتشاف حالة إيجابية فعلية واعتبرها سلبية، انخفضت قيمة الاسترجاع بشكل حاد. يكتسب هذا المقياس أولوية مطلقة في الأنظمة ذات الحساسية الأمنية والصحية العالية، حيث تكون تكلفة السلبيات الكاذبة فادحة ولا يمكن التسامح معها. ومن أمثلة ذلك الفحوصات الطبية للأمراض المعدية أو تقييم التشققات الهيكلية في أجنحة الطائرات؛ إذ إن الفشل في رصد حالة إصابة أو تصدع بنيوي (خطأ سلبي كاذب) قد يؤدي إلى خسائر بشرية ومادية لا يمكن تعويضها، حتى وإن تطلب رفع الاسترجاع القبول ببعض الإيجابيات الكاذبة.

2.3 ديناميكية المقايضة بين الدقة والاسترجاع (Precision-Recall Tradeoff)
تنشأ بين مقياسي الدقة والاسترجاع علاقة مقايضة عكسية حتمية ناجمة عن حركة عتبة القرار الاحتمالية. فعند رفع العتبة نحو الواحد الصحيح، يصبح النموذج شديد التحفظ ولا يُصدر حكماً إيجابياً إلا عند وجود درجات ثقة فائقة، مما يؤدي إلى تقليص الإيجابيات الكاذبة ورفع مقياس الدقة، ولكن على حساب زيادة السلبيات الكاذبة وهبوط الاسترجاع. وعلى العكس من ذلك، يؤدي خفض العتبة نحو الصفر إلى جعل النموذج متساهلاً وشاملاً في إيجابياته، فيرتفع الاسترجاع نتيجة صيد معظم الحالات الإيجابية، غير أن ذلك يترافق مع تدفق هائل للإيجابيات الكاذبة وانهيار متسارع في مقياس الدقة.
ترتبط هذه الديناميكية بمفهومي التحيز والتغاير (Bias-Variance Dilemma) وتوزيع الكثافة الاحتمالية للفئات؛ حيث تتداخل دوال التوزيع التكراري للفئتين في الواقع التجريبي، مما يجعل الوصول إلى دقة 100% واسترجاع 100% في آن واحد أمراً مستحيلاً عملياً في النظم غير الخطية ذات الضجيج العشوائي. ولتحقيق موازنة رياضية توفيقية بين هذين المتناقضين، تم تطوير مقياس F1 (F1-Score)، وهو الوسط التوافقي (Harmonic Mean) بين الدقة والاسترجاع، وتُحسب قيمته كالتالي:
F1 = 2 * (Precision * Recall) / (Precision + Recall)
يمتاز الوسط التوافقي بمعاقبته للقيم المتطرفة؛ فإذا انهارت الدقة أو انهار الاسترجاع نحو الصفر، ينهار مقياس F1 تبعاً لذلك، بخلاف المتوسط الحسابي البسيط. ولدعم الحالات التطبيقية المتباينة، يتم استخدام مقياس F-beta الموسع، والذي يُصاغ رياضياً كالتالي:
F_beta = (1 + beta^2) * (Precision * Recall) / ((beta^2 * Precision) + Recall)
حيث يمثل المعامل بيتا (Beta) وزناً ترجيحياً يحدد الأهمية النسبية؛ فإذا كانت بيتا تساوي 2 (F2-Score) يُمنح الاسترجاع ضعف وزن الدقة، وإذا كانت بيتا تساوي 0.5 (F0.5-Score) تُعطى الدقة الأولوية العليا على حساب الاسترجاع.
3. المقارنة المنهجية: منحنى PR في مواجهة منحنى ROC
3.1 بنية وآلية عمل منحنى خاصية تشغيل المستقبِل (ROC Curve)
يُعد منحنى خاصية تشغيل المستقبِل (Receiver Operating Characteristic – ROC) من أقدم وأعرق الأدوات الإحصائية المستخدمة لتقييم أنظمة كشف الإشارات وتصنيف الأنماط. يقوم هذا المنحنى على رسم بياني ثنائي الأبعاد يربط بين المعدل الإيجابي الحقيقي (TPR أو Recall) على المحور الرأسي (Y-axis)، ومعدل الإيجابيات الكاذبة (False Positive Rate – FPR) على المحور الأفقي (X-axis)، عبر جميع عتبات القرار المحتملة. يُعرّف معدل الإيجابيات الكاذبة رياضياً بالمعادلة:
FPR = FP / (FP + TN)
وهو يمثل نسبة العينات السلبية التي تم تصنيفها خطأً كإيجابيات إلى إجمالي عدد العينات السلبية الحقيقية في مجموعة البيانات.
يتميز منحنى ROC بخاصية الثبات الإحصائي تجاه تغير توزيع الفئات؛ وذلك لأن كلاً من TPR و FPR يتم حسابهما عبر أعمدة منفصلة تماماً من مصفوفة الارتباك، مما يعني أن زيادة عدد العينات السلبية لن يؤثر حسابياً على حسابات TPR، ولن يؤثر تزايد الإيجابيات على FPR. ومع ذلك، فإن وجود السلبيات الصحيحة (TN) في مقام معادلة FPR يمثل نقطة ضعف جوهرية للمنحنى في سيناريوهات عدم التوازن الحاد؛ فعندما يكون عدد الحالات السلبية بالغا جداً (مثلاً مئات الآلاف)، فإن حدوث آلاف الحالات من الإيجابيات الكاذبة (FP) سينتج عنه كسر ضئيل جداً في قيمة FPR، مما يترك انطباعاً مضللاً بأن النموذج يعمل بكفاءة استثنائية.
3.2 تأثير عدم توازن البيانات على التمثيل البياني
يؤدي هذا الخلل الرياضي في بنية منحنى ROC إلى ما يُعرف بظاهرة التفاؤل الزائف (Optimism Bias) عند تطبيق الخوارزميات على فئات نادرة الوجود. ففي مثل هذه السيناريوهات، يقترب منحنى ROC بشكل خادع من الزاوية العلوية اليسرى، محققاً مساحة تحت المنحنى (ROC AUC) تتجاوز 0.95 في كثير من الأحيان، على الرغم من أن النموذج قد يُغرق النظام بآلاف الإنذارات الكاذبة التي تجعل منه عبئاً تشغيلياً غير قابل للاستخدام في الواقع العملي.
في المقابل، يتصدى منحنى الدقة والاسترجاع (PR Curve) لهذا الخلل الجوهري من خلال استبعاد السلبيات الصحيحة (TN) تماماً من حساباته الرياضية؛ حيث يربط بين الدقة على المحور الرأسي والاسترجاع على المحور الأفقي. ولما كانت الإيجابيات الكاذبة (FP) تُقارن مباشرة مع الإيجابيات الصحيحة (TP) في مقام مقياس الدقة، فإن أي تدفق للإنذارات الكاذبة سيؤدي فورياً إلى هبوط حاد ومرئي في منحنى PR، مما يكشف الأداء الفعلي المتواضع للخوارزمية بدقة متناهية دون أدنى تزييف إحصائي.
يوضح الجدول المنهجي التالي المقارنة التحليلية الدقيقة بين المنحنيين وفق المعايير الإحصائية المعتمدة:
- المحاور الرياضية: يربط منحنى ROC بين TPR و FPR، بينما يربط منحنى PR بين Precision و Recall.
- الحساسية لحجم السلبيات الحقيقية (TN): منحنى ROC شديد التأثر بالسلبيات الحقيقية ويخفي أثر تراكمها، بينما منحنى PR محايد كلياً تجاه السلبيات الحقيقية.
- الاستجابة لعدم توازن البيانات: يُظهر منحنى ROC انحيازاً تفاؤلياً زائفاً، بينما يُعد منحنى PR شديد الصرامة والدقة في إبراز عيوب النموذج.
- خط الأساس للمصنف العشوائي: يمثل خط الأساس في ROC خطاً قطرياً ثابتاً دائماً عند القيمة 0.5، بينما يمثل خط الأساس في PR خطاً أفقياً متغيراً يساوي نسبة الفئة الإيجابية الحقيقية في البيانات (P / (P + N)).
- الاستخدام الموصى به: يُفضل ROC في البيانات المتوازنة وعند الاهتمام المتساوي بكلا الفئتين، ويُفضل PR قطعياً في البيانات غير المتوازنة وتطبيقات الفئات النادرة.
4. إعداد بيئة العمل البرمجية واستيراد المكتبات الأساسية
4.1 تجهيز بيئة بايثون وحزم الحوسبة العلمية
يتطلب الشروع في بناء وتحليل منحنيات الدقة والاسترجاع إعداد بيئة برمجية متينة ومستقرة في لغة بايثون، تعتمد على حزم الحوسبة العددية والإحصائية القياسية في الصناعة. يُوصى بإنشاء بيئة افتراضية مستقلة باستخدام أدوات إدارة البيئات مثل `venv` أو `conda`، لضمان عزل الاعتماديات البرمجية وتجنب أي تعارض في إصدارات الحزم المستخدمة عبر المشاريع المختلفة. يُشكل هذا الإجراء ضمانة منهجية لإمكانية تكرار التجارب الحسابية وإعادة إنتاجها وفق المعايير العلمية الدقيقة.
ترتكز البنية التحتية لتنفيذ هذه العمليات على مكتبة NumPy لإدارة المصفوفات متعددة الأبعاد والحسابات الجبرية الخطية عالية الأداء، ومكتبة SciPy للعمليات الإحصائية والتكامل العددي المتقدم. كما تمثل مكتبة Scikit-Learn المنظومة المرجعية الأساسية التي تزود المطورين بالخوارزميات التنبؤية ودوال الحساب الإحصائي للمقاييس المعقدة. يجب التأكد من تحديث هذه الحزم إلى أحدث الإصدارات المستقرة للاستفادة من التحسينات الحسابية ودوال العرض الرسومي الحديثة المدمجة فيها.
4.2 استدعاء وحدات النمذجة والتقييم والتصور البياني
تتضمن الخطوة التالية في التدفق البرمجي استدعاء الدوال والوحدات الوظيفية المناسبة من مكتبات النمذجة والتصور الإحصائي. يتم استيراد وحدات تقسيم البيانات وتوليد التوزيعات الاصطناعية من حزمة `sklearn.model_selection` و `sklearn.datasets`، والتي تتيح للمستخدم ضبط التوزيعات الإحصائية والتحكم الدقيق في درجات تعقيد البيانات التجريبية. وتُعد هذه الوحدات مسؤولة عن هندسة العينات وضمان سلامة الإجراءات التجريبية قبل إدخالها إلى مرحلة التدريب.
ومن جانب التقييم وحساب المقاييس، يتم استدعاء الدوال المتخصصة من مكتبة `sklearn.metrics`، ومن أبرزها دالة `precision_recall_curve` لحساب نقاط المنحنى، ودالة `average_precision_score` لحساب متوسط الدقة الموزون، وفئة `PrecisionRecallDisplay` المسؤولة عن بناء الكائنات الرسومية المعقدة. ولإخراج المخططات البيانية بجودة نشر أكاديمية عالية، يتم الاعتماد على مكتبة `matplotlib.pyplot` مقترنة بمكتبة `seaborn` لضبط التنسيقات اللونية، وسمك الخطوط، وهوامش المحاور، والخطوط الطباعية المعتمدة في التقارير الفنية المتقدمة.
5. توليد وتجهيز مجموعات البيانات التجريبية ذات التوزيع غير المتوازن
5.1 بناء مجموعة بيانات تصنيفية باستخدام make_classification
لإجراء تجارب محاكاة منضبطة تبرز الخصائص الرياضية لمنحنى PR، يتم توليد مجموعات بيانات اصطناعية خاضعة للرقابة الإحصائية الدقيقة باستخدام دالة `make_classification` المتوفرة في Scikit-Learn. تتيح هذه الدالة توليد مصفوفات أبعاد اصطناعية مع التحكم في عدد العينات الكلي، وعدد الخصائص المعلوماتية الحقيقية (Informative Features)، والخصائص المتكررة أو الزائدة (Redundant Features)، ومقدار التداخل العشوائي بين الفئات عبر معامل الفصل الطبقي.
تتم محاكاة مشكلة البيانات غير المتوازنة عبر ضبط معامل الأوزان `weights`، كأن يتم تخصيص وزن 0.95 للفئة السالبة مقابل 0.05 فقط للفئة الموجبة، مما يعكس توزيعاً واقعياً شديد الانحياز. كما يُعد تثبيت البذرة العشوائية (Random State) ضرورة منهجية وأخلاقية في البحث العلمي والبرمجي لضمان اتساق النتائج وتطابقها التام عند إعادة تنفيذ الشفرة من قِبل باحثين آخرين أو عبر منصات حوسبة متباينة.
5.2 تقسيم البيانات وإجراء المعايرة المسبقة
تخضع مجموعة البيانات المولدة لعملية تقسيم منهجي إلى مجموعتي تدريب (Training Set) واختبار (Testing Set). وفي ظل سيناريوهات عدم التوازن الإحصائي، يُعد التقسيم العشوائي البسيط ممارسة غير سليمة قد تؤدي إلى اختفاء الفئة النادرة تماماً من مجموعة الاختبار أو تمثيلها بنسب مشوهة تخالف التوزيع الأصلي للبيانات. ولتلافي هذا الخطأ المنهجي، يتم تطبيق التقسيم الطبقي (Stratified Split) عبر تمرير مصفوفة التسميات لمعامل `stratify` في دالة `train_test_split`.
يضمن التقسيم الطبقي الحفاظ الصارم على نفس النسبة المئوية لتوزيع الفئات الأصلية عبر مجموعتي التدريب والاختبار على حد سواء؛ فإذا كانت نسبة الفئة الإيجابية في المجتمع الإحصائي الكلي 5%، فإن التقسيم يضمن أن تظل هذه النسبة ثابتة بدقة في عينة التدريب وفي عينة التحقق النهائي. يتم بعد ذلك فصل مصفوفات الخصائص المستقلة المتصلة عن متجهات التسميات الثنائية التابعة، مع إجراء فحص إحصائي للتأكد من خلو البيانات المقسمة من أي تشوهات توزيعية قد تؤثر سلباً على تقارب الخوارزميات أثناء التدريب.
6. بناء نموذج التصنيف واستخراج الاحتمالات التنبؤية
6.1 تدريب نموذج الانحدار اللوجستي (Logistic Regression)
يُعد نموذج الانحدار اللوجستي (Logistic Regression) النموذج الخطي المعياري الأساسي في مهام التصنيف الثنائي، نظراً لقدرته المنهجية على تقدير الاحتمالات الشرطية المستمرة عبر دالة السيجمويد (Sigmoid Function). تقوم الخوارزمية برسم حد قرار خطي يربط التركيبة الخطية للمتغيرات المستقلة بالاحتمال اللوجستي المنتمي للفترة [0, 1]. يتم ضبط المعلمات الفائقة للنموذج، مثل خوارزمية التحسين (Solver) ومعامل التنظيم الرياضي (Regularization Parameter C)، لضمان التقارب الحسابي السلس للخوارزمية وتفادي الوقوع في فخ الإفراط في المطابقة (Overfitting).
يتم تدريب النموذج وتحديث أوزانه باستخدام دالة الملاءمة `fit` على مصفوفات التدريب المعايرة فقط. تهدف هذه العملية الحسابية إلى تصغير دالة الخسارة اللوغاريتمية (Log-Loss) عبر التكرار التدرجي، وصولاً إلى الأوزان المثلى التي تفصل بين المتجهات الخصائصية بكفاءة مقبولة. ويجب التحقق من تقارب النموذج وعدم تجاوزه الحد الأقصى للتكرارات الحسابية المعينة مسبقاً، للتأكد من وصول خوارزمية التحسين إلى الحد الأدنى الشامل لفضاء الخسارة الإحصائية.
6.2 استخراج الاحتماليات المستمرة مقابل التسميات الثنائية
يقع كثير من المبتدئين في خطأ منهجي فادح عند محاولة بناء منحنى الدقة والاسترجاع عبر استدعاء دالة التنبؤ المباشر `predict`، والتي تقوم بإرجاع تسميات قاطعة ثنائية (0 أو 1) بناءً على عتبة افتراضية ثابتة تبلغ 0.5. إن هذا الإجراء يجرد البيانات من بعدها الديناميكي ويحول المنحنى إلى نقطة مفردة مشوهة لا تعبر عن الأداء الشامل للمصنف عبر فضاء الاحتمالات الكامل.
ولبناء المنحنى بصورة رياضية صحيحة، يجب استدعاء دالة الاحتمالات التنبؤية `predict_proba` على بيانات الاختبار المستقلة. تُرجع هذه الدالة مصفوفة ثنائية الأبعاد تتضمن عمودين؛ يمثل العمود الأول احتمال انتماء كل عينة للفئة السلبية P(y=0|X)، بينما يمثل العمود الثاني احتمال انتماء العينة للفئة الإيجابية المستهدفة P(y=1|X). يتم استخلاص العمود الثاني حصراً وتخزينه كمتجه احتمالي متصل، وهو المتجه الذي يغذي خوارزميات حساب المنحنى ويسمح باختبار آلاف العتبات التدريجية المتتابعة.

7. الحساب الرياضي لنقاط المنحنى عبر Scikit-Learn
7.1 تشريح مخرجات الدالة precision_recall_curve
تُمثل دالة `precision_recall_curve` في مكتبة Scikit-Learn المحرك الحسابي الأساسي لتوليد الإحداثيات الرياضية لمنحنى PR. تأخذ الدالة مدخلين أساسيين هما متجه التسميات الحقيقية `y_test` ومتجه الاحتمالات التنبؤية المستمرة للفئة الإيجابية `y_scores`، وتنتج ثلاثة مصفوفات رقمية مترابطة رياضياً:
- مصفوفة الدقة (Precision Array): تحتوي على قيم الدقة المحسوبة عند كل عتبة احتمال، مرتبة تصاعدياً، وتنتهي دائماً بالقيمة 1.0 كقيمة معيارية مضافة لضبط الإغلاق الرياضي للمنحنى.
- مصفوفة الاسترجاع (Recall Array): تحتوي على قيم الاسترجاع المقابلة لكل عتبة احتمال، مرتبة تنازلياً، وتنتهي بالقيمة 0.0 لضمان الإغلاق عند أعلى عتبة ممكنة.
- مصفوفة العتبات (Thresholds Array): تمثل قيم العتبات الاحتمالية التي استُخدمت لتقسيم التنبؤات وحساب القيم المناظرة في مصفوفتي الدقة والاسترجاع.
من الملاحظات الرياضية الدقيقة التي تستوجب الانتباه في بنية Scikit-Learn أن طول مصفوفة العتبات يقل بمقدار عنصر واحد بالضبط عن طول مصفوفتي الدقة والاسترجاع (أي أن طول العتبات = n، بينما طول الدقة والاسترجاع = n + 1). يرجع هذا التباين البنيوي إلى قيام الدالة بحقن نقطة نهاية اصطناعية تمثل الحالة الحدية التي تصبح فيها العتبة أعلى من أعلى احتمال مسجل، حيث يكون الاسترجاع مساوياً تماماً للصفر والدقة مساوية للواحد الصحيح، وهو ما يتيح إغلاق المنحنى بيانياً دون تشويه إحصائي.
7.2 التحليل الحسابي لآلية مسح العتبات (Threshold Sweeping)
تعتمد الخوارزمية الداخلية لدالة `precision_recall_curve` على منهجية مسح العتبات عالي الكفاءة (Threshold Sweeping Algorithm) لتفادي التعقيد الحسابي الناتج عن إعادة بناء مصفوفة الارتباك بالكامل عند كل عتبة عشوائية. تبدأ الخوارزمية بفرز العينات وتصنيف احتمالاتها التنبؤية تنازلياً من القيمة الأعلى إلى القيمة الأدنى، مع الاحتفاظ بالتسميات الفعلية المناظرة لكل احتمال في مصفوفة موازية مرتبة.
عقب عملية الفرز، تتحرك الخوارزمية تتابعياً عبر الاحتمالات الفريدة، وتقوم بإجراء حسابات تراكمية للإيجابيات الصحيحة (Cumulative TP) والإيجابيات الكاذبة (Cumulative FP) باستخدام المجموع التراكمي للمصفوفات. يتيح هذا النهج التراكمي استخراج عناصر مصفوفة الارتباك لجميع العتبات بتعقيد زمني من رتبة O(N log N) فقط، وهو زمن الفرز الأولي، بدلاً من تعقيد O(N^2) الذي يتطلبه الحساب الساذج المنفصل. كما تعالج الخوارزمية داخلياً الحالات الحدية الحرجة لتجنب القسمة على الصفر في معادلة الدقة عندما لا توجد أي تنبؤات إيجابية، عبر تعيين قيمة الدقة تلقائياً إلى 1.0 عند تلك النقطة الصفرية للاسترجاع.
8. رسم وتخصيص منحنى الدقة والاسترجاع برمجياً
8.1 الرسم الأساسي والتخطيط التوضيحي باستخدام Matplotlib
يتم بناء المخطط البياني الأساسي لمنحنى الدقة والاسترجاع بالاعتماد على واجهة الرسم في مكتبة Matplotlib، حيث يُحدد المحور الأفقي لقيم الاسترجاع في المجال من 0.0 إلى 1.0، بينما يُخصص المحور الرأسي لقيم الدقة في نفس المجال القياسي. يُنفذ ذلك برمجياً عبر تمرير مصفوفة الاسترجاع كإحداثيات أفقية ومصفوفة الدقة كإحداثيات رأسية إلى دالة `plt.plot`، مع ضبط سماكة الخط واللون بما يحقق وضوحاً بصرياً فائقاً.
ولضمان مطابقة المخطط لمعايير العرض العلمي المعتمدة، يجب تسمية المحاور بدقة متناهية مع توضيح الوحدات، وإضافة عنوان رئيسي يحدد النموذج محل التقييم، وتفعيل شبكة التوجيه الخلفية (Grid Lines) بنمط متقطع وشفافية محسوبة. تساعد هذه الشبكة البصرية القارئ على تتبع التقاطعات الإحداثية بدقة، واستقراء قيم الدقة المتوقعة عند مستويات استرجاع محددة بمجرد النظر المجرد للمخطط دون الحاجة للرجوع إلى الجداول الرقمية الخام.
8.2 إضافة خط الأساس للمصنف العشوائي (Baseline/No-Skill)
من الأخطاء التحليلية الشائعة بين الممارسين محاكاة منحنى ROC في رسم خط قطري يبدأ من (0,0) إلى (1,1) كخط أساس عشوائي في منحنى الدقة والاسترجاع؛ فهذا الإجراء باطل رياضياً في فضاء PR. يُمثل المصنف غير المتعلم أو العشوائي (No-Skill Classifier) في منحنى الدقة والاسترجاع بخط أفقي متقطع موازٍ للمحور السيني، يقطع المحور الرأسي (الدقة) عند نقطة رياضية ثابتة تساوي بدقة نسبة انتشار الفئة الإيجابية في مجموعة البيانات الكلية:
Baseline = P / (P + N)
حيث يمثل P عدد العينات الإيجابية الفعلية، و N عدد العينات السلبية الفعلية.
تكمن الأهمية المحورية لإدراج هذا الخط المرجعي في تزويد المحلل بمقياس مقارن موضوعي وفوري يحدد مدى القيمة التنبؤية المضافة للخوارزمية المدربة؛ فإذا كان انتشار الفئة الإيجابية في البيانات هو 2%، فإن خط الأساس يستقر أفقياً عند القيمة 0.02. وأي منحنى لنموذج ذكي يرتفع بوضوح فوق هذا الخط يثبت امتلاكه لقدرة تمييزية تفوق التخمين الإحصائي الصرف، وكلما اتسعت الفجوة الرأسية بين المنحنى وخط الأساس، دل ذلك على كفاءة الخوارزمية في تنقية الإشارات الصحيحة من الخلفية الضبابية للبيانات.
8.3 استخدام فئة PrecisionRecallDisplay المتقدمة
وفرت التحديثات المعاصرة لحزمة Scikit-Learn كائنات برمجية مهيكلة لتبسيط عمليات التمثيل البياني وجعلها أكثر مرونة ومقاومة للأخطاء البشرية، وفي مقدمتها فئة `PrecisionRecallDisplay`. تتيح هذه الفئة منهجين تنفيذيين رفيعي المستوى لتوليد الرسوم البيانية؛ الأول هو الدالة المباشرة `PrecisionRecallDisplay.from_predictions`، والتي تقبل التسميات الحقيقية والاحتمالات التنبؤية مباشرة وتتولى حساب المصفوفات ورسم المنحنى آلياً بأسلوب برمجي مدمج.
أما المنهج الثاني فيتمثل في دالة `PrecisionRecallDisplay.from_estimator`، والتي تُمرر إليها بنية النموذج المدرب مباشرة مع مصفوفة خصائص الاختبار `X_test` والتسميات `y_test`. تتولى الدالة استخراج الاحتمالات ذاتياً، وحساب متوسط الدقة الموزون، وبناء المخطط البياني متضمناً وسيلة الإيضاح الرقمية (Legend) تلقائياً. تتيح هذه الكائنات البرمجية المتقدمة إمكانية التعديل اللاحق على خصائص المحاور عبر معالجة كائن `ax` التابع لـ Matplotlib، مما يجمع بين سرعة التنفيذ البرمجي ومرونة التخصيص الجمالي المتقدم.
9. حساب وتفسير المساحة تحت منحنى الدقة والاسترجاع (PR AUC)
9.1 التكامل العددي والمساحة تحت المنحنى (AUC-PR)
تُمثل المساحة تحت منحنى الدقة والاسترجاع (Area Under the Precision-Recall Curve – AUC-PR) مقياساً عددياً مجملاً يلخص الأداء الكلي للمصنف عبر كافة العتبات في رقم قياسي مفرد يتراوح نظرياً بين خط الأساس العشوائي والواحد الصحيح. يتم حساب هذه المساحة رياضياً عبر تطبيق تقنيات التكامل العددي (Numerical Integration)، وتحديداً قاعدة شبه المنحرف (Trapezoidal Rule) المدمجة في دالة `auc` الرياضية في Scikit-Learn.
تقوم قاعدة شبه المنحرف بربط النقاط المتتالية للمنحنى بقطع مستقيمة خطية وحساب مجموع مساحات أشباه المنحرفات الناتجة تحت تلك القطع. ومع ذلك، تشير الدراسات الإحصائية المتقدمة، ولا سيما أبحاث ديفيس وجودريتش (Davis & Goadrich, 2006)، إلى وجود قصور رياضي في استخدام قاعدة شبه المنحرف البسيطة لحساب AUC-PR؛ إذ إن الاستيفاء الخطي المباشر بين النقاط في فضاء الدقة والاسترجاع يميل إلى إعطاء تقدير متفائل ومفرط في الارتفاع للمساحة الحقيقية، نظراً لأن السلوك الرياضي الفعلي للمنحنى بين النقاط يتبع دوال غير خطية وليست مستقيمة، مما يفرض توخي الحذر عند تفسير القيم الناتجة عن هذا التكامل العددي البسيط.
9.2 حساب متوسط الدقة (Average Precision – AP)
لتجاوز القيود الرياضية لقاعدة شبه المنحرف، يُجمع المجتمع العلمي لتعلم الآلة على اعتماد مقياس متوسط الدقة (Average Precision – AP) كمعيار قياسي أكثر صرامة ودقة إحصائية لتقييم المساحة تحت منحنى PR. يتم حساب متوسط الدقة برمجياً عبر دالة `average_precision_score`، والتي تُعرّف رياضياً كمتوسط مرجح لقيم الدقة المحققة عند كل عتبة، وتُحسب وفق المعادلة التالية:
AP = Sum_n ((R_n – R_(n-1)) * P_n)
حيث يمثل P_n قيمة الدقة عند العتبة الحالية n، بينما يمثل (R_n – R_(n-1)) مقدار الزيادة والانتقال في مقياس الاسترجاع بين العتبة السابقة والعتبة الحالية. يعتمد هذا الحساب على مبدأ استيفاء الدرج (Stepwise Constant Interpolation)، وهو التقدير الأدق لمسار التغيرات في مصفوفة الارتباك عند تحريك العتبات.
يتميز مقياس AP بتطابقه مع مساحة منحنى الدقة والاسترجاع المحسوبة بدقة متناهية دون الوقوع في خطأ التقدير الخطي المتفائل لقاعدة شبه المنحرف. ولذلك، يُعد AP المقياس المعتمد والمعياري في المسابقات الدولية المرموقة، وتحديات الرؤية الحاسوبية كمسابقة PASCAL VOC وتحدي COCO لرصد الكائنات، ويُنصح باعتماده في الأوراق البحثية كبديل قطعي للتكامل العددي التقليدي للمنحنى.
10. استراتيجيات اختيار عتبة القرار المثلى (Optimal Threshold)
10.1 تعظيم مقاييس التوافق الرياضي (F-Measure Optimization)
تتمثل إحدى أهم الوظائف التطبيقية لمنحنى الدقة والاسترجاع في تحديد عتبة القرار التشغيلية المثلى (Optimal Operating Threshold) بدلاً من الانقياد الأعمى وراء العتبة الافتراضية 0.5. وتعتمد المنهجية الرياضية الأولى في هذا السياق على تعظيم مقياس التوافق F1 عبر مسح مصفوفات الدقة والاسترجاع المحسوبة واستخراج العتبة التي تحقق أعلى قمة لمنحنى F1.
يتم تنفيذ هذه العملية برمجياً باستخدام مكتبة NumPy عبر تحويل معادلة F1 إلى متجه حسابي يطبق على مصفوفتي المنحنى كالتالي:
f1_scores = (2 * precision * recall) / (precision + recall)
ثم استخدام الدالة `np.argmax` لتحديد الفهرس الرقمي لأعلى قيمة محققة في متجه F1، واسترجاع قيمة العتبة المقابلة لذلك الفهرس من مصفوفة `thresholds`. وفي الحالات التي تقتضي ترجيح أحد المقياسين، يتم استبدال معادلة F1 بمعادلة F-beta وتطبيق نفس الآلية الحسابية للوصول إلى العتبة التي تحقق التوازن الموجه المطلوب بدقة متناهية.
10.2 تطبيق مصفوفات التكلفة والخسارة المادية
في البيئات الإنتاجية والمشاريع الصناعية، نادراً ما تتساوى التكلفة الاقتصادية لأخطاء التصنيف؛ فالخسارة المالية المترتبة على مرور عملية احتيال بنكي (سلبي كاذب – FN) تفوق بمراحل تكلفة إرسال رسالة تحقق إضافية للعميل في حال الاشتباه الخاطئ (إيجابي كاذب – FP). ولذلك، تتطلب الحوكمة الهندسية للأنظمة الذكية ربط عتبات منحنى PR بمصفوفة التكلفة والخسارة المالية (Cost Matrix).
تُعرّف دالة التكلفة الإجمالية رياضياً كالتالي:
Total Cost = (Cost_FP * FP) + (Cost_FN * FN) + (Cost_TP * TP) + (Cost_TN * TN)
يقوم المهندس برسم منحنى بياني يربط بين قيم التكلفة المالية المتوقعة على المحور الرأسي وعتبات القرار المختلفة على المحور الأفقي. ومن خلال هذا التحليل، يتم اختيار “عتبة التشغيل الاقتصادية” التي تحقق الحد الأدنى المطلق للخسائر المالية للنظام، حتى وإن كانت تلك العتبة لا تتطابق حسابياً مع ذروة مقياس F1، مما يدمج متطلبات إدارة المخاطر المؤسسية مباشرة في عمق النموذج الإحصائي.
11. المقارنة البصرية لأداء خوارزميات متعددة عبر منحنيات PR
11.1 تدريب وتجهيز نماذج تنبؤية متباينة التعقيد
تتجلى القوة التحليلية لمنحنى الدقة والاسترجاع عند استخدامه كأداة مقارنة بصرية شاملة لتقييم عائلة متنوعة من الخوارزميات التنبؤية ذات البنى الرياضية المتباينة على نفس مجموعة بيانات الاختبار الموحدة. تشمل المقارنة المنهجية تدريب نماذج خطية كالانحدار اللوجستي (Logistic Regression)، ونماذج معتمدة على مجموعات الأشجار كالغابات العشوائية (Random Forests)، ونماذج التعزيز التدرجي المتقدمة مثل XGBoost أو LightGBM.
لضمان النزاهة العلمية للمقارنة وتجنب أي تحيز في التقييم، يجب إخضاع جميع النماذج لبروتوكول تدريب صارم وموحد؛ حيث تُدرب جميع الخوارزميات على نفس مصفوفات التدريب المعايرة وتُختبر على نفس مصفوفة الاختبار المعزولة تماماً. كما يُفضل تطبيق التحقق المتقاطع الطبقي (Stratified K-Fold Cross-Validation) لضبط المعلمات الفائقة لكل نموذج على حدة قبل إجراء المقارنة النهائية، لضمان وصول كل خوارزمية إلى أقصى طاقتها الاستيعابية والتمييزية.
11.2 توليد رسم بياني متعدد المنحنيات ومقارنة درجات AP
يتم رسم منحنيات PR لجميع النماذج المتنافسة على لوحة بيانية مشتركة في Matplotlib، مع تخصيص نمط خطي ولون مميز لكل مصنف لضمان سهولة التمييز البصري. وتتضمن الممارسة القياسية إدراج درجة متوسط الدقة (AP Score) المحسوبة لكل خوارزمية بجانب اسمها مباشرة في وسيلة الإيضاح (Legend) التوضيحية للشكل، كأن يُكتب: `Random Forest (AP = 0.88)` و `Logistic Regression (AP = 0.65)`.
يتيح هذا التمثيل المتراكب للمحللين إجراء تقييم تفاضلي يتجاوز مجرد مقارنة الرقم الإجمالي للمساحة؛ إذ يمكن رصد السلوك الديناميكي لكل خوارزمية عبر قطاعات الاسترجاع المختلفة. فقد يتفوق نموذج معين في قطاع الاسترجاع المنخفض (تحقيق دقة متناهية للحالات فائقة الوضوح)، بينما ينهار في قطاعات الاسترجاع المرتفع لصالح نموذج تعزيز تدرجي يتمتع بمرونة أعلى في التقاط الأنماط المعقدة في ذيول التوزيعات الاحتمالية، مما يوجه الفريق الهندسي لاختيار النموذج الأنسب لبيئة التشغيل المستهدفة بدقة وموضوعية.
12. التطبيقات المتقدمة والتعامل مع المشكلات المعقدة
12.1 منحنيات الدقة والاسترجاع للتصنيف متعدد الفئات (Multiclass)
على الرغم من أن منحنى الدقة والاسترجاع قد صُمم بنيوياً للتصنيف الثنائي، إلا أنه يمكن توسيعه رياضياً ليشمل مشكلات التصنيف متعدد الفئات (Multiclass Classification) التي تحتوي على ثلاثة أصناف أو أكثر، وذلك عبر تطبيق استراتيجية “فئة مقابل البقية” (One-vs-Rest / OvR). بموجب هذه الاستراتيجية، يتم تحويل مصفوفة التسميات المستهدفة إلى تمثيل ثنائي مشفر (Binarized Labels) باستخدام دالة `label_binarize`، بحيث تُعامل كل فئة على حدة كفئة إيجابية في مواجهة جميع الفئات الأخرى مجتمعة كفئة سلبية.
يتم بعد ذلك حساب منحنى PR مستقل ومخصص لكل صنف تصنيفي، مما يتيح فحص كفاءة النموذج على الفئات النادرة مقابل الفئات الشائعة ضمن نفس المنظومة التنبؤية. وللحصول على تقييم تجميعي شامل للأداء الكلي، يتم تطبيق نوعين من استراتيجيات التجميع الرياضي:
- المتوسط الصغير (Micro-Average): يجمع التنبؤات الإيجابية والسلبية لجميع الفئات في مصفوفة ارتباك عالمية واحدة موحدة لحساب الدقة والاسترجاع الكليين، مما يعطي وزناً أكبر للفئات ذات التكرار العالي.
- المتوسط الكبير (Macro-Average): يحسب منحنى PR ودرجة AP لكل فئة بشكل منفصل تماماً، ثم يأخذ المتوسط الحسابي البسيط للنتائج دون النظر لحجم الفئة، مما يضمن تقييماً عادلاً وصارماً يمنح الفئات النادرة صوتاً مساوياً للفئات المهيمنة.
12.2 المعايرة الاحتمالية (Probability Calibration) وأثرها على المنحنى
تعتمد صحة وموثوقية عتبات منحنى الدقة والاسترجاع على مدى مطابقة الاحتمالات التنبؤية الناتجة عن النموذج للترددات النسبية الحقيقية في الواقع الموضوعي، وهو ما يُعرف بالمعايرة الاحتمالية (Probability Calibration). تعاني العديد من خوارزميات تعلم الآلة غير الخطية كالغابات العشوائية وشبكات التعلم العميق ونماذج دعم المتجهات (SVM) من انحرافات في معايرة الاحتمالات؛ حيث تميل الغابات العشوائية إلى الابتعاد عن القيم الحدية الصفرية والواحدية نتيجة متوسطات الأشجار، بينما تفرط شبكات التعلم العميق في الثقة التنبؤية المضللة.
يتم تصحيح هذا التشوه الاحتمالي عبر تطبيق تقنيات المعايرة المتقدمة المدمجة في فئة `CalibratedClassifierCV` في Scikit-Learn، والتي تقدم منهجين رئيسيين: تقنية معايرة بلات (Platt Scaling) المعتمدة على الانحدار اللوجستي، وتقنية الانحدار المتساوي (Isotonic Regression) غير المعلمية. يؤدي تطبيق المعايرة إلى إعادة هيكلة التوزيع الاحتمالي الداخلي للنموذج دون التأثير على الترتيب النسبي للعتبات، مما يضمن أن الاحتمال التنبؤي 0.8 يعكس بدقة احتمال حدوث حقيقي بنسبة 80%، وهو ما يُكسب عتبات منحنى PR استقراراً وتوافقاً تشغيلياً عالياً عند التطبيق الفعلي.
12.3 أفضل الممارسات والأخطاء الشائعة أثناء التطبيق العملي
يتطلب التطبيق الاحترافي لمنحنيات الدقة والاسترجاع في البيئات البحثية والصناعية الالتزام بمجموعة من الضوابط الهندسية الصارمة لتفادي الأخطاء المنهجية القاتلة. وفي مقدمة هذه الأخطاء ظاهرة تسريب البيانات (Data Leakage)، والتي تحدث عندما يتم تحجيم الخصائص (Feature Scaling) أو اختيار المتغيرات على كامل مجموعة البيانات قبل التقسيم، مما ينقل معلومات خفية من بيانات الاختبار إلى التدريب وينتج عنه منحنى PR زائف ومفرط في المثالية ينهار فورياً عند النشر الإنتاجي.
كما تشمل الممارسات الواجب اتباعها تجنب تقييم النماذج على مجموعات اختبار شديدة الصغر؛ حيث يؤدي قلة عدد الحالات الإيجابية إلى تقلبات إحصائية عشوائية حادة ومظهر متدرج خشن وغير مستقر لمنحنى PR، مما يستوجب استخدام أساليب إعادة أخذ العينات (Bootstrapping) لحساب فترات الثقة الإحصائية (Confidence Intervals) للمنحنى. وأخيراً، يجب توثيق كافة المعلمات الفائقة، وتوزيعات الفئات الأصلية، ودرجات AP إلى جانب منحنيات ROC المقابلة في التقارير الفنية والأكاديمية، لتقديم رؤية تقييمية شفافة ومتكاملة تخضع لقواعد التحقق العلمي الصارم.
خاتمة
يمثل منحنى الدقة والاسترجاع (Precision-Recall Curve) الأداة الإحصائية والبيانية الأكثر نضجاً وموثوقية في تقييم نماذج التصنيف في تعلم الآلة، لا سيما في ظل التحديات الحقيقية التي تفرضها البيانات غير المتوازنة والفئات النادرة. ومن خلال فهم الأسس الرياضية العميقة التي تحكم مقاييس الدقة والاسترجاع، واستيعاب الفروق الهيكلية بين هذا المنحنى ومنحنى ROC، يكتسب الباحثون والمهندسون القدرة على تفكيك السلوك التنبؤي المعقد للخوارزميات بدقة متناهية.
إن التنفيذ البرمجي المتقن عبر منظومة بايثون وحزمها العلمية كـ Scikit-Learn و Matplotlib لا يقتصر على مجرد استدعاء سطور برمجية لرسم المنحنيات، بل يمتد ليشمل المعايرة الاحتمالية، وتطبيق مصفوفات التكلفة المالية لاختيار عتبات القرار المثلى، والتعامل الاحترافي مع التصنيفات متعددة الفئات. إن تبني هذه المنهجيات المتقدمة يضمن بناء أنظمة ذكاء اصطناعي تتسم بالشفافية، والصلابة، والقدرة التشغيلية العالية، مما يردم الفجوة بين النماذج النظرية والتطبيقات الإنتاجية الحساسة في العالم الحقيقي.
References
- Davis, J., & Goadrich, M. (2006). The relationship between Precision-Recall and ROC curves. In Proceedings of the 23rd international conference on Machine learning (pp. 233-240). https://doi.org/10.1145/1143844.1143874
- Fawcett, T. (2006). An introduction to ROC analysis. Pattern Recognition Letters, 27(8), 861-874. https://doi.org/10.1016/j.patrec.2005.10.010
- Pedregosa, F., Varoquaux, G., Gramfort, A., Michel, V., Thirion, B., Grisel, O., Blondel, M., Prettenhofer, P., Weiss, R., Dubourg, V., Vanderplas, J., Passos, A., Cournapeau, D., Brucher, M., Perrot, M., & Duchesnay, E. (2011). Scikit-learn: Machine learning in Python. Journal of Machine Learning Research, 12, 2825-2830. https://scikit-learn.org
- Saito, T., & Rehmsmeier, M. (2015). The precision-recall plot is more informative than the ROC plot when evaluating imbalanced datasets. PLOS ONE, 10(3), e0118432. https://doi.org/10.1371/journal.pone.0118432
- Zadrozny, B., & Elkan, C. (2002). Transforming classifier scores into accurate multiclass probability estimates. In Proceedings of the eighth ACM SIGKDD international conference on Knowledge discovery and data mining (pp. 694-699). https://doi.org/10.1145/775047.775151