تُعد مصفوفة الارتباك (Confusion Matrix) أداة تحليلية وإحصائية جوهرية لا غنى عنها في تقييم دقة النماذج التنبؤية والتصنيفية، لا سيما في ميادين علم النفس السريري والقياس النفسي الحديث. تتيح هذه المصفوفة للباحثين والممارسين تفكيك الأداء التشخيصي بدقة بالغة تتجاوز مقاييس الدقة الإجمالية البسيطة التي قد تكون مضللة في سياق الاضطرابات النفسية النادرة أو غير المتكافئة. من خلال فحص التوافق والاختلاف بين التشخيصات الفعلية والتنبؤات الصادرة عن الاختبارات النفسية أو خوارزميات التعلم الآلي، تمنحنا مصفوفة الارتباك رؤية معمقة حول معدلات الخطأ التشخيصي وعواقبه السريرية والأخلاقية.
المفهوم الإبستمولوجي والتعريف النظري لمصفوفة الارتباك
تُعرّف مصفوفة الارتباك بأنها جدول تخطيطي منظّم يُستخدم لتقييم أداء نموذج تصنيفي خاضع للإشراف، حيث يعرض التوزيع التكراري للفئات الحقيقية في مقابل الفئات التي تنبأ بها النموذج أو الأداة السيكومترية. في السياق النفسي، يكتسب هذا المفهوم أهمية ابستمولوجية عميقة؛ إذ لا يتعلق الأمر بمجرد أرقام مجردة، بل بالقدرة على تحديد ما إذا كان الفرد يعاني حقاً من اضطراب نفسي كالاكتئاب الجسيم أو الفصام، أو أنه يتمتع بسلامة نفسية طبيعية. يعتمد هذا التصنيف على مطابقة الواقع الإكلينيكي الملموس (المعيار الذهبي أو الفئة الحقيقية) مع النتائج المستخلصة من الاختبارات التشخيصية أو التقييمات النفسية المحوسبة.
تكمن الطبيعة الجوهرية لمصفوفة الارتباك في كشفها لمكامن الخطأ النوعي التي قد يقع فيها الممارس أو النموذج الحسابي؛ فالأخطاء التشخيصية في الصحة النفسية ليست متكافئة من حيث التكلفة النفسية والاجتماعية والعلاجية. إن التمييز الدقيق بين المريض النفسي والشخص السليم يمثل حجر الزاوية في بناء البروتوكولات العلاجية السليمة، وهنا تأتي المصفوفة لتجسد فلسفة القرار السريري متعدد الأبعاد. إنها ليست مجرد أداة حاسوبية مستوردة من علوم البيانات، بل هي امتداد رياضي لنظرية كشف الإشارة (Signal Detection Theory) التي شكّلت لسنوات طويلة ركناً أساسياً في علم النفس التجريبي وعلم النفس المعرفي.
إضافة إلى ذلك، توفر مصفوفة الارتباك الأساس الرياضي والمنطقي لاشتقاق حزمة متكاملة من المؤشرات الإحصائية المتقدمة مثل الحساسية، والنوعية، والقيم التنبؤية الموجبة والسالبة، ومعامل كابا لكوهين. تسمح هذه الحزمة الشاملة لعلماء النفس بتجاوز فخ “مفارقة الدقة” (Accuracy Paradox)؛ وهي الحالة التي يظهر فيها الاختبار دقة إجمالية مرتفعة للغاية تصل إلى تسعين بالمئة مثلاً، لمجرد أن الاضطراب النفسي المفحوص نادر الحدوث في المجتمع، بينما يكون الاختبار في حقيقة الأمر عاجزاً تماماً عن رصد أي حالة إيجابية حقيقية. بالتالي، تشكل المصفوفة صمام أمان منهجي يضمن سلامة القياس النفسي ودقته الإكلينيكية المعيارية.
البنية الهيكلية والمكونات الرباعية للمصفوفة في التشخيص النفسي
تتألف مصفوفة الارتباك الثنائية التقليدية من أربعة مخرجات رئيسية تنتج عن تقاطع حالتين واقعيتين (وجود الاضطراب أو غيابه) مع حالتين تنبؤيتين (تشخيص الاضطراب أو نفيه). المكون الأول هو الإيجابي الحقيقي (True Positive)، ويمثل الحالات التي شخصها المقياس النفسي بوجود الاضطراب، وكان الفرد يعاني منه بالفعل وفق المعيار التشخيصي المرجعي كالدليل التشخيصي والإحصائي للاضطرابات النفسية. يعكس هذا المؤشر قدرة الأداة السيكومترية على اكتشاف المرضى المستهدفين بالرعاية العلاجية دون إغفالهم.
المكون الثاني هو السلبي الحقيقي (True Negative)، وهو يشير إلى الأفراد الأصحاء أو الذين لا تنطبق عليهم معايير الاضطراب، وقد صنفتهم الأداة التشخيصية بنجاح كأشخاص غير مصابين. يعد هذا المكون بالغ الأهمية في الدراسات المسحية واسعة النطاق والبيئات المدرسية والمهنية، حيث يضمن عدم وصم الأشخاص الأسوياء بأمراض نفسية لا يعانون منها، مما يحافظ على التوازن النفسي والاجتماعي للمفحوصين ويمنع الهدر غير المبرر للموارد الطبية والنفسية المحدودة.
المكون الثالث هو الإيجابي الكاذب (False Positive)، أو ما يُعرف في الأدبيات المنهجية والإحصائية بخطأ النمط الأول (Type I Error). يحدث هذا الخطأ عندما تقرر الأداة النفسية أو النموذج التنبؤي أن الفرد يعاني من اضطراب نفسي معين في حين أنه سليم تماماً من الناحية الإكلينيكية الواقعية. في ممارسات الصحة النفسية، يترتب على هذا الخطأ عواقب بالغة الخطورة، كإخضاع الشخص لعلاجات دوائية غير مبررة ذات آثار جانبية عصبية وجسدية، فضلاً عن الوصمة الاجتماعية والاضطراب الانفعالي الناجم عن التشخيص الخاطئ.
المكون الرابع هو السلبي الكاذب (False Negative)، وهو ما يوازي خطأ النمط الثاني (Type II Error). يقع هذا الخطأ المأساوي عندما يفشل الاختبار النفسي في التعرف على الاضطراب، مصنفاً المريض كفرد سليم لا يحتاج إلى رعاية. يعد هذا الخطأ أشد خطورة في حالات تقييم خطر الانتحار أو نوبات الذهان الحاد، حيث يؤدي تفويت التشخيص إلى حرمان المريض من التدخل السريري الطارئ لإنقاذ حياته، مما يجعل ضبط هذا المكون أولوية أخلاقية وسريرية قصوى في بناء المقاييس النفسية.
المقاييس المشتقة وسيكومترية التقييم العيادي
لا تتوقف فائدة مصفوفة الارتباك عند فرز الحالات وتصنيفها، بل تمتد لتكون المحرك الرياضي لاشتقاق معدلات الأداء التشخيصي بالغة الأهمية. المقياس الأول والأبرز هو الحساسية (Sensitivity) أو الاستدعاء (Recall)، وتُحسب بقسمة الإيجابيات الحقيقية على مجموع الإيجابيات الحقيقية والسلبيات الكاذبة. تعكس الحساسية نسبة المرضى النفسيين الفعليين الذين نجح الاختبار في اكتشافهم، وهي معيار حاسم في اختبارات الفحص الأولي (Screening Tests) حيث تتطلب الأمانة الطبية عدم إغفال أي شخص قد يكون بحاجة إلى مساعدة متخصصة.
المقياس المقابل هو النوعية (Specificity)، وتُحسب بقسمة السلبيات الحقيقية على مجموع السلبيات الحقيقية والإيجابيات الكاذبة. تعبر النوعية عن كفاءة الأداة في استبعاد غير المصابين، والتأكد من أن نتائج الاختبار الإيجابية تقتصر على الحالات الحقيقية فقط. في الطب النفسي الشرعي والجنائي، تكتسب النوعية وزناً حاسماً يفوق الحساسية في كثير من الأحيان، لتفادي إدانة شخص غير مسؤول جنائياً أو تبرئة جانٍ بناءً على تشخيص نفسي خاطئ لا يتمتع بالدقة الإقصائية الكافية.
إلى جانب ذلك، تبرز القيمة التنبؤية الإيجابية (Positive Predictive Value / Precision) والقيمة التنبؤية السلبية (Negative Predictive Value) كمؤشرات لا يمكن الاستغناء عنها في الممارسة العيادية الواقعية. تكمن خصوصية هاتين القيمتين في تأثرهما المباشر بمعدل انتشار الاضطراب (Prevalence Rate) في المجتمع الخاضع للدراسة؛ فإذا كان انتشار اضطراب الشخصية الحدية منخفضاً في عينة معينة، فإن القيمة التنبؤية الإيجابية ستنخفض تلقائياً حتى لو كانت حساسية ونوعية المقياس مرتفعتين جداً، وهو ما يبرهن على ضرورة تفسير المصفوفة في ضوء السياق الوبائي الشامل.
لتحقيق التوازن الرياضي بين هذه المؤشرات المتضاربة أحياناً، يستعين الباحثون بـ مقياس إف-1 (F1-Score)، وهو المتوسط التوافقي بين الحساسية والدقة التنبؤية الإيجابية، بالإضافة إلى معامل الارتباط لماتيو (Matthews Correlation Coefficient – MCC). يكتسب معامل ماتيو تقديراً أكاديمياً فائقاً في القياس النفسي المحوسب، نظراً لاعتباره المكونات الأربعة للمصفوفة مجتمعة بأوزان متوازنة، مما يجعله مقياساً مقاوماً لانحيازات عدم توازن الفئات التشخيصية التي تميز معظم قواعد بيانات الاضطرابات العقلية والنفسية.
الجذور التاريخية وتطور المفهوم عبر نظرية كشف الإشارة
تعود الجذور المعرفية لمصفوفة الارتباك إلى أواسط القرن العشرين، وتحديداً خلال الحرب العالمية الثانية، عندما دعت الحاجة العسكرية الملحة إلى تحسين قدرة مشغلي الرادار على التمييز بين طائرات العدو الحقيقية والتشويش الجوي العشوائي. استلهم علماء النفس الرياضي والتجريبي، مثل ديفيد غرين وجون سويتس في ستينيات القرن الماضي، هذه النماذج وطوروها إلى ما يُعرف بـ نظرية كشف الإشارة (Signal Detection Theory)، والتي صاغت بصورة قطعية كيفية اتخاذ القرار البشري الحسي في ظل الشك والغموض البيئي.
أحدثت هذه النظرية ثورة ابتكارية في علم النفس الحسي والمعرفي؛ إذ كشفت أن القرارات الإدراكية ليست مجرد استجابات ميكانيكية للمثيرات، بل تخضع لمتغيرين منفصلين: حساسية الجهاز العصبي للمثير (d-prime)، ومحك القرار الشخصي أو الانحياز المعرفي للمستجيب (Criterion / Beta). في هذا الإطار التاريخي، كانت مصفوفة التوافق الرباعية (الضربة، والخطأ، والإنذار الكاذب، والرفض الصحيح) هي النموذج التأسيسي الذي انبثقت منه لاحقاً مصفوفة الارتباك المعاصرة المعمول بها في علم النفس السريري والذكاء الاصطناعي التشخيصي.
مع تطور حركة الاختبارات النفسية في السبعينيات والثمانينيات، وتحول علم النفس السريري نحو الاعتماد على المقاييس المعيارية الموضوعية كقائمة الشخصية متعددة الأوجه لمينيسوتا (MMPI)، تم توظيف مصفوفة الارتباك لتقييم درجات القطع المثلى (Cut-off Scores). أتاح هذا التطور النظري والمنهجي للأطباء النفسيين ضبط عتبات التشخيص بحسب أهداف التقييم، سواء كان الهدف فحصاً احترازياً يتطلب توسيع شبكة الصيد التشخيصي (تقليل السلبيات الكاذبة)، أو تشخيصاً حاسماً يتطلب صرامة مطلقة لمنع توجيه الاتهامات المرضية الباطلة.
في العقدين الأخيرين، قفز المفهوم قفزة نوعية مع ظهور حقل التعلم الآلي والطب النفسي الحسابي (Computational Psychiatry). لم تعد المصفوفة تقتصر على تقييم أداء اختبار ورقي بسيط ذي خيارين، بل أصبحت أداة التحقق المرجعية لنماذج معقدة من الشبكات العصبية الاصطناعية التي تحلل نصوص جلسات العلاج النفسي، أو نبرات الصوت لدى مرضى الاكتئاب، أو صور الرنين المغناطيسي الوظيفي للدماغ، لتصنيف الحالات ضمن مصفوفات ارتباك متعددة الفئات وعالية الأبعاد تعكس تعقيد الظاهرة النفسية.
الأبعاد السيكومترية واتخاذ القرارات السريرية
يمثل اتخاذ القرار السريري في الطب النفسي وعلم النفس الإكلينيكي عملية بالغة التعقيد، تتقاطع فيها الملاحظة المباشرة مع الفرضيات التشخيصية ونتائج الأدوات السيكومترية. تعمل مصفوفة الارتباك في هذا السياق كبوصلة منهجية توجه الطبيب نحو فهم حدود أدواته وقوتها التنبؤية. إن فهم بنية الأخطاء الناتجة عن مصفوفة مقياس معين يُلزم المعالج بعدم الركون المطلق لدرجة المقياس الرقمية، بل دمجها في نسق تقييمي شامل يأخذ التاريخ المرضي والظروف النفسية والاجتماعية في الحسبان.
ترتبط مصفوفة الارتباك ارتباطاً وثيقاً بـ منحنى خصائص تشغيل المستقبِل (Receiver Operating Characteristic – ROC Curve)، ومساحته تحت المنحنى (AUC). من خلال تعديل درجات القطع على المقياس النفسي، تتغير قيم مصفوفة الارتباك باستمرار؛ إذ يؤدي خفض درجة القطع لتشخيص اضطراب القلق العام إلى زيادة الإيجابيات الحقيقية والحساسية، ولكنه بالمقابل يرفع معدل الإيجابيات الكاذبة ويقلل النوعية. تمنح دراسة مصفوفات الارتباك المتعددة عند عتبات مختلفة الباحث السريري القدرة على اختيار العتبة التوازنية المثالية التي تحقق الغرض التشخيصي بأقل كلفة بشرية ممكنة.
علاوة على ذلك، تلعب مصفوفة الارتباك دوراً نقدياً في كشف الانحيازات القياسية في الاختبارات المطبقة على فئات ثقافية أو عرقية أو جندرية مختلفة (Differential Item Functioning). إذا أظهرت المصفوفة معدلات إيجابية كاذبة مرتفعة بشكل غير متكافئ لدى مجموعة سكانية معينة، فإن ذلك يعد دليلاً سيكومترياً قاطعاً على تحيز الأداة وعدم ملاءمتها الثقافية، مما يستوجب إعادة تقنينها أو تعديل بنودها لتجنب التمييز التشخيصي المؤسسي، وهو ما يجسد التكامل الوثيق بين علم القياس والعدالة السريرية.
المعضلات الأخلاقية والسريرية لتوزيع الأخطاء في مصفوفة الارتباك
تفرض الطبيعة الرياضية لمصفوفة الارتباك معضلة فلسفية وأخلاقية عميقة على العاملين في الصحة النفسية، تتمثل في تحديد أي نوع من الخطأين هو الأقل ضرراً على المريض والمجتمع. في حالات تشخيص اضطرابات مثل الاكتئاب الحاد المترافق مع أفكار انتحارية، يتفق معظم السريريين على أن تفويت تشخيص مريض حقيقي (سلبي كاذب) هو خطأ كارثي لا يُغتفر قد ينتهي بوفاة المريض، ولذلك يُفضل عمداً تقبل نسبة أعلى من الإيجابيات الكاذبة من أجل ضمان عدم إغفال أي مريض بحاجة للحماية والمراقبة.
في المقابل، تتجلى معضلة معاكسة تماماً عند استخدام أدوات التقييم النفسي في مجالات العدالة الجنائية والطب النفسي الشرعي، مثل مقاييس تقييم الاعتلال النفسي السيكوباتي (Psychopathy Checklist) أو أدوات التنبؤ بالخطر الجرمي العنيف. في هذه السياقات، يؤدي تصنيف الفرد كإيجابي كاذب إلى حرمانه من الإفراج المشروط، أو إيداعه في مصحات نفسية مشددة دون وجه حق، ووسمه بوصمة أبدية تدمر مستقبله الإنساني والمدني، مما يجعل الباحثين يطالبون برفع نوعية الأداة لأقصى حد ممكن لتقليص هذه الإيجابيات الكاذبة لأدنى مستوى، حتى لو كان الثمن زيادة طفيفة في السلبيات الكاذبة.
تتفاقم هذه المعضلات الأخلاقية اليوم مع تصاعد دور نماذج الذكاء الاصطناعي التوليدي والتعلم العميق في التشخيص النفسي التلقائي. إن النماذج التي تُعامل كمربعات سوداء (Black-Box Models) قد تحقق نسب دقة إجمالية مبهرة في مصفوفة الارتباك، لكنها قد تعجز عن تقديم تبرير سببي سريري لقراراتها. يثير هذا التباين تساؤلات حاسمة حول المسؤولية المهنية والقانونية: من يتحمل مسؤولية القرار السريري الكارثي الناجم عن سلبي كاذب أصدرته خوارزمية ذكية؟ يظل الجواب الأكاديمي الحاسم هو أن مصفوفة الارتباك وسيلة مساعدة للقرار وليست بديلاً عن العقل الإكلينيكي الرشيد والمتبصر للمختص الإنساني.
مصفوفة الارتباك متعددة الفئات في التصنيف النفسي الطبقي
نادراً ما تكون المشكلات النفسية ثنائية التفرع (مصاب / غير مصاب)؛ فالواقع السريري يتسم بالتشابك والتداخل العرضي، والاعتلال المشترك (Comorbidity). هنا تتسع مصفوفة الارتباك لتتحول من شكلها الثنائي البسيط إلى مصفوفة متعددة الفئات (Multiclass Confusion Matrix)، حيث تمثل الصفوف الفئات التشخيصية الحقيقية المتعددة (مثل: اضطراب ثنائي القطب، الاكتئاب أحادي القطب، الفصام، اضطراب الفصام الوجداني)، بينما تمثل الأعمدة الفئات التي توقعها النموذج أو المقابلة التشخيصية المقننة.
يفتح هذا التوسع آفاقاً تحليلية واسعة لتتبع “مسارات الالتباس الإكلينيكي” بدقة متناهية؛ إذ تسمح المصفوفة متعددة الفئات بتحديد الفئات التي تخلط بينها الأداة السيكومترية تحديداً. فعلى سبيل المثال، قد تكشف المصفوفة أن النموذج لا يخلط أبداً بين مريض الفصام والشخص السليم، لكنه يقع في خطأ متكرر وممنهج بالخلط بين نوبة الهوس في الاضطراب ثنائي القطب والنوبة الذهانية الحادة، مما يعكس تداخلاً مفاهيمياً وعرضياً حقيقياً في علم الأمراض النفسية (Psychopathology) يستدعي تحسين أدوات التفريق الفارقي وتطوير المحكات التمييزية.
يُوضح الجدول المفاهيمي التالي الهيكل الرياضي النمطي لمصفوفة الارتباك الثنائية وتوزيع مخرجاتها الأساسية وفق منطق كشف الإشارة السيكومتري:
- الواقع التشخيصي الإيجابي + النتيجة التنبؤية الإيجابية: إيجابي حقيقي (نجاح تشخيصي مباشر، رصد الحالة المصابة بدقة).
- الواقع التشخيصي السلبي + النتيجة التنبؤية الإيجابية: إيجابي كاذب (خطأ النمط الأول، تشخيص خاطئ لشخص سليم، وصمة علاجية).
- الواقع التشخيصي الإيجابي + النتيجة التنبؤية السلبية: سلبي كاذب (خطأ النمط الثاني، تفويت الحالة المرضية، خطر سريري داهم).
- الواقع التشخيصي السلبي + النتيجة التنبؤية السلبية: سلبي حقيقي (نجاح إقصائي مباشر، تأكيد السلامة النفسية للشخص غير المصاب).
عند التعامل مع المصفوفات متعددة الفئات، يُحسب الأداء الكلي عبر تقنيات التجميع مثل المتوسط الكلي الدقيق (Micro-averaging) أو المتوسط الكلي الموسع (Macro-averaging). يمنح المتوسط الموسع وزناً متساوياً لكل اضطراب نفسي بغض النظر عن معدل تكراره في العينة، مما يضمن تقييم أداء النموذج التشخيصي على الاضطرابات النادرة كاضطراب الهوية الانفصالية بنفس الدقة الممنوحة للاضطرابات الشائعة كالقلق، مانعاً تهميش الفئات الإكلينيكية الهشة أو نادرة الحدوث في البيانات السيكومترية.
التطبيقات الحديثة في الطب النفسي الحسابي وعلم الأعصاب الإدراكي
يشهد العصر الراهن اندماجاً واسعاً بين القياس النفسي التقليدي وعلم الأعصاب الإدراكي من جهة، والذكاء الاصطناعي من جهة أخرى، وقد غدت مصفوفة الارتباك المعيار الموحد لتحكيم جودة الدراسات في هذا الميدان الطليعي. في دراسات تخطيط أمواج الدماغ (EEG) والتصوير بالرنين المغناطيسي الوظيفي (fMRI)، تُدرب الخوارزميات على تصنيف أنماط النشاط العصبي لتمييز مرضى التوحد أو ألزهايمر المبكر عن المجموعات الضابطة، وتكون مصفوفة الارتباك هي الحكم الفصل في إثبات ما إذا كانت الأنماط العصبية المكتشفة تمتلك بالفعل دلالة تشخيصية تمييزية قابلة للتعميم السريري.
كذلك في علم النفس السيبراني وتحليل البيانات السلوكية الضخمة، يُستخدم تحليل مصفوفة الارتباك لتقييم خوارزميات رصد الحالة المزاجية من خلال استخدام الهواتف الذكية أو نشاط منصات التواصل الاجتماعي. تتيح هذه المصفوفات فهم قدرة النماذج التنبؤية على التقاط التدهور النفسي والانحدار نحو نوبات الاكتئاب قبل حدوثها الفعلي؛ مما يسهم في تطوير ما يُعرف بالتدخلات النفسية الرقمية التكيفية في الوقت الحقيقي (Just-in-Time Adaptive Interventions)، وهي نقلة نوعية تنقل الصحة النفسية من نمط رد الفعل العلاجي إلى نمط الوقاية الاستباقية المبكرة.
علاوة على ذلك، أصبحت مصفوفة الارتباك أداة مركزية في أبحاث الصيدلة الجينية والطب النفسي الشخصي (Personalized Psychiatry). عند محاولة التنبؤ بمدى استجابة مريض الاكتئاب لمثبطات استرداد السيروتونين الانتقائية (SSRIs) بناءً على ملفه الجيني والمعرفي، تكشف المصفوفة بدقة نسبة المرضى الذين سيستجيبون فعلياً للعلاج مقارنة بمن سيتعرضون لآثار جانبية دون فائدة تذكر، مما يجنب المرضى تجارب العلاج والخطأ الطويلة والمحبطة التي تؤثر سلباً على جودة حياتهم النفسية والوظيفية.
خاتمة
تمثل مصفوفة الارتباك صرحاً منهجياً ورياضياً لا غنى عنه في بنية القياس النفسي المعاصر، والتشخيص السريري، والطب النفسي الحسابي. إن قوتها لا تنبع فقط من تفكيكها الصارم لأبعاد الدقة الإحصائية، بل من تجسيدها للواقع السريري المعقد الذي لا يحتمل التبسيط السطحي. من خلال وضع الأخطاء التشخيصية بأنماطها المختلفة وجهاً لوجه أمام الباحث والمعالج، تحث مصفوفة الارتباك الممارسين على التفكير النقدي المتزن في الآثار الأخلاقية والإنسانية لكل قرار تقييمي، مؤكدة أن ضبط أدوات القياس النفسي ليس ترفاً حسابياً، بل هو التزام أصيل بصيانة كرامة الإنسان وصحته النفسية.
المراجع
- American Psychiatric Association. (2013). Diagnostic and statistical manual of mental disorders (5th ed.). American Psychiatric Publishing. https://doi.org/10.1176/appi.books.9780890425596
- Fawcett, T. (2006). An introduction to ROC analysis. Pattern Recognition Letters, 27(8), 861–874. https://doi.org/10.1016/j.patrec.2005.10.010
- Green, D. M., & Swets, J. A. (1966). Signal detection theory and psychophysics. John Wiley & Sons.
- Insel, T., Cuthbert, B., Garvey, M., Heinssen, R., Pine, D. S., Quinn, K., Sanislow, C., & Wang, P. (2010). Research Domain Criteria (RDoC): Toward creating a new framework for research on mental disorders. American Journal of Psychiatry, 167(7), 748–751. https://doi.org/10.1176/appi.ajp.2010.09091379
- Powers, D. M. W. (2011). Evaluation: From precision, recall and F-measure to ROC, informedness, markedness and correlation. Journal of Machine Learning Technologies, 2(1), 37–63.
- Steyerberg, E. W., Vickers, A. J., Cook, N. R., Gerds, T., Gonen, M., Obuchowski, N., Pencina, M. J., & Kattan, M. W. (2010). Assessing the performance of prediction models: A framework for traditional and novel measures. Epidemiology, 21(1), 128–138. https://doi.org/10.1097/EDE.0b013e3181c30fb2
- Swets, J. A. (1988). Measuring the accuracy of diagnostic systems. Science, 240(4857), 1285–1293. https://doi.org/10.1126/science.3287615