يُمثل معامل كابا لكوهين (Cohen’s Kappa Coefficient) أحد أبرز المؤشرات الإحصائية المعتمدة في مجال القياس النفسي والتقييم الإكلينيكي لقياس مستوى الاتساق والتوافق بين مقيّمين أو ملاحظين اثنين. تكمن القوة الجوهرية لهذا المعامل في قدرته الفريدة على استبعاد أثر التوافق الناشئ عن المصادفة العشوائية البحتة، مما يمنح الباحثين أداة دقيقة وموضوعية لتقييم مدى موثوقية أدوات التشخيص والملاحظة السلوكية. يُعد هذا المعامل حجر الزاوية في بناء المقاييس النفسية الرصينة واختبارات التشخيص النفسي والطب النفسي عبر العصور الحديثة.
السياق التاريخي والتطور الإبستمولوجي لمعامل كابا
نشأت الحاجة إلى صياغة معامل إحصائي متقدم لقياس التوافق بين الملاحظين في منتصف القرن العشرين، حيث كانت الأبحاث النفسية والطبية تعتمد اعتماداً كلياً وبدائياً على حساب ما يُعرف بنسبة الاتفاق البسيطة (Percentage Agreement). وقد أدرك علماء القياس النفسي والإحصاء الحيوي في ذلك الوقت أن هذه النسبة المئوية البسيطة تحمل في طياتها تضليلاً علمياً منهجياً جسيماً؛ نظراً لأنها تتجاهل تماماً احتمال أن يتفق اثنان من الفاحصين بمحض المصادفة العشوائية دون وجود أي أساس علمي أو موضوعي مشترك يحكم أحكامهما التقويمية المستقلة.
في عام 1960، نشر عالم الإحصاء والقياس النفسي الأمريكي البارز جاكوب كوهين (Jacob Cohen) ورقته البحثية التأسيسية بعنوان «معامل التوافق للمقاييس الاسمية» (A Coefficient of Agreement for Nominal Scales) في المجلة العلمية المرموقة Educational and Psychological Measurement. طرح كوهين في دراسته نموذجاً رياضياً دقيقاً يفصل بين التوافق الفعلي الملاحظ بين مقيّمين والتوافق الذي كان من المتوقع حدوثه حتماً بناءً على التوزيعات الهامشية للتصنيفات وفعل الصدفة الخالصة، مما أحدث ثورة نوعية في منهجيات القياس الإكلينيكي.
شهد العقد التالي تطويراً جوهرياً لهذا المفهوم الإحصائي؛ ففي عام 1968، عاد جاكوب كوهين ليقدم إضافة نوعية تمثلت في «معامل كابا الموزون» (Weighted Kappa)، ليتعامل مع متغيرات القياس الترتيبية (Ordinal Scales) التي تتجاوز المقاييس الاسمية البسيطة. سمح هذا التطور الرياضي بمراعاة درجات الاختلاف والتفاوت بين التشخيصات النفسية بدلاً من معاملة جميع الأخطاء والانحرافات على أنها متساوية في المقدار والأثر، وهو ما فتح آفاقاً تطبيقية واسعة في الاختبارات النفسية متعددة الدرجات والاستبانات التشخيصية المعتمدة في تقييم اضطرابات الشخصية والاكتئاب والقلق.
استمر النقاش المنهجي حول كابا عبر العقود اللاحقة، حيث انبرى باحثون مثل هيلينا تشيكيتي ومارتن فاينستاين في أوائل التسعينيات لتحليل ما بات يُعرف بـ «مفارقات كابا الإحصائية»، مما أسفر عن محاولات عديدة لتطوير بدائل ومكملات إحصائية لمعامل كوهين؛ بيد أن المعامل ظل النموذج الأكثر شيوعاً واعتماداً في الأدبيات السيكومترية الدولية نظراً لبساطته المفاهيمية ورسوخه النظري.
الأسس النظرية والرياضية لحساب معامل كابا
يقوم البناء الرياضي لمعامل كابا لكوهين على فكرة محورية تتلخص في قياس التباين الإضافي للتوافق المتجاوز تماماً للصدفة العشوائية، وقسمته على أقصى توافق ممكن يمكن تحقيقه نظرياً فوق مستوى الصدفة. يُعبَّر عن المعادلة الرياضية الأساسية لمعامل كابا بالصيغة الرمزية الآتية: κ = (Po – Pe) / (1 – Pe)، حيث يمثل الرمز (Po) نسبة التوافق الملاحظ بالفعل بين الفاحصين، بينما يمثل الرمز (Pe) النسبة المتوقعة للتوافق العشوائي بالصدفة البحتة، في حين يمثل الرقم (1) الحد الأقصى الرياضي للتوافق التام المطلق.
لحساب نسبة التوافق الملاحظ (Po)، يقوم الباحث برصد تكرارات الحالات التي تطابقت فيها أحكام المقيّمين مقسومة على إجمالي عدد الحالات أو الأفراد المفحوصين؛ ففي مصفوفة تصنيف ثنائية تحتوي على التشخيص الإيجابي والسلبي لمرض نفسي ما، تتشكل هذه النسبة من جمع التكرارات الموجودة في القطر الرئيسي للمصفوفة التي اتفق فيها كلا الفاحصين على وجود المرض أو غيابه، ومن ثم قسمتها على حجم العينة الكلية المدروسة، مما يعطي القيمة التجريبية المباشرة للاتفاق الفعلي دون تعديل.
أما حساب التوافق المتوقع بالصدفة (Pe)، فيتطلب استخدام الاحتمالات الهامشية المستقلة لكلا المقيّمين؛ حيث يُفترض وفق النظرية الاحتمالية الكلاسيكية أن المقيّمين يمارسان عملية التقييم باستقلالية إحصائية تامة دون أي تنسيق مسبق. ويتم الحصول على هذا التوقع بضرب الاحتمال الهامشي لاختيار فئة معينة من قِبل المقيّم الأول في الاحتمال الهامشي لاختيار الفئة نفسها من قِبل المقيّم الثاني، ثم تكرار هذه العملية الحسابية لكل فئة تشخيصية في المقياس وجمع كافة هذه النواتج، وهو ما يعكس الاتفاق الحتمي الذي يقع نتيجة النزوع الإحصائي الفردي لكل مقيّم في استخدام الفئات المتاحة.
وعندما تتطابق قيمة التوافق الملاحظ تماماً مع قيمة التوافق المتوقع بالصدفة، تصبح قيمة البسط صفراً، وتؤول قيمة معامل كابا إلى الصفر المطلق (κ = 0)، مما يشير إلى أن التوافق لا يتجاوز ما يمكن أن تنتجه رمية نرد عشوائية. بينما إذا كان التوافق بين المقيّمين تاماً في كل فحص، تصبح قيمة التوافق الملاحظ مساوية للواحد الصحيح (Po = 1)، وتصل قيمة كابا إلى واحد صحيح موجب (κ = 1.0)، وهو الحد الأقصى للموثوقية الإحصائية المنهجية.
التمييز بين كابا البسيط وكابا الموزون
يقتصر معامل كابا البسيط أو غير الموزون (Unweighted Kappa) على تصنيف الحالات ضمن متغيرات اسمية نوعية مطلقة تفتقر بطبيعتها إلى الترتيب الهرمي المتدرج؛ مثل تشخيص المريض إما باضطراب الاكتئاب الجسيم، أو الفصام، أو الاضطراب ثنائي القطب. في هذا النموذج البدائي، يُعامل الخطأ التشخيصي بالوزن ذاته؛ فإذا شخّص المقيّم الأول مريضاً بالاكتئاب بينما شخّصه الثاني بالفصام، يُعتبر هذا التباين مساوياً تماماً من حيث الأثر الحسابي لتباين يقع بين تشخيص الفصام والاضطراب الوجداني، حيث لا توجد مسافة دلالية متفاضلة بين تلك الفئات المستقلة إحصائياً.
على النقيض من ذلك، فإن معامل كابا الموزون (Weighted Kappa) صُمم خصيصاً للتعامل مع المقاييس الترتيبية ومستويات الشدة الإكلينيكية، مثل مقياس ليكرت أو تقييم شدة الأعراض (منعدمة، طفيفة، متوسطة، شديدة). في مثل هذه السيناريوهات الواقعية، فإن اختلاف المقيّمين بين تشخيص «عرض طفيف» و«عرض متوسط» لا يمكن منطقياً أن يُعامل بالوزن العقابي ذاته لاختلاف حاد بين «انعدام العرض» و«عرض شديد جداً»؛ حيث يعكس السيناريو الأول تقارباً إكلينيكياً نسبياً يستحق احتساب درجة جزئية من التوافق.
يتحقق هذا التمييز الرياضي الدقيق عبر إدخال مصفوفة أوزان مخصصة (Weighting Matrix)، والتي تأخذ عادةً أحد شكلين رئيسيين:
- الأوزان الخطية (Linear Weights): تفترض هذه الأوزان أن مقدار العقوبة الإحصائية يزداد طردياً وبشكل متساوٍ مع كل خطوة ابتعاد بين فئات التصنيف الممنوحة من المقيّمين، مما يجعل معامل كابا في هذه الحالة مكافئاً رياضياً لبعض مقاييس التباين الخطي.
- الأوزان التربيعية (Quadratic Weights): تفرض هذه الصياغة عقوبات متزايدة بصورة أُسّية على التناقضات الكبرى بين الفاحصين، بحيث تتضاعف الخسارة الحسابية الناتجة عن الخلافات الجذرية. والجدير بالذكر من الناحية السيكومترية أن كابا الموزون تربيعياً يتطابق رياضياً تماماً مع معامل الارتباط داخل الفئة (Intraclass Correlation Coefficient – ICC) في ظل شروط تحليل التباين المتكافئة.
يتطلب اختيار الأوزان المناسبة وعياً عميقاً من الباحث السيكومتري بطبيعة الظاهرة النفسية؛ فالأوزان ليست مجرد خيار إحصائي عشوائي، بل هي افتراض إبستمولوجي صريح حول التكلفة الإكلينيكية للخلاف التشخيصي ودرجة خطورته في توجيه الخطة العلاجية للمريض.
أهمية معامل كابا في القياس النفسي والتشخيص الإكلينيكي
يتبوأ معامل كابا مكانة مركزية راسخة في مجالات علم النفس السريري والطب النفسي، حيث يشكل المحك التجريبي الأهم لتقييم الموثوقية بين الفاحصين (Inter-Rater Reliability). تتسم الاضطرابات السلوكية والوجدانية بطبيعتها الذاتية وتداخل المظاهر العرضية، مما يجعل عملية الفحص عُرضة للانحياز الشخصي لكل فاحص بناءً على خلفيته النظرية وتجربته السريرية وتفسيره الفردي لسلوك المفحوص، الأمر الذي يستوجب وجود معيار قياسي موحد يضمن دقة التقييم عبر مختلف المعالجين.
تجلى الدور الحاسم لمعامل كابا في التاريخ الحديث للطب النفسي إبان إعداد الإصدارات المتعاقبة من الدليل التشخيصي والإحصائي للاضطرابات النفسية (DSM) الصادر عن الجمعية الأمريكية للطب النفسي. فخلال الانتقال التاريخي من الإصدار الثاني (DSM-II) إلى الإصدار الثالث (DSM-III) في أواخر السبعينيات، كشفت الدراسات الميدانية المعتمدة على معامل كابا عن تدنٍ مأساوي في مستويات التوافق بين الأطباء النفسيين في تشخيص اضطرابات مثل الفصام والعصاب، مما دفع المجتمع السيكومتري إلى صياغة معايير تشخيصية معيارية واضحة ومحددة لرفع قيم كابا وتعزيز الاتساق الموضوعي للطب النفسي ككل.
يمتد تطبيق كابا في بحوث القياس النفسي ليشمل التحقق من موثوقية أدوات جمع البيانات الميدانية، كالملاحظة المباشرة لسلوك الأطفال داخل البيئات الصفية أو التفاعلات الأسرية، ومقابلات التوظيف النفسية شبه المقننة، فضلاً عن تصحيح الاختبارات الإسقاطية مثل اختبار رورشاخ لبقع الحبر واختبار تفهم الموضوع. في هذه الأدوات النوعية المعقدة، يوفر معامل كابا برهاناً سيكومترياً لا غنى عنه يثبت أن النتائج المستخلصة تعكس سمات المفحوصين الحقيقية ولا تعبر عن تقلبات وميول الفاحصين القائمين على تصحيح تلك الاستجابات.
وعلاوة على ذلك، يُعد معامل كابا ركيزة أساسية في التحقق من المعايرة المتبادلة بين نظم الذكاء الاصطناعي الحديثة والخبراء البشريين؛ فمع دخول خوارزميات التعلم الآلي في تصنيف النصوص النفسية ورصد مؤشرات الاكتئاب والانتحار عبر منصات التواصل الاجتماعي، يُستعان بكابا كوهين لمطابقة دقة قرارات النماذج الخوارزمية مع القرارات السريرية التوافقية للأطباء النفسيين المعتمدين لضمان كفاءة وسلامة الأنظمة الرقمية المستحدثة.
معايير تفسير قيم معامل كابا والنقاشات الإحصائية حولها
تتراوح القيم النظرية الممكنة لمعامل كابا بين (-1.0) و(+1.0)؛ وتشير القيمة (+1.0) إلى التوافق التام المطلق والانسجام الشامل بين تصنيفات المقيّمين، بينما تعني القيمة (0.0) أن التوافق لا يزيد قيد أنملة عن ما تتنبأ به الصدفة العشوائية البحتة. أما القيم السالبة النادرة (أقل من الصفر وتصل نظرياً إلى -1.0)، فتعبر عن وجود خلاف منهجي منتظم بين المقيّمين يتجاوز حتى مستويات الصدفة، وهو ما يُعد مؤشراً خطيراً في أبحاث القياس النفسي يوحي بأن أحد الفاحصين يتبع معايير تشخيصية مقلوبة تماماً أو متناقضة جذرياً مع المعايير المعتمدة من الفاحص الآخر.
لتسهيل قراءة وتفسير هذه القيم من قِبل الباحثين والممارسين، وضع العالمان لانديس وكوخ (Landis & Koch, 1977) سلماً معيارياً شهيراً يُعد الأكثر تداولاً في الأوساط الأكاديمية رغم طابعه الإرشادي، ويصنف درجات التوافق وفق الآتي:
- أقل من 0.00: توافق ضعيف للغاية أو خلاف منهجي سلبي (Poor agreement).
- 0.00 إلى 0.20: توافق طفيف جداً أو هامشي (Slight agreement).
- 0.21 إلى 0.40: توافق منصف أو مقبول بحدود دنيا (Fair agreement).
- 0.41 إلى 0.60: توافق متوسط إلى معتدل (Moderate agreement).
- 0.61 إلى 0.80: توافق جوهري وكبير (Substantial agreement).
- 0.81 إلى 1.00: توافق شبه تام أو ممتاز (Almost perfect agreement).
ورغم الانتشار الواسع لتقسيمات لانديس وكوخ، فقد حذّر علماء القياس النفسي الأكثر صرامة، مثل فليس (Fleiss, 1981) وماكهيو (McHugh, 2012)، من الاعتماد الأعمى وغير النقدي على هذه التصنيفات التقريبية في السياقات السريرية الحرجة. يرى ماكهيو أنه في مجالات الرعاية الصحية النفسية والطبية، حيث يترتب على التشخيص الخاطئ إعطاء أدوية نفسية خطيرة أو احتجاز المريض قسرياً، فإن أي قيمة لكابا تقل عن 0.60 يجب أن تُعد غير مقبولة سيكومترياً، بل ينبغي استهداف قيم تفوق 0.80 لاعتبار أداة التشخيص صالحة وموثوقة للاستخدام الإكلينيكي العملي.
يجب على الباحث دوماً تقديم فترات الثقة (Confidence Intervals) لمعامل كابا عند مستوى دلالة 95%، إلى جانب القيمة الاحتمالية لاختبار الفرضية الصفرية (p-value)، ذلك لأن قيمة كابا وحدها قد تكون مضللة إذا ما حُسبت على عينات إكلينيكية صغيرة الحجم تخضع لأخطاء التقدير العشوائي المتطرفة.
مفارقات كابا وانتقاداته المنهجية (Kappa Paradoxes)
على الرغم من الشهرة الواسعة لمعامل كوهين، إلا أنه واجه انتقادات منهجية وإحصائية بالغة العمق تركزت في ظاهرتين إحصائيتين شهيرتين وثقهما كل من فاينستاين وتشيكيتي (Feinstein & Cicchetti, 1990) وعُرفتا في الأدبيات السيكومترية باسم «مفارقات كابا» (Kappa Paradoxes). تكشف هاتان المفارقتان عن سيناريوهات حسابية تبدو فيها نتائج المعامل غير منسجمة مع المنطق الظاهري للبيانات.
تتمثل المفارقة الأولى، والمعروفة باسم «مفارقة معدل الانتشار» (Prevalence Paradox)، في الانخفاض الحاد لقيمة كابا بالرغم من الارتفاع الشديد في نسبة التوافق الملاحظ الحقيقي بين الفاحصين. تحدث هذه المفارقة عندما يكون معدل انتشار الظاهرة النفسية في العينة منخفضاً للغاية أو مرتفعاً للغاية (عينة غير متوازنة هامشياً)، كأن يُطلب من طبيبين نفسيين تشخيص مرض نادر جداً يصيب شخصاً واحداً من كل مئة؛ فإذا اتفق الطبيبان على غياب المرض في 98 حالة من أصل 100، فإن نسبة التوافق الملاحظ تكون 98%، ومع ذلك قد تنخفض قيمة كابا لتصل إلى 0.20 أو أقل، وذلك لأن نسبة التوافق المتوقع بالصدفة (Pe) تكون مرتفعة بصورة هائلة نتيجة عدم التوازن الهامشي للتصنيفات، مما يقود إلى خصم حسابي مبالغ فيه للتوافق الفعلي.
أما المفارقة الثانية، وتُعرف باسم «مفارقة الانحياز» (Bias Paradox)، فتظهر عندما يؤدي عدم التماثل في عدم الاتفاق بين المقيّمين إلى تضخيم قيمة كابا بدلاً من خفضها. فإذا كان أحد الفاحصين يتسم بتشدد تشخيصي مفرط ويميل إلى وسم الحالات بالمرض، بينما الفاحص الآخر متساهل ويميل للعكس، فإن هذا التباين الهامشي يُخفض قيمة التوافق المتوقع بالصدفة مما ينتج عنه مفارقة تتمثل في الحصول على قيمة كابا أعلى مقارنة ببيانات لا تحتوي على انحياز تشخيصي، وهو ما ينافي البديهة العلمية التي تقتضي انخفاض المعامل عند وجود تحيز أحادي الجانب.
دفعت هذه المفارقات الباحثين إلى التوصية بعدم الاكتفاء بتقرير قيمة كابا بمعزل عن مؤشرات أخرى، بل يتعين دوماً عرض نسبة التوافق الملاحظ (Po)، والتوزيعات الهامشية لكلا المقيّمين، ومعدل انتشار السمة في العينة، مما يوفر رؤية شمولية تمنع الوقوع في فخ التقديرات الإحصائية المضللة التي تنشأ عن اختلالات التوزيع الهامشي.
مقارنة تحليلية: كابا والمقاييس الإحصائية البديلة
في ضوء المآزق المفاهيمية والمفارقات الحسابية المرتبطة بمعامل كابا لكوهين، قام علماء الإحصاء السيكومتري بتطوير واقتراح عدة مقاييس بديلة، يتميز كل منها بخصائص منهجية فريدة تجعله مفضلاً في سياقات بحثية معينة:
- معامل كابا لفليس (Fleiss’ Kappa): يُعد الامتداد الرياضي المباشر لمعامل كوهين للتعامل مع أكثر من مقيّمين اثنين (ثلاثة فاحصين فما فوق). بينما يقتصر كابا كوهين تماماً على اثنين فقط من الملاحظين، يستوعب فليس أعداداً متعددة، غير أنه يفترض أن الملاحظين تم اختيارهم عشوائياً من مجتمع ملاحظين أكبر، ويشترك مع كوهين في التأثر بمفارقات معدل الانتشار.
- ألفا كريبندورف (Krippendorff’s Alpha): يُعتبر من أكثر المعاملات الإحصائية مرونة وتطوراً؛ إذ يستطيع معالجة مختلف مستويات القياس (الاسمي، الترتيبي، الفتري، والنسبي)، ويتحمل وجود قيم مفقودة في مصفوفات البيانات، ويعمل بكفاءة فائقة بصرف النظر عن عدد المقيّمين أو تفاوتهم بين الحالات، مما يجعله بديلاً مفضلاً في تحليل المحتوى النفسي وتحليل الخطاب السلوكي المعقد.
- معامل جويت الأول (Gwet’s AC1): طُوّر هذا المعامل الحديث خصيصاً للتغلب على مفارقة معدل الانتشار المربكة في كابا كوهين. يقدم جويت طريقة بديلة لحساب التوافق المتوقع بالصدفة تحمي المعامل من الانهيار الحسابي عند فحص الظواهر النفسية نادرة الحدوث أو شائعة الحدوث بصورة مفرطة، مما جعله يحظى باعتراف متزايد كبديل أكثر استقراراً في القياس السريري.
- معامل الارتباط داخل الفئة (ICC): يُخصص للمتغيرات الكمية المستمرة (Continuous Variables) مثل الدرجات الخام على مقاييس الذكاء أو درجات الاكتئاب المستمرة، حيث يُقسّم التباين الإجمالي إلى تباين راجع للأفراد وتباين راجع للمقيّمين والخطأ العشوائي، متجاوزاً بذلك طبيعة كابا المصممة أساساً للبيانات الاسمية والترتيبية المقيدة.
يوضح هذا التعدد في الأدوات الإحصائية أن الباحث في القياس النفسي يجب أن يمتلك بصيرة نقدية تمكنه من مواءمة الأداة الإحصائية المختارة مع طبيعة البيانات ومستوى القياس وأهداف التحقق السيكومتري، متجنباً تطبيق معامل كوهين بشكل آلي دون فحص ملائمته للفرضيات الميدانية.
إرشادات وتوصيات منهجية للمشتغلين بالقياس النفسي
لتحقيق أقصى درجات الدقة والمصداقية عند استخدام معامل كابا لكوهين في البحوث النفسية والتطبيقات الإكلينيكية، ينبغي على الباحثين اتباع حزمة من التوصيات الإجرائية المنهجية الصارمة. تبدأ هذه الخطوات بالتدريب المسبق والمكثف للمقيّمين على أدلة الملاحظة والمقابلة التشخيصية؛ فالهدف من القياس ليس رصد الخلافات السطحية بل الوصول إلى فهم موحد للأطر الإجرائية والمفاهيمية المتضمنة في المقياس السلوكي.
يتعين ثانياً ضمان الاستقلالية التشخيصية التامة والمطلقة؛ بحيث يُمنع تماماً أي تواصل أو تشاور أو تلميح لفظي أو غير لفظي بين الفاحصين أثناء تقييم الحالات الإكلينيكية، إذ إن أي خرق لهذه الاستقلالية ينسف الفرضية الرياضية المركزية التي يستند إليها حساب التوافق بالصدفة، ويجعل نتائج كابا غير صالحة علمياً ومبالغاً في دقتها الظاهرية.
يجب ثالثاً التحقق من حجم العينة الإحصائية؛ إذ إن تقييم الاتساق بين الملاحظين على عينات صغيرة (كأن تكون أقل من 30 فرداً) يؤدي إلى اتساع فترات الثقة لمعامل كابا بصورة تجعل النتيجة بلا جدوى إحصائية. يُنصح بإجراء تحليل القدرة الإحصائية المسبق لتحديد حجم العينة الكافي لاكتشاف التوافق الحقيقي بمستوى ثقة مرتفع.
وأخيراً، ينبغي على الباحث أن يتبنى مبدأ الإفصاح المنهجي الكامل في تقاريره وبحوثه؛ وذلك بنشر جداول التوافق المزدوجة (Cross-tabulation Tables) كاملة، وذكر نوع كابا المستخدم (بسيط، موزون خطياً، موزون تربيعياً)، وتقديم مؤشرات التوافق البسيط جنباً إلى جنب مع كابا وبدائله مثل Gwet’s AC1، لتزويد القارئ برؤية متوازنة تحميه من استنتاجات خاطئة ناجمة عن انحرافات معدل الانتشار.
خاتمة
يمثل معامل كابا لكوهين علامة فارقة في تاريخ تطور القياس النفسي والإحصاء السريري، حيث استطاع على مدى أكثر من ستة عقود أن يكرس معياراً موضوعياً لفصل التوافق التشخيصي الحقيقي عن الصدفة العشوائية. ورغم الجدل المنهجي المستمر حول مفارقاته الرياضية وحساسيته لاختلالات معدلات الانتشار، يظل المعامل الأداة المعيارية الذهبية التي تحمي الممارسة النفسية من الذاتية والتحيز. إن الفهم العميق لأسس هذا المعامل ونقاط قوته وحدوده المنهجية هو ما يمكّن الباحثين السريريين من تطبيقه باحترافية تسهم في الارتقاء بموثوقية أدوات التشخيص وجودة الرعاية النفسية المقدمة للأفراد.
المراجع
- Cohen, J. (1960). A coefficient of agreement for nominal scales. Educational and Psychological Measurement, 20(1), 37–46. https://doi.org/10.1177/001316446002000104
- Cohen, J. (1968). Weighted kappa: Nominal scale agreement provision for scaled disagreement or partial credit. Psychological Bulletin, 70(4), 213–220. https://doi.org/10.1037/h0026256
- Feinstein, A. R., & Cicchetti, D. V. (1990). High agreement but low kappa: I. The problems of two paradoxes. Journal of Clinical Epidemiology, 43(6), 543–549. https://doi.org/10.1016/0895-4356(90)90046-K
- Fleiss, J. L. (1981). Statistical methods for rates and proportions (2nd ed.). John Wiley & Sons.
- Gwet, K. L. (2014). Handbook of inter-rater reliability: The definitive guide to measuring the extent of agreement among raters (4th ed.). Advanced Analytics, LLC.
- Krippendorff, K. (2018). Content analysis: An introduction to its methodology (4th ed.). SAGE Publications.
- Landis, J. R., & Koch, G. G. (1977). The measurement of observer agreement for categorical data. Biometrics, 33(1), 159–174. https://doi.org/10.2307/2529310
- McHugh, M. L. (2012). Interrater reliability: The kappa statistic. Biochemia Medica, 22(3), 276–282. https://doi.org/10.11613/BM.2012.031