يمثل التعامل مع المعطيات الناقصة أحد أكثر التحديات المنهجية تعقيداً وإلحاحاً في ميدان العلوم السلوكية والبحث النفسي المعاصر، حيث يندر أن تكتمل استجابات جميع المشاركين في الدراسات الطولية أو المسوح الميدانية واسعة النطاق. يُعد تحليل الحالات الكاملة (Complete-Case Analysis)، والذي يُعرف تقليدياً في الأدبيات الإحصائية باسم «الحذف حسب القائمة» (Listwise Deletion)، الأسلوب الافتراضي الأكثر شيوعاً الذي تلجأ إليه البرمجيات الإحصائية لمعالجة هذه المعضلة عبر استبعاد أي مشارك يحمل قيمة مفقودة واحدة على الأقل في أي من المتغيرات المدرجة في النموذج التحليلي. يهدف هذا المقال الموسوعي إلى تفكيك الأسس النظرية والرياضية لتحليل الحالات الكاملة، وتقييم تداعياته السيكومترية على الصدق والتعميم، وتقديم بدائل متقدمة تضمن نزاهة الاستنتاج العلمي في البحوث النفسية.
مفهوم تحليل الحالات الكاملة في البحث النفسي
يُعرَّف تحليل الحالات الكاملة بأنه إجراء منهجي وإحصائي يقوم على تقييد التحليلات الاستدلالية فقط بتلك المشاهدات أو الحالات التي تحتوي على بيانات مرصودة بالكامل لجميع المتغيرات المستهدفة في التحليل. في سياق القياس النفسي، يعني هذا أنه إذا طُلب من مريض استكمال مقياس للاكتئاب، واستبيان للقلق، ومؤشر للدعم الاجتماعي، وأغفل المريض الإجابة عن فقرة واحدة فقط ضمن استبيان القلق، فإن خوارزمية الحالات الكاملة ستقوم بإلغاء سجل هذا المريض بالكامل من نموذج الانحدار الخطي أو التحليل العاملي، بصرف النظر عن اكتمال استجاباته في سائر المتغيرات الأخرى.
ينطلق هذا الأسلوب من افتراض ضمني بالبساطة المنهجية، حيث يُنظر إليه بوصفه وسيلة سريعة لتفادي التعقيدات الرياضية المرتبطة بتقدير القيم الناقصة أو نمذجة مسارات الفقدان. وعلى الرغم من أن هذا الإجراء ينتج مصفوفة بيانات متناسقة ومتعامدة الأبعاد يمكن تطبيق الاختبارات الإحصائية البارامترية القياسية عليها مباشرة، إلا أنه يتعامل مع البيانات المتبقية كما لو كانت ممثلة تمثيلاً أميناً للمجتمع الأصلي، وهو افتراض محفوف بالمخاطر المنهجية في دراسات علم النفس الإكلينيكي وعلم النفس العصبي والاجتماعي.
تاريخياً، ارتبط الاعتماد الكثيف على هذا التحليل بالقيود الحوسبية التي هيمنت على النصف الثاني من القرن العشرين، حيث كانت الحزم الإحصائية الرائدة مثل SPSS تعتمد استراتيجية الحذف الافتراضي للحالات لتوفير الذاكرة وسرعة المعالجة. ومع ذلك، فإن النظرة المعاصرة للقياس النفسي تعتبر اللجوء غير النقدي لتحليل الحالات الكاملة ممارسة قد تنطوي على إهمال منهجي، نظراً لما يترتب عليها من هدر فادح في حجم العينة وانحياز منهجي يهدد نزاهة النتائج العلمية.
الأسس النظرية وآليات فقدان البيانات وفق تصنيف روبين
لفهم المشروعية الإحصائية لتحليل الحالات الكاملة، يجب الرجوع إلى الإطار النظري التأسيسي الذي صاغه الإحصائي دونالد روبين في سبعينيات القرن العشرين، والذي قسّم آليات فقدان البيانات إلى ثلاثة أنماط رئيسية تحكم كل منها شروط انحياز أو اتساق التقديرات الإحصائية. لا يمكن الفصل بين تقييم أداء تحليل الحالات الكاملة وطبيعة الآلية التي أدت إلى غياب الاستجابة النفسية في المقام الأول.
النمط الأول هو الفقدان العشوائي تماماً (Missing Completely at Random – MCAR)، وفيه يكون احتمال فقدان البيانات لمتغير معين مستقلاً تماماً عن المتغير نفسه وعن أي متغيرات أخرى مرصودة أو غير مرصودة في الدراسة. في ظل هذا الافتراض النادر، تكون الحالات الكاملة عبارة عن عينة عشوائية فرعية من العينة الكلية الأصلية. وهنا فقط، تكون تقديرات المعالم الإحصائية الناتجة عن تحليل الحالات الكاملة، مثل المتوسطات الحسابية ومعاملات الانحدار، غير منحازة إحصائياً، وإن كانت تعاني من ضعف القوة الاختبارية نتيجة تضاؤل حجم العينة.
النمط الثاني هو الفقدان العشوائي المشروط (Missing at Random – MAR)، وفيه يعتمد احتمال غياب البيانات على متغيرات أخرى جرى رصدها وقياسها في الدراسة، ولكنه لا يعتمد على القيمة المفقودة ذاتها. على سبيل المثال، إذا كان الذكور في عينة دراسة نفسية أقل ميلاً للإفصاح عن مستويات الضغط النفسي مقارنة بالإناث، ولكن داخل فئة الذكور لا يرتبط الغياب بمستوى الضغط الفعلي، فإن الآلية تكون عشوائية مشروطة. في هذا السياق، يؤدي تطبيق تحليل الحالات الكاملة إلى انحياز ممنهج في التقديرات، حيث تُستبعد فئات ديموغرافية أو إكلينيكية بنسب متفاوتة، مما يشوه العلاقات الارتباطية بين المتغيرات.
النمط الثالث والأكثر خطورة هو الفقدان غير العشوائي (Missing Not at Random – MNAR)، وفيه يرتبط احتمال الفقدان بالقيمة المجهولة للمتغير المفقود نفسه. يتجلى هذا النمط بوضوح في الأبحاث السلوكية؛ كأن يمتنع المشارك المصاب بالاكتئاب الحاد عن ملء استمارة الاكتئاب تحديداً بسبب ثقل الأعراض السريرية وفقدان الدافعية، أو كأن يرفض الأفراد ذوو الدخل المرتفع جداً أو المنخفض جداً الإفصاح عن دخلهم. يؤدي تحليل الحالات الكاملة في ظروف الفقدان غير العشوائي إلى تشويه كارثي في البنية التوزيعية للبيانات، مما يجعل النتائج مضللة وفاقدة للقيمة الإكلينيكية والمنهجية.
المزايا الإجرائية لتحليل الحالات الكاملة
على الرغم من الانتقادات المنهجية اللاذعة التي توجّه إلى هذا النهج، إلا أن استمرارية استخدامه في بعض الدوائر البحثية تستند إلى جملة من المزايا الإجرائية والحسابية التي تجعل منه خياراً مقبولاً في سياقات ضيقة ومحددة للغاية. تأتي في مقدمة هذه المزايا سهولة التطبيق الحسابي، إذ لا يتطلب التحليل أي خوارزميات معقدة للتعويض التنبئي أو المحاكاة الرياضية متعددة المراحل.
تتمثل الميزة الثانية في الاتساق الحسابي الداخلي لجميع التحليلات الفرعية؛ فعند الاعتماد على الحالات الكاملة فقط، يُحسب نموذج الانحدار ومصفوفة التغاير والتحليلات الوصفية على نفس المجموعة المحددة بدقة من المفحوصين، مما يضمن أن حجم العينة ($N$) يظل ثابتاً عبر جميع الجداول الإحصائية الملحقة بالتقرير العلمي. هذا التناسق يزيل التناقضات الحسابية التي قد تظهر أحياناً في تقنيات بديلة مثل «الحذف الثنائي» (Pairwise Deletion)، حيث تتغير أحجام العينات بين أزواج المتغيرات المختلفة مما قد يفرز مصفوفات ارتباط غير موجبة التحديد (Non-positive definite correlation matrices).
علاوة على ذلك، أثبتت الدراسات المنهجية الرياضية أنه في بعض نماذج الانحدار اللوجستي والانحدار الخطي، إذا كان فقدان البيانات مقصوراً تماماً على المتغير التابع وكان نمط الفقدان مستقلاً عن المتغيرات المستقلة، فإن تحليل الحالات الكاملة ينتج معاملات انحدار غير منحازة للمتغيرات التنبؤية، بل وقد يتفوق في بعض الحالات الخاصة على أساليب التعويض السيئة التحديد، مما يمنحه ميزة ظرفية يدركها المتخصصون في القياس المتقدم.
التحديات والعيوب الإحصائية والمنهجية
تتجاوز العيوب الملازمة لتحليل الحالات الكاملة مجرد الخسارة في الأرقام لتصل إلى صلب الصدق الداخلي والخارجي للبحوث السلوكية. يُعد التراجع الحاد في القوة الإحصائية (Statistical Power) الأثر المباشر الأكثر وضوحاً؛ إذ إن استبعاد عشرات أو مئات المفحوصين يؤدي تلقائياً إلى تضخم الخطأ المعياري لتقديرات المعالم، مما يرفع احتمالية ارتكاب الخطأ من النوع الثاني (Type II Error)، أي الفشل في رصد الفروق النفسية الحقيقية أو التأثيرات العلاجية القائمة بالفعل بين المجموعات التجريبية والضابطة.
الخطر الأكبر يكمن في تحيز الاختيار المنهجي (Selection Bias)، حيث نادراً ما تتحقق فرضية الفقدان العشوائي تماماً (MCAR) في الواقع الميداني لعلم النفس. عندما يقتصر الباحث تحليله على الأفراد الذين أكملوا كل مقياس وكل سؤال، فإنه ينتهي حتماً بدراسة عينة فائقة الالتزام، أو أكثر استقراراً من الناحية المعرفية والانفعالية، أو أعلى في المستوى التعليمي والاقتصادي مقارنة بعامة مجتمع الدراسة. يؤدي هذا التحيز إلى تضييق تباين المتغيرات وانكماش تقديرات التأثير، مما يعطي صورة وهمية عن طبيعة الظاهرة النفسية قيد الاستقصاء.
تتفاقم هذه المشكلة بشكل هندسي في الدراسات المتعددة المتغيرات (Multivariate Studies)؛ فكلما ازداد عدد المتغيرات النفسية الداخلة في التحليل، ارتفعت احتمالية وجود قيمة مفقودة واحدة على الأقل لدى المفحوص. في دراسة تشتمل على 30 متغيراً ومعدل فقدان لا يتجاوز 2% في كل متغير، قد يؤدي الحذف حسب القائمة إلى شطب أكثر من 40% من إجمالي حجم العينة الأصلي، وهو نزيف بياني مدمر لأي بحث علمي تكبد تكاليف بشرية ومادية باهظة في مرحلة الجمع والقياس.
الآثار المترتبة على الأبحاث النفسية الإكلينيكية والمسحية
في حقل علم النفس الإكلينيكي والطب النفسي، تكتسي معضلة البيانات المفقودة حساسية استثنائية ترتبط مباشرة بسلامة التدخلات العلاجية والنتائج التشخيصية. تتميز التجارب الإكلينيكية العشوائية (RCTs) بمعدلات تسرب ملحوظة (Attrition)، حيث يتوقف المرضى الذين يعانون من تدهور في حالتهم الصحية أو آثار جانبية حادة للعلاج النفسي والدوائي عن حضور جلسات المتابعة واستكمال مقاييس التقييم البعدي.
إذا لجأ الباحث النفسي الإكلينيكي إلى تحليل الحالات الكاملة في مثل هذه السيناريوهات، فإنه سيقوم فعلياً بحذف المرضى الأكثر تدهوراً من التحليل النهائي، والإبقاء فقط على أولئك الذين شعروا بتحسن كافٍ مكنهم من الاستمرار في التجربة. يقود هذا الخلل المنهجي إلى تضخيم زائف لفاعلية التدخل الإرشادي أو الدوائي، مما ينتهك مبدأ «التحليل وفق نية العلاج» (Intention-to-Treat Analysis) الذي يشترط تقييم جميع المشاركين الموزعين عشوائياً لضمان تجنب الانحياز التفاؤلي غير المبرر.
أما في الدراسات المسحية واسعة النطاق ودراسات الشخصية، فإن تحليل الحالات الكاملة يؤدي إلى تشويه الخصائص السيكومترية للمقاييس. إن حذف الأفراد ذوي الاستجابات الجزئية يؤثر على مصفوفة التغاير المطلوبة لإجراء التحليل العاملي التوكيدي (CFA) ونمذجة المعادلات البنائية (SEM)، مما قد يؤدي إلى رفض خاطئ لنماذج نظرية جيدة المطابقة، أو قبول نماذج مشوهة لا تعكس الواقع البنائي للظاهرة في المجتمع العام.
البدائل المنهجية المعاصرة لتحليل الحالات الكاملة
أدى القصور المنهجي لتحليل الحالات الكاملة إلى بلورة ثورة إحصائية أنتجت استراتيجيات حديثة قادرة على استيعاب وتطويع مشكلة البيانات المفقودة بكفاءة رياضية متقدمة ودون التضحية بحجم العينة أو إدخال انحيازات مدمرة. تستند هذه البدائل الحديثة إلى افتراض أن الفقدان هو من نمط الفقدان العشوائي المشروط (MAR)، وهو افتراض أكثر واقعية وقابلية للتحقق في البيانات الإنسانية والسلوكية.
1. التعويض المتعدد (Multiple Imputation – MI)
يُعد أسلوب التعويض المتعدد المعيار الذهبي لمعالجة البيانات الناقصة في القياس النفسي. يقوم هذا الأسلوب على توليد قيم متعددة بديلة لكل قيمة مفقودة استناداً إلى نموذج تنبؤي احتمالي يعتمد على المتغيرات المرصودة، مما يخلق عدة قواعد بيانات مكتملة (عادة بين 5 إلى 20 نسخة). يُجرى التحليل الإحصائي المستهدف على كل قاعدة بيانات على حدة، ثم تُدمج النتائج والمعلمات باستخدام «قواعد روبين» للدمج الحسابي، مما يعكس بدقة عدم اليقين المتأصل في عملية التعويض دون تقليص تباين الأخطاء المعيارية.
2. تقدير الاحتمالية العظمى للمعلومات الكاملة (FIML)
يُمثل أسلوب تقدير الاحتمالية العظمى للمعلومات الكاملة (Full Information Maximum Likelihood) بديلاً متفوقاً وخاصة في إطار نمذجة المعادلات البنائية والتحليلات المسارية والطولية. على النقيض من التعويض، لا يقوم أسلوب FIML بإنشاء قيم رقمية بديلة، بل يقوم بحساب دالة الاحتمالية لكل حالة استناداً إلى المتغيرات المتاحة لها حصراً دون استبعادها. تنتج هذه المنهجية تقديرات بارامترية فعالة وغير منحازة تحت افتراض الفقدان العشوائي المشروط (MAR)، مع الاحتفاظ بكامل حجم العينة وقوتها الإحصائية دون أي فقدان منهجي.
3. مقارنة سريعة بين استراتيجيات التعامل مع البيانات المفقودة
- تحليل الحالات الكاملة: يتطلب افتراض الفقدان العشوائي تماماً (MCAR)، يؤدي إلى انخفاض كبير في حجم العينة، يسبب انحيازاً مؤكداً عند انتهاك الافتراض، ولكنه شديد السهولة في التطبيق.
- الحذف الثنائي (Pairwise): يغير حجم العينة باختلاف المتغيرات، يولد مشكلات في مصفوفات الارتباط، وغير موصى به في الأبحاث الحديثة.
- التعويض بالمتوسط الحسابي: يؤدي إلى تشويه التباين والتغاير، ويقلص الخطأ المعياري اصطناعياً، ويُعتبر ممارسة إحصائية غير مقبولة في النشر العلمي الرصين.
- التعويض المتعدد وFIML: يتطلبان افتراض الفقدان العشوائي المشروط (MAR)، يحافظان على الحجم الكامل للعينة، يقدمان تقديرات غير منحازة ويأخذان في الاعتبار عدم اليقين الإحصائي بكفاءة تامة.
معايير وتوصيات للباحثين النفسيين
بالنظر إلى التداعيات المعرفية والمنهجية سالفة الذكر، وضعت الجمعيات العلمية الكبرى، مثل جمعية علم النفس الأمريكية (APA) عبر فرقة العمل المعنية بالاستدلال الإحصائي (TFSI)، إرشادات حاسمة لإدارة وتوثيق البيانات المفقودة في التقارير البحثية، تحظر الاستخدام الأعمى لتحليل الحالات الكاملة كحل افتراضي تلقائي.
يجب على الباحث في المقام الأول فحص نمط الفقدان واختبار الفرضيات المرتبطة به بدقة. يمكن إجراء اختبارات إحصائية متخصصة، مثل اختبار ليتل لبيانات مفقودة عشوائياً تماماً (Little’s MCAR Test)، لتقييم ما إذا كانت الحالات المفقودة تختلف جوهرياً عن الحالات المكتملة. إذا أظهر الاختبار رفضاً لفرضية الفقدان العشوائي التام، يصبح استخدام تحليل الحالات الكاملة غير مبرر علمياً ويستوجب الانتقال القسري إلى تقنيات التعويض المتعدد أو FIML.
كقاعدة إجرائية عامة تتبناها الأدبيات، يمكن التسامح مع تحليل الحالات الكاملة فقط إذا كانت نسبة البيانات المفقودة ضئيلة للغاية (أقل من 5% من إجمالي الحالات الكلية) وكانت آلية الفقدان تتسق مع معايير MCAR، شريطة إجراء «تحليل الحساسية» (Sensitivity Analysis) لمقارنة النتائج المحسوبة بعدة طرق والتحقق من صمود الاستنتاجات العلمية بصرف النظر عن الاستراتيجية التحليلية المتبعة.
ينبغي توثيق كل خطوة في تقرير البحث بشفافية تامة؛ بدءاً من الإفصاح عن عدد ونسب القيم المفقودة لكل متغير على حدة، وتوضيح الآليات المحتملة للفقدان، وصولاً إلى تبرير استراتيجية المعالجة الإحصائية المختارة ونشر الأكواد البرمجية لضمان قابلية إعادة الإنتاج والتدقيق المنهجي المستقل.
خاتمة
يظل تحليل الحالات الكاملة أداة إحصائية تاريخية ذات جاذبية بصرية وتنفيذية تبدو مريحة للوهلة الأولى، إلا أن ثمن هذه البساطة باهظ للغاية على مستوى الصدق الإحصائي والمصداقية العلمية للبحوث النفسية. إن إدراك حدود هذا الإجراء وطبيعة التحيزات العميقة التي يفرزها ليس مجرد مسألة رفاهية رياضية، بل هو واجب منهجي وأخلاقي يضمن عدم إقصاء الفئات الإكلينيكية الهشة من التحليل، وعدم التوصل إلى استنتاجات سيكولوجية مغلوطة تضلل الممارسة الإرشادية والتطبيقية في الميدان النفسي.
المراجع
- Allison, P. D. (2001). Missing data (Quantitative Applications in the Social Sciences, Vol. 136). SAGE Publications. https://doi.org/10.4135/9781412985079
- Enders, C. K. (2010). Applied missing data analysis. Guilford Press.
- Graham, J. W. (2009). Missing data analysis: Making it work in the real world. Annual Review of Psychology, 60, 549–576. https://doi.org/10.1146/annurev.psych.58.110405.085530
- Little, R. J. A. (1988). A test of missing completely at random for multivariate data with missing values. Journal of the American Statistical Association, 83(404), 1198–1202. https://doi.org/10.1080/01621459.1988.10478722
- Little, R. J. A., & Rubin, D. B. (2019). Statistical analysis with missing data (3rd ed.). John Wiley & Sons. https://doi.org/10.1002/9781119482260
- Rubin, D. B. (1976). Inference and missing data. Biometrika, 63(3), 581–592. https://doi.org/10.1093/biomet/63.3.581
- Schafer, J. L., & Graham, J. W. (2002). Missing data: Our view of the state of the art. Psychological Methods, 7(2), 147–177. https://doi.org/10.1037/1082-989X.7.2.147
- van Buuren, S. (2018). Flexible imputation of missing data (2nd ed.). Chapman and Hall/CRC. https://doi.org/10.1201/9780429492259
- Wilkinson, L., & Task Force on Statistical Inference. (1999). Statistical methods in psychology journals: Guidelines and explanations. American Psychologist, 54(8), 594–604. https://doi.org/10.1037/0003-066X.54.8.594