يُمثّل تحليل الحالات المتاحة (Available-Case Analysis)، والذي يُعرف شاعاً في الأدبيات الإحصائية باسم الحذف الزوجي (Pairwise Deletion)، أحد الأساليب الكلاسيكية البارزة للتعامل مع معضلة البيانات المفقودة في الدراسات النفسية والمسوح السلوكية. ينطلق هذا الإجراء من مبدأ تعظيم الاستفادة من كل معلومة مسجلة لدى الباحث، حيث يتم تضمين المفحوص أو المشترك في التحليل الإحصائي الخاص بزوج معين من المتغيرات طالما توفرت لديه بيانات مكتملة لهذين المتغيرين تحديداً، بصرف النظر عما إذا كانت قياساته على بقية متغيرات الدراسة مفقودة أو غير مكتملة. ورغم أن هذا التوجه يحظى بجاذبية حدسية واضحة لدى الباحثين الراغبين في عدم إهدار جهود جمع البيانات وتفادي تقليص حجم العينة الكلية، إلا أنه يثير في الآن ذاته إشكالات إبستمولوجية ورياضية معقدة ترتبط باختلال مصفوفات التغاير وتباين أحجام العينات بين المعاملات الإحصائية المختلفة.
المفهوم الإحصائي والأسس النظرية لتحليل الحالات المتاحة
يستند تحليل الحالات المتاحة إلى قاعدة حسابية محددة تقضي بفحص كل إجراء إحصائي أو علاقة ارتباطية على حدة؛ فعند حساب معامل ارتباط بيرسون بين متغيرين مثل “مستوى القلق” و”التحصيل الأكاديمي”، يعمد الإجراء إلى استبعاد الأفراد الذين تنقصهم درجات في أي من هذين المتغيرين فقط، بينما يظل هؤلاء الأفراد أنفسهم مؤهلين للدخول في حساب معامل الارتباط بين متغير “مستوى القلق” و”ساعات النوم” إذا كانت درجات هذين المتغيرين الأخيرين متوفرة لديهم. وبذلك، فإن حجم العينة الإحصائية لا يظل ثابتاً عبر كامل التحليلات التي تجريها الدراسة، بل يتحول إلى قيمة ديناميكية تتغير من زوج متغيرات إلى آخر تبعاً لنمط الفقد في أدوات القياس المستخدمة.
يتناقض هذا النهج بصورة حادة مع تحليل الحالات المكتملة (Complete-Case Analysis) أو ما يُعرف بـ “الحذف القائم على الحالات” (Listwise Deletion)، والذي يتطلب استبعاد المفحوص استبعاداً كلياً ونهائياً من كافة التحليلات بمجرد وجود قيمة مفقودة واحدة في أي متغير من متغيرات الدراسة، حتى لو كان ذلك المتغير هامشياً أو غير مستخدم في بعض الفرضيات الفرعية. وعليه، فإن المبرر الجوهري الذي يستند إليه أنصار تحليل الحالات المتاحة هو الرغبة في الحفاظ على أقصى قدر ممكن من القوة الإحصائية (Statistical Power) وتقليل هدر البيانات التي جُمعت بكلفة زمنية ومادية مرتفعة، لاسيما في المسوح النفسية الواسعة وتطبيقات القياس الإكلينيكي المعقدة.
ومع ذلك، فإن هذا الأساس الحسابي المرن يحمل في طياته شروطاً افتراضية صارمة لضمان صحة الاستدلال العلمي؛ إذ يفترض هذا الأسلوب ضمناً أن كل زوج من المتغيرات يمثل عينة فرعية عشوائية غير متحيزة من المجتمع الأصلي المستهدف، وهو افتراض يصعب التحقق منه تجريبياً في البيئات الميدانية للعلوم النفسية، حيث لا يكون الفقد مجرد حدث ميكانيكي عشوائي بل غالباً ما يرتبط بخصائص نفسية أو ديموغرافية تخص المشتركين أنفسهم، مما قد يفتح الباب أمام تشوهات في التقديرات المعلمية واختبارات الدلالة الإحصائية.
آليات الفقد وعلاقتها بصلاحية تحليل الحالات المتاحة
لكي نفهم التداعيات المنهجية لتطبيق تحليل الحالات المتاحة في البحث النفسي، لا بد من استحضار التصنيف الثلاثي الرائد الذي قدمه دونالد روبين (Donald Rubin) لآليات فقد البيانات، والذي يشمل: الفقد العشوائي التام (MCAR)، والفقد العشوائي (MAR)، والفقد غير العشوائي (MNAR). ويشير الفقد العشوائي التام إلى أن احتمالية فقدان الملاحظة لا تعتمد على المتغير نفسه المقاس ولا على أي متغير آخر ملحوظ أو غير ملحوظ داخل الدراسة؛ وفي هذه الحالة الاستثنائية والنادرة الحدوث، ينتج عن تحليل الحالات المتاحة تقديرات غير متحيزة للارتباطات والتغايرات، لأن الحالات المتبقية تمثل عينة عشوائية حقيقية من المجتمع الإحصائي الأصلي.
أما عندما يكون الفقد من نوع “الفقد العشوائي” (Missing at Random – MAR)، حيث ترتبط احتمالية الفقد بمتغيرات أخرى تم قياسها في الدراسة (مثل ميل الأفراد ذوي الدخل المنخفض أو المستويات التعليمية المعينة إلى عدم الإجابة على استبيان اضطراب ما بعد الصدمة)، فإن تحليل الحالات المتاحة يصبح عاجزاً عن تقديم تقديرات سليمة وغير متحيزة؛ وذلك لأن الحسابات الزوجية لا تأخذ في الاعتبار المتغيرات الوسيطة أو المتداخلة التي تفسر آلية الفقد خارج إطار الزوج الخاضع للتحليل الفوري. وبالتالي، فإن الاقتصار على الحالات المتاحة لكل زوج يؤدي إلى تحيز منهجي مباشر في معامِلات الانحدار وحجوم التأثير.
وتتفاقم الأزمة المعرفية عندما تقع البيانات تحت طائلة “الفقد غير العشوائي” (Missing Not at Random – MNAR)، حيث يعود سبب الغياب إلى قيمة المتغير المفقود ذاته، كأن يمتنع الأفراد المصابون بدرجات اكتئاب شديدة جداً عن إكمال مقياس الاكتئاب السريري. في هذا السياق، يقود تطبيق تحليل الحالات المتاحة إلى تشويه منهجي مضاعف؛ إذ يتم تجاهل الشريحة الأكثر تطرفاً في البنية النفسية للمتغير، وينجم عن ذلك عينات زوجية متباينة التمثيل تعكس أجزاء مشتتة وغير متجانسة من مجتمع العينة الكلية، مما يُفقد النتائج المترتبة عليها مصداقيتها الإكلينيكية والنظرية.
التطبيقات الشائعة في البحوث النفسية والمسوح السلوكية
يكثر اللجوء إلى تحليل الحالات المتاحة في التصاميم البحثية النفسية ذات الطبيعة الطولية (Longitudinal Studies)؛ ففي مثل هذه البحوث، يتم تتبع عينات من الأطفال أو البالغين عبر فترات زمنية ممتدة تمتد لعدة سنوات، وغالباً ما تشهد هذه الدراسات ظاهرة التسرب التدريجي للمشاركين (Attrition). فإذا تم استبعاد كل مشارك غاب عن جلسة واحدة من جلسات التقييم الدوري وفق أسلوب الحذف الكلي، فقد تنتهي الدراسة بفقدان ما يتراوح بين 40% إلى 60% من حجم العينة الكلية، مما يحدو بالباحثين إلى الاستعانة بتحليل الحالات المتاحة لاستبقاء أكبر قدر ممكن من القياسات الفردية لكل مرحلة نمائية ومقارنتها بما توفر من مراحل سابقة.
كما يُستخدم هذا الأسلوب على نطاق واسع في بناء الاختبارات والمقاييس السيكومترية وتحليل الاتساق الداخلي (Internal Consistency) وبطاريات استخبار الشخصية، مثل مقاييس العوامل الخمسة الكبرى. ففي الاستبانات الطويلة التي تشتمل على عشرات أو مئات البنود، قد يُسقط المفحوص سهواً بنداً أو بندين، ولتفادي التضحية بالاستمارة بأكملها، يقوم الباحثون بحساب مصفوفات الارتباط بين البنود اعتماداً على كل مشارك أجاب عن البندين قيد المقارنة، وهو ما يضمن توفير بيانات تغذي الفحوصات الأولية للخصائص القياسية للاختبار دون الحاجة إلى تكلفة إضافية في جمع العينات.
كذلك تبرز تطبيقات هذا الإجراء في دراسات علم النفس العصبي والطب النفسي التجريبي، حيث تتضمن البروتوكولات مزيجاً معقداً من القياسات البيولوجية والسلوكية والمقابلات التشخيصية. ونظراً لأن بعض المشاركين قد يكملون مهام التقييم المعرفي المحوسبة ولكنهم يرفضون أو يتعذر عليهم الخضوع للتصوير بالرنين المغناطيسي الوظيفي أو تقديم عينات لعابية، يُلجأ إلى تحليل الحالات المتاحة لدراسة العلاقات بين المتغيرات السلوكية بمفردها بأقصى حجم عينة ممكن، مع قصر التحليلات البيولوجية العصبية على الحالات التي استوفت شروط ذلك القياس الحصري.
المزايا المنهجية والمكاسب التحليلية لأسلوب الحالات المتاحة
تتمثل أولى المزايا وأبرزها في الكفاءة الإحصائية المتعلقة بالاستثمار الأمثل لحجم العينة؛ ففي البيئات البحثية التي تعاني من ندرة المفحوصين، مثل دراسات الاضطرابات النفسية النادرة أو الأقليات العيادية المتخصصة، يُعد كل تسجيل لمعلومة ذات قيمة سيكولوجية مورداً ثميناً لا يمكن التفريط فيه بسهولة. يتيح تحليل الحالات المتاحة الحفاظ على هذه الثروة المعطياتية، مما يرفع من حساسية الاختبارات الإحصائية لاكتشاف الفروق الحقيقية أو العلاقات التنبؤية الطفيفة وتجنب ارتكاب الخطأ من النوع الثاني (Type II Error).
علاوة على ذلك، يتسم هذا الأسلوب بالبساطة الإجرائية وسهولة التطبيق البرمجي؛ إذ يتوفر كخيار افتراضي أو أساسي في معظم الحزم الإحصائية الشهيرة مثل SPSS وSAS وStata دون الحاجة إلى إجراءات خوارزمية معقدة أو نمذجة مسبقة لأنماط الفقد، مثلما تتطلب أساليب المعايرة الاستدلالية أو التعيين المتعدد. هذه السهولة تجعله جذاباً للباحثين الميدانيين وطلبة الدراسات العليا في علم النفس لإجراء الفحوصات الاستكشافية الأولية للبيانات قبل الانتقال إلى بناء النماذج المعقدة ذات القيود المنهجية المشددة.
كما يقلل تحليل الحالات المتاحة من خطورة التحيز الشديد في تقدير مقاييس النزعة المركزية والتشتت الخاصة بالمتغيرات الفردية؛ فعند تقدير المتوسط الحسابي لمتغير ما، يتم استخدام جميع الحالات التي تتوفر لديها درجات على ذلك المتغير، مما ينتج عنه تقديراً أقرب إلى تمثيل المجتمع الأصلي مقارنة بأسلوب الحذف الكلي، والذي يختزل عينة المتوسط في تلك المجموعة الفرعية المقيدة التي أكملت الاستجابة لجميع المتغيرات الأخرى، وهي مجموعة غالباً ما تتميز بخصائص التزام ومثابرة قد لا تمثل النمط الشائع في المجتمع النفسي العام.
المعضلات الرياضية والانعكاسات المنهجية الحرجة
على الرغم من الجوانب العملية المغرية لهذا النهج، يواجه تحليل الحالات المتاحة نقداً بنيوياً حاداً من قِبل علماء القياس والإحصاء السلوكي، وتتمحور أولى هذه المشكلات حول التباين المستمر في حجم العينة (Variable Sample Size)؛ فعندما يكون معامل الارتباط الأول محسوباً على عينة حجمها 500 مفحوص، ومعامل الارتباط الثاني على 320 مفحوصاً، والثالث على 410 مفحوصين، يصبح من المستحيل تحديد حجم العينة الفعلي الكلي الذي تستند إليه المصفوفة ككل. وهذا الأمر يولد إرباكاً شديداً عند حساب درجات الحرية وحساب الأخطاء المعيارية للاختبارات الإحصائية، مما يضعف الثقة في اختبارات الدلالة وفترات الثقة الناتجة.
تتمثل المعضلة الكبرى الأخرى، ذات الطبيعة الجبرية، في توليد ما يسمى بـ “المصفوفات غير محددة الموجبية” (Non-Positive Definite Matrices)؛ ففي التحليلات الإحصائية المتقدمة شائعة الاستخدام في علم النفس، مثل التحليل العاملي الاستكشافي والتوكيدي ونمذجة المعادلات البنائية (SEM)، تشترط الخوارزميات أن تكون مصفوفة التغاير متماسكة رياضياً وقابلة للعكس الجبري. وبما أن كل معامل ارتباط في تحليل الحالات المتاحة يُحسب على مجموعة مختلفة من الأفراد، فقد تفضي العلاقات المتضاربة أحياناً إلى استحالة رياضية تتمثل في قيم ارتباط تربيعي تزيد عن الواحد الصحيح أو تباينات متبقية سالبة (Heywood Cases)، مما يؤدي إلى انهيار الخوارزميات الحاسوبية وفشلها في الوصول إلى حل متقارب.
يضاف إلى ذلك خطر الوقوع في استنتاجات خاطئة تماماً حول طبيعة العلاقات النفسية نتيجة التناقض الداخلي في العلاقات الترانزيتية (Intransitivity)؛ فمن الممكن حسابياً، بسبب اختلاف عينات الأزواج، أن يظهر المتغير (أ) ارتباطاً إيجابياً قوياً مع المتغير (ب)، والمتغير (ب) ارتباطاً إيجابياً مع (ج)، ومع ذلك يظهر المتغير (أ) ارتباطاً سلبياً غير متوقع مع المتغير (ج). هذا الخلل التركيبي لا يعود إلى حقيقة سيكولوجية في الظاهرة المدروسة، بل هو أثر اصطناعي ناشئ عن تباين العينات الفرعية التي وفرت البيانات لكل زوج، وهو ما قد يقود الباحثين إلى بناء نظريات مشوهة لا أصل لها في الواقع السلوكي.
مقارنة بين تحليل الحالات المتاحة والبدائل الإحصائية الحديثة
في ضوء المآزق المرتبطة بالتحليلات المعتمدة على الحذف، طوّر الإحصائيون بدائل حديثة تتفوق جذرياً على كل من تحليل الحالات المتاحة وتحليل الحالات المكتملة، وتأتي في مقدمتها خوارزمية الاحتمالية العظمى للمعلومات الكاملة (Full Information Maximum Likelihood – FIML) وأسلوب التعيين المتعدد للبيانات المفقودة (Multiple Imputation). يوضح الجدول والمقارنة المنهجية التالية الفروق المفصلية بين هذه المقاربات في إطار الأبحاث النفسية المعاصرة:
- تحليل الحالات المكتملة (Listwise Deletion): يؤدي إلى استقرار حجم العينة وثبات درجات الحرية ولكنه يتسبب في هدر هائل لحجم البيانات ويؤدي إلى تحيز منهجي واسع في حال غياب شرط الفقد العشوائي التام (MCAR).
- تحليل الحالات المتاحة (Pairwise Deletion): يستبقي معظم البيانات المسجلة، إلا أنه يعاني من عدم ثبات حجم العينة واحتمال توليد مصفوفات غير صالحة حسابياً ونمذجة مشوهة للتباين والارتباط.
- التعيين المتعدد (Multiple Imputation): يقوم على توليد قيم متعددة بديلة لكل قيمة مفقودة بناءً على نموذج تنبؤي يستند إلى كافة المتغيرات المتاحة في قاعدة البيانات، مما يعكس عدم اليقين المتأصل في الفقد، ويتوافق بالكامل مع شرط الفقد العشوائي (MAR)، ويحافظ على بنية المصفوفة الرياضية دون المساس بسلامتها.
- الاحتمالية العظمى للمعلومات الكاملة (FIML): يُعد المعيار الذهبي المفضل اليوم في نماذج المعادلات البنائية؛ حيث لا يتم استبدال البيانات المفقودة بقيم مصطنعة، بل يتم احتساب دالة الإمكان الأعظم لكل فرد بالاعتماد على المتغيرات المتوفرة لديه ضمن إطار النموذج العام، مما يمنح تقديرات دقيقة وغير متحيزة ويقضي على معضلات التباين في درجات الحرية.
إن التحول نحو أساليب FIML والتعيين المتعدد أدى إلى تراجع التوصية باستخدام تحليل الحالات المتاحة في المجلات العلمية المحكمة ذات التأثير المرتفع في علم النفس؛ حيث باتت هيئات التحرير تطالب الباحثين صراحة بتبرير إحصائي قاطع إن هم قرروا الاعتماد على الحذف الزوجي، أو تدعوهم لتقديم تحليلات حساسية تثبت أن نتائجهم لم تتأثر بانتقائية الحالات المتاحة لكل متغير.
إرشادات وموجهات للباحثين في القياس النفسي
إذا وجد الباحث النفسي نفسه مضطراً لاستخدام تحليل الحالات المتاحة في مرحلة من مراحل بحثه، فإن هناك مجموعة من الضوابط الإجرائية المنهجية التي ينبغي الالتزام بها بدقة لحماية البحث من الانحرافات التفسيرية، ومن أهمها:
- الفحص الصارم لطبيعة ونسبة الفقد: يجب إجراء اختبارات الفقد العشوائي، مثل اختبار ليتل (Little’s MCAR Test)، للتأكد المبدئي من أن غياب البيانات لا يرتبط بنسق منهجي خفي، مع تجنب استخدام الحذف الزوجي إذا تجاوزت نسبة الفقد في أحد المتغيرات 10% إلى 15%.
- الشفافية الكاملة في توثيق أحجام العينات: يتعين على الباحث الإبلاغ بوضوح عن حجم العينة الخاص بكل معامل ارتباط أو تغاير يتم عرضه في الجداول الإحصائية، بدلاً من الاكتفاء بذكر العينة الكلية للدراسة، وتوضيح نطاق تباين درجات الحرية المستخدمة في الحسابات.
- التحقق الرياضي من صلاحية المصفوفات: قبل الشروع في استخدام مصفوفة الارتباط المحسوبة بطريقة الحذف الزوجي في أي تحليل متعدد المتغيرات (Multivariate Analysis)، يجب فحص المحددات والقيم الذاتية (Eigenvalues) للمصفوفة للتأكد من أنها قيم موجبة، وأن المصفوفة متوافقة رياضياً وخالية من القيم الشاذة الناتجة عن تباين العينات الزوجية.
- إجراء تحليلات الحساسية (Sensitivity Analyses): يُنصح بمقارنة النتائج المتحصل عليها عبر تحليل الحالات المتاحة مع نتائج التحليل بطريقة الحالات المكتملة وطريقة التعيين المتعدد؛ فإذا أظهرت الطرق الثلاث نمطاً متقارباً من العلاقات، تعززت الثقة في ثبات النتيجة وصمودها، أما إذا اختلفت النتائج جذرياً، فيكون ذلك مؤشراً جازماً على وجود تحيز مرتبط بآلية الفقد.
خاتمة
يظل تحليل الحالات المتاحة محطة بارزة في تاريخ المنهجية الإحصائية والقياس السلوكي، عكست رغبة براغماتية لدى الباحثين في تعظيم الاستفادة من البيانات والحد من الهدر المعرفي للملاحظات النفسية المسجلة. ورغم سهولته الظاهرية وفائدته المحدودة في المراحل الاستكشافية الأولية، إلا أن ما ينطوي عليه من مخاطر تتعلق بتباين أحجام العينات، وتشويه فترات الثقة، واحتمال إنتاج مصفوفات رياضية معتلة وغير صالحة للاستخدام الإحصائي المتقدم، يجعل استخدامه في الوقت الحاضر محاطاً بمحاذير شديدة. ومع بزوغ أدوات المعالجة الأكثر متانة مثل خوارزمية الاحتمالية العظمى للمعلومات الكاملة (FIML) والتعيين المتعدد (Multiple Imputation)، بات لزاماً على مجتمع البحوث النفسية مغادرة هذه الأساليب الكلاسيكية والانتقال نحو مقاربات حديثة تصون سلامة البنية الاستدلالية للأبحاث وتحافظ في الوقت نفسه على غنى البيانات السيكولوجية وعمقها.
المراجع
- Allison, P. D. (2001). Missing Data (Quantitative Applications in the Social Sciences, Vol. 136). SAGE Publications.
- Enders, C. K. (2010). Applied Missing Data Analysis. Guilford Press.
- Graham, J. W. (2009). Missing data analysis: Making it work in the real world. Annual Review of Psychology, 60(1), 549–576. https://doi.org/10.1146/annurev.psych.58.110405.085530
- Little, R. J. A., & Rubin, D. B. (2019). Statistical Analysis with Missing Data (3rd ed.). John Wiley & Sons.
- Marsh, H. W. (1998). Pairwise deletion for missing data in structural equation modeling: Nonpositive definite matrices, parameter estimates, goodness of fit, and adjusted sample size. Structural Equation Modeling: A Multidisciplinary Journal, 5(1), 22–36. https://doi.org/10.1080/10705519809540089
- Peugh, J. L., & Enders, C. K. (2004). Missing data in educational research: A review of reporting practices and suggestions for improvement. Review of Educational Research, 74(4), 525–556. https://doi.org/10.3102/00346543074004525
- Rubin, D. B. (1976). Inference and missing data. Biometrika, 63(3), 581–592. https://doi.org/10.1093/biomet/63.3.581
- Schafer, J. L., & Graham, J. W. (2002). Missing data: Our view of the state of the art. Psychological Methods, 7(2), 147–177. https://doi.org/10.1037/1082-989X.7.2.147