تُعد المقارنة البعدية (A Posteriori Comparison)، والمعروفة على نطاق واسع في أدبيات القياس النفسي والإحصاء الحيوي باسم المقارنة اللاحقة أو اختبارات Post-Hoc، ركيزة أساسية في منهجية البحث التجريبي المعاصر. تُجرى هذه المقارنات الاستكشافية بعد استخراج النتائج العامة لاختبار تحليل التباين (ANOVA) وثبوت وجود دلالة إحصائية شاملة بين المجموعات التجريبية أو الضابطة دون تحديد مسبق لاتجاهات هذه الفروق. يهدف هذا المدخل الموسوعي إلى تقديم تفكيك نظري وإجرائي متعمق لمفهوم المقارنات البعدية وتطبيقاتها المعقدة في فضاء العلوم النفسية والتربوية والسلوكية.
المفهوم والتعريف الأكاديمي للمقارنة البعدية
تُعرّف المقارنة البعدية في الإحصاء النفسي والبارامتري بأنها تقنية استنتاجية استكشافية تُطبَّق بعد فحص البيانات (Data Snooping or Data Dredging المقنن) بغرض تحديد أيٍّ من المتوسطات الحسابية النوعية يختلف اختلافاً جوهرياً عن المتوسطات الأخرى. في العديد من التصاميم التجريبية النفسية متعددة المجموعات، مثل مقارنة فاعلية ثلاثة بروتوكولات علاجية مختلفة مع مجموعة ضابطة لتخفيف أعراض اضطراب الاكتئاب الجسيم، يقدم اختبار التباين الأحادي فرضية صفرية كلية تشير إلى تساوي جميع المتوسطات، ولا يوضح بدقة أي المجموعات تتفوق على نظيراتها، وهنا تتدخل الاختبارات البعدية لسد هذه الفجوة المعرفية الدقيقة.
تستند هذه الإجراءات إلى فكرة أن الباحث لم يكن يمتلك فرضية موجهة مسبقة وصارمة حيال أزواج المجموعات المتمايزة قبل جمع البيانات، أو أنه يرغب في استكشاف أنماط تباين غير متوقعة ظهرت أثناء المعالجة الميدانية. تتطلب المقارنة البعدية ضوابط رياضية صارمة لأن الفحص الحر غير المقيد للمجموعات بعد جمع البيانات يرفع من احتمالات الصدفة الإحصائية؛ الأمر الذي يجعل مفهوم المقارنة البعدية مرتبطاً بنيوياً بمصطلح ضبط معدل الخطأ عبر العائلة الواحدة من المقارنات، مما يميزها منهجياً عن الفرضيات الموجهة سلفاً.
من الناحية المعرفية والإبستيمولوجية في علم النفس التجريبي، تمثل المقارنات البعدية حلقة وصل بين البحث الاستكشافي والبحث التوكيدي. فعلى الرغم من أنها تُجرى على بيانات جُمعت بالفعل، إلا أنها تخضع لصرامة اختبار الفرضيات، مما يحول الملاحظات العفوية في المختبر النفسي إلى مؤشرات قابلة للتعميم، أو يؤسس لبناء فرضيات جديدة يمكن اختبارها توكيدياً في دراسات تتبعية مستقلة، مما يعزز رصانة الاستدلال القياسي في العلوم الإنسانية.
السياق التاريخي وتطور الاختبارات البعدية في السيكومتري
يعود الأصل النظري لاختبارات المقارنة اللاحقة إلى الثلث الأول من القرن العشرين، متزامناً مع الثورة الإحصائية التي قادها السير رونالد فيشر عند صياغته لاختبار تحليل التباين ومفهوم أقل فرق معنوي (LSD). سرعان ما أدرك علماء القياس النفسي والإحصائيون الرياضيون أن تطبيق اختبارات الفروق التقليدية المتكررة، مثل اختبار “ت” (t-test)، يؤدي إلى انهيار مستوى المعنوية المحدد، مما دفع باحثين مثل جون توكي وهنري شيفيه وديفيد دنكان إلى تطوير معادلات مخصصة لمعالجة هذا الخلل البنيوي في خمسينيات القرن الماضي.
مع اتساع نطاق الدراسات السلوكية في الجامعات الأمريكية والأوروبية خلال فترة ما بعد الحرب العالمية الثانية، وخصوصاً في بحوث الإشراط وعلم النفس الدوائي وعلم النفس الصناعي، تعقدت التصاميم التجريبية لتشمل مستويات متعددة من المتغيرات المستقلة. دفع هذا التعقيد إلى البحث عن آليات تحمي الباحث النفسي من التورط في قبول استنتاجات واهية، ومن هنا ظهرت مؤلفات جون توكي حول الحسابات الاستكشافية وتحليل التباين البعدي، والتي شكلت حجر الزاوية في المناهج الإحصائية المعاصرة المعتمدة في الجمعية الأمريكية لعلم النفس (APA).
شهدت العقود الأخيرة من القرن العشرين ومطلع القرن الحادي والعشرين تحولاً كبيراً مع دخول الحوسبة الإحصائية وبرمجيات الحزم الإحصائية للعلوم الاجتماعية (SPSS) وبيئات البرمجة مثل R وPython. أتاحت هذه التقنيات للباحثين النفسيين تطبيق خوارزميات بالغة التعقيد للمقارنات البعدية بدقة متناهية، والتعامل مع حالات عدم تجانس التباين واختلاف أحجام العينات، مما نقل المقارنة البعدية من مجرد حسابات يدوية مجهدة إلى عمليات نمذجة متقدمة تضمن سلامة الاستنتاج السيكولوجي.
الفارق المنهجي بين المقارنات القبلية والمقارنات البعدية
يرتكز التمييز بين المقارنات القبلية (A Priori or Planned Comparisons) والمقارنات البعدية (A Posteriori or Unplanned Comparisons) على التوقيت المنطقي والدافع النظري لبناء الفرضية داخل التصميم التجريبي النفسي. في المقارنات القبلية، يعتمد الباحث على أطر نظرية متينة ومراجعات أدبية مستفيضة لصياغة تساؤلات محددة سلفاً، مثل افتراض أن العلاج السلوكي المعرفي سيتفوق تحديداً على العلاج بالتحليل النفسي التقليدي قبل جمع أي استجابة من المبحوثين، مما يتيح له قوة إحصائية أعلى دون الحاجة لتعديلات مفرطة في معدلات الخطأ.
على النقيض من ذلك، تتدخل المقارنات البعدية حينما ينعدم التنبؤ المسبق باتجاه الفروق الفردية أو الجماعية، أو عندما يكون البحث قائماً على مسح استكشافي لتأثيرات متزامنة، مثل مقارنة استجابات خمس فئات عمرية مختلفة على مقياس التفكير المرن. لا يحدد الباحث في هذه الحالة أي الفئات ستكون أعلى أو أدنى، بل ينتظر دلالة اختبار التباين العام ليفحص بعدها جميع الأزواج الممكنة من المقارنات المتقاطعة، وهو ما يجعل المقارنة البعدية تتسم بطبيعة استقرائية استكشافية متأخرة زمنياً في دورة المعالجة التجريبية.
يفرض هذا الاختلاف التأسيسي قيوداً متباينة على القوة الإحصائية ومستويات التحفظ. المقارنات القبلية تتمتع بحساسية أكبر لاكتشاف الفروق الحقيقية ذات الأحجام الصغيرة لأنها تضحي بنطاق البحث الواسع لصالح التركيز الموجه، بينما تتبنى المقارنات البعدية نهجاً احترازياً شديد الصرامة يتطلب رفع عتبة الدلالة الإحصائية للحد الأدنى المقبول لتجنب العثور على أنماط عشوائية زائفة تنشأ نتيجة كثرة التباديل والتوافيق بين المتوسطات المستخلصة.
مشكلة تضخم الخطأ من النوع الأول ومعدل الخطأ العائلي
تمثل مشكلة تضخم الخطأ من النوع الأول (Type I Error Inflation) المبرر الرياضي الأهم الذي استدعى ابتكار المقارنات البعدية. في الممارسات الإحصائية القياسية، يحدد الباحث مستوى الدلالة (ألفا α) عند 0.05، وهو ما يعني قبول نسبة مخاطرة تعادل 5% لرفض الفرضية الصفرية بالخطأ (أي ادعاء وجود فرق حقيقي بينما هو نتاج الصدفة البحتة). ومع ذلك، تتضاعف هذه النسبة بشكل مركب كلما زاد عدد المقارنات الثنائية المجراة داخل نفس التجربة النفسية.
يُعبر رياضياً عن هذا التضخم بمفهوم معدل الخطأ عبر العائلة (Family-wise Error Rate – FWER)، والذي يُحسب تقريبياً بالمعادلة: FWER = 1 - (1 - α)^c، حيث يمثل c عدد المقارنات الممكنة والمحسوبة بالصيغة التوافقية k(k - 1) / 2 لعدد k من المجموعات. فعلى سبيل المثال، إذا كان لدى باحث نفسي 5 مجموعات تجريبية، فإن عدد المقارنات الثنائية المحتملة هو 10 مقارنات؛ وعند ثبات ألفا عند 0.05، يقفز معدل الخطأ الإجمالي للتجربة إلى قرابة 40%، مما يجعل استنتاج وجود فروق وهمية أمراً شبه حتمي إن لم تُطبّق اختبارات المقارنة اللاحقة المصممة خصيصاً لتحجيم هذا التضخم.
يترتب على الوقوع في شباك الخطأ من النوع الأول عواقب وخيمة في الأبحاث النفسية والتطبيقية، كاعتماد برامج إرشادية غير فعالة، أو الترويج لعقاقير سيكياترية لا تحقق تحسناً ملموساً بالمقارنة مع الدواء الوهمي. لذلك، تعمل أساليب المقارنة البعدية كصمام أمان منهجي يقيد معدل الخطأ الإجمالي للتجربة بأكملها ليبقى عند حدود 0.05، مما يضمن أن الفروق الإحصائية المعلنة تمثل ظواهر نفسية أصيلة وليست شوائب استدلالية ناتجة عن التكرار العشوائي للفحوص.
أبرز الاختبارات الإحصائية للمقارنات البعدية وتطبيقاتها
تتعدد أساليب المقارنة اللاحقة وتتباين في درجة تحفظها ومناسبتها للبيانات النفسية وتصميم التجربة، وفيما يلي تفصيل منهجي لأشهر هذه الاختبارات واستخداماتها الأكثر شيوعاً في الميدان السيكولوجي:
اختبار توكي للفرق الدال الحقيقي (Tukey’s HSD)
يُعد اختبار Tukey’s Honestly Significant Difference من أكثر الاختبارات البعدية انتشاراً وتوازناً في البحوث النفسية والتربوية. يعتمد الاختبار على توزيع المدى الماستودنت (Studentized Range Distribution)، وهو مصمم خصيصاً لإجراء جميع المقارنات الثنائية الممكنة بين أزواج المتوسطات. يتميز بقوته الإحصائية العالية عندما تكون أحجام العينات متساوية وتوزيعات البيانات تتبع التوزيع الطبيعي مع ثبات التجانس في التباين، كما أنه يحافظ بدقة متناهية على معدل الخطأ العائلي عند المستوى المرغوب دون إفراط في التحفظ قد يطمس الفروق الحقيقية.
اختبار شيفيه (Scheffé’s Method)
يمثل اختبار شيفيه الأسلوب الأكثر تحفظاً ومرونة بين جميع اختبارات المقارنة البعدية. صُمم هذا الاختبار للتعامل ليس فقط مع المقارنات الثنائية البسيطة (مجموعة مقابل مجموعة)، بل أيضاً مع المقارنات المركبة والمعقدة (مثل مقارنة متوسط مجموعتين علاجيتين معاً في مقابل متوسط مجموعة العلاج المعرفي بمفردها). وعلى الرغم من انخفاض قوته الإحصائية في اكتشاف الفروق الفردية الدقيقة مقارنة باختبار توكي، إلا أنه الاختبار الأمثل عندما تكون أحجام العينات في المجموعات النفسية غير متساوية بدرجة كبيرة، أو عند استهداف استكشاف تركيبات خطية معقدة وغير متوقعة للبيانات التجريبية.
تعديل بونفيروني (Bonferroni Correction) وتعديل سيداك (Šidák)
يقوم تعديل بونفيروني على مبدأ رياضي بالغ البساطة ولكنه فائق الصرامة، حيث يقسم الباحث قيمة ألفا العامة (0.05 مثلاً) على العدد الكلي للمقارنات المجراة (α / c). على الرغم من سهولة حسابه وتطبيقه الواسع في القياس العصبي وتصوير الدماغ الوظيفي (fMRI) حيث يتم التعامل مع آلاف المقارنات النقطية في آن واحد، إلا أنه يتسم بنزعة تحفظية حادة تؤدي غالباً إلى زيادة احتمالية الوقوع في الخطأ من النوع الثاني (Type II Error)، أي الفشل في اكتشاف فروق نفسية موجودة واقعياً؛ بينما يقدم تعديل سيداك بديلاً غير خطي أقل تحفظاً بقليل استناداً إلى استقلالية الاختبارات الجزئية.
اختبار غيمز-هاول (Games-Howell Test)
يبرز اختبار غيمز-هاول كخيار إنقاذ منهجي حاسم عندما تفشل البيانات النفسية في تحقيق فرضية تجانس التباين (Homogeneity of Variance)، وهي مشكلة متكررة الحدوث في القياس النفسي الإكلينيكي بسبب التباين الطبيعي الواسع في استجابات المرضى النفسيين مقارنة بالأفراد الأسوياء. لا يشترط هذا الاختبار تساوي تباينات المجموعات ولا تساوي أحجام العينات، بل يعدل درجات الحرية تلقائياً باستخدام معادلة ويلش-ساترثويت، مما يجعله الاختبار المفضل والأكثر موثوقية في الدراسات الميدانية التي تتعامل مع عينات واقعية صعبة الضبط والتوفيق.
اختبارات التدرج المتسلسل: نيومان-كولز ودنكان
تشمل هذه الفئة اختبارات المدى المتعددة مثل Student-Newman-Keuls (SNK) واختبار Duncan. تتبع هذه الأساليب استراتيجية مرحلية ترتب المتوسطات تصاعدياً وتقارن المدى الأكبر فالأصغر بحواجز دلالة متغيرة. ورغم أنها كانت واسعة الشيوع في الدراسات السلوكية القديمة نظراً لقوتها الإحصائية المرتفعة في رصد الفروق الهامشية، إلا أن الأدبيات المعاصرة توجه انتقادات حادة لعدم قدرتها على التحكم الكامل في معدل الخطأ العائلي عبر جميع الشروط التجريبية، مما قلص الاعتماد عليها في المجلات النفسية الرصينة المصنفة عالمياً.
معايير المفاضلة والاختيار في التصاميم التجريبية النفسية
يتطلب اختيار الاختبار البعدي المناسب في دراسات علم النفس وزناً دقيقاً لعدة متغيرات منهجية ورياضية تحكم بنية التجربة وطبيعة المجتمع الإحصائي المدروس. يجب على الباحث أولاً فحص توازن التصميم، فإذا كانت أحجام العينات متساوية تماماً (Balanced Design) وشروط التوزيع الطبيعي وتجانس التباين محققة بالكامل، فإن اختبار توكي (Tukey’s HSD) يقف في صدارة الخيارات الموصى بها أكاديمياً لما يقدمه من موازنة دقيقة بين الحماية من الخطأ واكتشاف الأثر الحقيقي.
في المقابل، إذا واجه الباحث اختلالاً واضحاً في تجانس التباينات، كما هو الحال الشائع في مقارنة عينات إكلينيكية (مثل مرضى الفصام) مع مجموعات غير سريرية، فإن اللجوء إلى اختبارات تفترض تساوي التباين يمثل خطأً منهجياً فادحاً يهدد الصدق الداخلي للدراسة بأكملها. في هذا السيناريو، يُعد اختبار غيمز-هاول (Games-Howell) هو البديل المنهجي الأكثر أماناً وقوة، حيث يحمي التحليل من التضخم الزائف للدلالة دون تقييد مفرط للقدرة الاستكشافية للباحث.
أما عند الرغبة في إجراء مقارنات غير متكافئة تشمل دمج مجموعات وتكوين تباينات فرعية، مثل مقارنة الأداء المعرفي لمجموعتي العلاج السلوكي مجتمعتين في مقابل مجموعة الدواء الوهمي ومجموعة الانتظار، فإن اختبار شيفيه (Scheffé) يتفرد بقدرته المنهجية على استيعاب هذه التوليفات المعقدة مع الحفاظ الصارم على حدود المعنوية العامة، بصرف النظر عن حجم التباين أو عدم تماثل أعداد المفحوصين داخل الخلايا التجريبية.
الافتراضات الإحصائية والحدود الإجرائية
لا تعمل اختبارات المقارنة البعدية في فراغ رياضي، بل ترتبط بمجموعة من الافتراضات الصارمة التي يستوجب تحققها لضمان صدق النتائج الميدانية وقابليتها للتعميم. تشمل هذه الافتراضات استقلالية الملاحظات، والتي تعني أن استجابة أي مفحوص نفسي لا تتأثر باستجابات الآخرين، والتوزيع الطبيعي لدرجات المتغير التابع داخل كل مستوى من مستويات المتغير المستقل، فضلاً عن تجانس التباين السكاني المقاس باختبارات كشف الشذوذ مثل اختبار ليفين (Levene’s Test).
تتمثل إحدى أبرز الحدود الإجرائية للمقارنات البعدية في ما يُعرف في فلسفة العلم بظاهرة “الاستكشاف اللاحق غير الموجه” (HARKing: Hypothesizing After the Results are Known). فعندما يفرط الباحث في إجراء عشرات المقارنات البعدية دون تأصيل نظري، يتحول المسار من ممارسة استكشافية مشروعة إلى نوع من التلاعب الإحصائي الانتقائي المعروف بـ Data Dredging، حيث يتم اقتناص الفروق العشوائية وتلفيق مبررات نظرية مصطنعة لها بأثر رجعي، وهو ما فاقم أزمة إعادة الإنتاج (Replication Crisis) في علم النفس التجريبي والاجتماعي خلال العقدين الأخيرين.
علاوة على ذلك، تعاني المقارنات البعدية من انخفاض القوة الإحصائية (Statistical Power) عندما تطبق أساليب تصحيحية متشددة جداً مثل بونفيروني مع عينات صغيرة الحجم، مما يقود إلى قبول فرضيات صفرية خاطئة وتجاهل آثار تدريبية أو علاجية واعدة. لذلك، تشترط المعايير المنهجية المعاصرة للجمعية الأمريكية لعلم النفس تدعيم نتائج المقارنات البعدية بتقديرات دقيقة لحجم الأثر (Effect Size) مثل مربع إيتا الجزئي (ηp²) ومعامل كوهين (Cohen’s d)، وفترات الثقة (Confidence Intervals) لتوفير قراءة متكاملة تتجاوز مجرد فحص الدلالة الاسمية (p-value).
دراسة حالة تطبيقية: فحص التدخلات النفسية للاحتراق النفسي المهني
لتوضيح التطبيق العملي للمقارنات اللاحقة، نفترض دراسة تجريبية استهدفت تقييم فاعلية أربعة بروتوكولات لخفض درجات الاحتراق النفسي لدى عينة من الممارسين الصحيين (N = 120، موزعين بالتساوي بمعدل n = 30 لكل مجموعة):
- المجموعة الأولى: برنامج اليقظة الذهنية وتخفيض التوتر (MBSR).
- المجموعة الثانية: برنامج الدعم النفسي الجماعي المركّز.
- المجموعة الثالثة: برنامج العلاج المعرفي السلوكي الموجه لمكان العمل (CBT).
- المجموعة الرابعة: قائمة الانتظار (المجموعة الضابطة).
أظهرت نتائج تحليل التباين الأحادي (One-Way ANOVA) وجود تأثير جوهري عام ذي دلالة إحصائية للبرامج التدخلية على درجات الاحتراق النفسي بمستوى معنوية F(3, 116) = 8.45, p < .001. هذا المعطى العام يخبرنا بوجود فرق حقيقي واحد على الأقل بين المتوسطات، لكنه يعجز عن تحديد ما إذا كان برنامج اليقظة الذهنية يتفوق على العلاج المعرفي السلوكي، أو ما إذا كانت جميع البرامج تتفوق بمفردها على مجموعة الانتظار.
نظراً لتساوي أحجام المجموعات (n = 30) وثبوت تجانس التباين عبر اختبار ليفين (p = .42)، وقع الاختيار الإجرائي على اختبار توكي (Tukey’s HSD) للمقارنات البعدية. أسفرت النتائج البعدية عن التفاصيل السلوكية التالية:
- أظهرت كل من مجموعة اليقظة الذهنية ومجموعة العلاج المعرفي السلوكي انخفاضاً ذا دلالة إحصائية في الاحتراق النفسي مقارنة بمجموعة الانتظار (p < .001 لكلا المقارنتين).
- لم تسجل مجموعة الدعم النفسي الجماعي فرقاً دالاً إحصائياً عند مقارنتها بمجموعة الانتظار (p = .18)، مما يشير إلى محدودية فاعلية هذا التدخل المفرد.
- لم يُظهر الاختبار البعدي أي فرق دال بين برنامج اليقظة الذهنية وبرنامج العلاج المعرفي السلوكي (p = .76)، مما قاد الباحثين إلى استنتاج تكافؤ المسارين العلاجيين في الأثر الإكلينيكي المباشر.
توضح هذه الحالة كيف أزاحت المقارنة البعدية الغموض عن النتائج الإجمالية، ومكنت الفريق البحثي من صياغة توصيات تطبيقية واضحة للمؤسسات الاستشفائية باعتماد برامج اليقظة أو المعرفة السلوكية وتجنب إهدار الموارد في جلسات الدعم غير الموجهة، وهو ما يبرهن على القيمة الميدانية الفارقة للتحليل البعدي الرصين في توجيه القرار النفسي والإداري.
الخلاصة والآفاق التوجيهية في القياس النفسي
تظل المقارنة البعدية (A Posteriori Comparison) أداة تحليلية لا غنى عنها في ترسانة الباحث النفسي والسلوكي، تمكّنه من استنطاق الفروق الدقيقة بين المعالجات التجريبية وضبط الأخطاء الإحصائية التي قد تشوه الاستنتاجات العلمية. إن الانتقال من النتيجة الكلية لتحليل التباين إلى التفاصيل البينية يستوجب إدراكاً عميقاً لطبيعة البيانات، والالتزام بالاختبار الأنسب وفق شروط التوزيع والتباين، والابتعاد عن الصيد العشوائي للدلالات غير المبررة نظرياً لضمان ترسيخ معرفة سيكولوجية تراكمية تتمتع بالصدق والموثوقية العالية.
المراجع
- American Psychological Association. (2020). Publication manual of the American Psychological Association (7th ed.). American Psychological Association.
- Field, A. (2018). Discovering statistics using IBM SPSS statistics (5th ed.). SAGE Publications.
- Howell, D. C. (2013). Statistical methods for psychology (8th ed.). Wadsworth, Cengage Learning.
- Keppel, G., & Wickens, T. D. (2004). Design and analysis: A researcher’s handbook (4th ed.). Pearson Prentice Hall.
- Maxwell, S. E., Delaney, H. D., & Kelley, K. (2018). Designing experiments and analyzing data: A model comparison perspective (3rd ed.). Routledge.
- Scheffé, H. (1959). The analysis of variance. John Wiley & Sons.
- Tukey, J. W. (1949). Comparing individual means in the analysis of variance. Biometrics, 5(2), 99–114.