يشكل التحيز الثقافي في الاختبارات النفسية والتربوية أحد أعقد التحديات المنهجية والأخلاقية التي واجهت مجالات القياس النفسي والتقييم التربوي منذ نشأتها المبكرة. إن محاولة قياس القدرات العقلية والسمات الشخصية عبر أدوات صيغت ضمن سياق ثقافي ولغوي معين غالباً ما تؤدي إلى نتائج مضللة تكرس التفاوت الاجتماعي وتظلم الفئات المهمشة أو الأقليات العرقية واللغوية. يتناول هذا المدخل الموسوعي ظاهرة التحيز الثقافي في أدوات القياس والتقييم من منظور علم النفس القياسي والاجتماعي، مستعرضاً جذورها النظرية والتاريخية وسبل الكشف عنها وتفكيكها لضمان العدالة التقييمية.
التحيز الثقافي في الاختبارات النفسية والتربوية
1. التعريف الدقيق والموجز
التحيز الثقافي في الاختبارات (Cultural Test Bias) هو خطأ منهجي ونسقي في أداة القياس النفسي أو التربوي، يؤدي إلى اختلاف دلالات الصدق أو التنبؤ أو صعوبة البنود باختلاف الخلفية الثقافية أو الإثنية أو اللغوية للمفحوصين، على الرغم من تساويهم في مستوى السمة أو القدرة الكامنة المقاسة. وبعبارة أخرى، هو قصور بنيوي في أداة القياس يحابي أفراد ثقافة معينة ويضع أفراد ثقافات أخرى في موقف غير عادل دون مبرر موضوعي.
يتجلى هذا المفهوم بصورة جوهرية عندما تتطلب أسئلة الاختبار معارف مسبقة، أو ألفاظاً لغوية، أو قيماً اجتماعية خاصة بالثقافة السائدة التي صُمم الاختبار في كنفها، وتعتبرها مقياساً عاماً ومطلقاً للذكاء أو القدرة. ومن ثم، فإن الاختبار المتحيز ثقافياً يفشل في التمييز بين القدرة العقلية الحقيقية للفرد وبين مدى اطلاعه وتشربه للثقافة السائدة، مما يحول عملية القياس من تقييم للسمة النفسية المجردة إلى تقييم لدرجة الاندماج الثقافي أو التماهي مع نموذج قيمي محدد.
في سياق القياس النفسي المعاصر، يُفرَّق بدقة بين مفهوم «التحيز» (Bias) بوصفه خاصية إحصائية وسيكومترية قابلة للإثبات التجريبي، وبين مفهوم «التأثير المتباين» أو «الفروق بين المجموعات»؛ إذ إن مجرد وجود فارق في متوسط الدرجات بين مجموعتين ثقافيتين لا يعني بالضرورة وجود تحيز في الاختبار، إلا إذا ثبت أن هذا الفارق ناجم عن متغيرات طفيلية مرتبطة بالثقافة وليس بالقدرة المقاسة ذاتها.
2. التأصيل اللغوي والاشتقاقي
يعود الأصل اللغوي لمفردة «تحيز» في المعاجم العربية إلى الجذر الثلاثي (ح ي ز)، ويقال تحيز إلى الشيء إذا مال إليه وانضم إليه، والحيّز هو المكان الذي ينفرد به الشيء. والتحيز اصطلاحاً هو الميل غير المبرر أو الانحراف عن جادة الحياد والموضوعية نحو طرف أو فكرة دون استناد إلى حجة برهانية. أما لفظ «الثقافة» فيرجع إلى الجذر (ث ق ف)، وثقف الشيء إذا حذقه وفهمه وضبطه، ودلالتها المعاصرة تشير إلى مجموع المعارف والمعتقدات والفنون والأعراف التي تميز جماعة بشرية معينة.
في اللغة الإنجليزية، يقابل هذا المصطلح تركيب (Cultural Test Bias). تشتق كلمة (Culture) من اللاتينية (Cultura) بمعنى الزراعة أو الفلاحة، ثم تطورت مجازياً لتعني صقل العقل وتهذيب السلوك البشري. أما كلمة (Bias) فتعود أصولها إلى الفرنسية القديمة (Biais) والتي كانت تُستعمل لوصف الخط المائل أو الزاوية المائلة، لا سيما في ألعاب الكرة القديمة، واستقرت في العلوم الحديثة لوصف الانحراف المنتظم أو الخطأ المنهجي غير العشوائي في التقدير الإحصائي. دخل المصطلح حقل علم النفس القياسي في أواسط القرن العشرين، مقترناً بالنقد الموجه لاختبارات الذكاء التقليدية واتهامها بأنها تصب في مصلحة الطبقات البيضاء والوسطى في المجتمعات الغربية.
3. الصيغة النحوية والصرفية والاستعمال
يُصنّف مصطلح «التحيز الثقافي» تركيباً نعتياً؛ حيث يمثل «التحيز» المبتدأ أو الاسم الموصوف، وهو مصدر للفعل الخماسي (تَحَيَّزَ – يَتَحَيَّزُ)، وجاءت كلمة «الثقافي» نعتاً له منسوباً إلى الثقافة بواسطة ياء النسب المشددة. ويُستعمل هذا التركيب في الخطاب الأكاديمي كاسم معنى يُشير إلى ظاهرة بنيوية تؤثر في صدق القياس وثباته.
في التداول السيكومتري العربي، تُستخدم أيضاً تركيبات رديفة مثل: «انحياز القياس الثقافي»، أو «التحيز العرقي-الثقافي في التقويم»، إلا أن التركيب «التحيز الثقافي في الاختبارات» يظل هو الأكثر شيوعاً ودقة في الأدبيات المنشورة. يُعامل المصطلح نحويّاً بحسب موقعه الإعرابي في الجملة (مرفوعاً، منصوباً، أو مجروراً)، ويُجمع جمعاً قياسياً باعتبار مفرداته: «أنماط التحيزات الثقافية في أدوات القياس».
4. الشرح المفاهيمي المعمق
ينطوي التحيز الثقافي في الاختبارات على تشويه معرفي ومنهجي يؤثر على ثلاثة مستويات رئيسية: مستوى صياغة البنود (المحتوى)، ومستوى بنية الاختبار والقدرات المقاسة (الصدق العاملي)، ومستوى القرارات المتخذة استناداً إلى نتائج الاختبار (الصدق التنبؤي). إن المشكلة الجوهرية تكمن في الافتراض الخاطئ بعالمية النماذج النفسية التي طُورت في مجتمعات غربية، صناعية، ديمقراطية، غنية، ومتعلمة، وهو ما يُعرف في علم النفس المعاصر بمجتمعات (WEIRD).
على صعيد المحتوى، يتجسد التحيز عندما تفترض أسئلة الاختبار معرفة دلالية أو رمزية لا تتاح بصورة عادلة لجميع المفحوصين. على سبيل المثال، احتواء اختبارات الاستدلال اللفظي على مفردات ترتبط بحياة الطبقة المخملية أو البيئات الحضرية المتقدمة يضع أبناء البيئات الريفية أو الثقافات الفرعية في حرج معرفي لا يرتبط بذكائهم الفطري بل بمخزونهم البيئي التراكمي. كما تتضمن بعض الأسئلة تراكيب لغوية دقيقة تعتمد على إتقان اللهجة المعيارية، مما يعيق أداء المتحدثين بلهجات محلية أو بلغات أم بديلة، فيتحول الاختبار إلى مقياس للكفاءة اللغوية الثقافية بدلاً من كونه مقياساً للاستدلال المنطقي.
على صعيد البنية البنائية، يظهر التحيز عندما لا يقيس المفهوم النفسي نفس السمة عبر مختلف الجماعات الثقافية. فقد تكون سمة مثل «تأكيد الذات» دليلاً على الصحة النفسية والنضج في ثقافة فردانية، بينما تُفسر السلوكيات ذاتها في ثقافة جمعانية على أنها وقاحة أو تمرد على الجماعة. بالتالي، فإن أدوات القياس التي تعامل هذه السلوكيات كمؤشرات معيارية ومطلقة للنمو النفسي تقع في فخ التحيز الثقافي الجوهري، لأنها تفشل في استيعاب التباين في البناء النفسي ذاته عبر السياقات البيئية المختلفة.
أما على صعيد العلاقة بالمحك والتنبؤ، فإن التحيز يبرز عندما تكون المعادلة التنبؤية للاختبار غير متكافئة بين المجموعات. فإذا كان الاختبار يتنبأ بالنجاح الأكاديمي أو الوظيفي للطلاب المنتمين للثقافة السائدة بمعامل ارتباط مرتفع، بينما يعجز عن التنبؤ بدقة بأداء الطلاب من الأقليات، فإن هذا يسمى بالتحيز التنبؤي. هذا الخلل يؤدي عملياً إلى إقصاء أفراد موهوبين وقادرين استناداً إلى درجات اختبار لا تعكس حقيقة إمكاناتهم المستقبلية في بيئة العمل أو التعليم.
5. التطور التاريخي والمعالم البارزة
تعود الجذور الأولى لمشكلة التحيز الثقافي إلى بدايات حركة القياس العقلي في أواخر القرن التاسع عشر وأوائل القرن العشرين مع أبحاث فرانسيس غالتون (Francis Galton) وألفريد بينيه (Alfred Binet). ورغم أن بينيه كان واعياً بحدود اختباره، إلا أن نقله إلى الولايات المتحدة على يد لويس تيرمان (Lewis Terman) وتطوير اختبار «ستانفورد-بينيه» قاد إلى استخدام الاختبارات لتصنيف الجماعات العرقية والمهاجرين دون أدنى مراعاة للفروق اللغوية والثقافية.
شهدت فترة الحرب العالمية الأولى محطة فارقة عبر تطبيق اختباري الجيش «ألفا» و«بيتا» (Army Alpha and Beta) في الولايات المتحدة عام 1917. زعم روبرت يركيز (Robert Yerkes) وزملاؤه حينها أن المهاجرين حديثاً من جنوب وشرق أوروبا والسود يمتلكون أعماراً عقلية متدنية مقارنة بالأمريكيين من أصول أنجلو-سكسونية، متجاهلين تماماً عوائق اللغة والتعليم والألفة مع أدوات التقييم الغربية، مما أسهم في سن قوانين هجرة تمييزية.
في خمسينيات وستينيات القرن العشرين، ومع تصاعد حركات الحقوق المدنية، فجّر علماء النفس نقاشات حادة حول عدالة القياس. قاد عالم النفس الأمريكي روبرت وليامز (Robert Williams) في سبعينيات القرن العشرين حركة نقدية رائدة؛ حيث قام بتطوير اختبار ذكاء خاص بالثقافة الإفريقية الأمريكية أطلق عليه (Black Intelligence Test of Cultural Homogeneity – BITCH-100)، ليثبت تجريبياً أن الأداء في الاختبارات يعتمد على البيئة الثقافية، مبيناً أن البيض يفشلون في اختباره تماماً كما يفشل السود في الاختبارات التقليدية المعدة بواسطة البيض.
توجت هذه المسيرة بالمعارك القضائية الكبرى، مثل قضية «لاري بي ضد رايلز» (Larry P. v. Riles) عام 1979 في كاليفورنيا، حيث قضت المحكمة بحظر استخدام اختبارات الذكاء القياسية لتصنيف الأطفال السود كمعاقين عقلياً نظراً لتحيزها الثقافي. دفع هذا التحول التاريخي الجمعيات المهنية، مثل الجمعية الأمريكية لعلم النفس (APA)، إلى تضمين معايير صارمة للملاءمة الثقافية وتكافؤ القياس في «معايير الاختبارات التربوية والنفسية».
6. الأسس والأطر النظرية
يستند فهم التحيز الثقافي إلى تقاطع نظريات علم النفس القياسي والأنثروبولوجيا النفسية ونظرية المعرفة الاجتماعية. يقف في مقدمة هذه الأطر التمييز المنهجي الذي صاغه كينيث بايك (Kenneth Pike) وطبقه عالم النفس جون بيري (John Berry) بين المقاربة «الإيمية» (Emic) التي تدرس السلوك من داخل الثقافة ووفق معاييرها الخاصة، والمقاربة «الإيتية» (Etic) التي تبحث عن قوانين عالمية مشتركة. يحدث التحيز الثقافي حتماً عندما يُفرض مفهوم «إيمي» مستمد من ثقافة مهيمنة ويُعامل كأنه مبدأ «إيتي» مطلق يسري على كافة الشعوب.
من جانب آخر، تقدم «نظرية التهديد النمطي» (Stereotype Threat) التي طورها كلود ستيل (Claude Steele) وجوشوا أرونسون (Joshua Aronson) إطاراً نفسياً اجتماعياً يوضح كيف يؤثر التحيز في سياق الموقف الاختباري نفسه؛ حيث يؤدي إدراك الفرد لانتمائه إلى جماعة يُنظر إليها مجتمعياً بنظرة دونية في مهارة معينة إلى توليد قلق استنزافي يستهلك موارده المعرفية ويؤدي إلى تدني أدائه الفعلي في الاختبار، بصرف النظر عن قدرته الحقيقية.
أما في علم السيكومتركس المعاصر، فإن الإطار المرجعي الأساسي لضبط التحيز هو «نظرية الاستجابة للمفردة» (Item Response Theory – IRT) ونظرية صدق البناء كما طورها سامويل ميسيك (Samuel Messick). يرى ميسيك أن الصدق ليس مجرد خاصية في الاختبار ذاته، بل هو حكم تقويمي متكامل على معاني الدرجات وتداعيات استخدامها في السياق الاجتماعي؛ ومن ثم فإن أي تباين في وظيفة البنود لا يخدم السمة الأصلية يُعد انتهاكاً لصدق الأداة وعدالتها.
7. الأبعاد، المكونات، والأنماط الفرعية
يتفرع التحيز الثقافي في أدوات التقييم النفسي والتربوي إلى عدة أشكال رئيسية يختص كل منها بمظهر محدد من مظاهر الخلل المنهجي:
- تحيز المحتوى (Content Bias): يحدث عندما تتضمن بنود الاختبار عناصر، ألفاظاً، مواقف، أو صياغات تكون أكثر ألفة وسهولة لأفراد ثقافة معينة دون غيرها، مما يجعل الإجابة الصحيحة مرتبطة بالخبرة الثقافية المسبقة لا بالقدرة المستهدفة.
- تحيز البناء أو المفهوم (Construct Bias): يبرز عندما لا يغطي البناء النفسي المقاس نفس المعنى أو الأبعاد عبر الثقافات المختلفة، أو عندما يختلف مظهر التعبير عن السمة بين بيئة وأخرى، مثل قياس «الذكاء العاطفي» أو «الكفاءة الاجتماعية».
- تحيز الأسلوب أو الطريقة (Method Bias): يتعلق بآلية تطبيق الاختبار وظروفه، مثل درجة ألفة المفحوص بنمط الأسئلة الموضوعية متعددة الخيارات، أو مستوى القلق الناجم عن التعامل مع تقنيات الاختبار الحاسوبية، أو استجابة المفحوصين للمفحوص وفقاً لجنسه أو عرقه.
- تحيز الصدق التنبؤي أو المحكي (Criterion-Related Bias): يقع عندما يتنبأ الاختبار بدرجة أداء أو كفاءة في المستقبل للمجموعة المرجعية بدرجة دقة تختلف جذرياً عن دقته في التنبؤ لأفراد المجموعات الأخرى، مما يؤدي إلى أخطاء في التعيين أو القبول الأكاديمي.
- التحيز اللغوي (Linguistic Bias): يتمثل في استخدام مستويات لغوية معقدة أو تعبيرات اصطلاحية مجازية لا تعكس مستوى ذكاء الفرد بل كفاءته في لغة غير لغته الأم أو لهجة هجينة تختلف عن لهجة التنشئة.
8. أمثلة وحالات توضيحية واقعية
لتوضيح أثر تحيز المحتوى، يمكن النظر في البند الشهير الذي ورد قديماً في بعض اختبارات الذكاء الغربية حول قياس التفكير التناظري: «الكأس بالنسبة للصحن مثل الكوب بالنسبة لـ…»، مع توقع إجابة «الطبق الصغير» (Saucer). في بيئات ثقافية ريفية أو نامية، قد لا تُستخدم هذه الأواني المنزلية معاً، أو قد تُستخدم أكواب مصنوعة من الطين أو المعدن دون صحون، مما يجعل الطالب عاجزاً عن حل التناظر ليس لقصور في قدرته على التفكير المنطقي، بل لعدم احتكاكه بهذه الأشياء في نمط معيشته اليومي.
مثال آخر يتجلى في دراسات الأنثروبولوجيا المعرفية مع قبائل الكبيلي (Kpelle) في ليبيريا؛ عندما طُلب منهم تصنيف مجموعة من الأدوات (مثل سكين، بطاطا، فأس، خضار)، قاموا بتصنيفها وظيفياً (السكين مع البطاطا لأنها تقطعها). وعندما حاول الباحثون تصنيفها بحسب الفئات المجردة التقليدية للاختبارات الغربية (أدوات معاً وأطعمة معاً)، اعتبر أفراد القبيلة أن هذا التصنيف الأخير غبي ولا ينم عن حكمة. غير أن معايير الاختبارات الغربية كانت ستصنف إجابتهم الوظيفية الذكية بأنها أدنى تطوراً عقلياً وفق منظور بياجيه للنمو المعرفي.
وفي سياق التشخيص العيادي، قد يؤدي استخدام اختبار الشخصية متعدد الأوجه (MMPI) بدون تكييف ثقافي إلى نتائج كارثية؛ فالإجابة بنعم على أسئلة حول «سماع أصوات أشخاص لا يراهم الآخرون» أو «الإيمان بأن قوى روحية تؤثر في الجسد» قد تُشخص سريعاً على أنها أعراض ذهانية أو فصامية في نموذج التحليل النفسي الغربي، بينما تُعد في بعض الثقافات الإفريقية أو الشرقية أو المجتمعات المتدينة تجارب روحانية اعتيادية مقبولة تماماً داخل النسيج الجمعي.
9. القياس، التقويم، والكشف الإحصائي
لا يعتمد علم القياس النفسي الحديث على التخمين المجرد لإثبات وجود التحيز الثقافي، بل يوظف ترسانة من الأساليب الإحصائية والسيكومترية المتقدمة لضبط وتحديد البنود المتحيزة:
تُعد تقنية «الأداء التفاضلي للبند» (Differential Item Functioning – DIF) الأسلوب الذهبي في هذا الميدان. تبحث هذه التقنية عما إذا كان المفحوصون من خلفيات ثقافية مختلفة يمتلكون نفس الاحتمالية للإجابة الصحيحة عن بند معين بعد مطابقتهم ومساواتهم في القدرة الكلية الكامنة المقاسة بالاختبار. إذا ظهر أن مجموعة تتفوق على أخرى في بند ما رغم التكافؤ التام في القدرة، فإن هذا البند يُعتبر مصاباً بالأداء التفاضلي، ويخضع للتحليل الكيفي لمعرفة أسباب تحيزه واستبعاده أو تعديله.
تشمل الأساليب الشائعة للكشف عن الأداء التفاضلي اختبار «مانتل-هانزل» (Mantel-Haenszel)، ونماذج الانحدار اللوجستي، ونماذج نظرية الاستجابة للمفردة المتعددة المجموعات. إضافة إلى ذلك، يُستخدم التحليل العاملي التوكيدي متعدد المجموعات (Multigroup CFA) لاختبار ما يُعرف بـ «تكافؤ القياس» (Measurement Invariance) عبر أربعة مستويات متدرجة: التكافؤ الشكلي (Configural)، والتكافؤ المتري (Metric)، والتكافؤ القياسي (Scalar)، وتكافؤ التباين المتبقي (Residual Invariance). يضمن التحقق من هذه المستويات أن الأداة النفسية تقيس المفهوم نفسه وبنفس وحدات القياس عبر مختلف الجماعات الثقافية.
10. التطبيقات والأهمية العملية
تكتسب مسألة تفكيك التحيز الثقافي أهمية مصيرية في الممارسات المؤسسية والمهنية المتعددة:
في القطاع التربوي والتعليمي، تسهم تصفية الاختبارات من التحيزات في الحد من الظلم الواقع على أطفال المهاجرين والأقليات، وتمنع الزج بهم خطأ في فصول التربية الخاصة وصعوبات التعلم، كما تفتح المجال أمامهم للالتحاق ببرامج الموهوبين والمتفوقين التي كانت تعتمد حصراً على اختبارات ذكاء تقليدية مفصلة وفق ثقافة الطبقة السائدة.
في ميدان التوظيف والاختيار المهني، تضمن الاختبارات المتحررة من الثقافة تكافؤ الفرص الوظيفية في الشركات متعددة الجنسيات والمؤسسات العامة؛ حيث يحمي الكشف عن التحيز المؤسسات من الوقوع في ممارسات تمييزية غير مقصودة تخرق معايير العدالة والمساواة، وتضمن استقطاب الكفاءات الحقيقية دون النظر إلى لهجتهم أو خلفيتهم الإثنية.
أما في الميدان الإكلينيكي والعلاجي، فإن تحييد البعد الثقافي يحمي الأطباء والمعالجين النفسيين من التشخيصات الخاطئة الناتجة عن إسقاط مقاييس غير مقننة محلياً، مما يضمن صياغة خطط علاجية وتدخلات سيكولوجية تراعي السياق البيئي والنسق القيمي للمريض ولا تصمه باضطرابات نفسية لا وجود لها في واقعه السلوكي الحقيقي.
11. الأبحاث والأدلة التجريبية المعاصرة
شهدت العقود الأخيرة فيضاً من الدراسات السيكومترية التي تناولت الفروق الثقافية في أدوات القياس. أظهرت أبحاث روبرت ستيرنبرغ (Robert Sternberg) في نظريته للذكاء الناجح أن الذكاء لا يمكن فصله عن السياق الثقافي؛ حيث أجرى دراسات ميدانية في كينيا بينت أن الأطفال الذين يمتلكون معارف عملية هائلة حول الأعشاب الطبية الطبيعية وطرق مكافحة الأمراض الطفيلية (وهو ذكاء تكيّفي حاسم للبقاء) حققوا درجات متدنية في اختبارات الذكاء الأكاديمي الغربية، مما يؤكد أن الاختبارات التقليدية تفشل في التقاط الذكاء الحقيقي المرتبط بالبيئة.
وفي مراجعة شاملة أجراها فونس فان دي فيفر (Fons van de Vijver) المتخصص في علم النفس الثقافي المقارن، وُجد أن غالبية اختبارات الشخصية والذكاء المنقولة والمترجمة بين اللغات دون تكييف دقيق تعاني من تحيز في الطريقة وتحيز في البنود، محذراً من أن الترجمة الحرفية للاختبارات لا تعني بأي حال نقل صلاحيتها السيكومترية. كما أكدت أبحاث جيمس فلين (James Flynn) حول ما يُعرف بـ «تأثير فلين» أن الارتفاع التاريخي في درجات الذكاء عبر الأجيال يعود بالأساس إلى تغيرات بيئية وتعليمية وثقافية وليست وراثية، مما يدحض الادعاءات السابقة التي فسرت فروق الدرجات بين المجموعات العرقية بأنها فروق بيولوجية أصيلة.
12. الاعتبارات الثقافية والعبر-ثقافية المتقدمة
تتطلب العدالة السيكومترية في البيئات المعولمة تبني استراتيجيات صارمة لتكييف الاختبارات عبر الثقافات (Cross-Cultural Test Adaptation)، وفقاً للإرشادات التي طورتها اللجنة الدولية للاختبارات (International Test Commission – ITC). لم يعد مقبولاً الاكتفاء بالترجمة العكسية (Back-Translation) للنصوص، بل لابد من دراسة الملاءمة المفاهيمية؛ فقد يحتاج البند إلى تعديل جذري ليعبر عن نفس الفكرة النفسية بما يلائم البيئة المستهدفة دون تشويه لمعنى السمة.
علاوة على ذلك، يجب الانتباه إلى مفهوم «الاختبارات المتكافئة ثقافياً» أو «المتحررة من أثر الثقافة» (Culture-Fair Tests)، مثل مصفوفات ريفن المتتابعة (Raven’s Progressive Matrices) واختبار كاتل للذكاء المحايد ثقافياً. ورغم أن هذه الأدوات اعتمدت على أشكال ورسومات هندسية مجردة لتقليل الاعتماد على اللغة، إلا أن الأبحاث الحديثة أثبتت أنها لا تخلو كلياً من الأثر الثقافي؛ إذ إن التعامل مع الأشكال البصرية المجردة وسرعة الاستجابة الورقية أو المحوسبة هو بحد ذاته مهارة تتأثر بنمط التعليم المدرسي والألفة مع التكنولوجيا السائدة في البيئات المتطورة.
13. الانتقادات، المناظرات، وحدود المفهوم
رغم الإجماع العلمي العام على خطورة التحيز، فقد ثارت مناظرات فكرية وسيكومترية حادة حول نطاق هذه الظاهرة وأسبابها. قاد آرثر جنسن (Arthur Jensen) في سبعينيات وثمانينيات القرن الماضي تياراً ادعى فيه أن الفروق بين الجماعات العرقية في اختبارات القدرة العامة (العامل العام – g) لا تعود إلى تحيز الاختبار في حد ذاته، مستنداً إلى أن قوة الصدق التنبؤي للاختبار كانت متساوية تقريباً بين البيض والسود في الجامعات الأمريكية، معتبراً أن الخلل يكمن في فروق فعلية في مستوى المهارات الناتجة عن عوامل تراكمية اجتماعية ووراثية وليس عيباً في الميزان القياسي.
في المقابل، رد علماء النفس النقديون والمعرفيون بأن تعريف النجاح والمحكات المستخدمة ذاتها (مثل الدرجات الجامعية أو تقييمات المشرفين) ليست محايدة بل متأثرة بنفس التحيز المنهجي الذي يحكم الاختبارات. كما نشأ جدل آخر حول مدى جدوى محاولة ابتكار اختبار محايد ثقافياً بنسبة مئة في المئة؛ حيث يرى فريق من المنظرين أن الذكاء والسلوك البشري ظواهر منغرسة بالضرورة في نسيج الثقافة، ومن المستحيل تماماً عزل الذكاء البشري عن وعائه الثقافي الذي يتشكل فيه، مما يجعل فكرة «الحياد المطلق» وهماً نظرياً يستحيل تحقيقه عملياً.
14. المصطلحات ذات الصلة والفروق الجوهرية
- التأثير المتباين (Adverse / Disparate Impact): هو اختلاف إحصائي في معدلات نجاح أو اختيار جماعة معينة مقارنة بأخرى في تطبيق عملي، بغض النظر عن سببه؛ فالتحيز هو خلل في أداة القياس، بينما التأثير المتباين هو النتيجة الاجتماعية المترتبة على استخدام الدرجات.
- عدالة الاختبار (Test Fairness): مفهوم اجتماعي وقيمي وأخلاقي أوسع نطاقاً بكثير من التحيز الإحصائي؛ فقد يكون الاختبار خالياً تماماً من التحيز السيكومتري للأداء التفاضلي، ومع ذلك يُعد غير عادل إذا استُخدم في سياق يفتقر لتكافؤ الفرص الأساسية في التعليم.
- الأداء التفاضلي للبند (DIF): هو الإجراء والخاصية الإحصائية المحددة التي تعكس أداءً متفاوتاً في مفردة بعينها بين مجموعتين لهما نفس القدرة، وهو الأداة الإحصائية لاكتشاف التحيز وليست المرادف المفاهيمي الكامل له.
- التلوث البنائي (Construct Irrelevance): دخول متغيرات طفيلية غير مرغوبة في درجات الاختبار (مثل القلق أو اللغة أو الألفة الثقافية) تؤثر سلباً على صدق تمثيل القدرة المستهدفة، ويُعد التحيز الثقافي الصورة الأشهر لهذا التلوث.
15. خلاصة ونتائج رئيسية
يظل التحيز الثقافي في أدوات الاختبار والتقويم عقبة رئيسية أمام تحقيق الموضوعية العلمية والعدالة الاجتماعية في العلوم السلوكية. إن التغلب على هذا الخلل لا ينتهي عند حدود ضبط المعادلات الإحصائية وحذف البنود المتباينة، بل يتطلب إعادة هيكلة جذرية لنماذج القياس النفسي تأخذ بالحسبان التعددية المعرفية والبيئية للإنسان، والابتعاد عن تعميم المعايير الغربية الأحادية كقالب كلي لقياس البشرية جمعاء.
المراجع
- American Educational Research Association, American Psychological Association, & National Council on Measurement in Education. (2014). Standards for educational and psychological testing. American Educational Research Association. https://www.apa.org/science/programs/testing/standards
- Berry, J. W. (1999). Emics and etics: A symbiotic conception. Culture & Psychology, 5(2), 165–171. https://doi.org/10.1177/1354067X9952004
- International Test Commission. (2017). ITC guidelines for translating and adapting tests (second edition). International Journal of Testing, 18(2), 101–134. https://www.intestcom.org/page/16
- Steele, C. M., & Aronson, J. (1995). Stereotype threat and the intellectual test performance of African Americans. Journal of Personality and Social Psychology, 69(5), 797–811. https://doi.org/10.1037/0022-3514.69.5.797
- van de Vijver, F. J., & Tanzer, N. K. (2004). Bias and equivalence in cross-cultural assessment: An overview. European Review of Applied Psychology, 54(2), 119–135. https://doi.org/10.1016/j.erap.2003.12.004