تُعد النظرية الكلاسيكية في القياس النفسي والتربوي حجر الزاوية الذي قامت عليه حركة القياس النفسي المعاصر منذ فجر القرن العشرين؛ إذ قدمت الإطار الرياضي والمفاهيمي الأول لفهم كيفية تحويل السلوك البشري المعقد إلى قيم كمية قابلة للتحليل والمقارنة. لقد أتاحت هذه النظرية للعلماء والممارسين تفكيك استجابات الأفراد عبر عزل الأداء الحقيقي عن التشوهات والشوائب الناجمة عن أخطاء القياس غير المنضبطة، مما أسهم في ضبط جودة الأدوات التشخيصية والاختبارات الأكاديمية والمهنية على مدى أجيال متعاقبة.
النظرية الكلاسيكية في القياس (Classical Test Theory – CTT)
1. التعريف الموجز
تُعرّف النظرية الكلاسيكية في القياس (Classical Test Theory)، وتُختصر بـ CTT وتُعرف أيضاً بنظرية الدرجة الحقيقية، بأنها نموذج إحصائي ونظري في القياس النفسي يفترض أن الدرجة الملاحظة أو الخام التي يحصل عليها الفرد في مقياس ما تتكون من عنصرين خطيين مضافين: الدرجة الحقيقية التي تعكس سمته الفعلية، ونسبة من خطأ القياس العشوائي غير المنتظم.
ينبني هذا النموذج على افتراض جوهري مفاده أن أي إجراء قياسي، مهما بلغ من الدقة والصرامة، يظل مشوباً بقدر من الخطأ غير المرصود الناشئ عن عوامل بيئية أو ذاتية أو فنية تتعلق بأداة القياس ذاتها. ومن ثم، فإن الهدف الأساسي للنظرية لا يقتصر على مجرد رصد الأداء الظاهري، بل يمتد إلى تحديد المدى الإحصائي الذي يقترب فيه هذا الأداء من القيمة الصادقة التي يمتلكها المستجيب، وذلك عبر تقدير معاملات الثبات والخطأ المعياري للقياس.
وتتكامل هذه المنظومة المفاهيمية لتوفير معايير موحدة يمكن من خلالها الحكم على مدى اتساق الأدوات السيكومترية وجودتها، مما يجعلها الإطار المرجعي الأول الذي استندت إليه الغالبية العظمى من الاختبارات النفسية والتربوية العالمية على مدار القرن الماضي، ولا سيما في مجالات الذكاء والشخصية والتحصيل الدراسي والتقييم الوظيفي.
2. التأثيل والاشتقاق اللغوي
تعود جذور مصطلح “النظرية الكلاسيكية في القياس” إلى تضافر مفاهيم لغوية وعلمية متعددة؛ فكلمة “كلاسيكية” مشتقة من اللاتينية (Classicus)، وهي صفة كانت تُطلق على أرقى طبقات المواطنين في روما القديمة، ثم تحولت دلالتها الاصطلاحية للإشارة إلى النماذج التأسيسية الراسخة التي تحظى بالقبول المعياري والاعتراف الشامل عبر الزمن مقارنة بالنماذج الحديثة المستحدثة. وقد دخلت الكلمة حقل القياس النفسي لتمييز هذا النموذج التقليدي التاريخي عن النماذج الأحدث التي ظهرت في النصف الثاني من القرن العشرين، ولا سيما نظرية استجابة المفردة ونظرية التعميم.
أما مصطلح “القياس” في المعجم العربي، فيعود إلى الجذر اللغوي (ق-ي-س)، والذي يحمل معنى تقدير الشيء بمثاله وتسويته به؛ يقال: “قاس الشيء بغيره” أي قدّره على منواله. وفي اللغات الأوروبية، يقابلها مصطلح (Psychometrics) المنحدر من الأصلين الإغريقيين: (Psyche) وتعني النفس أو الروح، و(Metron) وتعني الكيل أو القياس، ليصبح المعنى الحرفي هو قياس العمليات والخصائص النفسية.
وقد سُميت النظرية أيضاً في الأدبيات المبكرة باسم “نموذج الدرجة الحقيقية الكلاسيكي” (Classical True Score Model)، وهو التعبير الذي دشنه رواد القياس لوصف المحاولات الرياضية الهادفة إلى استخلاص الدرجة الصافية الكامنة من بين ثنايا الدرجات الخام الملوثة بالشوائب الإحصائية العشوائية.
3. النطق والصيغة الصرفية والنحوية
تُضبط عبارة “النَّظَرِيَّةُ الكِلَاسِيكِيَّةُ فِي القِيَاسِ النَّفْسِيِّ” في اللغة العربية وفق القواعد النحوية والصرفية المعتمدة؛ حيث تأتي كلمة “النَّظَرِيَّةُ” اسماً منسوباً على وزن “فَعَلِيَّة” وتُعرب هنا مبتدأ أو اسماً مستقلاً، وتتبعها صفة “الكِلَاسِيكِيَّةُ” كاسم منسوب معرّب يوافق موصوفه في التعريف وحركة الإعراب. أما شبه الجملة “فِي القِيَاسِ” فيتألف من حرف الجر واسم مجرور مشتق كمصدر صريح للفعل الرباعي “قَاسَ – يَقِيسُ – قِيَاساً”.
ويشيع استخدام الاختصار الإنجليزي (CTT) بين الباحثين العرب للإشارة السريعة إلى النظرية، ويُنطق حرفياً بحسب الأحرف اللاتينية، بينما تتنوع الصياغات المترجمة في الكتب المتخصصة لتشمل: “النظرية التقليدية للاختبارات”، أو “نظرية الاختبار التقليدي”، أو “نظرية القياس التقليدية”. وتُستخدم العبارة بوصفها مركباً وصفياً يُعامل معاملة المصطلح العلمي الاصطلاحي المفرد في صياغة الأبحاث والأوراق المحكمة.
ومن الناحية الاستعمالية، ترتبط الكلمة دوماً بمتعلقات إحصائية مشتقة من حقل السيكومتريا، مثل: “افتراضات النظرية الكلاسيكية”، و”معامل الثبات وفق النظرية الكلاسيكية”، و”الخطأ المعياري في إطار CTT”، مما يعكس رسوخها النحوي والاصطلاحي في الخطاب الأكاديمي العربي المعاصر.
4. الشرح المفاهيمي المفصل
ترتكز النظرية الكلاسيكية في القياس على نموذج خطي تجميعي بسيط في صياغته الرياضية، لكنه عميق في دلالاته المنطقية؛ حيث يقرر النموذج أن الدرجة الملاحظة التي يحصل عليها الفرد في موقف اختباري معين (ويرمز لها بالرمز X) تمثل محصلة الجمع الحسابي بين مكونين مستقلين: الدرجة الحقيقية (ويرمز لها بالرمز T) وخطأ القياس (ويرمز له بالرمز E). وتُصاغ هذه العلاقة عبر المعادلة الأساسية الشهيرة: X = T + E.
تُعرّف “الدرجة الحقيقية” في إطار هذه النظرية تعريفاً إجرائياً دقيقاً بأنها القيمة المتوقعة إحصائياً للدرجات الملاحظة إذا خضع الفرد للاختبار نفسه عدداً لانهائياً من المرات في ظل ظروف متطابقة تماماً دون أن يتأثر بعوامل التعب أو الألفة أو التعلم. ومن ثم، فإن الدرجة الحقيقية ليست كياناً ميتافيزيقياً ثابتاً ومطلقاً، بل هي متوسط رياضي نظري يمثل الاستقرار السلوكي للسمة المقاسة لدى الفرد عند تنقية النتيجة من التباينات الطارئة.
في المقابل، يمثل “خطأ القياس” ذلك التباين العشوائي غير المتوقع الذي ينجم عن تقلبات لحظية وغير منتظمة، مثل تشتت انتباه المفحوص، أو شعوره بالصداع المؤقت، أو سوء الإضاءة في قاعة الاختبار، أو وجود غموض طفيف في صياغة بعض الفقرات. وتفترض النظرية افتراضاً حاسماً بأن هذه الأخطاء هي أخطاء عشوائية بحتة، مما يعني أن متوسط الأخطاء عبر عدد لانهائي من مرات التطبيق يساوي صفراً، وأن هذه الأخطاء لا ترتبط إطلاقاً بالدرجة الحقيقية للمفحوص، كما أنها لا ترتبط بالأخطاء الناتجة عن قياسات أخرى لنفس الفرد أو لأفراد آخرين.
تتعامل النظرية الكلاسيكية مع الاختبار بوصفه كلاً موحداً؛ حيث تركز تحليلاتها الإحصائية على مجموع الدرجات الكلية بدلاً من تفكيك خصائص الفقرات بمعزل عن العينة المطبقة عليها. وهذا يعني أن المؤشرات السيكومترية المستخرجة في إطار CTT، مثل صعوبة الفقرة وقدرتها التمييزية، تظل خصائص نسبية تعتمد اعتماداً وثيقاً على خصائص عينة الأفراد التي استُخدمت في تقنين الاختبار، وهو أحد المحددات المفاهيمية الجوهرية لهذا النموذج.
وعلاوة على ذلك، توفر النظرية إطاراً تفسيرياً مباشراً لتقسيم التباين الكلي للدرجات الملاحظة في جماعة من الأفراد إلى قسمين متمايزين: تباين حقيقي ينشأ عن الفروق الفردية الفعلية في السمة المقاسة، وتباين خطأ ينشأ عن اضطرابات القياس. ومن هذه القسمة الرياضية ينبثق المفهوم السيكومتري الأبرز وهو “معامل الثبات”، والذي يُعرّف رياضياً بأنه نسبة تباين الدرجة الحقيقية إلى تباين الدرجة الملاحظة الكلية.
5. التطور التاريخي
انبثقت النظرية الكلاسيكية في القياس من رحم الحاجة المتزايدة لتأسيس علم نفس تجريبي يرتكز على الدقة الرياضية، وتعود إرهاصاتها الأولى إلى أواخر القرن التاسع عشر وأوائل القرن العشرين من خلال أعمال عالم النفس والإحصاء البريطاني تشارلز سبيرمان (Charles Spearman). ففي عام 1904، نشر سبيرمان بحثاً تاريخياً بعنوان “إثبات وقياس الارتباط بين صفتين”، قدم فيه أول صياغة رسمية لمفهوم تصحيح الارتباط لأثر التوهين الإحصائي الناتج عن خطأ القياس، واضعاً بذلك اللبنة الأساسية لنموذج الدرجة الحقيقية.
شهدت العقود التالية جهوداً مكثفة من قبل علماء القياس النفسي لتوسيع أركان هذا النموذج، حيث ساهم جورج أودني يول وترومان كيلي في تدقيق المفاهيم الرياضية المرتبطة بخطأ القياس والثبات. وفي عام 1910، نشر سبيرمان وويليام براون بشكل مستقل معادلة تنبؤية فارقة عُرفت لاحقاً باسم “معادلة سبيرمان-براون التنبؤية”، والتي مكنت الباحثين من حساب الأثر الدقيق لزيادة أو تقليص عدد فقرات الاختبار على معامل الثبات الكلي.
بلغت النظرية ذروة تطورها التنظيمي والمنهجي في ثلاثينيات وأربعينيات القرن العشرين، بفضل المساهمات البارزة لكل من كودر وريتشاردسون عام 1937 عبر ابتكارهما صيغ قياس الاتساق الداخلي (KR-20 وKR-21). تلا ذلك العمل المفصلي الذي قدمه لي كرونباخ عام 1951 حين طور معامل “ألفا كرونباخ” (Cronbach’s Alpha)، والذي سرعان ما تحول إلى أكثر المؤشرات الإحصائية استخداماً في العلوم الإنسانية والاجتماعية لتقدير اتساق المقاييس المتعددة التدريج.
أما التتويج الأكاديمي الحاسم للنظرية الكلاسيكية فجاء في عام 1968 بنشر الكتاب المرجعي الخالد لعالمي القياس ميلفين نوفيك وفريدريك لورد بعنوان “النظرية الإحصائية لدرجات الاختبار العقلي” (Statistical Theories of Mental Test Scores). قدم هذا المؤلف الصياغة الرياضية والبديهية المتكاملة للنظرية الكلاسيكية، وصاغ افتراضاتها على هيئة براهين إحصائية محكمة أنهت عقوداً من الضبابية المنهجية، ورسخت مكانة CTT كمعيار ذهبي للقياس السيكومتري في العالم بأسره.
6. الأسس النظرية والافتراضات الجوهرية
تستند النظرية الكلاسيكية في بنائها الصوري إلى مجموعة من المسلمات والافتراضات الرياضية الصارمة، والتي تشكل معاً الهيكل المنطقي الذي يستمد منه النموذج تماسكه وصلاحيته التطبيقية. ولا يمكن لأي باحث استخدام معادلات CTT بثقة دون التسليم المسبق بهذه الفرضيات البديهية، والتي تضمن اتساق الاستنتاجات المشتقة من البيانات التجريبية:
الافتراض الأول هو أن الدرجة الملاحظة تتكون خطياً من الدرجة الحقيقية والخطأ العشوائي (X = T + E). ويعني هذا الافتراض أن العلاقة بين هذه المتغيرات علاقة جمعية بسيطة وخالية من أي معاملات تفاعلية أو أسية معقدة، مما ييسر العمليات الجبرية الخاصة بتقدير التباينات وحساب الارتباطات بين المتغيرات المقاسة.
الافتراض الثاني يقرر أن القيمة المتوقعة أو المتوسط الحسابي لأخطاء القياس عبر مجتمع لانهائي من التطبيقات المتكررة لنفس الفرد أو عبر مجتمع كبير من المفحوصين يساوي صفراً رياضيّاً تاماً؛ أي أن: E(e) = 0. ويفسر هذا الافتراض طبيعة الخطأ بكونه عشوائياً صرفاً؛ فالأخطاء الإيجابية التي تزيد من درجة المفحوص دون وجه حق تتكافأ نظرياً وتلغي الأخطاء السلبية التي تخفض من درجاته في محاولات أخرى.
أما الافتراض الثالث فيتمثل في انعدام الارتباط بين الدرجة الحقيقية ودرجة خطأ القياس عبر المفحوصين؛ أي أن: r(T, E) = 0. وتتجلى أهمية هذا الافتراض في استبعاد أي تحيز منهجي؛ فلا يمكن افتراض أن الأفراد ذوي القدرات العالية أو السمات المرتفعة يتعرضون لأخطاء قياس تزيد أو تقل مقارنة بأولئك الذين يمتلكون قدرات منخفضة؛ فالخطأ يضرب الجميع باحتمالية عشوائية متماثلة ومستقلة تماماً عن مستوى السمة الأصلية.
وينص الافتراض الرابع على أن أخطاء القياس الناتجة عن تطبيق اختبارين مختلفين على نفس المفحوصين غير مرتبطة ببعضها البعض؛ أي أن: r(E1, E2) = 0. ويضمن هذا الافتراض استقلالية المصادر المؤدية إلى الخطأ بين أداة وأخرى أو بين جلسة تطبيق وأخرى، وهو الشرط الرياضي الضروري لاشتقاق معاملات التكافؤ بين الصور المتوازية للاختبارات وتقدير تباين الخطأ المشترك بدقة بالغة.
7. المكونات الرئيسية والأبعاد والأنواع
تتضمن النظرية الكلاسيكية في القياس منظومة متكاملة من العناصر والمفاهيم الإحصائية التي تشكل معاً أدوات الحكم على كفاءة الاختبار، ويمكن حصر هذه المكونات الرئيسية والأبعاد في النقاط الآتية:
- الدرجة الملاحظة (Observed Score – X): هي القيمة الكمية الرقمية التي يسجلها المستجيب بالفعل في الأداة، وتكون متاحة للفحص المباشر، وتتأثر بكل من إمكانات الفرد الحقيقية وعوامل الخطأ العشوائي في بيئة التقييم.
- الدرجة الحقيقية (True Score – T): هي المقدار النظري المجرد الذي يعكس الكفاءة أو السمة الفعلية للمفحوص الخالية تماماً من شوائب القياس، وتمثل القيمة الرياضية المتوقعة للدرجات الملاحظة عبر محاولات غير متناهية.
- خطأ القياس العشوائي (Error Score – E): هو الفرق الرياضي المحض بين الدرجة الملاحظة والدرجة الحقيقية (E = X – T)، وينشأ من التقلبات غير المنضبطة المرتبطة بالمفحوص أو الفاحص أو الأداة أو السياق الميداني.
- معامل الثبات (Reliability Coefficient – rxx): نسبة تباين الدرجة الحقيقية إلى تباين الدرجة الملاحظة الكلية، ويعبر عن مدى خلو المقياس من أخطاء القياس واستقراره الداخلي والخارجي، وتتراوح قيمته نظرياً بين صفر وواحد صحيح.
- الخطأ المعياري للقياس (Standard Error of Measurement – SEM): انحراف معياري لدرجات الخطأ حول الدرجة الحقيقية، ويُستخدم لبناء فترات الثقة الإحصائية (Confidence Intervals) المحيطة بالدرجة الملاحظة لتقدير المدى الذي تقع ضمنه الدرجة الحقيقية للمفحوص.
- صعوبة الفقرة (Item Difficulty – p-value): نسبة المستجيبين الذين أجابوا عن فقرة معينة إجابة صحيحة من بين إجمالي أفراد العينة، وتعتبر مؤشراً كلاسيكياً على مدى سهولة أو صعوبة المفردة الاختبارية.
- تمييز الفقرة (Item Discrimination): قدرة المفردة الاختبارية على التفريق الإحصائي بين الأفراد ذوي المستويات المرتفعة في السمة والأفراد ذوي المستويات المنخفضة، وتُحسب غالباً عبر معامل ارتباط بيرسون أو معامل ارتباط النقطتين ثنائي التسلسل (Point-Biserial).
- نماذج الاختبارات المتكافئة: تنقسم النماذج التي تبحث في شروط التكافؤ بين الاختبارات إلى نماذج كلاسيكية متدرجة:
- الاختبارات المتوازية كلاسيكياً (Parallel Tests): تفترض تطابق الدرجات الحقيقية تماماً وتساوي تباينات أخطاء القياس بين الاختبارين.
- الاختبارات المتكافئة بمقدار ثابت (Tau-Equivalent Tests): تفترض تطابق الدرجات الحقيقية، لكنها تسمح باختلاف طفيف في تباينات أخطاء القياس بين الأداتين.
- الاختبارات المتكافئة خطياً (Congeneric Tests): النموذج الأكثر مرونة؛ حيث يسمح باختلاف وحدات القياس والتباينات مع بقاء الارتباط التام بين الدرجات الحقيقية.
8. أمثلة وحالات تطبيقية وتوضيحية
لتوضيح آليات عمل النظرية الكلاسيكية في القياس بصورة ملموسة، يمكن استعراض حالة طالب جامعي يخضع لاختبار الذكاء العام (IQ). إذا افترضنا أن هذا الطالب حصل على درجة ملاحظة قدرها 115، وكان الخطأ المعياري للقياس المحسوب للاختبار (SEM) يساوي 3 درجات، فوفقاً لمبادئ CTT، يدرك الأخصائي السيكومتري أن درجة 115 ليست هي الدرجة الحقيقية المطلقة للطالب؛ بل يُبنى مجال ثقة بنسبة 95% يمتد تقريباً على مدى انحرافين معياريين حول الدرجة الملاحظة (115 ± 6)، مما يعني أن هناك احتمالاً قدره 95% بأن تقع الدرجة الحقيقية الكامنة للطالب بين 109 و121 درجة.
وتظهر تجليات النظرية في مثال آخر يتعلق باختبارات التحصيل الأكاديمي المقننة؛ فلو تقدمت مجموعة من مائة طالب لاختبار في مادة الرياضيات، وكانت صياغة السؤال العاشر غامضة وتحتمل أكثر من تأويل لغوي، فإن هذا الغموض سيتسبب في توزيع عشوائي للإجابات بين التخمين والخطأ، مما يرفع تباين الخطأ (Var(E)) في درجات ذلك السؤال. ويترتب على ذلك انخفاض مباشر في معامل ثبات الاختبار الإجمالي وتدني معامل تمييز تلك الفقرة، مما يدفع مطوري المقياس إلى تعديلها أو استبعادها عند تطبيق إجراءات تحليل الفقرات المعتمدة في النظرية الكلاسيكية.
أما في قطاع التقييم النفسي الإكلينيكي، فيمكن النظر إلى تطبيق مقياس قائمة بيك للاكتئاب (BDI). إذا طُبق المقياس على مريض مرتين متتاليتين في غضون ساعتين فقط وحصل على 22 درجة في المرة الأولى و26 درجة في الثانية، فإن CTT تفسر هذا التباين البالغ 4 درجات بأنه نتيجة أخطاء قياس عشوائية وظروف مؤقتة ارتبطت بالإجهاد أو تقلب المزاج اللحظي، ولا يعكس بالضرورة تدهوراً حقيقياً في حدة الاكتئاب الكامنة؛ إذ إن الدرجة الحقيقية للمريض تظل كامنة بين هذين التقديرين الملاحظين.
9. القياس والتقييم الإحصائي
تعتمد النظرية الكلاسيكية في تقييم جودة الأدوات القياسية على حزمة من الإجراءات الإحصائية المحكمة التي تهدف إلى تقدير الثبات والخطأ المعياري، فضلاً عن إجراءات تحليل الفقرات التقليدية. ويُعد تقدير معامل الثبات المحور التشغيلي الأهم، والذي يتم عبر طرق متعددة تختلف بحسب طبيعة البيانات ومصادر الخطأ المحتملة المراد رصدها:
الطريقة الأولى هي طريقة “إعادة الاختبار” (Test-Retest Method)، والتي تقيس الاستقرار الزمني للأداة عبر تطبيق الاختبار نفسه على العينة ذاتها بفاصل زمني مناسب، وحساب معامل ارتباط بيرسون بين نتائج التطبيقين. وتكشف هذه الطريقة عن أثر أخطاء القياس الناتجة عن التقلبات الزمنية، إلا أنها تتأثر بشدة بمشكلات التذكر والألفة أو التغيرات النمائية الحقيقية التي قد تطرأ على المفحوصين بين فترتي التطبيق.
الطريقة الثانية هي طريقة “الصور المتكافئة” (Alternate/Parallel Forms)، وتتطلب بناء نسختين مستقلتين ومتقاطعتين من الاختبار تتماثلان في المحتوى ومستويات الصعوبة والخصائص الإحصائية، ثم تطبيقهما على نفس الأفراد لحساب معامل التكافؤ. ورغم قوتها النظرية في ضبط أخطاء أخذ عينات الفقرات، فإنها تواجه صعوبات عملية بالغة في ضمان التكافؤ التام والصارم بين النموذجين في الواقع الميداني.
الطريقة الثالثة والأكثر شيوعاً هي مقاييس “الاتساق الداخلي” (Internal Consistency)، والتي تُقيّم تجانس فقرات الاختبار من خلال تطبيق واحد فقط. ويبرز هنا معامل “ألفا كرونباخ” (Cronbach’s Alpha) كأداة معيارية تعتمد على متوسط الارتباطات بين جميع الفقرات وتبايناتها، إلى جانب أساليب “التجزئة النصفية” (Split-Half) المعدلة عبر معادلة سبيرمان-براون الشهيرة (Spearman-Brown Prophecy Formula) المصاغة لحساب ثبات الاختبار الكلي عند مضاعفة طوله:
r_xx = (k * r) / [1 + (k – 1) * r]
حيث يمثل (k) نسبة التغير في طول الاختبار، ويمثل (r) معامل الارتباط الأصلي بين نصفي الاختبار. ويواكب ذلك استخراج معادلات تحليل الفقرات (Item Analysis) التي تحدد بساطة كل فقرة عبر مؤشر (p) وتمييزها عبر ارتباط المفردة بالمجموع الكلي المعدل (Corrected Item-Total Correlation)، لضمان استبعاد الفقرات التي لا تتسق مع البعد العام المقاس.
10. التطبيقات والأهمية العملية
تحظى النظرية الكلاسيكية بحضور تطبيقي طاغٍ في مختلف فروع القياس السلوكي والمهني؛ ففي السياقات التربوية والتعليمية، تستند غالبية أنظمة الامتحانات المركزية، واختبارات القبول الجامعي الوطنية، واختبارات التحصيل المدرسي الدورية إلى نماذج CTT في تحديد درجات الطلاب ومستويات اجتيازهم، وتصميم بنود الاختبارات المتوازنة من حيث الصعوبة والقدرة التمييزية.
وفي حقل القياس التنظيمي وإدارة الموارد البشرية، تعتمد الشركات الكبرى ومؤسسات التوظيف على اختبارات الكفاءة والسمات الشخصية المبنية وفقاً للنظرية الكلاسيكية لتصفية المرشحين والمفاضلة بينهم في مسابقات التعيين والترقية. ويتيح حساب الخطأ المعياري للقياس لمسؤولي التوظيف تجنب اتخاذ قرارات حاسمة بناءً على فروق طفيفة بين درجات المتقدمين قد تكون ناتجة عن أخطاء القياس العشوائية لا عن فروق كفاءة حقيقية.
أما في الطب النفسي والإرشاد السلوكي، فإن تقنين أدوات التشخيص السريري، كبطاريات الشخصية ومقاييس القلق والخرف والتوحد، يستند إلى صرامة ثبات CTT للتأكد من أن الأداة قادرة على تقديم نتائج مستقرة يُعتمد عليها في اتخاذ قرارات مصيرية مثل إدخال المرضى للمصحات، أو تحديد جرعات الدواء، أو تقييم الأهلية الجنائية والمسؤولية القانونية للأفراد أمام المحاكم والدوائر العدلية.
11. البحوث والأدلة التجريبية
تزخر أدبيات القياس النفسي بآلاف الدراسات التجريبية والميتا-تحليلية التي تناولت تطبيقات النظرية الكلاسيكية وأثبتت متانتها الإحصائية في شروط محددة. ففي دراسة كلاسيكية شاملة قادها كورتيز وسنيبيلز (Cortina, 1993) منشورة في “Journal of Applied Psychology”، فُككت الاستخدامات الخاطئة والتفسيرات القاصرة لمعامل ألفا كرونباخ، حيث أظهر الباحث تجريبياً كيف يتأثر معامل الثبات بشكل كبير بعدد فقرات المقياس وبنية العوامل الكامنة، محذراً من اعتباره دليلاً مطلقاً على أحادية البعد (Unidimensionality).
وفي سياق مقارن واسع، أجرى كل من فان دير ليندن وهامبلتون دراسات إمبريقية موسعة لمقارنة مخرجات CTT مع نظيراتها المشتقة من نظرية استجابة المفردة (Item Response Theory – IRT)، وأظهرت النتائج أن التحليلات الكلاسيكية توفر تقديرات مكافئة تماماً وذات كفاءة إحصائية متطابقة لنماذج IRT المتقدمة حينما تكون أحجام العينات متوسطة، وعندما تتوزع صعوبة الفقرات بشكل متماثل حول منتصف منحنى القدرة، مما يثبت الجدوى الاقتصادية والميدانية للاستمرار في توظيف CTT في التطبيقات اليومية.
كما بينت الدراسات الطولية التي فحصت استقرار مقاييس الشخصية الكبرى (مثل مقياس العوامل الخمسة الكبرى للشخصية لـ Costa & McCrae) أن مؤشرات الثبات المبنية على CTT قد برهنت على اتساق مذهل عبر عقود من التطبيق في مختلف المجتمعات، مما قدم برهاناً سيكومترياً لا جدال فيه على قدرة هذه النظرية على نمذجة الفروق الفردية المستقرة لدى البشر بصلابة علمية بالغة.
12. الاعتبارات الثقافية وعبر الثقافات
تفرض التطبيقات الثقافية المتقاطعة للاختبارات المبنية وفق النظرية الكلاسيكية تحديات سيكومترية معقدة؛ فالافتراض الأساسي بأن أخطاء القياس عشوائية بحتة قد يتعرض للانهيار حين تُترجم أداة من سياق غربي إلى سياق عربي أو شرقي دون مراعاة لحمولات المفردات؛ إذ قد يتحول الخطأ إلى “خطأ منهجي متحيز” (Systematic Error) بسبب سوء فهم بعض العبارات أو اختلاف الدلالات الدلالية والتعبيرية عبر الثقافات.
وعلاوة على ذلك، فإن اعتماد CTT الصارم على العينة يعني أن معاملات الصعوبة والتمييز المستخرجة في ثقافة معينة تفقد قيمتها المعيارية بمجرد نقل الأداة إلى بيئة أخرى، مما يحتم إعادة تقنين المقاييس واستخراج معاملات ثبات وصدق محلية خاصة بكل مجتمع. وقد لا تتناسب مؤشرات الاتساق الداخلي المستخرجة في المجتمعات الفردانية مع أساليب الاستجابة في المجتمعات الجمعية التي يميل فيها الأفراد إلى إجابات المرغوبية الاجتماعية (Social Desirability)، مما يؤثر على تباين الخطأ ويشوه تقديرات الدرجة الحقيقية.
وتستلزم المقارنات عبر الثقافية التأكد من “تكافؤ القياس” (Measurement Invariance)؛ حيث ينبغي للباحثين استخدام أساليب تحليل التباين والتحليل العاملي التوكيدي للتثبت من أن البنية المفاهيمية للاختبار لا تختلف نوعياً أو كمياً باختلاف العوامل الإثنية أو اللغوية، لضمان ألا تُعزى الفروق المرصودة إلى قصور في الأداة بدلاً من أن تكون فروقاً حقيقية في السمة المستهدفة.
13. الانتقادات والجدل والحدود المنهجية
على الرغم من النجاح التاريخي والانتشار الواسع للنظرية الكلاسيكية، إلا أنها تعرضت لانتقادات جذرية من قبل علماء القياس المعاصرين، وتمحورت هذه الاعتراضات حول القيود البنيوية التي تحد من دقتها في المواقف المتقدمة، ويمكن تفصيل أبرز هذه الانتقادات فيما يلي:
العيب الأكبر في النظرية الكلاسيكية هو “اعتمادية المعالم على العينة” (Sample-Dependence) و”اعتمادية الدرجة على الاختبار” (Test-Dependence). فخصائص الفقرات (مؤشرات الصعوبة والتمييز) تتغير بتغير مستوى عينة الأفراد المطبقة عليهم؛ إذ تبدو الفقرات سهلة عند تطبيقها على عينة مرتفعة القدرة وتبدو صعبة على عينة منخفضة القدرة. وبالمثل، فإن تقدير قدرة الفرد يعتمد تماماً على سهولة أو صعوبة الاختبار ككل، مما يفقد CTT خاصية المعايرة المطلقة ويجعل مقارنة أفراد خضعوا لاختبارات مختلفة أمراً مستحيلاً رياضياً دون موازاة معقدة.
الانتقاد الثاني يتعلق بافتراض ثبات الخطأ المعياري للقياس (SEM) عبر جميع مستويات القدرة. تفترض CTT رقماً موحداً للخطأ المعياري ينطبق على سائر درجات المفحوصين، في حين أثبتت الدراسات التجريبية الحديثة أن القياس يكون أكثر دقة في مستويات القدرة المتوسطة التي تتوافق مع صعوبة غالبية الفقرات، بينما يزداد خطأ القياس بصورة دراماتيكية عند الأطراف العليا والدنيا (المتفوقين وضعاف القدرة جداً)، وهو ما تعجز النظرية الكلاسيكية عن نمذجته بدقة مقارنة بما تقدمه دوال المعلومات في نظرية استجابة المفردة.
يضاف إلى ذلك أن افتراض نموذج الدرجة الحقيقية بأن الخطأ غير مرتبط بالدرجة الحقيقية يواجه إشكالات حقيقية عند أطراف المقاييس، مثل تأثيرات السقف والقاع (Ceiling and Floor Effects)؛ حيث يضيق تباين الخطأ قسرياً عند الأفراد الذين يحصلون على الدرجة النهائية أو أدنى درجة ممكنة. كما أن عجز CTT عن التمييز الدقيق بين أبعاد المقياس المتعددة يجعلها في كثير من الأحيان تفترض أحادية البعد ضمناً دون توفير أدوات رياضية مدمجة للتأكد الصارم من هذا الافتراض.
14. المصطلحات ذات الصلة والفروق الدقيقة
تتقاطع النظرية الكلاسيكية في القياس مع عدة نماذج ومصطلحات سيكومترية أساسية في الحقل العلمي، وتوضح النقاط التالية الفروق الدقيقة بينها:
- النظرية الكلاسيكية مقابل نظرية استجابة المفردة (Item Response Theory – IRT): تركز CTT على الدرجة الكلية للاختبار وتتسم خصائصها باعتماديتها على العينة، في حين تنمذج IRT احتمالية استجابة الفرد لكل مفردة مستقلة كدالة رياضية غير خطية لقدرته الكامنة، وتوفر معالم للمفردات مستقلة تماماً عن العينة المختبرة.
- النظرية الكلاسيكية مقابل نظرية التعميم (Generalizability Theory – G-Theory): تعتبر نظرية التعميم امتداداً تحليلياً متقدماً لـ CTT؛ فبينما تدمج CTT جميع مصادر الاضطراب في مكوّن خطأ عشوائي واحد مبهم (E)، تستخدم نظرية التعميم أسلوب تحليل التباين (ANOVA) لعزل وتفكيك مصادر الخطأ المتعددة بدقة (مثل أثر الفاحصين، والمناسبات الزمنية، وأشكال الأسئلة).
- الدرجة الحقيقية (True Score) مقابل القدرة الكامنة (Latent Trait – Theta): الدرجة الحقيقية في CTT تعتمد كلياً على مقياس الاختبار المعين ومحددة بمداه المتري، بينما تعبر القدرة الكامنة (Theta) في النماذج الحديثة عن سمة مستمرة مجردة غير مرتبطة بمقياس درجات محدد وتمتد عادة من سالب لا نهاية إلى موجب لا نهاية إحصائياً.
- الثبات (Reliability) مقابل الصدق (Validity): يعبر الثبات في إطار CTT عن الاتساق الداخلي والدقة الرياضية وتكرارية النتيجة ونسبة التباين الحقيقي، بينما يمثل الصدق التحقق النظري من أن الأداة تقيس بالفعل المفهوم النفسي المستهدف الذي وُضعت لأجله ولا تقيس سمة أخرى بديلة.
15. الخلاصة والنتائج الجوهرية
تظل النظرية الكلاسيكية في القياس (CTT) الإنجاز التاريخي والمنهجي الأكثر تأثيراً في مسار تطور القياس النفسي والتربوي؛ فرغم بساطة معادلتها المركزية (الدرجة الملاحظة = الدرجة الحقيقية + الخطأ)، استطاعت هذه النظرية أن تمد العلوم الإنسانية بإطار رياضي صارم نقل التقييم النفسي من نطاق التخمينات الذاتية إلى آفاق الموضوعية العلمية والتكميم الإحصائي الدقيق.
وعلى الرغم من القيود المنهجية البارزة التي كشفت عنها الأبحاث الحديثة، ولا سيما اعتماد معالمها على خصائص العينات، وافتراضها لخطأ معياري موحد لكافة المستويات، تظل CTT الخيار الميداني الأكثر جاذبية وتطبيقاً لدى الباحثين والممارسين نظراً لسهولة حساباتها الإحصائية، ومنطقها الحدسي المباشر، وعدم حاجتها لعينات فائقة الضخامة كما تتطلب نماذج السمة الكامنة الأكثر تعقيداً.
إن استيعاب النظرية الكلاسيكية وافتراضاتها الجوهرية يمثل الأساس الإلزامي لفهم أصول القياس السيكومتري الحديث، وتظل أدواتها ومؤشراتها مثل ألفا كرونباخ والخطأ المعياري للقياس حراس الجودة الموثوقين لآلاف الأدوات والاختبارات التي تحكم قرارات التعليم والتشخيص الطبي والمهني في مختلف أنحاء العالم حتى يومنا هذا.
المراجع
- Crocker, L., & Algina, J. (1986). Introduction to classical and modern test theory. Holt, Rinehart and Winston.
- Cronbach, L. J. (1951). Coefficient alpha and the internal structure of tests. Psychometrika, 16(3), 297–334. https://doi.org/10.1007/BF02310555
- Lord, F. M., & Novick, M. R. (1968). Statistical theories of mental test scores. Addison-Wesley.
- Nunnally, J. C., & Bernstein, I. H. (1994). Psychometric theory (3rd ed.). McGraw-Hill.
- Spearman, C. (1904). The proof and measurement of association between two things. The American Journal of Psychology, 15(1), 72–101. https://doi.org/10.2307/1412159