يشكل القياس النفسي حجر الزاوية في فهم البناء الإنساني وتقييم السمات والقدرات والاضطرابات بدقة متناهية، غير أن التحدي الأكبر الذي واجه علماء النفس منذ نشأة هذا العلم تمثل في كيفية قياس الظاهرة النفسية دون تلويث النتائج بعوامل خارجية كأثر الألفة والممارسة أو الرغبة الاجتماعية. هنا تبرز النماذج المتكافئة (Comparable Forms) أو ما يُعرف كلاسيكياً بالنماذج المتوازية (Parallel Forms)، كإحدى أمتن التقنيات المنهجية التي تضمن ثبات النتائج واستقرارها عبر الزمن والسياقات المختلفة. إن استيعاب الأبعاد النظرية والإحصائية لهذه النماذج لا يمثل ترفاً أكاديمياً، بل هو ضرورة حتمية لكل باحث وممارس يسعى إلى بناء اختبارات تتمتع بأعلى درجات المصداقية والموثوقية العلمية.
المفهوم السيكومتري للنماذج المتكافئة والأسس النظرية
تُعرّف النماذج المتكافئة في أدبيات القياس النفسي بأنها صيغتان أو أكثر من أداة تقييم معينة، صُممت كل صيغة منها لتقيس السمة الكامنة (Latent Trait) أو القدرة النفسية المعنية ذاتها، مع استخدام مفردات (بنود) مختلفة تماماً من حيث الصياغة السطحية، ولكنها متطابقة في الخصائص الإحصائية والمعرفية ومجال المحتوى. لا يقتصر التكافؤ هنا على تشابه النمط الظاهري للأسئلة، بل يمتد إلى اشتراط تطابق الخصائص التوزيعية والارتباطية للدرجات الناتجة عن كلا النموذجين عند تطبيقهما على نفس العينة المستهدفة من الأفراد.
تستند هذه المقاربة بصورة وثيقة إلى نظرية القياس التقليدية (Classical Test Theory)، التي تفترض أن الدرجة الملاحظة للشخص على أي اختبار تتكون من شقين أساسيين: الدرجة الحقيقية والخطأ العشوائي غير المنتظم. في ظل هذا الإطار النظري، يُفترض أن النموذجين المتكافئين تماماً يقيسان نفس الدرجة الحقيقية للفرد وبنفس مقدار تباين خطأ القياس، مما يعني أن أي اختلاف يظهر بين درجات الفرد على الصورتين يُعزى بالكامل إلى خطأ القياس العشوائي، وليس إلى اختلاف في بنية الأداة أو السمة المقاسة.
يتدرج التكافؤ السيكومتري في مستويات دقيقة ترسمها النماذج الرياضية، بدءاً من النماذج المتوازية تماماً (Strictly Parallel Models)، مروراً بالنماذج المتكافئة بقيمة تاو (Tau-Equivalent Models)، وانتهاءً بالنماذج المتجانسة أو المشتركة جوهرياً (Congeneric Models). يمثل النموذج المتوازي بدقة الحالة المثالية الأكثر تشدداً، حيث تتساوى أوزان الانحدار لجميع البنود على السمة، وتتساوى أيضاً تباينات الأخطاء؛ في حين تخفف النماذج الأخرى من هذه الشروط الصارمة لتتيح للباحثين مرونة تطبيقية واقعية مع الحفاظ على قدر موثوق من التكافؤ الرياضي والمفاهيمي.
إن إدراك الفروق الجوهرية بين التكافؤ الشكلي (Form Equivalence) والتكافؤ السيكومتري الدقيق يمنع الوقوع في أخطاء شائعة في تقنين المقاييس النفسية، حيث يعتقد البعض خطأً أن مجرد إعادة صياغة الأسئلة أو تغيير ترتيبها كافٍ لإنتاج نموذج متكافئ. الحقيقة المنهجية تؤكد أن التكافؤ عملية بناء سيكومترية معقدة تتطلب ضبطاً دقيقاً لخصائص المفردات من حيث الصعوبة، والتمييز، والارتباط بالدرجة الكلية، والتوزيع التكراري للاستجابات عبر عينات التقنين الواسعة.
الجذور التاريخية والتطور في إطار نظرية القياس
تعود الجذور الأولى لفكرة النماذج المتكافئة إلى بدايات القرن العشرين، وتحديداً مع الجهود الرائدة التي بذلها علماء القياس الأوائل لتجاوز إشكاليات طريقة «إعادة الاختبار» (Test-Retest) لقياس الموثوقية. أدرك الرواد مثل تشارلز سبيرمان وإدوارد ثورندايك أن إعادة تطبيق نفس الاختبار على الأفراد تؤدي حتماً إلى تلوث النتائج بتأثيرات الذاكرة، والتمرس، والملل، مما ينعكس سلباً على دقة تقدير معامل الثبات ويقدم صورة مشوهة عن استقرار السمة النفسية المقاسة عبر الزمن.
شهدت فترة الأربعينيات والخمسينيات من القرن العشرين قفزة نوعية في صياغة النماذج الرياضية الصارمة للتكافؤ، خاصة مع الإسهامات الفذة لعالم السيكومترك هارولد جليكسن (Harold Gulliksen) في كتابه الرائد «نظرية الاختبارات النفسية». وضع جليكسن معايير إحصائية صارمة تتيح اختبار ما إذا كان نموذجان اختباريان متوازيين بالفعل، مستنداً إلى مقارنة المتوسطات الحسابية، والتباينات، والارتباطات البينية، مما نقل مفهوم النماذج البديلة من مجرد ممارسة إجرائية عفوية إلى فرع رياضي قائم بذاته في السيكومترك.
تعزز هذا الاتجاه لاحقاً في الستينيات من خلال الأعمال التأسيسية لكل من فريدريك لورد (Frederic Lord) وميلفين نوفيك (Melvin Novick)، اللذين أعادا صياغة نظرية الاختبار الكلاسيكية بنسق إحصائي وبديهي صارم، واصفين التكافؤ المتوازي باعتباره الفرضية الأكثر مركزية التي تشتق منها معادلات الثبات والخطأ المعياري للقياس. فتح هذا التأسيس الباب واسعاً أمام تطوير اختبارات القدرات العقلية العامة، ومقاييس الشخصية المقننة متعددة الصور التي استُخدمت على نطاق واسع في السياقات التعليمية والعسكرية والمهنية في الولايات المتحدة وأوروبا.
مع الانتقال إلى العصر الرقمي ونشوء نظرية الاستجابة للمفردة (Item Response Theory)، تطور مفهوم النماذج المتكافئة ليتجاوز التكافؤ على مستوى الدرجة الكلية إلى التكافؤ على مستوى دالة معلومات الاختبار (Test Information Function). أتاح هذا التطور النظري إمكانية إنشاء نماذج متكافئة لا حصر لها بصورة آلية من بنوك الأسئلة، مما حرر الباحثين من قيود التصميم اليدوي التقليدي وأسس لمرحلة جديدة من القياس التكيفي المحوسب فائق الدقة والموثوقية.
المعايير الإحصائية والسيكومترية لتحقيق التكافؤ
لا يمكن إطلاق صفة «المتكافئة» على صورتين لاختبار نفسي إلا إذا استوفتا حزمة متكاملة من الشروط الإحصائية الصارمة التي حددتها أدبيات السيكومترك الكلاسيكي والحديث. يتمثل الشرط الأول والأكثر وضوحاً في تساوي المتوسطات الحسابية لدرجات الأفراد على كلا النموذجين عند تطبيقهما على نفس العينة، أو على عينتين متكافئتين تماماً اختيرتا عشوائياً، وهو ما يدل على عدم وجود فارق في السهولة أو الصعوبة الإجمالية بين النموذجين يميل لصالح أحدهما دون الآخر.
يرتبط الشرط الثاني بـ تساوي التباينات والانحرافات المعيارية للدرجات عبر الصورتين؛ إذ إن اختلاف التباين يعني بالضرورة تشتتاً مختلفاً في استجابات الأفراد، مما يشير إلى أن أحد النموذجين قد يفرّق بين مستويات السمة بدقة تختلف عن الآخر، وهو ما يتنافى جوهرياً مع مبدأ التوازي القياسي. تتطلب الفرضية الإحصائية أن تكون المصفوفة التباينية التغايرية متطابقة، لضمان أن المسافات الفاصلة بين قدرات المستجيبين تُقاس بنفس المقياس المتري المعياري عبر كلا النموذجين.
أما الشرط الثالث، فيختص بـ تساوي معاملات الارتباط مع المحكات الخارجية؛ فإذا كان لدينا محك خارجي معروف كالأداء الأكاديمي أو التشخيص الإكلينيكي أو مقياس نفسي مستقل معتمد، فيجب أن يُظهر النموذج الأول نفس قوة واتجاه الارتباط مع هذا المحك كالنموذج الثاني تماماً دون أي فرق دال إحصائياً. يؤكد هذا المعيار أن كلا النموذجين يتمتعان بنفس الصدق التنبؤي والملازم، ولا ينفرد أحدهما بتمثيل أبعاد غير ممثلة في النموذج المقابل.
- تطابق جدول المواصفات (مصفوفة البناء): يجب أن يغطي النموذجان نفس المجالات المعرفية أو السلوكية بنفس النسب المئوية وعدد المفردات لكل بعد فرعي.
- تماثل خصائص المفردات: تناظر قيم معاملات الصعوبة والتمييز لكل بند في النموذج الأول مع بند مقابل له في النموذج الثاني.
- تساوي تباين الخطأ المعياري للقياس (SEM): ضمان أن دقة القياس وهامش الخطأ المحتمل متطابقان عبر مختلف مستويات السمة النفسية المقاسة.
- غياب التحيز التفاضلي للمفردات (DIF): التأكد من أن بنود كلا النموذجين تعمل بنفس الطريقة العادلة عبر المجموعات السكانية والديموغرافية المتنوعة دون تحيز عرقي أو جنسي.
منهجية تصميم وبناء النماذج المتكافئة خطوة بخطوة
تبدأ الرحلة المنهجية لبناء النماذج المتكافئة بوضع مصفوفة المواصفات الدقيقة (Test Blueprint)، وهي بمثابة المخطط المعماري الذي يُفصّل أبعاد السمة النفسية، والعمليات المعرفية المتضمنة، ونسب التمثيل المئوية لكل مكون، وصيغ البنود المستخدمة. يتم إعداد هذا المخطط قبل كتابة أي مفردة اختبارية، ويعمل كمرجع صارم يحظر أي تفاوت في طبيعة الأبعاد التي سيتم تغطيتها في أي من النماذج المصممة، مما يحقق التكافؤ المفهومي والمضموني منذ اللحظة الأولى للإنشاء.
تتمثل الخطوة اللاحقة في كتابة حصيلة ضخمة من المفردات، تزيد عادة بضعفين أو ثلاثة أضعاف عن العدد النهائي المطلوب للنموذجين معاً، ويُشار إلى هذه الحصيلة باسم حوض البنود التجريبي. تخضع هذه المفردات للتحكيم الظاهري والمنطقي من قِبل خبراء في التخصص لفحص صدق المحتوى، والتأكد من وضوح اللغة، وخلو البنود من الغموض والتحيز الثقافي، قبل أن يتم إدخالها في تجارب الاستطلاع والتطبيق الميداني الأولي على عينات تجريبية ممثلة.
عقب التطبيق التجريبي وتفريغ البيانات، تُجرى التحليلات السيكومترية الكلاسيكية والمتقدمة؛ حيث يتم حساب معامل الصعوبة (Difficulty Index) ومعامل التمييز (Discrimination Index) لكل مفردة على حدة، فضلاً عن ملاءمتها لنماذج راش أو اللوجستية ثنائية وثلاثية المعلمات في نظرية الاستجابة للمفردة. بناءً على هذه النتائج، تُقسّم المفردات إلى أزواج متطابقة؛ حيث يُقرن كل بند بآخر يماثله بدقة في الصعوبة والتمييز والبعد الذي يقيسه، ثم يُوزع أفراد كل زوج عشوائياً بين النموذجين (أ) و (ب).
تتوج هذه العملية بمرحلة «المعادلة الاختبارية» (Test Equating)، وهي مجموعة من الإجراءات الإحصائية المتقدمة المصممة لضبط أي اختلافات طفيفة ومتبقية بين الصورتين في ميزان الصعوبة، وتحويل الدرجات الخام إلى درجات معيارية متكافئة بدقة تامة. تضمن هذه الإجراءات، سواء تمت عبر تصميم العينات المتكافئة أو تصميم المفردات المشتركة الرابطة (Anchor Items)، أن حصول الفرد على درجة معيارية معينة في النموذج (أ) يعادل تماماً نفس الدرجة المعيارية في النموذج (ب) بلا أي تمايز.
ثبات الصور المتكافئة: الأهمية والأساليب الحسابية
يُعد معامل ثبات النماذج المتكافئة (Alternate-Form Reliability)، والذي يُطلق عليه أيضاً معامل التكافؤ، من أقوى وأدق مؤشرات الثبات السيكومتري على الإطلاق، نظراً لقدرته الفائقة على عزل أخطاء القياس الناتجة عن عينات المفردات المحددة مقارنة بالأساليب الأخرى كالاتساق الداخلي (كرونباخ ألفا). يُحسب هذا المعامل من خلال تطبيق الصورتين على نفس المجموعة من المفردين، ثم حساب معامل ارتباط بيرسون بين الدرجات الإجمالية التي حصلوا عليها في كلتا الصورتين.
يأخذ تطبيق هذه الطريقة شكلين رئيسيين يخدم كل منهما غرضاً سيكومترياً محدداً؛ الأول هو الثبات المتزامن أو الفوري (Immediate Alternate-Form Reliability)، وفيه يُطبّق النموذجان في نفس الجلسة أو بفاصل زمني وجيز للغاية لا يتعدى بضع دقائق. يركز هذا النوع بصورة أساسية على فحص مدى حساسية المقياس لخطأ عينة المفردات (Item Sampling Error)، مجيباً عن السؤال: هل تتغير درجة المفحوص إذا قمنا فقط بتغيير الأسئلة بأسئلة أخرى مكافئة لها شكلاً وموضوعاً؟
أما الشكل الثاني فهو الثبات المؤجل أو الممتد (Delayed Alternate-Form Reliability)، حيث يفصل بين تطبيق النموذجين فاصل زمني معتبر قد يمتد من بضعة أيام إلى عدة أسابيع. يُطلق على المعامل الناتج في هذه الحالة معامل التكافؤ والاستقرار (Coefficient of Equivalence and Stability)، وهو يجمع بين مزايا ثبات إعادة الاختبار وثبات الصور المتكافئة، مما يجعله المحك الأشد صرامة؛ إذ يفحص استقرار القياس عبر تقلبات الزمن وتغير المفردات في آنٍ واحد، كاشفاً عن أخطاء العينة المفرداتية والتقلبات المؤقتة في استجابة الفرد معاً.
تتميز هذه الطريقة بتفوقها الصريح على طريقة التجزئة النصفية وطريقة إعادة الاختبار؛ فهي تتجنب افتراضات التجزئة الاعتباطية التي تقسم الاختبار الواحد إلى نصفين قد لا يكونان متكافئين تماماً، وتلغي أثر التذكر والاسترجاع الذي يشوه معاملات إعادة الاختبار التقليدية. إن الحصول على معامل تكافؤ مرتفع (يتجاوز عادة 0.85 أو 0.90) يمنح الباحثين ثقة استثنائية في أن الأداة النفسية تقيس المفهوم المقصود باستقلالية تامة عن الصياغات اللفظية أو البنائية المحددة للبنود.
التطبيقات الإكلينيكية والتربوية والمهنية
تتجلى الأهمية الميدانية للنماذج المتكافئة بأوضح صورها في الدراسات التجريبية والإكلينيكية التي تتبنى تصاميم القياس القبلي والبعدي (Pretest-Posttest Designs). عندما يرغب المعالج النفسي في تقييم فاعلية برنامج علاجي لاضطراب القلق أو الاكتئاب، فإن تطبيق نفس مقياس بيك للاكتئاب قبل وبعد العلاج قد يدفع المريض لتكرار إجاباته السابقة بدافع الألفة أو إظهار التحسن المرضي؛ بينما يضمن استخدام نموذج متكافئ قياس التغير الحقيقي في حدة الأعراض دون أي تلوث ناشئ عن ألفة البنود.
في مجال علم النفس العصبي والتقييم المعرفي الإكلينيكي، يُعد توفر النماذج المتكافئة شرطاً حاسماً للمتابعة الدورية للمرضى الذين يعانون من إصابات دماغية رضية، أو السكتات الدماغية، أو التدهور المعرفي المصاحب لمرض الزهايمر. تتيح النماذج المتكافئة لاختبارات الذاكرة والانتباه التنفيذي للأطباء مراقبة مسار التدهور أو التعافي بمرور الشهور بدقة متناهية، مستبعدين تماماً فرضية أن التحسن الطفيف في الدرجات يرجع إلى حفظ المريض لبطاقات الاختبار أو أنماط الاستجابة المطلوبة.
على الصعيد التربوي والاختبارات ذات المخاطر العالية (High-Stakes Testing)، مثل اختبارات القدرات العامة والقبول الجامعي والترخيص المهني، تبرز النماذج المتكافئة كأداة لا غنى عنها لتحقيق النزاهة والعدالة ومكافحة الغش وتسريب الأسئلة. تتيح هذه الاستراتيجية للهيئات التقويمية تطبيق نسخ اختبارية مختلفة للممتحنين الجالسين في نفس القاعة، أو عبر فترات زمنية متعاقبة، مع اليقين التام بأن مستويات الصعوبة والمعايير التقييمية موحدة، مما يحفظ تكافؤ الفرص التنافسية لجميع الطلاب والمتقدمين.
يمتد التطبيق أيضاً إلى ميادين علم النفس الصناعي والتنظيمي، وتحديداً في عمليات استقطاب الكفاءات والتقييم الدوري للموظفين؛ حيث تحتاج المؤسسات الضخمة إلى إعادة تقييم مهارات اتخاذ القرار أو الذكاء العاطفي للمرشحين الذين لم يحالفهم الحظ في المحاولة الأولى ويرغبون في إعادة الاختبار بعد فترة تدريبية. تضمن النماذج البديلة منع استغلال الإلمام السابق بالأسئلة، وتوفر مقياساً عادلاً للكفاءة الواقعية يمنع التضخم المصطنع في درجات التقييم الوظيفي.
التحديات المنهجية والقيود السيكومترية
على الرغم من الرصانة النظرية البالغة للنماذج المتكافئة، إلا أن تطبيقها العملي يواجه عقبات منهجية ولوجستية هائلة تجعل من النادر تحقيق التوازي التام بمفهومه الرياضي الصارم. يكمن التحدي الأول في التكلفة الزمنية والمالية الباهظة؛ إذ يتطلب بناء نموذجين متكافئين كتابة وتحكيم وتجريب ضعف عدد المفردات على الأقل، وما يستتبعه ذلك من جهود مضنية في المعايرة الميدانية، واستقطاب عينات تقنين ضخمة لضبط معاملات التكافؤ الإحصائي بدقة متناهية.
يتمثل التحدي السيكومتري الثاني في صعوبة مطابقة الخصائص الكيفية والارتقائية للبنود؛ فمهما بلغت براعة مطوري الاختبارات في مطابقة معاملات الصعوبة والتمييز العددية، قد تختلف المتغيرات النوعية كالحمولة اللغوية، وسياق الأمثلة المعروضة، والجاذبية النفسية للمفردة، مما يؤدي إلى تنشيط استراتيجيات معرفية مختلفة لدى المفحوص دون قصد من الباحث. هذا التباين الدقيق قد يمس صدق البناء، ويجعل أحد النماذج يقيس أبعاداً ثانوية غير مقصودة بجانب السمة الأصلية.
تتعلق المشكلة المنهجية الثالثة بظاهرة «تأثير الترتيب والتعب» عند التحقق التجريبي من التكافؤ؛ فإذا طُبق النموذجان على نفس العينة في جلسة واحدة، فإن النموذج الذي يُقدم أولاً يستفيد عادة من تركيز المفحوص العالي، بينما يعاني النموذج الثاني من وطأة التعب وتشتت الذهن. لمواجهة هذا التحيز، يلجأ الباحثون إلى تصميم الموازنة التبادلية (Counterbalancing) بتقسيم العينة عشوائياً وتطبيق النماذج بترتيب معكوس، إلا أن هذا الإجراء يزيد من تعقيد الإجراءات الإحصائية وحجم العينة المطلوب.
أخيراً، يؤكد منظرو القياس الحديث أن التمسك باشتراطات التوازي الكلاسيكية المطلقة (تساوي التباينات والأخطاء بالكامل) هو في كثير من الأحيان افتراض خيالي لا يتحقق عملياً في العالم الحقيقي للسمات النفسية المتشابكة. دفع هذا الإدراك علماء السيكومترك إلى تبني مقاربات أكثر واقعية قائمة على نظرية الاستجابة للمفردة، وتصميم النماذج المتكافئة تاوياً، التي تعترف بوجود تفاوتات طفيفة في أخطاء القياس مع المحافظة على تكافؤ التقدير للسمة الأساسية الكامنة.
النماذج المتكافئة في عصر الذكاء الاصطناعي وبنوك الأسئلة
أحدثت الثورة الرقمية المعاصرة تحولاً جذرياً في فلسفة وآليات بناء النماذج المتكافئة، متجاوزة النموذج الثابت التقليدي (النموذج أ والنموذج ب الورقيين) نحو عصر «النماذج المصممة آنياً» عبر بنوك الأسئلة الرقمية الضخمة (Item Banks). تتضمن هذه البنوك آلاف المفردات المعايرة بدقة فائقة وفق نماذج نظرية الاستجابة للمفردة المتطورة، مما يسمح للأنظمة الخوارزمية بتركيب وتوليد نماذج اختبارية متكافئة لا حصر لها بضغطة زر واحدة تلبي نفس منحنى معلومات الاختبار بدقة بالغة.
يقود الذكاء الاصطناعي وتوليد العناصر الآلي (Automated Item Generation – AIG) هذه الثورة السيكومترية الحديثة؛ حيث تُستخدم نماذج لغوية متقدمة لإنشاء قوالب بنود تفاعلية تُنتج مفردات اختبارية ذات صياغات نصية لا نهائية مع ثبات الصعوبة المعرفية المحسوبة مسبقاً. يُغني هذا النهج المبتكر عن سنوات من الكتابة اليدوية والتحكيم التقليدي، ويوفر حلاً جذرياً لمشكلة استهلاك النماذج وتسريب الأسئلة عبر الإنترنت، مؤمناً استدامة التكافؤ القياسي دون استنزاف الموارد البشرية والمالية.
في سياق الاختبارات التكيفية المحوسبة (Computerized Adaptive Testing – CAT)، يأخذ مفهوم التكافؤ بعداً فلسفياً وتقنياً أكثر عمقاً وديناميكية؛ حيث لا يتلقى أي مفحوصين في القاعة نفس مجموعة الأسئلة على الإطلاق، بل تُنتقى البنود لكل فرد تباعاً بناءً على مستوى قدرته الظاهرة من استجاباته السابقة. ورغم اختلاف مجموعات البنود المقدمة لكل ممتحن جذرياً، تظل الدرجات المقدرة متكافئة تماماً ومعيارية في دلالتها، لأن نظام المعايرة يقيس الجميع على نفس المسطرة اللوغاريتمية الكامنة (المعلمة ثيتا)، محققاً جوهر التكافؤ في أسمى صوره الإحصائية الحديثة.
يمهد هذا الاندماج بين القياس النفسي الصارم والذكاء الحاسوبي الطريق نحو جيل جديد من أدوات التقييم الذكية والمستمرة، سواء في تطبيقات الصحة النفسية الرقمية أو منصات التعلم التكيفي؛ حيث يمكن للمتعالج أو المتعلم أن يخضع لتقييم يومي دقيق دون أن يواجه نفس المفردة مرتين، ودون أن يضحي الباحث بمتانة الثبات وحرية المقارنة الإحصائية الطولية عبر الزمن.
خاتمة
تظل النماذج المتكافئة ركناً أساسياً لا غنى عنه في صرح القياس النفسي والتربوي المعاصر، وجسراً يربط بين النظرية الرياضية التجريدية والواقع التطبيقي الحافل بالتحديات الإنسانية والميدانية. من خلال قدرتها الفريدة على التحييد الفعال لأخطاء الذاكرة والممارسة وتوفير قياس نقي ومستقر للسمات النفسية، تمنح هذه النماذج الممارسين السريريين، والباحثين، وصناع القرار في المؤسسات التعليمية والمهنية أرضية صلبة لاتخاذ قرارات تقييمية وتشخيصية مصيرية تحظى بأقصى درجات العدالة والصدق العلمي، متجاوزة حدود الزمان وتبدلات السياق.
المراجع
- أمريتسون، س. إ.، وريز، س. ب. (2000). نظرية الاستجابة للمفردة في القياس النفسي. دار النشر إيرلباوم.
- جليكسن، هـ. (1950). نظرية الاختبارات العقلية. جون وايلي وأولاده.
- كروكر، ل.، وألجينا، ج. (2008). مدخل إلى نظرية القياس التقليدية والحديثة. سينجاج ليرنينج.
- لورد، ف. م.، ونوفيك، م. ر. (1968). النظرية الإحصائية لدرجات الاختبارات النفسية. أديسون-ويسلي.
- كولين، م. ج.، وبرينان، ر. ل. (2014). معادلة الاختبارات وربطها ومواءمتها: الأساليب والممارسات (الطبعة الثالثة). سبرنجر.
- أناستازي، أ.، وأوربينا، س. (1997). التقييم النفسي (الطبعة السابعة). برنتيس هول.
- الجمعية الأمريكية لعلم النفس، والجمعية الأمريكية للبحوث التربوية، والمجلس الوطني للقياس في التعليم. (2014). معايير الاختبارات التربوية والنفسية. الرابطة الأمريكية للبحوث التربوية.