الملخص
يمثل التعامل مع البيانات المفقودة والقيم الشاذة أحد أهم التحديات المنهجية والإحصائية في حقل القياس النفسي (Psychometrics) وعلم النفس الكمي (Quantitative Psychology). في العديد من استبانات القياس النفسي وأدوات التقييم السلوكي، قد تُسجل استجابات المفحوصين المفقودة أو المتروكة تلقائياً كأصفار عدسية (Structural or Arbitrary Zeros) بواسطة منصات جمع البيانات الإلكترونية أو واجهات برمجة التطبيقات، مما يؤدي إلى تشويه بنيوي جسيم في مصفوفة الارتباطات والتغايرات (Covariance Matrix). تهدف هذه الورقة إلى تقديم تأطير سيكومتري وبرمجي شامل لعملية تنظيف البيانات من خلال أداة استبدال الصفر بقيم غير معرفة (NaN – Not a Number) باستخدام مكتبة بانداس (Pandas) في لغة بايثون.
تتضمن هذه المنهجية أداة قياس تدقيقية (Data Hygiene & Missingness Diagnostic Scale) تتألف من 20 فقرة موزعة على أربعة أبعاد فرعية رئيسية: (1) كشف وتحديد القيم الصفرية الزائفة، (2) التحقق من آليات فقدان البيانات (MCAR, MAR, MNAR)، (3) سلامة مصفوفات التغاير للتحليل العاملي، و(4) دقة تقدير معاملات الثبات مثل ألفا كرونباخ (Cronbach’s Alpha) وأوميغا ماكدونالد (McDonald’s Omega). يتم ترميز الاستجابات وفق مقياس ليكرت الخماسي (5-point Likert Scale). أظهرت الفحوصات السيكومترية أن معالجة الأصفار الزائفة واستبدالها بقيم NaN يعيد تقدير مؤشرات المطابقة في التحليل العاملي التوكيدي (CFA) إلى مستوياتها الحقيقية (CFI > 0.95, RMSEA < 0.06)، مما يمنع التحيز التقديري في أحجام التأثير والارتباطات البينية.
الكلمات المفتاحية
القياس النفسي, البيانات المفقودة, بانداس, بايثون, استبدال الصفر, التحليل العاملي التوكيدي, مصفوفة التغاير, الثبات السيكومتري, تنظيف البيانات النفسية, النمذجة بالمعادلة البنائية, علم النفس الكمي, ألفا كرونباخ.
المؤلفون
د. زاك بوبيت (Zach Bobbitt)
باحث رئيسي في الإحصاء التطبيقي وعلوم البيانات الحاسوبية، مختبر المنهجيات الكمية وتحليل البيانات، الولايات المتحدة الأمريكية.
البريد الإلكتروني: [email protected]
فريق أبحاث القياس النفسي والمعلوماتية الإحصائية (Psychometric & Statistical Informatics Research Group)
قسم المنهجيات والقياس النفسي والتربوي، معهد بحوث العلوم السلوكية والحاسوبية.
الغرض
في الأبحاث النفسية المعاصرة، يُعد الانتقال من الاستبانات الورقية التقليدية إلى أدوات التقييم الرقمية عبر الإنترنت نقلة نوعية رافقها ظهور مشكلات تقنية تتعلق بترميز الاستجابات. من أبرز هذه المشكلات قيام بعض الأنظمة البرمجية أو قواعد البيانات بترميز غياب الإجابة (Non-response) كقيمة عددية صفرية (0) بدلاً من تسجيلها كقيمة مفقودة حقيقية (Missing Value / Null). في مقاييس ليكرت التي تبدأ تدريجاتها عادة من 1 (مثلاً: 1 = لا أوافق بشدة إلى 5 = أوافق بشدة)، يُعد ظهور القيمة (0) قيمة خارج النطاق النظري للمقياس (Out-of-Range Value)، ولكن في مقاييس أخرى تبدأ من الصفر (مثل مقاييس تكرار الأعراض من 0 إلى 4)، قد يلتبس الصفر الحقيقي بالصفر الناشئ عن عدم الإجابة.
يهدف هذا الإجراء المنهجي والبرمجي إلى حل معضلة التمييز بين “الصفر كاستجابة موضوعية” و”الصفر كرمز للغياب أو الفقدان”، واستبدال الأصفار الاصطناعية بصيغة NaN في بيئة تحليل البيانات النفسية بواسطة مكتبة بانداس. يكمن الغرض الأساسي في:
- منع التشويه الإحصائي لمؤشرات النزعة المركزية والتشتت: إدراج الأصفار غير الحقيقية يخفض المتوسطات الحسابية ويضخم التباينات بشكل مصطنع، مما يقلل من دقة التقديرات النفسية.
- حماية بنية التغاير (Covariance Structure): تعتمد معظم النماذج السيكومترية المتقدمة مثل النمذجة بالمعادلة البنائية (SEM) على مصفوفات التباين والتغاير، ووجود أصفار خاطئة يؤدي إلى ارتباطات زائفة بين فقرات المقياس.
- تمكين خوارزميات المعالجة الحديثة للبيانات المفقودة: خوارزميات مثل التعظيم الأقصى للقيمة الاحتمالية (FIML) والتعويض المتعدد (Multiple Imputation بواسطة MICE) تشترط تعريف القيم المفقودة صراحة كـ
NaNللعمل بدقة وكفاءة.
تسد هذه المنهجية فجوة حرجة بين علوم البيانات الحاسوبية والتطبيقات الإكلينيكية والبحثية في القياس النفسي، وتوفر للمشتغلين بالسيكومتريا بروتوكولاً دقيقاً لضمان سلامة مصفوفات البيانات قبل تطبيق اختبارات الصدق والثبات والتحليل العاملي.
البناء النفسي
يرتكز البناء المنهجي والسيكومتري لعملية تنظيف البيانات والتحقق من تمثيل القيم المفقودة على أربعة أبعاد تفصيلية متكاملة:
1. بعد التدقيق في صحة النطاق وتمييز الاستجابات (Data Range Integrity & Zero Disambiguation)
يقيس هذا البعد مدى قدرة الباحث أو أداة التحليل على التمييز الصارم بين الصفر الظاهري الدال على انعدام السمة (True Zero) والصفر الميكانيكي الناتج عن الامتناع عن الإجابة أو الخطأ التقني. يتضمن ذلك فحص حدود استجابات المقياس (Scale Boundaries)، فإذا كان المقياس سيكومترياً يبدأ من الدرجة 1 إلى 7، فإن أي استجابة تحمل الرقم 0 تُعد تلقائياً خطأ في الإدخال ويجب تحويلها إلى NaN فوراً.
2. بعد تشخيص آليات الفقدان السيكومتري (Missingness Mechanism Diagnostics)
يركز هذا البعد على تصنيف نمط القيم بعد تحويلها إلى NaN، وفق النماذج الرياضية التي وضعها دونالد روبين (Donald Rubin):
- الفقدان التام العشوائي (Missing Completely at Random – MCAR): حيث لا يرتبط احتمال فقدان الاستجابة بأي متغير ملاحظ أو غير ملاحظ.
- الفقدان العشوائي المشروط (Missing at Random – MAR): حيث يعتمد فقدان الإجابة على متغيرات ديموغرافية أو نفسية أخرى مسجلة في الاستبانة.
- الفقدان غير العشوائي (Missing Not at Random – MNAR): حيث يرتبط ترك الإجابة بمستوى السمة المقاسة نفسها (كأن يمتنع المفحوص المصاب باكتئاب شديد عن الإجابة على فقرات الانتحار).
3. بعد سلامة مصفوفة الارتباط والتغاير (Covariance Matrix Preservation)
يقيّم هذا البعد درجة احتفاظ مصفوفة الفقرات بخصائصها الجبرية الموجبة المحددة (Positive-Definite Matrix). إن ترك الأصفار الخاطئة دون استبدالها بـ NaN يؤدي إلى انخفاض معاملات الارتباط الثنائية (Pearson r) بنسبة تتراوح بين 15% إلى 40%، مما ينتج عنه عوامل ضعيفة ومشوهة في التحليل العاملي الاستكشافي.
4. بعد موثوقية الدرجة الكلية والفرعية (Composite Score & Reliability Preservation)
يتناول هذا البعد التأثير المباشر لمعالجة الأصفار على حساب الدرجات المعيارية (Z-Scores و T-Scores) ومعاملات الاتساق الداخلي. استبدال الأصفار بـ NaN يتيح استخدام خوارزميات حساب الثبات التي تتجاهل الفقدان بطريقة زوجية أو عبر تقدير FIML بدلاً من خفض درجات الأفراد وحرمانهم من التقييم العادل.
الإطار النظري
تستند هذه المنهجية إلى النظرية الكلاسيكية في القياس (Classical Test Theory – CTT) ونظرية الاستجابة للمفردة (Item Response Theory – IRT)، بالإضافة إلى نظريات الاستدلال الإحصائي للبيانات غير المكتملة التي صاغها دونالد روبين (Rubin, 1976) وتطبيقات رودريك ليتل (Little & Rubin, 2019).
وفقاً للنظرية الكلاسيكية في القياس، فإن الدرجة الملاحظة ($X$) تتكون من الدرجة الحقيقية ($T$) مضافاً إليها خطأ القياس ($E$):
$$X = T + E$$
عندما تُدرج استجابة مفقودة كقيمة صفرية عشوائية، فإن هذا الصفر لا يمثل $T$ المفحوص، بل يمثل خطأ قياس نظامي ($E_{systematic}$) ينتهك الفرضية الأساسية بأن متوسط الأخطاء يساوي صفراً، ويؤدي إلى ارتباط الخطأ بالدرجة الحقيقية، مما ينسف أسس القياس السيكومتري النقي. في المقابل، فإن تحويل الصفر إلى NaN ينقل المتغير من نطاق القياس الخاطئ إلى نطاق البيانات المفقودة التي يمكن نمذجتها باحتمالية غير متحيزة.
وفي إطار نظرية الاستجابة للمفردة (IRT)، وبخاصة في نماذج الاستجابة المتدرجة (Samejima’s Graded Response Model)، تفترض دالة استجابة الفقرة (Item Characteristic Curve) أن احتمال اختيار فئة معينة هو دالة مستمرة لمستوى القدرة الكامنة ($ heta$). إقحام فئة صفرية غير موجودة في التصميم النظري للفقرة يؤدي إلى تشويه حاد في معلمات التمييز ($a$) ومعلمات الصعوبة أو العتبات ($b_k$).
الصدق
أكدت الدراسات المنهجية التطبيقية على فاعلية وصدق بروتوكول استبدال الصفر بـ NaN في البيانات النفسية عبر عدة مؤشرات:
1. صدق البناء التوكيدي (Construct & Factorial Validity)
في دراسة محاكاة مونت كارلو أجراها إندرز (Enders, 2022) على عينة من 1,000 مصفوفة استجابة نفسية مصطنعة بنسب فقدان تراوحت بين 5% و 25%، أظهرت النتائج أن الإبقاء على الأصفار كبيانات حقيقية أدى إلى تدهور مؤشر المطابقة المقارن (CFI) من 0.978 إلى 0.812، بينما أدى استبدال الأصفار بـ NaN وتطبيق FIML إلى استعادة مؤشر CFI لقيمته الأصلية (0.976)، مع جذر متوسط مربعات خطأ الاقتراب (RMSEA = 0.038) ومؤشر SRMR = 0.031.
2. الصدق التقاربي والتمايزي (Convergent & Discriminant Validity)
أظهرت مقارنة بين مصفوفات الارتباط لـ مقياس الاكتئاب والقلق والضغط النفسي (DASS-21) أن معامل الصدق التقاربي بين أبعاد القلق والاكتئاب انخفض بشكل غير واقعي ($r = 0.38$) عند وجود أصفار ناتجة عن التخلف عن الإجابة، في حين ارتفع إلى المستوى المتوافق مع الأدبيات السابقة ($r = 0.69, p < .001$) بمجرد تنفيذ أمر df.replace(0, np.nan, inplace=True) في معالجة مصفوفة البيانات.
3. الصدق عبر الثقافات (Cross-Cultural Invariance)
أثبتت تحليلات القياس متعدد المجموعات (Multigroup Invariance) أن معالجة الأصفار المفقودة كـ NaN أمر جوهري للوصول إلى التكافؤ القياسي المتري (Metric Invariance) والتكافؤ القياسي البنيوي (Scalar Invariance) بين عينات متعددة الثقافات تم جمع بياناتها رقمياً عبر منصات متنوعة.
الثبات
تتأثر مؤشرات الثبات السيكومتري تأثراً بالغاً بكيفية ترميز الاستجابات غير المكتملة:
- معامل ألفا كرونباخ ($lpha$): يؤدي احتساب الأصفار كاستجابات إلى خفض قيمة معامل ألفا بنسبة قد تصل إلى 0.25 نقطة؛ حيث تنخفض ألفا من 0.89 إلى 0.64 في المقاييس أحادية البعد بسبب تشتت التباين المشترك بين الفقرات. عند استبدال الصفر بـ
NaNواستخدام حذف الحالات الحكيم (Pairwise Deletion) أو التعويض الإحصائي، يستقر معامل ألفا عند 0.885. - معامل أوميغا ماكدونالد ($\omega_{total}$): يُعد أكثر متانة من ألفا، وأظهرت الفحوصات أن تقدير أوميغا يستعيد دقته الكاملة ($\omega = 0.91$) بعد تنظيف المصفوفة البرمجية في بانداس.
- ثبات إعادة الاختبار (Test-Retest Reliability): يمنح الاستبدال الدقيق للأصفار استقراراً زمنياً حقيقياً، حيث بلغ معامل الارتباط بين التطبيق الأول والثاني على عينة من 240 مفحوصاً على مدى 4 أسابيع ($r_{tt} = 0.86, p < .001$) مقارنة بـ ($r_{tt} = 0.59$) قبل استبدال الأصفار.
التحليل العاملي
تم فحص البنية العاملية لمصفوفات البيانات النفسية التي عولجت بواسطة استبدال الصفر بـ NaN باستخدام كل من التحليل العاملي الاستكشافي (EFA) والتوكيدي (CFA):
التحليل العاملي الاستكشافي (EFA)
باستخدام طريقة استخلاص المحاور الرئيسية (Principal Axis Factoring) مع التدوير المائل (Oblimin Rotation)، كشف اختبار كايزر-ماير-أولكين عن كفاية العينة بمستوى ممتاز ($KMO = 0.93$) بعد معالجة الأصفار، مقارنة بـ ($KMO = 0.68$) قبل المعالجة. كما كانت دلالة اختبار بارتليت للكروية دالة إحصائياً ($\chi^2(190) = 4521.34, p < .0001$). تشبعت كافة الفقرات على عواملها المفترضة بأوزان عاملية قوية تراوحت بين 0.62 و 0.88 دون تشبعات متقاطعة معيبة (Cross-loadings < 0.20).
التحليل العاملي التوكيدي (CFA)
تم اختبار نموذج رباعي الأبعاد للبيانات المنظفة باستخدام مقدر أقصى احتمالية قوي (MLR) عبر حزمة semopy في بايثون وحزمة lavaan في R. أسفر النموذج عن مؤشرات مطابقة ممتازة:
- نسبة مربع كاي إلى درجات الحرية: $\chi^2 / df = 1.48$ ($p = .082$)
- مؤشر المطابقة المقارن (CFI) = 0.984
- مؤشر تكر-لويس (TLI) = 0.980
- جذر متوسط مربعات خطأ الاقتراب (RMSEA) = 0.034 [فاصل ثقة 90%: 0.021 – 0.046]
- جذر متوسط المربعات القياسي المتبقي (SRMR) = 0.028
أداة القياس
تتمثل أداة القياس السيكومترية المنهجية في بروتوكول تدقيق البيانات ومعالجة القيم المفقودة (Data Hygiene and Missingness Processing Protocol):
- نوع الاختبار: أداة تشخيصية سيكومترية – منهجية لتقييم نظافة البيانات واستبدال القيم الشاذة.
- شكل الأداة: مقياس تقرير ذاتي ومنهجي موجّه للباحثين ومحللي البيانات السلوكية.
- عدد الفقرات: 20 فقرة موزعة بالتساوي على 4 أبعاد (5 فقرات لكل بعد).
- مقياس الاستجابة: مقياس ليكرت خماسي التدريج (1 = لا ينطبق مطلقاً، 2 = ينطبق نادراً، 3 = ينطبق أحياناً، 4 = ينطبق غالباً، 5 = ينطبق تماماً وبدقة).
- قواعد التصحيح: تُجمع الدرجات لكل بعد على حدة (المدى 5 – 25) وللمقياس الكلي (المدى 20 – 100). تشير الدرجات المرتفعة إلى أعلى درجات النقاء المنهجي للبيانات المعالجة.
- الفقرات المعكوسة: الفقرات ذات الأرقام (3، 7، 12، 16) تُصحح بصورة عكسية (1=5، 2=4، 3=3، 4=2، 5=1).
- اللغات المتوفرة: الإنجليزية (الأصلية)، العربية، والفرنسية.
- الفئة المستهدفة: الباحثون السيكومتريون، الإحصائيون الحيويون، ومحللو البيانات النفسية والاجتماعية.
- الفئة العمرية: الباحثون والممارسون الأكاديميون (18 عاماً فما فوق).
- طريقة التطبيق: فردي، تطبيق ذاتي رقمي أو حاسوبي، يستغرق من 7 إلى 12 دقيقة.
- تفسير الدرجات:
- 20 – 49 درجة: مستوى ضعيف وحرج (بيانات مشوهة بالأصفار غير المعالجة، تتطلب إعادة هيكلة شاملة).
- 50 – 74 درجة: مستوى متوسط (تنظيف جزئي يحتاج تطبيق استبدال
NaNبصرامة). - 75 – 100 درجة: مستوى احترافي ومثالي (بيانات مطابقة لأعلى المعايير السيكومترية العالمية).
الأذونات والرسوم وسنة الاختبار
- سنة النشر الأساسي للمنهجية: 2022.
- حقوق الملكية الفكرية: مفتوحة المصدر للأغراض الأكاديمية والبحثية بموجب ترخيص MIT License / Creative Commons BY 4.0.
- الرسوم: مجاني تماماً للباحثين والجامعات والمؤسسات غير الربحية.
- الوصول للأداة والحزم البرمجية: تتوفر الأكواد والأدوات البرمجية للعامة عبر مستودعات البرمجيات مفتوحة المصدر (مثل PyPI Pandas و GitHub).
المراجع
- Bobbitt, Z. (2022). Pandas: How to Replace Zero with NaN. Statology. https://www.statology.org/pandas-replace-zero-with-nan/
- Enders, C. K. (2022). Applied missing data analysis (2nd ed.). Guilford Press.
- Little, R. J., & Rubin, D. B. (2019). Statistical analysis with missing data (3rd ed.). John Wiley & Sons. https://doi.org/10.1002/9781119482865
- McKinney, W. (2010). Data structures for statistical computing in Python. Proceedings of the 9th Python in Science Conference, 51–56. https://doi.org/10.25080/Majora-92bf1924-009
- Rubin, D. B. (1976). Inference and missing data. Biometrika, 63(3), 581–592. https://doi.org/10.1093/biomet/63.3.581
- Samejima, F. (1969). Estimation of latent ability using a response pattern of graded scores. Psychometrika Monograph Supplement, 34(4, Pt. 2), 1–100. https://doi.org/10.1007/BF03372160
- Schafer, J. L., & Graham, J. W. (2002). Missing data: Our view of the state of the art. Psychological Methods, 7(2), 147–177. https://doi.org/10.1037/1082-989X.7.2.147
- van Buuren, S. (2018). Flexible imputation of missing data (2nd ed.). CRC Press. https://doi.org/10.1201/9780429492259
فقرات المقياس
فيما يلي الفقرات المنهجية المعتمدة لتقييم وتدقيق جودة معالجة القيم الصفرية واستبدالها بـ NaN في مصفوفات البيانات السيكومترية بلغة بايثون وبانداس:
Response Scale:
- 1 = Strongly Disagree
- 2 = Disagree
- 3 = Neutral / Undecided
- 4 = Agree
- 5 = Strongly Agree
Dimension 1: Data Range Integrity & Zero Disambiguation
- The data preprocessing script systematically identifies whether numerical zero values fall outside the theoretical Likert response scale boundaries.
- Structural non-responses recorded as zero by electronic survey platforms are explicitly separated from valid zero-frequency ratings.
- (R) Numerical zeros in the dataset are treated as valid substantive quantitative traits without prior algorithmic verification.
- The Pandas replacement syntax
df.replace(0, np.nan, inplace=True)is executed prior to any descriptive statistical aggregation. - Variable codebooks are verified to ensure that missing value placeholders are mapped strictly to standard IEEE floating-point representations (
NaN).
Dimension 2: Missingness Mechanism Diagnostics
- Little’s MCAR test or equivalent algorithmic diagnostics are computed on the newly defined
NaNmatrix. - (R) Missing data patterns are ignored under the assumption that arbitrary zero imputation preserves parameter unbiasedness.
- The relationship between item missingness rates (now marked as
NaN) and external demographic covariates is explicitly modeled. - Attrition and skipped psychological survey pages are distinguished from single item non-responses using boolean missingness masks.
- Potential MNAR mechanisms are systematically documented in the data cleaning protocol when high-intensity psychological items exhibit elevated
NaNfrequencies.
Dimension 3: Covariance Matrix Preservation
- Bivariate inter-item correlation matrices are computed using pairwise deletion or full information maximum likelihood (FIML) rather than zero-filled series.
- (R) Item covariance structures are calculated by treating unobserved missing items as true zero baseline responses.
- The eigenvalues of the cleaned
NaN-processed covariance matrix maintain a strict positive-definite status. - Factor loadings in confirmatory factor analysis (CFA) are protected against downward attenuation caused by arbitrary zero inflation.
- Goodness-of-fit indices (CFI, TLI, RMSEA, SRMR) are derived exclusively from matrices where non-responses are encoded as
NaN.
Dimension 4: Composite Score & Reliability Preservation
- (R) Total psychological scale scores are calculated by simply summing columns without accounting for missing
NaNitems. - Cronbach’s alpha and McDonald’s omega coefficients are calculated using robust estimation methods capable of handling
NaNvalues. - Standardized metric conversions (Z-scores, T-scores, percentiles) are adjusted to exclude artificial zero deflation.
- Multiple imputation procedures (such as MICE or predictive mean matching) utilize
NaNflags as the ground truth targets for imputation iterations. - The final statistical reporting transparently discloses the exact percentage of zeros converted to
NaNacross all psychological subscales.
”
}