الإحصاء والقياس النفسيتحليل البيانات في R

كيفية حساب الارتباط حسب المجموعة في R

دليل أكاديمي شامل يشرح كيفية حساب معامل الارتباط حسب المجموعة في لغة R باستخدام حزم dplyr وpsych مع تطبيقات عملية في البحوث النفسية والإحصائية.

تاريخ النشر

تُعد دراسة العلاقات الارتباطية بين المتغيرات السلوكية والنفسية ركيزة أساسية في منهجية البحث الكمي المعاصر، حيث يسعى الباحثون في مجالات علم النفس، والعلوم الاجتماعية، والعلوم التربوية إلى تفكيك الشبكات المعقدة للسمات الإنسانية وفهم كيفية تفاعلها مع بعضها البعض. ومع ذلك، فإن التعامل مع مجتمع البحث ككتلة متجانسة واحدة غالباً ما يؤدي إلى استنتاجات مضللة تُغفل التباينات البنيوية الدقيقة الكامنة في الطبقات والمجموعات الفرعية للبيانات. من هنا تنبع ضرورة التحليل الإحصائي المقارن والمصنف، والذي يُتيح فحص معاملات الارتباط ضمن سياقات وسيطة محددة مثل الفئات العمرية، أو النوع الاجتماعي، أو البيئات المهنية المختلفة، مما يضمن دقة التفسير وعمقه.

تُمثل لغة البرمجة الإحصائية R البيئة الأقوى والأكثر مرونة لتنفيذ هذا النوع من التحليلات المعقدة بفضل منظومتها البيئية المتطورة، لا سيما حزم التحليل الحديثة التابعة لـ Tidyverse. يهدف هذا الدليل الشامل والمفصل إلى تزويد الباحثين الإحصائيين والمختصين في القياس النفسي بالمعرفة النظرية والتطبيقية الكاملة لحساب معاملات الارتباط وتفسيرها واختبار دلالتها الإحصائية وتمثيلها بيانياً عبر المجموعات الفرعية المتعددة، مع مراعاة كافة المعايير المنهجية الصارمة ومتطلبات التوثيق الأكاديمي المعتمدة عالمياً.

من خلال استعراض المبادئ الرياضية الأساسية، وتقنيات معالجة البيانات المفقودة، وتفادي الوقوع في المآزق الإحصائية الشهيرة مثل مفارقة سيمبسون، يقدم هذا المرجع مساراً متكاملاً يبدأ من إعداد بيئة العمل وهيكلة البيانات، مروراً بالحسابات البرمجية المتقدمة لمصفوفات الارتباط، وصولاً إلى صياغة النتائج وتوثيقها وفق دليل الجمعية الأمريكية لعلم النفس في إصداره السابع. سيمكّنك هذا الطرح المعمق من الانتقال بتحليلاتك الإحصائية في R من مجرد عمليات حسابية روتينية إلى نمذجة تفسيرية رصينة تعكس الواقع السلوكي بدقة متناهية.

1. مقدمة نظرية لمفهوم تحليل الارتباط المجمع في البحث النفسي والإحصائي

1.1 مفهوم معامل الارتباط واستخداماته في القياس النفسي

يُمثل معامل الارتباط الخطي (Linear Correlation Coefficient) مقياساً إحصائياً معيارياً يُستخدم لتحديد طبيعة وقوة واتجاه العلاقة الخطية التي تربط بين متغيرين كميين متصلين أو رتبيين. في سياق القياس النفسي (Psychometrics)، يكتسب هذا المعامل أهمية استثنائية نظراً لطبيعة الظواهر النفسية والسلوكية التي تتسم بعدم القابلية للقياس الفيزيائي المباشر، بل يتم الاستدلال عليها عبر مؤشرات ومقاييس متعددة العناصر مثل استبانات قياس القلق، والاكتئاب، والذكاء العاطفي، والمرونة النفسية. يسعى الباحث السيكومتري دوماً إلى استكشاف مدى تلازم تغير درجات سمة نفسية معينة مع تغيرات سمة أخرى، سواء أكان هذا التلازم طردياً موجباً يعكس تزايد المتغيرين معاً، أو عكسياً سالباً يشير إلى تناقص أحدهما مع زيادة الآخر.

تكمن التحديات المنهجية الكبرى في القياس النفسي في أن المتغيرات السلوكية غالباً ما تكون محملة بالخطأ القياسي والتشتت العالي الناتج عن الفروق الفردية وظروف التطبيق. وبالتالي، فإن تفسير قيمة المعامل، التي تتراوح نظرياً بين -1 و +1، لا ينبغي أن يقتصر على مجرد قراءة الرقم المجرد، بل يتطلب فهماً سيكولوجياً لطبيعة السمة المقاسة وحدود تفسيرها الإحصائي. فالارتباط لا يعني بأي حال من الأحوال وجود علاقة سببية (Causation) بين المتغيرين، بل يشير فقط إلى وجود اقتران إحصائي منتظم قد يرجع إلى عوامل مشتركة كامنة تؤثر في كلا المتغيرين في آن واحد.

علاوة على ذلك، فإن افتراض خطية العلاقة وتجانس العينة يُعد من الشروط الصارمة التي ينبغي التحقق منها قبل إطلاق أي تعميمات سيكولوجية. فعندما تُطبق أدوات القياس على عينات واسعة غير متجانسة تحتوي على فئات متباينة في العمر أو الخلفية الثقافية أو المستوى الإكلينيكي، فإن حساب معامل ارتباط كلي واحد وشامل يدمج كافة هذه الفئات معاً قد يؤدي إلى نتائج مضللة بصورة جذرية، حيث قد يطمس علاقات حقيقية قائمة داخل فئات معينة، أو يُظهر علاقات وهمية لا وجود لها على أرض الواقع الميداني.

1.2 أهمية تقسيم البيانات إلى مجموعات فرعية (Subgroup Analysis)

يُعد تحليل المجموعات الفرعية (Subgroup Analysis) أحد أهم المرتكزات المنهجية في التصميم التجريبي وشبه التجريبي، إذ يتيح للباحثين تفكيك التباين الكلي في البيانات واكتشاف الأثر المعدل (Moderating Effect) الذي تحدثه المتغيرات التصنيفية والديموغرافية. إن المتغيرات مثل النوع الاجتماعي (Gender)، والفئات العمرية (Age Cohorts)، والحالة الاجتماعية، والمستوى التعليمي، أو حتى التصنيفات الإكلينيكية (مثل: أفراد أصحاء مقابل مرضى باضطراب معين) لا تعمل فقط كمتغيرات وصفية، بل كأطر تفسيرية تغير بشكل جوهري من طبيعة العلاقات الارتباطية بين المتغيرات النفسية الأساسية.

إن إغفال تقسيم البيانات وحساب الارتباط على مستوى العينة الكلية يفترض ضمناً أن البنية السيكومترية للسمات النفسية تعمل بنفس الآلية عبر جميع الأفراد، وهو افتراض ينفيه الواقع الإكلينيكي والنظري للعلوم السلوكية. فعلى سبيل المثال، قد تكون العلاقة بين الضغط الأكاديمي والتحصيل الدراسي علاقة طردية دافعة لدى الطلاب ذوي الكفاءة الذاتية المرتفعة، بينما تنقلب إلى علاقة عكسية سلبية لدى الطلاب ذوي القلق المرتفع. إذا دمج الباحث هاتين الفئتين في تحليل ارتباط عام واحد، فستلغي إحدى العلاقتين الأخرى، وتظهر النتيجة النهائية معامل ارتباط يقترب من الصفر، مما يقود الباحث إلى استنتاج خاطئ تماماً مفاده غياب العلاقة بين الضغط والتحصيل.

تتيح دراسة الارتباطات المصنفة حسب المجموعة للباحث إمكانية الكشف عن الفروق الفردية الدقيقة وفهم التمايز البنيوي في النماذج السلوكية. هذا المستوى من التحليل يعزز من الصدق الخارجي (External Validity) والصدق البنائي (Construct Validity) للأدوات النفسية، ويوفر للممارسين في الميدان النفسي والإرشادي رؤى تطبيقية مخصصة لكل فئة سكانية على حدة، بدلاً من الاعتماد على تعميمات جائرة تسقط خصوصيات المجموعات المتباينة بنيوياً.

1.3 مسوغات استخدام بيئة R في التحليل الإحصائي المقارن

تعتبر بيئة R الإحصائية الخيار المعياري الأول للباحثين المتقدمين وعلماء البيانات في المؤسسات الأكاديمية ومراكز الأبحاث العالمية، وذلك لما تتمتع به من قوة حاسوبية فائقة ومرونة برمجية غير محدودة في معالجة مصفوفات البيانات الكبيرة والمتشعبة. وعلى عكس البرمجيات الإحصائية التجارية المغلقة وذات الواجهات الرسومية المحدودة، تقدم لغة R بنية برمجية مفتوحة المصدر تمكن الباحث من التحكم الكامل في كل مرحلة من مراحل التحليل الإحصائي، وتطوير خوارزميات مخصصة تتناسب مع تعقيدات التصاميم التجريبية المتداخلة ومتعددة المستويات.

من أهم مسوغات الاعتماد على بيئة R في التحليلات المقارنة هو دعمها الصارم لمبدأ قابلية إعادة الإنتاج وتكرار الأبحاث (Reproducibility). فمن خلال كتابة شفرات برمجية (Scripts) محكمة وموثقة، يستطيع الباحث إعادة تشغيل نفس التحليلات الدقيقة على بيانات جديدة أو مشاركة الشفرة مع مراجعين مستقلين للتحقق من النتائج، وهو ما يتماشى مع أحدث المعايير العلمية للنشر الأكاديمي الدولي. يمنع هذا النهج البرمجي الأخطاء اليدوية الشائعة التي تحدث أثناء نسخ النتائج أو التلاعب بالبيانات عبر القوائم المنسدلة في البرامج الأخرى.

علاوة على ذلك، تتميز R بالتكامل السلس والشامل بين أدوات معالجة وتنظيف البيانات، وخوارزميات التحليل الإحصائي الاستدلالي المتقدم، ومحركات التمثيل البياني فائق الدقة مثل حزمة ggplot2. إن القدرة على تحويل إطار بيانات ضخم وتصنيفه وحساب معاملات الارتباط المتعددة لمجموعاته الفرعية واستخراج فترات الثقة ثم تمثيل النتائج بيانياً في بضعة أسطر برمجية أنيقة يجعل من R بيئة لا غنى عنها لأي باحث يسعى للتميز الإحصائي والمصداقية العلمية.

2. إعداد بيئة العمل وهيكلة البيانات النفسية في R

2.1 تثبيت وتحميل الحزم الإحصائية الأساسية

تبدأ أي دراسة إحصائية رصينة في R بتأسيس بيئة عمل متكاملة تتضمن تحميل الحزم البرمجية المتخصصة التي توفر الدوال والأدوات اللازمة لتنفيذ عمليات المعالجة والتحليل السيكومتري بكفاءة عالية. تشكل منظومة tidyverse، وحزمة dplyr على وجه الخصوص، النواة الصلبة لمعالجة البيانات وتصنيفها وتحويلها وفق منطق برمجي بديهي وسريع. إضافة إلى ذلك، تلعب الحزم الإحصائية المتقدمة مثل حزمة psych دوراً حيوياً في تقديم دوال متخصصة تم تطويرها خصيصاً لتلبية احتياجات الباحثين في القياس النفسي والعلوم الاجتماعية.

لتثبيت هذه الحزم من المستودع الرسمي الشامل (CRAN)، يتم استخدام الدالة المعيارية المخصصة لذلك في سطر الأوامر، تليها عملية تفعيل الحزم في جلسة العمل الحالية. من الأهمية بمكان التأكد من توافق إصدارات الحزم مع إصدار لغة R المستخدم، وذلك لتفادي أي أخطاء برمجية غير متوقعة ناجمة عن تحديثات البنية التحتية للغة. تتضمن الحزم الأساسية التي سنعتمد عليها في هذا الدليل كلاً من dplyr لمعالجة البيانات وتجميعها، وpsych للحسابات السيكومترية، وbroom لتحويل مخرجات النماذج الإحصائية إلى جداول بيانات نظيفة، وggplot2 للتمثيل البياني، وpurrr للبرمجة الوظيفية المتقدمة.

يجب على الباحث أيضاً إدارة مساحات الأسماء (Namespaces) بحذر لمنع تضارب الدوال. فعلى سبيل المثال، تحتوي عدة حزم إحصائية على دوال تشترك في نفس الاسم مثل دالة التلخيص أو دالة التحديد، ولتجنب استدعاء دالة خاطئة من حزمة أخرى، ينبغي توضيح الحزمة المستهدفة بدقة أو ضبط ترتيب تحميل الحزم بصورة منهجية تضمن استدعاء الأوامر الصحيحة طوال مراحل التحليل.

2.2 هيكلة إطار البيانات (Data Frame) وفق القواعد الترتيبية

تتطلب الحسابات الإحصائية الدقيقة والموثوقة في R هيكلة إطار البيانات وفق قواعد البيانات المنظمة (Tidy Data)، وهي فلسفة تنظيمية تنص على أن كل متغير يجب أن يمثل عموداً مستقلاً (Column)، وكل مشاهدة أو مشارك يجب أن يمثل صفاً منفرداً (Row)، وكل قيمة قياسية يجب أن تحتل خلية واحدة محددة. في البحوث النفسية، يعني هذا أن المتغيرات الديموغرافية والتصنيفية، كالمجموعة التجريبية أو المستوى التعليمي أو التخصص المهني، يجب أن تُسجل كأعمدة تصنيفية واضحة بجانب أعمدة الدرجات الخام للمقاييس السلوكية والنفسية المختلفة.

من الخطوات المحورية في تجهيز البيانات تحويل المتغيرات المستقلة والتصنيفية إلى عوامل (Factors) مع تحديد مستوياتها (Levels) وترتيبها إن كانت ذات طبيعة رتبوية. يُعد تحويل النصوص إلى عوامل خطوة تأسيسية في R، حيث تعتمد دوال التجميع والتقسيم الداخلي على البنية الفئوية للعوامل لتحديد كيفية فرز البيانات وتوزيع العمليات الحسابية عبر المجموعات. يتم فحص هيكل البيانات للتأكد من أن المتغيرات التابعة الرقمية معرفة كقيم عددية متصلة أو صحيحة، لضمان عدم رفض الدوال الرياضية التعامل معها.

يوفر التحقق المبكر من سلامة مسميات الأعمدة وخلوها من المسافات أو الرموز الخاصة المعقدة بيئة عمل مستقرة تمنع توقف الأكواد أثناء المعالجة المتسلسلة. إن بناء إطار بيانات نظيف، متسق، ومطابق للمعايير القياسية يمثل أكثر من نصف الجهد المبذول في عملية التحليل الإحصائي، ويضمن الحصول على مخرجات دقيقة وقابلة للتكرار دون تعقيدات برمجية جانبية.

2.3 فحص المتغيرات والتحقق من الشروط البارامترية قبل التحليل

قبل الشروع في حساب معاملات الارتباط، تفرض المنهجية الإحصائية الصارمة التحقق من مدى استيفاء البيانات للشروط المعلمية (Parametric Assumptions) لكل مجموعة فرعية على حدة، وليس فقط على مستوى العينة الإجمالية. يشمل ذلك استكشاف اعتدالية التوزيع الطبيعي (Normality) لدرجات المتغيرات النفسية داخل كل فئة باستخدام اختبارات الدلالة المعيارية مثل اختبار شابيرو-ويلك (Shapiro-Wilk Test) ومؤشرات الالتواء (Skewness) والتفرطح (Kurtosis)، بالإضافة إلى فحص الرسوم البيانية كالمخططات الاحتمالية الطبيعية (Q-Q Plots).

كما ينبغي التحقق من شرط الخطية (Linearity) بين المتغيرين المستهدفين داخل كل طبقة تجريبية، إذ إن معامل ارتباط بيرسون يقيس حصراً قوة العلاقة الخطية المستقيمة، ويعجز عن رصد العلاقات المنحنية أو غير الخطية مهما بلغت قوتها. يتطلب ذلك أيضاً فحص تجانس التباين المشترك (Homoscedasticity) لضمان ثبات انتشار النقاط والدرجات على طول خط الانحدار عبر مختلف مستويات المتغير المستقل داخل كل مجموعة.

تعتبر مسألة اكتشاف القيم المتطرفة والشاذة (Outliers) داخل المجموعات الفرعية من أدق مراحل الفحص الأولي للبيانات. فالقيمة المتطرفة في مجموعة صغيرة قد تؤدي إلى تضخيم زائف لمعامل الارتباط أو خفضه إلى الصفر بشكل مصطنع. يتطلب ذلك استخدام المقاييس الاستكشافية القوية مثل المدى الربيعي (IQR) ومسافات ماهالانوبيس (Mahalanobis Distance) لرصد الحالات الشاذة متعددة الأبعاد داخل كل مستوى تصنيفي، واتخاذ القرار المنهجي المناسب بشأن عزلها أو تطبيق بدائل إحصائية غير معلمية ملائمة لخصائص التوزيع.

3. الصيغة الأساسية لحساب الارتباط حسب المجموعة باستخدام dplyr

3.1 بناء الأوامر البرمجية باستخدام عامل الربط (Pipe Operator %>%)

أحدث إدخال عامل الربط، المعروف بـ Pipe Operator، ثورة مفاهيمية في كيفية كتابة الشفرات البرمجية داخل بيئة R، حيث سمح بنقل مخرجات دالة معينة لتكون مدخلاً مباشراً للدالة التي تليها في تسلسل منطقي انسيابي يحاكي القراءة الطبيعية للنصوص. تاريخياً، اعتمدت بيئة tidyverse على عامل الربط الكلاسيكي الشهير المأخوذ من حزمة magrittr، والمكتوب بالرمز المكون من النسبة المئوية وقوس الإغلاق، والذي يربط العمليات الحسابية بمرونة فائقة تقلل من الحاجة لإنشاء كائنات ومتغيرات وسيطة مؤقتة تستهلك الذاكرة وتزيد من فوضى بيئة العمل.

في الإصدارات الحديثة من لغة R (بدءاً من الإصدار 4.1.0)، قامت لغة R بتضمين عامل ربط مدمج أصيل في نواتها البرمجية، ويُمثل برمز الخط الرأسي وقوس الإغلاق. يتميز عامل الربط الأصيل بالسرعة المباشرة وعدم الاعتماد على تحميل حزم خارجية، بينما يستمر عامل الربط الكلاسيكي في توفير مزايا تركيبية متقدمة في التعامل مع تعيين موضع البيانات المدخلة داخل الدوال المعقدة.

يسهم استخدام عامل الربط في تحسين مقروئية الشفرة الإحصائية بشكل استثنائي، مما يتيح للباحثين والمراجعين تتبع مسار تدفق البيانات من حالتها الخام، مروراً بمراحل الفرز والتصفية والتجميع، وانتهاءً بالحسابات الإحصائية النهائية. يعزز هذا البناء البرمجي الأنيق من وضوح الخطوات المنهجية المتبعة، ويقلل احتمالات الخطأ البشري أثناء تعديل الأوامر أو توسيع نطاق النماذج التحليلية.

3.2 تطبيق دالتي group_by و summarize مع دالة cor

تُعد توليفة دالتي التجميع والتلخيص في حزمة dplyr الهيكل البرمجي القياسي والأساسي لإجراء التحليلات الإحصائية المصنفة في R. تعمل دالة التجميع على تقسيم إطار البيانات منطقياً وداخلياً إلى مجموعات فرعية استناداً إلى واحد أو أكثر من المتغيرات التصنيفية المحددة، دون تغيير الترتيب المادي الظاهر للصفوف. يتحول إطار البيانات نتيجة لذلك إلى جدول مجمع مدرك للفئات، بحيث تُنفذ أي دالة حسابية تُطبق عليه لاحقاً بشكل مستقل داخل كل مجموعة على حدة.

عند دمج دالة التجميع مع دالة التلخيص الإحصائي، يتم استدعاء دالة حساب الارتباط الرياضية لتطبيقها على المتغيرين المستهدفين. تُمثل الصيغة البرمجية العامة لهذا الإجراء المسار التالي: يبدأ الباحث بتمرير إطار البيانات عبر عامل الربط إلى دالة التجميع لتحديد المتغير الفئوي، ثم يُمرر الناتج إلى دالة التلخيص التي تستدعي دالة حساب الارتباط محددة المتغير الرقمي الأول والمتغير الرقمي الثاني، مع إمكانية تحديد نوع المعامل المطلوب واستراتيجية التعامل مع القيم المفقودة داخل نفس الأمر.

يتميز هذا الأسلوب البرمجي بالقدرة على استيعاب مستويات تجميع متعددة في آن واحد. فإذا رغب الباحث في حساب الارتباط بين مقياسين نفسيين عبر تقاطعات متعددة، مثل النوع الاجتماعي والمستوى التعليمي معاً، فما عليه سوى إدراج كلا المتغيرين التصنيفيين داخل دالة التجميع، لتقوم dplyr بحساب معاملات الارتباط لكل تركيبة تصنيفية ممكنة بمنتهى السلاسة والكفاءة الرياضية.

3.3 قراءة المخرجات وتفسير الجداول الإحصائية الناتجة

تُسفر العملية البرمجية السابقة عن إنتاج جدول بيانات مقتضب وعالي التنسيق يُعرف في بيئة R بـ (Tibble). يحتوي هذا الجدول الناتج على أعمدة تمثل المتغيرات التصنيفية التي تم التجميع بناءً عليها، يتبعها عمود جديد يحتوي على القيمة المحسوبة لمعامل الارتباط لكل فئة من الفئات الفرعية. يسمح هذا التنسيق النظيف للباحث بإجراء مقارنة بصرية فورية ومباشرة لقيم معاملات الارتباط عبر مختلف المجموعات.

يتطلب التفسير الإحصائي السليم لهذه المخرجات فحص إشارة المعامل لتحديد اتجاه العلاقة، وقيمته المطلقة لتقدير حجم الأثر والقوة السلوكية للارتباط. فعلى سبيل المثال، إذا أظهر الجدول أن معامل الارتباط بين دافعية الإنجاز ومعدل القلق بلغ 0.45 لدى مجموعة الذكور، في حين بلغ -0.20 لدى مجموعة الإناث، فإن هذا التباين الجذري في الإشارة والقوة يعكس اختلافاً جوهرياً في الديناميات النفسية بين المجموعتين يستدعي وقفة تحليلية معمقة من الباحث لتفسير هذا التناقض السلوكي.

ينبغي أيضاً فحص أبعاد الجدول للتأكد من ظهور كافة مستويات المتغير التصنيفي، والتحقق من عدم وجود قيم مفقودة في معاملات الارتباط الناتجة، والتأكد من أن حجم العينة داخل كل فئة كان كافياً لتوليد معامل ارتباط يعتمد عليه رياضياً، تمهيداً للانتقال إلى مراحل الاختبار الاستدلالي للدلالة الإحصائية لهذه الفروق.

4. تطبيق أنواع معاملات الارتباط المختلفة حسب خصائص البيانات

4.1 حساب معامل ارتباط بيرسون (Pearson) للمتغيرات المتصلة

يُعد معامل ارتباط بيرسون لعزم حاصل الضرب (Pearson Product-Moment Correlation) المعامل الأكثر شيوعاً واستخداماً في الأبحاث النفسية والتربوية، وهو مصمم خصيصاً لقياس قوة واتجاه العلاقة الخطية بين متغيرين متصلين يتبعان مقياس الفترة (Interval Scale) أو مقياس النسبة (Ratio Scale). تعتمد دالة حساب الارتباط في R افتراضياً على معامل بيرسون ما لم يُنص على خلاف ذلك عبر وسيط الطريقة الحسابية المحدد في الدالة.

يتطلب تطبيق معامل بيرسون استيفاء شروط بارامترية حازمة داخل كل مجموعة فرعية يجري التحليل عليها، وأهمها التوزيع الطبيعي ثنائي المتغير (Bivariate Normality)، والذي يُفترض فيه أن الدرجات تتوزع بصورة جرسية اعتدالية مشتركة للمتغيرين معاً. في القياس النفسي، يُطبق معامل بيرسون بشكل واسع عند مقارنة الدرجات المعيارية الخام الناتجة عن اختبارات الذكاء، والمقاييس المقننة للشخصية، والدرجات التراكمية لاختبارات التحصيل المعرفي، شريطة خلو البيانات من الالتواء الحاد.

في الحالات التي تكون فيها العينات الفرعية كبيرة الحجم ومستوفية لشروط التوزيع الطبيعي، يقدم معامل بيرسون أعلى كفاءة إحصائية وقدرة على رصد العلاقات الدقيقة بين البنى النفسية المقاسة، مما يجعله الخيار الأمثل للنمذجة الإحصائية المتقدمة وتحليلات المسار والانحدار اللاحقة.

4.2 حساب معامل ارتباط سبيرمان (Spearman) للبيانات الرتبوية

عندما تفشل البيانات في تلبية شروط التوزيع الطبيعي المعلمي، أو عندما تكون البيانات ذات طبيعة ترتيبية غير متصلة، يبرز معامل ارتباط الرتب لسبيرمان (Spearman’s Rank Correlation Rho) كبديل لامعلمي قوي وموثوق. يتميز معامل سبيرمان بقدرته على قياس قوة واتجاه العلاقة الرتيبة (Monotonic Relationship) بين متغيرين، أي قدرة أحدهما على التزايد أو التناقص المستمر مع الآخر دون اشتراط أن يكون معدل التغير خطياً ثابتاً.

يتم تطبيق هذا المعامل في لغة R من خلال تمرير القيمة المخصصة لوسيط الطريقة داخل دالة حساب الارتباط لتصبح محددة بالنمط الرتبي. يقوم هذا الإجراء بتحويل القيم الرقمية الأصلية للمتغيرات إلى رتب تصاعدية داخل كل مجموعة فرعية بشكل منفصل، ثم حساب معامل بيرسون على تلك الرتب المستخرجة. يُعد معامل سبيرمان مقاوماً ممتازاً لتأثير القيم الشاذة والمتطرفة، حيث تُحد الرتب من التأثير الجارف للدرجات المنعزلة التي قد تشوه نتائج الارتباط المعلمي.

يجد هذا المعامل استخدامات هائلة في البحوث السلوكية والمسوح النفسية المعتمدة على مقاييس ليكرت (Likert Scales)، واستبانات التقدير الذاتي، وتصنيفات الأداء الإكلينيكي المعتمدة على مراتب وصفية، حيث تضمن طبيعته اللامعلمية استخلاص مؤشرات ارتباطية صادقة تعكس التوافق الرتبي الحقيقي بين المتغيرات النفسية المفحوصة عبر مختلف الطبقات السكانية.

4.3 حساب معامل ارتباط كيندال (Kendall Tau) للعينات الصغيرة

يُمثل معامل ارتباط كيندال للرتب (Kendall’s Tau) بديلاً لامعلمياً بالغ الأهمية والدقة، ويُفضل إحصائياً على معامل سبيرمان في حالات معينة، لا سيما عندما تكون حجوم العينات في المجموعات الفرعية صغيرة جداً، أو عندما تشتمل البيانات على عدد كبير من الرتب المكررة أو المتساوية (Tied Ranks). يعتمد منطق كيندال الرياضي على مقارنة عدد الأزواج المتوافقة (Concordant Pairs) بالأزواج غير المتوافقة (Discordant Pairs) بين المشاهدات.

يتم استدعاء معامل كيندال في بيئة R عبر ضبط وسيط الطريقة الحسابية على القيمة الخاصة به داخل دالة الارتباط. يتميز هذا المعامل بخصائص إحصائية ممتازة، حيث يمتلك توزيعاً تقاربياً يقترب من التوزيع الطبيعي بسرعة أكبر مقارنة بسبيرمان في العينات المحدودة، كما يقدم تقديراً غير متحيز لمعامل الارتباط في المجتمع الأصلي، وتعتبر فترات الثقة المحسوبة بناءً عليه أكثر دقة وموثوقية رياضية.

في مجالات علم النفس الإكلينيكي والطب النفسي، حيث يصعب في كثير من الأحيان جمع عينات ضخمة من المرضى المصابين باضطرابات نادرة، يوفر معامل كيندال أداة رصينة لحساب معاملات الارتباط المجمعة دون الوقوع في أخطاء التقدير الإحصائي. كما يُستخدم على نطاق واسع في قياس درجة الاتساق والتوافق بين ملاحظين سلوكيين متعددين (Inter-rater Reliability) عند تقييم الاستجابات النفسية عبر ظروف تجريبية مختلفة.

5. معالجة القيم المفقودة (Missing Values) أثناء الحساب الجماعي

5.1 تأثير القيم المفقودة (NA) على دالة cor في R

تُعد معضلة البيانات المفقودة (Missing Data) من أكثر التحديات شيوعاً وإرباكاً في البحوث النفسية والمسوح الميدانية، حيث يمتنع بعض المشاركين عن الإجابة على فقرات معينة في الاستبانات، أو ينسحبون من جلسات التقييم الطولي، أو تحدث أخطاء فنية أثناء تسجيل البيانات. في بيئة R، تتبع دالة حساب الارتباط سلوكاً رياضياً صارماً وحذراً للغاية؛ فبمجرد احتواء أي متغير على قيمة مفقودة واحدة يُرمز لها بـ NA، فإن الدالة ترجع تلقائياً القيمة NA كنتيجة نهائية لكامل العملية الحسابية لتلك المجموعة.

يحدث هذا السلوك الافتراضي لحماية الباحث من استخلاص نتائج غير واعية بحجم النقص في بياناته. ومع ذلك، فإن تطبيق التحليل على مجموعات فرعية متعددة يفاقم هذه المشكلة، حيث قد تختلف نسب الفقد اختلافاً جذرياً من مجموعة إلى أخرى. فقد تحتوي مجموعة الإناث على نسب إجابة كاملة 100% وتنتج معامل ارتباط دقيقاً، بينما تحتوي مجموعة الذكور على قيمة مفقودة واحدة تؤدي إلى إلغاء المعامل تماماً وظهور NA، مما يعيق إجراء أي مقارنة بين الفئتين ما لم يتم التدخل البرمجي لمعالجة نمط الفقد.

إن تجاهل الباحث لفهم كيفية تعامل R مع البيانات الناقصة قد يؤدي إما إلى فقدان كميات هائلة من المعلومات الصالحة، أو إلى توليد نتائج متحيزة ناتجة عن تقليص حجم العينة بشكل غير مدروس، مما يبرز الأهمية القصوى للتحكم الدقيق في وسائط معالجة الفقد داخل الدوال الإحصائية المستخدمة.

5.2 استخدام وسيط use لتنظيم حذف البيانات المفقودة

للتحكم في آلية تعامل دالة الارتباط مع الخلايا المفقودة أثناء الحساب المجمع، توفر لغة R وسيطاً حيوياً هو وسيط الاستخدام (use)، والذي يتيح للباحث تحديد الاستراتيجية الرياضية الدقيقة لحذف الحالات غير المكتملة. تشمل الخيارات الأساسية لهذا الوسيط الحذف الكلي للحالات التي تحوي أي فقد (complete.obs)، أو الحذف الثنائي للأزواج غير المكتملة (pairwise.complete.obs)، ولكل خيار منهما تبعاته الإحصائية على حجم العينة وقوة الاختبار.

عند استخدام استراتيجية الحذف الكلي (complete observations)، تقوم R باستبعاد أي مشارك يمتلك قيمة مفقودة في أي من المتغيرات المدرجة في التحليل، مما يضمن أن جميع معاملات الارتباط المحسوبة تستند إلى نفس العينة الفرعية المكتملة تماماً، وهو أمر مفيد عند بناء نماذج متعددة المتغيرات متسقة العينات. بالمقابل، تتيح استراتيجية الحذف الثنائي (pairwise complete observations) استخدام أقصى حجم عينة متاح لكل زوج من المتغيرات على حدة، حيث يتم استبعاد المشارك فقط إذا كانت قيمته مفقودة في أحد المتغيرين اللذين يجري حساب الارتباط بينهما في تلك اللحظة.

يجب على الباحث الموازنة المنهجية بين هاتين الاستراتيجيتين عند إجراء التحليل عبر المجموعات؛ فبينما يحافظ الحذف الثنائي على القوة الإحصائية (Statistical Power) بتعظيم حجم العينة المستخدم في كل حساب، فإنه قد ينتج مصفوفات ارتباط غير موجبة التحديد الرياضي (Non-positive definite matrices) في الحالات المعقدة، في حين يضمن الحذف الكلي اتساق المصفوفة على حساب تقليص حجم العينة الفعلي داخل كل مجموعة فرعية.

5.3 التعامل المتقدم مع البيانات المفقودة في القياس النفسي

في الممارسات البحثية النفسية المتقدمة، لا يُنصح بالاعتماد الأعمى على الحذف التلقائي للبيانات المفقودة دون فحص معمق للآليات والأنماط الإحصائية الكامنة وراء عملية الفقد داخل كل مجموعة فرعية. تقسم الأدبيات المنهجية الفقد إلى ثلاثة أنماط رئيسية: الفقد العشوائي التام (MCAR)، والفقد العشوائي المشروط (MAR)، والفقد غير العشوائي (MNAR). يتطلب تحديد النمط استخدام اختبارات متخصصة مثل اختبار ليتل (Little’s MCAR Test) للتحقق مما إذا كان نمط الفقد يختلف بنيوياً بين المجموعات التجريبية.

قبل تمرير البيانات إلى دوال التجميع وحساب الارتباط، يمكن للباحث تنظيف البيانات واستبعاد الصفوف غير الصالحة مسبقاً باستخدام دوال التصفية وإسقاط القيم المفقودة في حزمة dplyr، مثل دالة إسقاط القيم الناقصة الموجهة لأعمدة محددة. يمنح هذا الإجراء الباحث سيطرة مسبقة على حجم العينة النهائي المتدفق إلى مرحلة التلخيص الإحصائي ويضمن شفافية التوثيق المنهجي لعدد الأفراد المستبعدين من كل فئة تصنيفية.

علاوة على ذلك، في الحالات التي يتجاوز فيها الفقد نسباً حرجة ويكون من النمط العشوائي، تتجه التوصيات السيكومترية الحديثة نحو تطبيق خوارزميات التعويض المتعدد للبيانات المفقودة (Multiple Imputation) باستخدام حزم إحصائية رائدة مثل mice. يتم في هذا النهج توليد عدة قواعد بيانات مكتملة ومعوضة إحصائياً، وحساب معاملات الارتباط المجمعة على كل قاعدة بيانات على حدة، ثم دمج النتائج باستخدام قواعد روبين (Rubin’s Rules)، مما يحافظ على التباين الطبيعي للبيانات ويمنع تضخيم الدلالة الزائفة.

6. استخراج الدلالة الإحصائية وقيم p-values وفترات الثقة عبر المجموعات

6.1 الجمع بين دالة cor.test وأسلوب التجميع البرمجي

في حين تقتصر دالة حساب الارتباط البسيطة على استخراج القيمة النقطية لمعامل الارتباط الرياضي، فإن الاستدلال الإحصائي في الأبحاث السلوكية يقتضي اختبار الفرضيات الصفرية واستخراج مستويات الدلالة الإحصائية، وقيم اختبارات تي المصاحبة، ودرجات الحرية، وفترات الثقة المعيارية. توفر بيئة R دالة الاختبار الشامل للارتباط لتنفيذ هذه الحسابات الاستدلالية بدقة متناهية.

ومع ذلك، يواجه الباحثون تحدياً برمجياً عند محاولة دمج دالة الاختبار الإحصائي مباشرة داخل دالة التلخيص التابعة لـ dplyr؛ إذ إن دالة الاختبار ترجع كائناً مركباً وقائمة متعددة العناصر (htest object) تحتوي على مصفوفة من الإحصاءات والقيم الاحتمالية، وليس مجرد قيمة رقمية مفردة يمكن وضعها مباشرة في خلية جدول التلخيص. يؤدي تطبيقها المباشر بطريقة خاطئة إلى توقف تنفيذ الأكواد أو إرجاع رسائل خطأ بنيوية.

لتجاوز هذا التحدي البرمجي، يتم استخدام تقنيات استخراج العناصر المحددة من كائن الاختبار، مثل استدعاء القيمة الاحتمالية أو قيمة المعامل بشكل منفصل عبر التعيين الدقيق، أو الانتقال إلى أساليب البرمجة التكرارية والوظيفية الأكثر مرونة وتنظيماً، والتي تتيح تشغيل الاختبار الاستدلالي الكامل وتفكيك مخرجاته المعقدة بسلاسة تامة عبر جميع المجموعات الفرعية قيد الدراسة.

6.2 استخدام حزم purrr و broom لتحويل المخرجات لجداول منسقة

يُمثل الجمع بين البرمجة الوظيفية المتاحة عبر حزمة purrr وأدوات تنظيف النماذج في حزمة broom الحل البرمجي الأكثر تطوراً وأناقة لاستخراج كافة مؤشرات الاستدلال الإحصائي لمعاملات الارتباط المجمعة. يبدأ هذا المسار المتقدم باستخدام دالة التعشيش (nest) لتقسيم إطار البيانات الأصلي إلى جداول بيانات فرعية متداخلة ومغلفة داخل كل مستوى تصنيفي، بحيث يصبح كل صف في الجدول الرئيسي ممثلاً لمجموعة معينة ويحتوي على عمود يضم بيانات أفراد تلك المجموعة بالكامل.

باستخدام دالة الخرائط الوظيفية (map)، يتم تكرار تطبيق دالة اختبار الارتباط على كل جدول بيانات متداخل ومستقل. يعقب ذلك استخدام الدالة العبقرية لتنظيف النماذج من حزمة broom، والتي تقوم بتحويل كائن الاختبار المعقد إلى صف بيانات منظم يحتوي على أسماء قياسية لكافة الإحصاءات المستخرجة: قيمة المعامل، وقيمة الإحصائي الاختباري، والقيمة الاحتمالية الدالة، والحد الأدنى والحد الأعلى لفترة الثقة بنسبة 95%، والفرضية البديلة المختبرة.

بمجرد إلغاء التعشيش وفك الجداول المتداخلة عبر الدالة المخصصة لذلك، يحصل الباحث على جدول بيانات متكامل، موسع، وفائق التنسيق، يحتوي على سطر لكل مجموعة فرعية مع كافة المؤشرات الوصفية والاستدلالية وفترات الثقة دون الحاجة إلى كتابة حلقات تكرارية معقدة، مما يرفع من جودة وكفاءة التحليل البرمجي إلى أعلى مستوياتها.

6.3 تعديل مستويات الدلالة الإحصائية للمقارنات المتعددة

عند حساب معاملات الارتباط واختبار دلالتها الإحصائية عبر مجموعات فرعية متعددة، يواجه الباحث خطراً منهجياً جسيماً يتمثل في معضلة المقارنات المتعددة (Multiple Testing Problem). يؤدي تكرار إجراء اختبارات الفرضيات المستقلة على عدة مجموعات إلى تضخم معدل الخطأ من النوع الأول (Family-Wise Error Rate)، وهو احتمال رفض الفرضية الصفرية بالخطأ واكتشاف ارتباطات دالة إحصائياً هي في حقيقتها مجرد نتاج للصدفة العشوائية وتقلبات المعاينة.

للتعامل مع هذا التضخم وضبط الصرامة الاستدلالية، توفر بيئة R الدالة المدمجة المخصصة لضبط وتعديل القيم الاحتمالية. تتيح هذه الدالة تطبيق مجموعة واسعة من خوارزميات التصحيح الإحصائي المعتمدة، بدءاً من أسلوب تصحيح بونفيروني (Bonferroni Correction) الكلاسيكي الصارم، والذي يقسم مستوى الدلالة الاسمي على عدد الاختبارات المجراة، وصولاً إلى خوارزميات أكثر مرونة وقوة مثل تصحيح هولم (Holm) وتصحيح بنجاميني-هوشبرغ للتحكم في معدل الاكتشاف الخاطئ (False Discovery Rate – FDR).

يتم دمج هذه التعديلات البرمجية بسهولة داخل جدول النتائج النهائي عبر إضافة عمود جديد يحوي القيم الاحتمالية المعدلة. يضمن هذا الإجراء المنهجي توافق الأبحاث النفسية مع المعايير الدولية للنشر العلمي، ويحمي الباحث من الوقوع في فخ النتائج الإيجابية الكاذبة التي طالما عانت منها الدراسات السلوكية في أزمة التكرار الشهيرة (Replication Crisis).

7. حساب مصفوفة الارتباط المتعددة (Correlation Matrix) حسب المجموعة

7.1 حساب الارتباطات لعدة متغيرات نفسية في آن واحد

في معظم التصاميم السيكومترية المتقدمة، لا يقتصر اهتمام الباحث على فحص العلاقة بين متغيرين اثنين فقط، بل يمتد ليشمل تقييم البنية الارتباطية المتبادلة بين شبكة كاملة من المتغيرات والأبعاد النفسية، كما هو الحال في دراسات استكشاف أبعاد الشخصية الخمسة الكبرى، أو دراسة مقاييس الذكاء متعددة القدرات. يتطلب ذلك حساب مصفوفة ارتباط كاملة (Correlation Matrix) ترصد المعاملات البينية بين كل زوج ممكن من المتغيرات العددية المدرجة في النموذج.

تتعاظم أهمية هذا التحليل عندما يُطلب استخراج هذه المصفوفات المتعددة بشكل مستقل لكل مجموعة من المجموعات السكانية أو التجريبية، بغرض فحص ثبات البنية العاملية واستقرار العلاقات عبر الفئات. توفر حزمة dplyr أدوات حديثة وقوية مثل دالة التطبيق عبر الأعمدة المتعددة (across)، والتي تسمح بتحديد نطاق المتغيرات الرقمية المستهدفة وتطبيق العمليات الإحصائية عليها دفعة واحدة استناداً إلى الشروط التجميعية الموضوعة.

إن الانتقال من مستوى التحليل الثنائي البسيط إلى مستوى مصفوفات الارتباط متعددة الأبعاد يوفر رؤية شمولية وعميقة للتفاعلات السلوكية، ويُمهد الطريق لإجراء تحليلات القياس المتقدمة مثل التحليل العاملي التوكيدي متعدد المجموعات (Multigroup CFA) للتأكد من التكافؤ القياسي (Measurement Invariance) لأدوات القياس المستخدمة.

7.2 استخدام دالة group_modify لبناء مصفوفات فرعية

لإنتاج مصفوفات ارتباط كاملة ومنظمة لكل مجموعة فرعية داخل إطار بيانات موحد في R، تبرز دالة التعديل المجمعي (group_modify) كواحدة من أقوى الأدوات وأكثرها كفاءة ومرونة. تتيح هذه الدالة تطبيق دالة برمجية مخصصة ترجع إطار بيانات مستقل لكل مستوى من مستويات المتغير التصنيفي، ثم تقوم بدمج كافة المخرجات في جدول كبير واحد مع الاحتفاظ الصارم بترميز المجموعات.

يقوم الباحث ببناء دالة مخصصة تقوم بعزل المتغيرات الرقمية وتمريرها إلى دالة حساب مصفوفة الارتباط، ثم تحويل المصفوفة الناتجة من شكلها الأساسي إلى إطار بيانات منظم، مع تحويل أسماء الصفوف إلى عمود صريح يُحدد المتغير المقاس. عند دمج هذا البناء مع التجميع الفئوي، تقوم دالة التعديل المجمعي بتكرار هذه العملية الحسابية خلف الكواليس عبر كل فئة تصنيفية، وتجميع المصفوفات الفرعية في هيكل تركيبي متناسق ومصنف بدقة متناهية.

يتميز هذا الأسلوب البرمجي بالتغلب على كافة القيود التركيبية التي تفرضها دوال التلخيص التقليدية، حيث يتيح توليد جداول تحتوي على عدد غير محدود من الصفوف والأعمدة لكل مجموعة فرعية، مما يسهل عمليات الفلترة والاستعلام والفرز اللاحقة لمعاملات ارتباط محددة دون الحاجة إلى تفتيت البيانات إلى كائنات منفصلة في بيئة العمل.

7.3 تصدير وتنسيق مصفوفات الارتباط للأوراق العلمية

لا تكتمل العملية التحليلية إلا بتحويل المخرجات الإحصائية الخام إلى جداول منسقة وجاذبة بصرياً تتوافق مع معايير النشر الأكاديمي الصارمة في المجلات العلمية المحكمة. يتطلب ذلك إزالة المعاملات المكررة في المثلث العلوي للمصفوفة، وتنسيق الأرقام العشرية لتقتصر على منزلتين أو ثلاث منازل، وإضافة رموز النجوم الدالة على مستويات المعنوية الإحصائية بجوار معاملات الارتباط.

توفر حزم متخصصة في R مثل حزمة knitr وحزمة kableExtra وحزمة flextable إمكانات استثنائية لتنسيق جداول الارتباط المجمعة وتحويلها إلى أشكال برمجية جاهزة للتصدير المباشر إلى مستندات Word أو صيغ PDF و LaTeX. تتيح هذه الأدوات إمكانية دمج مصفوفات المجموعات المختلفة في جداول مدمجة ومتجاورة تسهل على القارئ المقارنة الفورية بين الفئات دون تشتت.

بالإضافة إلى ذلك، يمكن تصدير هذه المصفوفات المنظمة إلى ملفات جداول بيانات خارجية مثل صيغ CSV و Excel باستخدام دوال الحفظ القياسية في R، مما يسمح للباحثين بمشاركة نتائجهم مع فرق العمل البحثية أو تضمينها في الملاحق الإحصائية التفصيلية للأطروحات الأكاديمية والتقارير المؤسسية بأعلى معايير الدقة والاحترافية.

8. أساليب برمجية بديلة لحساب الارتباط المجمع في R

8.1 استخدام الدوال الأساسية في R (Base R Functions)

على الرغم من الشعبية الطاغية لمنظومة tidyverse في العصر الحالي، تظل دوال R الأساسية (Base R) تحتفظ بأهمية بالغة وقوة حاسوبية أصيلة تجعل من الضروري لكل باحث متمكن الإحاطة بها وفهم آليات عملها. تتميز دوال Base R بالاستقرار التاريخي المطلق وعدم اعتمادها على أي حزم خارجية قد تتعرض للتحديث أو التغيير، مما يضمن عمل الأكواد المكتوبة بها لعقود طويلة دون أي تعديل.

تُعد دالة التقسيم والتطبيق (by) ودالة الفرز والتجزئة (split) المقترنة بدوال العائلة التكرارية مثل lapply و sapply الأدوات الأساسية لتنفيذ الحسابات المصنفة في Base R. تقوم دالة split بتفكيك إطار البيانات الأصلي إلى قائمة من أطر البيانات المستقلة بناءً على المتغير الفئوي، ثم تقوم دالة التطبيق بتمرير دالة حساب الارتباط على كل عنصر من عناصر تلك القائمة لحساب المعامل لكل فئة على حدة.

على الرغم من أن هذه الأساليب الكلاسيكية قد تتطلب أسطراً برمجية إضافية لإعادة تجميع وتنسيق القوائم الناتجة في جداول مقروءة مقارنة بالصيغ المدمجة الحديثة، إلا أنها توفر فهماً عميقاً للبنية الهيكلية لكائنات لغة R، وتعتبر ذات كفاءة استثنائية في بيئات الحوسبة المصغرة أو الأنظمة البرمجية التي تمنع تثبيت حزم طرف ثالث لأسباب أمنية أو تقنية.

8.2 الحساب السريع للبيانات الضخمة باستخدام data.table

في عصر البيانات الضخمة (Big Data) والمسوح الوطنية والسكانية الكبرى التي تشتمل على ملايين السجلات ومئات المجموعات الفرعية المعقدة، قد تصل الدوال التقليدية إلى حدودها القصوى من حيث استهلاك الذاكرة العشوائية وسرعة المعالجة الزمنية. هنا تبرز حزمة data.table كأسرع محرك لمعالجة البيانات وأكثرها كفاءة في بيئة لغة R على الإطلاق.

تعتمد data.table على بناء تركيبي مقتضب وعالي الكفاءة يجمع بين التصفية، والتعديل، والتجميع داخل أقواس مربعة موحدة وفق البنية الشهيرة التي تحدد الصفوف والأعمدة والمجموعات. يتم حساب الارتباط المجمع في سطر برمجي واحد فائق السرعة يعتمد على التعديل المباشر في الذاكرة دون إنشاء نسخ إضافية من البيانات، مما يمنحها تفوقاً حاسوبياً هائلاً يصل إلى عشرات الأضعاف مقارنة بالحلول البرمجية الأخرى عند التعامل مع قواعد البيانات الضخمة.

يُعد إتقان استخدام data.table مهارة حاسمة للباحثين العاملين في مجالات القياس النفسي السكاني، والجينوم السلوكي، وتحليلات البيانات الضخمة لمنصات التواصل الاجتماعي، حيث تضمن هذه الأداة تنفيذ آلاف حسابات الارتباط المجمعة واستخراج فترات الثقة في أجزاء من الثانية وبأقل استهلاك ممكن لموارد النظام الحاسوبي.

8.3 استخدام حزمة psych ودالة statsBy المتخصصة

تمثل حزمة psych، التي طورها عالم القياس النفسي الشهير ويليام ريفيل (William Revelle)، الذراع التخصصي الأقوى للباحثين في علم النفس والقياس السلوكي في بيئة R. توفر هذه الحزمة دالة فريدة ومتخصصة للغاية هي دالة الإحصاءات المصنفة (statsBy)، والتي صُممت خصيصاً لتلبية متطلبات النمذجة النفسية متعددة المستويات والتحليلات المقارنة بين المجموعات.

لا تقتصر دالة statsBy على مجرد حساب مصفوفة الارتباط لكل مجموعة فرعية، بل تقدم تفكيكاً إحصائياً شاملاً يتماشى مع مفاهيم النمذجة الخطية الهرمية (Hierarchical Linear Modeling). فهي تقوم بحساب معاملات الارتباط داخل المجموعات (Within-group correlations)، ومعاملات الارتباط بين المجموعات (Between-group correlations)، بالإضافة إلى استخراج معاملات الارتباط داخل الفئة (Intraclass Correlation Coefficients – ICC) ومؤشرات التباين وتأثير التجميع.

يعد هذا التفكيك المتطور بالغ الأهمية في الدراسات التربوية والاجتماعية التي يتم فيها جمع البيانات في بيئات متداخلة، مثل دراسة الطلاب داخل الفصول الدراسية، أو الموظفين داخل الأقسام المؤسسية. تتيح مخرجات هذه الدالة للباحث التمييز بدقة بين العلاقات القائمة على مستوى الأفراد وتلك القائمة على مستوى البنى الجماعية، مما يمنع الوقوع في المغالطة البيئية (Ecological Fallacy) ويوفر أساساً نظرياً متيناً للقياس متعدد المستويات.

9. التمثيل البياني للارتباطات عبر المجموعات باستخدام ggplot2

9.1 رسم مخططات التشتت متعددة الفئات (Faceted Scatter Plots)

يُعد التمثيل البياني خطوة لا غنى عنها في استكشاف العلاقات الارتباطية وفهم السلوك الهندسي لتوزيع البيانات، حيث يتيح الرصد البصري الفوري للأنماط الخطية، والتشتت، والشذوذ الذي قد تعجز الأرقام المجردة عن إبرازه بوضوح. تُعد حزمة ggplot2 الأداة الرائدة عالمياً لإنشاء الرسوم البيانية الإحصائية بناءً على فلسفة قواعد الرسم البياني (Grammar of Graphics).

لتمثيل الارتباطات المجمعة، يُعد مخطط التشتت متعدد اللوحات (Faceted Scatter Plot) الأسلوب الأكثر فاعلية وأناقة. باستخدام دالة تقسيم اللوحات الملتفة (facet_wrap) أو دالة الشبكة اللوحية (facet_grid)، يقوم الباحث بإنشاء مخططات تشتت متجاورة ومنفصلة لكل مستوى من مستويات المتغير التصنيفي، مع الحفاظ على مقاييس محاور موحدة تتيح المقارنة البصرية الدقيقة والمباشرة بين المجموعات الفرعية.

يتيح ربط المتغيرات التصنيفية بالسمات الجمالية للمخطط، مثل تخصيص ألوان وأشكال هندسية مختلفة للنقاط لكل فئة، إبراز التباين في كثافة وتوزيع الدرجات بين المجموعات. يضمن التخصيص الاحترافي لعناوين المحاور، وشبكات الخلفية، وخطوط النصوص توافق الأشكال البيانية الناتجة مع أدلة النشر العلمي ومتطلبات التقارير الأكاديمية الرفيعة.

9.2 إضافة خطوط الانحدار ومعاملات الارتباط لكل فئة

لتعزيز القيمة التفسيرية لمخططات التشتت متعددة اللوحات، يتم تضمين خطوط الاتجاه والانحدار الخطي (Linear Regression Lines) وفترات الثقة المصاحبة لها لكل مجموعة فرعية على حدة. يُنفذ ذلك عبر استدعاء دالة التنعيم الهندسي وتحديد طريقة النمذجة بالنموذج الخطي المباشر داخل حزمة ggplot2.

يقوم هذا الإجراء برسم خط انحدار يوضح اتجاه وميل العلاقة الارتباطية داخل كل لوحة فرعية، محاطاً بنطاق مظلل يمثل فترات الثقة بنسبة 95% لخط الانحدار، مما يعطي انطباعاً بصرياً فورياً عن دقة التقدير ودرجة عدم اليقين الإحصائي المصاحبة لحجم العينة داخل كل فئة. تبرز الفروق الجوهرية بوضوح عندما تختلف ميول خطوط الانحدار بين اللوحات، كأن يكون الخط صاعداً بانحدار حاد في مجموعة، وأفقياً تماماً أو هابطاً في مجموعة أخرى.

علاوة على ذلك، توفر حزم مساعدة متقدمة مثل ggpubr دالة إحصائية متميزة هي دالة إضافة إحصاءات الارتباط (stat_cor)، والتي تقوم تلقائياً بحساب قيمة معامل الارتباط وقيمة الدلالة الاحتمالية وطباعتها كنص منسق وأنيق داخل كل لوحة فرعية مباشرة. يمنح هذا الدمج البصري والإحصائي القارئ فهماً فورياً وشاملاً للعلاقة دون الحاجة للتنقل بين الرسوم والجداول النصية المستقلة.

9.3 تصميم الخرائط الحرارية (Correlation Heatmaps) المقارنة

عندما يتسع نطاق التحليل ليشمل مصفوفات ارتباط متعددة المتغيرات عبر عدة مجموعات فرعية، تصبح مخططات التشتت الفردية غير كافية لتقديم نظرة شمولية مكثفة. في هذه الحالة، تمثل الخرائط الحرارية للارتباط (Correlation Heatmaps) الأداة البصرية المثالية لعرض ومقارنة المصفوفات المعقدة في مساحة بصرية موحدة ومحكمة.

يتم بناء الخرائط الحرارية في R عن طريق تحويل مصفوفات الارتباط المجمعة إلى نسق البيانات الطولية المنظمة، ثم استخدام البناء الهندسي للبلاطات الملونة في ggplot2. يتم ربط قيمة معامل الارتباط بتدرج لوني ثنائي القطب (Diverging Color Palette)، بحيث يُخصص لون محدد (كالأزرق الداكن مثلاً) للارتباطات الموجبة القوية، ولون معاكس (كاللون الأحمر الداكن) للارتباطات السالبة القوية، مع بقاء اللون الأبيض أو المحايد ممثلاً للارتباطات الصفرية أو المنعدمة.

يتيح تقسيم الخريطة الحرارية إلى لوحات فرعية مقارنة سريعة للبنى الارتباطية بين مختلف العينات الإكلينيكية وغير الإكلينيكية، أو بين الذكور والإناث. يستطيع الباحث من خلال مسح بصري سريع اكتشاف كتل المتغيرات المترابطة بإحكام (Correlation Clusters) وتحديد الأبعاد النفسية التي يتغير سلوكها الارتباطي عبر الفئات، مما يوفر أداة استكشافية وتشخيصية فائقة القوة في أبحاث القياس السلوكي.

10. تطبيقات ودراسات حالة في القياس النفسي والعلوم السلوكية

10.1 دراسة العلاقة بين القلق والأداء الأكاديمي حسب المستوى الدراسي

تُعد العلاقة بين القلق المعرفي والتحصيل الأكاديمي من الموضوعات الكلاسيكية في علم النفس التربوي، والتي توفر أرضية خصبة لتطبيق تحليل الارتباط المصنف حسب المجموعة. تفترض النظريات السيكولوجية الحديثة أن طبيعة هذه العلاقة ليست ثابتة بل تتأثر بالنضج المعرفي والخبرة الأكاديمية المتراكمة للطلاب عبر مراحلهم الدراسية المختلفة من المرحلة الابتدائية وحتى الدراسات العليا.

في هذه الدراسة التطبيقية، يتم استخدام قاعدة بيانات نفسية تشتمل على درجات مقياس قلق الاختبار والدرجات التراكمية للتحصيل الأكاديمي لعينة واسعة مصنفة حسب المستوى الدراسي. باستخدام دوال التجميع والتلخيص في dplyr، يتم حساب معامل ارتباط بيرسون واختبار دلالته الإحصائية وفترات الثقة لكل مستوى دراسي بشكل مستقل ومقارن.

تكشف المخرجات التحليلية الميدانية في كثير من الأحيان عن نمط ديناميكي لافت؛ حيث يظهر ارتباط سلبي حاد ودال إحصائياً بين القلق والتحصيل لدى طلاب المراحل المبكرة ناتج عن غياب مهارات التعامل مع الضغوط، بينما يتراجع هذا الارتباط تدريجياً في المراحل الجامعية المتقدمة ليقترب من الصفر أو يتحول إلى ارتباط طردي خفيف لدى طلاب الدراسات العليا، حيث يعمل القلق المعتدل كحافز للإنجاز. يؤكد هذا التطبيق استحالة فهم هذه الظاهرة التربوية المعقدة دون تفكيك العينة إلى مجموعاتها البنيوية الحقيقية.

10.2 فحص الارتباط بين الاحتراق النفسي والرضا الوظيفي حسب بيئة العمل

يمثل الاحتراق النفسي المهني (Job Burnout) تحدياً كبيراً للصحة النفسية في بيئات العمل الحديثة، وترتبط أبعاده، كالإجهاد الانفعالي والتبلد الشعوري، ارتباطاً وثيقاً بمستويات الرضا الوظيفي والإنتاجية. ومع ذلك، فإن طبيعة الضغوط وشدة التفاعل بين هذه المتغيرات تتباين جذرياً بين القطاعات المهنية المختلفة كالمؤسسات الصحية، والتعليمية، والشركات التكنولوجية الخاصة.

لتطبيق التحليل المجمع في هذا السياق التنظيمي، تُقسّم عينة الموظفين حسب قطاع العمل، ويتم حساب مصفوفات الارتباط البينية بين أبعاد مقياس ماسلاش للاحتراق النفسي ومؤشرات مقياس الرضا الوظيفي العام. توظف لغة R لاستخراج معاملات الارتباط ومقارنة أحجام الآثار بين مختلف القطاعات بصورة إحصائية دقيقة.

تُظهر نتائج التحليل المصنف أن الارتباط السلبي بين الإجهاد الانفعالي والرضا الوظيفي يبلغ ذروته لدى العاملين في القطاع الصحي والطبي نتيجة لطبيعة العمل المشحونة عاطفياً، بينما يكون هذا الارتباط أقل وطأة في القطاعات التقنية التي تتأثر بالبيئة المادية وحوافز الإنجاز. تتيح هذه النتائج التفصيلية لمستشاري الصحة النفسية المهنية تصميم برامج تدخل وقائية مخصصة تستهدف الاحتياجات الحقيقية لكل بيئة عمل على حدة بدلاً من تطبيق سياسات عامة غير مجدية.

10.3 مقارنة استجابات المجموعات التجريبية والضابطة في التدخلات العلاجية

في تصاميم البحوث التجريبية والإكلينيكية الرامية إلى تقييم فاعلية البرامج العلاجية والتدخلات النفسية السلوكية، يُعد قياس ثبات واستقرار العلاقات بين درجات القياس القبلي (Pre-test) والقياس البعدي (Post-test) عبر المجموعات التجريبية والضابطة ركيزة أساسية للحكم على الأثر العلاجي المستقل.

باستخدام لغة R، يتم تجميع البيانات وفق نوع المجموعة (مجموعة تجريبية خضعت للعلاج المعرفي السلوكي مقابل مجموعة ضابطة في قائمة الانتظار)، وحساب معامل الارتباط بين درجات شدة الأعراض قبل البرنامج وبعده. في المجموعة الضابطة، يُتوقع وجود ارتباط طردي قوي وموجب يعكس استقرار درجات الأفراد وثبات مسار الاضطراب في غياب التدخل العلاجي الفعال.

في المقابل، يؤدي التدخل العلاجي الناجح في المجموعة التجريبية إلى إحداث تغييرات متباينة في درجات الأفراد تعتمد على استجابتهم الفردية للعلاج، مما ينعكس إحصائياً في انخفاض قيمة معامل الارتباط بين القياسين القبلي والبعدي أو تغير بنيته تماماً مقارنة بالمجموعة الضابطة. يوفر هذا التحليل المقارن مؤشراً سيكومترياً بالغ الأهمية يدعم مؤشرات الفروق في المتوسطات ويؤكد فاعلية البرنامج الإكلينيكي في كسر النمط السلوكي المستقر للاضطراب.

11. مفارقة سيمبسون (Simpson’s Paradox) والاعتبارات المنهجية المتقدمة

11.1 مفهوم مفارقة سيمبسون ومخاطر التحليل التجميعي الإجمالي

تُمثل مفارقة سيمبسون (Simpson’s Paradox) واحدة من أعمق وأخطر المعضلات الإحصائية والمنهجية في تحليل البيانات الكمية، وهي ظاهرة إحصائية بالغة الغرابة يظهر فيها اتجاه ارتباطي واضح ومحدد (موجب أو سالب) عند تحليل البيانات المجمعة ككتلة واحدة، ولكنه ينعكس تماماً أو يختفي كلياً عند تقسيم نفس البيانات إلى مجموعاتها الفرعية المكونة لها.

تنشأ هذه المفارقة الرياضية نتيجة وجود متغيرات مربكة أو كامنة (Confounding Variables) غير مرئية أو لم يتم ضبطها في النموذج الإحصائي الأولي، وتكون هذه المتغيرات مرتبطة في آن واحد بكل من المتغير المستقل والمتغير التابع، فضلاً عن اختلاف توزيعها وتكرارها بين المجموعات الفرعية. يؤدي تجاهل المتغير التصنيفي في هذه الحالة إلى حساب انحدار زائف يعكس الفروق بين المجموعات بدلاً من قياس العلاقة الحقيقية داخل المجموعات.

تزخر الأدبيات الطبية والسيكولوجية بأمثلة واقعية كارثية ناجمة عن الوقوع في هذه المفارقة؛ فقد يُظهر التحليل الإجمالي الشامل أن استخدام دواء أو تدخل نفسي معين يرتبط بارتفاع معدلات التدهور والانتكاس، في حين يكشف التحليل المصنف حسب شدة المرض أن الدواء يحقق تحسناً كبيراً داخل كل فئة مرضية على حدة (الحالات الخفيفة والحالات الحرجة)، وإنما ظهر الارتباط الإجمالي السلبي لأن الأطباء وصفوا الدواء بكثافة لمرضى الحالات الحرجة جداً. إن إغفال تحليل المجموعات في مثل هذه السياقات يقود إلى قرارات علاجية وبحثية مضللة تماماً.

11.2 كشف وتوضيح المفارقة عملياً في R

توفر بيئة R منصة مثالية لكشف وتوضيح مفارقة سيمبسون بالأدلة الحسابية والبيانية القاطعة. تبدأ خطوات التحقيق بحساب معامل الارتباط الكلي على كامل العينة المدمجة باستخدام دالة الارتباط المباشرة، وملاحظة الإشارة والقيمة الناتجة. تليها خطوة تطبيق التحليل المجمع باستخدام دالتي group_by و summarize لفحص المعاملات داخل كل طبقة تصنيفية على حدة.

عندما تقع المفارقة، يلاحظ الباحث صدمة إحصائية واضحة؛ كأن يكون معامل الارتباط الكلي موجباً ودالاً إحصائياً بقيمة 0.50، في حين تكون جميع معاملات الارتباط داخل المجموعات الفرعية سالبة تماماً بقيم تدور حول -0.40. يثبت هذا التناقض الصريح أن الاتجاه الإجمالي الملاحظ ما هو إلا أثر زائف ناجم عن الفروق في متوسطات المجموعات وليس انعكاساً للعلاقة السيكولوجية بين المتغيرين على مستوى الأفراد.

يتم توضيح هذه المفارقة هندسياً بشكل ساحر باستخدام مخططات ggplot2، حيث يتم رسم خط انحدار إجمالي أسود يمتد عبر كامل سحابة النقاط ليظهر ميلاً صاعداً، وتتداخل معه خطوط انحدار ملونة ومستقلة لكل مجموعة فرعية تُظهر ميولاً هابطة بشكل متوازٍ. يُعد هذا التمثيل البصري القاطع أفضل وسيلة تعليمية ومنهجية لترسيخ الوعي بمخاطر التحليلات التجميعية العمياء وأهمية التحليل المصنف حسب المجموعة.

11.3 اختبار الفروق ذات الدلالة الإحصائية بين معاملات الارتباط المستقلة

عند ملاحظة اختلاف قيم معاملات الارتباط المحسوبة بين مجموعتين فرعيتين مستقلتين (مثل الذكور والإناث)، لا يجوز للباحث الاكتفاء بالمقارنة البصرية أو الوصفية للأرقام للادعاء بوجود فروق حقيقية بين الجنسين؛ إذ قد يكون هذا الاختلاف الظاهري مجرد تذبذب عشوائي ناتج عن خطأ المعاينة (Sampling Error). يتطلب التحقق العلمي الصارم اختبار ما إذا كان الفرق بين المعاملين دالاً إحصائياً.

نظراً لأن توزيع العينات لمعامل ارتباط بيرسون ليس توزيعاً طبيعياً، لا سيما عندما تبتعد قيمة المعامل عن الصفر، يتم اللجوء إلى تطبيق تحويل فيشر الرياضي Z الشهير (Fisher’s r-to-z transformation). يقوم هذا التحويل بتحويل معاملات الارتباط إلى قيم Z ذات توزيع طبيعي معياري ثابت الخطأ المعياري، مما يتيح حساب إحصائي الفرق واختبار دلالته الإحصائية بدقة متناهية.

في بيئة R، توفر حزمة psych دالة مخصصة وبارعة هي دالة اختبار معاملات الارتباط (r.test)، والتي تقبل معاملات الارتباط وأحجام العينات للمجموعتين المستقلتين وتقوم بحساب قيمة تحويل فيشر Z، والقيمة الاحتمالية الدالة للفرق بينهما. إذا كانت القيمة الاحتمالية أصغر من مستوى الدلالة المعتمد (0.05)، يستنتج الباحث بيقين إحصائي أن العلاقة الارتباطية تختلف جوهرياً بين المجموعتين في المجتمع الأصلي، مما يؤكد وجود أثر معدل حقيقي للمتغير التصنيفي.

12. توثيق النتائج وفق معايير APA واستكشاف الأخطاء البرمجية الشائعة

12.1 صياغة تقارير الارتباط المجمعة وفق دليل APA (الإصدار السابع)

تفرض جمعية علم النفس الأمريكية (APA) في دليلها السابع للنشر معايير بالغة الدقة لتسجيل وتوثيق المعاملات والاختبارات الإحصائية في المتن الأكاديمي وفي الجداول الإحصائية الملحقة. عند كتابة تقارير معاملات الارتباط المصنفة، يجب توثيق قيمة معامل الارتباط مائلة، متبوعة بدرجات الحرية بين قوسين، ثم علامة التساوي، ثم قيمة المعامل مقربة إلى منزلتين عشريتين دون كتابة الصفر قبل الفاصلة العشرية، يتبعها مستوى الدلالة الاحتمالية وفترات الثقة بنسبة 95% بدقة تامة.

في متن التقرير، تتم صياغة النتائج بلغة علمية مقارنة ومحكمة؛ كأن يُذكر: “أظهرت النتائج وجود ارتباط طردي دال إحصائياً بين الكفاءة الذاتية والتحصيل الدراسي لدى مجموعة الذكور، في حين لم يصل هذا الارتباط إلى مستوى الدلالة لدى مجموعة الإناث”. يجب أن يدعم النص بالإحصاءات الدقيقة لكل مجموعة متضمنة حجم العينة الفعلي المستخدم بعد معالجة الفقد.

في جداول النتائج، تُدرج مصفوفات الارتباط المجمعة بوضوح، مع وضع خطوط أفقية تفصل رأس الجدول وأسفله وفق نسق APA الخالي تماماً من الخطوط الرأسية. تُذيل الجداول بملاحظات توضيحية تحدد مستويات الدلالة الإحصائية المرموز لها بالنجوم، واستراتيجية معالجة القيم المفقودة المتبعة، مما يضمن خروج البحث بالصورة الاحترافية المعتمدة في كبريات الدوريات العالمية المحكمة.

12.2 معالجة الأخطاء البرمجية الشائعة (Troubleshooting and Debugging)

أثناء تنفيذ حسابات الارتباط المجمعة في R، قد يواجه الباحثون رسائل خطأ برمجية أو تحذيرات إحصائية ناتجة عن خلل في خصائص البيانات داخل إحدى المجموعات الفرعية. من أكثر هذه الأخطاء شيوعاً خطأ عدم كفاية حجم العينة (Sample size too small)، والذي يحدث عندما تتضمن إحدى المجموعات المصنفة مشاركين اثنين فقط أو أقل، مما يجعل حساب التباين والارتباط مستحيلاً رياضياً ويؤدي إلى توقف الدالة.

الخطأ الشائع الآخر هو مشكلة التباين الصفري (Zero Variance / Standard Deviation is Zero)، والتي تحدث عندما يقدم جميع أفراد مجموعة فرعية معينة نفس الاستجابة تماماً على أحد المقاييس، كأن يحصل الجميع على الدرجة القصوى. يؤدي انعدام التباين إلى جعل المقام صفراً في معادلة الارتباط الرياضية، مما ينتج قيمة غير معينة (NaN). يجب على الباحث تتبع هذه المتغيرات مسبقاً وتطبيق دوال التحقق من التباين قبل تشغيل دوال الارتباط المجمعة.

كما ينبغي الحذر من الأخطاء الناجمة عن عدم تطابق أنواع البيانات، مثل محاولة تمرير متغير نصي أو عامل كمتغير رقمي داخل دالة الارتباط، أو وجود مستويات تصنيفية فارغة (Empty Factor Levels) لا تحوي أي مشاهدات. يتم حل هذه الإشكالات باستخدام دوال إسقاط المستويات غير المستخدمة والتحويل القسري الآمن للمتغيرات إلى الصيغ العددية المناسبة لضمان تنفيذ الأكواد دون انقطاع.

12.3 أفضل الممارسات لضمان قابلية إعادة الإنتاج والكفاءة الحاسوبية

لضمان أعلى درجات الموثوقية العلمية والكفاءة البرمجية في المشاريع البحثية الإحصائية الكبرى، يجب على الباحثين الالتزام الصارم بقواعد البرمجة النظيفة والتوثيق المستمر. يتضمن ذلك كتابة تعليقات شارحة ومفصلة ترافق كل كتلة برمجية، وتوضح الأهداف المنهجية والمعادلات المطبقة، وتحديد أرقام الإصدارات لكافة الحزم المستخدمة في بيئة العمل لضمان توافقها المستقبلي.

يُعد الاعتماد على بيئات النشر الديناميكي الحديثة مثل R Markdown و Quarto المعيار الذهبي لإعداد التقارير العلمية القابلة لإعادة الإنتاج الكامل. تتيح هذه الأدوات دمج النصوص الأكاديمية والشفرات البرمجية ومخرجات الجداول والرسوم البيانية في ملف توثيقي واحد ومترابط، بحيث يؤدي أي تعديل مستقبلي في قاعدة البيانات إلى تحديث تلقائي وفوري لكافة الأرقام والجداول والرسوم المضمنة في التقرير دون أي تدخل يدوي.

أخيراً، يُنصح بتنظيم بنية المشروع البحثي في مجلدات معيارية تفصل بين البيانات الخام، وشفرات المعالجة والتنظيف، وشفرات التحليل الإحصائي، والمخرجات النهائية الجاهزة للنشر. يسهم هذا الانضباط الهيكلي في تعزيز الكفاءة الحاسوبية، وتسهيل التعاون الأكاديمي بين الفرق البحثية، وترسيخ أعلى معايير الشفافية والنزاهة العلمية في مجتمعات البحث السيكومتري والسلوكي.

خاتمة

استعرض هذا الدليل المتعمق الأبعاد النظرية والتطبيقية لحساب معاملات الارتباط وتفسيرها حسب المجموعات الفرعية في بيئة البرمجة الإحصائية R. من خلال الربط المنهجي بين النظريات السيكومترية وخوارزميات المعالجة الحديثة في منظومة tidyverse والحزم الإحصائية المتخصصة، تم تقديم مسار إجرائي متكامل يضمن دقة النمذجة وتفادي التعميمات الخاطئة في البحوث السلوكية والاجتماعية.

لقد أثبتت المعالجات التفصيلية المطروحة أن تقسيم البيانات واختبار العلاقات الارتباطية عبر الطبقات التصنيفية ليس مجرد ترف برمجى أو خطوة تحليلية إضافية، بل هو ضرورة منهجية حاسمة تمنع الوقوع في المزالق الإحصائية الجسيمة مثل مفارقة سيمبسون، وتكشف عن التباينات الجوهرية في البنى النفسية بين مختلف الفئات السكانية والتجريبية. إن إتقان هذه المهارات المتقدمة في R يمنح الباحثين القدرة على استنطاق بياناتهم بعمق، وتقديم براهين كمية رصينة تعزز من موثوقية المعرفة العلمية وصدقها التطبيقي.

References

  • American Psychological Association. (2020). Publication manual of the American Psychological Association (7th ed.). American Psychological Association. https://doi.org/10.1037/0000165-000
  • Field, A., Miles, J., & Field, Z. (2012). Discovering statistics using R. SAGE Publications.
  • Revelle, W. (2023). psych: Procedures for psychological, psychometric, and personality research (R package version 2.3.9). Northwestern University. https://CRAN.R-project.org/package=psych
  • Robinson, D., Hayes, A., & Couch, S. (2023). broom: Convert statistical analysis objects into tidy tibbles (R package version 1.0.5). https://CRAN.R-project.org/package=broom
  • Wickham, H., Averick, M., Bryan, J., Chang, W., McGowan, L. D., François, R., Grolemund, G., Hayes, A., Henry, L., Hester, J., Kuhn, M., Pedersen, T. L., Miller, E., Bache, S. M., Müller, K., Ooms, J., Robinson, D., Seidel, D. P., Spinu, V., … Yutani, H. (2019). Welcome to the Tidyverse. Journal of Open Source Software, 4(43), 1686. https://doi.org/10.21105/joss.01686
  • Wickham, H., & Grolemund, G. (2017). R for data science: Import, tidy, transform, visualize, and model data. O’Reilly Media. https://r4ds.had.co.nz/

اقتباس هذا المقال

looti, M. (2026, سبتمبر 1). كيفية حساب الارتباط حسب المجموعة في R. عرب سايكلوجي. https://arabpsychology.com/statistics/how-to-calculate-correlation-by-group-in-r/
looti, Mohammed. “كيفية حساب الارتباط حسب المجموعة في R.” عرب سايكلوجي, 1 سبتمبر 2026, https://arabpsychology.com/statistics/how-to-calculate-correlation-by-group-in-r/.
looti, Mohammed. “كيفية حساب الارتباط حسب المجموعة في R.” عرب سايكلوجي. سبتمبر 1, 2026. https://arabpsychology.com/statistics/how-to-calculate-correlation-by-group-in-r/.