يحتل الإحصاء الوصفي مكانة ركيزة لا غنى عنها في بنية التحليل الإحصائي الحديث، إذ يمثل البوابة المنهجية الأولى التي يعبر من خلالها الباحثون وعلماء البيانات لاستكشاف الخصائص البنيوية للمتغيرات قيد الدراسة. وفي ظل تزايد تعقيد البيانات السلوكية والنفسية والبيولوجية، باتت المقاييس التقليدية المعتمدة على الافتراضات البارامترية، مثل المتوسط الحسابي والانحراف المعياري، غير كافية بمفردها لتقديم صورة صادقة وشاملة عن الواقع التجريبي، نظراً لحساسيتها الشديدة للقيم الشاذة والالتواءات التوزيعية. من هنا برزت الحاجة إلى أدوات استكشافية متينة (Robust) وغير معلمية تمنح الباحث رؤية دقيقة وعميقة للبنية التوزيعية دون الانجراف وراء التشوهات الإحصائية.
يعد ملخص الأرقام الخمسة (Five-Number Summary) واحداً من أهم هذه الابتكارات المنهجية التي صاغها علم الإحصاء الاستكشافي، حيث يقدم هذا الملخص إطاراً رياضياً مختزلاً يعتمد على خمس قيم موضعية تعكس بدقة متناهية كلاً من النزعة المركزية، والتشتت، ونطاق الانتشار، وشكل التوزيع العام. وتزداد القيمة العلمية لهذا المفهوم عند تطبيقه برمجياً باستخدام لغة برمجة متخصصة في الحوسبة الإحصائية مثل بيئة R الإحصائية، التي تتيح ترسانة متكاملة من الدوال الأساسية والمتقدمة لحساب هذه القيم بدقة متناهية، وتحويلها إلى مصفوفات وجداول ونماذج بصرية تسهم في تعميق الفهم الظاهراتي للبيانات.
يهدف هذا المقال الأكاديمي الموسع إلى تقديم دليل معرفي وتطبيقي شامل حول كيفية حساب وفحص وتفسير ملخص الأرقام الخمسة في بيئة R، من خلال تفكيك أصوله النظرية، وتشريح خوارزمياته الحسابية، واستعراض المقارنات الدقيقة بين الدوال البرمجية المختلفة مثل fivenum وsummary وquantile. كما يتناول المقال المعالجة الإحصائية المتقدمة للبيانات المفقودة، وتحليل المجموعات المقارنة، والربط العضوي بين الملخص والمخططات الصندوقية، وكشف القيم الشاذة، وصولاً إلى صياغة التقرير الإحصائي النهائي وفق معايير جمعية علم النفس الأمريكية (APA)، ليكون هذا المرجع دليلاً شاملاً للباحثين والمحللين وطلاب الدراسات العليا.
- 1. مقدمة نظرية إلى ملخص الأرقام الخمسة في الإحصاء الوصفي
- 2. المكونات الرياضية الخمسة: التحديد والتحليل
- 3. أهمية ملخص الأرقام الخمسة في أبحاث العلوم السلوكية والقياس النفسي
- 4. الدالة الأساسية fivenum() في بيئة R: البنية والآلية
- 5. أمثلة تطبيقية: حساب ملخص الأرقام الخمسة للمتجهات العددية
- 6. المقارنة بين الدوال: fivenum() مقابل summary() و quantile()
- 7. تطبيق ملخص الأرقام الخمسة على أطر البيانات (Data Frames)
- 8. التعامل مع القيم المفقودة (Missing Data – NA) في التحليل
- 9. حساب ملخص الأرقام الخمسة حسب المجموعات والفئات (Group-by Analysis)
- 10. التمثيل البياني لملخص الأرقام الخمسة: المخطط الصندوقي (Boxplot)
- 11. كشف وتشخيص القيم الشاذة (Outliers) اعتماداً على الملخص الخماسي
- 12. أفضل الممارسات والأخطاء الشائعة في حساب وتفسير ملخص الأرقام الخمسة
- خاتمة
- References
1. مقدمة نظرية إلى ملخص الأرقام الخمسة في الإحصاء الوصفي
1.1 مفهوم ملخص الأرقام الخمسة وأصله التاريخي
تعود الجذور التاريخية لمفهوم ملخص الأرقام الخمسة إلى أواخر سبعينيات القرن العشرين، وتحديداً إلى العمل الرائد الذي قدمه عالم الإحصاء الأمريكي الفذ جون توكي (John W. Tukey) في كتابه المرجعي التأسيسي “Exploratory Data Analysis” الصادر عام 1977. كان توكي يسعى إلى إحداث ثورة منهجية في الممارسات الإحصائية السائدة، من خلال تحويل التركيز من مجرد اختبار الفرضيات الصارم وتأكيد النماذج المسبقة (Confirmatory Data Analysis) إلى استكشاف البيانات بحرية وفهم الأنماط الكامنة فيها قبل فرض أي قيود رياضية جائرة.
يُعرَّف ملخص الأرقام الخمسة في الأدبيات الإحصائية بأنه أداة تلخيصية غير معلمية (Non-parametric Summary) تتألف من خمس نقاط موضعية مرتبة تصاعدياً هي: القيمة الصغرى (Minimum)، والربيع الأول أو الأدنى (First Quartile – Q1)، والوسيط أو الربيع الثاني (Median – Q2)، والربيع الثالث أو الأعلى (Third Quartile – Q3)، والقيمة القصوى (Maximum). تكمن عبقرية هذا التشكيل الخماسي في قدرته الفائقة على تجريد مئات أو آلاف المشاهدات في خمس قيم حاسمة تلخص في طياتها موقع المركز، ودرجة الانتشار للنصف الأوسط من البيانات، والمدى الكلي للظاهرة، مع الكشف الفوري عن أي اختلال في تماثل التوزيع التكراري.
إن الأهمية الإبستيمولوجية لهذا الملخص تنبع من كونه لا يفترض أي توزيع احتمالي محدد للبيانات، مما يجعله صالحاً للتطبيق على كافة المتغيرات الكمية المستمرة والرتبية واسعة المدى. ويوفر هذا الملخص صورة موجزة وسريعة تمكن المحلل من قراءة سلوك العينة واستنباط خصائصها الأساسية في ثوانٍ معدودة، مما يجعله نقطة الانطلاق الإجبارية لأي بروتوكول تحليلي رصين في الأبحاث الأكاديمية والتطبيقية المعاصرة.
1.2 المقارنة بين المقاييس المعلمية وغير المعلمية في تلخيص البيانات
اعتاد التحليل الإحصائي التقليدي الاعتماد شبه المطلق على مقياسين معلميين أساسيين هما المتوسط الحسابي (Arithmetic Mean) كمؤشر للنزعة المركزية، والانحراف المعياري (Standard Deviation) كمؤشر للتشتت. ورغم الأناقة الرياضية لهذين المقياسين وخصائصهما الجبرية المميزة، إلا أنهما يعانيان من نقطة ضعف جوهرية تتمثل في هشاشتهما الشديدة (Lack of Robustness) إزاء الانتهاكات التوزيعية، ولا سيما عند وجود التواءات حادة (Skewness) أو قيم متطرفة شاذة (Outliers) ناتجة عن تباينات بيولوجية أو أخطاء في القياس والتسجيل.
تتجلى متانة (Robustness) ملخص الأرقام الخمسة في اعتماده على الترتيب الموضعي للمشاهدات (Rank-based/Order Statistics) بدلاً من قيمها الجبرية التراكمية. فالوسيط الإحصائي يمتلك نقطة انهيار (Breakdown Point) تبلغ 50%، مما يعني أن نصف المشاهدات يمكن أن تتغير أو تتطرف إلى اللانهاية دون أن ينهار الوسيط أو ينجرف بعيداً عن مركز الثقل الحقيقي للعينة، في حين أن المتوسط الحسابي يمتلك نقطة انهيار تبلغ صفرية (1/n)، حيث يمكن لقيمة شاذة واحدة أن تسحب المتوسط بأكمله وتجعله غير ممثل لأغلبية أفراد العينة.
وبناءً على ذلك، تبرز دواعي استخدام الملخص الإحصائي الخماسي كبديل لا غنى عنه للمقاييس التقليدية في حالات متعددة، منها: صغر حجم العينات التجريبية، وعدم تماثل التوزيعات التكرارية، ووجود ذيول طويلة (Heavy Tails) في التوزيع، والتعامل مع مقاييس التقدير الذاتي النفسية. يقدم الملخص للباحث ضمانة إحصائية تحميه من الوقوع في فخ التفسيرات المضللة التي قد تنشأ عن الاعتماد الحصري على المتوسط والانحراف المعياري.
1.3 دور التحليل الاستكشافي في الدراسات النفسية والسلوكية
تتسم المتغيرات في العلوم النفسية والسلوكية، مثل القلق، والذكاء، والرضا الوظيفي، والأداء المعرفي، بدرجة عالية من التعقيد والتنوع الداخلي، حيث نادراً ما تتبع هذه السمات توزيعاً طبيعياً معيارياً مثالياً في العينات الميدانية. يلعب التحليل الاستكشافي للبيانات دوراً حاسماً في فحص الخصائص المترية والخصائص السيكومترية لدرجات المقاييس النفسية قبل الشروع في تطبيق الاختبارات الإحصائية الاستدلالية البارامترية، مثل اختبار ت (t-test) أو تحليل التباين (ANOVA).
يتيح تقييم اعتدالية التوزيع للسمات السلوكية عبر ملخص الأرقام الخمسة للباحث النفسي رؤية واضحة لتكدس الدرجات، وما إذا كانت تعاني من ظواهر سيكومترية شائعة مثل “تأثير السقف” (Ceiling Effect) حيث تتجمع الدرجات قرب الحد الأقصى، أو “تأثير الأرضية” (Floor Effect) حيث تنخفض درجات معظم الأفراد نحو الحد الأدنى. هذه المؤشرات الموضعية توفر أرضية صلبة لتحديد ما إذا كان المقياس قادراً على التمييز بين المستويات المختلفة للسمة المقاسة عبر المدى الكامل للمستجيبين.
علاوة على ذلك، يسهم الملخص في استكشاف التباينات الفردية الدقيقة في العينات الإكلينيكية والتجريبية، إذ يسمح بمقارنة الأرباع التوزيعية بدقة للكشف عن الفئات الفرعية ذات الاستجابات الاستثنائية، مما يعزز الفهم الإكلينيكي للحالات الفردية داخل السياق الجمعي للعينة، ويمنع التغاضي عن الظواهر السلوكية النادرة التي غالباً ما يطمسها المتوسط الحسابي الإجمالي.
2. المكونات الرياضية الخمسة: التحديد والتحليل
2.1 القيمة الصغرى (Minimum) والقصوى (Maximum)
تمثل القيمة الصغرى (Minimum) رياضياً أدنى قيمة مرصودة في فضاء العينة المرتبة، ويرمز لها إحصائياً بالرمز $X_{(1)}$، بينما تمثل القيمة القصوى (Maximum) أعلى قيمة مرصودة في فضاء العينة ويرمز لها بالرمز $X_{(n)}$، حيث يمثل $n$ حجم العينة الكلي. تُشكل هاتان النقطتان الحدود الخارجية المطلقة للتوزيع التكراري، وتحددان النطاق الكلي الذي تنتشر فيه المشاهدات الفعلية للمتغير المقاس.
من خلال هاتين القيمتين، يُستخرج المدى الكلي للبيانات (Range) عبر المعادلة الخطية البسيطة: $Range = Ma\ximum – Minimum$. على الرغم من سهولة حسابه، يقدم المدى مؤشراً أولياً بالغ الأهمية حول اتساع الظاهرة قيد القياس، ويعد خط الدفاع الأول لاكتشاف أخطاء إدخال البيانات؛ فإذا كانت درجات اختبار نفسي تتراوح نظرياً بين 0 و100، وظهور قيمة صغرى سالبة أو قيمة قصوى تتجاوز 100 يعد مؤشراً قاطعاً على وجود خطأ منهجي أو خطأ في الترميز يتطلب المعالجة الفورية.
كما يتأثر تحديد هاتين القيمتين بحدود أدوات القياس المستخدمة، ولا سيما في مقاييس ليكرت (Likert Scales) ومقاييس التقدير المتدرجة. في مثل هذه البيئات السيكومترية، تعكس القيمة الصغرى والقصوى مدى استخدام المستجيبين لكامل أبعاد المقياس المتاح، مما يمنح الباحثين انطباعاً مباشراً حول حساسية الأداة القياسية وقدرتها على استيعاب الاستجابات المتطرفة لدى العينة المدروسة.
2.2 الوسيط (Median / Q2): نقطة الارتكاز المركزية
يُعرف الوسيط الإحصائي بأنه المئين الخمسين (50th Percentile) أو الربيع الثاني ($Q_2$)، وهو النقطة العددية التي تقسم مجموعة البيانات المرتبة تصاعدياً إلى نصفين متساويين تماماً، بحيث يقع 50% من المشاهدات دونه، و50% من المشاهدات أعلاه. رياضياً، إذا كان حجم العينة $n$ عدداً فردياً، فإن الوسيط هو القيمة التي تحتل الرتبة $\frac{n+1}{2}$، أما إذا كان $n$ عدداً زوجياً، فإن الوسيط يمثل المتوسط الحسابي للقيمتين اللتين تحتلان الرتبتين $\frac{n}{2}$ و $\frac{n}{2} + 1$.
تكمن القوة الإحصائية للوسيط في مقاومته التامة للتشوهات والانحيازات الناتجة عن الالتواء الشديد في التوزيع، حيث تظل قيمته ثابتة ومستقرة حتى لو تضاعفت القيم القصوى للعينة بمئات المرات. لذلك، يمثل الوسيط النقطة المرجعية الأكثر أماناً وموثوقية لتحديد المركز عندما تبتعد البيانات عن التوزيع الطبيعي المتماثل، ويقدم للمحلل فهماً حقيقياً للدرجة النموذجية التي تتمركز حولها العينة.
من المنظور السيكومتري، يُفسر الوسيط كمؤشر معتمد لاستجابة “الفرد المتوسط” داخل العينة، متجاوزاً التأثيرات المشوهة للاستجابات المتطرفة أو العشوائية. هذا التوصيف يكتسب أهمية فائقة في دراسات زمن الرجع (Reaction Time) ومقاييس الأعراض الإكلينيكية، حيث يضمن الوسيط عدم تضخيم الدرجة الإجمالية للمجموعة بسبب وجود أفراد قليلين يعانون من بطء شديد أو استجابات غير نمطية.
2.3 الربيع الأول (Q1) والربيع الثالث (Q3) والمدى الربيعي (IQR)
يمثل الربيع الأول ($Q_1$)، أو المئين الخامس والعشرون (25th Percentile)، النقطة التي تفصل الربع الأدنى (25%) من البيانات عن الأرباع الثلاثة المتبقية، وهو بمثابة وسيط النصف الأدنى من العينة. في المقابل، يمثل الربيع الثالث ($Q_3$)، أو المئين الخامس والسبعون (75th Percentile)، النقطة التي تفصل الـ 75% الأدنى من المشاهدات عن أعلى 25% من البيانات، وهو وسيط النصف الأعلى من العينة.
يُشتق من هذين الموضعين المقياس الأكثر شهرة واستقراراً في الإحصاء اللامعلمي للتشتت، وهو المدى بين الربيعي (Interquartile Range – IQR)، والذي يُحسب بالطرح المباشر: $IQR = Q_3 – Q_1$. يقيس هذا المؤشر مقدار التشتت أو التباين المحصور في النصف الأوسط (50% الأوسط) من البيانات، متجاهلاً تماماً النصف الخارجي من التوزيع الذي قد يحتوي على قيم شاذة أو متطرفة، مما يجعله المقياس المفضل لوصف التشتت في التوزيعات الملتوية.
من الناحية المنهجية، توجد فروق رياضية طفيفة بين طرق حساب الربيعيات، لعل أبرزها التمييز بين “مفصلات توكي” (Tukey’s Hinges) والتقديرات المئينية القياسية المعتمدة على الاستيفاء الخطي (Linear Interpolation). يكمن الفارق الجوهري في كيفية تضمين نقطة الوسيط عند حساب وسيط النصفين الأدنى والأعلى عندما يكون حجم العينة فردياً؛ حيث تُضمن مفصلات توكي الوسيط في كلا النصفين، مما ينتج أحياناً قيماً تختلف بمقدار ضئيل جداً عن التقديرات المئينية القياسية المستندة إلى الدوال الرياضية المستمرة.
3. أهمية ملخص الأرقام الخمسة في أبحاث العلوم السلوكية والقياس النفسي
3.1 تحليل استجابات الاستبيانات والمقاييس النفسية
تنتج أدوات القياس النفسي والتربوي، مثل استبيانات التقرير الذاتي ومقاييس الشخصية، بيانات تقع غالباً في المستوى الرتبي (Ordinal Level) أو شبه الفئوي (Interval-like)، حيث يصعب الجزم بأن المسافات السيكولوجية بين خيارات الاستجابة (مثل: أعارض بشدة، محايد، أوافق بشدة) متساوية رياضياً تماماً. في هذا السياق، يوفر ملخص الأرقام الخمسة أسلوباً موضوعياً لوصف هذه الدرجات دون انتهاك الخصائص القياسية للبيانات الرتبية.
عند تقييم سمات معقدة مثل القلق، والاكتئاب، والاحتراق النفسي، يتيح الملخص الخماسي توصيف مستويات الشدة بطريقة بالغة الدقة؛ إذ يمكن للباحث معرفة ما إذا كان نصف المفحوصين يسجلون درجات تقع ضمن النطاق السوي، وتحديد النقطة الفاصلة التي يبدأ عندها الربع الأكثر تضرراً أو معاناة ($Q_3$)، فضلاً عن تحديد المدى الذي تتحرك فيه الدرجات الكلية للعينة الإكلينيكية.
علاوة على ذلك، يُسهم الملخص في بناء المعايير والموازين السيكومترية (Norms) وتحديد الدرجات القاطعة (Cut-off Scores) للفئات الحرجة. فمن خلال الحدود الربيعية، يستطيع الأخصائي النفسي تصنيف الأفراد إلى فئات ربيعية معيارية (مثل: منخفض جداً، متوسط، مرتفع، مرتفع جداً)، مما يسهل اتخاذ القرارات التشخيصية والإرشادية بناءً على التموضع الموضعي للدرجة الفردية مقارنة بالعينة المعيارية.
3.2 فحص الالتواء (Skewness) والتفرطح (Kurtosis) بصرياً ورقمياً
يوفر ملخص الأرقام الخمسة آلية سريعة وحدسية لفحص شكل التوزيع التكراري ورصد الالتواء دون الحاجة إلى حساب معاملات العزوم الرياضية المعقدة. تتم هذه العملية من خلال المقارنة الهندسية للمسافات النسبية بين القيم الخمس؛ وتحديداً بمقارنة المسافة بين الربيع الأول والوسيط ($Median – Q_1$) بالمسافة بين الوسيط والربيع الثالث ($Q_3 – Median$).
إذا كانت المسافة من الربيع الأول إلى الوسيط مساوية تقريباً للمسافة من الوسيط إلى الربيع الثالث، وكان طول الشاربين الخارجيين متكافئاً ($Median – Min \approx Max – Median$)، فإن التوزيع يقترب من التماثل الطبيعي المعياري. أما إذا كانت المسافة ($Q_3 – Median$) أكبر بكثير من المسافة ($Median – Q_1$)، فإن هذا يشير بوضوح إلى التواء إيجابي جهة اليمين (Positive/Right Skewness)، والعكس صحيح؛ فإذا كانت المسافة السفلية أكبر، دل ذلك على التواء سلبي جهة اليسار (Negative/Left Skewness).
يمتد هذا الفحص التشخيصي ليكشف عن العيوب المنهجية في أدوات القياس؛ فالالتواء الإيجابي الحاد في مقياس تحصيلي قد يعكس صعوبة بالغة في بنود الاختبار أدت إلى تكدس الطلاب عند الدرجات الدنيا (أثر الأرضية – Floor Effect)، في حين يشير الالتواء السلبي الحاد إلى سهولة مفرطة تسببت في وصول معظم المختبرين إلى الدرجات النهائية المتاحة (أثر السقف – Ceiling Effect)، مما يوجه مصممي الاختبارات إلى ضرورة إعادة معايرة وموازنة الفقرات.
3.3 اتخاذ القرارات الإحصائية اللاحقة
يمثل ملخص الأرقام الخمسة بوصلة منهجية توجه الباحث نحو اتخاذ قرارات صائبة فيما يخص اختيار أساليب التحليل الإحصائي الاستدلالي. فمن خلال تقييم درجة تباعد وتماثل الربيعيات والمدى الكلي، يستطيع المحلل تقدير مدى ملاءمة استخدام النماذج الخطية العامة (General Linear Models) مثل الانحدار الخطي وتحليل التباين، التي تشترط اعتدالية التوزيع وتجانس التباين بين المجموعات.
عندما يكشف الملخص الخماسي عن وجود عدم تماثل شديد أو انتشار متباين للأرباع بين المجموعات المقارنة، يبرز أمام الباحث مساران منهجيان: المسار الأول يتمثل في تطبيق أساليب التحويل الرياضي للبيانات (Data Transformation)، مثل التحويل اللوغاريتمي ($LogTransformation$) أو تحويل الجذر التربيعي، بهدف استعادة التماثل وتقليل تأثير الفروق الربيعية المتطرفة قبل تطبيق الاختبارات المعلمية.
أما المسار الثاني، فيتمثل في التخلي المبرر عن الطرق البارامترية والتوجه مباشرة نحو استخدام الاختبارات اللامعلمية المناسبة والمكافئة، مثل اختبار مان-ويتني (Mann-Whitney U Test) لمقارنة مجموعتين مستقلتين، أو اختبار كروسكال-واليس (Kruskal-Wallis) للمجموعات المتعددة، أو اختبار ويلكوكسون للإشارات والرتب للعينات المرتبطة. وبذلك يضمن الباحث سلامة استنتاجاته الإحصائية وتوافقها التام مع الطبيعة الحقيقية للبيانات الميدانية.
4. الدالة الأساسية fivenum() في بيئة R: البنية والآلية
4.1 الصيغة التركيبية (Syntax) والوسائط الخاصة بالدالة
توفر حزمة R الأساسية (Base R) دالة مخصصة وعالية الكفاءة لحساب ملخص الأرقام الخمسة وفق المفهوم الأصلي الذي وضعه جون توكي، وتعرف هذه الدالة باسم fivenum(). تتميز الدالة ببنيتها التركيبية البسيطة والمباشرة، حيث تأخذ الشكل القياسي التالي في بيئة التطوير:
fivenum(x, na.rm = TRUE)
تستقبل الدالة وسيطين رئيسيين: الوسيط الأول x ويمثل المتجه العددي (Numeric Vector) الذي يحتوي على البيانات المراد تلخيصها، مع اشتراط أن تكون العناصر ذات طبيعة كمية تقبل العمليات الترتيبية؛ والوسيط الثاني na.rm وهو متغير منطقي (Logical Parameter) قيمته الافتراضية TRUE، ويعمل على توجيه الدالة لحذف القيم المفقودة (Missing Values – NA) تلقائياً قبل الشروع في إجراء العمليات الحسابية والترتيبية.
تُرجع الدالة مخرجاً على هيئة متجه عددي أحادي البعد يتألف دائماً وبشكل صارم من خمسة عناصر رقمية مرتبة تصاعدياً كالتالي: [1] القيمة الصغرى، [2] الربيع الأدنى (مفصلة توكي السفلى)، [3] الوسيط الإحصائي، [4] الربيع الأعلى (مفصلة توكي العليا)، و[5] القيمة القصوى. هذا الترتيب البنيوي الثابت يجعل من السهل استرجاع أي مؤشر موضعي عبر عمليات الفهرسة المباشرة داخل نصوص R البرمجية.
4.2 الخوارزمية الحسابية المعتمدة في fivenum()
تعتمد دالة fivenum() خوارزمية مفصلات توكي (Tukey’s Hinges) لحساب الربيعيات، وهي تختلف بنيوياً عن الخوارزميات المئينية المستمرة الشائعة في الإحصاء الرياضي الكلاسيكي. تبدأ الخوارزمية أولاً بترتيب المتجه العددي تصاعدياً من أصغر قيمة إلى أكبرها، ثم تستخرج القيمة الصغرى $X_{(1)}$ والقيمة القصوى $X_{(n)}$ مباشرة من طرفي المتجه المرتب.
في الخطوة التالية، تحسب الدالة رتبة الوسيط (Depth of Median) بالصيغة: $d(M) = \frac{1 + n}{2}$. إذا كان $n$ فردياً، فإن الوسيط هو العنصر في هذا الموضع، وإذا كان زوجياً، فإن الوسيط هو متوسط العنصرين المحيطين بالرتبة الكسرية. بعد ذلك، تحسب الدالة رتبة المفصلات (Depth of Hinges) باستخدام المعادلة التكرارية الخاصة بتوكي:
$d(H) = \frac{\lfloor d(M) \rfloor + 1}{2}$
حيث تمثل $lfloor d(M) rfloor$ الجزء الصحيح الأدنى لرتبة الوسيط. وبناءً على هذه الرتبة، يتم استخراج الربيع الأول كالقيمة المقابلة للرتبة $d(H)$ من بداية المتجه، واستخراج الربيع الثالث كالقيمة المقابلة للرتبة $d(H)$ من نهاية المتجه، مع حساب المتوسط الحسابي إذا كانت رتبة المفصلة تحتوي على كسر نصفي ($0.5$). تعالج هذه الآلية المتجهات الفردية والزوجية بمنهجية حتمية ثابتة تحقق الدقة المطلقة دون الحاجة إلى افتراض خطية الفواصل بين الرتب.
4.3 مقارنة الأداء الحسابي وكفاءة الذاكرة في R Base
تمتاز دالة fivenum() بكفاءة حوسبية وسرعة تنفيذ فائقة تجعلها تتفوق في كثير من الأحيان على الدوال الإحصائية المتقدمة الموزعة ضمن الحزم الخارجية. يعود هذا التفوق إلى كونها مكتوبة بكود منخفض المستوى ومدمجة في صلب نواة لغة R، مما يقلل من العبء الحسابي (Overhead) واستهلاك الذاكرة العشوائية (RAM) أثناء معالجة المتجهات الضخمة التي تحتوي على ملايين المشاهدات.
تتمتع الدالة باستقرار برمجي مطلق؛ فهي لا تعتمد على أي مكتبات خارجية قابلة للتحديث أو التغيير، مما يضمن استمرارية واستنساخ نتائج الأكواد البرمجية (Code Reproducibility) عبر مختلف إصدارات R وأنظمة التشغيل المتنوعة. هذا الاستقرار يجعلها الخيار المثالي لبناء خطوط معالجة البيانات الحساسة داخل البيئات الإنتاجية والمختبرات البحثية.
علاوة على ذلك، يسهل تضمين fivenum() بسلاسة فائقة داخل عائلة دوال التكرار الموجهة مثل apply() و sapply() و vapply()، وكذلك داخل الحلقات البرمجية التكرارية الكلاسيكية (For Loops) وأطر المعالجة المتوازية (Parallel Computing). يمكن للباحث إجراء آلاف عمليات التلخيص الخماسي لمصفوفات البيانات المتشعبة في أجزاء من الثانية دون التعرض لمشاكل تسريب الذاكرة أو بطء المعالجة.
5. أمثلة تطبيقية: حساب ملخص الأرقام الخمسة للمتجهات العددية
5.1 المثال الأول: تحليل متجه درجات اختبار الذكاء (IQ Scores)
لتوضيح التطبيق العملي داخل بيئة R، سنقوم بمحاكاة عينة بحثية تتكون من درجات اختبار ذكاء مقنن تم تطبيقه على 15 طالباً جامعياً في أحد أقسام علم النفس. تتوزع الدرجات المفترضة في النطاق المعياري المعروف للاختبار. يمكن إنشاء المتجه وتطبيق دالة ملخص الأرقام الخمسة عبر الأوامر البرمجية التالية:
data_iq <- c(88, 92, 95, 98, 100, 102, 105, 108, 110, 112, 115, 118, 122, 125, 138)
fivenum(data_iq)
عند تنفيذ هذا الأمر في منصة R Console، ينتج لدينا المتجه الإحصائي التالي المكون من خمس قيم:
[1] 88.0 98.0 108.0 118.0 138.0
يوضح تفكيك هذه المخرجات الرقمية ما يلي: أدنى درجة ذكاء مرصودة في العينة هي 88 نقطة، بينما تمثل 98 نقطة الربيع الأول ($Q_1$)، مما يعني أن 25% من الطلاب تبلغ درجات ذكائهم 98 أو أقل. أما الوسيط الإحصائي للعينة فهو 108 نقاط، وهو ما يعكس مركز استجابات العينة، في حين يمثل 118 نقطة الربيع الثالث ($Q_3$) الذي يفصل الـ 25% الأعلى ذكاءً في المجموعة، وتصل القيمة القصوى المرصودة في العينة إلى 138 نقطة، مما يشير إلى وجود أداء متميز لواحد من أفراد العينة يمتد نحو الأطراف العليا للمنحنى.
5.2 المثال الثاني: تحليل زمن الرجع (Reaction Time) بالمللي ثانية
في تجارب علم النفس المعرفي والإدراك الحسي، يُقاس زمن الرجع (Reaction Time) بالمللي ثانية، وهو متغير مستمر يشتهر بكونه يتبع دائماً توزيعاً ملتزياً إيجابياً نظراً لأن الأفراد يمتلكون حداً فسيولوجياً أدنى لسرعة الاستجابة، مع وجود بعض المحاولات التي يحدث فيها تشتت ذهني تؤدي إلى أزمنة استجابة طويلة جداً. سنقوم بإنشاء متجه زمني مفترض وتلخيصه كالتالي:
rt_data <- c(245, 250, 252, 258, 260, 263, 267, 270, 275, 280, 295, 310, 340, 420, 580)
rt_summary <- fivenum(rt_data)
print(rt_summary)
تأتي النتائج البرمجية لهذا التحليل على النحو الآتي:
[1] 245 258 270 310 580
يُظهر التحليل السيكومتري لهذه الأرقام بوضوح طبيعة التوزيع الملتوي؛ فالقيمة الصغرى لزمن الاستجابة هي 245 مللي ثانية، والربيع الأول هو 258 مللي ثانية، والوسيط هو 270 مللي ثانية. نلاحظ هنا أن المسافة بين الربيع الأول والوسيط تبلغ فقط 12 مللي ثانية ($270 – 258 = 12$)، بينما المسافة بين الوسيط والربيع الثالث ($310 – 270 = 40$) تبلغ 40 مللي ثانية، وتمتد القيمة القصوى بعيداً لتصل إلى 580 مللي ثانية. هذا التفاوت الربيعي الحاد يثبت وجود تباطؤ في بعض المحاولات الإدراكية، ويوضح بجلاء كيف ينجح ملخص الأرقام الخمسة في تجسيد عدم التماثل بدقة متناهية مقارنة بالمتوسط الحسابي الذي سيتأثر بشدة بالرقم 580.
5.3 استخراج العناصر بشكل منفصل برمجياً من المخرجات
نظراً لأن ناتج دالة fivenum() هو متجه عددي قياسي من النمط numeric، يمكن للباحث استخدام آليات الفهرسة الموضعية (Positional Indexing) في R لاستخراج أي مؤشر بمفرده وإدخاله في معادلات لاحقة أو استخدامه في بناء تقارير مخصصة. يتم ذلك عبر تحديد موضع العنصر بين قوسي الفهرسة المربعة [ ] كالتالي:
min_val <- rt_summary[1] # القيمة الصغرى
q1_val <- rt_summary[2] # الربيع الأول
med_val <- rt_summary[3] # الوسيط الإحصائي
q3_val <- rt_summary[4] # الربيع الثالث
max_val <- rt_summary[5] # القيمة القصوى
لتحسين قابلية قراءة الكود والمخرجات ودمجها في العروض الأكاديمية، يُنصح بتسمية عناصر المتجه باستخدام الدالة names()، مما يحول المتجه الصامت إلى هيكل بياني واضح:
names(rt_summary) <- c("Minimum", "Q1_Hinge", "Median", "Q3_Hinge", "Maximum")
print(rt_summary)
كما يمكن حساب المدى بين الربيعي (IQR) يدوياً وبشكل مباشر من عناصر مخرجات الدالة عبر طرح الربيع الأول من الربيع الثالث:
custom_iqr <- rt_summary[4] - rt_summary[2]
cat("المدى الربيعي لمفصلات توكي يساوي:", custom_iqr, "مللي ثانيةn")
تمنح هذه المرونة البرمجية الباحث قدرة مطلقة على تفصيل المخرجات الإحصائية بما يلائم متطلبات العرض والنشر الأكاديمي.
6. المقارنة بين الدوال: fivenum() مقابل summary() و quantile()
6.1 أوجه الاختلاف بين fivenum() ودالة summary()
تعد دالة summary() واحدة من أكثر الدوال استخداماً في لغة R لإجراء المسح الوصفي الشامل للمتغيرات، إلا أن هناك فروقاً جوهرية بينها وبين دالة fivenum() يجب على كل باحث إحصائي إدراكها بدقة لتجنب الخلط في الأوراق العلمية. يكمن الاختلاف الأول والأكثر وضوحاً في عدد المخرجات؛ حيث تنتج summary() ستة مقاييس إحصائية بدلاً من خمسة، إذ تدرج المتوسط الحسابي (Mean) إلى جانب المقاييس الموضعية الخمسة.
أما الاختلاف الثاني والأكثر عمقاً فيتعلق بالخوارزمية الحسابية المعتمدة لتقدير الربيعين الأول والثالث ($Q_1$ و $Q_3$). تعتمد دالة fivenum() بصورة صارمة على مفصلات توكي (Tukey’s Hinges) التي ترتكز على الترتيب الموضعي البحت وتقسيم السلسلة إلى أنصاف، بينما تعتمد دالة summary() داخلياً على دالة المئينات المستمرة quantile() باستخدام الخوارزمية القياسية الافتراضية (Type 7)، والتي تعتمد على الاستيفاء الرياضي الخطي عبر مسافات المئين المستمر.
تتطابق مخرجات الدالتين تماماً في حالات محددة، مثل العينات ذات الأحجام المتوافقة رياضياً مع قوى معينة للأعداد الزوجية، أو عندما تكون البيانات متباعدة بانتظام تام. لكنهما تختلفان بوضوح في العينات الصغيرة والمتوسطة، وخاصة عندما يكون حجم العينة $n$ فردياً أو لا يقبل القسمة المتكافئة على 4؛ حيث يظهر اختلاف طفيف في قيمتي $Q_1$ و $Q_3$، في حين يظل الوسيط والقيمتان الصغرى والقصوى متطابقة تماماً في كلا الدالتين.
6.2 التحكم في خوارزميات الحساب عبر دالة quantile()
تعتبر الدالة quantile() في R الأداة الأكثر شمولاً وتطوراً لحساب المئينات والأرباع، إذ تتضمن وسيطاً متقدماً اسمه type يسمح للمستخدم بالاختيار بين تسع خوارزميات رياضية مختلفة (من Type 1 إلى Type 9) لتقدير المئينات، وهي الخوارزميات الموثقة في الدراسة الشهيرة لعالمي الإحصاء هينديكر وماكغيل (Hyndman & Fan, 1996).
لحساب الأرباع الثلاثة باستخدام quantile()، يُمرر المتجه مع تحديد المئينات المطلوبة عبر الوسيط probs كالتالي:
quantile(data_iq, probs = c(0, 0.25, 0.5, 0.75, 1), type = 7) # النمط الافتراضي في R
إذا أراد الباحث مطابقة نتائج دالة fivenum() بدقة متناهية باستخدام دالة quantile()، فإن ذلك يتطلب ضبط نوع الخوارزمية ليكون type = 2 (المطابقة لأسلوب المئينات المتقطعة والتجريبية التي تتفق مع مفصلات توكي عند الأحجام المتكافئة)، أو استخدام الدوال المتخصصة في حزم التحليل المتقدم مثل boxplot.stats()$stats. إن فهم هذه الأنواع التسعة يمنح المحلل القدرة على توحيد منهجه الحسابي ومواءمة نتائجه مع البرمجيات الإحصائية الأخرى مثل SPSS أو SAS أو Python (NumPy).
6.3 جدول مقارنة شامل للاستخدامات والخصائص البرمجية
يوضح الجدول المقارن التالي الفروق الجوهرية والتقنية بين الدوال الإحصائية الثلاث في بيئة R، مما يسهل على الباحث اختيار الأداة المناسبة وفقاً لطبيعة البيانات وأهداف التحليل:
| خاصية المقارنة | الدالة fivenum() | الدالة summary() | الدالة quantile() |
|---|---|---|---|
| خوارزمية الربيعيات | مفصلات توكي (Tukey’s Hinges) | استيفاء خطي (Type 7 الافتراضي) | 9 خوارزميات قابلة للتخصيص (Type 1-9) |
| إدراج المتوسط الحسابي | لا (تركز حصرياً على المقاييس الموضعية) | نعم (تدرج Mean كعنصر رابع) | لا (تحسب فقط الرتب المئينية المطلوبة) |
| التعامل الافتراضي مع NA | تتجاهل القيم المفقودة تلقائياً (na.rm=TRUE) | تحسب المتوفر وتحصر عدد المفقودات | تتوقف وتعطي خطأ ما لم يُحدد na.rm=TRUE |
| نوع المخرجات البرمجية | متجه عددي قياسي (Numeric Vector) | جدول ملخص كلاسيكي (Table / Summary) | متجه مسمى بنسب المئينات (Named Vector) |
| السرعة الحوسبية | فائقة السرعة ومنخفضة استهلاك الذاكرة | متوسطة (بسبب تعدد الأنماط والحسابات) | عالية مع مرونة رياضية واسعة |
| السيناريو الأكاديمي الأمثل | التحليل الاستكشافي السريع، وربط الصناديق | المسح العام الأولي لكافة متغيرات الإطار | الحسابات السيكومترية المتقدمة وتحديد الرتب |
يوصى في المعايير الأكاديمية الصارمة (مثل دليل نشر APA) بالإفصاح الدقيق عن الخوارزمية المستخدمة لحساب الربيعيات في حال تم الاعتماد على الرتب المئينية، لضمان أعلى مستويات الشفافية وإمكانية تكرار التحليل في الأبحاث المستقبلية.
7. تطبيق ملخص الأرقام الخمسة على أطر البيانات (Data Frames)
7.1 تطبيق الدالة على أعمدة مفردة ومتعددة في Data Frame
في التطبيقات الواقعية، نادراً ما يتعامل المحلل مع متجهات منفردة معزولة، بل يتعامل مع أطر بيانات مركبة (Data Frames) تضم عشرات المتغيرات الديموغرافية والنفسية المقاسة. لحساب ملخص الأرقام الخمسة لمتغير واحد داخل إطار بيانات يُسمى psych_df، يتم استدعاء العمود المعني باستخدام عامل الفهرسة الدولاري $ كالتالي:
fivenum(psych_df$anxiety_score)
أما عندما يتطلب البحث تلخيص مجموعة كاملة من المتغيرات العددية في آن واحد، فإن استدعاء الدالة لكل عمود على حدة يصبح عملاً غير فعال ومستهلكاً للوقت. هنا تبرز قوة دوال التطبيق الجمعي في لغة R الأساسية، ولا سيما الدالة sapply() أو lapply(). يمكن تطبيق fivenum() على كافة الأعمدة الرقمية لإطار البيانات بخطوة واحدة عبر الكود التالي:
# عزل الأعمدة العددية وتطبيق الملخص الخماسي عليها
numeric_cols <- sapply(psych_df, is.numeric)
summary_matrix <- sapply(psych_df[, numeric_cols], fivenum)
rownames(summary_matrix) <- c("Min", "Q1", "Median", "Q3", "Max")
print(as.data.frame(summary_matrix))
يقوم هذا الكود بفحص طبيعة الأعمدة برمجياً، ثم يطبق خوارزمية الأرقام الخمسة على كل متغير عددي، ليجمع النتائج في مصفوفة أنيقة يتم تحويلها إلى إطار بيانات يحتوي على المتغيرات كأعمدة والمقاييس الموضعية كصفوف، مما يمنح الباحث نظرة شمولية مقارنة لكافة مقاييس الدراسة في جدول واحد منسق.
7.2 التكامل مع حزمة tidyverse لمعالجة البيانات المعقدة
تعد منظومة حزم tidyverse، وبخاصة حزمة dplyr، المعيار الحديث والأكثر شيوعاً في بيئة R لهندسة البيانات وتنظيفها وتحليلها. يمكن دمج دالة fivenum() داخل دوال التلخيص الحديثة مثل summarise() و reframe() لإنتاج مخرجات منظمة ومتوافقة مع مبادئ “البيانات المرتبة” (Tidy Data).
نظراً لأن fivenum() تُرجع متجهاً من خمس قيم، فإن استخدام دالة reframe() يتيح استيعاب المتجهات متعددة القيم بكفاءة، أو يمكن كتابة دالة تفصيلية داخل summarise() لاستخراج كل قيمة في عمود مستقل لإنتاج هيكل بيانات عريض (Wide Format):
library(dplyr)
psych_df %>%
summarise(
Min = fivenum(depression_score)[1],
Q1 = fivenum(depression_score)[2],
Med = fivenum(depression_score)[3],
Q3 = fivenum(depression_score)[4],
Max = fivenum(depression_score)[5],
IQR = fivenum(depression_score)[4] - fivenum(depression_score)[2]
)
تسمح هذه المنهجية المبنية على سلاسل الأنابيب (Pipes %>% أو |>) ببناء تدفقات عمل إحصائية سلسة ومقروءة بدرجة عالية، حيث يمكن دمج عمليات التصفية والانتقاء والتلخيص في أمر برمجي موحد ومعبر يعالج البيانات النفسية الضخمة دون تعقيد إجرائي.
7.3 تحويل مخرجات التحليل إلى جداول قابلة للنشر الأكاديمي
لا يكتمل العمل الإحصائي الرصين بمجرد استخراج الأرقام في نافذة الأوامر، بل يتطلب تقديمها في صيغ جداول احترافية جاهزة للإدراج المباشر في المجلات العلمية والتقارير الأكاديمية. توفر بيئة R حزم متخصصة لإنتاج جداول النشر، مثل حزمة knitr، وحزمة kableExtra، وحزمة gt الحديثة.
لتحويل مصفوفة ملخص الأرقام الخمسة إلى جدول فائق التنسيق يدعم معايير النشر العلمي، يمكن استخدام الشيفرة البرمجية التالية عبر kableExtra:
library(knitr)
library(kableExtra)
# تحويل المصفوفة الملخصة وتنسيقها الأكاديمي
t(summary_matrix) %>%
kbl(caption = "جدول (1): ملخص الأرقام الخمسة للمتغيرات السيكومترية في العينة الأساسية",
digits = 2,
col.names = c("الصغرى (Min)", "الربيع الأدنى (Q1)", "الوسيط (Median)", "الربيع الأعلى (Q3)", "القصوى (Max)")) %>%
kable_classic(full_width = FALSE, html_font = "Arial") %>%
row_spec(0, bold = TRUE, background = "#F8F9FA") %>%
column_spec(1, bold = TRUE)
تتيح هذه الأدوات تصدير الجداول الناتجة بتنسيقات متعددة تشمل HTML للعرض التفاعلي وصفحات الويب، وLaTeX للدمج المباشر في الأوراق البحثية المعدة للنشر الدولي، وملفات Word، مما يوفر على الباحث ساعات طويلة من التنسيق اليدوي المعرض للخطأ البشري.
8. التعامل مع القيم المفقودة (Missing Data – NA) في التحليل
8.1 تأثير القيم المفقودة على حسابات fivenum() و summary()
تعتبر ظاهرة البيانات المفقودة (Missing Data) من التحديات الشائعة في البحوث الميدانية والمسوح السلوكية؛ حيث يمتنع بعض المشاركين عن الإجابة على فقرات معينة أو يتعذر تسجيل بعض القياسات التجريبية. تمتلك لغة R قيمة رمزية محجوزة لتمثيل هذه الحالات هي NA (Not Available). يختلف سلوك الدوال الإحصائية جذرياً عند مواجهة هذه القيم داخل المتجهات قيد المعالجة.
تم تصميم الدالة fivenum() لتكون دالة عملية ومحمية بطبيعتها؛ إذ تحتوي على الوسيط na.rm = TRUE مفعلة افتراضياً، مما يعني أنها تستبعد تلقائياً كافة قيم NA قبل حساب الرتب الموضعية الخمسة دون أن تتوقف عن التنفيذ أو تصدر أخطاء برمجية قاتلة. في المقابل، تقوم دالة summary() بحساب القيم الخمس والمتوسط من البيانات المتوفرة، وتضيف عنصراً سادساً صريحاً يوضح عدد الحالات المفقودة (مثل: NA's: 14).
رغم الراحة البرمجية التي يوفرها الحذف التلقائي للقيم المفقودة، يجب على الباحث التحلي بالحذر المنهجي؛ فتجاهل الفقدان دون فحص آليته قد يوقع الدراسة في خطأ التحيز المنهجي، ولا سيما إذا كان الفقدان غير عشوائي (Missing Not at Random – MNAR)، كأن يمتنع الأفراد ذوو المستويات المرتفعة جداً من الاكتئاب عن الإجابة على أسئلة معينة، مما يؤدي إلى تشويه غير مقصود للملخص الخماسي للعينة المتبقية.
8.2 استراتيجيات فحص ومعالجة الفقدان قبل الحساب
يقتضي المنهج العلمي الصارم عدم الاكتفاء بالاستبعاد الصامت للبيانات المفقودة، بل يجب تقييم حجم ونمط الفقدان قبل اتخاذ قرار حساب ملخص الأرقام الخمسة. توفر R مجموعة من الدوال الاستكشافية لفحص الحالات المفقودة، مثل is.na() و complete.cases()، والتي يمكن استخدامها لحساب النسبة المئوية للفقد كالتالي:
# حساب نسبة القيم المفقودة في المتغير
missing_count <- sum(is.na(psych_df$stress_score))
missing_prop <- mean(is.na(psych_df$stress_score)) * 100
cat("عدد الحالات المفقودة:", missing_count, "(", round(missing_prop, 2), "%)n")
إذا كانت نسبة الفقدان ضئيلة جداً (أقل من 5%) وتتبع نمط الفقدان العشوائي التام (MCAR)، يمكن المضي قدماً في حساب الملخص على الحالات المكتملة. أما إذا كانت النسبة مؤثرة، فيمكن للباحث تطبيق أساليب الإسناد الإحصائي (Imputation)، مثل إسناد الوسيط (Median Imputation) أو استخدام الحزم المتقدمة للإسناد المتعدد مثل mice أو missForest.
بعد إجراء عملية الإسناد، يُنصح الباحث بإجراء مقارنة استكشافية بحساب ملخص الأرقام الخمسة قبل وبعد الإسناد لتقييم تأثير معالجة الفقدان على البنية التوزيعية للمتغير وضمان عدم تسبب الإسناد في إحداث تشوه في مفصلات التوزيع أو تشتت الأرباع.
8.3 كتابة أكواد آمنة للتعامل مع البيانات الواقعية الملوثة
في بيئات العمل التحليلية التي تتعامل مع بيانات واقعية ضخمة وقادمة من مصادر متعددة، قد تواجه الأكواد البرمجية مشكلات مفاجئة ناتجة عن متجهات فارغة تماماً (All NAs) أو متجهات تحتوي على قيم غير متوقعة تؤدي إلى نتائج غير منطقية. لتفادي ذلك، يُستحسن بناء دوال تغليف برمجية آمنة (Safe Wrapper Functions) تتضمن معايير تحقق واضحة قبل استدعاء fivenum().
يوضح النموذج البرمجي التالي كيفية بناء دالة مخصصة تقوم بفحص سلامة المتجه، وإصدار تحذيرات موثقة عند ارتفاع نسبة الفقدان عن حد حرج (مثلاً 20%)، ثم إرجاع الملخص الإحصائي الخماسي بصيغة منظمة ومحمية:
safe_fivenum <- function(vec, var_name = "المتغير", threshold = 0.20) {
if (!is.numeric(vec)) {
stop(paste("خطأ: المتغير", var_name, "يجب أن يكون متجهاً عددياً."))
}
na_ratio <- mean(is.na(vec))
if (na_ratio > threshold) {
warning(paste("تحذير منهجي: نسبة القيم المفقودة في", var_name, "تبلغ", round(na_ratio * 100, 1), "% وهي نسبة مرتفعة."))
}
clean_vec <- vec[!is.na(vec)]
if (length(clean_vec) == 0) {
return(rep(NA, 5))
}
res <- fivenum(clean_vec)
names(res) <- c("Min", "Q1", "Median", "Q3", "Max")
return(res)
}
يضمن هذا الأسلوب البرمجي الاحترافي تعزيز الشفافية المنهجية، وحماية التقارير الإحصائية من الانهيار البرمجي المفاجئ، مع توثيق أدق لحالات الاستبعاد وفق متطلبات الرصانة الأكاديمية.
9. حساب ملخص الأرقام الخمسة حسب المجموعات والفئات (Group-by Analysis)
9.1 المقارنة بين المجموعات التجريبية والضابطة باستخدام tapply() و aggregate()
تشكل المقارنة بين المجموعات التجريبية والضابطة حجر الزاوية في التصاميم البحثية التجريبية وشبه التجريبية. تتطلب مثل هذه الدراسات حساب ملخص الأرقام الخمسة لكل مجموعة فرعية على حدة للمقارنة بين مستويات النزعة المركزية ودرجات التشتت. توفر لغة R الأساسية دوال قوية لتحقيق ذلك، من أبرزها دالتا tapply() و aggregate().
تتيح دالة tapply() تقسيم المتغير التابع طبقاً لمتغير تصنيفي وتطبيق الدالة التلخيصية على كل فئة، كما يظهر في الكود التالي:
# حساب الملخص الخماسي لمقياس الاكتئاب حسب المجموعات التجريبية
tapply(psych_df$depression_score, psych_df$treatment_group, fivenum)
تنتج هذه الدالة قائمة مصفوفية تعرض القيم الخمس لمجموعة العلاج النفسي ومجموعة الدواء الوهمي (Placebo) والمجموعة الضابطة. من جانب آخر، تبرز دالة aggregate() كأداة ممتازة عندما يرغب الباحث في الحصول على جدول مهيكل يسهل ربطه وتصديره، وتستخدم بنية الصيغ الرياضية (Formula Interface) الكلاسيكية:
group_summary <- aggregate(depression_score ~ treatment_group, data = psych_df, FUN = fivenum)
print(group_summary)
تسهم هذه المقارنات في الكشف عن الفروق الجوهرية ليس فقط في مركز استجابة المجموعات عبر مقارنة الوسائط، بل في سلوك الأطراف والأرباع التوزيعية؛ مما يسمح بفهم ما إذا كان العلاج النفسي قد نجح في تقليل التشتت وحصر درجات المرضى في النطاق الأدنى للمرض مقارنة بمجموعة الدواء الوهمي.
9.2 التحليل المتقدم حسب المجموعات باستخدام dplyr::group_by
يوفر إطار dplyr أسلوباً برمجياً غاية في المرونة والتكامل لإجراء التحليلات الفئوية المركبة متعددة المستويات، مثل تصنيف الأفراد بناءً على التفاعل بين متغيرين تصنيفيين (كالنوع الاجتماعي والمرحلة العمرية معاً). يتم ذلك عبر الجمع بين دالتي group_by() و summarise() في سلسلة أنابيب سلسة:
library(dplyr)
detailed_grouped_summary <- psych_df %>%
group_by(Gender, Age_Group) %>%
summarise(
N = n(),
Min = fivenum(resilience_score)[1],
Q1 = fivenum(resilience_score)[2],
Median = fivenum(resilience_score)[3],
Q3 = fivenum(resilience_score)[4],
Max = fivenum(resilience_score)[5],
IQR = fivenum(resilience_score)[4] - fivenum(resilience_score)[2],
.groups = "drop"
)
print(detailed_grouped_summary)
ينتج هذا التدفق البرمجي جدولاً متكاملاً يشتمل على حجم كل عينة فرعية ($N$) إلى جانب القيم الخمس التفصيلية ومقياس المدى الربيعي ($IQR$). هذا التقرير المنظم يتيح استكشاف الأنماط التفاعلية المعقدة بين المتغيرات الديموغرافية والسمات السلوكية المقاسة بأعلى مستويات الوضوح والكفاءة.
9.3 التفسير السيكومتري للمقارنات الفئوية
إن قراءة ملخص الأرقام الخمسة عبر المجموعات تتجاوز المقارنة الرقمية الصامتة إلى استنباط الدلالات السيكومترية والظاهراتية الكامنة خلف هذه المؤشرات الموضعية. فعلى سبيل المثال، عند مقارنة درجات “المرونة النفسية” بين الذكور والإناث، قد نجد أن وسيط المجموعتين متطابق تقريباً، لكن المدى الربيعي ($IQR$) لدى الإناث يبلغ ضعف المدى الربيعي لدى الذكور.
هذا الفارق في المدى الربيعي يكشف للباحث حقيقة سيكومترية جوهرية تتمثل في تباين تجانس العينة؛ فالاستجابات لدى الذكور أكثر تماسكاً وتمركزاً حول الدرجة الوسطى، بينما تظهر درجات الإناث تبايناً وتنوعاً واسعاً في استراتيجيات المرونة النفسية. هذا الاستنتاج المهم كان سيضيع حتماً لو اقتصر التقرير على ذكر الوسيط أو المتوسط الحسابي بمفرده.
كذلك تكتسب المقارنات الفئوية أهمية حاسمة في دراسات التتبع النمائي وتقييم فاعلية البرامج العلاجية والتدخلات الإرشادية (Pre-Post Intervention Studies). فمقارنة ملخص الأرقام الخمسة قبل وبعد تطبيق البرنامج العلاجي تمكن الباحث من تتبع هبوط النصف الأوسط للدرجات ($Q_1$ إلى $Q_3$) نحو مستويات السواء النفسي، مع مراقبة ما إذا كانت التدخلات قد قلصت المدى الكلي للظاهرة المرضية وعززت التعافي الشامل لدى مختلف شرائح العينة.
10. التمثيل البياني لملخص الأرقام الخمسة: المخطط الصندوقي (Boxplot)
10.1 العلاقة البنيوية بين ملخص الأرقام الخمسة والمخطط الصندوقي
يمثل المخطط الصندوقي (Boxplot)، أو ما يُعرف بمخطط الصندوق والشاربين (Box-and-Whisker Plot)، الترجمة البصرية والهندسية المباشرة لملخص الأرقام الخمسة التي ابتكرها جون توكي. يقوم هذا التمثيل البياني على تحويل المؤشرات الرقمية الموضعية إلى عناصر هندسية ذات دلالات إحصائية دقيقة تتيح إدراك البنية التوزيعية بالعين المجردة خلال لحظات معدودة.
يتكون جسم الصندوق الأوسط (The Box) من خط سفلي يمثل الربيع الأول ($Q_1$) وخط علوي يمثل الربيع الثالث ($Q_3$)، مما يجعل ارتفاع الصندوق ذاته مساوياً تماماً للمدى بين الربيعي ($IQR$)، وهو ما يعكس تمركز 50% من مشاهدات العينة. ويقسم الصندوق خط أفقي عريض في المنتصف يمثل الوسيط الإحصائي ($Median / Q_2$)، الذي يكشف موقعه النسبي داخل الصندوق عن اتجاه وشدة الالتواء الداخلي للتوزيع.
أما الشاربان (Whiskers) فيمتدان من طرفي الصندوق باتجاه القيمتين الصغرى والقصوى. في التصميم الكلاسيكي البسيط، يمتد الشاربان ليصلان مباشرة إلى $Minimum$ و $Ma\ximum$. أما في التصميم المعياري الحديث لتوكي، فيمتد الشاربان فقط إلى أبعد نقطة تقع ضمن نطاق 1.5 ضعف المدى الربيعي ($1.5 \times IQR$) من حافتي الصندوق، بينما تُرسم أي مشاهدات تتجاوز هذه الحدود كنقاط منفصلة ومعزولة تمثل قيماً شاذة إحصائياً تتطلب الفحص والتدقيق.

10.2 رسم المخططات الصندوقية باستخدام R Base Graphics
توفر حزمة الرسوميات الأساسية في R دالة سريعة وفعالة لرسم المخططات الصندوقية تدعى boxplot(). تتميز هذه الدالة بقدرتها على إنتاج رسوم بيانية فورية بأقل قدر من الشيفرات، مع إمكانية التخصيص الجمالي وإضافة تسميات المحاور والألوان التمييزية. يمكن رسم مخطط صندوقي لمتغير نفسي وتخصيصه كالتالي:
# رسم مخطط صندوقي لمقياس الرضا الحياتي
boxplot(psych_df$life_satisfaction,
main = "توزيع درجات مقياس الرضا عن الحياة",
ylab = "الدرجة الكلية على المقياس",
col = "#AED6F1",
border = "#1B4F72",
notch = TRUE, # إضافة تجويف حول الوسيط لمقارنة الدلالة
las = 1)
لتعزيز القيمة التوضيحية للرسم، يمكن للمحلل إضافة قيم fivenum() كنقاط بيانية بارزة أو نصوص توضيحية مباشرة على المخطط باستخدام دالتي points() و text()، مما يربط القارئ بصرياً بالقيم الرقمية المحددة للربيعيات والوسيط والحدود القصوى والدنيا على المقياس المرسوم.
10.3 الرسم المتقدم باستخدام حزمة ggplot2 وتخصيصه للنشر العلمي
تعتبر حزمة ggplot2 المعيار الذهبي للإنتاج الرسومي الأكاديمي في لغة R، نظراً لما توفره من مرونة جمالية فائقة وقدرة على بناء طبقات رسومية متعددة تلتزم بمعايير المجلات العلمية المحكمة مثل دليل APA. تتيح دالة geom_boxplot() بناء المخطط الصندوقي بدقة هندسية عالية، مع إمكانية دمجه مع طبقة النقاط الفردية المشوشة (Jittered Points) لعرض التوزيع الكامل للبيانات خلف الصندوق.
يوضح الكود التالي كيفية إنشاء مخطط صندوقي متقدم مخصص للنشر الأكاديمي يقارن بين درجات المرونة النفسية عبر مجموعات الدراسة:
library(ggplot2)
ggplot(psych_df, aes(x = Group, y = Resilience_Score, fill = Group)) +
geom_boxplot(width = 0.5, alpha = 0.7, outlier.color = "red", outlier.shape = 16, outlier.size = 2.5) +
geom_jitter(width = 0.15, alpha = 0.3, color = "black") +
stat_summary(fun = mean, geom = "point", shape = 18, size = 3.5, color = "darkblue", aes(group = Group)) +
labs(
title = "مقارنة توزيع درجات المرونة النفسية بين المجموعات",
subtitle = "تمثل الصناديق ملخص الأرقام الخمسة، وتمثل المعينات الزرقاء المتوسط الحسابي",
x = "المجموعة التجريبية",
y = "درجة المرونة النفسية (0 - 100)"
) +
theme_classic() +
theme(
text = element_text(family = "Arial", size = 12),
plot.title = element_text(face = "bold", hjust = 0.5),
plot.subtitle = element_text(hjust = 0.5, color = "gray30"),
legend.position = "none"
)
يجمع هذا التمثيل البصري المتكامل بين ملخص الأرقام الخمسة المتمثل في الصندوق وشاربيه، والمتوسط الحسابي المتمثل في المعين الأزرق، والنقاط الفردية الفعلية للبيانات، مما يقدم للقارئ والمحكم الأكاديمي صورة بصرية وافية تجمع بين النزعة المركزية، والتشتت، والشذوذ الإحصائي، والكثافة التوزيعية في رسم واحد متقن.
11. كشف وتشخيص القيم الشاذة (Outliers) اعتماداً على الملخص الخماسي
11.1 قاعدة توكي للكشف عن الشذوذ الإحصائي (Tukey’s Fences)
وضع جون توكي قاعدة رياضية معيارية غير معلمية لكشف وتشخيص القيم الشاذة والمتطرفة تستند مباشرة إلى مكونات ملخص الأرقام الخمسة، وتعرف هذه القاعدة في الأوساط الإحصائية باسم “أسوار توكي” (Tukey’s Fences). تعتمد هذه المنهجية على حساب مسافات معيارية انطلاقاً من مفصلات الصندوق ($Q_1$ و $Q_3$) بالاعتماد على المدى بين الربيعي ($IQR$).
تحدد قاعدة توكي مستويين من الأسوار الإحصائية لتصنيف درجات التطرف:
- الأسوار الداخلية (Inner Fences): وتحدد نطاق القيم العادية أو الشاذة المعتدلة، وتُحسب عبر الصيغتين:
الحد الأدنى الداخلي = $Q_1 – (1.5 \times IQR)$
الحد الأعلى الداخلي = $Q_3 + (1.5 \times IQR)$
تعتبر أي قيمة تقع خارج هذين الحدين “قيمة شاذة محتملة” (Mild Outlier). - الأسوار الخارجية (Outer Fences): وتحدد نطاق القيم شديدة التطرف، وتُحسب عبر الصيغتين:
الحد الأدنى الخارجي = $Q_1 – (3.0 \times IQR)$
الحد الأعلى الخارجي = $Q_3 + (3.0 \times IQR)$
تعتبر أي قيمة تقع خارج هذين السورين “قيمة متطرفة حادة” (Extreme Outlier).
من الناحية المنهجية في العلوم السلوكية، يجب التمييز الدقيق بين الشذوذ الإحصائي الناجم عن خطأ إجرائي (مثل خطأ إدخال البيانات أو عدم انتباه المفحوص) والشذوذ الناتج عن تباين إنساني حقيقي يعكس خصوصية الحالة الإكلينيكية؛ فالقيم الشاذة الحقيقية غالباً ما تحمل في طياتها رؤى علمية فريدة يجب عدم التسرع في حذفها دون فحص منهجي معمق.
11.2 بناء دالة في R لتحديد وعزل القيم الشاذة برمجياً
يمكن للمحلل توظيف قدرات البرمجة الوظيفية في R لبناء دالة مخصصة تقوم بتطبيق أسوار توكي اعتماداً على مخرجات fivenum() لعزل القيم الشاذة واستخراج أرقام الحالات (Row Indices) والمشاركين المرتبطين بها برمجياً. يوضح الكود التالي طريقة بناء هذه الدالة:
identify_outliers <- function(data_vector) {
stats <- fivenum(data_vector, na.rm = TRUE)
q1 <- stats[2]
q3 <- stats[4]
iqr_val <- q3 - q1
lower_inner <- q1 - 1.5 * iqr_val
upper_inner <- q3 + 1.5 * iqr_val
lower_outer <- q1 - 3.0 * iqr_val
upper_outer <- q3 + 3.0 * iqr_val
mild_outliers <- data_vector[(data_vector < lower_inner & data_vector >= lower_outer) |
(data_vector > upper_inner & data_vector <= upper_outer)]
extreme_outliers <- data_vector[data_vector < lower_outer | data_vector > upper_outer]
list(
Q1 = q1, Median = stats[3], Q3 = q3, IQR = iqr_val,
Inner_Fences = c(Lower = lower_inner, Upper = upper_inner),
Outer_Fences = c(Lower = lower_outer, Upper = upper_outer),
Mild_Outliers = mild_outliers,
Extreme_Outliers = extreme_outliers,
Total_Outliers_Count = length(mild_outliers) + length(extreme_outliers)
)
}
# تطبيق الدالة على مقياس زمن الرجع
outlier_report <- identify_outliers(rt_data)
print(outlier_report)
تتيح هذه الدالة توليد تقرير تشخيصي شامل يحدد موقع الأسوار بدقة، ويسرد القيم الشاذة المصنفة حسب درجة تطرفها، مما يمكّن الباحث من اتخاذ قرارات واعية وموثقة بخصوص معالجة هذه الحالات في دراسته.
11.3 التعامل المنهجي مع القيم الشاذة في البحوث السلوكية
يتطلب التعامل مع القيم الشاذة في الأبحاث السلوكية حساً نقدياً والتزاماً بأخلاقيات البحث العلمي؛ حيث يُحظر حذف المشاهدات المتطرفة لمجرد تحسين قيم الدلالة الإحصائية أو دعم الفرضيات المسبقة للباحث. إن الاستبعاد غير المبرر للحالات قد يؤدي إلى خفض التباين الحقيقي للظاهرة وتقليل صدق وثبات المقاييس النفسية المستخدمة.
يتمثل النهج الأكاديمي الأكثر رصانة في إجراء ما يُعرف إحصائياً بـ “تحليل الحساسية” (Sensitivity Analysis)، والذي يقوم على تنفيذ التحليلات الإحصائية كاملة مرتين متوازيتين: المرة الأولى باستخدام العينة الكلية المتضمنة لكافة القيم الشاذة، والمرة الثانية بعد استبعاد أو تعديل تلك القيم (مثل تطبيق أسلوب وينسرة البيانات – Winsorization حيث تُستبدل القيمة الشاذة بأقرب قيمة عند السور الربيعي).
إذا أظهرت مقارنة النتائج بين التحليلين استقراراً في الاستنتاجات الإحصائية واتجاه الفروق، تزداد ثقة الباحث في متانة نموذجه النظري. أما إذا تغيرت القرارات الإحصائية جذرياً، فيلتزم الباحث منهجياً بالإفصاح الكامل عن كلا التحليلين في قسم النتائج ومناقشة الكيفية التي أثرت بها هذه الحالات الاستثنائية على النموذج التفسيري، التزاماً بمبادئ الشفافية والنزاهة الأكاديمية.
12. أفضل الممارسات والأخطاء الشائعة في حساب وتفسير ملخص الأرقام الخمسة
12.1 الأخطاء الشائعة في البرمجة والتطبيق داخل R
يقع العديد من الباحثين المبتدئين في مجموعة من الأخطاء التقنية والمنهجية المتكررة عند حساب ملخص الأرقام الخمسة في لغة R، لعل أبرزها الخلط بين مخرجات الدالتين fivenum() و summary()؛ حيث يعمد البعض إلى نسخ قيم الربيعيات من summary() وتسميتها بمفصلات توكي، متناسين الفروق الخوارزمية بين النمطين، مما يخلق تبايناً عند محاولة إعادة إنتاج النتائج بواسطة باحثين آخرين.
يتمثل الخطأ الثاني في محاولة تطبيق الدالة fivenum() على متغيرات نوعية أو اسمية غير مشفرة رقمياً (مثل متغيرات النصوص أو العوامل الاسمية Factor Variables)، مما يؤدي إما إلى ظهور أخطاء برمجية أو توليد رتب عددية وهمية لا تعبر عن أي معنى إحصائي حقيقي. يجب التأكد دائماً من أن المتغير خاضع للقياس الكمي أو الرتبي قبل الشروع في حسابه.
أما الخطأ الثالث، فيرتبط بإغفال تأثير العينات الصغيرة جداً (Small Sample Bias)؛ فعندما يكون حجم العينة صغيراً جداً (مثلاً $n < 8$)، تفقد المقاييس الموضعية مثل الربيعيات دقتها التمثيلية، ويصبح تقدير التشتت الموضعي غير مستقر وعرضة لتقلبات عشوائية حادة. في مثل هذه الحالات، يجب على المحلل الإشارة بوضوح إلى محدودية التقدير الربيعي وتفسير النتائج بحذر شديد.
12.2 المعايير المنهجية لكتابة تقرير إحصائي وفق دليل APA
يفرض دليل النشر التابع لجمعية علم النفس الأمريكية (APA 7th Edition) معايير واضحة وصارمة لتوثيق وعرض النتائج الإحصائية الوصفية اللامعلمية في المتن والجداول. عند تقرير ملخص الأرقام الخمسة، يجب تقديم الوسيط والمدى الربيعي كمقياسين متلازمين للنزعة المركزية والتشتت، مع ذكر المدى الكلي والقيم الطرفية لدعم الفهم التوزيعي.
تتضمن الصياغة النصية المعيارية لتقرير الملخص الخماسي نموذجاً أكاديمياً مشابهاً لما يلي:
“أظهرت درجات القلق لدى العينة الإكلينيكية توزيعاً ملتزياً إيجابياً، حيث بلغ الوسيط الإحصائي 42.00 نقطة، بينما تراوح النصف الأوسط للدرجات بين الربيع الأول (Q1 = 34.00) والربيع الثالث (Q3 = 56.00)، بمدى ربيعي بلغ (IQR = 22.00)، في حين امتدت الدرجات الكلية بين أدنى قيمة مرصودة (Min = 20.00) وأعلى قيمة (Max = 88.00).”
كما يُلزم دليل APA الباحثين بالربط التكاملي بين الوصف النصي الرقمي والتمثيل البياني الصندوقي المرفق في قسم النتائج، مع ضرورة توثيق الحزم والبرمجيات الإحصائية المستخدمة في التحليل وإصداراتها الدقيقة (مثل الإشارة إلى استخدام Base R version 4.3.x أو حزمة ggplot2)، مما يعزز الشفافية العلمية وإمكانية إعادة الإنتاج والتحقق المستقل (Reproducibility) في المجتمع الأكاديمي.
12.3 دليل إرشادي لاختيار الأداة الإحصائية المناسبة في R
لتسهيل عملية اتخاذ القرار البرمجي والإحصائي لدى الباحثين وعلماء البيانات، نلخص في هذا الدليل الإرشادي شجرة القرارات الموصى بها لاختيار دالة التلخيص المناسبة في لغة R بناءً على متطلبات التحليل وطبيعة المخرجات المطلوبة:
- اختر دالة
fivenum(): إذا كان هدفك هو التحليل الاستكشافي السريع، أو الحساب الصارم لمفصلات توكي المرتبطة بالمخططات الصندوقية الكلاسيكية، أو عند الرغبة في الحصول على متجه عددي خفيف وعالي السرعة للمعالجة داخل الحلقات البرمجية الكبيرة والبيانات الضخمة. - اختر دالة
summary(): عند إجراء الاستكشاف الأولي العام لمجموعات البيانات المعقدة، وحاجتك لمشاهدة المتوسط الحسابي بجانب الوسيط لتقييم الالتواء الأولي، أو لمراقبة وإحصاء عدد القيم المفقودة في كل متغير في نفس اللحظة. - اختر دالة
quantile(): عندما يتطلب بحثك السيكومتري التحكم الكامل في نوع الخوارزمية الرياضية (من خلال الوسيطtype)، أو عند الرغبة في استخراج مئينات مخصصة غير الأرباع القياسية (مثل المئين الخامس والتسعين $P_{95}$ أو العشيرات Deciles). - اختر أدوات
tidyverse (dplyr + ggplot2): عندما تحتاج إلى هندسة تقارير تجميعية معقدة متعددة المستويات والمجموعات وتضمينها في تدفقات أنابيب منسقة، وتصدير مخرجات بصرية وجداول نشر فائقة الجودة تدعم معايير النشر في المجلات الدولية المحكمة.
تتيح أتمتة هذه العمليات التحليلية باستخدام منصات النشر الديناميكي الحديثة مثل Quarto أو R Markdown للباحثين كتابة تقارير دورية متكاملة تدمج الأكواد والحسابات والجداول والرسوم البيانية في وثيقة تفاعلية واحدة قابلة للتحديث التلقائي كلما تم جمع بيانات جديدة، مما يمثل قمة الممارسة العلمية المعاصرة في تحليل البيانات.
خاتمة
يظل ملخص الأرقام الخمسة، بعد عقود طويلة من ابتكاره على يد جون توكي، إحدى أكثر الأدوات الإحصائية رسوخاً وأصالة في ترسانة التحليل الاستكشافي للبيانات. إن قدرته الفريدة على اختزال التوزيعات المعقدة في خمس نقاط موضعية متينة تجعله درعاً واقياً للباحثين ضد مضللات الالتواء والتشوهات الناتجة عن القيم الشاذة، وبخاصة في مجالات العلوم السلوكية والنفسية والطبية التي تتسم بياناتها بدرجة عالية من التنوع الطبيعي.
وقد أثبتت بيئة R الإحصائية أنها المنصة البرمجية الأكثر كفاءة ومرونة لتطبيق واستثمار هذا المفهوم الإحصائي؛ فمن خلال دوالها المتنوعة—سواء دالة R الأساسية fivenum() بمفصلاتها التوكية الدقيقة، أو دوال summary() و quantile()، أو المنظومات الحديثة المعززة بحزم tidyverse و ggplot2—يمتلك المحلل كافة الأدوات الرياضية والبرمجية والبصرية لفهم أدق تفاصيل بياناته، وبناء استنتاجات استدلالية رصينة ومحمية، وصياغة تقارير أكاديمية تتطابق مع أرقى معايير النشر العلمي العالمي.
References
- American Psychological Association. (2020). Publication manual of the American Psychological Association (7th ed.). American Psychological Association. https://doi.org/10.1037/0000165-000
- Hyndman, R. J., & Fan, Y. (1996). Sample quantiles in statistical packages. The American Statistician, 50(4), 361–365. https://doi.org/10.1080/00031305.1996.10473566
- R Core Team. (2023). R: A language and environment for statistical computing. R Foundation for Statistical Computing, Vienna, Austria. https://www.R-project.org/
- Tukey, J. W. (1977). Exploratory data analysis. Addison-Wesley Publishing Company.
- Wickham, H., Averick, M., Bryan, J., Chang, W., McGowan, L. D., François, R., Müller, K., Takahashi, K., Wilke, C. O., & Yutani, H. (2019). Welcome to the Tidyverse. Journal of Open Source Software, 4(43), 1686. https://doi.org/10.21105/joss.01686
- Wilkinson, L. (2005). The grammar of graphics (2nd ed.). Springer-Verlag. https://doi.org/10.1007/0-387-28695-0