الإحصاء والبرمجة في Rتحليل البيانات النفسية

كيفية رسم التوزيع ذي الحدين في R

دليل شامل ومفصل خطوة بخطوة لتعلم كيفية رسم التوزيع ذي الحدين بيانيًا في لغة البرمجة الإحصائية R باستخدام الدوال الأساسية وحزمة ggplot2 المتقدمة.

تاريخ النشر

يُعد التحليل الإحصائي الاستدلالي الركيزة الأساسية التي تقوم عليها الأبحاث العلمية الحديثة بمختلف تخصصاتها، لا سيما في العلوم السلوكية والاجتماعية والطبية الحيوية. وضمن هذا الإطار المعرفي المتشابك، يحتل التوزيع ذو الحدين (Binomial Distribution) مكانة محورية وفريدة بوصفه النموذج الاحتمالي النظري الأكثر موثوقية في دراسة الظواهر العشوائية المتقطعة ذات النتائج الثنائية المتعارضة. تتطلب معالجة هذه الظواهر الرياضية فهمًا عميقًا لكيفية توليد الاحتمالات وتفسيرها، حيث يُشكل الانتقال من الصياغات الجبرية المجردة إلى التجسيد البصري التفاعلي خطوة حاسمة لفك شفرات السلوك الإحصائي للبيانات والتحقق من افتراضات النماذج المعقدة.

تعتبر بيئة لغة R الإحصائية المنصة القياسية العالمية للباحثين والإحصائيين وعلماء البيانات لتحليل وتمثيل التوزيعات الاحتمالية بدقة فائقة ومرونة برمجية لا تضاهى. تقدم لغة R منظومة متكاملة من الدوال المدمجة التي تسمح بحساب وتوليد ومحاكاة مختلف خصائص التوزيع ذي الحدين بدقة حسابية متقدمة، بالإضافة إلى محركات رسومية فائقة القدرة تمتد من الرسوم البيانية الأساسية المدمجة (Base R Graphics) وصولاً إلى حزم الرسم المتقدمة المعتمدة على قواعد لغة النحو الرسومي مثل حزمة ggplot2. يتيح هذا التكامل للباحث تفكيك التوزيع بصريًا، ورصد تأثير تغير المعلمات التجريبية بصورة فورية وواضحة.

يهدف هذا الدليل المرجعي الشامل إلى تقديم معالجة أكاديمية وتطبيقية معمقة لكيفية رسم وتمثيل التوزيع ذي الحدين في لغة R، بدءًا من التأطير النظري والاشتقاق الرياضي لدوال الكتلة والتوزيع التراكمي، مرورًا بتشريح الدوال البرمجية الرباعية، وتطوير المخططات ثنائية وثلاثية الأبعاد، وضبط الخيارات الرسومية وفق معايير الجمعية الأمريكية لعلم النفس (APA Style) للنشر الأكاديمي المحكم. سيتم تزويد الباحث بالقواعد البرمجية المتكاملة، وتفسير المخرجات الإحصائية، واستكشاف الأخطاء وتصحيحها لضمان موثوقية وقابلية إعادة الإنتاج في الدراسات التجريبية والسلوكية.

1. مقدمة نظرية إلى التوزيع ذي الحدين وتطبيقاته الإحصائية

1.1 تعريف التوزيع ذي الحدين (Binomial Distribution)

يُعرَّف التوزيع ذو الحدين إحصائيًا بأنه توزيع احتمالي متقطع يصف عدد مرات النجاح المتحققة في عدد محدد وثابت من المحاولات العشوائية المستقلة والمتطابقة، والمعروفة تاريخيًا باسم تجارب بيرنولي (Bernoulli Trials). لكي تخضع تجربة عشوائية ما لنموذج ذي الحدين، يتعين استيفاء أربعة شروط أساسية صارمة لا تقبل التهاون: أولاً، ثبات عدد المحاولات الكلي المحدد بالرمز n؛ ثانيًا، ثنائية مخرجات كل محاولة منفردة، بحيث تنحصر النتائج في فئتين متنافيتين وشاملتين تُصنفان تقليديًا كـ “نجاح” (Success) أو “فشل” (Failure)؛ ثالثًا، استقلالية المحاولات التامة إحصائيًا، بحيث لا تؤثر نتيجة أي محاولة على احتمال وقوع المحاولات اللاحقة؛ ورابعًا، ثبات احتمال النجاح المحدد بالرمز p عبر جميع المحاولات التجريبية دون أي تغيير.

يتحدد هذا التوزيع بشكل قطعي بواسطة معلمتين بنيويتين أساسيتين هما: حجم العينة أو عدد المحاولات الكلي n، واحتمال النجاح الفردي في كل محاولة p، والذي يحدد بدوره تلقائيًا احتمال الفشل المتمم $q = 1 – p$. يأخذ المتغير العشوائي المتقطع X قيمه في فضاء عينة محدد بدقة يمتد على مجموعة الأعداد الصحيحة غير السالبة ${0, 1, 2, dots, n}$. تكتسب عملية تحديد فضاء العينة أهمية استثنائية في الدراسات السلوكية والنفسية، حيث تُترجم المتغيرات المعرفية والسلوكية إلى مقاييس متقطعة تمثل عدد الاستجابات الصحيحة أو القرارات المستهدفة، مما يفرض استخدام هذا التوزيع لنمذجة تباين الأداء وتحديد احتمالات المصادفة بدقة رياضية صارمة.

1.2 أهمية التمثيل البياني للتوزيعات الاحتمالية في R

يمثل التمثيل البياني للتوزيعات الاحتمالية في بيئة R حجر الزاوية في الاستكشاف الإحصائي، إذ يُسهم في تحويل المعادلات الرياضية الجافة والمصفوفات الرقمية المعقدة إلى هياكل بصرية ذات دلالات إدراكية واضحة. يتيح المخطط البياني للباحث قراءة السلوك الديناميكي للتوزيع، والتحقق البصري المباشر من مدى تمركز البيانات حول قيمتها المتوقعة، وتقدير سرعة تضاؤل الاحتمالات عند الأطراف (Tails). يوفر هذا التمثيل وسيلة لا غنى عنها لتبسيط المفاهيم الاحتمالية المجردة، وتسهيل شرح النتائج التجريبية للأوساط الأكاديمية وصناع القرار دون الغرق في التفاصيل الحسابية الدقيقة.

علاوة على ذلك، يُعد التمثيل الرسومي أداة تشخيصية فعالة لاستكشاف الخصائص التوزيعية الجوهرية مثل التماثل والالتواء (Skewness) والتفرطح (Kurtosis). فعند تعديل المعلمة p، يستطيع الباحث تتبع انزياح ذروة التوزيع بصريًا نحو اليمين أو اليسار ورصد التغير في تسطح القمة. كما تُستخدم الرسوم البيانية في بيئة R كأداة مطابقة تشخيصية (Goodness-of-Fit) لمقارنة التوزيعات التكرارية التجريبية المرصودة من العينات الميدانية مع التوزيع النظري ذي الحدين، مما يتيح الكشف الفوري عن أي شذوذ في البيانات أو انحراف عن الفرضيات الأساسية للتجربة.

1.3 حالات الاستخدام الشائعة للتوزيع ذي الحدين

تتعدد التطبيقات الإحصائية للتوزيع ذي الحدين عبر طيف واسع من المجالات التجريبية، ويبرز استخدامه بوضوح في العلوم السلوكية وعلم النفس التجريبي عند تحليل المهام القائمة على الاستجابة الثنائية القسرية (Two-Alternative Forced Choice Tasks)، مثل تجارب التمييز الحسي، وقرارات الرصد البصري، والمهام الإدراكية التي تتطلب الحكم بنعم/لا أو صواب/خطأ. يتيح التوزيع للباحثين السلوكيين وضع خط أساس احتمالي لاختبار ما إذا كان أداء المفحوصين يفوق مستوى التخمين العشوائي (Chance Level)، وبناء نماذج دقيقة لقدرات التعرف والذاكرة الاسترجاعية.

يمتد التطبيق ليشمل تقييم الأداء المعرفي ومعدلات اجتياز المهام المقننة في القياس النفسي والتربوي، حيث تُحلل استجابات الطلاب على مفردات الاختبارات الموضوعية لتقدير صعوبة الأسئلة وموثوقية المقاييس. كما يشكل التوزيع الأساس الإحصائي المعتمد في اختبارات مراقبة الجودة الصناعية لتقدير نسب الوحدات المعيبة ضمن خطوط الإنتاج، وتصميم وتحليل التجارب السريرية للتحقق من فعالية العلاجات الدوائية (شفاء/عدم شفاء)، بالإضافة إلى بناء خوارزميات اتخاذ القرار في بحوث العمليات والذكاء الاصطناعي التي تعتمد على مسارات احتمالية شجرية ثنائية التفرع.

2. الأسس الرياضية لدوال الاحتمال الخاصة بالتوزيع ذي الحدين

2.1 دالة الكتلة الاحتمالية (Probability Mass Function – PMF)

تُعبر دالة الكتلة الاحتمالية للمتغير العشوائي المتقطع X عن الاحتمال الدقيق لحصول عدد محدد من النجاحات مقداره k ضمن n محاولة مستقلة. تصاغ هذه العلاقة رياضيًا عبر المعادلة الكلاسيكية:

$$P(X = k) = \binom{n}{k} p^k (1-p)^{n-k} = \frac{n!}{k!(n-k)!} p^k q^{n-k}$$

حيث يمثل $k in {0, 1, 2, dots, n}$ عدد النجاحات المستهدفة، و $p^k$ احتمال حدوث النجاح k مرة، و $(1-p)^{n-k}$ احتمال حدوث الفشل في بقية المحاولات البالغ عددها $n-k$.

يبرز في هذه الصيغة معامل التوافيق الرياضي $\binom{n}{k}$، والذي يؤدي دورًا محوريًا في حساب عدد التبديلات والترتيبات الفريدة والممكنة لتوزيع k من النجاحات عبر n من المحاولات دون النظر إلى الترتيب الزمني لحدوثها. يكمن الفرق الجوهري بين التوزيعات المتقطعة التي تعتمد دالة الكتلة الاحتمالية (PMF) والتوزيعات المتصلة التي تعتمد دالة الكثافة الاحتمالية (PDF) في أن دالة الكتلة تعطي قيمة احتمالية نقطية موجبة مباشرة لكل نقطة معزولة $P(X = k) ge 0$، ويكون مجموع هذه الاحتمالات عبر كامل فضاء العينة مساويًا للواحد الصحيح قطعيًا ($\sum_{k=0}^{n} P(X = k) = 1$).

2.2 دالة التوزيع التراكمي (Cumulative Distribution Function – CDF)

تُعرف دالة التوزيع التراكمي للمتغير العشوائي ذي الحدين، والتي يُرمز لها بالرمز $F(k)$، بأنها الدالة الرياضية التي تحسب الاحتمال التراكمي لحدوث عدد من النجاحات يقل عن أو يساوي قيمة عتبية معينة k. يعبر عن هذه الدالة رياضيًا بالصيغة التجميعية:

$$F(k) = P(X le k) = \sum_{i=0}^{\lfloor k \rfloor} \binom{n}{i} p^i (1-p)^{n-i}$$

حيث تمثل $lfloor k rfloor$ أكبر عدد صحيح يقل عن أو يساوي k. تتسم هذه الدالة بكونها دالة متزايدة رتيبة، تبدأ قيمتها من الصفر وتتصاعد عبر قفزات متقطعة لتصل إلى الواحد الصحيح عند $k = n$.

تتجلى العلاقة الحسابية والتكاملية بين دالة الكتلة الاحتمالية ودالة التوزيع التراكمي في أن قيمة CDF عند أي نقطة تمثل الجمع البسيط لمساحات الكتل الاحتمالية السابقة لها وحتى تلك النقطة. تكتسب دالة التوزيع التراكمي أهمية بالغة في الإحصاء الاستدلالي واختبار الفرضيات (Hypothesis Testing)، حيث تُستخدم لحساب القيم الاحتمالية الحرجة (p-values) الخاصة بالاختبارات ذات الطرف الواحد أو الطرفين، وتحديد مناطق رفض فرضية العدم عند مستويات دلالة إحصائية معيارية ($\alpha = 0.05$ أو $\alpha = 0.01$).

2.3 الخصائص الإحصائية: القيمة المتوقعة والتباين

تخضع معالم النزعة المركزية والتشتت للتوزيع ذي الحدين لقوانين رياضية دقيقة تشتق مباشرة من خواص تجارب بيرنولي المستقلة. يُحسب التوقع الرياضي أو المتوسط الحسابي للتوزيع، والممثل بالرمز $E(X)$ أو $\mu$، عبر ضرب الحجم الإجمالي للمحاولات في احتمال النجاح الفردي:

$$\mu = E(X) = n \cdot p$$

ويعكس هذا الرقم المركز الثقلي لكتلة الاحتمالات والقيمة الأكثر ترجيحًا للظهور على المدى الطويل من التكرار التجريبي.

أما التشتت وتناثر البيانات حول هذا المتوسط، فيقاس كميًا بواسطة التباين الإحصائي $Var(X)$ والانحراف المعياري $\sigma$ وفق المعادلات التالية:

$$\sigma^2 = Var(X) = n \cdot p \cdot (1 – p) = n p q$$

$$\sigma = \sqrt{n p (1 – p)}$$

تؤثر هذه الخصائص الإحصائية بشكل مباشر على البنية البصرية للمخطط البياني في R؛ إذ يحدد المتوسط الحسابي $\mu$ الموقع الأفقي لذروة التوزيع على المحور السيني، بينما يتحكم التباين $\sigma^2$ في مدى اتساع أو ضيق التوزيع، حيث يبلغ التباين أقصى قيمة له عندما يكون الاحتمال متساويًا تمامًا ($p = 0.5$)، مما يؤدي إلى اتساع قاعدة الرسم البياني وزيادة انتشاره الأفقي مقارنة بالتوزيعات ذات القيم المتطرفة لـ p.

3. منظومة دوال التوزيع ذي الحدين المدمجة في لغة R

3.1 الدالة dbinom(): حساب قيم دالة الكتلة الاحتمالية

تُعد دالة dbinom() إحدى الركائز الأساسية المدمجة في حزمة stats القياسية في لغة R، وهي المسؤولة عن الحساب الرقمي الدقيق لقيم دالة الكتلة الاحتمالية (PMF). تأتي الدالة بالبنية النحوية المعيارية التالية:

dbinom(x, size, prob, log = FALSE)

حيث يمثل الوسيط x متجهًا من الأعداد الصحيحة يحدد قيم النجاحات المستهدفة المراد تقييمها، بينما يحدد الوسيط size عدد المحاولات الكلي n، ويحدد الوسيط prob احتمال النجاح في المحاولة الواحدة p. أما الوسيط المنطقي log فيتيح عند ضبطه على TRUE إرجاع اللوغاريتم الطبيعي للاحتمالات المحسوبة، وهو خيار بالغ الأهمية لتجنب أخطاء التدفق السفلي (Underflow) في النماذج الاحتمالية المعقدة وتطبيقات تقدير الإمكانية العظمى (Maximum Likelihood Estimation).

تتميز الدالة في لغة R بقدرتها الفائقة على التعامل مع المتجهات كمدخلات أساسية (Vectorization)، مما يتيح تمرير متجه كامل من قيم النجاحات، مثل x = 0:n، لتقوم الدالة بحساب وتوليد مصفوفة احتمالية متكاملة بضربة برمجية واحدة دون الحاجة إلى كتابة حلقات تكرارية (Loops) بطيئة. تشكل هذه المصفوفة الناتجة من dbinom() المدخل المباشر لمتغير المحور الصادي في دوال الرسم البياني، مما يجعلها الأداة المركزية لبناء المخططات البيانية لتوزيعات الكتل الاحتمالية.

3.2 الدالة pbinom(): حساب الاحتمالات التراكمية

تتولى دالة pbinom() حساب دالة التوزيع التراكمي (CDF) بدقة حسابية عالية، مستخدمة الصيغة التركيبية التالية:

pbinom(q, size, prob, lower.tail = TRUE, log.p = FALSE)

يستقبل الوسيط q متجه الشواهد أو نقاط القطع الكمية التي يُراد حساب الاحتمال التراكمي عندها. ويعمل الوسيط المنطقي المحوري lower.tail على تحديد اتجاه التراكم؛ فعندما يكون lower.tail = TRUE (الوضع الافتراضي)، تحسب الدالة احتمال الطرف الأيسر للتوزيع $P(X le q)$، في حين يؤدي تعيينه إلى FALSE إلى حساب احتمالات الطرف الأيمن الصارمة $P(X > q)$.

تُعد دالة pbinom() المكون الأساسي المعتمد لتمثيل منحنيات التوزيع التراكمي التدريجية في R، حيث تُمرر قيم المتجه التراكمي المحسوب لتوليد المخططات البيانية الدرجية. كما تُسهم هذه الدالة بشكل فعال في حساب احتمالات الفترات المفتوحة والمغلقة، واستخراج مساحات الأطراف الحرجة للاختبارات الإحصائية ذات الدلالة المعنوية دون الحاجة لإجراء عمليات الجمع اليدوي للكتل الاحتمالية المنفردة.

3.3 الدوال الإضافية qbinom() و rbinom() ودورها التكاملي

تكتمل المنظومة الرباعية لدوال التوزيع ذي الحدين في لغة R من خلال دالتي qbinom() و rbinom(). تعمل دالة المئين (Quantile Function) qbinom(p, size, prob, lower.tail = TRUE) كمعكوس رياضي لدالة التوزيع التراكمي، حيث تأخذ قيمة احتمالية معينة p (تنحصر بين 0 و 1) وتُرجع أصغر قيمة صحيحة لعدد النجاحات k التي تحقق شرط الاحتمال التراكمي $P(X le k) ge p$. تُعد هذه الدالة بالغة الأهمية لتحديد نقاط القطع الحرجة (Critical Values) وحدود فترات الثقة الإحصائية وتحديد مواقع الربيعيات والمئينات على المخططات البيانية.

من جانب آخر، تُمثل دالة rbinom(n, size, prob) محرك التوليد العشوائي المعتمد لمحاكاة البيانات وفق نموذج ذي الحدين، حيث يحدد الوسيط n هنا عدد الملاحظات أو المتغيرات العشوائية المستقلة المراد توليدها تجريبيًا. يؤدي هذا التكامل الرباعي بين الدوال دورًا جوهريًا في بحوث النمذجة الإحصائية ومحاكاة مونت كارلو (Monte Carlo Simulations)، إذ يستطيع الباحث توليد عينات افتراضية باستخدام rbinom()، ورسم توزيعاتها التجريبية، ومقارنتها مباشرة بالمنحنيات النظرية المشتقة من dbinom() و pbinom()، وتحديد معالمها القطعية باستخدام qbinom() ضمن خط أنابيب تحليلي وبصري موحد وشامل.

4. رسم دالة الكتلة الاحتمالية للتوزيع ذي الحدين باستخدام Base R

4.1 إعداد متجهات البيانات الأساسية للمحاكاة

يتطلب الشروع في بناء التمثيل البياني لدالة الكتلة الاحتمالية في بيئة R الأساسية (Base R) إعداد البنية المتجهية للبيانات بدقة ومنهجية برمجية واضحة. تبدأ الخطوة الأولى بتحديد معلمات النموذج التجريبي وتخزينها في متغيرات واضحة التسمية؛ حيث نقوم بتعريف عدد المحاولات الكلي n <- 20 واحتمال النجاح الفردي p <- 0.3. يتيح هذا التجريد البرمجي تعديل معلمات النموذج لاحقًا بسهولة وإعادة إنتاج المخططات البيانية دون تعديل الأوامر الحسابية المتتالية.

تتمثل الخطوة التالية في إنشاء متجه يمثل النطاق الكامل لعدد النجاحات المحتملة للمتغير العشوائي X، ويتم ذلك بالاعتماد على عامل التسلسل في R: success <- 0:n. بعد ذلك، يتم تطبيق دالة dbinom() مباشرة على متجه النجاحات لحساب الكتلة الاحتمالية لكل نقطة: probabilities <- dbinom(success, size = n, prob = p). ينتج عن هذه الخطوة متجه عددي متطابق في الطول مع متجه النجاحات، يحتوي على قيم احتمالية دقيقة تُمثل الأساس الرياضي الذي سيتم إسقاطه على المحاور الإحداثية للرسم البياني.

4.2 استخدام دالة plot() مع تحديد نوع الرسم البياني نوع ‘h’

توفر دالة الرسم العامة plot() في Base R بيئة مرنة وسريعة لتمثيل البيانات، إلا أن الطبيعة المتقطعة للتوزيع ذي الحدين تفرض اختيارًا دقيقًا لنوع التمثيل البياني. يتم تنفيذ الرسم الأساسي عبر تمرير متجه النجاحات على المحور الأفقي ومتجه الاحتمالات على المحور الرأسي مع التحديد الصريح للوسيط type = "h" (والذي يرمز إلى الخطوط الرأسية الشبيهة بأعمدة المدرج التكراري أو Histogram-like vertical lines):

plot(success, probabilities, type = "h")

تكمن الأهمية المنهجية لاستخدام النمط type = "h" في كونه يعكس بدقة الطبيعة الانفصالية للمتغير العشوائي المتقطع، حيث تُرسم خطوط عمودية تمتد من الصفر حتى قيمة الكتلة الاحتمالية عند كل نقطة صحيحة، مع بقاء الفراغات بين القيم لتعكس استحالة وقوع قيم كسرية بين النجاحات. في المقابل، فإن استخدام النمط type = "p" يقتصر على وضع نقاط معزولة قد يصعب تتبعها بصريًا، بينما يؤدي استخدام النمط الخطي type = "l" أو type = "b" إلى إيحاء خاطئ باستمرارية التوزيع وتوفر احتمالات بينية للقيم الكسرية، وهو ما يتنافى كليًا مع المنطق الإحصائي للمتغيرات المتقطعة.

Plot of Binomial distribution probability mass function in R
Plot of Binomial distribution probability mass function in R

4.3 فهم محاور الرسم البياني وقراءة النتائج الأولية

يتطلب التفسير الإحصائي السليم للمخطط البياني الناتج قراءة متأنية ودقيقة للمحاور الإحداثية وتوزيع الكتل. يمثل المحور السيني (X-axis) فضاء الحالات الممكنة للمتغير العشوائي، والتي تبدأ بدقة من الصفر (حالة الإخفاق التام في جميع المحاولات) وتتدرج تصاعديًا حتى تصل إلى أقصى حد ممكن وهو n (20 نجاحًا). أما المحور الصادي (Y-axis)، فيمثل مقياس الاحتمال النظري المحسوب لكل نقطة، وتتراوح قيمه بين 0 وأعلى قيمة احتمالية مفردة في التوزيع.

من الناحية التحليلية، يتيح المخطط للباحث التحقق البصري المباشر من نقطة الذروة (Mode) ومقارنتها بالمتوسط الحسابي النظري المحسوب رياضيًا $E(X) = n \cdot p = 20 \times 0.3 = 6$. يظهر المخطط بوضوح أن العمود الأطول يتمركز تمامًا عند القيمة 6 على المحور السيني بقيمة احتمالية تبلغ قرابة 0.1916، مع تضاؤل سريع ومتناظر نسبيًا في كتل الاحتمالات كلما ابتعدنا عن هذه النقطة المركزية، حتى تتلاشى الاحتمالات عمليًا وتقترب من الصفر المطلق عند تجاوز 14 نجاحًا، مما يجسد الخصائص الرياضية للنموذج تجريبيًا وبصريًا.

5. تخصيص وتنسيق المخططات البيانية الأساسية في Base R

5.1 إضافة العناوين التوضيحية وتسميات المحاور

يتطلب إنتاج مخططات بيانية جاهزة للعرض الأكاديمي والتقارير العلمية تجاوز الإعدادات الافتراضية المقتضبة لدالة plot() من خلال تزويد الرسم بالتسميات التوضيحية الدقيقة التي تزيل أي غموض مفاهيمي. يتم التحكم في هذه النصوص عبر وسائط مخصصة داخل أمر الرسم:

plot(success, probabilities, type = "h", main = "توزيع ذي الحدين (n = 20, p = 0.3)", xlab = "عدد مرات النجاح (k)", ylab = "الاحتمال P(X = k)")

يسهم تضمين قيم المعلمات الأساسية ($n$ و $p$) مباشرة في العنوان الرئيسي (main) في إعطاء القارئ سياقًا فوريًا لخصائص النموذج الإحصائي الممثل. كما تضمن التسمية الدقيقة للمحور السيني (xlab) والمحور الصادي (ylab) الالتزام بالمعايير الأكاديمية الصارمة، حيث يُحدد المحور الأفقي كمتغير متقطع يمثل تكرار النجاحات، بينما يُحدد المحور الرأسي كمقياس للاحتمال النقطي المباشر، مما يمنع الخلط بين دالة الكتلة الاحتمالية ودوال الكثافة أو التوزيع التراكمي.

5.2 التحكم في سُمك الخطوط والألوان وعناصر الرؤية

توفر لغة Base R خيارات رسومية متقدمة لتعديل المظهر الجمالي والوضوح البصري للأعمدة الاحتمالية. يمكن زيادة سُمك الأعمدة الرأسية لتبدو كمستطيلات بارزة وواضحة باستخدام وسيط عرض الخط lwd (Line Width)، مثل تعيين lwd = 5 أو lwd = 8. كما يمكن تطبيق نظام ألوان احترافي باستخدام وسيط اللون col، بتمرير أسماء الألوان القياسية (مثل col = "steelblue" أو col = "darkgreen") أو استخدام أكواد الألوان السداسية العشرية (HEX Codes) للحصول على تباين لوني دقيق:

plot(success, probabilities, type = "h", lwd = 6, col = "#1F78B4")

ولإضفاء لمسة جمالية تعزز من دقة الرؤية وتحديد نهايات الأعمدة بوضوح، يمكن دمج دالة points() لإضافة نقاط دائرية مصمتة في أعلى كل عمود احتمالي. يتم استدعاء هذه الدالة بعد أمر الرسم المباشر:

points(success, probabilities, pch = 16, col = "#E31A1C", cex = 1.2)

حيث يحدد الوسيط pch = 16 رمز النقطة الدائرية المصمتة، بينما يحدد cex = 1.2 حجم النقطة النسبي، مما يحول الرسم البياني التقليدي إلى ما يشبه مخطط المصاصة (Lollipop Plot) الاحترافي الذي يجمع بين وضوح الارتفاع الرأسي وتحديد القمة الاحتمالية بدقة فائقة.

5.3 تعديل حدود المحاور وشبكة الإحداثيات

تقتطع الدوال الرسومية الافتراضية أحيانًا الهوامش المحيطة بأعلى عمود احتمالي أو تضغط المحاور بصورة تعيق القراءة السلسة. يمكن معالجة ذلك عبر التحديد الصريح لحدود المحاور باستخدام الوسيطين xlim و ylim. يتم تعيين xlim = c(0, n) لضمان ظهور كامل فضاء العينة، وتعيين ylim = c(0, max(probabilities) * 1.15) لإضافة مساحة أمان رأسية تمنع تداخل قمم الأعمدة مع العنوان الرئيسي للرسم:

plot(success, probabilities, type = "h", lwd = 6, col = "steelblue", ylim = c(0, 0.25), xlim = c(0, 20), bty = "l", las = 1)

يساعد الوسيط bty = "l" في إزالة الإطار العلوي والأيمن للرسم البياني لتوليد مظهر عصري ونظيف يقتصر على المحورين السيني والصادي الأساسيين، بينما يقوم الوسيط las = 1 بجعل جميع أرقام تسميات المحاور أفقية لتسهيل قراءتها. ولتعزيز الدقة في تتبع القيم الاحتمالية ومطابقتها بصريًا مع المحور الرأسي، تُضاف شبكة إحداثيات خلفية خفيفة باستخدام دالة grid():

grid(nx = NA, ny = NULL, col = "gray85", lty = "dotted")

حيث يضمن ضبط nx = NA عدم تشويه المحور السيني المتقطع بخطوط رأسية زائدة، مع الاقتصار على الخطوط الأفقية المنقطة (lty = "dotted") التي تسهم في التقدير البصري السريع للقيم الاحتمالية.

6. استخراج وتنسيق القيم الاحتمالية العددية بدقة في R

6.1 التعامل مع الترقيم العلمي وتعطيله عبر خيار scipen

عند التعامل مع التوزيع ذي الحدين في لغة R—خاصة في الحالات التي يكون فيها عدد المحاولات n كبيرًا أو عند دراسة الأحداث النادرة ذات الاحتمالات الضئيلة—تميل البيئة البرمجية تلقائيًا إلى تحويل الأرقام العشرية الصغيرة جدًا إلى صيغة الترقيم العلمي (Scientific Notation)، مثل عرض القيمة 0.0000123 على هيئة 1.23e-05. على الرغم من الكفاءة البرمجية لهذا التنسيق، إلا أنه يشكل عائقًا إدراكيًا كبيرًا عند بناء الجداول الإحصائية الموجهة للقراءة البشرية أو عند كتابة التقارير الأكاديمية التفسيرية.

للتحكم في هذا السلوك وفرض العرض العشري القياسي الكامل عبر جلسة العمل، توفر لغة R خيار النظام العام scipen (Scientific Penalty). يتم تعطيل الترقيم العلمي عبر تمرير قيمة موجبة عالية باستخدام الأمر:

options(scipen = 999)

تفرض هذه التعليمة على محرك R الرياضي عرض الأرقام العشرية الممتدة بدلاً من الترقيم الأسي ما لم يتجاوز عدد الأصفار العقوبة المحددة. ومن أفضل الممارسات البرمجية المعتمدة إعادة ضبط هذا الخيار إلى وضعه القياسي الافتراضي (options(scipen = 0)) بعد الانتهاء من استخراج البيانات وتصدير الجداول، لضمان عدم التأثير على سلوك الحزم الأخرى التي قد تعتمد على الترقيم العلمي في الحسابات المتقدمة.

6.2 بناء جدول توزيع احتمالي كامل وتنسيقه

يمثل إنشاء جدول توزيع احتمالي متكامل ومنسق الخطوة التحليلية الأساسية لربط المخططات البيانية بالبيانات الرقمية الدقيقة التي بنيت عليها. يتم ذلك بتجميع المتجهات الإحصائية المحسوبة داخل إطار بيانات منظم (Data Frame)، مع تطبيق دالة التقريب round() لضبط عدد المنازل العشرية وفق التقاليد الأكاديمية (غالبًا 4 أو 5 منازل عشرية):

dist_table <- data.frame(Successes = success, Probability = round(probabilities, 4), Cumulative_Prob = round(pbinom(success, size = n, prob = p), 4))

يتيح هذا الجدول المدمج استعراضًا شاملاً لكل نقطة من نقاط فضاء العينة؛ حيث يقابل كل عدد محدد من النجاحات قيمته الاحتمالية المنفردة $P(X = k)$ وقيمته التراكمية الصاعدة $P(X le k)$. يمكن استعراض الجدول في وحدة التحكم البرمجية (Console) أو تصديره إلى صيغ نشر متعددة مثل HTML أو LaTeX باستخدام حزم مثل knitr::kable() لتقديمه كملحق إحصائي مدعم للمخططات البيانية في الأوراق البحثية.

6.3 تحديد وحساب احتمالات فترات معينة برمجياً

تتطلب التطبيقات العملية في اختبار الفرضيات وحساب فترات الثقة تقدير احتمالية وقوع المتغير العشوائي ضمن نطاق محدد مغلق $[a, b]$، مثل حساب احتمالية الحصول على عدد نجاحات يتراوح بين 4 و 8 نجاحات ($P(4 le X le 8)$). يتم تنفيذ هذا الحساب برمجياً في R بكفاءة متناهية عبر استخدام دالة الجمع sum() على مخرجات dbinom() للنطاق المستهدف:

interval_prob <- sum(dbinom(4:8, size = n, prob = p))

أو بدلاً من ذلك، باستخدام دالة التوزيع التراكمي: pbinom(8, n, p) - pbinom(3, n, p).

ولإبراز هذه الفترة الاحتمالية بصريًا وربط الحساب النظري بالمخطط البياني، يمكن استخدام مصفوفة ألوان شرطية أثناء استدعاء أمر الرسم، حيث يتم إعطاء لون مميز وبارز (مثل الأحمر) للأعمدة الواقعة داخل الفترة $[4, 8]$، بينما تأخذ بقية الأعمدة لونًا محايدًا خافتًا (مثل الرمادي):

bar_colors = 4 & success <= 8, "#E41A1C", "#B0B0B0")
plot(success, probabilities, type = "h", lwd = 6, col = bar_colors, main = "تمثيل فترة احتمالية مخصصة P(4 <= X <= 8)")

يسهم هذا التظليل الشرطي في توجيه الانتباه البصري الفوري نحو المساحة الاحتمالية المستهدفة، مما يسهل تفسير الاحتمالات الشرطية وفترات الدلالة الإحصائية في المحاضرات الأكاديمية والعروض التقديمية المحكمة.

7. رسم التوزيع ذي الحدين باستخدام حزمة ggplot2 المتقدمة

7.1 تجهيز وتشكيل البيانات في صيغة Data Frame ملائمة لـ ggplot2

تعتمد حزمة ggplot2—المطورة كجزء من منظومة Tidyverse الشهيرة—على فلسفة لغة النحو الرسومي (Grammar of Graphics)، والتي تشترط أن تكون جميع البيانات المدخلة مهيكلة بدقة داخل إطار بيانات مستطيل ونظيف (Tidy Data Frame). يقتضي ذلك تجهيز كائن البيانات الإحصائية مسبقًا قبل الشروع في بناء طبقات الرسم البياني:

df_binom <- data.frame(k = 0:n, prob = dbinom(0:n, size = n, prob = p))

في بعض السياقات الرسومية المتقدمة، يُفضل تحويل متغير النجاحات k إلى عامل متقطع (Factor) باستخدام الدالة factor(0:n) إذا كان الهدف معاملة المحور السيني كفئات منفصلة تمامًا، أو الإبقاء عليه كمتغير عددي متصل (Numeric Discrete) عند الرغبة في التحكم المستمر بتدريجات المحور وتطبيق التحويلات الرياضية. تضمن هذه الهيكلة توافق البيانات التام مع محددات الجمالية المكانية واللونية (Aesthetic Mappings) داخل بيئة ggplot2.

7.2 بناء الرسم البياني باستخدام geom_col() و geom_segment()

توفر ggplot2 مقاربات رسومية متعددة لتمثيل دالة الكتلة الاحتمالية بدقة بصرية مذهلة. تتمثل الطريقة الأولى في استخدام طبقة الأعمدة geom_col()، والتي تسمح بالتحكم الدقيق في عرض الأعمدة (width)، ولون التعبئة الداخلية (fill)، ولون الحدود الخارجية (color):

ggplot(df_binom, aes(x = k, y = prob)) + geom_col(width = 0.6, fill = "#2C3E50", color = "black")

أما المقاربة الأكثر تطابقًا مع التمثيل الخطي الرأسي التقليدي، فتتمثل في بناء مخطط المصاصة (Lollipop Chart) فائق الأناقة عبر دمج طبقتي geom_segment() و geom_point(). ترسم طبقة geom_segment() خطوطًا عمودية دقيقة تبدأ من الصفر وتنتهي عند قيمة الاحتمال المقابلة، بينما تضع geom_point() نقاطًا دائرية بارزة على قمم الخطوط:

ggplot(df_binom, aes(x = k, y = prob)) +
  geom_segment(aes(x = k, xend = k, y = 0, yend = prob), color = "steelblue", size = 1.2) +
  geom_point(color = "firebrick", size = 3)

Binomial distribution probably mass function plot in R
Binomial distribution probably mass function plot in R

7.3 تطبيق السمات (Themes) المتقدمة وإضافة التسميات التوضيحية

تكتمل قوة ggplot2 عبر قدرتها الاستثنائية على تخصيص كافة المكونات الطباعية والخلفيات لتلائم معايير النشر الأكاديمي الرصين. يمكن التخلص من الخلفية الرمادية الافتراضية وتطبيق سمات احترافية مثل theme_minimal() أو theme_classic() التي توفر مظهرًا ناصعًا وخلفيات بيضاء نظيفة تتوافق بدقة مع متطلبات المجلات العلمية المحكمة.

علاوة على ذلك، يمكن إضافة طبقة النصوص المباشرة geom_text() لطباعة القيم الاحتمالية الرقمية فوق كل عمود بدقة متناهية، مع استخدام دالة labs() لتنسيق العناوين والمحاور وشروح الأشكال:

ggplot(df_binom, aes(x = k, y = prob)) +
  geom_col(fill = "#3498DB", width = 0.5) +
  geom_text(aes(label = sprintf("%.3f", prob)), vjust = -0.5, size = 3.5, color = "black") +
  scale_x_continuous(breaks = 0:n) +
  scale_y_continuous(limits = c(0, max(df_binom$prob) * 1.2)) +
  labs(title = "دالة الكتلة الاحتمالية للتوزيع ذي الحدين",
       subtitle = paste("n =", n, ", p =", p),
       x = "عدد مرات النجاح (k)",
       y = "الاحتمال P(X = k)") +
  theme_classic()

يوفر هذا التنسيق المتكامل مخططًا بيانيًا عالي الجودة يجمع بين التمثيل الرقمي الدقيق والشكل البصري الجذاب، مما يجعله جاهزًا للإدراج المباشر في الأطروحات والمنشورات العلمية.

8. تمثيل دالة التوزيع التراكمي (CDF) بيانياً في R

8.1 الرسم التدريجي لدالة CDF في Base R

تتطلب الطبيعة الرياضية الانفصالية للمتغير العشوائي ذي الحدين تمثيل دالة التوزيع التراكمي (CDF) على هيئة دالة درجية أو خطوة بخطوة (Step Function)، حيث يظل الاحتمال التراكمي ثابتًا في الفترات الواقعة بين الأعداد الصحيحة، ويقفز فجأة عند كل عدد صحيح بمقدار الكتلة الاحتمالية لذلك العدد. يتم تنفيذ هذا التمثيل في Base R من خلال حساب متجه الاحتمالات التراكمية باستخدام دالة pbinom()، ومن ثم استدعاء دالة plot() مع التحديد الصريح للنمط type = "s":

cum_prob <- pbinom(success, size = n, prob = p)
plot(success, cum_prob, type = "s", lwd = 3, col = "darkblue",
     main = "دالة التوزيع التراكمي ذي الحدين (CDF)",
     xlab = "عدد مرات النجاح (k)", ylab = "الاحتمال التراكمي P(X <= k)",
     ylim = c(0, 1), las = 1)

تُظهر القفزات الرأسية في الرسم التدريجي بدقة متناهية مساهمة كل نقطة نجاح جديدة في رفع الحصيلة التراكمية للاحتمالات. ولإبراز النقاط المفصلية التي تحدث عندها القفزات، يمكن إضافة طبقة من النقاط الدائرية المصمتة عند الحواف اليمنى لكل درجة باستخدام الأمر points(success, cum_prob, pch = 19, col = "red", cex = 1)، مما يعكس المعنى الرياضي الدقيق للاتصال من اليمين (Right-Continuous) الذي تتسم به دوال التوزيع التراكمي للمتغيرات المتقطعة.

8.2 رسم دالة CDF باستخدام ggplot2 ودالة stat_ecdf()

توفر حزمة ggplot2 أدوات هندسية متخصصة لتمثيل المنحنيات التراكمية بأعلى درجات الدقة والجمالية. يتم تمثيل الدالة النظرية التراكمية باستخدام طبقة geom_step()، والتي تأخذ إطار البيانات المحسوب مسبقًا وتقوم ببناء المسار الدرجي بسلاسة تامة:

ggplot(df_binom, aes(x = k, y = pbinom(k, size = n, prob = p))) +
  geom_step(color = "#2980B9", size = 1.2, direction = "hv") +
  geom_point(color = "#C0392B", size = 2.5) +
  scale_y_continuous(breaks = seq(0, 1, 0.2), limits = c(0, 1)) +
  scale_x_continuous(breaks = 0:n) +
  labs(title = "المخطط التراكمي للتوزيع ذي الحدين في ggplot2",
       x = "عدد مرات النجاح (k)", y = "F(k) = P(X <= k)") +
  theme_minimal()

في السياقات التجريبية التي تتطلب مقارنة دالة التوزيع التراكمي التجريبية الناتجة من عينة مولدة عشوائيًا عبر rbinom() بالمنحنى النظري، توفر الحزمة طبقة stat_ecdf(geom = "step") المتخصصة. تقوم هذه الطبقة بحساب التراكم التجريبي تلقائيًا من البيانات الخام وإسقاطه كمنحنى تدريجي يمكن تراكبه بسهولة فوق المنحنى النظري المشتق، مما يوفر أداة بصرية فورية لاختبار مدى مطابقة العينات المولدة للتوزيع النظري المفترض.

8.3 التفسير الإحصائي للرسوم التراكمية في اتخاذ القرار

تُعد الرسوم البيانية لدالة التوزيع التراكمي أداة حاسمة في اتخاذ القرارات الإحصائية وتفسير نتائج الاختبارات المعلمية واللامعلمية. تتيح القراءة البصرية للمنحنى استخراج احتمالية عدم تجاوز حد معين من الأحداث السلوكية أو الحيوية $P(X le k)$ بمجرد التحرك أفقيًا من المحور السيني نحو الخط الدرجي ثم القراءة عموديًا على المحور الصادي. على سبيل المثال، يمكن قراءة احتمالية الحصول على 5 نجاحات أو أقل في تجربة ($n=20, p=0.3$) بملاحظة الارتفاع الرأسي للمنحنى عند النقطة 5، والذي يقابل تقريبًا القيمة 0.4164.

بالإضافة إلى ذلك، تلعب هذه المخططات دورًا جوهريًا في تحديد احتمالات الذيل العلوي $P(X > k) = 1 – P(X le k)$، والتي تمثل الأساس لحساب مستويات الدلالة الإحصائية في اختبارات الطرف الواحد. كما يُستدل من المنحنى التراكمي مباشرة على موضع الوسيط الإحصائي (Median) للتوزيع، وهو أول قيمة صحيحة على المحور السيني يتجاوز عندها الاحتمال التراكمي عتبة 0.50، بالإضافة إلى استخراج المئينات الحرجة (مثل المئين 2.5 والمئين 97.5) اللازمة لبناء فترات الثقة الدقيقة بنسبة 95% حول المعلمات التجريبية.

9. مقارنة التأثير البصري لتغير المعلمات (n و p) على شكل التوزيع

9.1 تأثير تغير احتمال النجاح (p) على الالتواء والتماثل

يمارس احتمال النجاح الفردي p تأثيرًا مباشرًا وجوهريًا على الشكل الهندسي ودرجة تماثل دالة الكتلة الاحتمالية للتوزيع ذي الحدين. عند ثبات حجم العينة n، ينقسم السلوك التوزيعي إلى ثلاث حالات أساسية:

  • الحالة المتماثلة ($p = 0.5$): يكون التوزيع متماثلاً تمامًا حول متوسطه الحسابي $\mu = n/2$، ويكون معامل الالتواء مساويًا للصفر ($\gamma_1 = 0$). يظهر المخطط البياني في هذه الحالة قمة مركزية وحيدة ينحدر حولها التوزيع بشكل متطابق يمينًا ويسارًا ليحاكي الشكل الجرسي المتقطع.
  • الالتواء الموجب لليمين ($p < 0.5$): تتمركز غالبية الكتل الاحتمالية بالقرب من الصفر في الطرف الأيسر للرسم، بينما يمتد ذيل التوزيع الطويل نحو اليمين باتجاه القيم الكبيرة لـ k. يكون معامل الالتواء موجبًا ($\gamma_1 > 0$)، وتتزاحم الأعمدة الاحتمالية المرتفعة في مطلع المحور السيني.
  • الالتواء السالب لليسار ($p > 0.5$): تنزاح الكتل الاحتمالية الكبرى نحو الحد الأقصى للمحاولات n في الطرف الأيمن، ويمتد الذيل الاحتمالي الطويل نحو الصفر إلى اليسار. يكون معامل الالتواء سالبًا ($\gamma_1 < 0$).

يمكن تمثيل هذه التحولات المقارنة بوضوح في Base R من خلال تقسيم نافذة الرسم إلى ثلاثة ألواح متجاورة باستخدام أمر par(mfrow = c(1, 3))، ورسم التوزيعات الثلاثة مع تثبيت n = 20 وتمرير قيم $p in {0.2, 0.5, 0.8}$، مما يبرز الانزياح الديناميكي للقمم وتغير اتجاه الذيول بصريًا للمحلل الإحصائي.

9.2 تأثير زيادة حجم العينة (n) ونظرية النهاية المركزية

تُعد دراسة السلوك التقاربي للتوزيع ذي الحدين عند زيادة عدد المحاولات n أحد أروع التطبيقات البصرية لـ نظرية النهاية المركزية (Central Limit Theorem). فعندما يكون حجم العينة صغيرًا (مثل $n = 10$)، تظهر الطبيعة المتقطعة والانفصالية للكتل الاحتمالية بشكل فج وفواصل واضحة بين الأعمدة، خاصة إذا كانت قيمة p بعيدة عن 0.5.

ومع تزايد حجم العينة تدريجيًا إلى عينات متوسطة ($n = 50$) ثم عينات كبيرة ($n = 200$)، تتكاثف الأعمدة الاحتمالية المتقطعة وتتقارب فيما بينها وتضيق الفجوات النسبية، ويبدأ الشكل العام للتوزيع في فقدان التوائه ويتخذ نمطًا منحنيًا سلسًا ومتماثلاً يقترب بشدة من المنحنى الغوسي للتوزيع الطبيعي المتصل $N(\mu, \sigma^2)$ ذي المعلمات $\mu = np$ و $\sigma^2 = np(1-p)$.

يمكن التحقق من هذا التقارب بصريًا في R عن طريق رسم أعمدة التوزيع ذي الحدين لحجم عينة كبير ($n = 100$)، ثم تراكب منحنى الكثافة الاحتمالية الطبيعي المقابل فوق الأعمدة باستخدام دالة lines() مع dnorm():

n_large <- 100; p_val <- 0.4
x_vals <- 0:n_large
probs <- dbinom(x_vals, n_large, p_val)
plot(x_vals, probs, type = "h", lwd = 2, col = "gray50", xlim = c(20, 60),
     main = "التقارب مع التوزيع الطبيعي (n = 100, p = 0.4)",
     xlab = "عدد النجاحات", ylab = "الاحتمال")
curve(dnorm(x, mean = n_large * p_val, sd = sqrt(n_large * p_val * (1 - p_val))),
      add = TRUE, col = "blue", lwd = 2)

يُبرز هذا التراكب التطابق المذهل بين النموذج المتقطع والتقريب الطبيعي المتصل، مبررًا استخدام التقريب الطبيعي في الاختبارات الإحصائية واسعة النطاق عندما يتحقق الشرط المعياري $np ge 10$ و $n(1-p) ge 10$.

9.3 إنشاء مخططات مقارنة متعددة الأوجه باستخدام facet_wrap في ggplot2

تتيح حزمة ggplot2 إنشاء لوحات مقارنة بصرية شاملة وعالية التعقيد عبر دمج توليفات متعددة من المعلمات داخل إطار بيانات موحد واستخدام تقنية التوجيه الشبكي (Faceting). يمكن توليد شبكة متكاملة تجمع سيناريوهات مختلفة لحجم العينة $n in {10, 30, 50}$ واحتمال النجاح $p in {0.2, 0.5, 0.8}$ باستخدام دالة expand.grid():

scenarios <- expand.grid(n = c(10, 30, 50), p = c(0.2, 0.5, 0.8))
df_all <- do.call(rbind, lapply(1:nrow(scenarios), function(i) {
  n_val <- scenarios$n[i]
  p_val <- scenarios$p[i]
  data.frame(k = 0:n_val, prob = dbinom(0:n_val, n_val, p_val),
             n_label = paste("n =", n_val),
             p_label = paste("p =", p_val))
}))

يتم بعد ذلك بناء المخطط الشامل باستخدام facet_grid(p_label ~ n_label, scales = "free") مع تلوين الأعمدة ديناميكيًا:

ggplot(df_all, aes(x = k, y = prob, fill = p_label)) +
  geom_col(show.legend = FALSE) +
  facet_grid(p_label ~ n_label, scales = "free") +
  scale_fill_brewer(palette = "Set1") +
  labs(title = "مصفوفة مقارنة التوزيع ذي الحدين عبر معلمات متعددة",
       x = "عدد مرات النجاح (k)", y = "الاحتمال P(X = k)") +
  theme_bw()

تنتج هذه الشيفرة لوحة من 9 مخططات بيانية منسقة تتيح للقارئ مقارنة التفاعل الثنائي بين زيادة حجم العينة وتغير احتمالات النجاح بلمحة بصرية واحدة، وهي أداة تدريسية وبحثية فائقة الفعالية لتوضيح ديناميكا النماذج الاحتمالية.

10. تطبيقات عملية في العلوم السلوكية والنفسية

10.1 نمذجة اختبارات التعرف والذاكرة الثنائية

تعتمد دراسات الذاكرة والتعرف الحسي في علم النفس المعرفي على مهام الاختيار القسري بين بديلين (2AFC)، حيث يُعرض على المشارك في كل محاولة مثيران (أحدهما قديم والآخر جديد) ويُطلب منه تحديد المثير الذي شاهده مسبقًا. في ظل فرضية العدم القائلة بعدم وجود أي تذكر حقيقي وأن المفحوص يعتمد على التخمين العشوائي البحت، يخضع عدد الاستجابات الصحيحة للتوزيع ذي الحدين بمعلمات $n = 30$ و $p = 0.5$.

يتيح رسم هذا التوزيع في R تحديد العتبة الحرجة للأداء الإحصائي المعنوي بدقة. لحساب النقطة التي يعتبر عندها أداء المفحوص دالاً إحصائيًا عند مستوى معنوية $\alpha = 0.05$ (اختبار طرف واحد)، نستخدم دالة المئين: cutoff <- qbinom(0.95, size = 30, prob = 0.5)، والتي تُرجع القيمة 19. يمكن بعد ذلك رسم التوزيع مع تظليل منطقة الرفض ($k ge 20$) باللون الأحمر:

k_vals <- 0:30
probs <- dbinom(k_vals, 30, 0.5)
cols = 20, "firebrick", "gray70")
plot(k_vals, probs, type = "h", lwd = 5, col = cols,
     main = "اختبار التعرف الثنائي: تحديد عتبة الدلالة الإحصائية (n = 30)",
     xlab = "عدد الإجابات الصحيحة", ylab = "الاحتمال النظري للصدفة")
abline(v = 19.5, lty = 2, col = "darkred", lwd = 2)
text(24, 0.10, "منطقة الدلالة الإحصائيةn(P < 0.05)", col = "firebrick")

يقدم هذا الرسم للمختص النفسي دليلاً بصريًا قاطعًا: إذا حقق المشارك 20 استجابة صحيحة أو أكثر، فإننا نرفض فرضية التخمين العشوائي ونستنتج وجود أثر تذكر حقيقي ذي دلالة إحصائية معنوية.

10.2 تحليل استجابات الاستبيانات المقننة ثنائية القطب

تستخدم مقاييس الفحص الإكلينيكي والاستبيانات التشخيصية النفسية أسئلة ثنائية القطب (نعم/لا) لتقييم وجود أعراض نوعية (مثل مقاييس الاكتئاب أو القلق). عند تطبيق مقياس يتألف من 25 مفردة على عينة معيارية، يمكن نمذجة التوزيع المتوقع لدرجات المفحوصين تحت افتراضات نظرية ومقارنتها بالتوزيع الملحوظ من البيانات الميدانية.

يسهم التمثيل البياني في الكشف المباشر عن التحيزات الاستجابية (Response Biases)؛ فعند رسم التوزيع التجريبي لاستجابات العينة وتراكبه مع التوزيع النظري ذي الحدين، يمكن للباحث رصد ما إذا كان هناك ميل عام نحو “الموافقة التلقائية” (Acquiescence Bias) أو التزييف نحو الأفضل (Social Desirability)، والتي تظهر بصريًا على هيئة انزياح غير متوقع في قمة التوزيع التجريبي نحو اليمين مقارنة بالمنحنى النظري المفترض، مما يوفر أداة تشخيصية قوية لمراجعة بنية المقاييس النفسية وضمان صلاحيتها السيكومترية.

10.3 تجارب زمن الاستجابة والمهام المعرفية المقيدة بوقت

في تجارب علم النفس العصبي واليقظة الإدراكية، يُطلب من المفحوصين الاستجابة لمثيرات بصرية أو سمعية متتابعة وسريعة ضمن نافذة زمنية ضيقة جدًا (مثل 400 ميلي ثانية). تُصنف كل محاولة كنجاح (استجابة سريعة ودقيقة ضمن النافذة) أو فشل (استجابة بطيئة أو إغفال للمثير). يتيح التوزيع ذو الحدين نمذجة وتصوير معدلات الكفاءة المعرفية لمجموعات سريرية مختلفة (مثل مجموعة مرضى اضطراب فرط الحركة وتشتت الانتباه ADHD مقابل مجموعة ضابطة).

من خلال رسم توزيع احتمالات النجاح في إتمام 50 محاولة مقيدة بوقت عبر المجموعتين، يستطيع الباحث تصوير الفروق الإدراكية الجوهرية، حيث تظهر المجموعة الضابطة توزيعًا يتمركز حول معدل نجاح مرتفع ($p = 0.85$)، بينما يتمركز توزيع المجموعة الإكلينيكية حول معدل نجاح أدنى ($p = 0.55$) مع تشتت أوسع. توفر هذه المخططات المقارنة دعمًا بصريًا قويًا للاستنتاجات العلمية المنشورة في أبحاث الوظائف التنفيذية العصبية والقصور الإدراكي.

11. تصدير المخططات البيانية بجودة عالية للنشر الأكاديمي

11.1 استخدام دوال الإخراج الرسومي في Base R (PNG, PDF, TIFF)

تفرض المجلات العلمية المحكمة المنضوية تحت دور النشر العالمية (مثل Elsevier و Springer و APA) معايير تقنية صارمة لجودة ودقة الأشكال والرسوم البيانية المرفقة بالمخطوطات. توفر لغة R مجموعة من مشغلات الأجهزة الرسومية المدمجة (Graphical Devices) لتصدير المخططات البيانية بصيغ متعددة فائقة الدقة.

لتصدير الرسوم بصيغة متجهة غير نقطية (Vector Graphics) لا تفقد جودتها إطلاقًا عند التكبير، تُستخدم دالة pdf()، مع تحديد الأبعاد بالبوصة:

pdf("binomial_plot.pdf", width = 7, height = 5)
# أوامر الرسم البياني هنا
plot(success, probabilities, type = "h", lwd = 4, col = "navy")
dev.off()

أما بالنسبة للمجلات التي تشترط تسليم الصور بصيغ نقطية (Raster) مثل TIFF أو PNG بدقة طباعية لا تقل عن 300 أو 600 نقطة في البوصة (DPI)، فيتم استخدام دالتي tiff() أو png() مع تحديد الدقة ووحدات القياس بدقة:

tiff("Figure1.tiff", width = 6.5, height = 4.5, units = "in", res = 300, compression = "lzw")
par(mar = c(4.5, 4.5, 2, 1)) # ضبط الهوامش الداخلية
plot(success, probabilities, type = "h", lwd = 4, col = "black", las = 1)
dev.off()

يعد استدعاء الأمر dev.off() خطوة إجبارية لإغلاق المشغل الرسومي وحفظ تدفق البيانات إلى الملف بنجاح وتفادي تلف الملفات الناتجة.

11.2 حفظ المخططات المتقدمة باستخدام دالة ggsave()

توفر حزمة ggplot2 الدالة الموحدة فائقة القوة ggsave() لحفظ المخططات المتقدمة بخطوة برمجية واحدة مرنة تتعامل تلقائيًا مع محركات الإخراج المختلفة استنادًا إلى امتداد اسم الملف:

p_binom <- ggplot(df_binom, aes(x = k, y = prob)) + geom_col() + theme_classic()
ggsave("Figure_APA.pdf", plot = p_binom, width = 6.5, height = 4.5, units = "in", dpi = 300)

تتميز ggsave() بإمكانية التحكم الدقيق في معامل التحجيم الطباعي عبر الوسيط scale، وتحديد خطوط النظام المستخدمة، وضبط مسارات الحفظ النسبية والمطلقة بسهولة. كما تدعم تصدير ملفات بصيغة SVG التفاعلية أو EPS الموجهة للطباعة التجارية، مما يجعلها الخيار الأمثل للباحثين لضمان مطابقة المخططات المرفوعة للأنظمة الإلكترونية للمجلات العلمية بدقة متناهية.

11.3 معايير العرض البصري وفق دليل جمعية علم النفس الأمريكية (APA Style)

يضع دليل النشر الأكاديمي لجمعية علم النفس الأمريكية (APA Style – الإصدار السابع) مجموعة من الإرشادات المحددة لتصميم الأشكال الإحصائية لتكون واضحة ومقروءة ومجردة من الزخارف غير الضرورية:

  • نظام الألوان والتباين: تجنب استخدام الألوان المتعددة غير الوظيفية، والاعتماد على التدرج الرمادي (Grayscale) أو الألوان الأحادية المتباينة التي تظل مقروءة وواضحة عند طباعة المقال باللونين الأبيض والأسود.
  • الخطوط والطباعة: استخدام خطوط غير مذيلة واضحة وخالية من التعقيد (مثل Arial أو Helvetica) بحجم يتراوح بين 8 إلى 14 نقطة، مع ضمان تناسق حجم الخط عبر جميع عناصر المخطط وتجنب تداخل النصوص مع الأرقام.
  • إزالة العناصر المشتتة (Chartjunk): تجنب استخدام التأثيرات ثلاثية الأبعاد، والظلال الجانبية، والأطر الخارجية المغلقة؛ والاقتصار على محوري الإحداثيات الأساسيين مع علامات تدريج (Ticks) واضحة ومتجهة للخارج.
  • التسميات التوضيحية (Captions): ترقيم الأشكال تسلسليًا (مثل: الشكل 1 بخط غامق)، يليه عنوان وصفي موجز ومائل في السطر التالي، مع وضع شروح الرموز والمعلمات التجريبية ($n, p$) في حاشية توضيحية أسفل الشكل (Figure Note) بدلاً من حشرها داخل المخطط نفسه.

12. الأخطاء الشائعة واستكشاف المشكلات الإحصائية والبرمجية وإصلاحها

12.1 أخطاء تعريف النطاق وتمرير المعلمات في R

يقع العديد من الباحثين المبتدئين في أخطاء منهجية وبرمجية متكررة عند بناء متجهات التوزيع ذي الحدين في R. من أكثر هذه الأخطاء شيوعًا بدء تسلسل متجه النجاحات من الرقم 1 بدلاً من الصفر (كتابة 1:n بدلاً من 0:n). يؤدي هذا الإغفال إلى استبعاد احتمال الصفر التام $P(X = 0)$—أي حالة عدم تحقق أي نجاح—وهو احتمال رياضي أصيل قد يمثل كتلة معتبرة عندما تكون قيمة p صغيرة، مما يترتب عليه تشويه المخطط البياني وجعل مجموع الاحتمالات أقل من الواحد الصحيح.

من الأخطاء البرمجية الأخرى محاولة تمرير قيم لاحتمال النجاح خارج النطاق المغلق المعياري $[0, 1]$ (مثل تمرير prob = 1.2 أو prob = -0.1)، مما يدفع لغة R إلى إيقاف التنفيذ وإصدار رسالة الخطأ التحذيرية الشهيرة NaNs produced مع إرجاع مصفوفة من القيم المفقودة. كما أن طلب حساب الاحتمال لعدد نجاحات يفوق حجم العينة ($k > n$) مثل dbinom(25, size = 20, prob = 0.5) يُرجع القيمة 0 تلقائيًا، وهو ما يستوجب التحقق الدائم من اتساق أطوال المتجهات وتوافق الشواهد مع معلمات المحاكاة.

12.2 الخلط بين الدوال dbinom و pbinom في الرسم البياني

يحدث التباس مفاهيمي متكرر لدى بعض المحللين بين استخدام دالة الكتلة الاحتمالية dbinom() ودالة التوزيع التراكمي pbinom() عند بناء المخططات البيانية. ينتج عن هذا الخلط تمثيل غير مقصود للاحتمال التراكمي الصاعد في مواقف تتطلب تقييم احتمالية نقطية منفردة، أو العكس.

يُمكّن الفحص البصري الفوري للمخرجات من اكتشاف هذا الخطأ وتصحيحه بسرعة؛ فمخطط دالة الكتلة الاحتمالية (PMF) الناتجة من dbinom() يظهر دائمًا كأعمدة ترتفع لتشكل ذروة مركزية ثم تهبط متلاشية عند الأطراف، في حين يظهر مخطط دالة التوزيع التراكمي (CDF) الناتجة من pbinom() كمنحنى درجي تصاعدي رتيب لا ينخفض أبدًا، ويبدأ من الصفر ليتصاعد حتمًا حتى يصل إلى الواحد الصحيح. يساعد توثيق الكود البرمجي بالتعليقات التوضيحية وتسمية المتجهات بدقة (مثل pmf_vals و cdf_vals) في تفادي هذا اللبس البرمجي الشائع.

12.3 أفضل الممارسات البرمجية والإحصائية لضمان قابلية إعادة الإنتاج

لضمان أعلى معايير الشفافية والموثوقية العلمية وقابلية إعادة الإنتاج (Reproducibility) للرسوم والتحليلات الإحصائية، يتعين على الباحثين اتباع بروتوكول برمجي صارم يشمل الخطوات المعيارية التالية:

  • تثبيت البذرة العشوائية: عند استخدام دوال المحاكاة وتوليد العينات العشوائية مثل rbinom()، يجب دائمًا استدعاء دالة set.seed(123) قبل أمر التوليد لضمان تطابق الأرقام العشوائية المولدة والمخططات الناتجة بدقة عند إعادة تشغيل الشيفرة البرمجية على أي جهاز آخر.
  • هيكلة الكود والبيئة البرمجية: تجميع التحليلات والرسوم داخل سكربتات R منظمة ومنفصلة، مع تسجيل وتوثيق إصدارات الحزم ولغة R المستخدمة عبر استدعاء sessionInfo() في نهاية التقرير التحليلي.
  • عزل المعلمات الأساسية: تعريف معلمات التجربة ($n, p$) كمتغيرات مستقلة في أعلى البرنامج النصي واستخدامها كمتغيرات ديناميكية داخل دوال الرسم والتسميات النصية، مما يقلل من احتمالية الأخطاء اليدوية عند تحديث الفرضيات التجريبية.

خاتمة

يُمثل التوزيع ذو الحدين أحد الأعمدة النظرية والتطبيقية الراسخة في صرح التحليل الإحصائي والاستدلال العلمي. ومن خلال تطويع الإمكانات الحسابية والرسومية الهائلة للغة R، يستطيع الباحثون والمحللون تجاوز التعقيد الرياضي وتحويل الصيغ الاحتمالية المجردة إلى نماذج بصرية عالية الدقة والتأثير. لقد استعرض هذا الدليل الشامل الأسس الرياضية لدوال الاحتمال، وتشريح الدوال البرمجية الأربع (dbinom, pbinom, qbinom, rbinom)، وكيفية تطويع محرك Base R وحزمة ggplot2 المتطورة لبناء مخططات دالة الكتلة والتوزيع التراكمي وتنسيقها وفق معايير النشر الأكاديمي الصارمة.

إن إتقان رسم وتمثيل التوزيع ذي الحدين لا يُعد مجرد مهارة تقنية مضافة، بل هو أداة تفكير واستكشاف علمي تمكن الباحث من فهم سلوك الظواهر الثنائية، واختبار الفرضيات التجريبية، وتشخيص جودة البيانات في مختلف الميادين المعرفية. يُنصح دائمًا باتباع أفضل الممارسات البرمجية لضمان قابلية إعادة الإنتاج، واختيار الأنماط الرسومية التي تعكس بدقة الطبيعة المتقطعة للتوزيع، مما يضمن تقديم استنتاجات علمية رصينة وموثوقة تثري المجتمع الأكاديمي والمعرفي.

المراجع (References)

  • American Psychological Association. (2020). Publication manual of the American Psychological Association (7th ed.). American Psychological Association. https://doi.org/10.1037/0000165-000
  • Casella, G., & Berger, R. L. (2002). Statistical inference (2nd ed.). Duxbury Press.
  • Field, A., Miles, J., & Field, Z. (2012). Discovering statistics using R. SAGE Publications.
  • R Core Team. (2023). R: A language and environment for statistical computing. R Foundation for Statistical Computing, Vienna, Austria. https://www.R-project.org/
  • Wickham, H. (2016). ggplot2: Elegant graphics for data analysis (2nd ed.). Springer-Verlag New York. https://doi.org/10.1007/978-3-319-24277-4
  • Wilkinson, L. (2005). The grammar of graphics (2nd ed.). Springer Science & Business Media. https://doi.org/10.1007/0-387-28695-0

اقتباس هذا المقال

looti, M. (2026, أغسطس 26). كيفية رسم التوزيع ذي الحدين في R. عرب سايكلوجي. https://arabpsychology.com/statistics/how-to-plot-a-binomial-distribution-in-r/
looti, Mohammed. “كيفية رسم التوزيع ذي الحدين في R.” عرب سايكلوجي, 26 أغسطس 2026, https://arabpsychology.com/statistics/how-to-plot-a-binomial-distribution-in-r/.
looti, Mohammed. “كيفية رسم التوزيع ذي الحدين في R.” عرب سايكلوجي. أغسطس 26, 2026. https://arabpsychology.com/statistics/how-to-plot-a-binomial-distribution-in-r/.