يُعد الاستدلال الإحصائي الركيزة الأساسية التي تقوم عليها العلوم التجريبية والسلوكية الحديثة، حيث يسعى الباحثون من خلاله إلى استخلاص استنتاجات عامة حول المجتمعات الإحصائية انطلاقاً من ملاحظات العينات المحدودة. وفي سياق تحليل البيانات الفئوية الثنائية، تبرز الحاجة الماسة إلى أدوات اختبار دقيقة قادرة على تقييم ما إذا كانت التكرارات الملاحظة لظاهرة معينة تتوافق مع النماذج النظرية المفترضة أو تختلف عنها جوهرياً. يمثل الاختبار ذو الحدين الدقيق (Exact Binomial Test) المعيار الذهبي في هذه الفئة من التحليلات، نظراً لكونه اختباراً لا بارامترياً لا يستند إلى تقريبات احتمالية قائمة على العينات الكبيرة، بل يحسب الاحتمالات بدقة تامة اعتماداً على قانون التوزيع ذي الحدين الرياضي.
مع التطور المتسارع للبرمجيات الإحصائية مفتوحة المصدر، أصبحت بيئة البرمجة الإحصائية لغة R الخيار المفضل لدى الأكاديميين والمحللين في مختلف التخصصات العلمية، من علم النفس المعرفي والطب الإكلينيكي إلى أبحاث السوق وتحليل سلوك المستهلك. تقدم بيئة R مرونة فائقة وإمكانات متقدمة لإجراء الاختبار ذي الحدين من خلال الدوال المدمجة، وفي مقدمتها دالة binom.test، التي تتيح للباحث ليس فقط حساب القيم الاحتمالية الدقيقة للاختبارات ثنائية أو أحادية الطرف، بل وتوفر أيضاً فترات ثقة دقيقة وموثوقة باستخدام منهجية كلوبر-بيرسون الرياضية الصارمة.
يهدف هذا الدليل الشامل والمفصل إلى تقديم مرجع أكاديمي وتطبيقي متكامل لإجراء وفهم وتفسير الاختبار ذي الحدين في لغة R. سنستعرض بعمق المفاهيم النظرية الكامنة وراء هذا الاختبار، ونتناول بالتفصيل البنية البرمجية للدوال المستخدمة، ونحلل مخرجاتها تحليلاً رياضياً وإحصائياً دقيقاً، مع التركيز على تقدير أحجام التأثير، وتحليل القوة الإحصائية، والمقارنة مع البدائل الإحصائية الأخرى، فضلاً عن كيفية توثيق النتائج وفق المعايير الدولية للنشر العلمي كدليل الجمعية الأمريكية لعلم النفس (APA).
- 1. المفاهيم النظرية والأسس الإحصائية للاختبار ذي الحدين
- 2. بنية وصيغة دالة binom.test في لغة البرمجة R
- 3. إعداد بيئة العمل وهيكلة البيانات في R
- 4. تنفيذ الاختبار ذي الحدين ثنائي الذيل (Two-Tailed Test)
- 5. تنفيذ الاختبار ذي الحدين أحادي الذيل (One-Tailed Test)
- 6. التفكيك المنهجي لمخرجات دالة binom.test
- 7. فترات الثقة الدقيقة وتقدير حجم التأثير في R
- 8. تطبيقات عملية في الأبحاث النفسية والسلوكية عبر R
- 9. المقارنة بين الاختبار ذي الحدين والبدائل الإحصائية في R
- 10. تحليل القوة الإحصائية وتحديد حجم العينة في R
- 11. التصور البياني المتقدم للبيانات ذات الحدين في R
- 12. صياغة وتوثيق النتائج وفق معايير APA والأخطاء الشائعة
- خاتمة
- References
1. المفاهيم النظرية والأسس الإحصائية للاختبار ذي الحدين
1.1 تعريف الاختبار ذي الحدين وطبيعته اللابارامترية
يُعرَّف الاختبار الدقيق ذو الحدين (Exact Binomial Test) بأنه اختبار إحصائي استدلالي يُستخدم لاختبار الفرضيات المتعلقة بنسبة حدوث سمة معينة في مجتمع إحصائي ذي طبيعة ثنائية التفرع. يندرج هذا الاختبار ضمن فئة الإحصاء اللابارامتري (Non-parametric Statistics) أو الإحصاء التوزيعي الحر الدقيق، وذلك لأنه لا يتطلب افتراض اعتدالية توزيع البيانات في المجتمع الأصلي، ولا يعتمد على معلمات التوزيع الطبيعي مثل المتوسط والانحراف المعياري، بل يبني استدلالاته مباشرة على دالة الكتلة الاحتمالية للتوزيع ذي الحدين المنفصل.
تتمحور البيانات الخاضعة لهذا الاختبار حول متغيرات تابعة ثنائية (Binary or Dichotomous Variables)، وهي المتغيرات التي لا يمكن للملاحظة الواحدة فيها إلا أن تتخذ إحدى قيمتين متنافستين ومتبادلتين، مثل: (نجاح/فشل)، (نعم/لا)، (استجابة/عدم استجابة)، أو (ظهور العَرَض/غياب العَرَض). يعمل الاختبار على مقارنة التكرار الملاحظ للنجاحات في عينة حجمها محدد مسبقاً بالنسبة المتوقعة أو المفترضة نظرياً في المجتمع، وذلك لتقييم ما إذا كان التباين الملاحظ ناتجاً عن الصدفة الإحصائية البحتة أم أنه يعكس انحرافاً حقيقياً ذا دلالة إحصائية.
تبرز الأهمية القصوى للاختبار ذي الحدين الدقيق عند التعامل مع العينات الصغيرة أو المتناهية الصغر، حيث تفشل الاختبارات التقريبية القائمة على نظرية النهاية المركزية (مثل اختبار النسبة القائم على توزيع Z أو اختبار مربع كاي) في تقديم قيم احتمالية دقيقة. في مثل هذه الحالات، يوفر الاختبار ذو الحدين دقة رياضية مطلقة دون الحاجة لأي تقريب أو تصحيح استمرارية، مما يجعله الأداة المثلى في الأبحاث المخبرية الدقيقة والدراسات الإكلينيكية النادرة.
1.2 صياغة الفرضيات الإحصائية (الصفرية والبديلة)
تعتمد المنهجية الاستدلالية للاختبار ذي الحدين على صياغة رياضية واضحة ومحددة للفرضيات الإحصائية. تنطلق الفرضية الصفرية (Null Hypothesis – H0) من مبدأ التكافؤ التام بين النسبة الحقيقية للنجاح في المجتمع (ويرمز لها بالرمز الإغريقي π) وقيمة مرجعية افتراضية محددة سلفاً يرمز لها بالرمز p. وتُصاغ رياضياً بالشكل: H0: π = p. تمثل هذه الفرضية فرضية “اللا-تأثير” أو افتراض أن النتائج الملاحظة تعود إلى التوزيع العشوائي الخالص المتوقع، مثل افتراض أن احتمالية سقوط عملة نقدية متوازنة على وجه الصورة هي 0.5 بالضبط.
في المقابل، يتم صياغة الفرضية البديلة (Alternative Hypothesis – HA أو H1) وفقاً لطبيعة التساؤل البحثي والأساس النظري للدراسة. في الاختبارات غير الموجهة أو ثنائية الاتجاه (Two-sided / Two-tailed Test)، تُصاغ الفرضية البديلة لاختبار وجود أي فرق جوهري بين النسبة الحقيقية والنسبة المفترضة بغض النظر عن اتجاه الفرق، وتكتب رياضياً: HA: π ≠ p. يُعد هذا الشكل هو الخيار الافتراضي والأكثر تحفظاً في المنهجية الأكاديمية لأنه لا ينحاز مسبقاً لأي اتجاه تجريبي.
عندما يمتلك الباحث مبررات نظرية قوية وتوقعات مسبقة موجهة، يمكنه اللجوء إلى صياغة فرضيات بديلة أحادية الاتجاه (One-sided / One-tailed Test). في اختبار الطرف الأيمن، تُصاغ الفرضية البديلة لتحديد ما إذا كانت النسبة الحقيقية أكبر من النسبة المفترضة: HA: π > p، وهو ما يُستخدم عادة في تقييم فاعلية تدخل علاجي جديد يتوقع منه رفع معدلات الشفاء. أما في اختبار الطرف الأيسر، فتُصاغ الفرضية لاختبار ما إذا كانت النسبة أقل من القيمة المرجعية: HA: π < p، كما في دراسات خفض معدلات الخطأ أو تقليل الآثار الجانبية. ويتم تقييم هذه الفرضيات بالاعتماد على مستوى دلالة إحصائية محدد مسبقاً (Alpha Level)، يُحدد تقليدياً عند 0.05، لاتخاذ قرار برفض الفرضية الصفرية أو الفشل في رفضها.
1.3 الافتراضات الإحصائية الصارمة لتطبيق الاختبار
على الرغم من الطبيعة اللابارامترية للاختبار ذي الحدين، إلا أن صحة استنتاجاته وموثوقيتها العلمية مشروطة بصرامة باستيفاء مجموعة من الافتراضات المنهجية والتصميمية التي لا يمكن التهاون معها. يأتي في مقدمة هذه الافتراضات افتراض الاستقلالية التامة بين المحاولات أو الملاحظات (Independent Trials)؛ ويعني ذلك أن نتيجة أي محاولة تجريبية لا تؤثر إطلاقاً، ولا تتأثر، بنتيجة أي محاولة أخرى ضمن العينة المدروسة. يتطلب هذا الافتراض تطبيق تقنيات المعاينة العشوائية البسيطة مع الإرجاع، أو المعاينة من مجتمعات إحصائية ضخمة جداً بحيث لا يؤثر سحب عنصر ما على احتمالات العناصر اللاحقة.
يتمثل الافتراض الثاني في ثبات احتمالية النجاح (Constant Probability of Success) عبر جميع المحاولات التجريبية المستقلة. يجب أن تظل القيمة الاحتمالية p ثابتة دون أي تغيير من المحاولة الأولى وحتى المحاولة الأخيرة في التجربة، مما يفرض توحيد الظروف التجريبية والبيئية وتجنب عوامل الإرهاق أو التعلم لدى المشاركين التي قد تؤدي إلى تذبذب احتمالية النجاح مع توالي المحاولات.
علاوة على ذلك، يشترط الاختبار أن تُصنف جميع المخرجات حصراً إلى فئتين متبادلتين وشاملتين (Mutually Exclusive and Exhaustive Outcomes)؛ بحيث يستحيل للملاحظة الواحدة أن تنتمي للفئتين معاً أو أن تسقط خارجهما. وأخيراً، يجب تحديد حجم العينة الكلي، أي عدد المحاولات الإجمالي (n)، مسبقاً قبل البدء بجمع البيانات وإجراء التحليل الإحصائي، مما يعني استبعاد خطط المعاينة التتابعية التي تستمر في جمع البيانات حتى الوصول إلى دلالة إحصائية معينة، نظراً لأن ذلك ينتهك التوزيع الاحتمالي للنموذج ويضخم الخطأ من النوع الأول.
2. بنية وصيغة دالة binom.test في لغة البرمجة R
2.1 المعاملات الأساسية لدالة binom.test()
توفر بيئة لغة R الإحصائية دالة قياسية مضمنة في حزمتها الأساسية لإجراء الاختبار ذي الحدين بدقة متناهية وهي الدالة binom.test(). تمتلك هذه الدالة بنية مرنة تسمح باستيعاب مدخلات متنوعة وفقاً لطريقة تمثيل البيانات لدى الباحث. يتكون الاستدعاء الأساسي للدالة من ثلاثة معاملات رئيسية: binom.test(x, n, p = 0.5).
يُعبر المعامل x عن عدد حالات النجاح الملاحظة في العينة التجريبية كقيمة عددية صحيحة غير سالبة، أو يمكن أن يكون متجهاً رقمياً ثنائي العنصر يحتوي على عدد حالات النجاح وعدد حالات الفشل بالترتيب (أي c(successes, failures)). أما المعامل n فيمثل إجمالي عدد المحاولات التجريبية أو حجم العينة الكلي الخاضع للدراسة، ويجب أن يكون عدداً صحيحاً موجباً أكبر من أو يساوي قيمة x في حال تمرير x كعدد مفرد؛ بينما يُلغى استخدام n في حال تم تمرير متجه النجاح والفشل في المعامل x.
يمثل المعامل p الاحتمال النظري المرجعي المفترض للنجاح والمحدد في الفرضية الصفرية. وقد تم ضبط القيمة الافتراضية لهذا المعامل في بيئة R لتكون 0.5، وهو ما يتطابق مع حالات الاختيار الثنائي العشوائي المتكافئ. وتتميز الدالة بقدرتها على استقبال الجداول التوافقية أحادية البعد (1D contingency tables) الناتجة عن دالة table() مباشرة كمدخل في المعامل x، حيث تقوم الدالة تلقائياً باستخلاص تكرارات الفئتين واستخدام أول فئة كمعيار للنجاح وإجمالي المجموع كحجم للعينة.
2.2 المعاملات المتقدمة وتخصيص التحليل الإحصائي
إلى جانب المعاملات الحسابية الأساسية، تشتمل دالة binom.test() على معاملات متقدمة تمنح الباحث السيطرة الكاملة على توجيه الاختبار الإحصائي ومستويات التقدير الفترية. المعامل الأول هو alternative، والذي يحدد الفرضية البديلة المراد اختبارها، ويقبل إحدى القيم النصية الثلاث التالية: "two.sided" وهو الخيار الافتراضي لإجراء اختبار ثنائي الذيل، أو "greater" لاختبار ما إذا كانت نسبة النجاح في المجتمع أكبر من القيمة المحددة في p، أو "less" لاختبار ما إذا كانت النسبة أقل من القيمة المرجعية.
المعامل المتقدم الثاني هو conf.level، والذي يتحكم في حساب مجال أو فترة الثقة (Confidence Interval) للنسبة الحقيقية للنجاح. القيمة الافتراضية المحددة في النظام هي 0.95 المقابلة لمستوى ثقة 95%، ولكن يمكن للباحث تعديلها بدقة إلى أي قيمة تقع في المجال المفتوح (0, 1)، مثل 0.90 أو 0.99 وفقاً لمتطلبات الصرامة المنهجية للدراسة.
تكمن الميزة الرياضية الأبرز لدالة binom.test() في حزمة stats المدمجة في R في اعتمادها الحصري على طريقة كلوبر-بيرسون الدقيقة (Clopper-Pearson Exact Method) لحساب فترات الثقة. على عكس فترات الثقة التقريبية المستندة إلى تقريب والد (Wald) والتي تعاني من قصور شديد في ضبط معدل التغطية الفعلي، فإن طريقة كلوبر-بيرسون تستخدم التوزيع التراكمي لـ توزيع بيتا وتضمن تغطية احتمالية لا تقل إطلاقاً عن المستوى الاسمي المحدد 1 – alpha، مما يضمن أعلى درجات الثقة في التقدير الإحصائي المعلمي.
3. إعداد بيئة العمل وهيكلة البيانات في R
3.1 تجهيز وتثبيت الحزم الإحصائية المساعدة
قبل الشروع في تطبيق الاختبار ذي الحدين، من الضروري إعداد بيئة العمل البرمجية داخل واجهة RStudio لضمان التدفق السلس للبيانات وسهولة استعراض وتحليل النتائج. تأتي دالة binom.test() محملة مسبقاً كجزء لا يتجزأ من حزمة stats التي تُشحن تلقائياً مع النواة الأساسية للغة R، مما يعني عدم الحاجة لتثبيت حزم خارجية لتشغيل التحليل الأساسي.
ومع ذلك، تتطلب المعايير الحديثة لتحليل البيانات الاستعانة بمنظومة حزم tidyverse، والتي تشمل حزم dplyr لمعالجة البيانات وهيكلتها، وreadr لاستيراد الملفات، وggplot2 للتصور البياني المتقدم. كما يُوصى بتثبيت حزمة binom المتخصصة في حساب ومقارنة فترات الثقة المتعددة للنسب الثنائية، وحزمة pwr المخصصة لتحليلات القوة الإحصائية.
يمكن تثبيت واستدعاء هذه الحزم عبر الأوامر البرمجية التالية:
install.packages(c("tidyverse", "binom", "pwr"))
library(tidyverse)
library(binom)
library(pwr)
لضمان سهولة قراءة النتائج الإحصائية وتجنب الترميز العلمي للأرقام الصغيرة جداً، يُفضل ضبط خيارات العرض العامة في R لتنسيق المخرجات العشرية عبر تعديل المعامل scipen وdigits، مثل تنفيذ الأمر: options(scipen = 999, digits = 4)، مما يجعل القيم الاحتمالية وفترات الثقة تظهر بتنسيق عشري مباشر يسهل تضمينه في التقارير الأكاديمية.
3.2 استيراد وتشكيل البيانات الثنائية للتحليل
في الممارسة البحثية الواقعية، نادراً ما تقتصر البيانات على أرقام ملخصة وجاهزة، بل تأتي على هيئة سجلات خام مخزنة في ملفات من صيغ مثل CSV أو Excel. يتطلب التعامل المنهجي مع هذه البيانات استيرادها بدقة وتحويل الأعمدة النصية المستهدفة إلى عوامل فئوية (Factors) لتحديد المستويات وتعيين الفئة التي تمثل حالة “النجاح”.
يمكن استيراد مجموعة بيانات افتراضية ومعاينتها برمجياً كما يلي:
raw_data <- read.csv("behavioral_experiment.csv")
raw_data$Response <- factor(raw_data$Response, levels = c("Success", "Failure"))
تُعد معالجة القيم المفقودة (Missing Values) خطوة جوهرية قبل استخراج التكرارات. يجب تصفية الملاحظات غير المكتملة لمنع حدوث أخطاء حسابية أو تشويه في تقدير حجم العينة الكلي n. يوفر إطار عمل tidyverse وظائف متقدمة لتنقية البيانات:
clean_data <- raw_data %>% filter(!is.na(Response)) counts <- table(clean_data$Response) n_success <- counts["Success"] n_total <- sum(counts)
لأغراض التطوير واختبار النماذج البرمجية قبل جمع البيانات الفعلية، يستطيع الباحث محاكاة بيانات ثنائية عشوائية تخضع لبارامترات محددة مسبقاً باستخدام الدالة rbinom()، مثل إنشاء متجه استجابات لـ 100 مشارك باحتمالية نجاح افتراضية تبلغ 0.65:
set.seed(123)
simulated_trials <- rbinom(n = 100, size = 1, prob = 0.65)
simulated_factor <- factor(simulated_trials, levels = c(1, 0), labels = c("Success", "Failure"))
4. تنفيذ الاختبار ذي الحدين ثنائي الذيل (Two-Tailed Test)
4.1 السيناريو الإحصائي وبناء النموذج البرمجي
يُعد الاختبار ثنائي الذيل (Two-Tailed Test) الشكل القياسي والأكثر شيوعاً للاختبار ذي الحدين، حيث يُستخدم للتحقق مما إذا كانت نسبة النجاح الملاحظة تختلف اختلافاً جوهرياً، في أي من الاتجاهين (بالزيادة أو النقصان)، عن القيمة النظرية المحددة بموجب الفرضية الصفرية.
لنفترض سيناريو تجريبياً كلاسيكياً في أبحاث الإدراك الحسي أو تقييم عدالة أدوات القياس: لدينا نرد سداسي الأوجه يُشتبه في كونه غير عادل وغير متزن فيزيائياً. تنص الفرضية الصفرية H0 على أن النرد متوازن تماماً، وبالتالي فإن احتمالية ظهور الرقم 6 في أي رمية هي p = 1/6 (أي ما يعادل تقريباً 0.1667). أجرى الباحث تجربة رمي للنرد تضمنت n = 24 رمية مستقلة، وأسفرت النتائج عن ظهور الرقم ستة x = 9 مرات.
يهدف النموذج البرمجي إلى صياغة هذا التساؤل كالتالي:
dice_test <- binom.test(x = 9, n = 24, p = 1/6, alternative = "two.sided", conf.level = 0.95) dice_test
قبل تشغيل الكود، يتحقق R من صحة المدخلات الرياضية: x عدد صحيح يقع ضمن النطاق [0, n]، وp تقع ضمن المجال المفتوح (0, 1)، ويتم بناء دالة الكتلة الاحتمالية لحساب التوافيق الرياضية لكافة المخرجات الممكنة.
4.2 التنفيذ العملي وتحليل مخرجات الكود البرمجي
عند تنفيذ الكود البرمجي السابق، يُنتج R كائناً إحصائياً شاملاً من فئة htest يحتوي على كافة التفاصيل الحسابية للاختبار. تظهر المخرجات في وحدة التحكم (Console) بالهيكل التالي:
Exact binomial test 9 and 24 number of successes = 9, number of trials = 24, p-value = 0.01026 alternative hypothesis: true probability of success is not equal to 0.1666667 95 percent confidence interval: 0.1879793 0.5940608 sample estimates: probability of success 0.375
يكشف الفحص الدقيق للمخرجات أن النسبة الملاحظة للنجاح في العينة (sample estimate) تبلغ 0.375 (أي 9/24)، وهي تفوق النسبة النظرية المفترضة 0.1667 بشكل ملحوظ. بلغت القيمة الاحتمالية الناتجة p-value = 0.01026. بمقارنة هذه القيمة بمستوى ألفا الاسمي المحدد سلفاً عند alpha = 0.05، نجد أن p-value < 0.05.
بناءً على هذه النتيجة، يُتخذ القرار الإحصائي الأكاديمي برفض الفرضية الصفرية (Reject H0) لصالح الفرضية البديلة، والاستنتاج بوجود دليل إحصائي كافٍ يثبت أن النرد غير عادل وأن احتمالية ظهور الوجه ستة تختلف جوهرياً عن الاحتمال النظري المتوازن. ويؤكد هذا الاستنتاج مجال الثقة الدقيق 95% الذي يمتد من 0.1880 إلى 0.5941؛ حيث نلاحظ بوضوح أن القيمة النظرية المفترضة (1/6 = 0.1667) تقع بالكامل خارج حدود فترة الثقة المحسوبة، مما يعزز قرار رفض فرضية العدالة والتكافؤ.
5. تنفيذ الاختبار ذي الحدين أحادي الذيل (One-Tailed Test)
5.1 اختبار الطرف الأيمن: التحقق من الزيادة (Greater)
يُطبق اختبار الطرف الأيمن أحادي الذيل (Right-tailed / Greater Test) عندما يكون الاهتمام البحثي منصباً حصرياً على إثبات أن احتمالية النجاح الحقيقية في المجتمع تتجاوز حداً معيارياً محدداً، مع اعتبار أي انخفاض مساوياً لعدم وجود تأثير ومؤيداً للفرضية الصفرية. تصاغ الفرضيات في هذه الحالة على النحو: H0: π ≤ p مقابل الفرضية البديلة HA: π > p.
لنفترض تطبيق برنامج تدريبي إدراكي متطور لتدريب الأفراد على اكتشاف الإشارات التحذيرية. في الاختبار المعياري للتعرف العشوائي، يبلغ معدل التخمين العشوائي للنجاح p = 0.50. خضع 20 متدرباً للاختبار ونجح منهم 16 متدرباً في اجتياز المهمة بنجاح. لاختبار ما إذا كان البرنامج التدريبي يحقق معدل كفاءة أعلى من الصدفة العشوائية، يتم صياغة الكود البرمجي بتمرير المعامل alternative = "greater":
training_test <- binom.test(x = 16, n = 20, p = 0.50, alternative = "greater", conf.level = 0.95) training_test
يُظهر تشغيل هذا النموذج مخرجات نوعية مختلفة فيما يخص القيمة الاحتمالية وفترة الثقة:
Exact binomial test 16 and 20 number of successes = 16, number of trials = 20, p-value = 0.005909 alternative hypothesis: true probability of success is greater than 0.5 95 percent confidence interval: 0.6009088 1.0000000 sample estimates: probability of success 0.8
توضح النتائج أن القيمة الاحتمالية أحادية الطرف بلغت p = 0.0059، وهي دالة إحصائياً عند مستوى دلالة 0.01. وتتميز فترة الثقة أحادية الطرف هنا بأنها محددة بحد سفلي صارم (Lower Bound) قدره 0.6009، بينما يمتد الحد العلوي تلقائياً إلى 1.0000، مما يعني أننا واثقون بنسبة 95% من أن الكفاءة الحقيقية للبرنامج في المجتمع لا تقل عن 60.1%، مما يقدم برهاناً علمياً قاطعاً على فاعلية التدخل التدريبي.
5.2 اختبار الطرف الأيسر: التحقق من النقصان (Less)
على النقيض من الحالة السابقة، يُستخدم اختبار الطرف الأيسر أحادي الذيل (Left-tailed / Less Test) عندما تهدف الدراسة إلى إثبات انخفاض نسبة الظاهرة المدروسة عن معيار مرجعي محدد مسبقاً. تُصاغ الفرضيات رياضياً: H0: π ≥ p مقابل الفرضية البديلة HA: π < p.
كمثال تطبيقي، يُفترض أن نسبة المضاعفات الجانبية لعقار طبي تقليدي هي p = 0.30 (أي 30%). قامت شركة أدوية بتطوير تركيبة علاجية جديدة تهدف إلى تقليل هذه النسبة. عند تجربة العقار الجديد على n = 25 مريضاً، ظهرت الأعراض الجانبية لدى x = 3 مرضى فقط. يُنفذ الاختبار لاختبار فرضية انخفاض الآثار الجانبية كالتالي:
adverse_test <- binom.test(x = 3, n = 25, p = 0.30, alternative = "less", conf.level = 0.95) adverse_test
تنتج الدالة المخرجات الإحصائية التالية:
Exact binomial test 3 and 25 number of successes = 3, number of trials = 25, p-value = 0.03324 alternative hypothesis: true probability of success is less than 0.3 95 percent confidence interval: 0.0000000 0.2764951 sample estimates: probability of success 0.12
تشير القيمة الاحتمالية p = 0.03324 (وهي أصغر من 0.05) إلى وجود انخفاض دال إحصائياً في معدل الآثار الجانبية للتركيبة الجديدة. في هذا الاختبار أحادي الجانب من اليسار، يبدأ مجال الثقة من الصفر المطلق 0.0000 ويحده حد أعلى دقيق (Upper Bound) مقداره 0.2765. يثبت هذا الحد أن النسبة الحقيقية للآثار الجانبية تقل بكل تأكيد عن 27.6% بمستوى ثقة 95%.
من الناحية المنهجية، ينبغي التنبيه الصارم إلى خطورة ما يُعرف بالانحياز المنهجي أو التحيز البعدي؛ حيث يُحظر تماماً تحويل الاختبار ثنائي الذيل إلى اختبار أحادي الذيل بعد رؤية البيانات بهدف تخفيض القيمة الاحتمالية للحصول على دلالة إحصائية زائفة، وهو سلوك يندرج ضمن الممارسات البحثية المشبوهة (P-hacking).
6. التفكيك المنهجي لمخرجات دالة binom.test
6.1 عناصر كائن htest وتفسيرها الإحصائي
عند تنفيذ أي اختبار إحصائي تقليدي في لغة R عبر الحزم الأساسية، لا تقوم الدوال بمجرد طباعة نصوص على الشاشة، بل تُنشئ كائناً برمجياً منظماً من نوع قائمة مخصصة تُعرف باسم htest (Hypothesis Test Object). يحتوي هذا الكائن على كافة المتغيرات والمقاييس المستخرجة من العملية الحسابية بدقة متناهية.
يتألف كائن htest الناتج عن دالة binom.test() من العناصر البنيوية الأساسية التالية:
- statistic: يحمل عدد حالات النجاح الملاحظة (number of successes) ويمثل القيمة الفعلية لـ x.
- parameter: يمثل إجمالي عدد المحاولات التجريبية أو حجم العينة n (number of trials).
- p.value: القيمة الاحتمالية الدقيقة المحسوبة استناداً إلى مجموع الاحتمالات في مناطق الرفض للتوزيع ذي الحدين.
- conf.int: متجه عددي ثنائي العنصر يحدد الحد الأدنى والحد الأعلى لفترة الثقة الدقيقة، ومزود بسمة (attribute) إضافية تحدد مستوى الثقة المستخدم
conf.level. - estimate: التقدير النقطي لنسبة النجاح الملاحظة في العينة (x / n).
- null.value: النسبة المرجعية المحددة تحت الفرضية الصفرية المفحوصة (p).
- alternative: نص وصفي يحدد اتجاه الفرضية البديلة (“two.sided” أو “greater” أو “less”).
- method: السلسلة النصية المعبرة عن الاسم الرياضي للاختبار:
"Exact binomial test". - data.name: وصف نصي للمدخلات الأصلية التي تم تمريرها للدالة.
6.2 استخراج العناصر المضمنة برمجياً للتقارير الآلية
تتيح بنية كائن htest في بيئة R إمكانية استخراج القيم الإحصائية المنفردة برمجياً باستخدام مشغل الاستخلاص $. تكتسب هذه الميزة أهمية استثنائية في التحليلات الحديثة لأنها تمكن الباحث من أتمتة كتابة التقارير العلمية بالكامل داخل مستندات R Markdown أو منظومة Quarto، مما يلغي تماماً الأخطاء البشرية الناتجة عن النسخ واللصق اليدوي للأرقام.
يوضح الكود التالي كيفية استخراج كافة العناصر وتنسيقها برمجياً:
test_output <- binom.test(x = 18, n = 30, p = 0.5)
p_val <- test_output$p.value
ci_lower <- test_output$conf.int[1]
ci_upper <- test_output$conf.int[2]
prop_est <- test_output$estimate
cat(sprintf("النسبة الملاحظة = %.2f [مجال الثقة 95%%: %.2f - %.2f]، والقيمة الاحتمالية = %.4f",
prop_est, ci_lower, ci_upper, p_val))
كما يمكن دمج هذه المخرجات في جداول تلخيصية احترافية عبر حزمة broom ودالتها الشهيرة tidy()، والتي تحول كائن htest المعقد إلى إطار بيانات قياسي (Tibble / Data Frame) يسهل تصديره إلى تقارير PDF أو Word أو مواقع ويب تفاعلية.
7. فترات الثقة الدقيقة وتقدير حجم التأثير في R
7.1 طريقة كلوبر-بيرسون مقابل الطرق التقريبية
تمثل فترة الثقة للنسبة المعلمية مجالاً من القيم المعقولة التي يُرجح أن تحتوي على النسبة الحقيقية في المجتمع عند مستوى ثقة محدد. تاريخياً، اعتمدت العديد من البرمجيات على تقريب والد (Wald Interval)، القائم على التوزيع الطبيعي المعياري والمعادلة الكلاسيكية: p_hat ± Z * sqrt(p_hat * (1 – p_hat) / n). ومع ذلك، أثبتت الدراسات الرياضية الحديثة، ولا سيما دراسات Agresti و Coull، أن تقريب والد يعاني من عيوب فادحة؛ إذ ينخفض معدل التغطية الفعلي الحقيقي له بشكل كارثي عندما تكون العينة صغيرة أو عندما تقترب النسبة من الأطراف (0 أو 1)، مما يعطي فترات ثقة متفائلة وضيعة تفشل في احتواء المعلمة الحقيقية بنسبة 95% المعلنة.
تتجاوز دالة binom.test() في R هذه الإشكالية بالاعتماد على فترة كلوبر-بيرسون الدقيقة (Clopper-Pearson Exact Interval). تقوم هذه الطريقة بعكس التوزيع التراكمي الدقيق لذوي الحدين باستخدام العلاقة الرياضية بين التوزيع ذي الحدين وتوزيع F أو توزيع بيتا (Beta Distribution). يتم حساب الحد الأدنى والحد الأعلى بدقة عبر الدوال الرياضية التالية:
الحد الأدنى هو النسبة p_L التي تحقق P(X ≥ x | p_L) = alpha / 2، والحد الأعلى هو النسبة p_U التي تحقق P(X ≤ x | p_U) = alpha / 2. ونظراً لأن المتغير منفصل، فإن معدل التغطية الفعلي لطريقة كلوبر-بيرسون يكون دائماً أكبر من أو مساوياً للمستوى الاسمي 1 – alpha، مما يجعلها طريقة “محافظة” تضمن أعلى درجات الموثوقية وتمنع الاستنتاجات الزائفة.
لاستكشاف ومقارنة طرق فترات الثقة البديلة مثل فترة ويلسون (Wilson Score)، وأجريستي-كول (Agresti-Coull)، وفترة جيفريز البيزية (Jeffreys)، توفر حزمة binom في R دالة متكاملة تتيح حساب كافة هذه الطرق دفعة واحدة وتحليل الفروق بينها برمجياً:
library(binom) comparison_ci <- binom.confint(x = 8, n = 20, conf.level = 0.95, methods = "all") print(comparison_ci)
7.2 حساب مقاييس حجم التأثير للمتغيرات الثنائية
في المنهجية العلمية الرصينة، لم يعد الاعتماد على الدلالة الإحصائية والقيمة الاحتمالية (p-value) كافياً لتقييم الأهمية العلمية للنتائج؛ فالقيمة الاحتمالية تخبرنا فقط عما إذا كان التأثير ناتجاً عن الصدفة، لكنها لا توضح حجم ذلك التأثير أو أهميته العملية والواقعية (Practical Significance). لذلك، يجب حساب وتقرير مقاييس حجم التأثير (Effect Size) المناسبة للمتغيرات الثنائية.
المقياس الأكاديمي الأكثر استخداماً لمقارنة النسب في الاختبار ذي الحدين هو مقياس كوهين إتش (Cohen’s h). يقوم هذا المقياس على تطبيق تحويل رياضي قوسي (Arcsine Transformation) على النسبتين المراد مقارنتهما، مما يثبت التباين عبر كامل مدى النسب ويسمح بمقارنة متكافئة. يُحسب كوهين إتش بالمعادلة التالية:
h = 2 * arcsin(sqrt(p1)) – 2 * arcsin(sqrt(p2))
حيث p1 هي النسبة الملاحظة في العينة، و p2 هي النسبة النظرية المفترضة. وفقاً لإرشادات جاكوب كوهين (Jacob Cohen)، تُفسر قيم h كما يلي: التأثير الصغير: h = 0.20، التأثير المتوسط: h = 0.50، التأثير الكبير: h = 0.80 فما فوق.
يمكن حساب كوهين إتش برمجياً في R باستخدام حزمة pwr عبر الدالة ES.h():
library(pwr)
p_obs <- 18 / 24 # 0.75
p_theo <- 0.50
h_value <- ES.h(p1 = p_obs, p2 = p_theo)
cat(sprintf("قيمة حجم التأثير (Cohen's h) = %.4f", h_value))
بالإضافة إلى كوهين إتش، يمكن في سياقات معينة حساب نسبة الأرجحية (Odds Ratio – OR) لتقييم مقدار زيادة احتمالية النجاح مقارنة باحتمالية الفشل في العينة بالنسبة للنموذج النظري، مما يوفر رؤية تفسيرية شاملة تجمع بين الصرامة الرياضية والمعنى التطبيقي للظاهرة المدروسة.
8. تطبيقات عملية في الأبحاث النفسية والسلوكية عبر R
8.1 دراسة سلوكية: اختبار تفضيل المهام في علم النفس الإدراكي
تعتمد أبحاث علم النفس الإدراكي والسلوكي بشكل واسع على تجارب الاختيار القسري ثنائي البدائل (Two-Alternative Forced-Choice – 2AFC). لنفترض دراسة سلوكية تجريبية تهدف إلى التحقق مما إذا كان الأطفال الرضع يظهرون تفضيلاً فطرياً للمثيرات البصرية ذات التناسق الوجهي مقارنة بالمثيرات الهندسية المجردة.
تم تعريض عينة مكونة من n = 35 طفلاً رضيعاً لشاشتين متزامنتين، وتم تسجيل الخيار البصري الأول لكل طفل. وفقاً للنموذج العشوائي المحايد (عدم وجود تفضيل)، فإن النسبة المتوقعة لاختيار الوجه البشري هي p = 0.50. أظهرت النتائج التجريبية أن x = 26 طفلاً حدقوا أولاً نحو الوجه البشري المتناسق.
يتم بناء وتشغيل التحليل الإحصائي لهذه الدراسة في R كما يلي:
infant_preference <- binom.test(x = 26, n = 35, p = 0.50, alternative = "two.sided") infant_preference
أظهر التحليل الإحصائي أن النسبة الملاحظة لتفضيل الوجه البشري بلغت 74.3% [مجال ثقة 95%: 56.7% – 87.5%]، مع قيمة احتمالية دالة إحصائياً بلغت p = 0.0062. يثبت هذا التحليل السلوكي بدلالة قاطعة وجود تحيز إدراكي فطري لدى الأطفال نحو المثيرات ذات الطابع البشري، متجاوزاً احتمالية الصدفة العشوائية بشكل دال.
8.2 دراسة إكلينيكية: قياس معدلات الاستجابة للعلاج النفسي
في الأبحاث النفسية الإكلينيكية والطب النفسي المسند بالدليل، يتم تقييم التدخلات العلاجية الحديثة مقارنة بالمعايير التاريخية المعروفة مسبقاً لمعدلات التحسن العفوي (Spontaneous Remission) أو العلاجات التقليدية. لنفترض أن الأدبيات الطبية تشير إلى أن برامج العلاج النفسي التقليدية للاضطراب الوجداني تحقق معدل استجابة وتعافٍ مستقر يبلغ p = 0.40 (أي 40%).
قام فريق بحثي بتطبيق بروتوكول مكثف من العلاج المعرفي السلوكي المطور (Modified CBT) على عينة إكلينيكية تجريبية مكونة من n = 45 مريضاً، حيث أظهر x = 27 مريضاً استجابة إيجابية كاملة وتحسناً ملحوظاً وفق مقاييس التشخيص الإكلينيكي المعتمدة.
نظراً لأن الهدف الإكلينيكي هو إثبات تفوق البروتوكول الجديد على النسبة التاريخية، يتم إجراء اختبار ذي حدين أحادي الطرف (طرف أيمن) في R كالتالي:
clinical_response <- binom.test(x = 27, n = 45, p = 0.40, alternative = "greater", conf.level = 0.95) clinical_response
أسفرت النتائج عن نسبة استجابة إكلينيكية بلغت 60.0% في العينة المعالجة، بقيمة احتمالية أحادية الطرف p = 0.0044، وحد سفلي لمجال الثقة 95% يبلغ 46.7%. تدعم هذه النتائج المنهجية اعتماد البروتوكول الجديد في الممارسة السريرية، حيث تثبت أن كفاءة البرنامج العلاجي تتجاوز المعيار التاريخي المرجعي بدلالة إحصائية عالية.
9. المقارنة بين الاختبار ذي الحدين والبدائل الإحصائية في R
9.1 المقارنة مع اختبار النسبة للعينات الكبيرة (prop.test)
تضم لغة R دالة أخرى شهيرة لتحليل النسب وهي دالة prop.test(). يعتمد هذا الاختبار على التقريب التوزيعي لمربع كاي (أو التوزيع الطبيعي للنسب) باستخدام تقريب العينات الكبيرة، مع تطبيق تصحيح ييتس للاستمرارية (Yates’ Continuity Correction) افتراضياً لتقليل خطأ التقريب المتقطع.
يوضح الجدول المقارن التالي الفروق المنهجية والحسابية الجوهرية بين الدالتين:
| وجه المقارنة | دالة binom.test() | دالة prop.test() |
|---|---|---|
| الأساس الرياضي | توزيع ذي الحدين الدقيق (Exact Binomial) | تقريب مربع كاي / التوزيع الطبيعي (Asymptotic) |
| القيود على حجم العينة | صالحة لجميع الأحجام (صغيرة جداً، متوسطة، كبيرة) | تتطلب عينات كبيرة (np ≥ 5 و n(1-p) ≥ 5) |
| حساب فترات الثقة | طريقة كلوبر-بيرسون الدقيقة (Clopper-Pearson) | طريقة ويلسون المعدلة مع تصحيح الاستمرارية |
| القيم الاحتمالية (p-values) | قيم دقيقة خالية من أخطاء التقريب | قيم تقريبية تقاربية تعتمد على نظرية النهاية المركزية |
عندما تكون العينة كبيرة جداً (مثلاً n = 1000)، تتقارب نتائج binom.test() وprop.test() إلى درجات متناهية من التطابق. ولكن في العينات الصغيرة أو عند دراسة الأحداث النادرة، تُعد دالة binom.test() الخيار الإحصائي الوحيد المقبول علمياً لأنها تضمن التحكم الكامل في معدل الخطأ من النوع الأول دون الاعتماد على افتراضات تقاربية غير متحققة.
9.2 المقارنة مع اختبار حسن المطابقة لمربع كاي (Chi-Square Goodness-of-Fit)
يُمثل اختبار حسن المطابقة لمربع كاي، المنفذ في R عبر دالة chisq.test()، بديلاً واسع الانتشار لاختبار الفرضيات حول التوزيعات الفئوية. عند تطبيق الاختبار على متغير ثنائي الفئات بنسب متوقعة محددة، يتكافأ اختبار مربع كاي غير المصحح رياضياً مع مربع اختبار النسبة الطبيعي Z.
ومع ذلك، يبرز فارق منهجي حاسم بين الاختبارين؛ فاختبار مربع كاي يعاني من حساسية شديدة لشرط التكرارات المتوقعة (Expected Frequencies)، حيث تفقد الدالة صلاحيتها إذا كان التكرار المتوقع في أي خلية يقل عن 5 (أي عندما يكون n*p < 5 أو n*(1-p) < 5). في مثل هذه الحالات، يعطي اختبار chisq.test() تحذيراً صريحاً في واجهة R يفيد بأن تقريب كاي قد لا يكون دقيقاً.
في المقابل، لا تخضع دالة binom.test() لأي قيود على التكرارات المتوقعة إطلاقاً، وتعمل بكفاءة رياضية مطلقة حتى مع وجود تكرارات متوقعة أو ملاحظة تبلغ صفراً أو واحداً. الميزة الوحيدة لاختبار chisq.test() تكمن في قدرته على التعامل مع المتغيرات متعددة الفئات الاسمية (Multinomial Variables) التي تتجاوز فئتين، بينما يقتصر الاختبار ذو الحدين حصرياً على المتغيرات الثنائية المتبادلة.
10. تحليل القوة الإحصائية وتحديد حجم العينة في R
10.1 حساب القوة الإحصائية اللاحقة والقبلية (Power Analysis)
يُعد تحليل القوة الإحصائية (Statistical Power Analysis) ركناً أساسياً في التصميم التجريبي الرصين لتفادي الوقوع في الخطأ من النوع الثاني (Type II Error – Beta)، وهو الفشل في رفض الفرضية الصفرية رغم كونها خاطئة في الواقع. تُمثل القوة الإحصائية (1 – Beta) احتمالية نجاح التجربة في الكشف عن تأثير حقيقي ذي حجم محدد عند مستوى دلالة إحصائية معين.
توفر حزمة pwr في لغة R دالة متخصصة لتحليل القوة لنسبة مفردة وهي الدالة pwr.p.test(). تتطلب هذه الدالة تحديد ثلاثة بارامترات لحساب الرابع المجهول: حجم التأثير (h)، حجم العينة (n)، مستوى الدلالة (sig.level)، والقوة الإحصائية المطلوبة (power).
لحساب حجم العينة المطلوب مسبقاً (A Priori Sample Size) للكشف عن تأثير متوسط (h = 0.5) بمستوى دلالة alpha = 0.05 وقوة إحصائية معيارية 80% (power = 0.80) لاختبار ثنائي الذيل:
library(pwr) sample_size_req <- pwr.p.test(h = 0.50, sig.level = 0.05, power = 0.80, alternative = "two.sided") sample_size_req
توضح نتائج الحساب أن الباحث يحتاج إلى n = 32 مشاركاً على الأقل لضمان تحقيق قوة إحصائية كافية. كما يمكن توليد منحنيات القوة الإحصائية (Power Curves) برمجياً عبر تكرار الحساب لأحجام عينات مختلفة ورسم العلاقة بيانياً لتحديد الحجم الأمثل بدقة.
10.2 محاكاة مونت كارلو لتقييم حساسية الاختبار ذي الحدين
تُعد محاكاة مونت كارلو (Monte Carlo Simulation) تقنية حسابية متقدمة ونافذة لتقييم الخصائص التجريبية للاختبار الإحصائي في ظل ظروف تكرارية واقعية. من خلال محاكاة آلاف العينات العشوائية المتطابقة، يستطيع الباحث التحقق تجريبياً من معدل الخطأ الفعلي ومعدل الرفض (Empirical Power) للاختبار ذي الحدين.
يوضح الكود التالي بناء دالة محاكاة تقوم بتوليد 10,000 عينة عشوائية بحجم n = 30 وباحتمالية نجاح حقيقية p = 0.70، ثم تجري اختبار binom.test على كل عينة لاختبار الفرضية الصفرية (H0: p = 0.50) وحساب النسبة المئوية لرفض الفرضية الصفرية:
set.seed(42)
n_simulations <- 10000
sample_size <- 30
true_prob <- 0.70
null_prob <- 0.50
p_values <- replicate(n_simulations, {
sim_x <- rbinom(n = 1, size = sample_size, prob = true_prob)
test <- binom.test(x = sim_x, n = sample_size, p = null_prob)
test$p.value
})
empirical_power <- mean(p_values < 0.05)
cat(sprintf("القوة الإحصائية التجريبية المقدرة بالمحاكاة = %.2f%%", empirical_power * 100))
تتيح هذه المحاكاة للمحلل اختبار سلوك الاختبار ذي الحدين تحت سيناريوهات تجريبية معقدة ومتنوعة، مما يعزز الثقة في سلامة التصميم الإحصائي وصحة القرارات الاستدلالية المتخذة.
11. التصور البياني المتقدم للبيانات ذات الحدين في R
11.1 رسم التوزيعات الاحتمالية باستخدام حزمة ggplot2
يساعد التمثيل البصري للتوزيعات الاحتمالية في تعميق الفهم الإحصائي لموقع النتيجة الملاحظة مقارنة بجميع النتائج المحتملة تحت الفرضية الصفرية، وتحديد مناطق الرفض الحرجة (Critical Rejection Regions) بيانياً.
يمكن بناء وتوليد دالة الكتلة الاحتمالية (Probability Mass Function – PMF) للتوزيع ذي الحدين باستخدام دالة dbinom() في R، ودمجها داخل منظومة ggplot2 لإنتاج رسم بياني أكاديمي فائق الجودة يوضح قيم الاحتمالات لكل عدد ممكن من النجاحات، مع تلوين الأعمدة التي تقع في منطقة الرفض بمستوى دلالة alpha = 0.05، وإضافة خط رأسي يحدد بدقة موقع القيمة الملاحظة في التجربة.
library(ggplot2)
n_trials <- 20
p_null <- 0.5
obs_x <- 15
binom_df <- data.frame(
Successes = 0:n_trials,
Probability = dbinom(0:n_trials, size = n_trials, prob = p_null)
)
# تحديد مناطق الرفض الحرجة ثنائية الطرف
critical_p <- 0.05
binom_df$Region <- ifelse(\binom_df$Probability <= dbinom(15, n_trials, p_null), "منطقة الرفض", "منطقة القبول")
ggplot(binom_df, aes(x = factor(Successes), y = Probability, fill = Region)) +
geom_col(width = 0.7, color = "black") +
geom_vline(xintercept = obs_x + 1, linetype = "dashed", color = "blue", size = 1) +
scale_fill_manual(values = c("منطقة الرفض" = "#d9534f", "منطقة القبول" = "#5bc0de")) +
labs(
title = "التوزيع الاحتمالي النظري ذو الحدين (n = 20, p = 0.5)",
subtitle = "الخط الأزرق يوضح موضع القيمة الملاحظة (x = 15)",
x = "عدد حالات النجاح الممكنة",
y = "الاحتمالية",
fill = "المنطقة الإحصائية"
) +
theme_minimal(base_family = "sans") +
theme(plot.title = element_text(face = "bold", hjust = 0.5),
plot.subtitle = element_text(hjust = 0.5))
11.2 تمثيل النسب الملاحظة وفترات الثقة بيانياً
يُعد عرض التقديرات النقطية مصحوبة بفترات الثقة المقابلة لها المعيار الأساسي في النشر العلمي الحديث. يتيح استخدام دالة geom_pointrange() أو geom_errorbar() في ggplot2 تصوير فترات ثقة كلوبر-بيرسون بشكل احترافي يسهل مقارنة عدة مجموعات تجريبية أو شروط مختلفة جنباً إلى جنب.
يوضح النموذج التالي كيفية إعداد مخطط بياني يقارن نسب النجاح وفترات ثقتها لثلاث مجموعات تجريبية مختلفة:
results_summary <- data.frame(
Group = c("المجموعة الضابطة", "العلاج التقليدي", "العلاج التجريبي"),
Successes = c(12, 18, 25),
Total = c(30, 30, 30)
)
# حساب التقديرات وفترات الثقة الدقيقة لكل مجموعة
ci_data <- do.call(rbind, lapply(1:nrow(results_summary), function(i) {
test <- binom.test(results_summary$Successes[i], results_summary$Total[i])
data.frame(
Group = results_summary$Group[i],
Proportion = test$estimate,
Lower = test$conf.int[1],
Upper = test$conf.int[2]
)
}))
ggplot(ci_data, aes(x = Group, y = Proportion, ymin = Lower, ymax = Upper)) +
geom_pointrange(size = 0.8, color = "#2c3e50", fatten = 3) +
geom_hline(yintercept = 0.50, linetype = "dotted", color = "red", size = 1) +
coord_flip() +
scale_y_continuous(limits = c(0, 1), labels = scales::percent) +
labs(
title = "مقارنة نسب النجاح وفترات الثقة 95% عبر المجموعات",
subtitle = "الخط الأحمر المنقط يمثل النسبة المفترضة تحت الفرضية الصفرية (50%)",
x = "المجموعة التجريبية",
y = "النسبة المئوية المقدرة للنجاح"
) +
theme_bw(base_family = "sans")
يمكن تصدير هذه المخططات بدقة فائقة بصيغ متجهة عالية الجودة (مثل PDF أو SVG أو TIFF بدقة 300 DPI) عبر الدالة ggsave() لضمان استيفاء المعايير الصارمة لدور النشر الأكاديمية العالمية.
12. صياغة وتوثيق النتائج وفق معايير APA والأخطاء الشائعة
12.1 كتابة تقرير النتائج حسب دليل الجمعية الأمريكية لعلم النفس (APA 7th)
يفرض دليل النشر الأكاديمي الصادر عن الجمعية الأمريكية لعلم النفس (APA 7th Edition) قواعد دقيقة لتوثيق نتائج الاختبارات الإحصائية في متن الأبحاث. عند كتابة تقرير الاختبار ذي الحدين، يجب ألا يقتصر الباحث على ذكر القيمة الاحتمالية فقط، بل يتوجب توثيق العناصر التالية بشكل منهجي متكامل: عدد حالات النجاح (x)، حجم العينة الإجمالي (n)، النسبة المئوية الملاحظة، القيمة الاحتمالية الدقيقة (p-value)، ومجال الثقة الدقيق (95% CI)، بالإضافة إلى مقياس حجم التأثير (Cohen’s h).
فيما يلي نماذج نصية جاهزة ومعتمدة للصياغة الأكاديمية باللغة العربية:
نموذج لاختبار ثنائي الطرف ذي دلالة إحصائية:
“أظهرت نتائج الاختبار الدقيق ذي الحدين وجود اختلاف دال إحصائياً في نسبة اختيار المثير البصري مقارنة بالنسبة المتوقعة بموجب الصدفة العشوائية (50%)؛ حيث بلغت نسبة الاختيار الملاحظة 75.0% (18 من أصل 24 مشاركاً)، p = .023، بنطاق ثقة 95% كلوبر-بيرسون [53.3%، 90.2%]. كما بلغ حجم التأثير المحسوب h = 0.52، مما يشير إلى تأثير متوسط ذي دلالة عملية تدعم الفرضية المعرفية للبحث.”
نموذج لاختبار غير دال إحصائياً:
“أجري اختبار دقيق ذو حدين لمقارنة معدل الإجابات الصحيحة بالنسبة المعيارية المفترضة نظرياً (p = .50). أشارت النتائج إلى أن نسبة النجاح الملاحظة البالغة 56.7% (17 من أصل 30 محاولة) لم تكن دالة إحصائياً، p = .584، 95% CI [37.4%، 74.5%]، h = 0.13. بناءً على ذلك، فشلت الدراسة في رفض الفرضية الصفرية، مما يشير إلى أن أداء المشاركين لا يختلف جوهرياً عن مستوى التخمين العشوائي.”
12.2 الأخطاء المنهجية والبرمجية الشائعة وكيفية تلافيها
يقع العديد من الباحثين ومحللي البيانات في أخطاء منهجية وبرمجية متكررة عند تطبيق الاختبار ذي الحدين وتفسير مخرجاته في لغة R. يوضح الاستعراض التالي أبرز هذه الأخطاء وسبل تلافيها الصارم:
- عكس ترتيب معاملات الدالة (Parameter Inversion): من الأخطاء البرمجية الشائعة وضع إجمالي حجم العينة n مكان عدد النجاحات x أو العكس داخل الدالة
binom.test(n, x). يؤدي هذا الخطأ إلى حسابات احتمالية غير صحيحة كلياً أو انهيار تنفيذ الكود عند محاولة تمرير x أكبر من n. يجب دائماً تسمية المعاملات صراحة (مثلx = 15, n = 20) لضمان الدقة البرمجية. - ممارسة الـ P-Hacking وتغيير اتجاه الاختبار بعد جمع البيانات: يلجأ بعض الباحثين إلى تحويل الاختبار من ثنائي الذيل إلى أحادي الذيل (Right-tailed أو Left-tailed) بعد ملاحظة أن القيمة الاحتمالية ثنائية الذيل تقع قرب عتبة الدلالة (مثلاً p = 0.08) بهدف شطر القيمة إلى النصف لتصبح دالة (p = 0.04). يُعد هذا التصرف انتهاكاً جسيماً للنزاهة العلمية؛ حيث يجب حسم اتجاه الفرضية قبل بدء التجربة وجمع البيانات، وتوثيق ذلك في بروتوكولات التسجيل المسبق (Pre-registration).
- تجاهل مجالات الثقة والاعتماد الحصري على p-value: يُعتبر التركيز على القيمة الاحتمالية بمعزل عن فترات الثقة وحجم التأثير خطأً استدلالياً فادحاً. ففترة الثقة الواسعة جداً تدل على عدم دقة التقدير النقطي وصغر حجم العينة، حتى وإن كانت القيمة الاحتمالية دالة، والعكس صحيح.
- الخلط بين الفشل في رفض الفرضية الصفرية وإثبات صحتها: إن عدم الوصول إلى دلالة إحصائية (p > 0.05) لا يعني على الإطلاق إثبات أن النسبة الحقيقية تساوي القيمة النظرية تماماً؛ بل يعني فقط غياب الأدلة الكافية لرفضها في ضوء حجم العينة المتاحة وبياناتها، وهو ما قد ينتج ببساطة عن ضعف القوة الإحصائية للتجربة (Underpowered Study).
خاتمة
يُمثل الاختبار الدقيق ذو الحدين (Exact Binomial Test) أحد أرسخ وأهم النماذج الإحصائية اللابارامترية لتحليل البيانات الثنائية الاسمية، حيث يجمع بين الدقة الرياضية المطلقة والتحرر من الافتراضات التوزيعية التقريبية القاصرة. ومن خلال بيئة الحوسبة الإحصائية R، يمتلك الباحثون أداة برمجية غاية في القوة والمرونة ممثلة في دالة binom.test()، التي تمكّنهم من إجراء التحليلات الموجهة وغير الموجهة، وحساب فترات ثقة كلوبر-بيرسون الدقيقة، واستخراج المعلمات لإنتاج تقارير تفاعلية مؤتمتة وموثوقة.
إن التطبيق المنهجي الرصين للاختبار ذي الحدين يتطلب من الباحث فهماً عميقاً لشروط الاستقلالية وثبات الاحتمالات، واقتراناً لازماً بين حساب الدلالة الإحصائية (p-value) وتقدير فترات الثقة وأحجام التأثير المعيارية مثل كوهين إتش، فضلاً عن مراعاة متطلبات القوة الإحصائية والتصميم التجريبي المسبق. بالالتزام بهذه المعايير الأكاديمية والبرمجية، تصبح الاستنتاجات العلمية المنشورة أكثر متانة وموثوقية وقدرة على دفع عجلة التقدم في الأبحاث النفسية والسلوكية والإكلينيكية.
References
- Agresti, A., & Coull, B. A. (1998). Approximate is better than “exact” for interval estimation of binomial proportions. The American Statistician, 52(2), 119-126. https://doi.org/10.1080/00031305.1998.10480550
- American Psychological Association. (2020). Publication manual of the American Psychological Association (7th ed.). American Psychological Association. https://doi.org/10.1037/0000165-000
- Champely, S. (2020). pwr: Basic functions for power analysis (R package version 1.3-0). CRAN. https://CRAN.R-project.org/package=pwr
- Clopper, C. J., & Pearson, E. S. (1934). The use of confidence or fiducial limits illustrated in the case of the binomial. Biometrika, 26(4), 404-413. https://doi.org/10.1093/biomet/26.4.404
- Cohen, J. (1988). Statistical power analysis for the behavioral sciences (2nd ed.). Lawrence Erlbaum Associates.
- Dorai-Raj, S. (2014). binom: Binomial confidence intervals for several parameterizations (R package version 1.1-1). CRAN. https://CRAN.R-project.org/package=binom
- R Core Team. (2023). R: A language and environment for statistical computing. R Foundation for Statistical Computing, Vienna, Austria. https://www.R-project.org/
- Wickham, H., Averick, M., Bryan, J., Chang, W., McGowan, L. D., François, R., Grolemund, G., Hayes, A., Henry, L., Hester, J., Kuhn, M., Pedersen, T. L., Miller, E., Bache, S. M., Müller, K., Ooms, J., Robinson, D., Seidel, D. P., Spinu, V., … Yutani, H. (2019). Welcome to the Tidyverse. Journal of Open Source Software, 4(43), 1686. https://doi.org/10.21105/joss.01686