الإحصاء والقياس النفسيتحليل البيانات بلغة R

كيفية ملاءمة توزيع غاما لمجموعة بيانات في R

دليل أكاديمي شامل ومفصل لخطوات ملاءمة توزيع غاما للبيانات في بيئة R الإحصائية باستخدام حزمة fitdistrplus مع التحليل التشخيصي والتطبيقات العملية.

تاريخ النشر

تمثل النمذجة الإحصائية للبيانات المستمرة ركيزة أساسية في البحث العلمي التطبيقي، لا سيما عند التعامل مع ظواهر طبيعية أو سلوكية تتميز بطبيعتها غير المتماثلة والتواء توزيعاتها نحو اليمين. في العديد من التخصصات، مثل العلوم السلوكية، والاقتصاد القياسي، والقياس النفسي، والعلوم الحيوية، تفشل الفرضيات التقليدية المعتمدة على التوزيع الاعتدالي الطبيعي في تمثيل الواقع التجريبي بدقة، حيث تتسم البيانات بوجود حد أدنى مقيد بالصفر وذيل ممتد يمثل القيم المتطرفة الإيجابية. هنا يبرز توزيع غاما (Gamma Distribution) كأحد أقوى وأكثر التوزيعات الاحتمالية المستمرة مرونة في استيعاب هذه الخصائص الهيكلية دون الحاجة إلى اللجوء القسري إلى تحويلات رياضية قد تشوه طبيعة العلاقات بين المتغيرات.

تتيح لغة البرمجة الإحصائية R ترسانة برمجية متقدمة وحزم متخصصة لتقدير معلمات التوزيعات الاحتمالية وتقييم جودة مطابقتها. ومن بين هذه الحزم، تبرز حزمة fitdistrplus كمعيار ذهبي يوفر أدوات متكاملة للاستكشاف البصري، والتقدير البارامتري باستخدام خوارزميات استمثال متعددة، وإجراء الاختبارات الإحصائية الصارمة لحسن المطابقة. يقدم هذا الدليل المنهجي الشامل معالجة تفصيلية وعميقة لخطوات ملاءمة توزيع غاما لمجموعات البيانات في بيئة R، بدءاً من الأسس الرياضية والنظرية، مروراً بآليات التنفيذ البرمجي، وانتهاءً بتفسير المخرجات وتشخيص النماذج وتطبيقاتها المتقدمة في نمذجة المتغيرات السلوكية والكمية.

يهدف هذا المقال إلى تزويد الباحثين والمحللين بفهم إبستمولوجي وتطبيقي دقيق لعملية الملاءمة الإحصائية. سنستعرض معاً الفروق الجوهرية بين طرائق التقدير الإحصائي المختلفة، مثل تقدير الإمكان الأعظم (Maximum Likelihood Estimation) وطريقة العزوم ومطابقة المئينات، مع تسليط الضوء على كيفية تشخيص جودة النماذج المقدرة عبر المؤشرات الرقمية والمخططات البيانية المتقدمة، وتقديم حلول علمية للتحديات العملية كظهور القيم الصفرية وعدم تقارب الخوارزميات الحسابية.

1. مقدمة نظرية حول توزيع غاما وتطبيقاته في النمذجة الإحصائية

1.1 المفهوم الإحصائي لتوزيع غاما

يُعرَّف توزيع غاما في النظرية الاحتمالية بأنه توزيع احتمالي مستمر ثنائي المعلمة، يمتد مجاله الرياضي حصراً على مجموعة الأعداد الحقيقية الموجبة، أي في الفترة المفتوحة من الصفر إلى ما لا نهاية الموجبة ($x in (0, \infty)$). ينتمي هذا التوزيع إلى عائلة التوزيعات الأسية الطبيعية (Exponential Family)، ويتميز بمرونته الفائقة في تشكيل منحنيات الكثافة الاحتمالية، حيث يمكنه اتخاذ أشكال تتراوح بين التناقص الأسي الحاد والمنحنيات وحيدة القمة ذات الالتواء الإيجابي المتفاوت، وصولاً إلى أشكال تقترب من التماثل الاعتدالي عندما تكبر قيمة معلمة الشكل بدرجة كافية.

يرتبط توزيع غاما بعلاقات رياضية وطيدة مع عدة توزيعات احتمالية أساسية. فعلى سبيل المثال، يمثل التوزيع الأسي (Exponential Distribution) حالة خاصة من توزيع غاما عندما تكون معلمة الشكل مساوية تماماً للواحد الصحيح ($\alpha = 1$). كما يرتبط توزيع غاما ارتباطاً وثيقاً بـ توزيع كاي تربيع (Chi-Squared Distribution)؛ إذ إن توزيع كاي تربيع بدرجات حرية مقدارها $\nu$ يكافئ تماماً توزيع غاما بمعلمة شكل تساوي $nu/2$ ومعلمة مقياس تساوي $2$. إضافة إلى ذلك، يعد توزيع إيرلانغ (Erlang Distribution) حالة خاصة أخرى لتوزيع غاما تقتصر فيها معلمة الشكل على الأعداد الصحيحة الموجبة، وهو ما يُستخدم بكثافة في نمذجة طوابير الانتظار والعمليات العشوائية المتسلسلة.

تتجلى أهمية توزيع غاما في الأبحاث الكمية عند نمذجة الظواهر التي لا يمكن أن تأخذ قيماً سالبة، والتي تظهر تبايناً يتزايد طردياً مع تزايد المتوسط الحسابي. إن افتراض التوزيع الطبيعي في مثل هذه السياقات يؤدي إلى أخطاء استدلالية جسيمة، مثل التنبؤ بقيم سالبة مستحيلة فيزيائياً، أو التقليل من احتمالية وقوع الأحداث في الذيل الأيمن للتوزيع. لذلك، يمثل نموذج غاما أداة رياضية رصينة قادرة على احتواء الالتواء الموجب الطبيعي للبيانات المتصلة دون تشويه لمقياس القياس الأصلي.

1.2 أهمية ملاءمة التوزيعات المستمرة في العلوم السلوكية والنفسية

تحظى ملاءمة التوزيعات الاحتمالية المستمرة باهتمام استثنائي في حقول علم النفس التجريبي والعلوم السلوكية والمعرفية. تُظهر البيانات المستمدة من التجارب السلوكية، مثل أزمنة الرجع (Reaction Times) وفترات الاستجابة للمثيرات الحسية، التواءً إيجابياً بنيوياً ثابتاً؛ إذ يتمكن المفحوصون من الاستجابة بسرعة حتى حد فسيولوجي أدنى، بينما تمتد أزمنة بعض المحاولات لتشكل ذيلاً طويلاً ناتجاً عن تشتت الانتباه أو التعقيد الإدراكي للمهمة. يتيح استخدام توزيع غاما نمذجة هذه الأزمنة كعملية تراكمية لمراحل المعالجة العصبية المتتابعة.

تساعد النمذجة الدقيقة لتوزيع البيانات النفسية على تجاوز التحديات المرتبطة بفرض التوزيع الطبيعي قسراً على مقاييس لا تنطبق عليها شروط الاعتدالية. في كثير من الممارسات البحثية التقليدية، يلجأ الباحثون إلى تحويلات البيانات، مثل التحويل اللوغاريتمي أو تحويل الجذر التربيعي، لجعل البيانات تبدو طبيعية. ومع ذلك، تؤدي هذه التحويلات إلى صعوبة بالغة في تفسير المعلمات المستخرجة وإعادتها إلى المقياس الزمني أو السلوكي الأصلي. يوفر توزيع غاما حلاً مباشراً يتيح تقدير المؤشرات الإحصائية على المقياس الخام للظاهرة دون فقدان الدقة النظرية.

إلى جانب أزمنة الاستجابة، يمتد تطبيق توزيع غاما ليشمل قياس الفترات الزمنية الفاصلة بين الأحداث السلوكية المتكررة، مثل تكرار نوبات الانفعال، أو الفواصل الزمنية بين التفاعلات الاجتماعية في دراسات علم النفس الاجتماعي وعلم السلوك الحيواني. إن فهم التوزيع الاحتمالي الذي يحكم هذه الفواصل الزمنية يعزز من قدرة النماذج التنبؤية على رصد الأنماط السلوكية المعقدة واختبار النظريات الديناميكية حول العمليات العقلية الكامنة.

1.3 الأهداف المنهجية للملاءمة الإحصائية

تنطوي عملية ملاءمة التوزيعات الاحتمالية على أهداف منهجية متكاملة تتجاوز مجرد مطابقة المنحنيات الرياضية مع البيانات الإمبريقية. الهدف الأول والأبرز هو الاستدلال الإحصائي الدقيق على معلمات المجتمع الأصلي انطلاقاً من بيانات العينة المتاحة. من خلال تقدير هذه المعلمات، يستطيع الباحث تلخيص كميات هائلة من المشاهدات الفردية في صورتين بارامتريتين تعبران عن الموضع الهيكلي والتشتت والشكل للعملية المولدة للبيانات.

الهدف المنهجي الثاني يتمثل في تقييم القدرة التنبؤية وتوليد السيناريوهات الاحتمالية المستقبلية. بمجرد التحقق من صحة ملاءمة نموذج غاما لمجموعة البيانات، يصبح بالإمكان حساب الاحتمالات التراكمية لوقوع أحداث نادرة في ذيل التوزيع، وتحديد المئينات الحساسة التي تقع خارج النطاق المشاهد للعينة، وهو ما يكتسب أهمية بالغة في مجالات تقييم المخاطر، والتشخيص الإكلينيكي النفسي، ومراقبة جودة العمليات الصناعية.

أما الهدف الثالث، فيرتبط باختبار الفروض النظرية حول الآليات السببية المولدة للبيانات (Data-Generating Processes). عندما يثبت التحليل الإحصائي أن البيانات تتبع توزيع غاما بمعلمات محددة، فإن هذا يدعم الفرضيات التي تفترض أن الظاهرة المقاسة هي نتاج لسلسلة من الأحداث العشوائية المستقلة والمتطابقة التوزيع المترابطة زمنياً بآلية بواسونية (Poisson Process). وبالتالي، تسهم الملاءمة في سد الفجوة بين الوصف الإحصائي المجرد والتفسير النظري العميق للظاهرة محل الدراسة.

2. الخصائص الرياضية والمعلمات الأساسية لتوزيع غاما

2.1 دالة كثافة الاحتمال ودالة التوزيع التراكمي

تُعطى دالة كثافة الاحتمال (Probability Density Function – PDF) لمتغير عشوائي متصل $X$ يتبع توزيع غاما بالصيغة الرياضية التالية:

$$f(x; \alpha, \beta) = \frac{\beta^\alpha}{\Gamma(\alpha)} x^{\alpha – 1} e^{-\beta x}, \quad x > 0, ; \alpha > 0, ; \beta > 0$$

حيث تمثل $\alpha$ معلمة الشكل (Shape Parameter)، بينما تمثل $\beta$ معلمة المعدل (Rate Parameter). وتُعرَّف دالة غاما الرياضية القياسية $\Gamma(\alpha)$ بالتكامل غير المعتل التالي:

$$\Gamma(\alpha) = \int_0^\infty u^{\alpha – 1} e^{-u} , du$$

وفي حالة إذا كانت $\alpha$ عدداً صحيحاً موجباً، فإن الدالة تختزل إلى عاملي العدد السابق: $\Gamma(\alpha) = (\alpha – 1)!$.

أما دالة التوزيع التراكمي (Cumulative Distribution Function – CDF)، والتي تعبر عن الاحتمال التراكمي $F(x) = P(X le x)$، فتُحسب عبر تكامل دالة الكثافة من الصفر إلى $x$، وتأخذ الصيغة القائمة على دالة غاما غير المكتملة الأدنى (Lower Incomplete Gamma Function) $\gamma(\alpha, \beta x)$:

$$F(x; \alpha, \beta) = \frac{\gamma(\alpha, \beta x)}{\Gamma(\alpha)} = \frac{1}{\Gamma(\alpha)} \int_0^{\beta x} t^{\alpha – 1} e^{-t} , dt$$

تسمح هذه الخصائص الرياضية بالاشتقاق المباشر للعزوم الإحصائية لتوزيع غاما. يُحسب المتوسط الحسابي النظري (Mean) بالصيغة $\mu = \frac{\alpha}{\beta}$، بينما يُعطى التباين (Variance) بالصيغة $\sigma^2 = \frac{\alpha}{\beta^2}$، مما يعني أن الانحراف المعياري هو $\sigma = \frac{\sqrt{\alpha}}{\beta}$. ومن هذه العلاقات نلاحظ أن معامل الاختلاف (Coefficient of Variation) يساوي ثابتاً يعتمد فقط على الشكل: $CV = \frac{\sigma}{\mu} = \frac{1}{\sqrt{\alpha}}$.

2.2 معلمات التوزيع: الشكل، المعدل، والمقياس

يمكن صياغة توزيع غاما بطريقتين متكافئتين رياضياً ولكن تختلفان في المعلمة المستخدمة للتعبير عن الامتداد الأفقي للمنحنى. الصيغة الأولى تستخدم معلمة الشكل ($\alpha$ أو $k$) ومعلمة المعدل ($\beta$ أو $lambda$)، في حين تستخدم الصيغة البديلة معلمة الشكل ($\alpha$) ومعلمة المقياس (Scale Parameter) التي يُرمز لها بـ $\theta$، حيث ترتبط المعلمتان بعلاقة عكسية دقيقة: $\theta = \frac{1}{\beta}$. عند استخدام معلمة المقياس $\theta$، تُكتب دالة الكثافة الاحتمالية على النحو التالي:

$$f(x; \alpha, \theta) = \frac{1}{\Gamma(\alpha) \theta^\alpha} x^{\alpha – 1} e^{-\frac{x}{\theta}}$$

تتحكم معلمة الشكل $\alpha$ بصورة مباشرة في الخصائص الهندسية لمنحنى التوزيع، وتحدد درجتي الالتواء والتفرطح؛ إذ يُحسب معامل الالتواء (Skewness) بـ $\gamma_1 = \frac{2}{\sqrt{\alpha}}$، بينما يُحسب معامل التفرطح الإضافي (Excess Kurtosis) بـ $\gamma_2 = \frac{6}{\alpha}$. عندما تكون $\alpha 1$)، يكتسب المنحنى قمة محددة (Unimodal) تقع عند نقطة المنوال الرياضي $x_{mode} = \frac{\alpha – 1}{\beta} = (\alpha – 1)\theta$.

توضح دراسة السلوك الحدي للتوزيع أنه كلما ازدادت قيمة $\alpha$ لتصل إلى قيم كبيرة، يتناقص معامل الالتواء مقترباً من الصفر، ويتناقص معامل التفرطح الإضافي كذلك، مما يجعل توزيع غاما يتقارب تقاربياً، بحسب مبرهنة النهاية المركزية (Central Limit Theorem)، مع التوزيع الطبيعي ذي المتوسط $\mu = \alpha\theta$ والتباين $\sigma^2 = \alpha\theta^2$.

2.3 شروط وحدود تطبيق توزيع غاما على مجموعات البيانات

يفرض التطبيق السليم لتوزيع غاما مجموعة من الشروط المنهجية الصارمة التي يجب التحقق منها قبل الشروع في إجراءات النمذجة الإحصائية. الشرط الأساسي الذي لا يقبل الاستثناء هو شرط الإيجابية التامة؛ حيث يجب أن تكون جميع المشاهدات في مجموعة البيانات أكبر قطعياً من الصفر ($x_i > 0$). لا يمكن لدوال الكثافة وحسابات لوغاريتم الإمكان في توزيع غاما التعامل مع القيم السالبة أو القيم المساوية للصفر تماماً نظراً لوجود الحدود الرياضية $ln(x)$ و $x^{alpha-1}$ في صيغ التوزيع.

في الممارسات التطبيقية، قد تحتوي مجموعات البيانات على قيم صفرية ناتجة عن حدود دقة أدوات القياس أو تسجيل فترات زمنية منعدمة. يتطلب هذا الوضع تطبيق استراتيجيات معالجة منهجية؛ فإما أن يتم إضافة ثابت إزاحة متناهي الصغر (Small Constant Shift) لجميع المشاهدات لنقل البيانات إلى النطاق الموجب بالكامل، أو استخدام نماذج متقدمة مثل النماذج ذات الصفر المتضخم (Zero-Inflated Gamma Models) أو نماذج توديد (Tweedie Models) القادرة على استيعاب الكتلة الاحتمالية المنفصلة عند الصفر بالتوازي مع التوزيع المستمر للقيم الموجبة.

كذلك، يجب مراعاة حساسية تقدير معلمات غاما لوجود القيم المتطرفة الشاذة (Outliers) الناتجة عن أخطاء القياس أو الإدخال في الذيل الأيمن للبيانات. نظراً لاعتماد طرائق التقدير القياسية كالإمكان الأعظم على لوغاريتمات المشاهدات والعزوم الإحصائية، فإن وجود قيم متطرفة مفرطة الضخامة قد يؤدي إلى انحياز شديد في تقدير معلمة الشكل نحو الانخفاض وانحياز معلمة المقياس نحو الارتفاع، مما يشوه الهيكل الاحتمالي المستنتج للمجتمع الإحصائي.

3. إعداد بيئة العمل البرمجية في R وتثبيت الحزم اللازمة

3.1 تجهيز حزمة fitdistrplus الإحصائية

تُعد حزمة fitdistrplus البيئة البرمجية الأكثر شمولاً واعتماداً في مجتمع لغة R لملاءمة التوزيعات الاحتمالية المعلمية المتصلة والمنفصلة على البيانات الأحادية المتغير. توفر الحزمة واجهة موحدة تطبق أحدث الخوارزميات الرياضية في الاستمثال والتقدير الإحصائي والتشخيص البصري واختبارات جودة المطابقة، مما يغني الباحث عن كتابة دوال الإمكان الرياضية يدوياً ويقلل من احتمالات الخطأ البرمجي الحسابي.

لتثبيت الحزمة من المستودع الرسمي لشبكة الأرشيف الشامل للغة R (CRAN)، يتم تنفيذ الأمر البرمجي التالي داخل منصة R أو بيئة RStudio التطويرية:

# تثبيت حزمة fitdistrplus والحزم التابعة الأساسية
install.packages("fitdistrplus")
# استدعاء الحزمة للعمل في الجلسة الحالية
library(fitdistrplus)

تعتمد حزمة fitdistrplus بصورة تكاملية على حزم إحصائية مساعدة راسخة في لغة R، من أبرزها حزمة MASS التي تتضمن دالة fitdistr الكلاسيكية، وحزمة survival المستخدمة في التعامل مع البيانات المراقبة أو المبتورة (Censored Data). عند استدعاء fitdistrplus، يتم تحميل التبعيات الأساسية تلقائياً، مما يتيح الوصول المباشر إلى هياكل برمجية مخصصة للتعامل مع كائنات الملاءمة الإحصائية المتقدمة وإجراء المقارنات المتعددة بسلاسة تامة.

3.2 فهم البنية التركيبية العامة لدالة fitdist

تشكل دالة fitdist() المحرك التنفيذي المركزي في حزمة fitdistrplus. تتميز هذه الدالة بتصميم بنيوي مرن يقبل مجموعة واسعة من الوسائط (Arguments) التي تتيح للمحلل التحكم الكامل في كافة مفاصل عملية التقدير الإحصائي. تتحدد المعاملات الإلزامية الأساسية للدالة في تحديد متجه البيانات المتصلة ونوع التوزيع الاحتمالي المستهدف عبر الوسيط distr.

تأخذ الدالة البنية التركيبية النمطية التالية:

fitdist(data, distr, method = c("mle", "mme", "qme", "mge"), 
 start = NULL, optim.method = "Nelder-Mead", ...)

يمثل الوسيط data متجراً عددياً أحادي البعد يحتوي على المشاهدات الإمبريقية الخالية من القيم المفقودة وغير الموجبة. ويحدد الوسيط distr اسماً نصياً للتوزيع المعني وفقاً لتسميات R القياسية؛ حيث يُستخدم الحرف "gamma" للإشارة إلى توزيع غاما، وتستدعي الدالة ضمنياً الدوال الرياضية الأربع المرتبطة بالتوزيع في لغة R وهي: dgamma لحساب الكثافة، و pgamma للتوزيع التراكمي، و qgamma لدالة المئينات، و rgamma لتوليد الأرقام العشوائية.

كما يتيح الوسيط method تحديد خوارزمية التقدير المفضلة؛ حيث يتم اعتماد تقدير الإمكان الأعظم "mle" كخيار افتراضي قياسي، مع إمكانية التبديل إلى طريقة العزوم "mme"، أو مطابقة المئينات "qme"، أو تعظيم مسافة الملاءمة التراكمية "mge". كما يسمح الوسيط start بتمرير قائمة تحتوي على قيم ابتدائية تخمينية للمعلمات لتوجيه خوارزمية التحسين الرقمي optim عند مواجهة صعوبات في التقارب العددي.

3.3 ضبط خيارات الجلسة وتثبيت العشوائية لضمان تكرارية النتائج

يعد ضمان التكرارية العلمية (Reproducibility) أحد المبادئ الجوهرية في التحليل الإحصائي الحديث والبحث العلمي المحكم. عند إجراء عمليات المحاكاة الإحصائية أو تطبيق طرائق إعادة المعاينة مثل البوتستراب البارامتري لتقدير فترات الثقة، تنتج خوارزميات توليد الأرقام شبه العشوائية قيماً متغيرة في كل مرة يتم فيها تشغيل الكود البرمجي، مما قد يؤدي إلى تباين طفيف في النتائج بين جلسات العمل المختلفة.

لضمان الحصول على نتائج رقمية متطابقة قابلة للتحقق من قبل باحثين آخرين، يجب تثبيت البذرة العشوائية لمولد الأرقام في بداية بيئة العمل باستخدام الدالة set.seed(). إضافة إلى ذلك، يُستحسن ضبط خيارات عرض الأرقام العشرية وتنظيم بيئة العمل وتفريغ الذاكرة المؤقتة لمنع أي تداخل غير مرغوب فيه بين المتغيرات المحفوظة مسبقاً، وذلك عبر تنفيذ الأوامر التالية:

# تفريغ بيئة العمل من كافة الكائنات السابقة
rm(list = ls())
# تثبيت البذرة العشوائية لضمان تكرارية التحليلات والمحاكاة
set.seed(2026)
# ضبط خيارات العرض لطباعة الأرقام بدقة خمس خانات عشرية وتجنب الترقيم العلمي المفرط
options(digits = 5, scipen = 999)

يسهم هذا التنظيم المنهجي في توفير بيئة عمل مستقرة تضمن استقرار عمليات الاستمثال العددي وسهولة قراءة المخرجات الرقمية ومقارنتها عبر مراحل التحليل الإحصائي المختلفة.

4. توليد البيانات التجريبية واستيراد مجموعات البيانات في R

4.1 محاكاة بيانات تتبع توزيع غاما مع إضافة تشويش غاوسي

تعتبر محاكاة البيانات الخاضعة لرقابة بارامترية تامة أسلوباً تعليمياً ومنهجياً رفيع المستوى لاختبار كفاءة ودقة خوارزميات الملاءمة الإحصائية. عند توليد عينة اصطناعية بمعلمات معروفة سلفاً، يستطيع المحلل التحقق من مدى قدرة دوال التقدير على استرجاع المعلمات الحقيقية للأصل الاحتمالي وتقييم دقة فترات الثقة الناتجة.

سنقوم هنا بتوليد عينة محاكاة متصلة بحجم $n = 1500$ مشاهدة تتبع توزيع غاما بمعلمة شكل حقيقية $\alpha = 3.5$ ومعلمة معدل $\beta = 0.7$ (وهو ما يكافئ معلمة مقياس $\theta = 1/0.7 \approx 1.42857$). ولإضفاء طابع الواقعية التجريبية التي تشهدها القياسات المعملية، سنقوم بدمج تشويش عشوائي خفيف مستمد من توزيع اعتدالي، مع الحرص الصارم على بقاء جميع القيم المتولدة ضمن النطاق الموجب تماماً:

# تحديد المعلمات النظرية الحقيقية لعملية المحاكاة
true_shape <- 3.5
true_rate <- 0.7
sample_size <- 1500
# توليد البيانات الأساسية المستمدة من توزيع غاما
simulated_raw <- rgamma(n = sample_size, shape = true_shape, rate = true_rate)
# توليد تشويش تجريبي غاوسي بمتوسط صفري وانحراف معياري منخفض
experimental_noise <- rnorm(n = sample_size, mean = 0, sd = 0.15)
# دمج التشويش مع البيانات الأصلية مع ضمان الإيجابية التامة للمشاهدات
simulated_data <- simulated_raw + experimental_noise
simulated_data <- simulated_data[simulated_data > 0]
# معاينة المشاهدات الست الأولى من العينة المتولدة
head(simulated_data)

تتيح لنا هذه العينة المحاكاة تقييم سلوك دالة fitdist ومدى مرونة النموذج في استعادة المعلمات الأصلية ($\alpha = 3.5, \beta = 0.7$) بالرغم من وجود نسبة التشويش المضافة.

4.2 استيراد وتجهيز البيانات الواقعية من مصادر خارجية

في التطبيقات الإمبيريقية الحقيقية، يتم استيراد البيانات من ملفات قواعد بيانات خارجية تم جمعها أثناء التجارب المعملية أو الاستطلاعات الميدانية. تدعم بيئة R قراءة مختلف امتدادات الملفات بسهولة عبر الحزم الأساسية والمتخصصة، مثل دالة read.csv() لقراءة الملفات النصية المفصولة بفواصل، ودالة read_excel() من حزمة readxl لقراءة جداول ميكروسوفت إكسيل.

يتطلب استيراد البيانات وتجهيزها للملاءمة اتباع سلسلة من خطوات التدقيق الإحصائي لضمان صلاحية المتجه للتحليل عبر توزيع غاما:

# قراءة ملف بيانات خارجي بصيغة CSV (مثال افتراضي لمسار ملف)
# raw_dataset <- read.csv("reaction_times_data.csv")
# استخراج المتغير المستهدف والتأكد من تحويله إلى متجه عددي نقي
# target_variable <- as.numeric(raw_dataset$ResponseTime)
# فحص ومعالجة القيم المفقودة (NA / NaN) واستبعادها من المتجه
# clean_data <- na.omit(target_variable)
# التحقق الصارم من غياب القيم الصفرية والسالبة لضمان استيفاء شروط غاما
# valid_gamma_data <- clean_data[clean_data > 0]
# فحص عدد المشاهدات الصالحة المتبقية للتحليل
# length(valid_gamma_data)

تضمن هذه المرحلة التنظيفية خلو متجه البيانات من أية قيم نصية مشوهة أو قيم غير معرّفة قد تتسبب في إيقاف خوارزميات الاستمثال الرياضي فور استدعائها، مما يمهد الطريق لإجراء الفحوص الوصفية والاستكشافية بأعلى معايير الدقة المنهجية.

4.3 التحقق من الخصائص القياسية لعينة المحاكاة

قبل الشروع في تطبيق خوارزميات الملاءمة الرسمية، يجب إجراء استكشاف وصفي شامل لمقاييس النزعة المركزية والتشتت وشكل التوزيع لعينة البيانات المحاكاة، بهدف التأكد من مطابقتها المبدئية للسمات المتوقعة لنموذج غاما. يوفر حساب المتوسط والوسيط والتباين ومعاملات الالتواء والتفرطح رؤية أولية حول درجة عدم التماثل في العينة.

# حساب مقاييس النزعة المركزية والتشتت الأساسية
data_mean <- mean(simulated_data)
data_median <- median(simulated_data)
data_var <- var(simulated_data)
data_sd <- sd(simulated_data)
data_iqr <- IQR(simulated_data)
# حساب معاملي الالتواء والتفرطح الإمبيريقيين
# استدعاء دالة الالتواء والتفرطح من حزمة moments أو e1071
if(!require(moments)) install.packages("moments"); library(moments)
data_skewness <- skewness(simulated_data)
data_kurtosis <- kurtosis(simulated_data)
# طباعة مصفوفة المؤشرات الوصفية
cat("--- المؤشرات الإحصائية الوصفية للعينة ---n",
 "المتوسط الحسابي (Mean):", round(data_mean, 4), "n",
 "الوسيط (Median):", round(data_median, 4), "n",
 "التباين (Variance):", round(data_var, 4), "n",
 "الانحراف المعياري (SD):", round(data_sd, 4), "n",
 "معامل الالتواء (Skewness):", round(data_skewness, 4), "n",
 "معامل التفرطح (Kurtosis):", round(data_kurtosis, 4), "n")

تكشف المؤشرات الرقمية الناتجة عن سمات توزيع غاما النمطية؛ حيث نلاحظ أن المتوسط الحسابي يتجاوز الوسيط بشكل ملحوظ ($\text{Mean} > \text{Median}$)، وهي السمة الأساسية للتوزيعات الملتوية التواءً موجباً نحو اليمين. كما أن قيمة معامل الالتواء المحسوبة تتطابق إلى حد كبير مع القيمة النظرية المتوقعة للعينة وفق المعادلة $\gamma_1 = \frac{2}{\sqrt{3.5}} \approx 1.069$، مما يعزز الفرضية الإمبيريقية بملاءمة توزيع غاما لهذه البيانات.

5. الاستكشاف الأولي للبيانات والتحقق البصري من ملاءمتها لتوزيع غاما

5.1 رسم المخططات الإمبريقية باستخدام دالة plotdist

توفر حزمة fitdistrplus دالة استكشافية متقدمة تُعرف بـ plotdist() تتيح فحص التوزيع الإمبيريقي للمتغير العددي من خلال واجهة رسومية ثنائية متكاملة. تقوم هذه الدالة بتوليد رسمين متجاورين في آن واحد: الأول يمثل المدرج التكراري الإمبيريقي للبيانات (Empirical Histogram) مع منحنى تجريبي لكثافة النواة (Kernel Density Estimation)، بينما يمثل الثاني دالة التوزيع التراكمي الإمبيريقية (Empirical Cumulative Distribution Function – ECDF).

# توليد المخططات الاستكشافية الإمبيريقية لعينة البيانات
plotdist(simulated_data, histo = TRUE, demp = TRUE)

تساعد هذه المخططات الباحث في إجراء تقييم بصري نوعي مبدئي للشكل العام للبيانات. يوضح المدرج التكراري وجود قمة واضحة تتبعها انحدارات غير متماثلة مع امتداد أطول في الجانب الأيمن، مما ينفي تماماً فرضية التماثل الغاوسي. وفي الوقت نفسه، يظهر منحنى التوزيع التراكمي الإمبيريقي تصاعداً سريعاً في القيم الدنيا والمتوسطة قبل أن يتباطأ تقاربه مع الواحد الصحيح في القيم العليا، وهي الصورة الهندسية النمطية لدوال التوزيع التراكمي لعائلة غاما.

كما يمكن عبر فحص الصندوق الطرفي (Boxplot) المدمج في الخيارات الرسومية رصد أي تركز للمشاهدات الشاذة في أقصى الذيل الأيمن للتوزيع، مما يمنح المحلل فكرة مبكرة حول مدى استقرار عملية التقدير البارامترية وقدرة النموذج المختار على احتواء هذه القيم دون انحياز مفرط.

5.2 استخدام مخطط كولين وجري فري (Cullen and Frey graph)

يعد مخطط كولين وجري فري (Cullen and Frey graph)، الذي يتم تنفيذه في R عبر دالة descdist()، إحدى أقوى الأدوات الاستدلالية الاستكشافية لاختيار التوزيعات الاحتمالية المرشحة. يعتمد هذا المخطط على رسم الفضاء الإحصائي ثنائي الأبعاد المكون من مربع الالتواء ($\text{Skewness}^2$) على المحور الأفقي والتفرطح الإجمالي ($\text{Kurtosis}$) على المحور الرأسي المعكوس، حيث تُمثَّل التوزيعات الاحتمالية المختلفة بنقاط أو خطوط أو مساحات هندسية محددة وفقاً لخصائصها الرياضية الثابتة.

# تنفيذ مخطط كولين وجري فري مع تفعيل تقنية البوتستراب لتقييم عدم اليقين
descdist_results <- descdist(simulated_data, boot = 1000, discrete = FALSE)

في هذا المخطط، يُمثل التوزيع الطبيعي بنقطة وحيدة ثابتة عند $(\text{Skewness}^2 = 0, \text{Kurtosis} = 3)$، والتوزيع الأسي بنقطة أخرى محددة، بينما يُمثل توزيع غاما وتوزيع ويبل (Weibull) واللوغاريتمي الطبيعي (Lognormal) بخطوط ومساحات تعبر عن التغير المشترك لمعالم الشكل والمقياس. تقوم دالة descdist() برسم نقطة زرقاء تمثل موقع عينة البيانات الفعلية، مصحوبة بسحابة من النقاط الناتجة عن إعادة المعاينة بتقنية البوتستراب (Bootstrap samples) لتمثيل عدم اليقين الإحصائي الناجم عن حجم العينة.

5.3 الاستدلال الاستكشافي المبدئي لتحديد ملاءمة التوزيع

تسفر مخرجات دالة descdist() عن ملخص نصي إحصائي دقيق يتضمن قيم العزوم الإمبيريقية المحسوبة للعينة، متبوعاً بقائمة من التوزيعات الاحتمالية المقترحة نظرياً والتي تقع العينة ضمن نطاقها الهندسي. إذا أظهر المخطط والملخص الإحصائي أن النقطة الإمبيريقية وسحابة البوتستراب تتطابق بشكل وثيق مع الخط المخصص لتوزيع غاما، فإن ذلك يمثل دليلاً استكشافياً قوياً على أهلية هذا التوزيع للنمذجة.

يتيح هذا التحليل المقارن أيضاً استبعاد التوزيعات غير المتوافقة؛ فإذا كانت سحابة النقاط تبتعد جذرياً عن نقطة التوزيع الطبيعي وتتقاطع مع منحنيات غاما وويبل واللوغاريتمي الطبيعي، يستنتج الباحث أن التوزيعات غير المتماثلة ذات الالتواء الإيجابي هي الخيار العلمي السليم. تتيح هذه الرؤية الانتقال من مرحلة الاستكشاف الوصفي المبدئي إلى مرحلة النمذجة الرياضية الصارمة وتقدير المعلمات باستخدام خوارزميات الاستدلال المعلمي بثقة منهجية عالية.

6. ملاءمة توزيع غاما باستخدام دالة fitdist وتقدير الإمكان الأعظم (MLE)

6.1 تنفيذ كود الملاءمة بطريقة الإمكان الأعظم (Maximum Likelihood Estimation)

يعد تقدير الإمكان الأعظم (Maximum Likelihood Estimation – MLE) المعيار الرياضي الأكثر كفاءة وشيوعاً لتقدير معلمات التوزيعات الاحتمالية المستمرة. تقوم هذه الطريقة على فكرة تعظيم دالة لوغاريتم الإمكان (Log-Likelihood Function) بالنسبة لمعلمتي الشكل $\alpha$ والمعدل $\beta$، بحيث تكون المعلمات المقدرة هي القيم التي تجعل العينة المشاهدة ذات احتمالية الحدوث الأعلى تحت النموذج الرياضي المفترض.

تُعطى دالة لوغاريتم الإمكان لعينة مستقلة متطابقة التوزيع مكونة من $n$ مشاهدة تتبع توزيع غاما بالمعادلة الرياضية التالية:

$$\ln L(\alpha, \beta; \mathbf{x}) = n \alpha \ln(\beta) – n \ln(\Gamma(\alpha)) + (\alpha – 1) \sum_{i=1}^n \ln(x_i) – \beta \sum_{i=1}^n x_i$$

يتم تنفيذ الملاءمة بطريقة MLE في لغة R عبر استدعاء دالة fitdist() مع تحديد وسيط التوزيع كـ "gamma" ووسيط الطريقة كـ "mle"، كما يوضح الكود البرمجي التالي:

# إجراء ملاءمة توزيع غاما باستخدام خوارزمية تقدير الإمكان الأعظم
fit_gamma_mle <- fitdist(data = simulated_data, distr = "gamma", method = "mle")
# التحقق من فئة الكائن البرمجي الناتج
class(fit_gamma_mle)
# استعراض المخرجات الإحصائية المفصلة لكائن الملاءمة
summary(fit_gamma_mle)

ينتج عن هذا الإجراء إنشاء كائن إحصائي متكامل من الفئة fitdist يحتوي على التقديرات النقطية للمعلمات، ومصفوفة التباين والتباين المشترك المقاربة، ولوغاريتم دالة الإمكان، بالإضافة إلى معايير جودة التوفيق المعيارية.

6.2 قراءة وتفسير مخرجات دالة summary لكائن الملاءمة

توفر دالة summary() تحليلاً إحصائياً شاملاً لكائن الملاءمة fit_gamma_mle. تتضمن المخرجات الرئيسية تقديرات المعلمات النقطية (Parameter Estimates) مع أخطائها المعيارية المقابلة (Standard Errors)، ومصفوفة الارتباط بين المعلمات، ومؤشرات جودة المطابقة الإجمالية.

عند فحص المخرجات الناتجة من عينة المحاكاة، نجد تقديراً لمعلمة الشكل (Shape) ومعلمة المعدل (Rate) يقترب بصورة ملحوظة من المعلمات الحقيقية المستخدمة في التوليد ($\alpha = 3.5, \beta = 0.7$). يعكس صغر الخطأ المعياري المقترن بكل معلمة دقة التقدير النقطي وكفاية حجم العينة المستخدمة في استقرار خوارزمية التحسين العددي.

كما يعرض ملخص المخرجات القيم الرقمية لثلاثة معايير أساسية لتقييم النماذج:

  • لوغاريتم دالة الإمكان (Log Likelihood): يمثل القيمة العظمى لدالة الهدف التي تم التوصل إليها بواسطة الخوارزمية، حيث تشير القيم الأقل سلبية (الأعلى رياضياً) إلى ملاءمة أفضل.
  • معيار آكيكي للمعلومات (Akaike Information Criterion – AIC): يُحسب بالمعادلة $\text{AIC} = 2k – 2\ln(L)$ حيث $k$ يمثل عدد المعلمات المقدرة ($k=2$). يستخدم للمفاضلة بين النماذج مع فرض عقوبة على عدد المعلمات.
  • معيار بيز للمعلومات (Bayesian Information Criterion – BIC): يُحسب بالمعادلة $\text{BIC} = k\ln(n) – 2\ln(L)$، ويفرض عقوبة أشد تعتمد على لوغاريتم حجم العينة $n$.

إضافة إلى ذلك، توفر مصفوفة الارتباط التقديرية (Correlation Matrix) بين المعلمات تقييماً لدرجة الاعتماد المتبادل بين تقديري الشكل والمعدل، حيث تظهر عادة علاقة ارتباطية موجبة قوية بين المعلمتين، مما يشير إلى أن زيادة معلمة الشكل تترافق حسابياً مع زيادة في معلمة المعدل للحفاظ على استقرار موضع المنوال والتباين النسبي للمنحنى.

6.3 حساب فترات الثقة لمعلمات التوزيع المقدرة

لا يكتمل الاستدلال الإحصائي بالاعتماد على التقديرات النقطية وحدها؛ إذ يجب تقدير عدم اليقين المحيط بهذه المعلمات عبر حساب فترات الثقة (Confidence Intervals). تتيح بيئة R طريقتين منهجيتين لحساب فترات الثقة لمعلمات غاما المقدرة:

الطريقة الأولى: فترات الثقة المقاربة (Asymptotic Confidence Intervals)، وتعتمد على الفرضية المقاربة للملاءمة الغاوسية المشتقة من المعكوس لمصفوفة المعلومات الملاحظة لمصفوفة هيسيان (Hessian Matrix)، وتُنفذ باستخدام الدالة القياسية confint():

# حساب فترات الثقة المقاربة بمستوى ثقة 95%
confint(fit_gamma_mle, level = 0.95)

الطريقة الثانية: فترات الثقة عبر البوتستراب البارامتري (Parametric Bootstrap)، وتعد الخيار الأكثر دقة وموثوقية، لا سيما في العينات الصغيرة أو المتوسطة الحجم حيث قد لا تتحقق الفروض المقاربة لمصفوفة هيسيان بدقة. تُنفذ في حزمة fitdistrplus باستخدام دالة bootdist():

# تنفيذ البوتستراب البارامتري بإجراء 1001 تكرار إعادة معاينة
gamma_boot <- bootdist(fit_gamma_mle, niter = 1001)
# استعراض ملخص نتائج البوتستراب وفترات الثقة المئينية
summary(gamma_boot)
# رسم التوزيعات التجريبية لمعلمات البوتستراب
plot(gamma_boot)

توفر نتائج البوتستراب فترات ثقة مئينية (Percentile Bootstrap CI) وفترات ثقة مصححة تعكس بدقة التوزيع التجريبي الفعلي للمعلمات المقدرة وتوضح مدى استقرار التقديرات الإحصائية في مواجهة التباين العشوائي للعينة.

7. مقارنة طرق التقدير الإحصائي: MLE و MME و QME و MGE

7.1 طريقة العزوم وطريقة العزوم التوافقية (MME و MGE)

على الرغم من السيادة المنهجية لطريقة الإمكان الأعظم (MLE)، توفر الإحصاءات الاستدلالية طرائق تقدير بديلة تتميز بخصائص رياضية واستقرار حسابي متباين في ظل ظروف تجريبية معينة. تُعد طريقة العزوم (Method of Moments Estimation – MME) من أقدم الطرائق وأبسطها مفاهيمياً؛ حيث تقوم على مساواة العزوم النظرية لتوزيع غاما بالعزوم الإمبيريقية المحسوبة من العينة مباشرة.

يتم حل نظام المعادلات التالي لاستخراج تقديرات العزوم لمعلمتي الشكل والمعدل:

$$\hat{\alpha}_{MME} = \frac{\bar{x}^2}{s^2}, \quad \hat{\beta}_{MME} = \frac{\bar{x}}{s^2}$$

حيث تمثل $\bar{x}$ المتوسط الحسابي للعينة، و $s^2$ تباين العينة غير المنحاز. يتم تنفيذ طريقة العزوم في R عبر تمرير الوسيط method = "mme":

# ملاءمة توزيع غاما باستخدام طريقة العزوم (MME)
fit_gamma_mme <- fitdist(simulated_data, "gamma", method = "mme")
summary(fit_gamma_mme)

أما طريقة تقدير المسافة المعممة أو تعظيم حسن المطابقة (Maximum Goodness-of-fit Estimation – MGE)، فتهدف إلى تعظيم المسافة الرياضية بين دالة التوزيع التراكمي الإمبيريقية ودالة التوزيع التراكمي النظرية. يمكن تطبيق خوارزميات MGE بالاعتماد على مقاييس مسافة مختلفة مثل مسافة كولموغوروف-سميرنوف (KS) أو مسافة كرامر-فون ميسيس (CvM) أو مسافة أندرسون-دارلنغ (AD):

# ملاءمة توزيع غاما بتعظيم مسافة أندرسون-دارلنغ (MGE)
fit_gamma_mge <- fitdist(simulated_data, "gamma", method = "mge", gof = "AD")
summary(fit_gamma_mge)

تتميز طريقة MME بسرعة حسابية فورية لأنها لا تتطلب خوارزميات استمثال عددي تكرارية، ولكنها تتسم بكفاءة إحصائية أقل من MLE وتتأثر بشدة بالقيم الشاذة. في المقابل، توفر طريقة MGE الموجهة بمسافة أندرسون-دارلنغ تركيزاً استثنائياً على ملاءمة ذيول التوزيع بدقة تفوق أحياناً طريقة MLE عندما يكون الهدف محصوراً في ضبط أطراف التوزيع.

7.2 طريقة مطابقة المئينات (Quantile Matching Estimation – QME)

تُعد طريقة مطابقة المئينات (Quantile Matching Estimation – QME) استراتيجية تقديرية متقدمة تُستخدم عندما يكون لدى الباحث اهتمام تحليلي بمناطق محددة من التوزيع الاحتمالي، مثل المئينات الوسطى أو المئينات الحدية العليا. تقوم الطريقة على ضبط معلمات التوزيع الرياضية بحيث تتطابق المئينات النظرية المحسوبة من الدالة العكسية للتوزيع التراكمي $F^{-1}(p; \alpha, \beta)$ تماماً مع المئينات الإمبيريقية المناظرة للعينة عند مستويات احتمالية محددة مسبقاً $p_1, p_2$.

نظراً لأن توزيع غاما يحتوي على معلمتين ($\alpha, \beta$)، يتطلب تطبيق QME اختيار مئينين مستقلين، مثل المئين الخامس والعشرين والمئين الخامس والسبعين (المدى الربيعي)، أو المئين العاشر والمئين التسعين لتغطية نطاق أوسع من التشتت:

# ملاءمة توزيع غاما باستخدام مطابقة المئينات عند المستويين (0.25 و 0.75)
fit_gamma_qme <- fitdist(simulated_data, "gamma", method = "qme", probs = c(0.25, 0.75))
summary(fit_gamma_qme)

تكتسب طريقة QME ميزة تنافسية كبرى عند وجود تشوهات أو قيود قياس في مناطق معينة من البيانات؛ إذ يستطيع المحلل استبعاد تأثير أطراف التوزيع غير الموثوقة واختيار مئينات تنتمي إلى النطاق المركزي الأكثر استقراراً، مما يمنح النموذج مناعة ومقاومة عالية (Robustness) ضد الانحرافات الناتجة عن أخطاء جمع البيانات في الأطراف.

7.3 مفاضلة منهجية وشاملة بين طرق التقدير الأربع

تتطلب الممارسة المنهجية الرصينة إجراء مقارنة موضوعية بين طرائق التقدير الأربع (MLE, MME, QME, MGE) للوقوف على التباينات في المعلمات المقدرة والكفاءة الإحصائية واستهلاك الموارد الحسابية. يمكن تلخيص ومقارنة مخرجات النماذج الأربعة برمجياً من خلال تجميع كائنات الملاءمة في مصفوفة موحدة:

# تجميع التقديرات النقطية للمعلمات من كافة الطرق المقدرة
comparison_matrix <- data.frame(
 Method = c("Maximum Likelihood (MLE)", "Moment Matching (MME)", 
 "Quantile Matching (QME)", "Max Goodness-of-Fit (MGE-AD)"),
 Shape = c(fit_gamma_mle$estimate["shape"], fit_\gamma_mme$estimate["shape"], 
 fit_gamma_qme$estimate["shape"], fit_\gamma_mge$estimate["shape"]),
 Rate = c(fit_gamma_mle$estimate["rate"], fit_\gamma_mme$estimate["rate"], 
 fit_gamma_qme$estimate["rate"], fit_\gamma_mge$estimate["rate"]),
 LogLik = c(fit_gamma_mle$loglik, fit_\gamma_mme$loglik, 
 fit_gamma_qme$loglik, fit_\gamma_mge$loglik),
 AIC = c(fit_gamma_mle$aic, fit_\gamma_mme$aic, 
 fit_gamma_qme$aic, fit_\gamma_mge$aic)
)
print(comparison_matrix)

تُظهر المقارنة التحليلية أن طريقة MLE تحقق أعلى قيمة للوغاريتم الإمكان وأدنى قيمة لمعيار AIC، مما يؤكد أفضليتها النظرية كأكثر المقدرات كفاءة مقاربة وذات أدنى تباين مقارب ممكن (Asymptotic Efficiency) وفقاً لحدود كرامر-راو (Cramér-Rao Lower Bound). وتأتي طريقة MME كبديل سريع ومقبول في العينات الضخمة المتجانسة، بينما تتفوق QME في سيناريوهات التلوث الطرفي، وتبرز MGE كأداة متخصصة لتعظيم جودة المطابقة التراكمية العامة وتجاوز مشكلات عدم التوافق الموضعي في المنحنى.

8. تقييم جودة المطابقة والتشخيص البصري للنموذج المقدر

8.1 المخططات التشخيصية الرباعية الكلاسيكية

يمثل التشخيص البصري خطوة إلزامية في التحقق من صحة النموذج الإحصائي؛ إذ إن الاعتماد الحصري على المؤشرات الرقمية قد يخفي انحرافات نسقية موضعية في مناطق معينة من التوزيع. توفر حزمة fitdistrplus وظيفة رسومية متكاملة تتيح توليد المخططات التشخيصية الرباعية الكلاسيكية دفعة واحدة بمجرد تمرير كائن الملاءمة إلى الدالة العامة plot().

# توليد لوحة المخططات التشخيصية الرباعية لموديل غاما المقدر
plot(fit_gamma_mle)

تتضمن هذه اللوحة أربعة مخططات متكاملة تغطي كافة جوانب التوافق بين النموذج النظري والبيانات الإمبيريقية:

  1. مخطط الكثافة الإمبيريقية والنظرية (Empirical and Theoretical Densities): يعرض المدرج التكراري للبيانات متراكباً مع منحنى الكثافة الاحتمالية المحسوب من نموذج غاما المقدر، مما يتيح تقييم توافق القمة والانحدار العام.
  2. مخطط التوزيع التراكمي الإمبيريقي والنظري (Empirical and Theoretical CDFs): يقارن بين درجات التراكم الفعلي للبيانات ومنحنى الدالة التراكمية $F(x)$ للنموذج عبر المدى الكامل للمتغير.
  3. مخطط الكوانتايل-كوانتايل (Q-Q Plot): يرسم المئينات الإمبيريقية في مواجهة المئينات النظرية المقابلة لتقييم دقة ملاءمة الأطراف والتيول.
  4. مخطط الاحتمال-احتمال (P-P Plot): يرسم الاحتمالات التراكمية الإمبيريقية مقابل الاحتمالات التراكمية النظرية لتقييم دقة التوافق في النطاق المركزي للتوزيع.

يشير التراصف المحكم للنقاط والمنحنيات في هذه الأشكال الأربعة إلى جودة مطابقة استثنائية وخلو النموذج من مظاهر التحيز الهيكلي عبر مختلف مناطق نطاق القياس.

8.2 تحليل مخططات المئينات والمطابقة الاحتمالية (Q-Q Plot و P-P Plot)

يقدم التحليل المتعمق لمخططي Q-Q و P-P رؤى تشخيصية تفصيلية ودقيقة لسلوك النموذج الرياضي عند تمثيل مناطق مختلفة من مجموعة المشاهدات. يركز مخطط الكوانتايل-كوانتايل (Q-Q Plot) بصورة أساسية على دقة تمثيل الذيل الأيمن والأيسر؛ حيث تتوافق المحاور مع وحدات القياس الأصلية للبيانات ($x$). إذا كانت نقاط المخطط تتوزع باستقامة مثالية على طول الخط المرجعي القطري ذي الزاوية 45 درجة ($y = x$)، فإن ذلك يبرهن على أن توزيع غاما ينجح في تقدير المئينات المتطرفة دون إفراط أو تفريط.

في المقابل، يعمل مخطط الاحتمال-احتمال (P-P Plot) في فضاء الاحتمالات المعياري المحصور في الفترة $[0, 1]$. نظراً لكون الاحتمالات التراكمية تتغير بسرعة أكبر في المناطق ذات الكثافة الاحتمالية المرتفعة (حول المنوال والوسيط)، فإن مخطط P-P يمتلك حساسية فائقة لكشف أي انحرافات أو سوء تخصيص في مركز التوزيع أو قمة المنحنى الاحتمالي.

إذا أظهر مخطط Q-Q انحناءً تصاعدياً حاداً عند الطرف الأيمن مبتعداً عن الخط المرجعي، فإن هذا يدل على أن ذيل البيانات الحقيقية أثقل (Heavier Tail) من قدرة توزيع غاما على الاستيعاب، مما يوجه الباحث للنظر في توزيعات ذات ذيول أثقل مثل توزيع باريتو أو اللوغاريتمي الطبيعي. أما إذا تطابقت النقاط مع الخط القطري عبر كافة المستويات، فيُعد ذلك دليلاً قاطعاً على كفاية النموذج ومصداقيته.

8.3 التخصيص البصري المتقدم للرسومات البيانية عبر دالات Denscomp و Cdfcomp

لأغراض النشر الأكاديمي والتقارير العلمية المحكمة وفق معايير جمعية علم النفس الأمريكية (APA)، تتطلب المخططات التشخيصية مستوى متقدماً من التخصيص البصري من حيث الألوان وسماكة الخطوط ودقة العناوين والمحاور. توفر حزمة fitdistrplus دوالاً مستقلة لكل مخطط تتيح التحكم البرمجي الشامل في كافة العناصر الجمالية:

# تخصيص مخطط مقارنة الكثافة الاحتمالية بجودة نشر احترافية
denscomp(ft = fit_gamma_mle, 
 main = "مقارنة دالة الكثافة الاحتمالية الإمبيريقية والنظرية لتوزيع غاما",
 xlab = "زمن الاستجابة (بالثواني)", 
 ylab = "الكثافة الاحتمالية",
 col = "steelblue", 
 fitcol = "darkred", 
 fitlwd = 2.5,
 legendtext = c("البيانات الإمبيريقية", "نموذج غاما المقدر (MLE)"))
# تخصيص مخطط مقارنة التوزيع التراكمي (CDF)
cdfcomp(ft = fit_gamma_mle, 
 main = "مقارنة دالة التوزيع التراكمي الإمبيريقية والنظرية",
 xlab = "زمن الاستجابة (بالثواني)", 
 ylab = "الاحتمال التراكمي F(x)",
 col = "black", 
 fitcol = "darkgreen", 
 fitlwd = 2,
 legendtext = c("التراكم الإمبيريقي", "تراكم غاما النظري"))
# تخصيص مخطط Q-Q ومخطط P-P
qqcomp(ft = fit_gamma_mle, main = "مخطط Q-Q لتشخيص ملاءمة الذيول", fitcol = "red", fitlwd = 2)
ppcomp(ft = fit_gamma_mle, main = "مخطط P-P لتشخيص ملاءمة المركز والاحتمالات", fitcol = "blue", fitlwd = 2)

تسمح هذه المرونة التخصيصية بإنتاج مخرجات رسومية عالية الدقة والوضوح تلبي المتطلبات الصارمة للمجلات العلمية العالمية الرائدة، وتيسر إيصال النتائج الإحصائية المعقدة إلى جمهور الباحثين والقراء بسلاسة ووضوح.

9. الاختبارات الإحصائية الرسمية لجودة المطابقة (Goodness-of-Fit Tests)

9.1 تطبيق دالة gofstat لاستخراج الإحصاءات المعيارية

بجانب الفحص البصري، يتطلب التوثيق الإحصائي الصارم إجراء اختبارات فرضية رسمية لتقييم جودة حسن المطابقة (Goodness-of-Fit Tests). توفر حزمة fitdistrplus دالة مركزية فائقة القوة تُدعى gofstat()، تقوم بحساب كافة المؤشرات والاختبارات الإحصائية غير المعلمية والمعلمية لكائن الملاءمة دفعة واحدة وتقديمها في تقرير إحصائي متكامل.

# استدعاء دالة gofstat لحساب إحصاءات حسن المطابقة الرسمية
gof_results <- gofstat(fit_gamma_mle)
# استعراض التقرير الإحصائي الكامل
print(gof_results)

يقوم الاختبار باختبار الفرضية الصفرية ($H_0$) التي تنص على أن عينة البيانات المسحوبة تتبع المجتمع الإحصائي المعرف بتوزيع غاما المقدر، في مواجهة الفرضية البديلة ($H_1$) التي تنص على عدم مطابقة البيانات لهذا التوزيع. تتضمن المخرجات الأساسية ثلاثة اختبارات كلاسيكية مستمرة قائمة على المسافات التراكمية:

  • إحصاء كولموغوروف-سميرنوف (Kolmogorov-Smirnov – KS): يقيس المسافة الرأسية القصوى المطلقة بين دالة التوزيع التراكمي الإمبيريقية $F_n(x)$ ودالة التوزيع التراكمي النظرية $F(x)$؛ وتدل القيمة المنخفضة للإحصاء والقيمة الاحتمالية غير الدالة إحصائياً ($p > 0.05$) على قبول الفرضية الصفرية وجودة المطابقة.
  • إحصاء كرامر-فون ميسيس (Cramer-von Mises – CvM): يعتمد على حساب مجموع مربعات الفروق التراكمية الموزونة على كامل مدى المتغير، مما يمنحه حساسية شمولية للتطابق الكلي للمنحنى التراكمي تفوق اختبار KS الذي يعتمد على نقطة تباعد قصوى واحدة.

9.2 اختبار أندرسون-دارلنغ وتفضيله لتقييم الذيول

يُعد اختبار أندرسون-دارلنغ (Anderson-Darling – AD) الاختبار الإحصائي الأكثر تفضيلاً ودقة في تقييم جودة ملاءمة التوزيعات المستمرة غير المتماثلة كتوزيع غاما. يختلف إحصاء AD عن إحصاءي KS و CvM في كونه يطبق دالة ترجيح وتوزين رياضي تمنح أطراف التوزيع (الذيلين الأيمن والأيسر) وزناً نسبياً أكبر بكثير مقارنة بمركز التوزيع.

تُعطى معادلة إحصاء أندرسون-دارلنغ بالصيغة التكاملية الموزونة التالية:

$$A^2 = n \int_{-\infty}^\infty \frac{[F_n(x) – F(x)]^2}{F(x)[1 – F(x)]} , dF(x)$$

يعمل المقام الرياضي $F(x)[1 – F(x)]$ على تضخيم الفروق التراكمية الملاحظة عندما تقترب $F(x)$ من الصفر (الطرف الأيسر) أو تقترب من الواحد الصحيح (الطرف الأيمن)، وهي المناطق التي يفقد فيها اختبار كولموغوروف-سميرنوف حساسيته الإحصائية تماماً.

لذلك، عندما يظهر تقرير gofstat انخفاضاً دالاً في قيمة إحصاء أندرسون-دارلنغ، فإن هذا يمنح الباحث أعلى درجات اليقين العلمي بأن ذيول نموذج غاما المقدر تتطابق بأمانة فائقة مع السلوك الحدي للبيانات الإمبيريقية، مما يمنع الأخطاء الشائعة في تقدير احتمالات الأحداث النادرة والمتطرفة في التحليلات اللاحقة.

9.3 اختبار كاي تربيع لحسن المطابقة للبيانات المجمعة

بالإضافة إلى الاختبارات المستمرة القائمة على الدوال التراكمية، تحسب دالة gofstat اختبار كاي تربيع لحسن المطابقة (Chi-squared Goodness-of-Fit Test). يعتمد هذا الاختبار على تقسيم المدى المتصل للبيانات إلى عدد من الفئات أو الخلايا الترددية المنفصلة ($k$)، ثم مقارنة التكرارات الإمبيريقية الملاحظة فعلياً في كل فئة ($O_i$) مع التكرارات المتوقعة نظرياً تحت نموذج غاما المقدر ($E_i$).

يُحسب إحصاء كاي تربيع عبر الصيغة الرياضية الكلاسيكية:

$$\chi^2 = \sum_{i=1}^k \frac{(O_i – E_i)^2}{E_i}$$

بدرجات حرية تساوي $df = k – 1 – m$، حيث تمثل $m$ عدد المعلمات المقدرة من العينة ($m = 2$ في توزيع غاما).

توفر مخرجات دالة gofstat فحصاً لجداول التكرارات الملاحظة والمتوقعة، مع إمكانية تعديل حدود الفئات عبر الوسيط chisqbreaks. يجب على المحلل التأكد من استيفاء الشروط البنيوية للاختبار، وتحديداً ألا يقل التكرار المتوقع في أي خلية عن 5 مشاهدات ($E_i ge 5$) لضمان سلامة التقارب التقريبي لتوزيع كاي تربيع وتجنب الحصول على قيم احتمالية مضللة تؤدي إلى قرارات إحصائية خاطئة.

10. مقارنة توزيع غاما بتوزيعات احتمالية بديلة متصلة

10.1 ملاءمة توزيعات بديلة: ويبل، اللوغاريتمي الطبيعي، والتوزيع الأسي

في المنهجية الإحصائية الحديثة، لا يُنصح بالاكتفاء بملاءمة توزيع احتمالي وحيد والاعتماد عليه دون مقارنته بمنافسيه الطبيعيين في النمذجة. عند التعامل مع بيانات متصلة وموجبة وملتوية نحو اليمين، تتنافس عدة توزيعات احتمالية كبرى لتمثيل الظاهرة، وأبرزها: توزيع ويبل (Weibull Distribution)، والتوزيع اللوغاريتمي الطبيعي (Lognormal Distribution)، والتوزيع الأسي (Exponential Distribution).

تتيح حزمة fitdistrplus ملاءمة هذه التوزيعات المتعددة على نفس مجموعة البيانات بسهولة بالغة، ثم تخزين كائنات الملاءمة الناتجة في قائمة برمجية موحدة لإجراء المقارنات التنافسية:

# ملاءمة التوزيعات الاحتمالية الأربعة المرشحة باستخدام طريقة MLE
fit_gamma <- fitdist(simulated_data, "gamma", method = "mle")
fit_weibull <- fitdist(simulated_data, "weibull", method = "mle")
fit_lnorm <- fitdist(simulated_data, "lnorm", method = "mle")
fit_exp <- fitdist(simulated_data, "exp", method = "mle")
# تجميع النماذج في قائمة برمجية لتسهيل استدعائها في دوال المقارنة
fitted_models <- list(Gamma = fit_gamma, 
 Weibull = fit_weibull, 
 Lognormal = fit_lnorm, 
 Exponential = fit_exp)

تضمن هذه المقارنة المتزامنة تطبيق نفس معايير التحسين العددي وشروط الاستمثال على كافة التوزيعات، مما يضع الأساس لمفاضلة إحصائية وبصرية عادلة وغير منحازة بين النماذج الرياضية المختلفة.

10.2 المقارنة البصرية المتعددة باستخدام مخططات التراكب

بمجرد تجميع النماذج المقدرة في قائمة موحدة، توفر حزمة fitdistrplus دعماً رسومياً استثنائياً يتيح تمرير قائمة النماذج مباشرة إلى دوال التشخيص البصري (denscomp, cdfcomp, qqcomp, ppcomp) لرسم كافة المنحنيات النظرية المتنافسة متراكبة فوق البيانات الإمبيريقية في نافذة واحدة.

# تحديد لوحة الألوان المخصصة للنماذج الأربعة
model_colors <- c("firebrick", "dodgerblue3", "forestgreen", "darkorchid")
# رسم مقارنة الكثافة الاحتمالية المتعددة
denscomp(fitted_models, 
 main = "مقارنة دالات الكثافة الاحتمالية للنماذج المتنافسة",
 legendtext = c("غاما", "ويبل", "اللوغاريتمي الطبيعي", "الأسي"),
 fitcol = model_colors, fitlwd = 2)
# رسم مقارنة التوزيع التراكمي (CDF) المتعددة
cdfcomp(fitted_models, 
 main = "مقارنة دوال التوزيع التراكمي للنماذج المتنافسة",
 legendtext = c("غاما", "ويبل", "اللوغاريتمي الطبيعي", "الأسي"),
 fitcol = model_colors, fitlwd = 2)
# رسم مقارنة مخططات Q-Q للذيول المتعددة
qqcomp(fitted_models, 
 main = "مقارنة مخططات Q-Q لتشخيص الذيول بين النماذج",
 legendtext = c("غاما", "ويبل", "اللوغاريتمي الطبيعي", "الأسي"),
 fitcol = model_colors)

تسمح هذه المخططات التراكبية بالرصد المباشر للتوزيع الأكثر قدرة على مطابقة ذروة الكثافة وسرعة الانحدار نحو الذيل؛ حيث يظهر التوزيع الأسي عادة عجزاً واضحاً عن تمثيل الذروة إذا كانت $\alpha > 1$، بينما يتنافس غاما وويبل واللوغاريتمي الطبيعي في تمثيل الوسط، وتكشف مخططات Q-Q تفوق نموذج غاما في تطابق ذيله مع الذيل الفعلي لعينة البيانات المحاكاة.

10.3 المفاضلة المعيارية باستخدام معايير AIC و BIC ولوغاريتم الإمكان

لإصدار حكم قطعي حول النموذج الأفضل، يتم استدعاء دالة gofstat() وتمرير قائمة النماذج الأربعة إليها لاستخراج جدول المقارنة المعياري الذي يتضمن قيم لوغاريتم الإمكان، ومعايير المعلومات (AIC, BIC)، والإحصاءات غير المعلمية (KS, CvM, AD):

# استخراج تقرير المقارنة الشامل بين النماذج الأربعة
models_gof_comparison <- gofstat(fitted_models)
# طباعة جدول معايير المعلومات والمفاضلة الإحصائية
print(models_gof_comparison)

يتم تطبيق مبدأ التفضيل النموذجي بناءً على القواعد الإحصائية الراسخة التالية:

النموذج الاحتمالي لوغاريتم الإمكان (Log-Lik) معيار آكيكي (AIC) معيار بيز (BIC) إحصاء كولموغوروف (KS) إحصاء أندرسون-دارلنغ (AD)
توزيع غاما (Gamma) الأعلى رياضياً الأدنى قيمة (الأفضل) الأدنى قيمة (الأفضل) الأدنى قيمة الأدنى قيمة (الأفضل)
توزيع ويبل (Weibull) مرتفع أعلى من غاما أعلى من غاما منخفض أعلى من غاما
اللوغاريتمي الطبيعي (Lognormal) متوسط أعلى من غاما أعلى من غاما متوسط مرتفع في الأطراف
التوزيع الأسي (Exponential) الأقل رياضياً الأسوأ بمستويات عليا الأسوأ بمستويات عليا الأسوأ الأسوأ

تؤكد هذه النتائج أن توزيع غاما يحقق التوازن الأمثل بين مطابقة البيانات وتجنب الإفراط في التعقيد البارامتري، مما يجعله النموذج المختار علمياً لتمثيل العملية التوليدية للبيانات دون منازع.

11. تطبيقات عملية متقدمة في القياس النفسي وتحليل البيانات السلوكية

11.1 نمذجة أزمنة الرجع والاستجابة في التجارب النفسية المعرفية

في أبحاث علم النفس المعرفي والقياس النفسي، يكتسب تقدير معلمات توزيع غاما دلالة سيكولوجية عميقة تتجاوز مجرد الوصف الرياضي. عند نمذجة أزمنة الرجع (Reaction Times) في مهام الانتباه والاسترجاع من الذاكرة والتعرف البصري، تمثل معلمة الشكل ($\alpha$) مؤشراً نظرياً على عدد مراحل المعالجة المعرفية المتتابعة (Sequential Information Processing Stages) التي ينفذها النظام العصبي للوصول إلى الاستجابة السلوكية.

من ناحية أخرى، تُفسر معلمة المعدل ($\beta$) كمؤشر لسرعة معالجة المعلومات أو معدل نقل الإشارات العصبية لكل مرحلة من تلك المراحل المعرفية. بالتبعية، فإن متوسط زمن الاستجابة هو حصيلة قسمة عدد المراحل على سرعة المعالجة ($\mu = alpha/\beta$).

تتيح هذه النمذجة للباحثين النفسيين مقارنة مجموعات إكلينيكية وتجريبية مختلفة بطريقة متقدمة؛ فعلى سبيل المثال، يمكن اختبار ما إذا كان التباطؤ الملاحظ في أزمنة استجابة كبار السن أو مرضى التدهور المعرفي يعود إلى زيادة في عدد مراحل الفحص والتدقيق المعرفي (ارتفاع قيمة $\alpha$)، أم يعود إلى انخفاض عام في سرعة التوصيل العصبي ومعالجة المدخلات الحسية (انخفاض قيمة $\beta$).

11.2 تقدير درجات السمات النفسية وفترات استمرار السلوك

يمتد تطبيق توزيع غاما ليشمل القياس النفسي المتقدم لفترات استمرار النوبات السلوكية ومقاييس التفاعل الاجتماعي في بيئات الملاحظة المباشرة، مثل قياس مدة نوبات البكاء أو فترات نوبات الغضب لدى الأطفال، أو قياس زمن المحافظة على التواصل البصري في دراسات اضطراب طيف التوحد. تتميز هذه المتغيرات بطبيعتها المستمرة وامتلاكها حداً أدنى صفرياً والتواءً موجباً حاداً يعكس ندرة النوبات الطويلة جداً مقارنة بالنوبات القصيرة والمتوسطة.

من خلال ملاءمة توزيع غاما لهذه القياسات، يستطيع الباحثون استخراج الرتب المئينية الفردية الدقيقة (Standardized Percentile Scores) لكل مفحوص بناءً على التوزيع الاحتمالي المستمر الملاءم بدلاً من الاعتماد على التحويلات المعيارية الكلاسيكية القائمة على التوزيع الطبيعي ($Z\text{-scores}$) التي تؤدي إلى تشويه رتب الأفراد في الذيول الملتوية.

تسهم هذه المنهجية في بناء اختبارات ومقاييس نفسية معيارية ذات حساسية تشخيصية فائقة، تضمن تقييماً عادلاً ودقيقاً للأفراد في الفئات الحدية والمتطرفة دون الوقوع في شراك التحيز القياسي الناجم عن انتهاك افتراض الاعتدالية.

11.3 دمج ملاءمة غاما ضمن النماذج الخطية المعممة (GLM)

يمثل الانتقال من الملاءمة الأحادية للمتغير إلى بناء نماذج انحدارية تفسيرية وتنبؤية قمة التطبيقات الإحصائية المتقدمة. تتيح النماذج الخطية المعممة (Generalized Linear Models – GLM) في بيئة R نمذجة المتغير التابع المستمر الموجب والملتوي بافتراض انتمائه لعائلة غاما الاحتمالية، مع ربط متوسطه بالمتغيرات المستقلة والتجريبية عبر دالة ربط لوغاريتمية (Log Link Function):

# توليد متغير تجريبي افتراضي يمثل مجموعات التجربة (ضابطة مقابل تجريبية)
group <- factor(rep(c("Control", "Treatment"), each = sample_size / 2))
# بناء نموذج خطي معمم بانحدار غاما ودالة ربط لوغاريتمية
gamma_glm_model <- glm(simulated_data ~ group, family = Gamma(link = "log"))
# استعراض ملخص النموذج الخطي المعمم واختبار دلالة المعاملات
summary(gamma_glm_model)

تضمن دالة الربط اللوغاريتمية ($\ln(\mu_i) = \mathbf{x}_i^T boldsymbol{\beta}$) بقاء القيم المتنبأ بها لمتوسط الاستجابة موجبة دائماً في النطاق الطبيعي للظاهرة السلوكية، وتفترض دالة التباين لتوزيع غاما ($V(\mu) = \mu^2$) أن التباين يتزايد تربيعياً مع تزايد المتوسط، وهو ما يتطابق بدقة متناهية مع الواقع الإمبيريقي لأغلب البيانات السلوكية والاقتصادية والبيولوجية.

12. استكشاف الأخطاء الشائعة والتحديات البرمجية وأفضل الممارسات

12.1 معالجة أخطاء عدم التقارب العددي والقيم الابتدائية غير المناسبة

أثناء ملاءمة توزيع غاما باستخدام خوارزمية MLE، قد يواجه المحلل رسائل خطأ أو تحذيرات ناتجة عن فشل دالة الاستمثال العددي optim في تحقيق التقارب المطلوب (Convergence Failure)، مثل رسالة "the function cannot be evaluated at initial parameters" أو "optimization algorithm did not converge". تنشأ هذه المشكلات عادة عندما تكون البيانات شديدة التشتت أو تحتوي على قيم متطرفة مفرطة تجعل نقطة البداية الافتراضية تقع في منطقة ذات انحدارات رياضية غير معرّفة.

للتغلب على هذا التحدي، يمكن تطبيق استراتيجيتين منهجيتين في كود R:

أولاً: تمرير قيم ابتدائية مخصصة (Custom Starting Values) يتم حسابها مسبقاً بطريقة العزوم لضمان قربها من الحل الأمثل، عبر الوسيط start:

# حساب قيم ابتدائية تقريبية باستخدام طريقة العزوم
m_init <- mean(simulated_data)
v_init <- var(simulated_data)
shape_init <- m_init^2 / v_init
rate_init <- m_init / v_init
# إعادة تشغيل الملاءمة مع تمرير القيم الابتدائية المحسوبة
fit_gamma_custom_start <- fitdist(simulated_data, "gamma", method = "mle",
 start = list(shape = shape_init, rate = rate_init))

ثانياً: تغيير خوارزمية الاستمثال الرياضي من الخوارزمية الافتراضية (Nelder-Mead) إلى خوارزميات التدرج شبه النيوتونية مثل خوارزمية BFGS، أو خوارزمية L-BFGS-B التي تتيح فرض قيود صريحة على الحدود الدنيا للمعلمات لمنعها من الانحدار إلى القيم الصفرية أو السالبة:

# استخدام خوارزمية L-BFGS-B مع تحديد حد أدنى موجب صارم للمعلمات
fit_gamma_lbfgsb <- fitdist(simulated_data, "gamma", method = "mle",
 optim.method = "L-BFGS-B",
 lower = c(0.0001, 0.0001))

12.2 التعامل مع المشاهدات الصفرية والقيم السالبة في مجموعات البيانات

يعد وجود قيمة صفرية أو سالبة في متجه البيانات المدخلة السبب الأكثر شيوعاً للفشل الفوري لدالة fitdist عند محاولة ملاءمة توزيع غاما؛ حيث تطلق بيئة R تحذيراً فورياً يشير إلى عدم إمكانية تطبيق دالة الكثافة على قيم غير موجبة قطيعاً ($x le 0$).

تتحدد المعالجة المنهجية السليمة لهذه المعضلة وفقاً للآلية المولدة للقيم الصفرية:

  1. إزاحة المتغير بثابت موجب صغير (Constant Shift): إذا كانت الأصفار ناتجة عن أسلوب قياس أو تمثل بداية النطاق فقط، يمكن إضافة ثابت صغير جداً يرمز له بـ $c$ (مثل $c = \min(x_{positive})/2$ أو $c = 0.001$) لكافة المشاهدات: $x^* = x + c$. تجدر الإشارة إلى أن هذه الإزاحة تؤثر على تقديرات المعلمات، ويجب الإفصاح عنها بشفافية ومناقشة أثرها في تقرير النتائج.
  2. تطبيق نماذج الأجزاء الثنائية / الصفر المتضخم (Two-Part Hurdle / Zero-Inflated Models): إذا كانت الأصفار تمثل كتلة احتمالية نوعية أصيلة (مثل امتناع أفراد العينة تماماً عن أداء سلوك معين)، يجب فصل التحليل إلى مرحلتين: نمذجة احتمالية الحدوث (صفر مقابل قيمة موجبة) باستخدام انحدار لوجستي ثنائي (Binary Logistic Regression)، ثم ملاءمة نموذج غاما حصراً على المشاهدات الموجبة قطعياً ($x > 0$).
# مثال تطبيقي لفصل البيانات وتطبيق نموذج ذي مرحلتين
# استخراج القيم الموجبة فقط لملاءمة توزيع غاما
positive_subsample <- simulated_data[simulated_data > 0]
# ملاءمة توزيع غاما للجزء الموجب وحده
fit_gamma_hurdle <- fitdist(positive_subsample, "gamma", method = "mle")

12.3 أفضل الممارسات المنهجية لتوثيق ومشاركة تحليلات R

لضمان النزاهة الأكاديمية والشفافية المنهجية وسهولة إعادة إنتاج التحليلات الإحصائية من قبل المجتمع العلمي، يجب الالتزام بحزمة من أفضل الممارسات البرمجية عند توثيق ملاءمة التوزيعات الاحتمالية في لغة R:

  • استخدام صيغ الحوسبة التفاعلية الموثقة: يُنصح بكتابة أكواد التحليل ضمن ملفات RMarkdown أو ملفات Quarto لدمج الأكواد البرمجية، والمخرجات الرقمية، والرسومات البيانية التشخيصية، والتفسيرات النظرية في وثيقة ديناميكية متكاملة يمكن تصديرها مباشرة بصيغ PDF أو HTML.
  • التوثيق الدقيق لمعلومات الجلسة البرمجية: يجب دائماً تضمين استدعاء دالة sessionInfo() في نهاية كود التحليل؛ حيث تقوم هذه الدالة بتسجيل وطباعة إصدار لغة R المستخدم، ونظام التشغيل، وإصدارات كافة الحزم الإحصائية المعتمدة (مثل fitdistrplus, MASS, survival)، مما يمنع حدوث أي تعارضات مستقبلية ناتجة عن تحديثات الحزم.
# طباعة معلومات الجلسة البرمجية لتوثيق التبعيات وإصدارات الحزم
sessionInfo()
  • كتابة التقارير بأسلوب علمي رصين: عند صياغة نتائج الملاءمة في الأوراق البحثية، يجب الإفصاح عن التقديرات النقطية للمعلمات مصحوبة بأخطائها المعيارية وفترات الثقة الناتجة عن البوتستراب، وقيم معايير المفاضلة (AIC, BIC)، وقيم الاختبارات الفرضية الرسمية لجودة المطابقة (KS, AD) متبوعة بالمخططات التشخيصية الرباعية، مما يمنح البحث مصداقية منهجية وقوة استدلالية لا تقبل الشك.

الخاتمة

استعرض هذا الدليل المنهجي الشامل الأسس النظرية والتطبيقية لملاءمة توزيع غاما لمجموعات البيانات المتصلة في بيئة لغة البرمجة الإحصائية R. بدءاً من تفكيك البنية الرياضية لدالة الكثافة الاحتمالية ودوال التوزيع التراكمي والعزوم الإحصائية، اتضح لنا جلياً التفوق النوعي والقدرة الفائقة لنموذج غاما في تمثيل البيانات ذات الالتواء الموجب الإيجابي، كأزمنة الرجع والاستجابة في القياسات السلوكية والنفسية، متفوقاً على المحاولات القسرية لتطبيق الفروض الاعتدالية أو التحويلات المشوهة لمقاييس القياس الأصلية.

كما أظهرت المعالجة البرمجية عبر حزمة fitdistrplus كفاءة وسلاسة استثنائية في تنفيذ مراحل التحليل الإحصائي المختلفة؛ بدءاً من الاستكشاف البصري الإمبيريقي وتطبيق مخطط كولين وجري فري، مروراً بتطبيق خوارزميات التقدير الإحصائي المتعددة (تقدير الإمكان الأعظم MLE، وطريقة العزوم MME، ومطابقة المئينات QME، وتعظيم مسافة الملاءمة MGE)، وانتهاءً بإجراء الفحوص التشخيصية الشاملة عبر المخططات الرباعية والاختبارات الإحصائية الصارمة كاختبار أندرسون-دارلنغ وكولموغوروف-سميرنوف وكاي تربيع.

إن إتقان الباحث لمثل هذه الأدوات الإحصائية المعلمية المتقدمة في بيئة R، واستيعابه لكيفية تجاوز العقبات البرمجية كفشل التقارب العددي والتعامل السليم مع المشاهدات الصفرية، يمثل نقلة نوعية في قدرته على بناء نماذج تفسيرية وتنبؤية تتسم بأعلى معايير الدقة العلمية والمصداقية الإمبريقية، مما يسهم بصورة مباشرة في الارتقاء بجودة المخرجات البحثية في العلوم السلوكية والكمية المعاصرة.

References

  • Akaike, H. (1974). A new look at the statistical model identification. IEEE Transactions on Automatic Control, 19(6), 716–723. https://doi.org/10.1109/TAC.1974.1100705
  • Anderson, T. W., & Darling, D. A. (1954). A test of goodness of fit. Journal of the American Statistical Association, 49(268), 765–769. https://doi.org/10.1080/01621459.1954.10501232
  • Cullen, A. C., & Frey, H. C. (1999). Probabilistic techniques in exposure assessment: A handbook for dealing with variability and uncertainty in models and inputs. Plenum Press.
  • Delignette-Muller, M. L., & Dutang, C. (2015). fitdistrplus: An R package for fitting distributions. Journal of Statistical Software, 64(4), 1–34. https://doi.org/10.18637/jss.v064.i04
  • Johnson, N. L., Kemp, A. W., & Kotz, S. (2005). Univariate discrete distributions (3rd ed.). John Wiley & Sons.
  • Luce, R. D. (1986). Response times: Their role in inferring elementary mental organization. Oxford University Press.
  • McCullagh, P., & Nelder, J. A. (1989). Generalized linear models (2nd ed.). Chapman and Hall/CRC.
  • R Core Team. (2024). R: A language and environment for statistical computing. R Foundation for Statistical Computing, Vienna, Austria. https://www.R-project.org/
  • Venables, W. N., & Ripley, B. D. (2002). Modern applied statistics with S (4th ed.). Springer. https://doi.org/10.1007/978-0-387-21706-2

اقتباس هذا المقال

looti, M. (2026, أغسطس 29). كيفية ملاءمة توزيع غاما لمجموعة بيانات في R. عرب سايكلوجي. https://arabpsychology.com/statistics/how-to-fit-a-gamma-distribution-to-a-dataset-in-r/
looti, Mohammed. “كيفية ملاءمة توزيع غاما لمجموعة بيانات في R.” عرب سايكلوجي, 29 أغسطس 2026, https://arabpsychology.com/statistics/how-to-fit-a-gamma-distribution-to-a-dataset-in-r/.
looti, Mohammed. “كيفية ملاءمة توزيع غاما لمجموعة بيانات في R.” عرب سايكلوجي. أغسطس 29, 2026. https://arabpsychology.com/statistics/how-to-fit-a-gamma-distribution-to-a-dataset-in-r/.