التحليل الإحصائيبرنامج ستاتامناهج البحث في علم النفس

كيفية الحصول على القيم المتوقعة والبواقي في برنامج ستاتا

دليل أكاديمي شامل يوضح خطوات استخراج القيم المتوقعة والبواقي في برنامج ستاتا (Stata) وتحليل افتراضات نماذج الانحدار الخطي وتفسير النتائج بدقة.

تاريخ النشر

يحتل نموذج الانحدار الخطي مكانة مركزية في التحليل الإحصائي التطبيقي، إذ يمثل حجر الزاوية في نمذجة العلاقات السببية والتفسيرية والتنبؤية بين المتغيرات في شتى العلوم الإنسانية، الاجتماعية، الطبية، والاقتصادية. ولا تقتصر قوة النمذجة الإحصائية على مجرد تقدير معالم الانحدار واستخراج معاملات التأثير، بل تمتد بصورة جوهرية إلى فحص دقة النموذج وجودته التنبؤية من خلال استخراج وتحليل كل من القيم المتوقعة (Predicted Values) والبواقي (Residuals). وتعد هذه المخرجات المشتقة الركيزة الأساسية للتحقق من سلامة البناء الرياضي للنموذج واختبار مدى مطابقة البيانات لافتراضات النمذجة الإحصائية الكلاسيكية.

يقدم برنامج Stata بيئة برمجية متكاملة وفائقة الدقة للتعامل مع النماذج الإحصائية المتقدمة؛ حيث يوفر حزمة من الأوامر الاحترافية التي تمكن الباحثين من الانتقال بسلاسة من مرحلة بناء النموذج وتقدير معلماته إلى مرحلة التشخيص المعمق. إن استخراج القيم المتوقعة يتيح للباحثين فهم السلوك النمطي للظاهرة المدروسة وتوقع مستويات الاستجابة بناءً على مدخلات محددة، في حين يفتح تحليل البواقي نافذة تحليلية دقيقة لرصد الفروق الفردية، واكتشاف الأخطاء النظامية، وتحديد الحالات الشاذة والمؤثرة، والتحقق الصارم من افتراضات طريقة المربعات الصغرى العادية (OLS).

يهدف هذا الدليل المرجعي الشامل إلى تقديم معالجة أكاديمية وتطبيقية معمقة لكيفية استخراج، وتشخيص، وتفسير القيم المتوقعة والبواقي في برنامج ستاتا. سنتناول بالتفصيل المفاهيم الرياضية، والخطوات البرمجية الدقيقة، والأدوات البيانية المتقدمة، والاختبارات الإحصائية التشخيصية، مع التركيز على التطبيقات في البحوث النفسية والتربوية والاجتماعية، وصولاً إلى صياغة التقارير الإحصائية المعتمدة وفق معايير النشر العلمي الدولية (APA).

1. الأسس النظرية والمفاهيمية للانحدار الخطي في برنامج ستاتا

1.1 مفهوم نموذج الانحدار الخطي ودوره في التحليل الإحصائي

يمثل الانحدار الخطي أسلوباً إحصائياً استدلالياً يستهدف نمذجة العلاقة الرياضية بين متغير تابع (Response/Dependent Variable) يُرمز له عادة بالرمز Y، ومتغير تفسيري مستقل واحد (Explanatory/Independent Variable) يُرمز له بالرمز X في حالة الانحدار الخطي البسيط، أو مجموعة من المتغيرات التفسيرية في حالة الانحدار الخطي المتعدد. يرتكز النموذج على افتراض وجود ارتباط خطي يتيح التنبؤ بقيم المتغير التابع بالاعتماد على التباين المشترك مع المتغيرات المستقلة، مما يجعله أداة محورية في صياغة الفرضيات العلمية واختبار النظريات الأكاديمية.

تكمن الأهمية الجوهرية لنمذجة العلاقات الخطية في قدرتها على التجريد والتفسير والتنبؤ بالظواهر السلوكية والاجتماعية المعقدة. ففي حقول مثل علم النفس والتربية، يساعد الانحدار في قياس مدى إسهام المتغيرات النفسية كالقلق ودافعية الإنجاز في التنبؤ بالتحصيل الدراسي أو مستويات التكيف الاجتماعي. رياضياً، تُصاغ المعادلة الخطية العامة لجمهرة الدراسة على النحو التالي: Y يساوي الحد الثابت مضافاً إليه حاصل ضرب كل معامل انحدار في متغيره المستقل، وصولاً إلى الحد الخطئي العشوائي الذي يمثل التباين غير المفسر في النموذج.

تتمثل مهمة الباحث الإحصائي عند استخدام برنامج ستاتا في تقدير معالم هذه المعادلة من خلال عينة ممثلة، حيث يتم حساب قيم المقاطع والميول التي تقلل مجموع مربعات الفروق بين القيم الفعلية والقيم المقدرة إلى أدنى حد ممكن، وهو ما يعرف بأسلوب المربعات الصغرى العادية (Ordinary Least Squares). يتيح هذا التقدير فهم التأثير الهامشي لكل متغير مستقل مع تثبيت أثر المتغيرات الأخرى في النموذج.

1.2 التعريف الرياضي والإحصائي للقيم المتوقعة (Predicted Values)

تُعرّف القيمة المتوقعة إحصائياً، والتي يُرمز لها بالرمز Y-hat، بأنها القيمة المقدرة للمتغير التابع المحسوبة من معادلة الانحدار التقديرية عند تعويض قيم محددة للمتغيرات المستقلة لمشاهدة معينة. هندسياً، تمثل القيمة المتوقعة النقطة الواقعة مباشرة على خط أو مستوى الانحدار المقدر، وتجسد القيمة المتوسطة للمتغير التابع المشروطة بقيم معينة للمتغيرات المستقلة وفقاً للنموذج الإحصائي المعتمد.

تجري آلية حساب القيم التنبؤية من خلال تعويض المتجهات الرقمية للمتغيرات التفسيرية في المعادلة الخطية المقدرة؛ حيث يُضرب كل متغير مستقل في معامل الانحدار الجزئي الخاص به وتُجمع النواتج مع الحد الثابت. يبرز هنا الفارق الجوهري بين القيمة الفعلية الملاحظة التي تم جمعها ميدانياً من المبحوث أو المفحوص، والقيمة التنبؤية التي تمثل الأداء المتوقع نظرياً بافتراض خلو القياس من الخطأ العشوائي والانحرافات الفردية غير المفسرة.

تتعدد الاستخدامات التطبيقية للقيم المتوقعة في الأبحاث العلمية والسريرية؛ فهي تشكل الأساس لحساب المعايير التقديرية، وتتيح إجراء محاكاة لسيناريوهات مستقبلية عبر إدخال قيم افتراضية للمتغيرات المستقلة لتقدير النتائج المتوقعة. كما تُعد القيم المتوقعة خطوة وسيطة بالغة الأهمية لتوليد مؤشرات تشخيصية أخرى مثل البواقي وقيم الرافعة وأحجام التأثير التنبؤي.

1.3 مفهوم البواقي (Residuals) ودورها في تشخيص النماذج

يُعرّف الباقي (Residual) رياضياً بأنه الفرق الحسابي الدقيق بين القيمة الفعلية الملاحظة للمتغير التابع والقيمة المتوقعة الناتجة عن نموذج الانحدار، ويُعبر عنه بالمعادلة: e يساوي Y مطروحاً منها Y-hat. يمثل الباقي المقدار الذي عجز النموذج الإحصائي عن تفسيره من التباين الكلي للمتغير التابع بالنسبة لكل مشاهدة فردية، وهو النظير التجريبي للخطأ العشوائي النظري غير المشاهد في مجتمع الدراسة.

تكتسب البواقي أهمية استثنائية في التحليل الإحصائي المتقدم لكونها المرآة العاكسة لمدى كفاءة وملاءمة النموذج للبيانات الفعلية. فبينما يركز الباحثون المبتدئون على معاملات التحديد ومستويات الدلالة، يوجه الإحصائيون المتمرسون جل اهتمامهم لفحص البواقي؛ إذ إن النموذج الجيد والمطابق للواقع هو الذي تتسم بواقيه بالعشوائية التامة وتخلو من أي نمط رياضي أو هيكلي منتظم.

يرتكز الاستدلال الإحصائي في نماذج الانحدار الخطي على مجموعة من الفرضيات الصارمة المعروفة بافتراضات “غاوس-ماركوف”، والتي تتعلق بخصائص الأخطاء مثل التوزيع الطبيعي، وتجانس التباين، واستقلالية المشاهدات. ونظراً لعدم إمكانية مراقبة الأخطاء الحقيقية للمجتمع، تصبح البواقي الأداة التشخيصية الوحيدة المتاحة للباحث لاختبار مدى تحقق هذه الفرضيات أو انتهاكها في عينة البحث، وتحديد ما إذا كانت التقديرات غير متحيزة وتتمتع بأقل تباين ممكن.

2. أهمية استخراج القيم المتوقعة والبواقي في البحوث النفسية والاجتماعية

2.1 تقييم جودة ملاءمة النماذج النفسية والسلوكية

تتميز الظواهر النفسية والتربوية بدرجة عالية من التعقيد والتشابك، مما يجعل النمذجة الإحصائية في هذه المجالات عرضة للتحديات المنهجية. يسهم استخراج القيم المتوقعة والبواقي في تقديم مؤشرات حساسة لتقييم جودة ملاءمة النماذج التنبؤية؛ حيث تتيح هذه الأدوات للباحث النفسي تقدير نسبة التباين الحقيقي المفسر في السمات السلوكية والقدرات المعرفية مقابل التباين المتبقي الناتج عن عوامل غير مقاسة أو أخطاء في أداة القياس.

يساعد التحليل المعمق للبواقي في الكشف عن مشكلات التحيز في أدوات القياس النفسي، وتحديد ما إذا كان النموذج يعاني من التقدير الزائد (Overestimation) أو التقدير الناقص (Underestimation) لبعض الفئات الفرعية في العينة. فعلى سبيل المثال، عند بناء نموذج للتنبؤ بالاكتئاب استناداً إلى ضغوط الحياة وأساليب التكيف، يمكن من خلال فحص البواقي تحديد ما إذا كان النموذج يعمل بنفس الكفاءة التفسيرية لدى مختلف الفئات العمرية أو النوعية، مما يعزز من الصدق التنبؤي للأطر النظرية المطروحة.

كما يوفر استخراج القيم التنبؤية إمكانية تدقيق النماذج ومقارنتها عبر التحقق المتقاطع (Cross-Validation)، حيث تُقارن القيم المتوقعة المشتقة من عينة البناء بالقيم الفعلية في عينة التحقق، لضمان استقرار النموذج وعدم وقوعه في فخ الإفراط في المطابقة (Overfitting) للبيانات الاستكشافية الأولية.

2.2 رصد الفروق الفردية والانحرافات عن النمط العام

في الأبحاث السلوكية والإكلينيكية، لا تقتصر الغاية على تعميم النمط العام للظاهرة، بل تكتسب الحالات الشاذة والخارجة عن النمط أهمية علمية بالغة. تمثل البواقي الكبيرة في قيمتها المطلقة مؤشراً مباشراً على وجود حالات فردية يبتعد سلوكها الفعلي ابتعاداً جوهرياً عما يتنبأ به النموذج النظري، مما يستدعي دراسة هذه الحالات بصورة نوعية أو إكلينيكية متعمقة.

يُطلق على الأفراد الذين يظهرون بواقي موجبة ضخمة أو سالبة ضخمة مسمى “الحالات المتناقضة” أو الاستثنائية. ففي دراسات التحصيل الدراسي، يشير الطالب ذو الباقي الموجب المرتفع جداً إلى أداء يفوق بكثير قدراته الذكائية وظروفه الاقتصادية المتوقعة، مما يفتح المجال لدراسة عوامل المرونة النفسية والبيئة الأسرية الداعمة. وبالمقابل، يكشف الباقي السالب المرتفع عن وجود معوقات خفية تمنع الفرد من الوصول إلى مستوى أدائه المتوقع.

يتيح عزل وتحليل متغير البواقي للباحثين استخدام هذه القيم المتبقية كمتغيرات تابعة جديدة في تحليلات لاحقة، وذلك بهدف تفسير هذا التباين الشاذ عبر إدخال متغيرات وسيطة أو معدلة جديدة، مما يسهم في التطوير المستمر للنظريات النفسية وتوسيع قدرتها على الإحاطة بالفروق الفردية الدقيقة.

2.3 دعم القرار الإكلينيكي والتربوي عبر التنبؤ الفردي

يمتد توظيف القيم المتوقعة والبواقي من الإطار النظري الأكاديمي إلى الممارسة التطبيقية وصناعة القرارات المهنية في المجالات الطبية والتربوية والإكلينيكية. إذ يمكن للأخصائي النفسي استخدام القيم المتوقعة لتحديد خط الأساس المتوقع للأداء الوظيفي أو المعرفي للمراجع، ومن ثم مقارنة أدائه الفعلي المسجل بهذا الخط لتشخيص وجود التدهور المعرفي أو الاضطراب النفسي بدقة متناهية.

في البيئات التربوية، يسهم التنبؤ الفردي في تصميم برامج التدخل التعليمي الموجهة للطلاب المعرضين لخطر التعثر الأكاديمي قبل وقوع الفشل الفعلي. فعندما تُظهر معادلة الانحدار قيمة متوقعة منخفضة لأداء الطالب بناءً على مؤشرات الحضور والمشاركة والتقييمات الأولية، يمكن تفعيل التدخلات الاستباقية لتعديل المسار التعليمي وتقديم الدعم الإرشادي المناسب.

علاوة على ذلك، فإن حساب فترات التنبؤ الفردية (Prediction Intervals) المصاحبة للقيم المتوقعة يزود الممارس الإكلينيكي بنطاق ثقة محدد يعكس دقة التقدير الإحصائي؛ مما يقلل من احتمالية إصدار أحكام تشخيصية متسرعة ناتجة عن أخطاء القياس العشوائية، ويضمن اتخاذ قرارات مبنية على أدلة وبراهين إحصائية رصينة.

3. إعداد بيئة العمل وتحميل واستكشاف البيانات في ستاتا

3.1 تحميل مجموعات البيانات التدريبية والتطبيقية في ستاتا

يوفر برنامج ستاتا مرونة استثنائية في التعامل مع مختلف صيغ البيانات، سواء كانت قواعد بيانات مدمجة للأغراض التعليمية أو ملفات بحثية خارجية. للبدء في التطبيق العملي، يمكن استدعاء إحدى قواعد البيانات الشهيرة المدمجة في البرنامج مثل قاعدة بيانات السيارات عبر كتابة الأمر المباشر sysuse auto, clear، والتي تحتوي على متغيرات متنوعة تشمل السعر، والوزن، وكفاءة استهلاك الوقود، مما يجعلها نموذجاً مثالياً لشرح آليات الانحدار.

أما بالنسبة للبيانات البحثية الواقعية، يتيح ستاتا استيراد ملفات إكسل (Excel) عبر أمر import excel مع تحديد الخيارات المناسبة مثل قراءة الصف الأول كأسماء للمتغيرات عبر خيار firstrow، أو استيراد ملفات النصوص والفواصل (CSV) باستخدام أمر import delimited. كما يوفر البرنامج التوافق التام مع برمجيات التحليل الأخرى مثل SPSS عبر أوامر التحويل المتخصصة.

من الممارسات البرمجية الرصينة في ستاتا الحرص على فتح ملف سجل للأوامر والمخرجات (Log File) في بداية الجلسة التحليلية باستخدام الأمر log using analysis_log.log, replace لتوثيق كافة الخطوات بدقة، والاعتماد المستمر على ملفات الأوامر المبرمجة (Do-Files) لضمان قابلية تكرار التحليل ومراجعته مستقبلاً وفق أعلى معايير الشفافية العلمية.

3.2 الفحص الاستكشافي للمتغيرات قبل التحليل

قبل الشروع في بناء نموذج الانحدار، يتعين على المحلل الإحصائي إجراء فحص استكشرافي معمق لبنية البيانات وتوزيعاتها. يبدأ ذلك باستخدام الأمر describe للتعرف على عدد المشاهدات، وأنواع المتغيرات المخزنة (سواء كانت رقمية أو نصية)، وتسميات المتغيرات ومقاييسها، مما يضمن خلو الملف من أخطاء الترميز الأساسية.

يلي ذلك استخراج الإحصاءات الوصفية التلخيصية للمتغيرات المستهدفة عبر الأمر summarize، الذي يعرض المتوسطات الحسابية، والانحرافات المعيارية، والقيم الدنيا والقصوى، وحجم العينة الصالح للتحليل. كما يمكن إضافة الخيار detail للحصول على مؤشرات التشتت المتقدمة، والرتب المئينية، ومعاملات الالتواء (Skewness) والتفرطح (Kurtosis) الضرورية لتقييم اعتدالية التوزيع.

Summarize command in Stata
Summarize command in Stata

كما يُنصح بإجراء فحص أولي لمصفوفة الارتباط الخطي البسيط بين المتغيرات باستخدام الأمر correlate أو pwcorr مع إظهار مستويات الدلالة الإحصائية عبر خيار sig. يساعد هذا الإجراء في تشكيل رؤية مبدئية لطبيعة واتجاه وقوة العلاقات بين المتغير التابع والمتغيرات التفسيرية، بالإضافة إلى الكشف المبكر عن احتمالات وجود ارتباط خطي متعدد مرتفع بين المتغيرات المستقلة.

3.3 معالجة البيانات والقيم المفقودة

تؤثر جودة تنظيف ومعالجة البيانات تأثيراً مباشراً على دقة تقديرات الانحدار وصحة البواقي المستخرجة. يتعامل ستاتا مع القيم المفقودة للنصوص والأرقام عبر اعتبار النقطة (.) قيمة عددية لا نهائية في المقارنات، ويقوم تلقائياً بتطبيق أسلوب الاستبعاد الإجمالي للحالات (Listwise Deletion) عند تنفيذ الانحدار في حال وجود أي قيمة مفقودة في المتغيرات المدرجة في النموذج.

ينبغي للباحث تقييم نمط الفقد وحجمه باستخدام أوامر مخصصة مثل mdesc أو misstable summarize للتحقق مما إذا كان الفقد عشوائياً تماماً (MCAR) أم غير عشوائي، حيث إن فقدان نسبة كبيرة من البيانات قد يؤدي إلى انخفاض القوة الإحصائية وتحيز المعاملات المقدرة. وفي حال تطلب الأمر، يمكن اللجوء لأساليب التعويض المتعدد (Multiple Imputation) المتقدمة المتوفرة في ستاتا تحت حزمة أوامر mi.

يتضمن الإعداد أيضاً تحويل المتغيرات الفئوية والاسمية إلى متغيرات وهمية (Dummy Variables) باستخدام بادئة العوامل في ستاتا i.varname، والتحقق من الحاجة لإجراء تحويلات رياضية للمتغيرات المتصلة شديدة الالتواء، مثل التحويل اللوغاريتمي عبر الأمر generate log_var = ln(var) لتقريب التوزيع من الاعتدالية وتحقيق الخطية المطلوبة في العلاقة.

4. تنفيذ نموذج الانحدار الخطي في برنامج ستاتا (Linear Regression)

4.1 بناء وصياغة أمر الانحدار الخطي `regress`

يُعد الأمر regress (ويمكن اختصاره برمجياً إلى reg) الأمر المحوري في ستاتا لتقدير نماذج الانحدار الخطي المتعدد بأسلوب المربعات الصغرى العادية. تتسم صياغة الأمر بالبساطة المنهجية، حيث يُكتب اسم الأمر متبوعاً بالمتغير التابع أولاً، ثم تليه قائمة بالمتغيرات المستقلة المفردة أو التفاعلية، مثل: regress price weight mpg foreign.

يوفر الأمر مرونة واسعة لإدراج المتغيرات التفاعلية والحدود غير الخطية مباشرة دون الحاجة لإنشاء متغيرات جديدة يدوياً؛ فعلى سبيل المثال يمكن استخدام العامل c.weight##c.weight لإدراج الحد الخطي والتربيعي، أو i.foreign##c.mpg لدراسة التفاعل بين متغير تصنيفي وآخر متصل. تحافظ هذه الصياغة البرمجية المتقدمة على اتساق العمليات اللاحقة لاستخراج التنبؤات والتأثيرات الهامشية.

عند الشك في وجود مشكلة عدم تجانس التباين في الأخطاء العشوائية، يوفر ستاتا خيار حساب الأخطاء المعيارية الحصينة عبر إضافة الخيار robust أو vce(robust) في نهاية أمر الانحدار. يؤدي هذا الخيار إلى تعديل مصفوفة التباين والتباين المشترك للمعاملات باستخدام مقدر “هوبر-وايت” الحصين، مما يضمن الحصول على اختبارات دلالة وفترات ثقة موثوقة دون التأثير على قيم المعاملات النقطية ذاتها.

4.2 قراءة وتفسير جدول مخرجات الانحدار في ستاتا

تنقسم مخرجات أمر regress في ستاتا إلى ثلاثة أجزاء رئيسية متكاملة تقدم تحليلاً شاملاً لأداء النموذج. يحتوي الجزء العلوي الأيسر على جدول تحليل التباين (ANOVA Table) متضمناً مجموع المربعات (SS)، ودرجات الحرية (df)، ومتوسط المربعات (MS) لكل من النموذج المفسر (Model)، والتباين المتبقي غير المفسر (Residual)، والتباين الكلي (Total).

Regression model output in Stata
Regression model output in Stata

يعرض الجزء العلوي الأيمن المؤشرات الإجمالية لجودة الملاءمة الإحصائية؛ ومن أبرزها قيمة اختبار فاء (F-statistic) والدلالة الإحصائية المقترنة به (Prob > F)، والتي تختبر الفرضية الصفرية القائلة بأن جميع معاملات الانحدار في النموذج تساوي صفراً في آن واحد. يشير الحصول على قيمة دلالة أقل من 0.05 إلى أن النموذج ككل ذو دلالة إحصائية ويفسر تباين المتغير التابع بدرجة أفضل من النموذج الصفري المجرد من المتغيرات التفسيرية.

كما يعرض هذا الجزء معامل التحديد (R-squared) الذي يقيس النسبة المئوية للتباين في المتغير التابع المفسرة بواسطة المتغيرات المستقلة، بالإضافة إلى معامل التحديد المعدل (Adj R-squared) الذي يأخذ في الاعتبار عدد المتغيرات ودرجات الحرية، مما يمنع التضخم المصطنع لقيمة التفسير عند إضافة متغيرات جديدة عديمة الجدوى. كما يظهر مؤشر الجذر التربيعي لمتوسط مربعات الخطأ (Root MSE)، والذي يمثل الانحراف المعياري المقدر للبواقي العشوائية في النموذج.

4.3 تفسير المعاملات التقديرية (Coefficients) وفترات الثقة

يحتوي الجزء السفلي من مخرجات ستاتا على جدول المعاملات التقديرية المفصلة، حيث يُخصص لكل متغير سطر مستقل يوضح معامل الانحدار المقدر (Coef.)، والخطأ المعياري للتقدير (Std. Err.)، وقيمة اختبار تاء (t-value)، والقيمة الاحتمالية المقابلة للدلالة الفردية (P>|t|)، وفترة الثقة عند مستوى 95% للمعامل في مجتمع الدراسة.

يُفسر معامل الانحدار الجزئي بأنه المقدار المتوقع للزيادة أو النقصان في المتغير التابع عند تغير المتغير المستقل المعني بمقدار وحدة قياس واحدة، وذلك مع تثبيت أثر كافة المتغيرات التفسيرية الأخرى الداخلة في النموذج عند قيم ثابتة. أما الحد الثابت المقدر والمشار إليه في ستاتا بالرمز _cons، فيمثل القيمة المتوقعة للمتغير التابع عندما تنعدم قيم جميع المتغيرات المستقلة وتصل إلى الصفر رياضياً.

تكتسب فترات الثقة (Confidence Intervals) أهمية قصوى في الاستدلال الإحصائي؛ إذ إن عدم اشتمال فترة الثقة المقدرة للمعامل عند مستوى 95% على القيمة صفر يؤكد وجود تأثير دال إحصائياً عند مستوى دلالة 0.05. تتيح هذه الفترات تقييم الدقة التقديرية للمعامل والمدى المحتمل لتأثيره في المجتمع الأصلي بصورة تتجاوز مجرد فحص القيمة الاحتمالية المجردة.

5. الخطوات الإجرائية للحصول على القيم المتوقعة في ستاتا

5.1 استخدام أمر التنبؤ الأساسي `predict`

يُعد الأمر الملحق predict الأداة البرمجية الأساسية في ستاتا لاستخراج وحساب القيم المشتقة بعد تقدير أي نموذج إحصائي. يعتمد هذا الأمر على ما تم تخزينه في الذاكرة الحية المؤقتة للبرنامج بعد تنفيذ أمر regress مباشرة، مما يعني أنه لا يمكن تنفيذه بصورة مستقلة دون وجود نموذج انحدار تم تقديره في الخطوة السابقة مباشرة ضمن جلسة العمل.

لتوليد متغير جديد يحتوي على القيم المتوقعة لجميع مشاهدات العينة، يكتب الباحث الأمر بالصيغة التالية: predict y_hat، حيث يقوم ستاتا افتراضياً بإنشاء متغير جديد يحمل الاسم المعطى ويحتوي على القيم التنبؤية المحسوبة. كما يمكن التصريح بالخيار الخطي صراحة بكتابة: predict y_hat, xb، حيث يشير الحرفان xb إلى حاصل الضرب المصفوفي لمتجه المتغيرات في متجه المعاملات المقدرة.

تتميز هذه الخطوة بالكفاءة الحسابية العالية؛ حيث يقوم ستاتا بحساب التنبؤ حتى للمشاهدات التي تحتوي على قيم صالحة للمتغيرات المستقلة ولكنها كانت تفتقد للقيمة التابعة الأصلية، وهو ما يُعرف بالتنبؤ خارج العينة (Out-of-Sample Prediction)، مما يتيح تطبيق النموذج التنبئي على عينات جديدة دون الحاجة لإعادة تقدير المعاملات.

5.2 توليد الأخطاء المعيارية وفترات الثقة للقيم المتوقعة

لا يقتصر التنبؤ العلمي على حساب القيمة النقطية المفردة، بل يستلزم بالضرورة تقدير مدى عدم اليقين المحيط بهذا التنبؤ. يوفر ستاتا خيارات متقدمة لحساب الأخطاء المعيارية المرتبطة بالقيمة المتوقعة؛ حيث يتيح الخيار stdp حساب الخطأ المعياري للقيمة المتوقعة المتوسطة لخط الانحدار عبر الأمر: predict se_mean, stdp.

أما عند الرغبة في التنبؤ بسلوك مشاهدة فردية جديدة، فإن التباين الكلي يتضمن كلاً من تباين تقدير خط الانحدار بالإضافة إلى التباين العشوائي للبواقي. في هذه الحالة، يُستخدم الخيار stdf عبر كتابة الأمر: predict se_indiv, stdf، الذي يولد الخطأ المعياري للتنبؤ الفردي (Standard Error of the Forecast)، وتكون قيمته دائماً أكبر من قيمة stdp.

باستخدام هذه الأخطاء المعيارية، يستطيع الباحث بناء فترات ثقة حول خط التنبؤ بدقة عبر إنشاء حدود عليا ودنيا برمجياً باستخدام أوامر توليد المتغيرات generate؛ فعلى سبيل المثال، يُحسب الحد الأدنى للتنبؤ بضرب الخطأ المعياري في القيمة الحرجة للتوزيع وحسمه من القيمة المتوقعة، مما يوفر تمثيلاً بيانياً وإحصائياً لمجال التباين التنبؤي المتوقع في الظاهرة.

5.3 التحقق من القيم المتوقعة في جدول البيانات ومقارنتها

بعد تنفيذ أمر التنبؤ، تُضاف المتغيرات المنشأة تلقائياً كأعمدة جديدة في نهاية قاعدة البيانات النشطة في ستاتا. يمكن للباحث فتح نافذة محرر البيانات (Data Editor) عبر الأمر edit أو browse لمعاينة القيم المتوقعة جنباً إلى جنب مع القيم الفعلية للمتغير التابع، مما يتيح التدقيق البصري الأولي لكفاءة التقدير.

Actual vs. predicted values in regression in Stata
Actual vs. predicted values in regression in Stata

لإجراء مقارنة إحصائية سريعة وشاملة، يُستخدم أمر التلخيص الإحصائي summarize actual_var predicted_var. ومن الخصائص الرياضية الأساسية لنماذج المربعات الصغرى المحتوية على حد ثابت أن المتوسط الحسابي للقيم المتوقعة يتطابق تماماً مع المتوسط الحسابي للقيم الفعلية الملاحظة، في حين يكون الانحراف المعياري للقيم المتوقعة أقل دائماً من الانحراف المعياري للقيم الفعلية، معبراً عن نسبة التباين المفسر في النموذج.

كما يُنصح باستخدام الأمر list actual_var predicted_var in 1/10 لاستعراض قائمة بعينة من المشاهدات العشر الأولى ومقارنة الفروق الرقمية بين الواقع والمقدر، مما يعطي الباحث فهماً عملياً لكيفية تعامل النموذج مع الحالات الفردية المختلفة ومدى اقتراب المنحنى الرياضي من رصد القيم الحقيقية.

6. الخطوات الإجرائية للحصول على البواقي وحسابها في ستاتا

6.1 استخراج البواقي الخام العادية (Raw Residuals)

تُمثل البواقي الخام العادية (Raw Residuals) الفارق البسيط غير المقيس بين القيمة الملاحظة والقيمة المقدرة لنفس المشاهدة. بعد الانتهاء من تقدير نموذج الانحدار باستخدام أمر regress، يتم استخراج هذا المتغير الهام مباشرة باستخدام الأمر الملحق predict مقروناً بالخيار التخصصي للبواقي: predict e_raw, residuals، أو بصيغته المختصرة الشائعة: predict e_raw, res.

يقوم البرنامج داخلياً بتنفيذ العملية الجبرية بطرح القيمة المتوقعة المحسوبة مسبقاً من القيمة الفعلية للمشاهدة المقابلة، وتخزين الناتج في عمود رقمي جديد يحمل الاسم المختار e_raw. تُعامل هذه القيم الجديدة كأي متغير كمي متصل في ملف البيانات، مما يتيح للمحلل إجراء كافة العمليات الحسابية والرسومات البيانية المتقدمة عليها.

من الضروري التأكد من عدم وجود متغير سابق يحمل نفس الاسم في قاعدة البيانات لتجنب ظهور رسائل الخطأ من ستاتا، أو يمكن استخدام خيار الاستبدال إذا لزم الأمر، مع مراعاة أن البواقي المحسوبة تعتمد كلياً على آخر نموذج انحدار تم تنفيذه في سطر الأوامر، مما يتطلب الحذر عند التبديل بين نماذج متعددة.

6.2 التحقق الإحصائي الأولي من خصائص البواقي

فور استخراج البواقي الخام، يتعين على الباحث التحقق من اتساقها مع الخصائص الرياضية الإجبارية المقررة في نظرية الانحدار الخطي الكلاسيكي للمربعات الصغرى. يُنفذ ذلك عبر استدعاء الأمر summarize e_raw لمعاينة المؤشرات الوصفية لمتغير البواقي المولد.

تتمثل السمة الأولى التي يجب فحصها في أن المتوسط الحسابي للبواقي يجب أن يساوي صفراً تماماً (أو قيمة قريبة جداً من الصفر تعود لأخطاء التقريب الحاسوبي مثل 1.0e-15). كما يجب أن يتطابق الانحراف المعياري للبواقي الخام (مع تعديل درجات الحرية) بدقة مع قيمة الجذر التربيعي لمتوسط مربعات الخطأ (Root MSE) المسجلة في جدول مخرجات الانحدار الرئيسي.

residuals vs predicted values in Stata
residuals vs predicted values in Stata

كما يُنصح بالتحقق من انعدام الارتباط الخطي التام بين البواقي والقيم المتوقعة عبر الأمر correlate e_raw y_hat؛ حيث تشترط الهندسة الرياضية للمربعات الصغرى تعامد متجه البواقي مع فضاء المتغيرات التفسيرية والمتغير التنبؤي، مما يعني أن معامل الارتباط بينهما يجب أن يكون صفراً رياضياً، وهو ما يثبت خلو التنبؤات من أي شوائب من البواقي المتبقية.

6.3 تصدير وتوثيق متغيرات البواقي للأغراض البحثية

لضمان احترافية العمل البحثي وقابلية نتائجه للمراجعة والتدقيق، يُفضل توثيق المتغيرات الجديدة فور توليدها عبر إعطائها تسميات وصفية دقيقة توضح طبيعتها ونموذج الانحدار المشتقة منه. يُستخدم في ذلك أمر التوصيف المرجعي في ستاتا: label variable e_raw “Raw Residuals from Model 1”.

عقب الانتهاء من استخراج وحساب المتغيرات التنبؤية والبواقي، يجب حفظ مجموعة البيانات المحدثة في ملف مستقل يحمل اسماً جديداً يبرز التعديلات المنجزة عبر الأمر: save “dataset_with_residuals.dta”, replace، وذلك لتجنب العبث بالملف الخام الأصلي والحفاظ على مسار المعالجة سديداً.

كما يُلزم الباحث بتسجيل كافة سطور الأوامر المستخدمة بدقة داخل ملف الأوامر المبرمج (Do-File)، مع كتابة تعليقات تفسيرية توضح خطوات الحساب وأسباب استخدام كل خيار، وهو ما يضمن تحقيق أعلى درجات التكرارية والاعتمادية العلمية (Reproducibility) المتوافقة مع متطلبات المجلات العلمية المحكمة ذات التصنيف المتقدم.

7. استخراج البواقي المتقدمة والمعيارية لتشخيص أدق

7.1 البواقي المعيارية (Standardized Residuals)

على الرغم من فائدة البواقي الخام في العمليات الحسابية البسيطة، إلا أنها تعاني من عيب جوهري يتمثل في اعتمادها على وحدات قياس المتغير التابع، مما يجعل من الصعب مقارنة تشتت البواقي بين نماذج مختلفة أو تقييم مدى ابتعاد المشاهدة عن الصفر بشكل مطلق. للتغلب على هذه المشكلة، تُستخدم البواقي المعيارية (Standardized Residuals) والتي تنتج عن قسمة الباقي الخام على الانحراف المعياري المقدر للبواقي.

يتم توليد هذا النوع من البواقي في ستاتا مباشرة بعد أمر الانحدار باستخدام الخيار التخصصي rstandard عبر كتابة الأمر: predict r_std, rstandard. ينتج عن هذا الأمر متغير معياري جديد يخلو من وحدات القياس، ويقارب توزيعه التوزيع الطبيعي المعياري بمتوسط يقترب من الصفر وانحراف معياري يقترب من الواحد الصحيح.

تُعد البواقي المعيارية أداة كشف مثالية للحالات غير النمطية؛ حيث يعتمد الباحثون على القواعد المعيارية المرجعية التي تنص على أن أي مشاهدة تتجاوز قيمتها المعيارية المطلقة عتبة ±2 تُعد حالة ملفتة للنظر تستوجب المراجعة، في حين تعتبر المشاهدات التي تتجاوز قيمتها عتبة ±3 انحرافات معيارية حالات شاذة واضحة (Outliers) تمارس تشويشاً كبيراً على اتجاه خط الانحدار العام.

7.2 بواقي ستيودنت المحذوفة (Studentized / Jackknife Residuals)

تمثل بواقي ستيودنت المحذوفة (Studentized Deleted Residuals)، والمعروفة أيضاً باسم بواقي “جاك نايف”، التطور الأكثر دقة في تشخيص الحالات الشاذة المتطرفة. تكمن فكرتها الرياضية في حساب الباقي لكل مشاهدة بعد إعادة تقدير نموذج الانحدار مع حذف تلك المشاهدة المحددة من عينة التحليل، ومن ثم قسمة الباقي على خطأ معياري مستقل لا يتأثر بوجود تلك النقطة ذاتها.

لتوليد بواقي ستيودنت في برنامج ستاتا، يُستخدم الأمر الملحق بالصيغة التالية: predict r_stud, rstudent. تتبع هذه البواقي توزيع تاء (t-distribution) بدرجات حرية مساوية لدرجات حرية البواقي ناقصاً واحداً، مما يوفر أساساً اختبارياً دقيقاً لإجراء اختبارات الدلالة الإحصائية لفرز القيم المتطرفة الشاذة.

تكمن القوة التشخيصية لبواقي ستيودنت في عدم قدرة النقطة المتطرفة الكبيرة على تقليص باقيها الخاص من خلال جذب خط الانحدار نحوها بقوة (Masking Effect)، وهي الظاهرة التي تحدث عند استخدام البواقي الخام والمعيارية العادية. لذا، يُعد فحص قيم rstudent المعيار الذهبي لتحديد ما إذا كانت نقطة معينة تنتمي بالفعل لنفس مجتمع الدراسة أم تمثل خطأ في الإدخال أو القياس.

7.3 المقارنة المنهجية بين أنواع البواقي المختلفة

يستدعي التحليل الإحصائي الرصين إدراك الفروق المنهجية والاستخدامات المثلى لكل نوع من أنواع البواقي المتاحة في ستاتا. فبينما تُستخدم البواقي الخام في حسابات التباين المتبقي وتوليد القيم التنبؤية، تُفضل البواقي المعيارية في فحص التوزيع الطبيعي ومقارنة المتغيرات عبر النماذج المختلفة، في حين تبرز بواقي ستيودنت كأقوى أداة للكشف عن القيم الشاذة والمؤثرة ذاتياً.

يوضح الجدول التالي مقارنة دقيقة بين أنواع البواقي البرمجية في ستاتا وأهدافها الإحصائية:

  • البواقي الخام (Raw Residuals): صيغة الأمر predict e, residuals | الهدف: تقييم الفروق الحسابية المباشرة واختبارات التجانس العامة.
  • البواقي المعيارية (Standardized Residuals): صيغة الأمر predict r, rstandard | الهدف: تنميط الأخطاء واستكشاف المشاهدات التي تتجاوز عتبة ±2 أو ±3 انحرافات معيارية.
  • بواقي ستيودنت المحذوفة (Studentized Residuals): صيغة الأمر predict t, rstudent | الهدف: الفحص الحصين للقيم الشاذة مع التحييد الكامل لتأثير النقطة على تباين الخطأ.

في الأبحاث النفسية والاجتماعية التي تتسم بارتفاع التباين الذاتي للمشاركين، يُوصى بالاعتماد المتزامن على البواقي المعيارية والطلابية لبناء صورة تشخيصية متكاملة لمدى نقاء العينة واتساقها الداخلي قبل اعتماد الاستنتاجات العلمية النهائية.

8. التشخيص البياني وتحليل البواقي بيانياً في ستاتا

8.1 رسم البواقي مقابل القيم المتوقعة (Residuals vs Fitted Plot)

يُمثل الرسم البياني للبواقي مقابل القيم المتوقعة (Residuals versus Fitted Plot) الأداة البصرية الأهم والأكثر كفاءة لتشخيص صلاحية نموذج الانحدار الخطي بأكمله. يوفر ستاتا أمراً مباشراً فائق السرعة لتوليد هذا المخطط بعد تشغيل الانحدار مباشرة وهو: rvfplot، مع إمكانية إضافة خط أفقي عند الصفر عبر الخيار yline(0) لتسهيل القراءة البصرية.

Residuals vs. predicted values plot in Stata
Residuals vs. predicted values plot in Stata

في النماذج السليمة التي تحقق افتراضات المربعات الصغرى بالكامل، تظهر النقاط في المخطط على شكل سحابة دائرية أو مستطيلة عشوائية تماماً موزعة بتماثل متساوٍ فوق وتحت خط الصفر الأفقي على امتداد محور السينات، دون تشكيل أي نمط هندسي أو انحناءات مميزة.

أما في حال ظهور نمط على شكل “قمع” أو “مروحة” (حيث يزداد تشتت البواقي رأسياً كلما زادت القيم المتوقعة)، فإن ذلك يمثل دليلاً بصرياً قاطعاً على انتهاك افتراض تجانس التباين (Heteroscedasticity). وإذا ظهرت النقاط في مسار منحني كقطع مكافئ (U-shape)، فإن ذلك يكشف عن فشل النموذج في نمذجة علاقة غير خطية تتطلب إدخال حدود تربيعية أو دوال لوغاريتمية لتصحيح التخصيص.

8.2 فحص التوزيع الطبيعي للبواقي بيانياً

يشترط الاستدلال الإحصائي الدقيق (مثل اختبارات تاء وفاء وبناء فترات الثقة) أن تتوزع البواقي توزيعاً طبيعياً معتدلاً بمتوسط يساوي الصفر. يوفر ستاتا ترسانة متكاملة من الأوامر الرسومية المتخصصة في تدقيق هذا الافتراض بصرياً بدرجة عالية من الإحكام.

يأتي في مقدمة هذه الأدوات مخطط كثافة النواة التراكمي المقرون بالمنحنى الطبيعي النظري عبر الأمر: kdensity e_raw, normal. يتيح هذا الرسم مقارنة منحنى التوزيع الفعلي للبواقي بالمنحنى الجرسي الطبيعي للكشف الفوري عن الالتواءات الإيجابية أو السلبية وحالات التفرطح والتفلطح في ذيول التوزيع.

ولفحص أدق للأطراف، يُستخدم مخطط الاحتمال الطبيعي pnorm e_raw للتركيز على وسط التوزيع، ومخطط المئين الطبيعي الشامل qnorm e_raw الذي يقارن رتب المئينات الفعلية بالمئينات المعيارية. يشير تطابق نقاط المشاهدات مع الخط المستقيم القطري المائل في رسم qnorm إلى تحقق اعتدالية التوزيع، بينما يعكس ابتعاد النقاط عن الخط في الأطراف العلوية أو السفلية وجود ذيول ثقيلة ناجمة عن وجود حالات متطرفة تستوجب التدخل.

8.3 رسم البواقي مقابل المتغيرات المستقلة الفردية

بينما يقدم مخطط rvfplot تقييماً شاملاً للنموذج ككل، تبرز الحاجة في كثير من الأحيان لفحص علاقة البواقي بكل متغير تفسيري على حدة، وذلك لتحديد المتغير المسؤول عن التشوهات أو اللاخطية المكتشفة في النموذج العام. يوفر ستاتا الأمر المخصص rvpplot لإجراء هذا التشخيص التفصيلي عبر الصياغة: rvpplot varname.

عند تنفيذ الأمر لكل متغير مستقل، يجب أن تظهر البواقي مشتتة عشوائياً عبر جميع مستويات المتغير المستقل دون تركز تشتتها في مستويات محددة. يتيح هذا الفحص التأكد من أن التباين متجانس عبر مختلف فئات أو مدى المتغير، وأن تأثير المتغير المستقل قد تم استيعابه بالكامل بواسطة المعامل الخطي المقدر دون ترك أي أثر تركيبي في البواقي.

إذا كشف مخطط rvpplot عن وجود انحناء واضح للبواقي عند مستويات محددة لمتغير مستقل معين، فإن ذلك يرشد الباحث بشكل قاطع إلى ضرورة إعادة صياغة إدخال هذا المتغير تحديداً، كإضافة الحد التربيعي الخاص به أو تحويله إلى مقياس لوغاريتمي، مما يرفع من جودة التخصيص الرياضي للنموذج الكلي بصورة دقيقة وموجهة.

9. اختبار افتراضات الانحدار الخطي المعتمدة على البواقي

9.1 اختبار تجانس التباين للبواقي (Homoscedasticity)

يُعد افتراض تجانس التباين (Homoscedasticity) من الركائز البنيوية لطريقة المربعات الصغرى، ويعني أن تباين البواقي يجب أن يظل ثابتاً عند جميع مستويات القيم المتوقعة أو المتغيرات التفسيرية. يؤدي انتهاك هذا الافتراض وظهور مشكلة عدم تجانس التباين (Heteroscedasticity) إلى فقدان الأخطاء المعيارية لكفاءتها وصلاحيتها للاستدلال، مما يجعل اختبارات الدلالة وفترات الثقة مضللة وغير دقيقة.

يتيح برنامج ستاتا اختبار هذا الافتراض بصرامة عبر الأمر التشخيصي estat hettest، والذي ينفذ اختبار “بروش-باغان” (Breusch-Pagan Test) واختبار “كوك-وايزبرغ”. يختبر هذا الإجراء الفرضية الصفرية القائلة بأن التباين ثابت؛ وبالتالي فإن الحصول على قيمة احتمالية (p-value) أصغر من 0.05 يقود إلى رفض الفرضية الصفرية وتأكيد وجود مشكلة عدم تجانس التباين في النموذج.

كما يوفر ستاتا اختبار “وايت” الأكثر عمومية والذي لا يشترط التوزيع الطبيعي للبواقي ويأخذ في الحسبان التأثيرات غير الخطية والتفاعلية، ويُنفذ بكتابة: estat imtest, white. وفي حال ثبوت عدم تجانس التباين، يتعين على الباحث استخدام الأخطاء المعيارية الحصينة عبر الخيار vce(robust) أو استخدام نماذج المربعات الصغرى المعممة (GLS) لضبط التباينات واستعادة كفاءة التقدير.

9.2 اختبار استقلالية الأخطاء وعدم وجود ارتباط ذاتي

ينص افتراض استقلالية الأخطاء على أن البواقي المقابلة لأي مشاهدة معينة يجب ألا ترتبط بالبواقي المقابلة للمشاهدات الأخرى. تبرز مشكلة الارتباط الذاتي (Autocorrelation) بصفة خاصة عند تحليل البيانات ذات الطبيعة الزمنية أو السلاسل الطولية والبيانات المقطعية المتكررة في الأبحاث النفسية والتربوية متكررة القياس، مما يؤدي إلى التقليل المصطنع من الأخطاء المعيارية وتضخيم الدلالة الإحصائية الزائفة.

يختبر الباحث وجود الارتباط الذاتي من الدرجة الأولى في ستاتا باستخدام اختبار “دربن-واتسون” الشهير عبر الأمر: estat dwatson (بعد تهيئة هيكل السلسلة الزمنية باستخدام الأمر tsset). تقترب القيمة المثالية للمؤشر من 2 في حالة غياب الارتباط الذاتي، بينما تشير القيم القريبة من الصفر إلى ارتباط ذاتي موجب قوي، والقيم القريبة من 4 إلى ارتباط ذاتي سالب.

ولإجراء اختبار أكثر شمولاً يتيح فحص رتب عليا من الارتباط الذاتي ويتعامل بكفاءة مع وجود فترات إبطاء للمتغير التابع، يوفر ستاتا اختبار “بروش-غودفري” عبر الأمر: estat bgodfrey, lags(p). وعند الكشف عن وجود الارتباط الذاتي، يتم الانتقال إلى استخدام أساليب الانحدار الذاتي ونماذج السلاسل الزمنية الحصينة مثل مقدرات “نيوي-ويست” عبر الأمر newey لتصحيح مصفوفة التباين.

9.3 اختبار التخصيص الرياضي للنموذج (Model Specification)

يرتبط اختبار التخصيص الرياضي بمدى نجاح الباحث في تضمين كافة المتغيرات المفسرة الجوهرية وتحديد الشكل الدالي الصحيح للعلاقة (خطية، أسية، تفاعلية). يؤدي خطأ التخصيص الناتج عن حذف متغير مؤثر أو إهمال حدود غير خطية إلى تحيز معاملات الانحدار وعدم اتساقها، وتشويه بنية البواقي المستخرجة بشكل جذري.

يُنفذ ستاتا اختبار “رامسي ريسيت” الشهير للتحقق من خطأ التخصيص عبر الأمر المباشر: estat ovtest. يقوم هذا الاختبار بإنشاء قوى متعددة للقيم المتوقعة (مثل المربع والمكعب) وإعادة إدخالها كمتغيرات تفسيرية مساعدة في النموذج لاختبار ما إذا كانت تسهم في تفسير التباين المتبقي بشكل دال إحصائياً.

تتمثل الفرضية الصفرية لاختبار “ريسيت” في أن النموذج لا يعاني من متغيرات مهملة وأن الشكل الدالي صحيح تماماً. إذا كانت القيمة الاحتمالية الناتجة (p-value) أكبر من 0.05، يتم قبول الفرضية الصفرية وتأكيد سلامة التخصيص؛ أما في حال انخفاضها عن ذلك، يصبح لزاماً على الباحث إعادة النظر في بناء النموذج النظري وإضافة حدود القوى الرياضية أو مراجعة المتغيرات التفسيرية المحذوفة.

10. كشف وتشخيص الحالات الشاذة والمؤثرة في ستاتا

10.1 حساب مسافة كوك (Cook’s Distance) لتقييم التأثير الإجمالي

تُعد مسافة كوك (Cook’s Distance) المقياس الإحصائي الأكثر استخداماً في تقييم التأثير الشامل لكل مشاهدة على كامل المعاملات التقديرية للنموذج مجتمعة. تدمج مسافة كوك رياضياً بين بعدين رئيسيين: حجم باق النقطة (مدى تطرفها في المتغير التابع) ومقدار رافعتها (مدى تطرفها في فضاء المتغيرات المستقلة).

يتم استخراج وحساب مسافة كوك في ستاتا مباشرة بعد تشغيل الانحدار عبر كتابة الأمر: predict cook_d, cooksd، مما ينشئ متغيراً كمياً يحتوي على قيمة المسافة لكل حالة في قاعدة البيانات. تشير مسافة كوك الكبيرة إلى أن استبعاد تلك المشاهدة المحددة من التحليل سيؤدي إلى تغير جذري في قيم معاملات الانحدار المقدرة ونتائج التنبؤ.

تتعدد القواعد المرجعية لتحديد القيم الحرجة لمسافة كوك؛ فالقاعدة الكلاسيكية الصارمة تعتبر أي قيمة تتجاوز 1.0 مؤشراً على تأثير خطر وحاد، في حين تعتمد الأبحاث الحديثة على العتبة النسبية الأكثر حساسية المحسوبة بالمعادلة: 4 مقسومة على حجم العينة الكلي (4/n). يُنصح الباحث باستعراض المشاهدات التي تتجاوز هذه العتبة باستخدام أمر الترتيب والفحص: list if cook_d > (4/_N) لتدقيق طبيعتها وفهم أسباب تأثيرها البالغ.

10.2 حساب قيم الرافعة (Leverage / Hat Values)

يقيس مؤشر الرافعة (Leverage)، والمعروف بقيم عناصر قطر مصفوفة القبعة (Hat Values)، مدى ابتعاد قيم المتغيرات المستقلة لمشاهدة معينة عن المتوسطات الحسابية لمتجهات تلك المتغيرات في العينة. تعكس الرافعة قدرة النقطة على جذب مستوى الانحدار نحوها نتيجة لموقعها المتطرف والمستقل في الفضاء متعدد الأبعاد، بغض النظر عن قيمة المتغير التابع لتلك النقطة.

يتم توليد قيم الرافعة في ستاتا باستخدام أمر التنبؤ المقرون بخيار الرافعة: predict lev, leverage أو بالصيغة البديلة predict lev, hat. تتراوح قيم الرافعة دائماً بين مقلوب حجم العينة (1/n) والواحد الصحيح، ويبلغ متوسط قيم الرافعة لجميع المشاهدات رياضياً حاصل قسمة عدد المعلمات المقدرة في النموذج بما فيها الثابت (k) على حجم العينة (k/n).

لتشخيص الحالات التي تتمتع برافعة مفرطة، تُستخدم العتبة المرجعية الشائعة المتمثلة في ضعفي أو ثلاثة أضعاف متوسط الرافعة (2k/n أو 3k/n). كما يوفر ستاتا رسماً بيانياً تشخيصياً عبقرياً يدمج بين تباين البواقي المربعة وقيم الرافعة في مخطط واحد عبر الأمر: lvr2plot، والذي يقسم الشكل إلى أربعة أرباع لتصنيف الحالات فورياً إلى حالات شاذة فقط، أو ذات رافعة فقط، أو نقاط نفوذ وتأثير حرج تجمع بين الرافعة العالية والباقي المتطرف.

10.3 تشخيص DFBETA و DFFITS لتأثير المشاهدات على المعاملات الفردية

بينما تقيس مسافة كوك التأثير الإجمالي على النموذج ككل، يبرز مؤشر DFBETA كأداة تشخيصية دقيقة للغاية تتيح معرفة مقدار التغير الذي يطرأ على معامل انحدار متغير مستقل محدد عند استبعاد مشاهدة معينة من العينة، مقاساً بوحدات الخطأ المعياري للمعامل.

يتم توليد مقاييس DFBETA في ستاتا لجميع المتغيرات المستقلة دفعة واحدة عبر تنفيذ الأمر المباشر: dfbeta. يقوم هذا الإجراء بإنشاء متغيرات جديدة في قاعدة البيانات تحمل البادئة _dfbeta_ متبوعة برقم أو اسم كل متغير تفسيري. تُعد المشاهدة ذات تأثير مخل على معامل متغير معين إذا تجاوزت القيمة المطلقة لمؤشر DFBETA العتبة الحرجة الموصى بها إحصائياً وهي: 2 مقسومة على الجذر التربيعي لحجم العينة (2/sqrt(n)).

أما مؤشر DFFITS فيقيس عدد الانحرافات المعيارية التي تتغير بها القيمة المتوقعة للحالة ذاتها عند حذفها من بناء النموذج، ويُستخرج بالأمر predict dff, dffits مع عتبة حرجة تساوي 2 مضروبة في الجذر التربيعي لـ (k/n). من الناحية الأخلاقية والمنهجية في أبحاث العلوم النفسية والاجتماعية، يحظر حذف هذه الحالات المؤثرة تعسفياً لمجرد تحسين نتائج الدلالة؛ بل يجب التحقق من خلوها من أخطاء الرصد والترميز أولاً، وإجراء تحليل الحساسية (Sensitivity Analysis) بمقارنة نتائج النماذج مع وبدون هذه الحالات لضمان نزاهة وموثوقية التقرير العلمي.

11. الأخطاء الشائعة وأفضل الممارسات البرمجية والمنهجية

11.1 أخطاء الترتيب والتسلسل البرمجي في ستاتا

يقع العديد من الباحثين في أخطاء برمجية شائعة تنشأ من عدم الإدراك الدقيق لطبيعة عمل ستاتا كبيئة معالجة تتبعية تعتمد على الذاكرة الحية. من أبرز هذه الأخطاء محاولة تنفيذ أمر predict لاستخراج القيم المتوقعة أو البواقي بعد تنفيذ أوامر وصفية أو اختبارات إحصائية أخرى تسببت في مسح نتائج الانحدار السابقة من الذاكرة اللحظية (e-returns)، مما يؤدي إلى ظهور رسالة الخطأ الشهيرة “last estimates not found”.

لتفادي هذا الخطأ، يجب الالتزام الصارم بتنفيذ كافة أوامر التنبؤ وحساب البواقي والتشخيصات البيانية التابعة للأمر regress مباشرة ودون أي فواصل لأوامر أخرى تعدل الذاكرة النشطة. كما يمكن استخدام ميزة تخزين التقديرات عبر الأمر estimates store model1 ثم استرجاعها لاحقاً عند الحاجة للتنبؤ عبر الأمر estimates restore model1 لضمان الاتساق البرمجي الكامل.

من الأخطاء المتكررة أيضاً محاولة تسمية المتغير الجديد باسم موجود مسبقاً في قاعدة البيانات، مما يوقف تنفيذ ملف Do-file فجأة. يُعالج ذلك إما باختيار أسماء فريدة ومعبرة لكل نموذج، أو باستخدام أمر إسقاط المتغير القديم capture drop varname قبل سطر التنبؤ لضمان تشغيل الأكواد البرمجية بصورة انسيابية وآلية دون توقف.

11.2 الخلط بين القيم المتوقعة في النماذج الخطية وغير الخطية

يتطلب التحليل الإحصائي المتقدم تمييزاً دقيقاً بين صياغة التنبؤ في نماذج الانحدار الخطي العادي (OLS) ونماذج الانحدار غير الخطية ذات المتغيرات التابعة المحدودة، مثل الانحدار اللوجستي (Logistic Regression) أو انحدار بروبيت وبواسون. فالاستخدام الافتراضي لأمر predict y_hat بعد أمر logit يولد افتراضياً احتمالات الوقوع التنبؤية (Probabilities) المقيدة بين 0 و 1 (خيار pr)، وليس المؤشر الخطي المجرد.

إذا رغب الباحث في الحصول على القيمة التنبؤية الخطية (Log-odds) في النماذج اللوجستية، يتعين عليه التصريح بخيار المؤشر الخطي صراحة: predict xb_score, xb. كما أن مفهوم البواقي يختلف جذرياً في النماذج اللوجستية وغير الخطية، حيث تتعدد أنواع البواقي لتشمل بواقي بيرسون (Pearson Residuals) وبواقي الانحراف (Deviance Residuals)، وتُستخرج بخيارات مخصصة مثل predict res_dev, deviance.

إن تطبيق المفاهيم الخطية الكلاسيكية للبواقي على النماذج اللوجستية يؤدي إلى استنتاجات تشخيصية خاطئة؛ نظراً لأن البواقي في البيانات الثنائية تكون بالضرورة غير متجانسة التباين بطبيعتها البنيوية، مما يستوجب استخدام الأدوات الرسومية والتشخيصية المصممة خصيصاً لتلك العائلة من النماذج لتفادي الوقوع في التفسيرات المضللة.

11.3 أفضل الممارسات في كتابة الشيفرات البرمجية وتوثيق التحليل

تقتضي الرصانة الأكاديمية اتباع أفضل الممارسات البرمجية عند العمل على برنامج ستاتا لضمان كفاءة التحليل وقابلية النتائج للمراجعة والتدقيق المستقل. يرتكز ذلك على كتابة ملفات Do-Files مهيكلة بوضوح، تبدأ بتحديد مسارات العمل، وإعداد الذاكرة، وفتح ملفات السجل (Logs)، مع تقسيم التحليل إلى أقسام منطقية تفصل بين استكشاف البيانات، وتقدير النماذج، واستخراج البواقي، والتشخيص.

يجب تضمين التعليقات التوضيحية التفصيلية (Comments) باستخدام علامات التعليق البرمجية (* أو //) لشرح الأساس النظري لكل خطوة والخيارات الإحصائية المستخدمة. كما يُنصح بكتابة أكواد برمجية ديناميكية ومؤتمتة باستخدام التكرارات الحلقية (Loops) والمتغيرات المحلية (Locals) عند التعامل مع نماذج متعددة أو متغيرات كثيرة لتجنب أخطاء النسخ واللصق اليدوي.

علاوة على ذلك، ينبغي إجراء مقارنة منهجية بين النماذج المختلفة وحفظ المؤشرات التشخيصية لكل نموذج في جداول موحدة تتيح المفاضلة المنهجية الشفافة بين النماذج الأولية والنماذج المعدلة بعد التعامل مع الحالات الشاذة، وهو ما يرتقي بالبحث العلمي إلى أعلى مراتب الجودة والاعتمادية الأكاديمية.

12. دراسة حالة تطبيقية متكاملة وكتابة تقرير النتائج الأكاديمي

12.1 تطبيق شامل: من استيراد البيانات إلى استخراج وتحليل البواقي

لتطبيق كافة المفاهيم المشروحة في سياق عملي متكامل، نفترض سيناريو بحثي يستهدف دراسة محددات كفاءة استهلاك الوقود للمركبات (mpg) كدالة في وزن السيارة (weight)، ومعدل التروس (gear_ratio)، ومصدر التصنيع (foreign)، باستخدام قاعدة بيانات ستاتا المدمجة. يوضح الكود التتابعي التالي المسار التطبيقي الشامل من التقدير إلى استخراج كافة المتغيرات التشخيصية:

يبدأ الباحث بتحميل البيانات وتشغيل الانحدار عبر الأوامر: sysuse auto, clear ثم regress mpg weight gear_ratio i.foreign. فور ظهور المخرجات، يتم توليد القيم المتوقعة وأخطائها المعيارية: predict mpg_hat, xb متبوعاً بـ predict mpg_se, stdp. بعد ذلك يتم استخراج حزمة البواقي المتنوعة: predict e_raw, residuals للبواقي الخام، و predict e_std, rstandard للبواقي المعيارية، و predict e_stud, rstudent لبواقي ستيودنت المحذوفة.

تكتمل خطوة الاستخراج بحساب مقاييس النفوذ والتأثير: predict cook_dist, cooksd و predict hat_lev, leverage. يلي ذلك تنفيذ حزمة التشخيص البياني والاختبارات الإحصائية عبر الأوامر: rvfplot, yline(0) لرسم البواقي مقابل التنبؤات، و qnorm e_stud لفحص التوزيع الطبيعي، متبوعة باختبار بروش-باغان لتجانس التباين estat hettest، واختبار التخصيص estat ovtest، مما يوفر قاعدة بيانات تشخيصية متكاملة جاهزة للتحليل والتوثيق.

12.2 تصدير النتائج والجداول إلى برامج المعالجة الإحصائية والمكتبية

يمثل التصدير الآلي والمنسق للمخرجات الإحصائية مهارة حيوية للباحث المتميز؛ إذ يجنب الباحث الوقوع في أخطاء النقل اليدوي ويوفر الوقت والجهد في إعداد الجداول وفق المعايير الأكاديمية. يوفر ستاتا حزمة من الأوامر الخارجية الشائعة للتصدير المباشر إلى برامج ميكروسوفت وورد (Word) وإكسل (Excel) ولاتك (LaTeX)، ومن أبرزها حزمة outreg2 وحزمة asdoc وحزمة esttab / estout.

لتصدير جدول الانحدار المفصل مع الإحصاءات التشخيصية ومعاملات التحديد بضغطة زر واحدة، يمكن استخدام الأمر: esttab using regression_table.rtf, replace se r2 ar2 f obslast star(* 0.10 ** 0.05 *** 0.01). يقوم هذا الأمر بإنشاء مستند منسق بالكامل يحتوي على المعاملات والأخطاء المعيارية ومستويات الدلالة المرمزة بالنجوم بصورة جاهزة للطباعة والتضمين في مسودة البحث.

كما يمكن تصدير المتغيرات المستخرجة (القيم المتوقعة، البواقي، ومسافات كوك) إلى ملفات إكسل مخصصة لمزيد من التحليل الوصفي أو مشاركتها في الملاحق البحثية عبر الأمر: export excel make mpg mpg_hat e_stud cook_dist using diagnostic_data.xlsx, firstrow(variables) replace. كما تُحفظ الرسوم البيانية بدقة نشر عالية (Vector/TIF/PNG) باستخدام خيار الحفظ الرسومي: graph export “rvf_plot.png”, as(png) width(2400) replace لضمان وضوح الشكل في المجلات المطبوعة.

12.3 صياغة التقرير الإحصائي وفق معايير الجمعية الأمريكية لعلم النفس (APA)

تتطلب معايير الجمعية الأمريكية لعلم النفس (APA Style – 7th Edition) تقديم تقرير دقيق وشامل يجمع بين عرض النتائج الكمية للنموذج وتوثيق التحقق الصارم من الافتراضات الإحصائية وتشخيص البواقي. لا يكفي في النشر الأكاديمي الرصين ذكر المعاملات وقيم الدلالة فقط، بل يجب إبراز إجراءات فحص النموذج المتبعة لطمأنة القارئ والمحكم حول سلامة وموثوقية النتائج.

فيما يلي نموذج تطبيقي لصياغة تقرير إحصائي متكامل لنتائج الانحدار والتشخيص:

“تم إجراء تحليل انحدار خطي متعدد للتنبؤ بكفاءة استهلاك الوقود بالاعتماد على وزن المركبة، ونسبة التروس، ومصدر التصنيع. أظهرت النتائج أن النموذج ككل يمتلك دلالة إحصائية عالية، F(3, 70) = 47.90, p < .001، ويفسر ما نسبته 67.2% من التباين الكلي في استهلاك الوقود (R² = .672, R²_adj = .658). ارتبط وزن المركبة سلبياً وبدلالة إحصائية بكفاءة الوقود (B = -0.006, SE = 0.001, t = -8.78, p < .001, 95% CI [-0.008, -0.005])، مما يشير إلى انخفاض الكفاءة بمقدار 0.006 ميل/غالون لكل زيادة في الوزن بمقدار رطل واحد مع تثبيت المتغيرات الأخرى."

“تم فحص افتراضات الانحدار الخطي بدقة عبر تحليل البواقي المشتقة. أظهر الفحص البصري لمخطط البواقي مقابل القيم المتوقعة (rvfplot) توزيعاً عشوائياً متماثلاً للنقاط حول الصفر، وأكد اختبار بروش-باغان تحقق افتراض تجانس التباين، χ²(1) = 0.42, p = .518. كما أظهر مخطط المئين الطبيعي (Q-Q plot) لبواقي ستيودنت المحذوفة التزاماً وثيقاً بالاعتدالية. وأظهر تشخيص الحالات المؤثرة عبر مسافة كوك وقيم الرافعة عدم وجود أي مشاهدة تتجاوز العتبات الحرجة الموصى بها (جميع قيم Cook’s D < 0.15)، مما يؤكد استقرار النموذج التقديري وصلاحيته للاستدلال والتعميم الأكاديمي."

خاتمة

يمثل استخراج وتشخيص القيم المتوقعة والبواقي في برنامج ستاتا حلقة الوصل الحاسمة بين النظرية الإحصائية المجردة والتطبيق البحثي الرصين. إن الاعتماد الأعمى على معاملات الانحدار دون الغوص في بنية البواقي وفحص سلوك القيم التنبؤية يعرض الباحث لمخاطر الوقوع في استنتاجات مضللة ونتائج زائفة قد تنهار عند تطبيقها العملي. تمنح أوامر ستاتا المرنة والمتقدمة، بدءاً من الأمر المحوري predict بمختلف خياراته، مروراً بحزم التشخيص البياني مثل rvfplot و lvr2plot، وصولاً إلى الاختبارات الاستدلالية المتقدمة مثل hettest و ovtest، قدرة فائقة على إحكام السيطرة المنهجية على النماذج الإحصائية وتطويرها باستمرار، مما يضمن في نهاية المطاف تقديم أبحاث علمية تتسم بأعلى درجات الصدق والدقة والأمانة المنهجية.

References

اقتباس هذا المقال

looti, M. (2026, أغسطس 26). كيفية الحصول على القيم المتوقعة والبواقي في برنامج ستاتا. عرب سايكلوجي. https://arabpsychology.com/statistics/how-to-obtain-predicted-values-and-residuals-in-stata/
looti, Mohammed. “كيفية الحصول على القيم المتوقعة والبواقي في برنامج ستاتا.” عرب سايكلوجي, 26 أغسطس 2026, https://arabpsychology.com/statistics/how-to-obtain-predicted-values-and-residuals-in-stata/.
looti, Mohammed. “كيفية الحصول على القيم المتوقعة والبواقي في برنامج ستاتا.” عرب سايكلوجي. أغسطس 26, 2026. https://arabpsychology.com/statistics/how-to-obtain-predicted-values-and-residuals-in-stata/.