يمثل التحليل الإحصائي ركيزة أساسية لا غنى عنها في منهجية البحث العلمي المعاصر عبر مختلف التخصصات، بدءاً من العلوم الاقتصادية والمالية ووصولاً إلى العلوم الاجتماعية والسلوكية والطبية. وفي قلب هذه المنظومة التحليلية، يبرز نموذج الانحدار الخطي البسيط (Simple Linear Regression) كأحد أكثر الأساليب الكمية رسوخاً وأوسعها تطبيقاً لدراسة العلاقات السببية والتفسيرية بين المتغيرات. لا يقتصر دور هذا النموذج على مجرد قياس مدى اقتران ظاهرة بأخرى، بل يمتد إلى بناء صياغة رياضية محكمة تتيح للباحثين فهم آليات التأثير المتبادل والتنبؤ بالقيم المستقبلية للمتغير التابع بدقة إحصائية قابلة للقياس والتقييم.
وعلى الرغم من البساطة الظاهرية لمعادلة الخط المستقيم، فإن التطبيق الرصين لانحدار المربعات الصغرى العادية يتطلب إدراكاً عميقاً للأسس النظرية والافتراضات الإحصائية الكامنة وراء التقدير. إن أي انحراف عن هذه الافتراضات، مثل وجود التباين غير المتجانس أو غياب الخطية، قد يؤدي إلى نتائج مضللة وفقدان الاستدلال الإحصائي لموثوقيته وصلاحيته. من هنا، تبرز الحاجة إلى استخدام بيئة برمجية متطورة توفر للباحث ليس فقط أدوات التقدير السريع، بل حزمة متكاملة من الاختبارات التشخيصية وأدوات التمثيل البياني ومعالجة البيانات المعقدة بكفاءة ومرونة عالية.
يعد برنامج ستاتا (Stata) أحد المعايير الذهبية في التحليل الإحصائي والاقتصادي القياسي لدى المؤسسات الأكاديمية والمراكز البحثية العالمية. يتميز هذا البرنامج ببيئة عمل تجمع بين سهولة الأوامر النصية المباشرة والقدرة الفائقة على أتمتة الإجراءات عبر ملفات الأوامر المتخصصة، مما يضمن أعلى معايير الشفافية وقابلية إعادة الإنتاج في البحث العلمي. يهدف هذا الدليل الشامل والمطول إلى تقديم مرجع أكاديمي وتطبيقي متكامل لإجراء وتشخيص وتفسير وتوثيق الانحدار الخطي البسيط باستخدام برنامج ستاتا، مستعرضاً أدق التفاصيل النظرية والبرمجية من البداية وحتى مرحلة نشر النتائج في الدوريات العلمية المحكمة.
- 1. مقدمة إلى الانحدار الخطي البسيط وأهميته في التحليل الإحصائي
- 2. الافتراضات الإحصائية الأساسية لنموذج الانحدار الخطي البسيط
- 3. إعداد بيئة العمل وتحميل البيانات في ستاتا
- 4. التحليل الاستكشافي والإحصاء الوصفي للمتغيرات
- 5. التمثيل البصري واستكشاف العلاقات الخطية بيانيًا
- 6. تنفيذ أمر الانحدار الخطي البسيط في ستاتا
- 7. قراءة وتفسير مخرجات جدول تحليل التباين (ANOVA Table)
- 8. تفسير المعلمات وفترات الثقة والاختبارات التائية (t-tests)
- 9. تقييم جودة التوفيق الإحصائي والمؤشرات التنبؤية للنموذج
- 10. التشخيص الإحصائي للنموذج واختبار البواقي في ستاتا
- 11. معالجة المشكلات القياسية والقيم الشاذة والمؤثرة
- 12. توثيق وكتابة نتائج الانحدار الخطي وفق معايير APA وتصدير الجداول
- خاتمة شاملة وآفاق تطبيقية
- References
1. مقدمة إلى الانحدار الخطي البسيط وأهميته في التحليل الإحصائي
1.1 التعريف الرياضي والإحصائي لنموذج الانحدار الخطي البسيط
يُعرَّف نموذج الانحدار الخطي البسيط رياضياً بأنه الأسلوب الإحصائي الذي يسعى إلى صياغة وتفسير العلاقة الخطية بين متغيرين كميين مستمرين: المتغير التابع (Dependent Variable) ويُرمز له بالرمز $Y$، وهو المتغير المراد التنبؤ بسلوكه أو تفسير تباينه، والمتغير المستقل أو التفسيري (Independent/Explanatory Variable) ويُرمز له بالرمز$X$. تصاغ المعادلة القياسية للنموذج في مجتمع الدراسة على النحو التالي:
$$Y_i = \beta_0 + \beta_1 X_i + \epsilon_i$$
حيث يمثل $Y_i$ قيمة المتغير التابع للمشاهدة رقم $i$، ويمثل$X_i$ قيمة المتغير المستقل لنفس المشاهدة. أما $\beta_0$ فهو المعلمة الثابتة للنموذج (Intercept أو Alpha)، والتي تعبر عن القيمة المتوقعة للمتغير التابع عندما تنعدم قيمة المتغير المستقل تماماً ($X = 0$). بينما يمثل $\beta_1$ معامل الميل الزاوي أو معامل الانحدار (Slope أو Beta)، وهو المعلمة الأكثر أهمية من الناحية التفسيرية، إذ يقيس مقدار التغير الحدي المتوقع في متوسط قيمة $Y$ لكل تغير بمقدار وحدة قياس واحدة في $X$.
يشكل حد الخطأ العشوائي ($\epsilon_i$ – Error Term) ركناً جوهرياً في بنية النموذج الإحصائي؛ فهو يلتقط كافة التأثيرات غير المشاهدة على المتغير التابع، وأخطاء القياس الميدانية، والاضطرابات العشوائية الطبيعية الكامنة في السلوك البشري أو الظواهر الطبيعية. إن وجود هذا الحد هو ما يحول العلاقة الرياضية من علاقة قطعية حتمية (Deterministic) إلى علاقة إحصائية احتمالية (Stochastic). وفي إطار العينة المسحوبة، نقوم بتقدير المعلمات المجهولة في المجتمع ($\beta_0$ و $\beta_1$) للحصول على القيم التقديرية ($\hat{\beta}_0$ و $\hat{\beta}_1$)، لتصبح المعادلة التقديرية:
$$\hat{Y}_i = \hat{\beta}_0 + \hat{\beta}_1 X_i$$
ومن الضروري جداً التمييز الجوهري بين تحليل الارتباط الخطي (Correlation) ونمذجة الانحدار. فالارتباط يقيس فقط قوة واتجاه الاقتران الخطي بين متغيرين متناظرين، دون افتراض أي علاقة سببية أو تحديد مسبق للمتغير التابع والمتغير المستقل؛ حيث يكون معامل الارتباط متماثلاً تماماً ($r_{xy} = r_{yx}$). في المقابل، يفرض تحليل الانحدار هيكلاً اتجاهياً وتفسيرياً واضحاً، حيث يُفترض أن التغير في $X$ يفسر التغير في $Y$، وبالتالي فإن عكس ترتيب المتغيرات في معادلة الانحدار يؤدي إلى تغيير جذري في قيم المعلمات ودلالاتها الإحصائية.
1.2 تطبيقات الانحدار الخطي في البحوث السلوكية والنفسية والاجتماعية
تعتمد العلوم الإنسانية والسلوكية بصورة مكثفة على نمذجة الانحدار الخطي البسيط لاستكشاف الفرضيات النظرية وتفسير السلوك البشري المعقد. ففي الدراسات النفسية، يُستخدم النموذج بكثرة للتنبؤ بحدة الأعراض النفسية مثل القلق أو الاكتئاب استناداً إلى متغيرات تفسيرية مثل مستويات الضغوط النفسية الحياتية، أو جودة النوم، أو الدعم الاجتماعي المدرك. يتيح الانحدار في هذا السياق تقييم دقيق لقوة الاستجابة وتحديد العتبات الحرجة التي تبدأ عندها التأثيرات السلوكية بالظهور.
أما في الحقل التربوي والتعليمي، فيُوظف الانحدار لقياس حجم التأثير الفعلي لمتغيرات بيئية ومنهجية على التحصيل الأكاديمي للطلاب؛ كقياس أثر عدد ساعات المذاكرة الذاتية، أو نسبة حضور المحاضرات، أو حجم الصف الدراسي على الدرجات النهائية في الاختبارات القياسية. لا يقتصر التحليل هنا على إثبات وجود العلاقة، بل يوفر للباحثين وصناع القرار التربوي أرقاماً دقيقة لحساب العائد المتوقع من الاستثمار في أي برنامج تدخلي أو تعديل تنظيمي.
وفي البحوث الاجتماعية والاقتصادية، يساهم الانحدار في دعم القرارات التنموية والسياسات العامة، مثل تحليل العلاقة بين مستويات الدخل الأسري ومعدلات الإنفاق الصحي أو التعليمي، ودراسة أثر سنوات الخبرة المهنية على الأجور في سوق العمل. إن النمذجة القياسية تمكن الباحثين من صياغة فرضيات علمية صارمة قابلة للاختبار التجريبي، وتوفر إطاراً كمياً متيناً للمقارنة بين النظريات السوسيولوجية المتنافسة واختبار مدى اتساقها مع البيانات الواقعية.
1.3 واجهة برنامج ستاتا (Stata) ومزاياه في التحليلات الإحصائية المتقدمة
يتميز برنامج ستاتا ببيئة عمل احترافية مبنية على التوازن المثالي بين الأوامر النصية المباشرة (Command Syntax) والقوائم الرسومية التفاعلية. تتميز لغة أوامر ستاتا بتركيبة منطقية موحدة ورصينة؛ فمعظم الأوامر تبدأ باسم الإجراء الإحصائي المطلوب يليه المتغير التابع ثم المتغيرات المستقلة متبوعة بالخيارات الإضافية بعد فاصلة. هذه البنية الموحدة تقلل من منحنى التعلم للمبتدئين وتمنح الممارسين سرعة استثنائية في تنفيذ النماذج المعقدة وإجراء التحليلات المتتابعة.
تعد ملفات الأوامر التلقائية المعروفة باسم ملفات الدو (Do-Files) حجر الزاوية في ممارسات البحث العلمي القابل للتكرار (Reproducible Research) داخل بيئة ستاتا. تتيح هذه الملفات كتابة وتنسيق وتوثيق كافة خطوات تنظيف البيانات والتحليل الإحصائي والتمثيل البياني في ملف نصي قابل لإعادة التشغيل الفوري في أي وقت، مما يتيح للباحثين والمراجعين الأكاديميين التحقق من موثوقية الخطوات الإحصائية بدقة مطلقة وتعديلها بسهولة. كما يدعم البرنامج إنشاء سجلات النتائج التلقائية عبر ملفات السجل (Log-Files)، والتي تحفظ كل المدخلات والمخرجات بصيغ نصية أو منسقة بدقة عالية.
عند مقارنة ستاتا بالحزم البرمجية الإحصائية الأخرى مثل SPSS أو R أو SAS، تبرز قوة ستاتا الفائقة في مجال الاقتصاد القياسي وتقدير نماذج المربعات الصغرى العادية (OLS). يقدم ستاتا كفاءة برمجية عالية في معالجة مصفوفات البيانات الكبيرة، ويوفر حزمة مدمجة وشاملة للغاية من أدوات التشخيص اللاحق، والاختبارات الفرضية المتقدمة، وحساب الأخطاء المعيارية الحصينة بمجرد إضافة خيارات بسيطة لأمر الانحدار، مما يجعله الخيار الأول للمجلات الأكاديمية المرموقة في العلوم الاجتماعية والكمية.
2. الافتراضات الإحصائية الأساسية لنموذج الانحدار الخطي البسيط
2.1 افتراض الخطية واستقلال المشاهدات
يقوم نموذج المربعات الصغرى العادية الكلاسيكي على مجموعة من الافتراضات الرياضية والإحصائية الصارمة المعروفة في الأدبيات بفرضيات غاوس-ماركوف (Gauss-Markov Assumptions). الفرضية الأولى والأساسية هي افتراض الخطية في المعلمات (Linearity in Parameters)؛ ويعني ذلك أن العلاقة الرياضية بين المتغير التابع والقيم المتوقعة للمتغير المستقل يجب أن تأخذ شكلاً خطياً من حيث المعلمات المقدرة ($\beta_0$ و $\beta_1$)، حتى وإن كانت المتغيرات ذاتها قد خضعت لتحويلات غير خطية (مثل اللوغاريتمات أو القوى التربيعية). إذا كانت العلاقة الحقيقية في المجتمع غير خطية (كالعلاقات الأسية أو اللوجستية)، فإن تطبيق الانحدار الخطي يؤدي إلى تحيز منهجي كبير في التقديرات وفشل النموذج في التقاط السلوك الحقيقي للبيانات.
أما الفرضية الثانية فتتعلق بـ استقلال المشاهدات وحدود الأخطاء (Independence of Errors)، والتي تشترط عدم وجود أي ارتباط ذاتي أو تباين مشترك بين الأخطاء العشوائية لأي مشاهدتين مختلفتين ($\text{Cov}(\epsilon_i, \epsilon_j) = 0$ لكل $i \neq j$). يُعد هذا الافتراض حرجاً للغاية، لاسيما في البيانات المقطعية (Cross-sectional Data) التي تفترض أن كل مفردة تم سحبها بطريقة عشوائية ومستقلة تماماً عن المفردات الأخرى في العينة.
يترتب على انتهاك فرضية استقلال الأخطاء (ظاهرة الارتباط الذاتي – Autocorrelation)، الشائعة في بيانات السلاسل الزمنية أو البيانات المجمعة، عواقب وخيمة؛ إذ تصبح تقديرات الأخطاء المعيارية للمعلمات مقومة بأقل من قيمتها الحقيقية بصورة مصطنعة، مما يضخم القيم التائية المحسوبة ويقود الباحث إلى استنتاجات خاطئة حول الدلالة الإحصائية، معلناً وجود تأثيرات ذات دلالة في حين أنها ناجمة عن التداخل الإحصائي غير المعالج.
2.2 افتراض التوزيع الطبيعي للبواقي وثبات التباين
تشترط النظرية الإحصائية الكلاسيكية لنموذج الانحدار أن تتبع حدود الأخطاء العشوائية توزيعاً طبيعياً بمتوسط حسابي يساوي صفراً وتباين ثابت ($\epsilon_i \sim N(0, \sigma^2)$). يُعد افتراض التوزيع الطبيعي للبواقي (Normality of Residuals) شرطاً محورياً لإجراء اختبارات الفروض الاستدلالية بدقة وموثوقية في العينات الصغيرة والمتوسطة، حيث تعتمد صلاحية اختبار فيشر (F-test) للنموذج الكلي واختبارات تاي (t-tests) للمعلمات الفردية على صحة هذا التوزيع. ومع ذلك، وبناءً على نظرية النهاية المركزية (Central Limit Theorem)، فإن هذا الافتراض يصبح أقل حساسية في العينات الكبيرة جداً، حيث تقترب توزيعات العينات للمعلمات من التوزيع الطبيعي تلقائياً.
على النقيض من ذلك، فإن افتراض ثبات تجانس تباين الأخطاء (Homoscedasticity) يمثل ركيزة لا يمكن التهاون معها في أي حجم عينة. يعني تجانس التباين أن التباين الشرطي لحد الخطأ يظل ثابتاً عبر جميع مستويات وقيم المتغير المستقل $X$ ($\text{Var}(\epsilon_i | X_i) = \sigma^2$). عندما ينتهك هذا الشرط، وتظهر ظاهرة عدم تجانس التباين (Heteroscedasticity)، فإن تباين الأخطاء يتغير مع تغير قيم $X$، كما هو الحال الشائع في دراسات الدخل والإنفاق حيث يتزايد تشتت الإنفاق بصورة هائلة لدى أصحاب الدخول المرتفعة.
إن النتيجة المترتبة على عدم ثبات التباين ليست انحياز معاملات الانحدار ذاتها—إذ تظل المعلمات $\hat{\beta}_1$ غير متحيزة—بل تكمن المشكلة في فقدان خاصية الكفاءة (Efficiency)، وتصبح الأخطاء المعيارية التقليدية خاطئة وغير متسقة. يؤدي ذلك إلى تشويه فترات الثقة وحسابات القيم الاحتمالية ($p$-values)، مما يجعل الاعتماد على مخرجات الانحدار العادي أمراً غير علمي ويستوجب تصحيحات قياسية متخصصة.
2.3 مستويات قياس المتغيرات وخلو البيانات من أخطاء القياس الجسيمة
يتطلب نموذج الانحدار الخطي البسيط معايير محددة لمستويات القياس (Levels of Measurement) لضمان المعنى الرياضي للعمليات الحسابية المطبقة. يجب أن يكون المتغير التابع $Y$ مقاساً بمستوى كمي مستمر، أي على مقياس الفترة (Interval Scale) أو مقياس النسبة (Ratio Scale)، بحيث يكون للفروق الحسابية بين القيم معنى رياضي وفيزيائي ثابت. أما المتغير المستقل $X$، فيفضل أن يكون متغيراً كمياً مستمراً أو متقطعاً، كما يمكن أن يكون متغيراً ثنائياً وهمياً (Dummy Variable) مرمزاً برقمي (0 و 1) لتمثيل الفروق بين مجموعتين.
تشكل القيم المتطرفة والشاذة (Outliers) والمشاهدات ذات النفوذ العالي (High Leverage Points) تهديداً كبيراً لسلامة نموذج المربعات الصغرى العادية. ونظراً لأن خوارزمية OLS تعمل على تقليل مجموع مربعات الانحرافات، فإن المشاهدات المتطرفة تكتسب وزناً تربيعياً مضاعفاً قادراً على سحب وإمالة خط الانحدار بقوة نحوها، مما يؤدي إلى تشويه ميل الخط وتزييف قيمة المعلمة الثابتة وتضخيم الخطأ المعياري الكلي للنموذج.
تتضمن استراتيجيات التأكد المسبق من استيفاء البيانات لخصائص المربعات الصغرى العادية تطبيق سلسلة من الفحوصات الاستكشافية قبل تشغيل النموذج النهائي. تشمل هذه الاستراتيجيات فحص مقاييس الالتواء والتفرطح، واستخدام الرسوم الصندوقية ومخططات التشتت لتحديد النقاط المنفصلة عن التوزيع العام، والتأكد من عدم وجود أخطاء في إدخال البيانات والترميز، فضلاً عن تقييم دقة أدوات القياس المستخدمة لتقليل أخطاء القياس العشوائية والمنتظمة.
3. إعداد بيئة العمل وتحميل البيانات في ستاتا
3.1 تحميل مجموعات البيانات الافتراضية والبيانات الميدانية
يوفر برنامج ستاتا بيئة متكاملة وسلسة للتعامل مع البيانات من مصادر متعددة، سواء كانت مخزنة محلياً أو مستدعاة من خوادم النظام التعليمية. لتحميل مجموعات البيانات التدريبية الافتراضية المدمجة في ستاتا، يُستخدم الأمر المباشر sysuse. تُعد قاعدة بيانات السيارات الشهيرة auto.dta من أشهر الأمثلة التطبيقية لتعلم الانحدار، حيث تحتوي على بيانات متنوعة لأسعار وأوزان وكفاءة استهلاك الوقود للمركبات. يمكن تحميل هذه القاعدة ببساطة من خلال كتابة الأمر التالي في شريط الأوامر:
sysuse auto, clear
أما بالنسبة للبيانات الميدانية الخاصة بالباحث والمخزنة بصيغة ستاتا الأصلية (.dta) على القرص الصلب، فيتم استدعاؤها باستخدام الأمر use مصحوباً بالمسار الكامل للملف، مع استخدام الخيار clear لتفريغ الذاكرة الحالية من أي بيانات سابقة تجنباً لحدوث تعارض بين الملفات:
use "C:/Research_Data/survey_data.dta", clear
وفي حال كانت البيانات الميدانية مجمعة عبر استبيانات أو أدوات إلكترونية ومخزنة في ملفات خارجية مثل Microsoft Excel أو ملفات نصية مفصولة بفواصل (CSV)، يوفر ستاتا أوامر استيراد عالية الكفاءة. لاستيراد ملفات الإكسيل يُستخدم أمر import excel مع خيار تحديد السطر الأول كأسماء للمتغيرات (firstrow)، في حين يُستخدم أمر import delimited للتعامل مع ملفات CSV:
import excel "C:/Data/field_data.xlsx", sheet("Sheet1") firstrow clear
import delimited "C:/Data/raw_data.csv", clear
3.2 إدارة مساحة العمل وتوثيق الجلسة الإحصائية
تقتضي المعايير الأكاديمية الصارمة توثيق كل خطوة من خطوات المعالجة الإحصائية لضمان سلامة النتائج وسهولة مراجعتها من قبل اللجان العلمية أو المجلات المحكمة. يبدأ التنظيم الاحترافي لجلسة العمل في ستاتا بإنشاء ملف سجل شامل (Log File) باستخدام الأمر log using، والذي يقوم بحفظ وتوثيق كافة الأوامر المطبقة والمخرجات الناتجة عنها بدقة في ملف نصي دائم على الجهاز:
log using "Regression_Analysis_Log.smcl", replace
يُنصح دائماً بكتابة الأوامر وتنظيمها داخل محرر ملفات الأوامر (Do-File Editor) بدلاً من تنفيذها في سطر الأوامر الفردي. يتيح محرر الدو-فايل تقسيم التحليل إلى أقسام منطقية متبوعة بتعليقات توضيحية باستخدام الرمز // أو *، وتحديد المتغيرات وتجربة النماذج بطريقة منظمة. وقبل البدء في استدعاء البيانات، يُفضل دائماً وضع الأوامر التأسيسية التي تضمن تهيئة بيئة العمل بكفاءة:
clear all
set more off
capture log close
يضمن أمر clear all تنظيف الذاكرة ومصفوفات النتائج بالكامل، بينما يعمل أمر set more off على إيقاف توقف المخرجات الطويلة في شاشة النتائج، مما يسمح للبرنامج بتنفيذ ملف الدو-فايل بأكمله بسلاسة تامة دون الحاجة لضغط مفاتيح المتابعة من قبل المستخدم.
3.3 فحص بنية المتغيرات وترميز البيانات
عقب استيراد البيانات مباشرة، وقبل الشروع في أي معالجة إحصائية، يجب فحص البنية الهيكلية لملف البيانات والتأكد من سلامة ترميز المتغيرات وأنواعها. يُنفذ ذلك عبر أمر التوصيف الشامل describe، والذي يستعرض عدد المشاهدات الكلي ($N$)، وعدد المتغيرات، ونوع تخزين كل متغير (سواء كان رقمياً Numeric مثل float و double، أو نصياً String مثل str20):
describe
إذا كانت المتغيرات الكمية مخزنة كنصوص نتيجة وجود رموز خاصة أثناء الإدخال، فلن يتمكن أمر الانحدار من قراءتها. يتطلب ذلك تنظيفها وتحويلها إلى أرقام حقيقية باستخدام أمر destring مصحوباً بالخيار replace أو generate مع إزالة الرموز غير الرقمية عبر الخيار ignore(). بعد ذلك، تأتي خطوة توثيق المتغيرات عبر إضافة التسميات التعريفية الشارحة (Labels) لتسهيل قراءة المخرجات والجداول الإحصائية لاحقاً:
label variable price "سعر السيارة بالدولار الأمريكي"
label variable weight "وزن المركبة بالرطل"
من الخطوات الحاسمة أيضاً في هذه المرحلة التحقق من مسألة القيم المفقودة (Missing Values). يتعامل ستاتا مع القيم المفقودة في المتغيرات الرقمية كنقطة (.)، والتي يعتبرها البرنامج رياضياً كأكبر رقم ممكن في المقارنات المنطقية. لذا، يجب استخدام أمر misstable summarize لفحص نسب ومواقع القيم المفقودة في المتغيرين التابع والمستقل لتقييم مدى تأثيرها على حجم العينة الفعلي الذي سيشمله نموذج الانحدار لاحقاً وتفادي التحيز الناتج عن الفقدان غير العشوائي للبيانات.
4. التحليل الاستكشافي والإحصاء الوصفي للمتغيرات
4.1 حساب مقاييس النزعة المركزية والتشتت
يعد الإحصاء الوصفي الخطوة التأسيسية التي تمكّن الباحث من تكوين فهم عميق لسلوك وتوزيع المتغيرات المعنية بالدراسة قبل صياغة النموذج الانحداري. في بيئة ستاتا، يُعد الأمر summarize (أو اختصاراً sum) الأداة الأساسية لاستخراج مقاييس النزعة المركزية والتشتت الأولية للمتغيرين التابع والمستقل، بما يشمل عدد المشاهدات الصالحة، والمتوسط الحسابي، والانحراف المعياري، وأدنى وأعلى قيمة مسجلة في البيانات:
summarize price weight
وللحصول على تشخيص إحصائي أكثر دقة وشمولاً، يتم استخدام الخيار التفصيلي detail الملحق بالأمر. يتيح هذا الخيار استخراج مئينات التوزيع التفصيلية (Percentiles)، والوسيط الحسابي (المئين الخمسين)، بالإضافة إلى مقياسي الالتواء (Skewness) والتفرطح (Kurtosis):
summarize price weight, detail
إن فحص مقاييس التفرطح والالتواء يمنح الباحث مؤشراً أولياً وحاسماً حول مدى قرب المتغيرات من التوزيع الطبيعي المتماثل (حيث يقترب معامل الالتواء من الصفر، ويقترب التفرطح من 3 في التوزيع القياسي). إن وجود قيم التواء تتجاوز ($\pm 1$) أو ($\pm 2$) في المتغير التابع يعطي إشارة تحذيرية مبكرة إلى احتمالية الحاجة لتحويلات رياضية، مثل التحويل اللوغاريتمي، لتعديل التوزيع وتجنب مشكلات عدم الخطية وتفاوت التباين في النمذجة اللاحقة.

4.2 فحص توزيع البيانات واكتشاف القيم الشاذة مبدئياً
تتضمن مرحلة التحليل الاستكشافي المتقدم فحص تكرارات البيانات وتحديد مدى وجود تركزات غير طبيعية أو قيم شاذة قد تؤثر بشكل مدمر على تقديرات المربعات الصغرى. بالنسبة للمتغيرات التفسيرية المتقطعة أو الفئوية المرتبطة بالتحليل، يُستخدم أمر الجداول التكرارية tabulate (أو tab) لعرض التكرارات والنسب المئوية والنسب التراكمية لتلك الفئات:
tabulate rep78
كما يعتمد الباحثون على فحص الفروق بين المتوسطات الحسابية والوسائط في مخرجات summarize, detail؛ فوجود فجوة واسعة بين المتوسط والوسيط يعد دليلاً قاطعاً على تأثير القيم المتطرفة الشديدة في أحد ذيلي التوزيع. بالإضافة إلى ذلك، يمكن استخدام قاعدة الانحرافات المعيارية الثلاثة ($\text{Mean} \pm 3 \times \text{SD}$) كمعيار استكشافي أولي لتحديد المشاهدات التي تتجاوز النطاق الطبيعي للبيانات:
summarize price
display r(mean) + 3*r(sd)
display r(mean) - 3*r(sd)
إن رصد هذه الانحرافات الشديدة في مرحلة مبكرة يتيح للباحث تدقيق أصل هذه المشاهدات في البيانات الأولية للتحقق مما إذا كانت ناجمة عن أخطاء إدخال مادية يمكن تصحيحها، أو أنها تمثل حالات حقيقية استثنائية تستدعي تطبيق نماذج انحدار حصينة لا تتأثر بالقيم المتطرفة.
4.3 تقييم معامل الارتباط البسيط (Pearson Correlation)
قبل الشروع في تقدير معادلة الانحدار الخطي، يمثل تقييم قوة واتجاه العلاقة الخطية الأولية بين المتغير التابع والمستقل خطوة تمهيدية أساسية. يُستخدم أمر correlate في ستاتا لإنشاء مصفوفة ارتباط بيرسون (Pearson Correlation Matrix)، والتي تعطي قياساً عددياً مجرداً يتراوح بين -1 و +1 يوضح اتجاه الاقتران ودرجته الخطية:
correlate price weight
وللحصول على معلومات إحصائية أدق تتضمن مستويات الدلالة الإحصائية ($p$-values) المصاحبة لكل معامل ارتباط، يُفضل استخدام أمر الارتباط المزدوج pwcorr (Pairwise Correlation) مع إضافة خيار الدلالة sig:
pwcorr price weight, sig
يعطي معامل الارتباط الإيجابي القوي (مثل $r > 0.50$) دلالة على وجود اقتران طردي ملحوظ بين المتغيرين، مما يشير إلى أن زيادة المتغير المستقل تترافق عموماً مع زيادة المتغير التابع. ومع ذلك، يجب على الباحث التريث وعدم القفز إلى استنتاجات سببية قاطعة بمجرد ثبوت معنوية الارتباط، إذ يقتصر دور هذا التحليل على إثبات الترافق الخطي الأولي، تاركاً لنموذج الانحدار مهمة تحديد حجم الأثر التفسيري وتقدير المعلمات التنبؤية الفعلية في ظل وجود الثابت الإحصائي وحد الخطأ.
5. التمثيل البصري واستكشاف العلاقات الخطية بيانيًا
5.1 إنشاء مخططات التشتت (Scatterplots) في ستاتا
يعد التمثيل البياني الخطوة الأهم للتحقق الحسي والمباشر من طبيعة العلاقة بين المتغيرات قبل بناء النماذج الإحصائية المعقدة. يوفر ستاتا محركاً بيانياً فائق القوة عبر عائلة أوامر twoway. لإنشاء مخطط التشتت الأساسي (Scatterplot) الذي يمثل فيه المحور الرأسي ($Y$) المتغير التابع والمحور الأفقي ($X$) المتغير المستقل، يُستخدم الأمر التالي:
twoway scatter price weight
لإنتاج رسوم بيانية ذات مظهر احترافي جاهز للنشر الأكاديمي، يمكن تخصيص المظهر الجمالي للرسم البياني وتعديل ألوان النقاط وحجمها وتسمية المحاور بدقة وإضافة عنوان رئيسي عبر الخيارات المتقدمة:
twoway (scatter price weight, mcolor(navy%70) msize(medium) msymbol(circle)), title("مخطط التشتت للعلاقة بين وزن السيارة وسعرها") ytitle("سعر السيارة (بالدولار)") xtitle("وزن السيارة (بالرطل)")
يسمح الفحص البصري لمخطط التشتت بالتعرف الفوري على النمط الحاكم للعلاقة: هل تتوزع النقاط على شكل شريط مائل يشير إلى علاقة خطية منتظمة (طردية أو عكسية)؟ أم تأخذ شكلاً منحنياً مقعراً أو محدباً يعكس علاقة غير خطية تستوجب تعديلاً رياضياً؟ أم تتناثر النقاط بشكل عشوائي كروي يدل على غياب أي علاقة ارتباطية واضحة بين المتغيرين؟

5.2 إضافة خط الانحدار الخطي إلى الرسم البياني
لتسهيل قراءة النمط الخطي، يمكن دمج خط الانحدار المقدر بأسلوب المربعات الصغرى فوق مخطط التشتت مباشرة في أمر بياني مركب واحد باستخدام الأداة lfit (Linear Fit):
twoway (scatter price weight, mcolor(navy%60)) (lfit price weight, lcolor(red) lwidth(medthick)), title("خط الانحدار الخطي للعلاقة بين الوزن والسعر") ytitle("السعر") xtitle("الوزن") legend(order(1 "المشاهدات الفعلية" 2 "خط الانحدار المقدر"))
كما يمكن تعزيز هذا الرسم بإضافة مجالات الثقة لخط الانحدار التقديري عند مستوى ثقة 95% عبر استبدال lfit بالأمر lfitci، مما يظهر نطاق عدم التيقن الإحصائي حول الخط التقديري عبر مستويات المتغير المستقل المختلفة:
twoway (scatter price weight, mcolor(gray%50)) (lfitci price weight, clcolor(cranberry) alcolor(cranberry%30)), title("خط الانحدار مع نطاق الثقة 95%")
ولفحص مدى ابتعاد البيانات عن مسار الخطية الحقيقي بدون فرض قيود خطية مسبقة، يوفر ستاتا أداة التوفيق الموضعي اللامعلمي المعروفة باسم لووس (Lowess – Locally Weighted Scatterplot Smoothing). يتيح دمج خط lowess مع خط lfit الكشف البصري الفوري عما إذا كان هناك التواء حاد أو تغير في ميل العلاقة في أطراف التوزيع لا يستطيع الخط المستقيم التقاطه:
twoway (scatter price weight, mcolor(navy%40)) (lfit price weight, lcolor(blue)) (lowess price weight, lcolor(green) lpattern(dash)), legend(order(1 "البيانات" 2 "انحدار خطي" 3 "توفيق موضعي Lowess"))
5.3 الرسوم البيانية المساعدة لفحص توزيع المتغيرات
إلى جانب مخططات التشتت الثنائية، تتطلب المعايير المنهجية إجراء فحص بصري مستقل للتوزيع الهامشي لكل متغير على حدة. يُستخدم أمر المدرج التكراري histogram في ستاتا مع دمج منحنى التوزيع الطبيعي النظري ومنحنى الكثافة اللامعلمي (Kernel Density) لتقييم درجة اعتدالية المتغير بصرياً:
histogram price, normal kdensity title("المدرج التكراري لسعر السيارة مع منحنى الكثافة") xtitle("السعر")
كذلك تعد مخططات الصندوق (Boxplots) عبر أمر graph box وسيلة بصرية بالغة الفعالية لتحديد مواقع الربيعات، ومجال التشتت الربيعي (IQR)، وعزل النقاط التي تعتبر قيماً شاذة خارج حدود السورين الأدنى والأعلى:
graph box price, title("المخطط الصندوقي لتشخيص القيم المتطرفة في السعر")
وعند اكتمال إنتاج هذه الرسوم التوضيحية، يوفر ستاتا أمر graph export لحفظ وتصدير الرسوم البيانية بجودة طباعية عالية (Vector Graphics أو High-Resolution Rasters) بصيغ متعددة مثل PDF و PNG و EPS و TIFF لتضمينها مباشرة في التقارير البحثية والأطروحات العلمية بأعلى المعايير البصرية:
graph export "Scatterplot_Regression.png", as(png) width(2400) height(1600) replace
6. تنفيذ أمر الانحدار الخطي البسيط في ستاتا
6.1 صيغة وقواعد استخدام أمر `regress`
يمثل أمر regress (أو اختصاراً reg) العمود الفقري لإجراء تقدير المربعات الصغرى العادية (OLS) في بيئة ستاتا. يلتزم هذا الأمر بقاعدة نحوية برمجية صارمة لا تقبل التبديل: يُكتب اسم الأمر أولاً، متبوعاً حصراً بالمتغير التابع ($Y$) كأول مدخل، ثم يليه المتغير المستقل ($X$) كمدخل ثانٍ، ومن ثم تتبع الخيارات الإضافية بعد الفاصلة:
regress price weight
إن ارتكاب خطأ شائع بعكس ترتيب المتغيرات داخل الأمر—كأن يكتب الباحث regress weight price—سيؤدي إلى بناء نموذج مختلف تماماً، تصبح فيه كتل الأوزان هي التابع وسعر المركبة هو المفسر، وهو ما ينتج عنه معلمات ومصفوفات تباين تختلف جذرياً في بنيتها الرياضية والتفسيرية عن النموذج الأصلي المنشود.
كما يتيح ستاتا تطبيق النموذج على عينات فرعية محددة من البيانات وفق شروط منطقية واضحة دون الحاجة إلى حذف المشاهدات الأخرى من قاعدة البيانات، وذلك باستخدام العبارة الشرطية if. على سبيل المثال، إذا رغب الباحث في تقدير العلاقة للسيارات الأجنبية الصنع فقط (حيث يرمز المتغير foreign == 1)، يُنفذ الأمر كما يلي:
regress price weight if foreign == 1
6.2 الخيارات المتقدمة الملحقة بأمر الانحدار
يتيح أمر regress في ستاتا تفعيل حزمة واسعة من الخيارات المتقدمة التي تلبي المتطلبات الإحصائية والتحليلية المتخصصة. من أبرز هذه الخيارات الخيار beta، والذي يقوم بحساب وتقديم معاملات الانحدار المعيارية (Standardized Beta Coefficients) إلى جانب المعاملات الأصلية في جدول المخرجات:
regress price weight, beta
تفيد المعاملات المعيارية في إلغاء وحدات القياس الفيزيائية للأبعاد المتغيرة، مما يسمح للباحث بمقارنة القوة النسبية لتأثير المتغيرات بصورة مجردة، وهو أمر بالغ الأهمية عند مقارنة النتائج مع دراسات تجريبية أخرى استخدمت مقاييس مختلفة لذات الظاهرة.
كما يمكن تعديل مستوى فترات الثقة الإحصائية الافتراضية (95%) إلى أي مستوى ثقة آخر، مثل 90% أو 99%، لتلبية متطلبات صرامة البحث التجريبي باستخدام الخيار level(#):
regress price weight, level(99)
وفي التطبيقات البرمجية المتقدمة التي تتضمن إجراء محاكاة مونت كارلو (Monte Carlo Simulations) أو أسلوب إعادة العينات (Bootstrapping)، يمكن استخدام خيارات كتم عرض الجداول مثل noheader أو notable لتسريع معالجة الذاكرة وتقليل الحمل على الشاشة أثناء التكرار البرمجي المتتابع.
6.3 إدارة الذاكرة والنتائج المحفوظة بعد التنفيذ
بمجرد الانتهاء من تنفيذ أمر regress، يقوم ستاتا داخلياً بتخزين كافة المعلمات المحسوبة، وإحصاءات الاختبارات، ودرجات الحرية، ومصفوفة التباين والتباين المشترك (Variance-Covariance Matrix) في الذاكرة المؤقتة للبرنامج تحت ما يسمى بكائنات التقدير التابعة للمصفوفة القياسية e(). لاستعراض القائمة الكاملة لهذه النتائج المخزنة ومسمياتها البرمجية، يُنفذ أمر:
ereturn list
تتيح هذه المصفوفة للمحلل استدعاء أي قيمة إحصائية مباشرة في برامجه الحسابية اللاحقة؛ فعلى سبيل المثال يتم تخزين عدد المشاهدات تحت الرمز e(N)، وقيمة معامل التحديد تحت e(r2)، وقيمة إحصاءة فيشر تحت e(F)، والخطأ المعياري للنموذج تحت e(rmse). كما يمكن الوصول إلى مصفوفة معاملات الانحدار عبر الأمر matrix list e(b) ومصفوفة التباين المشترك عبر matrix list e(V).
وعند بناء نماذج متعددة والمقارنة بينها، يوفر ستاتا إمكانية تجميد وحفظ النموذج بالكامل في الذاكرة الحية باستخدام أمر estimates store (أو est store)، مما يسهل استدعاءه لاحقاً لإنشاء جداول المقارنة المجمعة أو إجراء اختبارات الفروض المقارنة بين النماذج المتداخلة:
regress price weight
estimates store Model_1
7. قراءة وتفسير مخرجات جدول تحليل التباين (ANOVA Table)
7.1 تفكيك مجموع المربعات (Sum of Squares – SS)
يظهر في الجزء العلوي الأيسر من مخرجات أمر regress في ستاتا جدول تحليل التباين (Analysis of Variance – ANOVA)، وهو الجدول المسؤول عن تفكيك التباين الإجمالي للمتغير التابع إلى مكوناته الأساسية. يقوم هذا التحليل على المتطابقة الرياضية الجوهرية لمجموع المربعات:
$$\text{Total SS} = \text{Model SS} + \text{Residual SS}$$
يمثل مجموع مربعات النموذج (Model SS) أو المجموع المفسر بالانحدار (Explained Sum of Squares – ESS)، مقدار التباين والتشتت في قيم المتغير التابع الذي نجح المتغير المستقل $X$ في تفسيره عبر خط الانحدار المقدر. ويحسب رياضياً عبر جمع مربعات الفروق بين القيم التنبؤية والمتوسط العام للبيانات ($\sum (\hat{Y}_i – \bar{Y})^2$). كلما ارتفعت هذه القيمة بالنسبة للمجموع الكلي، دل ذلك على قوة النموذج التفسيرية.
في المقابل، يمثل مجموع مربعات البواقي (Residual SS) أو المجموع غير المفسر (Sum of Squared Errors – SSE)، جزء التباين في المتغير التابع الذي عجز النموذج عن استيعابه، والذي يعزى إلى حد الخطأ العشوائي والاضطرابات غير المشاهدة ($\sum (Y_i – \hat{Y}_i)^2 = \sum e_i^2$). أما مجموع المربعات الكلي (Total SS) فيمثل التباين الإجمالي الخام في المتغير التابع مقاساً حول متوسطه الحسابي ($\sum (Y_i – \bar{Y})^2$).

7.2 حساب درجات الحرية ومتوسط المربعات (Degrees of Freedom & MS)
يقابل كل نوع من مجموع المربعات في جدول ANOVA عمود مخصص لـ درجات الحرية (Degrees of Freedom – df)، والتي تمثل عدد المعلومات المستقلة المتاحة لتقدير كل مكون. في نموذج الانحدار الخطي البسيط، تكون درجات حرية النموذج مساوية دائماً لـ $1$ ($\text{df}_{\text{Model}} = k – 1 = 2 – 1 = 1$) حيث يمثل $k$ عدد معلمات النموذج المقدرة بما فيها الثابت.
أما درجات حرية البواقي فتحسب بالمعادلة ($n – k = n – 2$)، حيث يمثل $n$ حجم العينة الإجمالي؛ ويتم طرح درجتين من الحرية نتيجة استهلاك معلومتين إحصائيتين من العينة لتقدير المعلمتين ($\beta_0$ و $\beta_1$). وتكون درجات الحرية الكلية مساوية دائماً لـ ($n – 1$).
ينتقل الجدول بعد ذلك إلى حساب متوسط المربعات (Mean Square – MS) في العمود التالي، وذلك بقسمة مجموع المربعات المعني على درجات الحرية المقابلة له:
$$\text{MS}_{\text{Model}} = \frac{\text{SS}_{\text{Model}}}{1}$$
$$\text{MS}_{\text{Residual}} = \frac{\text{SS}_{\text{Residual}}}{n – 2} = s^2$$
يمثل متوسط مربعات البوا ($\text{MS}_{\text{Residual}}$) التقدير غير المتحيز لتباين حد الخطأ العشوائي في المجتمع ($\sigma^2$)، ويعد الجذر التربيعي لهذه القيمة هو الخطأ المعياري الكلي للتقدير (Root MSE)، والذي يقيس متوسط تشتت النقاط الفعلية حول خط الانحدار بوحدات قياس المتغير التابع ذاتها.
7.3 تفسير اختبار فيشر الإحصائي (F-Test) والدلالة الكلية للنموذج
يختبر جدول تحليل التباين الفرضية الصفرية الكلية للنموذج ($H_0: \beta_1 = 0$) في مقابل الفرضية البديلة ($H_1: \beta_1 \neq 0$). يتم إجراء هذا الفحص من خلال حساب النسبة الفائية (F-statistic)، والتي تعبر رياضياً عن نسبة التباين المفسر بواسطة النموذج مقارنة بالتباين العشوائي غير المفسر المتبقي في البواقي:
$$F = \frac{\text{MS}_{\text{Model}}}{\text{MS}_{\text{Residual}}}$$
يعرض البرنامج قيمة $F$ المحسوبة في الجزء العلوي الأيمن من المخرجات، متبوعة بالقيمة الاحتمالية المقابلة Prob > F. تمثل هذه القيمة الاحتمالية الدلالة الإحصائية الكلية للنموذج؛ فإذا كانت القيمة الاحتمالية أقل من مستوى المعنوية المحدد سلفاً (عادة $\alpha = 0.05$ أو $0.01$)، يتم رفض الفرضية الصفرية بشكل قاطع.
يعني رفض الفرضية الصفرية لاختبار فيشر أن النموذج ككل يتمتع بقدرة تفسيرية حقيقية ذات دلالة إحصائية، وأن العلاقة المرصودة بين المتغير التابع والمستقل ليست وليدة الصدفة الإحصائية أو خطأ المعاينة العشوائية. وفي حالة الانحدار الخطي البسيط بمتغير مستقل واحد، يتطابق اختبار $F$ رياضياً مع مربع اختبار $t$ للمعامل ($F = t^2$)، مما يعطي نتيجة استدلالية متماثلة تماماً لتقييم معنوية العلاقة.
8. تفسير المعلمات وفترات الثقة والاختبارات التائية (t-tests)
8.1 تفسير الثابت الإحصائي (Constant / Intercept)
يظهر في الجزء السفلي من مخرجات ستاتا جدول تقدير المعلمات، حيث يرمز للثابت الإحصائي بالرمز _cons. يمثل الثابت الإحصائي القيمة المتوقعة لمتوسط المتغير التابع $Y$ عندما تكون قيمة المتغير المستقل $X$ مساوية تماماً للصفر. على سبيل المثال، إذا كان النموذج يقدر سعر المركبة بدلالة وزنها، وكانت قيمة الثابت تساوي $-3965.84$، فهذا يعني رياضياً أن القيمة المتوقعة لسيارة عديمة الوزن (وزنها صفر رطل) هي قيمة سالبة بهذا المقدار.
من الناحية المنهجية، يواجه الباحثون حالتين عند تفسير الثابت: الحالة الأولى أن تكون للصفر في المتغير المستقل دلالة فيزيائية وواقعية ممكنة ضمن نطاق البيانات، وهنا يكون للثابت معنى تطبيقي مباشر ومهم. أما الحالة الثانية—وهي الأكثر شيوعاً—فهي أن تكون قيمة الصفر مستحيلة واقعياً أو تقع بعيداً خارج النطاق الفعلي للمشاهدات (Extrapolation)، كما في مثال أوزان السيارات أو دراسات ضغط الدم؛ وهنا يقتصر دور الثابت على كونه ضابطاً حسابياً وهندسياً يضمن تثبيت خط الانحدار في الفضاء الإحصائي الصحيح ليمر بمتوسطات البيانات ($\bar{Y}, \bar{X}$).
تتم قراءة معنوية الثابت عبر الخطأ المعياري التابع له وقيمة $t$ المحسوبة وقيمتها الاحتمالية. ومع ذلك، يوصي علماء القياس الإحصائي بعدم إسقاط الثابت من النموذج حتى وإن لم يكن ذا دلالة إحصائية ($p > 0.05$)، إلا إذا كانت هناك مبررات نظرية قطعية تفرض مرور الخط بنقطة الأصل، لأن إجبار الخط على المرور بنقطة الأصل يؤدي في حال خطأ الفرضية إلى تحيز هائل في تقدير معامل الميل $\beta_1$ وتشويه قيمة $R^2$.
8.2 تفسير معامل الميل الزاوي (Slope Coefficient)
يمثل معامل الميل الزاوي (المسجل أمام اسم المتغير المستقل في الجدول) جوهر التحليل التفسيري في نموذج الانحدار. يقيس هذا المعامل معدل التغير الحدي المتوقع في المتغير التابع لكل تغير بمقدار وحدة قياس واحدة في المتغير المستقل، مع بقاء العوامل الأخرى ثابتة. فإذا كانت قيمة معامل الوزن weight تساوي $2.044$، فهذا يفسر بأن زيادة وزن السيارة بمقدار رطل إنجليزي واحد تقترن بزيادة متوقعة في سعرها قدرها $2.044$ دولاراً أمريكياً في المتوسط.
تحدد إشارة المعامل الجبرية الاتجاه الهيكلي للعلاقة؛ فالإشارة الموجبة ($+$) تعكس علاقة طردية تصاعدية، حيث يرتفع المتغير التابع بزيادة المتغير المستقل، بينما تعكس الإشارة السالبة ($-$) علاقة عكسية تنازلية، حيث ينخفض التابع كلما ارتفع المستقل. ويجب على الباحث دائماً ربط التفسير بوحدات القياس المستخدمة فعلياً في جمع البيانات لتجنب المبالغة أو سوء فهم حجم التأثير الواقعي.
وفي حال تم استخدام الخيار beta لاستخراج المعاملات المعيارية، يتحول التفسير إلى وحدات الانحراف المعياري؛ حيث يعبر المعامل المعياري عن عدد الانحرافات المعيارية التي يتوقع أن يتغير بها المتغير التابع لكل تغير بمقدار انحراف معياري واحد كامل في المتغير المستقل. يوفر هذا المقياس وسيلة مثالية لتقييم الأهمية النسبية في المقارنات النظرية الواسعة وتوليد مؤشرات موحدة لحجم التأثير (Effect Size).
8.3 تقييم الدلالة الإحصائية الفردية وفترات الثقة (95% CI)
يحتوي جدول المعلمات في ستاتا على أربعة أعمدة رئيسية مخصصة للتحقق الاستدلالي من معنوية كل معلمة مقدرة على حدة:
- الخطأ المعياري (Std. Err.): يقيس مدى الدقة الإحصائية لتقدير المعلمة وتشتت توزيع العينات حول المعلمة الحقيقية في المجتمع. كلما صغر الخطأ المعياري، دل ذلك على كفاءة أعلى ودقة متناهية في التقدير.
- القيمة التائية (t-statistic): تحسب بقسمة المعامل المقدر على خطئه المعياري ($t = \frac{\hat{\beta}}{\text{SE}(\hat{\beta})}$). تمثل هذه القيمة عدد الأخطاء المعيارية التي تبعدها المعلمة المقدرة عن الصفر الافتراضي تحت الفرضية الصفرية ($H_0: \beta = 0$).
- القيمة الاحتمالية ($p$-value المسجلة تحت `P>|t|`): تعبر عن احتمالية الحصول على قيمة تائية مساوية أو أكبر من القيمة المحسوبة في حال كانت الفرضية الصفرية صحيحة تماماً. إذا كانت هذه القيمة أصغر من مستوى الدلالة المعتمد ($p < 0.05$)، نرفض الفرضية الصفرية ونقر بوجود تأثير جوهري ذي دلالة إحصائية.
- فترة الثقة 95% ([95% Conf. Interval]): تمثل المدى العددي الذي يثق الباحث بنسبة 95% أنه يحتوي على القيمة الحقيقية للمعلمة في المجتمع الكلي. يحسب النطاق بالمعادلة ($\hat{\beta} \pm t_{\text{critical}} \times \text{SE}$).
إن المعيار الحاسم في قراءة فترات الثقة هو عدم اشتمال الفترة على القيمة صفر. فإذا كان الحدان الأدنى والأعلى لفترة الثقة موجبين معاً أو سالبين معاً، يُعد ذلك تأكيداً إحصائياً قاطعاً على معنوية التأثير، مما يعزز الثقة في نتائج اختبار الفرضيات ويمنح فهماً واقعياً لنطاق التباين المتوقع للتأثير في المجتمع.
9. تقييم جودة التوفيق الإحصائي والمؤشرات التنبؤية للنموذج
9.1 تفسير معامل التحديد ($R^2$) ومعامل التحديد المعدل ($Adjusted R^2$)
يعد معامل التحديد ($R^2$ – R-squared) المقياس القياسي الأكثر استخداماً لتقييم جودة التوفيق الإحصائي (Goodness of Fit) لنموذج الانحدار. يعبر معامل التحديد عن النسبة المئوية للتباين الإجمالي في المتغير التابع التي استطاع المتغير المستقل تفسيرها وإيضاحها عبر خط الانحدار، ويحسب رياضياً بقسمة مجموع مربعات النموذج على مجموع المربعات الكلي:
$$R^2 = \frac{\text{Model SS}}{\text{Total SS}} = 1 – \frac{\text{Residual SS}}{\text{Total SS}}$$
تتراوح قيمة $R^2$ دائماً بين $0$ و $1$ (أو بين 0% و 100%). فإذا كانت قيمة $R^2 = 0.29$ في نموذج انحدار السعر على الوزن، فهذا يفسر بأن ما يقارب 29% من إجمالي الفروق والتقلبات في أسعار السيارات تعزى وتفسر مباشرة باختلاف أوزانها، بينما تعود النسبة المتبقية (71%) إلى عوامل ومتغيرات أخرى لم تدخل في النموذج، بالإضافة إلى أخطاء القياس والتأثيرات العشوائية.
كما يعرض ستاتا بجانبها قيمة معامل التحديد المعدل (Adj R-squared)، والذي يدخل تصحيحاً رياضياً يأخذ بعين الاعتبار عدد المتغيرات التفسيرية ودرجات الحرية المستهلكة في النموذج:
$$\bar{R}^2 = 1 – \left[ \frac{\text{SS}_{\text{Residual}} / (n – k)}{\text{SS}_{\text{Total}} / (n – 1)} \right]$$
على الرغم من أن الفارق بين $R^2$ و $\bar{R}^2$ يكون طفيفاً جداً في نماذج الانحدار الخطي البسيط بمتغير مستقل واحد، إلا أن معامل التحديد المعدل يكتسب أهمية حاسمة في الانحدار المتعدد، حيث يعاقب النموذج على إضافة متغيرات تفسيرية غير مجدية، متفادياً التضخم الوهمي المستمر الذي يصيب $R^2$ التقليدي كلما زاد عدد المتغيرات بصرف النظر عن دلالتها.
9.2 الخطأ المعياري للنموذج (Root Mean Squared Error – Root MSE)
يظهر مؤشر Root MSE (والذي يعرف أيضاً بالخطأ المعياري للتقدير المعياري $s$) في أعلى الجانب الأيمن من مخرجات ستاتا. يحسب هذا المؤشر بأخذ الجذر التربيعي لمتوسط مربعات البواقي في جدول ANOVA:
$$\text{Root MSE} = \sqrt{\text{MS}_{\text{Residual}}} = \sqrt{\frac{\sum e_i^2}{n – 2}}$$
تكمن الأهمية الاستثنائية لمؤشر Root MSE في أنه يقدم مقياساً مطلقاً لمدى دقة النموذج التنبؤية مقاساً بنفس وحدات قياس المتغير التابع الأصلية، بخلاف معامل التحديد $R^2$ الذي يقدم نسبة نسبية مجردة. يمثل Root MSE متوسط الانحراف أو المسافة الإحصائية النموذجية التي تبتعد بها القيم الحقيقية المشاهدة عن القيم التنبؤية الواقعة على خط الانحدار.
تتجلى الفائدة التطبيقية لهذا المؤشر عند استخدامه لتقييم الدقة التنبؤية؛ فكلما كانت قيمة Root MSE أصغر بالنسبة لمتوسط ومدى المتغير التابع، كان خط الانحدار أكثر إحكاماً والتصاقاً بالبيانات، وكانت التنبؤات الناتجة عن النموذج أكثر موثوقية وأقل عرضة لهوامش الخطأ الواسعة في التطبيقات الميدانية العملية.
9.3 حساب القيم التنبؤية (Fitted Values) والبواقي في ستاتا
عقب تنفيذ أمر الانحدار regress، يتيح ستاتا توليد القيم التنبؤية المحسوبة ($\hat{Y}_i$) وقيم البواقي الإحصائية ($e_i = Y_i – \hat{Y}_i$) لكل مشاهدة في العينة وتخزينها كمتغيرات جديدة في قاعدة البيانات باستخدام الأمر متعدد الأغراض predict. لتوليد القيم التنبؤية، يُستخدم الأمر مصحوباً بالخيار xb (وهو الخيار الافتراضي):
predict price_hat, xb
أما لاستخراج قيم البواقي الإحصائية، والتي تمثل المسافات الرأسية الدقيقة بين كل نقطة مشاهدة وخط الانحدار، فيُنفذ الأمر مع تحديد خيار البواقي residuals (أو res):
predict price_resid, residuals
تسمح هذه الخطوة بمقارنة القيم الأصلية بالقيم المتوقعة واكتشاف المشاهدات التي ينحرف فيها النموذج عن التنبؤ بدقة استثنائية. كما تعد هذه المتغيرات المولدة المادة الخام الأساسية التي ترتكز عليها كافة الاختبارات والتشخيصات القياسية المتقدمة لسلامة النموذج وتحقق افتراضاته الإحصائية.
10. التشخيص الإحصائي للنموذج واختبار البواقي في ستاتا
10.1 فحص اعتدالية توزيع البواقي (Normality of Residuals)
يعد التحقق من التوزيع الطبيعي للبواقي شرطاً جوهرياً لضمان صحة الاختبارات التائية والفائية. يوفر ستاتا منظومة متكاملة من الأدوات البصرية والاختبارات الإحصائية الصارمة لتشخيص هذه الفرضية. بصرياً، يمكن رسم منحنى كثافة البواقي ومقارنته بالتوزيع الطبيعي عبر الأمر:
kdensity price_resid, normal title("توزيع البواقي مقارنة بالتوزيع الطبيعي")
كما يوفر البرنامج مخططات احتمالية متقدمة مثل مخطط الاحتمال الطبيعي pnorm ومخطط التجزيء الطبيعي qnorm. يركز مخطط pnorm على رصد الانحرافات في وسط التوزيع، بينما يختبر qnorm درجة الحساسية والانحراف في ذيول التوزيع (Heavy Tails):
pnorm price_resid
qnorm price_resid
وللانتقال من التقييم البصري إلى التقييم الرقمي الصارم، يقدم ستاتا اختبارات قياسية متقدمة مثل اختبار شابيرو-ويلك (Shapiro-Wilk Test) عبر أمر swilk، واختبار شابيرو-فرانشيا (Shapiro-Francia) عبر أمر sfrancia:
swilk price_resid
تضع هذه الاختبارات فرضية صفرية مفادها أن البواقي تتبع التوزيع الطبيعي ($H_0: \text{Normality}$). بالتالي، فإن الحصول على قيمة احتمالية غير دالة إحصائياً ($p > 0.05$) يعني قبول الفرضية الصفرية واستيفاء النموذج لشرط التوزيع الطبيعي بنجاح تام.
10.2 اختبار تجانس تباين الأخطاء (Heteroscedasticity Tests)
يمثل فحص ثبات التباين أحد أهم مراحل التشخيص القياسي لأي نموذج انحدار. تبدأ هذه العملية بالتشخيص البصري عبر إنشاء مخطط البواقي مقابل القيم التنبؤية (Residuals versus Fitted Plot) باستخدام الأمر المباشر rvfplot:
rvfplot, yline(0) title("مخطط البواقي مقابل القيم التنبؤية لتشخيص تجانس التباين")
إذا كان التباين متجانساً، تتناثر البواقي بشكل عشوائي موحد حول الخط الأفقي الصفري دون اتخاذ أي نمط محدد. أما إذا ظهرت البواقي على شكل “قمع” (Funnel Shape) يتسع تدريجياً مع زيادة القيم التنبؤية، فهذا مؤشر قوي على وجود تفاوت غير متجانس في التباين.
لتأكيد ذلك إحصائياً، يوفر ستاتا أمر estat hettest لتنفيذ اختبار بروش-باغان / كوك-وايزبرغ (Breusch-Pagan / Cook-Weisberg Test):
estat hettest
يختبر هذا الإجراء الفرضية الصفرية القائلة بثبات وتجانس التباين ($H_0: \text{Constant Variance}$). إن الحصول على قيمة احتمالية أصغر من 0.05 ($p < 0.05$) يقود الباحث إلى رفض الفرضية الصفرية وإثبات وجود مشكلة عدم تجانس التباين (Heteroscedasticity). كما يمكن إجراء اختبار وايت العام (White’s Test) الأكثر شمولاً عبر أمر:
estat imtest, white
10.3 فحص خطية النموذج وتحديد مواطن الخطأ في التحديد
للتحقق من استيفاء فرضية الخطية بين المتغير التابع والمستقل وخلو النموذج من أخطاء التحديد الصوري (Model Misspecification)، يوفر ستاتا مخطط البواقي مقابل المتغير التفسيري عبر أمر rvpplot:
rvpplot weight, yline(0) title("مخطط البواقي مقابل وزن السيارة")
يكشف هذا المخطط ما إذا كانت هناك أنماط انحنائية متبقية في البواقي تشير إلى أن العلاقة ليست خطية مستقيمة، بل تتطلب إدخال حدود تربيعية أو تكعيبية للمتغير التفسيري.
ولدعم التشخيص باختبار قياسي صارم، يُنفذ اختبار رامزي لأخطاء تحديد النموذج (Ramsey RESET Test) عبر أمر estat ovtest مباشرة بعد تقدير الانحدار:
estat ovtest
يقوم اختبار RESET بإنشاء قوى تنبؤية إضافية للنموذج ($\hat{Y}^2, \hat{Y}^3, \hat{Y}^4$) ويختبر ما إذا كانت تساهم مجتمعة في تفسير تباين إضافي ذي دلالة إحصائية. الفرضية الصفرية للاختبار هي أن النموذج لا يعاني من متغيرات مهملة وأن الصياغة الخطية صحيحة ($H_0: \text{Model has no omitted variables}$). إذا كانت القيمة الاحتمالية الناتجة أصغر من 0.05، دل ذلك على وجود خطأ في التحديد الهيكلي يستدعي إعادة النظر في الصياغة الرياضية للنموذج وتجربة التحويلات غير الخطية.
11. معالجة المشكلات القياسية والقيم الشاذة والمؤثرة
11.1 كشف النقاط الشاذة والرافعة والمؤثرة (Outliers & Influential Cases)
تنقسم المشاهدات غير الاعتيادية في الانحدار إلى ثلاثة مفاهيم رئيسية: القيم الشاذة (Outliers) في قيم $Y$، ونقاط الرفع (Leverage) في قيم$X$، والنقاط المؤثرة (Influential Points) التي يؤدي حذفها منفردة إلى تغير جذري في قيم معلمات الانحدار المقدرة. يوفر ستاتا أدوات متقدمة لتوليد وحساب كافة مؤشرات التشخيص التشريحي لهذه النقاط.
لحساب مسافة كوك (Cook’s Distance)، التي تقيس الأثر الكلي للمشاهدة على جميع المعلمات المقدرة مجتمعة، يُستخدم أمر predict بالخيار cooksd:
predict cook_d, cooksd
تعتبر المشاهدة نقطة مؤثرة حرجة إذا تجاوزت مسافة كوك الخاصة بها العتبة التقليدية المقررة ($\text{Cook’s } D > \frac{4}{n}$ أو $\text{Cook’s } D > 1$). كما يمكن استخراج قيم الرفع الهيكلي (Leverage values) عبر خيار leverage:
predict lev, leverage
وتعد قيم الرفع التي تتجاوز ضعف أو ثلاثة أضعاف متوسط الرفع ($\frac{2k}{n}$) نقاطاً ذات نفوذ عالٍ على ميل خط الانحدار. بالإضافة إلى ذلك، يمكن حساب البواقي المحذوفة المعيرة (Studentized Residuals) عبر الخيار rstudent لرصد المشاهدات التي تتجاوز ($\pm 2$) أو ($\pm 3$) انحرافات معيارية كقيم شاذة تتطلب المعالجة أو التحقق من دقة توثيقها الأصلي في البحث.
11.2 التعامل مع مشكلة عدم تجانس التباين (Robust Standard Errors)
عند ثبوت وجود مشكلة عدم تجانس تباين الأخطاء عبر اختبارات estat hettest أو estat imtest، تصبح الأخطاء المعيارية التقليدية لـ OLS غير موثوقة. يقدم برنامج ستاتا الحل القياسي الأقوى والأكثر اعتماداً في النشر الأكاديمي، وهو تقدير الأخطاء المعيارية الحصينة لهوبر-وايت (Huber/White/sandwich Robust Standard Errors)، بمجرد إضافة خيار robust (أو اختصاراً vce(robust)) إلى أمر الانحدار:
regress price weight, robust
عند تنفيذ الانحدار الحصين، تظل قيم معاملات الانحدار ($\hat{\beta}_0$ و $\hat{\beta}_1$) متطابقة تماماً دون أي تغيير؛ لأن OLS تظل غير متحيزة. لكن التغيير الجوهري يطرأ على حسابات الأخطاء المعيارية (Std. Err.)، حيث يتم تصحيحها لتعكس البنية الحقيقية لعدم التجانس، مما يؤدي إلى تعديل فترات الثقة والقيم التائية والاحتمالية لتصبح دقيقة ومتسقة وتوفر استدلالاً إحصائياً سليماً تماماً يحمي الباحث من أخطاء النوع الأول (Type I Errors).
وفي الحالات التي تكون فيها البيانات موزعة هيكلياً داخل مجموعات أو عناقيد مترابطة (مثل عينات الطلاب المجمعين داخل مدارس، أو المرضى داخل مستشفيات)، يوفر ستاتا خيار التصحيح العنقودي vce(cluster clustervar):
regress price weight, vce(cluster manufacturer)
يقوم هذا الخيار بتصحيح الأخطاء المعيارية لمواجهة مشكلتي تفاوت التباين والارتباط المشترك بين الأخطاء داخل كل مجموعة عنقودية في آن واحد، مما يضمن أعلى درجات الموثوقية في البيانات ذات الطبيعة الهرمية.
11.3 التحويلات الرياضية للمتغيرات (Transformations)
تعد التحويلات الرياضية للمتغيرات إحدى أنجح الاستراتيجيات لمعالجة مشكلات الالتواء الشديد، وتفاوت التباين، وغياب العلاقة الخطية. يعد التحويل اللوغاريتمي الطبيعي (Logarithmic Transformation) التحويل الأكثر شيوعاً في التحليل القياسي، ويتم تنفيذه في ستاتا باستخدام أمر generate مصحوباً بالدالة ln():
generate log_price = ln(price)
generate log_weight = ln(weight)
تفتح التحويلات اللوغاريتمية الباب أمام ثلاثة نماذج وظيفية شهيرة تختلف صياغتها وطرق تفسير معاملاتها:
- النموذج اللوغاريتمي-الخطي (Log-Linear Model): يتم تقديره عبر
regress log_price weight. يفسر المعامل المقدر $\hat{\beta}_1$ بأن تغير المتغير المستقل بوحدة واحدة يؤدي إلى تغير نسبي مئوي في المتغير التابع مقداره $(\hat{\beta}_1 \times 100)%$. - النموذج الخطي-اللوغاريتمي (Linear-Log Model): يتم تقديره عبر
regress price log_weight. يفسر المعامل بأن زيادة المتغير المستقل بنسبة 1% تؤدي إلى تغير مطلق في المتغير التابع بمقدار $(\hat{\beta}_1 / 100)$ وحدة. - النموذج اللوغاريتمي المزدوج (Log-Log Model): يتم تقديره عبر
regress log_price log_weight. يمثل المعامل هنا المرونة الاقتصادية المباشرة (Elasticity)، حيث يفسر بأن زيادة المتغير المستقل بنسبة 1% تؤدي إلى تغير نسبي في المتغير التابع بنسبة $\hat{\beta}_1%$.
كما يمكن تطبيق تحويلات الجذر التربيعي sqrt() للمتغيرات ذات التوزيعات القريبة من توزيع بواسون، أو إضافة الحدود التربيعية generate weight_sq = weight^2 لاختبار العلاقات غير الخطية ونقاط الانقلاب في السلوك المدروس.
12. توثيق وكتابة نتائج الانحدار الخطي وفق معايير APA وتصدير الجداول
12.1 صياغة التقرير الأكاديمي لنتائج الانحدار حسب نمط APA
تفرض جمعية علم النفس الأمريكية (APA Style – 7th edition) معايير دقيقة لكتابة وتوثيق نتائج الانحدار الخطي في المتن الأكاديمي للبحوث. يجب أن تبدأ الصياغة بعرض الغرض من التحليل، متبوعاً بقيمة الاختبار الفائي للدلالة الكلية ودرجات الحرية وقيمة الدلالة وحجم التأثير ($R^2$):
“أُجري تحليل الانحدار الخطي البسيط لتقييم القدرة التنبؤية لوزن المركبة على سعرها السوقي. أظهرت النتائج أن النموذج التنبؤي ككل يتمتع بدلالة إحصائية عالية، $F(1, 72) = 29.45$، $p < .001$، حيث فسر وزن المركبة ما نسبته 29% من إجمالي التباين في الأسعار ($R^2 = .290$)."
ثم ينتقل التقرير لتوثيق معاملات الانحدار الفردية متضمنة المعامل غير المعياري ($B$)، والخطأ المعياري ($text{SE}$)، والمعامل المعياري ($beta$)، والقيمة التائية وفترة الثقة:
“وقد تبين أن لوزن المركبة تأثيراً طردياً دالاً إحصائياً على السعر ($B = 2.044$، $\text{SE} = 0.377$، $\beta = .539$، $t(72) = 5.43$، $p < .001$، 95% CI $[1.293, 2.796]$). تشير هذه النتائج إلى أنه مع زيادة وزن السيارة بمقدار رطل واحد، يرتفع سعرها التقديري بمقدار 2.04 دولاراً تقريباً."
يجب مراقبة قواعد التنسيق الدقيقة في نمط APA، مثل وضع الحروف الإحصائية اللاتينية بخط مائل ($F$,$t$,$p$,$R^2$,$B$,$beta$)، وكتابة القيم الاحتمالية بدون وضع صفر قبل الفاصلة العشرية إذا كانت القيمة لا يمكن أن تتجاوز الواحد الصحيح (كتابة$p < .001$ بدلاً من $p < 0.001$).
12.2 تصدير جداول المخرجات بتنسيق احترافي للنشر العلمي
تعد حزم التصدير التلقائية في ستاتا من أهم الأدوات لتوفير الوقت وتجنب أخطاء النقل اليدوي للأرقام إلى ملفات المعالجة النصية. من أشهر هذه الحزم حزمة outreg2 وحزمة estout (التي تتضمن أمر esttab). لتثبيت واستخدام حزمة outreg2 لتصدير جداول الانحدار بتنسيق وورد أو إكسيل مطابق للمعايير الأكاديمية، يتم تنفيذ الأوامر التالية:
ssc install outreg2, replace
regress price weight
outreg2 using "Regression_Results.doc", replace word bdec(3) sdec(3) r2 ar2 title("جدول نتائج الانحدار الخطي البسيط وفق نمط APA")
ولمحبي التنسيق المتقدم باستخدام حزمة esttab، يمكن إنتاج جداول مخصصة تدمج المعاملات وفترات الثقة والنجوم الإحصائية الدالة على المعنوية بدقة متناهية:
ssc install estout, replace
eststo clear
eststo: regress price weight
esttab using "Model_Table.rtf", replace cells("b(star fmt(3)) se(fmt(3)) ci(fmt(2))") stats(N r2_a F p, fmt(0 3 2 3)) label star(* 0.05 ** 0.01 *** 0.001)
كما يوفر ستاتا الحديث نظاماً داخلياً مدمجاً فائق التطور يُعرف بأمر putdocx، والذي يتيح للباحث كتابة الأوامر لإنشاء ملف وورد كامل آلياً، يدمج النصوص التفسيرية والجداول الإحصائية والرسوم البيانية المصدرة في وثيقة رسمية موحدة دون مغادرة بيئة البرنامج.
12.3 أفضل الممارسات لضمان شفافية التحليل وقابلية تكراره
يتطلب الالتزام بأخلاقيات البحث العلمي الرصين وحوكمة البيانات اتباع منهجية محكمة تضمن شفافية التحليلات وقابليتها لإعادة الإنتاج (Replication). تتأسس هذه الممارسات على تنظيم ملفات المشروع البحثي داخل هيكل مجلدات واضح، وفصل ملفات البيانات الخام الأصلية (Raw Data) للقراءة فقط، وعدم إجراء أي تعديل أو تنظيف يدوي عليها مطلقاً، بل تنفيذ كافة عمليات التنظيف والترميز والتحويل برمجياً من خلال ملف Do-file موثق.
يجب أن يتضمن ملف Do-file تعليقات توضيحية مفصلة توضح سبب استبعاد أي مشاهدة أو تطبيق أي تحويل رياضي، مع استخدام المسارات النسبية (Relative Paths) للوصول إلى الملفات لضمان عمل الأكواد بسلاسة عند نقل المشروع إلى أجهزة باحثين آخرين. كما يُنصح بتسجيل رقم الإصدار البرمجي لستاتا عبر أمر version 17 (أو الإصدار المستخدم) في مقدمة ملف الأوامر، لضمان استقرار الخوارزميات الحسابية وتطابق النتائج الإحصائية مستقبلاً.
أخيراً، يتعين على الباحث إجراء تدقيق ومراجعة مزدوجة للنتائج عبر مقارنة التقديرات اليدوية بمخرجات الحزم الإحصائية المعتمدة، والتأكد من مطابقة حجم العينة الفعلي المدرج في الجداول مع عدد الاستجابات الصالحة، وفحص حساسية النتائج (Sensitivity Analysis) من خلال مقارنة النماذج العادية بالنماذج الحصينة، لضمان متانة الاستنتاجات العلمية المقدمة للمجتمع الأكاديمي.
خاتمة شاملة وآفاق تطبيقية
يعد نموذج الانحدار الخطي البسيط أكثر من مجرد خوارزمية رياضية لربط نقطتين على رسم بياني؛ إنه إطار فلسفي وتحليلي متكامل لفهم التباين وتفكيك العلاقات التفسيرية بين الظواهر الكمية. من خلال بيئة برنامج ستاتا المتقدمة، يمتلك الباحثون والدارسون ترسانة متكاملة من الأدوات التي تبدأ من الاستكشاف البصري الرصين وتصل إلى أدق اختبارات التشخيص القياسي والمعالجة الحصينة للبيانات المعقدة.
إن إتقان خطوات بناء وتفسير نموذج الانحدار الخطي البسيط في ستاتا يشكل حجر الزاوية الأساسي والمنطلق المعرفي الذي لا غنى عنه للارتقاء نحو النماذج الأكثر تعقيداً، مثل الانحدار الخطي المتعدد (Multiple Linear Regression)، ونماذج المعادلات البنائية (Structural Equation Modeling)، ونماذج البيانات الطولية (Panel Data Analysis). إن التمسك الصارم بالافتراضات الإحصائية، والفحص الدقيق للبواقي، والشفافية المطلقة في التوثيق هي المعايير الحقيقية التي تضمن تحويل البيانات الخام إلى معرفة علمية رصينة قادرة على دعم القرار وتطوير النظريات الأكاديمية والممارسات التطبيقية.
References
- Acock, A. C. (2018). A Gentle Introduction to Stata (6th ed.). Stata Press. https://www.stata-press.com/books/gentle-introduction-to-stata/
- American Psychological Association. (2020). Publication Manual of the American Psychological Association (7th ed.). American Psychological Association. https://doi.org/10.1037/0000165-000
- Cameron, A. C., & Trivedi, P. K. (2010). Microeconometrics Using Stata (Revised ed.). Stata Press. https://www.stata-press.com/books/microeconometrics-using-stata/
- Field, A. (2018). Discovering Statistics Using IBM SPSS Statistics (5th ed.). SAGE Publications. https://edge.sagepub.com/field5e
- Greene, W. H. (2018). Econometric Analysis (8th ed.). Pearson. https://www.pearson.com/en-us/subject-catalog/p/econometric-analysis/P200000006456
- Gujarati, D. N., & Porter, D. C. (2009). Basic Econometrics (5th ed.). McGraw-Hill Education. https://www.mheducation.com
- Mitchell, M. N. (2020). Interpreting and Visualizing Regression Models Using Stata (2nd ed.). Stata Press. https://www.stata-press.com/books/interpreting-visualizing-regression-models-stata/
- StataCorp. (2023). Stata Base Reference Manual Release 18. Stata Press. https://www.stata.com/manuals/r.pdf
- Stock, J. H., & Watson, M. W. (2019). Introduction to Econometrics (4th ed.). Pearson. https://www.pearson.com/en-us/subject-catalog/p/introduction-to-econometrics/P200000006454
- Wooldridge, J. M. (2020). Introductory Econometrics: A Modern Approach (7th ed.). Cengage Learning. https://www.cengage.com/c/introductory-econometrics-a-modern-approach-7e-wooldridge/