تُعد النمذجة الإحصائية حجر الزاوية في العلوم السلوكية والنفسية والاجتماعية والاقتصادية، حيث يسعى الباحثون باستمرار إلى فهم طبيعة العلاقات المعقدة التي تربط بين المتغيرات المفسرة والمتغيرات التابعة. ولفترات طويلة، هيمنت نماذج الانحدار الخطي البسيط والمتعدد على الممارسات البحثية نظراً لسهولة تفسير معاملاتها ووضوح افتراضاتها الرياضية. غير أن الواقع التجريبي والظواهر الإنسانية نادراً ما تتبع مسارات مستقيمة أو معدلات تغير ثابتة؛ فالعديد من السمات النفسية والأنماط السلوكية والظواهر الاقتصادية تخضع لقوانين التناقص، والتراكم، والعتبات الحرجة، ونقاط الإشباع التي تعجز الخطوط المستقيمة عن تمثيلها بدقة دون الوقوع في خطأ التحديد الخاطئ للنموذج (Model Misspecification).
يمثل الانحدار التربيعي (Quadratic Regression) أحد أهم الامتدادات غير الخطية لنماذج الانحدار الخطي المتعدد، إذ يتيح للباحث إمكانية نمذجة العلاقات المنحنية (Curvilinear Relationships) واختبار الفرضيات النظرية المتعلقة بوجود نقاط تحول قصوى (Maxima) أو دنيا (Minima). ومن خلال إدخال حد تربيعي للمتغير المستقل إلى جانب حده الخطي، يستطيع الباحث التقاط ديناميكيات التحول في اتجاه وقوة الأثر، مثل تحول الأثر الإيجابي لمتغير ما إلى أثر سلبي بعد تجاوزه حداً معيناً، وهو ما يُعرف في الأدبيات السيكولوجية بمنحنيات الحرف U أو الحرف U المقلوب (Inverted U-shaped curves).
يهدف هذا الدليل المرجعي الشامل إلى تقديم معالجة منهجية وتطبيقية متقدمة لكيفية إجراء وتحليل وتشخيص وتفسير نماذج الانحدار التربيعي باستخدام حزمة البرمجيات الإحصائية المرموقة Stata. سنستعرض معاً البنية الرياضية الكاملة للنموذج، والخطوات البرمجية الدقيقة عبر لغة أوامر ستاتا، وطرق التعامل مع مشكلات التعدد الخطي، وتقنيات الحساب الآلي لنقاط التحول وفترات ثقتها باستخدام طريقة دلتا (Delta Method)، وصولاً إلى إنتاج الرسوم البيانية التوضيحية عالية الدقة وتوثيق النتائج وفق المعايير الأكاديمية الصارمة لجمعية علم النفس الأمريكية (APA Style).
- 1. مقدمة نظرية إلى الانحدار التربيعي في النماذج النفسية والسلوكية
- 2. الأسس الرياضية والإحصائية الكامنة وراء نموذج الانحدار التربيعي
- 3. إعداد بيئة العمل وتجهيز البيانات في برنامج Stata
- 4. الاستكشاف البصري الأولي للعلاقات غير الخطية في Stata
- 5. توليد المتغيرات التربيعية والتهيئة البرمجية للنمذجة
- 6. تنفيذ نموذج الانحدار التربيعي خطوة بخطوة في Stata
- 7. القراءة التفسيرية الشاملة لمخرجات الانحدار في Stata
- 8. المقارنة الإحصائية المنهجية بين النموذج الخطي والتربيعي
- 9. تشخيص افتراضات الانحدار والتحقق من صحة النموذج
- 10. التمثيل البياني المتقدم والتأثيرات الهامشية في Stata
- 11. تطبيقات متقدمة: المتغيرات الضابطة والتفاعلات غير الخطية
- 12. كتابة وتوثيق نتائج الانحدار التربيعي وفق دليل APA
- خاتمة
- References
1. مقدمة نظرية إلى الانحدار التربيعي في النماذج النفسية والسلوكية
1.1 مفهوم العلاقات غير الخطية وظاهرة منحنيات U و U المقلوبة
تفترض النماذج الخطية الكلاسيكية أن التغير بمقدار وحدة واحدة في المتغير المستقل ($X$) يقابله تغير ثابت ومستمر في المتغير التابع ($Y$) عبر كامل نطاق المشاهدات. بيد أن القياسات السلوكية تكشف باستمرار عن علاقات تتسم باللاخطية والانحناء؛ حيث يختلف معدل التأثير وربما ينعكس اتجاهه كلياً تبعاً للمستوى الحالي للمتغير المستقل. تُعد هذه الظاهرة جوهر النماذج اللاخطية في العلوم الاجتماعية، والتي تتخذ في كثير من الأحيان نمطين رئيسيين: منحنى حرف$U$ حيث تنخفض الاستجابة في المستويات المتوسطة وترتفع عند الأطراف، أو منحنى حرف $U$ المقلوب ($cap$) حيث تزداد الاستجابة تدريجياً حتى تبلغ ذروتها القصوى ثم تنحدر بعد ذلك بصورة حادة.

من أشهر الأمثلة الكلاسيكية المجسدة لهذا الانحناء في علم النفس التجريبي هو قانون يركس-دودسون (Yerkes-Dodson Law)، الذي يصف العلاقة التجريبية بين مستوى الاستثارة الفسيولوجية أو العصبية ومستوى الأداء الإدراكي أو المهاري. يوضح هذا القانون أن المستويات المنخفضة من الاستثارة تؤدي إلى أداء متدنٍ بسبب الخمول وغياب الحافز، ومع ارتفاع الاستثارة يتحسن الأداء تدريجياً ليصل إلى المستوى الأمثل (Optimal Level)، لكن إذا زادت الاستثارة عن هذا الحد وتحولت إلى قلق مفرط وتوتر نفسي، يبدأ الأداء في التدهور الحاد، مما ينتج منحنى على شكل $U$ مقلوب لا يمكن لأي انحدار خطي مستقيم استيعابه أو تمثيله رياضياً.

يتكرر هذا النمط بوضوح في دراسات علم النفس التنظيمي وعلم الاجتماع الاقتصادي عند فحص العلاقة بين ساعات العمل الأسبوعية ومستوى الرفاهية النفسية والسعادة الذاتية. إن العمل لعدد ساعات معقول يوفر الدخل المادي والشعور بالإنجاز والانتماء الاجتماعي، مما يرفع من درجات السعادة، ولكن تجاوز عدد ساعات العمل لعتبة حرجة معينة يؤدي إلى الإرهاق الوظيفي (Burnout)، وتآكل الوقت المخصص للأسرة والراحة، وبالتالي هبوط مؤشرات الرفاهية. إن تطبيق انحدار خطي مستقيم على هذه البيانات سيعطي انطباعاً مضللاً إما بوجود علاقة موجبة ضعيفة أو عدم وجود علاقة على الإطلاق، متجاهلاً نقطة التحول الجوهرية التي تهم صانعي السياسات والباحثين.
1.2 المقارنة الرياضية والمفاهيمية بين الانحدار الخطي والتربيعي
يكمن التباين المفاهيمي والجبري بين الانحدار الخطي والتربيعي في طبيعة معدل التغير (Rate of Change). في الانحدار الخطي من الدرجة الأولى، تأخذ المعادلة الصيغة الجبرية $Y = \beta_0 + \beta_1 X + \varepsilon$، ويكون المشتق الأول للمعادلة بالنسبة للمتغير $X$ هو $\frac{dY}{dX} = \beta_1$. هذا يعني رياضياً أن الأثر الهامشي لـ $X$ على $Y$ ثابت تماماً ولا يتأثر بقيمة $X$ نفسها. هذا الافتراض الرياضي، رغم بساطته، يفرض قيداً صارماً وغير واقعي في كثير من الأحيان على الظواهر السلوكية المتغيرة.
في المقابل، يرتكز الانحدار التربيعي على معادلة من الدرجة الثانية تأخذ الصيغة الرياضية $Y = \beta_0 + \beta_1 X + \beta_2 X^2 + \varepsilon$. وبإجراء التفاضل الأول لهذه المعادلة بالنسبة إلى $X$، نحصل على الأثر الهامشي اللحظي:$frac{dY}{dX} = beta_1 + 2beta_2 X$. يتضح جلياً هنا أن ميل المماس لمنحنى الاستجابة ليس ثابتاً، بل هو دالة خطية تعتمد بصورة مباشرة على قيمة$X$. يسمح الحد التربيعي ($X^2$) للنموذج بالانحناء التدريجي والتسارع أو التباطؤ، مما يوفر مرونة رياضية فائقة في محاكاة البيانات التي تتضمن تباطؤاً في العوائد أو نقاط ذروة وانقلاب.
1.3 دواعي اختيار الانحدار التربيعي كخيار منهجي رصين
لا ينبغي أن يكون اختيار الانحدار التربيعي مجرد محاولة استكشافية عمياء لمطابقة البيانات الرياضية (Overfitting)، بل يجب أن يستند في المقام الأول إلى أسس نظرية رصينة ومبررات فرضية واضحة في مجال التخصص. إن وجود أدبيات تشير إلى ظواهر مثل “الحد التناقصي للمنفعة” أو “الجرعة المفرطة السامة” أو “التوازن النفسي الأمثل” يمثل المسوغ الأساسي لصياغة فرضية غير خطية واختبارها عبر إدخال الحد التربيعي، مما يحمي الباحث من الانزلاق وراء التوافقات العشوائية في العينة.
إلى جانب التبرير النظري، يلعب الاستكشاف الإحصائي المبدئي الموجه دوراً محورياً؛ إذ تدفع الرسوم البيانية الاستكشافية، وتوزيعات البواقي، وفحوصات جودة التوفيق الباحثين إلى فحص ما إذا كان النموذج الخطي قاصراً عن تفسير تباين المتغير التابع. إن التحديد الصحيح للنموذج التربيعي يرفع من القوة التفسيرية ($R^2$)، ويقلل من تباين الخطأ العشوائي، ويمنع تحيز المعاملات الناتج عن إغفال المتغيرات ذات الصلة الجوهرية، مما يمنح الباحثين نتائج دقيقة وقابلة للتعميم الأكاديمي والتطبيقي.
2. الأسس الرياضية والإحصائية الكامنة وراء نموذج الانحدار التربيعي
2.1 المعادلة الرياضية العامة وتفسير المعلمات الإحصائية
تتم صياغة نموذج الانحدار التربيعي في صورته السكانية العامة على النحو التالي:
$$Y_i = \beta_0 + \beta_1 X_i + \beta_2 X_i^2 + \varepsilon_i$$
حيث يمثل $Y_i$ قيمة المتغير التابع للمشاهدة $i$، و$X_i$ قيمة المتغير المستقل، و $X_i^2$ يمثل مربع هذه القيمة، بينما يمثل $\varepsilon_i$ حد الخطأ العشوائي المستقل والموزع توزيعاً طبيعياً بمتوسط صفر وتباين ثابت $\sigma^2$. لفهم هذا النموذج، يجب تحليل كل معامل من المعاملات المقدرة ($\beta$) بدقة إحصائية:
- الحد الثابت ($\beta_0$): يمثل القيمة المتوقعة لـ $Y$ عندما تكون قيمة $X$ مساوية تماماً للصفر. وله معنى تطبيقي حقيقي فقط إذا كان الصفر يقع ضمن النطاق المعقول للمتغير $X$.
- المعامل الخطي ($\beta_1$): يمثل الميل اللحظي لمنحنى الانحدار عند النقطة المحددة التي تكون فيها قيمة $X = 0$. ويخطئ الكثير من الباحثين عند تفسيره على أنه “الأثر العام الثابت” لـ $X$ كما في الانحدار الخطي البسيط.
- المعامل التربيعي ($\beta_2$): يمثل معامل التسارع أو الانحناء (Curvature Parameter)، وهو يحدد بمفرده طبيعة تقعر المنحنى وشكله الهندسي.
تعتبر إشارة المعامل التربيعي $\beta_2$ هي المعيار الرياضي الحاسم لشكل المنحنى؛ فإذا كانت قيمة $\beta_2$ موجبة ($\beta_2 > 0$)، فإن المشتق الثاني للمعادلة يكون موجباً ($\frac{d^2Y}{dX^2} = 2\beta_2 > 0$)، مما يدل على أن المنحنى مقعر لأعلى (Convex / U-shaped) وله نقطة نهاية صغرى (Minimum Vertex). أما إذا كانت قيمة $\beta_2$ سالبة ($\beta_2 < 0$)، فإن المشتق الثاني يكون سالباً ($\frac{d^2Y}{dX^2} = 2\beta_2 < 0$)، مما يشير إلى أن المنحنى مقعر لأسفل (Concave / Inverted U-shaped) ويمتلك نقطة نهاية عظمى (Maximum Vertex) تجسد أعلى استجابة ممكنة في المتغير التابع.
2.2 تحديد وحساب نقطة التحول القصوى أو الدنيا (Vertex)
تعتبر نقطة التحول، أو ما يُعرف في الهندسة الرياضية برأس المنحنى (Vertex)، أهم مخرج تحليلي وتطبيقي للنموذج التربيعي. لتحديد القيمة الحرجة لـ $X$ التي يصل عندها المنحنى إلى قمته القصوى أو قاعه الأدنى، نقوم بمساواة المشتق الأول للمعادلة بالصفر:
$$\frac{dY}{dX} = \beta_1 + 2\beta_2 X = 0$$
وبحل هذه المعادلة الجبرية البسيطة للحصول على قيمة $X$, نصل إلى الصيغة الرياضية الكلاسيكية لنقطة التحول ($X_{vertex}$):
$$X_{vertex} = -\frac{\beta_1}{2\beta_2}$$
تحمل هذه القيمة أهمية سيكولوجية وسلوكية بالغة؛ فهي تحدد بدقة الجرعة المثالية من المتغير المستقل (مثل عدد ساعات العمل المثالية، أو مستوى القلق المحفز للأداء الأقصى). غير أن الاعتماد على القيمة النقطية لـ $X_{vertex}$ وحدها لا يكفي في البحث العلمي الرصين، إذ يجب على الباحث حساب فترة الثقة (Confidence Interval) لهذه النقطة للتأكد من مدى دقة التقدير الإحصائي.
نظراً لأن $X_{vertex}$ عبارة عن دالة غير خطية غير كسرية لمعاملين عشوائيين مقدرين ($\hat{\beta}_1$ و $\hat{\beta}_2$)، يتم استخدام طريقة دلتا (Delta Method) لتقريب التباين وحساب الخطأ المعياري لنقطة التحول. توفر حزمة Stata أدوات متقدمة لتطبيق طريقة دلتا بصورة آلية عبر أوامر التحليل اللاحق، مما يتيح استخراج فترات ثقة بنسبة 95% بدقة بالغة دون الحاجة إلى إجراء الاشتقاقات الحسابية المعقدة يدوياً.
2.3 قضية التعدد الخطي بين المتغير وحدّه التربيعي واستراتيجيات التمركز
من التحديات الإحصائية البارزة التي تنشأ عند إدخال المتغير ومربعه في نموذج واحد هي مشكلة التعدد الخطي غير الجوهري (Non-essential Multicollinearity). نظراً لأن المتغير $X^2$ هو تحويل رياضي مباشر للمتغير $X$، فإن معامل الارتباط الخطي بينهما غالباً ما يكون مرتفعاً جداً (قد يتجاوز 0.90)، خاصة إذا كانت جميع قيم$X$ موجبة وبعيدة عن الصفر. يؤدي هذا التعدد الخطي إلى تضخيم الأخطاء المعيارية للمعاملات الفردية ($\beta_1$ و $\beta_0$)، وزيادة قيم معامل تضخم التباين (VIF)، مما قد يجعل المعامل الخطي يبدو غير دال إحصائياً بالرغم من جودة النموذج الكلية.
للتغلب على هذه المعضلة وتسهيل التفسير الإحصائي، يوصي علماء الإحصاء النفسي بتطبيق إجراء التمركز حول المتوسط الحسابي (Mean-Centering). يتم التمركز بطرح المتوسط الحسابي للمتغير ($\bar{X}$) من كل مشاهدة قبل إجراء عملية التربيع، لتصبح المعادلة:
$$Y_i = \beta_0^* + \beta_1^* (X_i – \bar{X}) + \beta_2^* (X_i – \bar{X})^2 + \varepsilon_i$$
يحقق التمركز حول المتوسط فوائد منهجية جوهرية؛ فهو يقلل الارتباط الخطي المصطنع بين الحد الخطي والحد التربيعي إلى مستويات تقترب من الصفر في التوزيعات المتماثلة، مما يؤدي إلى انخفاض قيم VIF واستقرار تقديرات الأخطاء المعيارية. علاوة على ذلك، يكتسب المعامل الخطي المقدر ($\beta_1^*$) تفسيراً علمياً غاية في الأهمية: فهو يمثل الآن الميل اللحظي للمنحنى عند المتوسط الحسابي للعينة ($X = \bar{X}$)، بينما يمثل الحد الثابت ($\beta_0^*$) القيمة المتوقعة للمتغير التابع عند متوسط العينة بدلاً من الصفر الافتراضي.
3. إعداد بيئة العمل وتجهيز البيانات في برنامج Stata
3.1 واجهة برنامج Stata وإدخال البيانات المباشر
يمتاز برنامج Stata ببيئة عمل تجمع بين الواجهات الرسومية التفاعلية وقوة لغة الأوامر البرمجية المباشرة (Command Line Interface). للبدء في تجهيز دراسة تطبيقية حول العلاقة بين ساعات العمل ومستوى السعادة، يمكن للباحث إدخال البيانات مباشرة باستخدام محرر البيانات المدمج (Data Editor) عبر كتابة الأمر edit في نافذة الأوامر أو الضغط على أيقونة المحرر في الشريط العلوي.

عند بناء مجموعة البيانات يدوياً، يجب الحرص على تسمية المتغيرات بأسماء واضحة ودقيقة ذات مغزى علمي؛ كأن نطلق على متغير ساعات العمل الأسبوعية اسم hours وعلى مقياس السعادة والرفاهية اسم happiness. من الممارسات المنهجية الرصيدة في Stata توثيق جلسة التحليل بالكامل عن طريق فتح ملف سجل (Log File) في بداية العمل لتسجيل جميع الأوامر والنتائج بدقة، وذلك باستخدام الأمر التالي:
log using "quadratic_regression_analysis.log", replace text
يضمن فتح ملف السجل إمكانية الرجوع إلى المخرجات التفصيلية لاحقاً، والتحقق من خطوات التحليل، وتعزيز مبدأ الشفافية وإمكانية تكرار النتائج (Replicability) وفق المعايير الأكاديمية الدولية.
3.2 استيراد البيانات وفحص بنيتها الإحصائية
في معظم الدراسات الميدانية، يتم جمع البيانات وتخزينها بصيغ رقمية خارجية مثل ملفات Excel أو CSV. يتيح برنامج Stata استيراد هذه الملفات بسهولة وسلاسة فائقة عبر الأوامر المباشرة. إذا كانت البيانات مخزنة في ملف إكسيل، يمكن كتابة الأمر:
import excel "work_happiness_study.xlsx", sheet("Data") firstrow clear
حيث يوجه الخيار firstrow البرنامج لاعتبار الصف الأول كعناوين للمتغيرات، بينما يقوم clear بتفريغ الذاكرة من أي بيانات سابقة.
بمجرد استيراد البيانات بنجاح، يتعين على الباحث فحص البنية الهيكلية لمتغيرات الدراسة باستخدام الأمرين الأساسيين describe و summarize. يوفر الأمر الأول وصفاً شاملاً لأنواع المتغيرات وحجم العينة وتسمياتها، بينما يقدم الأمر الثاني فحصاً للمقاييس الوصفية الأساسية، بما في ذلك المتوسط الحسابي، والانحراف المعياري، والحدين الأدنى والأعلى لكل متغير، وذلك عبر تنفيذ:
summarize happiness hours, detail
يتيح فحص التفاصيل المتقدمة (Detail) عبر هذا الأمر تقييم معاملي الالتواء (Skewness) والتفرطح (Kurtosis)، مما يمنح الباحث رؤية أولية حول اعتدالية التوزيعات الإحصائية للمتغيرات قيد الدراسة.
3.3 تنظيف البيانات والتعامل مع القيم الشاذة والمفقودة
تتأثر نماذج الانحدار غير الخطي بشدة بوجود القيم الشاذة والمتطرفة (Outliers)؛ إذ يمكن لمشاهدة واحدة متطرفة تقع في أقصى نطاق المتغير المستقل أن تؤدي إلى تشويه مسار التقعر، وتحويل انحناء النموذج بصورة مصطنعة، أو إزاحة نقطة التحول عن موضعها الحقيقي. لذلك، يجب فحص البيانات بدقة لاكتشاف هذه القيم قبل بناء النموذج الرياضي.
يمكن الكشف عن القيم غير المنطقية (مثل تسجيل ساعات عمل أسبوعية تتجاوز 100 ساعة أو درجات سعادة تقع خارج نطاق المقياس المقنن) باستخدام أوامر الفحص والفرز الشرطي مثل:
list hours happiness if hours > 80 | hours < 0
كما يجب معالجة القيم المفقودة (Missing Values) التي يرمز لها في Stata بالنقطة (.). ينبغي على الباحث التأكد من عدم وجود تشفير خاطئ للمفقودات كأرقام حقيقية (مثل -99 أو 999)، حيث يتعين تحويلها إلى قيم مفقودة نظامية عبر أمر mvdecode لضمان استبعادها التلقائي من التحليلات الإحصائية دون تلويث تقديرات المعلمات.
4. الاستكشاف البصري الأولي للعلاقات غير الخطية في Stata
4.1 إنشاء مخططات التشتت الأساسية باستخدام أمر scatter
يمثل الاستكشاف البصري الخطوة الأولى والأساسية في أي تحليل انحدار رصين. يوفر مخطط التشتت (Scatter Plot) رؤية مباشرة لطبيعة التوزيع المشترك بين المتغير المستقل والمتغير التابع، ويكشف مبدئياً عما إذا كان النمط العام يتجه نحو مسار مستقيم أو يظهر انحناءً تدريجياً. في برنامج Stata، يتم توليد مخطط التشتت الأساسي باستخدام أمر scatter:
scatter happiness hours, title("العلاقة بين ساعات العمل ومستوى السعادة") xtitle("ساعات العمل الأسبوعية") ytitle("مستوى السعادة الذاتية (1-100)") mcolor(navy%70) msymbol(circle)

تساعد الخيارات المرافقة للأمر في تحسين المقروئية البصرية للرسم؛ فالخيار mcolor(navy%70) يمنح النقاط لوناً كحلياً مع شفافية بنسبة 70% للحد من تداخل النقاط المتقاربة (Overplotting)، في حين تحدد الخيارات title و xtitle و ytitle التسميات التوضيحية للمحاور والرسم بدقة.
4.2 إضافة خطوط التوفيق المنحنية والموضعية
لتأكيد الطبيعة المنحنية بصرياً، يتيح Stata تركيب خطوط توفيق رياضية وإحصائية فوق نقاط التشتت من خلال دمج أوامر الرسم البياني الثنائية (Twoway Graphs). يمكن للباحث مقارنة خط التوفيق الخطي مع خط التوفيق التربيعي مباشرة عبر الأمر المدمج التالي:
twoway (scatter happiness hours, mcolor(gray%50)) (lfit happiness hours, lcolor(red) lpattern(dash) lwidth(medium)) (qfit happiness hours, lcolor(blue) lwidth(thick)), legend(order(1 "المشاهدات" 2 "التوفيق الخطي" 3 "التوفيق التربيعي")) title("مقارنة بصرية بين التوفيق الخطي والتربيعي")
إلى جانب التوفيق المعلمي، يوفر Stata أداة قوية للغاية تسمى التنعيم الموضعي غير المعلمي الموزون (LOWESS – Locally Weighted Scatterplot Smoothing). يمتاز أسلوب LOWESS بأنه يرسم مسار العلاقة بناءً على البيانات الفعلية دون فرض أي شكل رياضي مسبق (خطي أو تربيعي). يمكن تنفيذ ذلك عبر كتابة:
lowess happiness hours, lineopts(lcolor(darkgreen) lwidth(thick)) title("منحنى التنعيم الموضعي غير المعلمي (Lowess)")
إذا أظهر منحنى LOWESS تطابقاً شكلياً مع خط التوفيق التربيعي (qfit)، فإن ذلك يوفر دعماً بصرياً واستكشافياً قوياً لفرضية وجود علاقة غير خطية تربيعية قبل الشروع في النمذجة الإحصائية المعلمية.
4.3 تقييم مؤشرات الانحناء قبل المضي قدماً في التحليل المعلمي
عند فحص الرسوم البيانية الاستكشافية، يجب على الباحث تدقيق عدة مؤشرات نوعية حاسمة. أولاً، ملاحظة سلوك النقاط عند المستويات المنخفضة والمتوسطة من المتغير المستقل؛ هل تظهر زيادة مطردة في المتغير التابع تعكس أثراً إيجابياً أولياً؟ ثانياً، تحديد النطاق التقريبي الذي تتوقف عنده هذه الزيادة ويبدأ المنحنى في التسطح (Plateau). وأخيراً، رصد النطاق الذي تبدأ فيه درجات المتغير التابع بالانحدار التدريجي مع استمرار زيادة المتغير المستقل.
إن توثيق هذه الملاحظات البصرية في التقرير المبدئي للتحليل يمنح الباحث أساساً تجريبياً يبرر الانتقال من النماذج الخطية المقيدة إلى نماذج الانحدار متعدد الحدود (Polynomial Regression)، ويعزز من مصداقية القرارات التحليلية اللاحقة أمام المحكمين الأكاديميين.
5. توليد المتغيرات التربيعية والتهيئة البرمجية للنمذجة
5.1 التوليد اليدوي للمتغير المربع عبر أمر generate
الأسلوب الكلاسيكي المباشر لإعداد نموذج الانحدار التربيعي هو إنشاء متغير جديد يمثل القيمة المربعة للمتغير المستقل وتخزينه في قاعدة البيانات. في Stata، يتم ذلك باستخدام أمر توليد المتغيرات generate على النحو التالي:
generate hours2 = hours^2
ومن الأفضل دائماً إضافة بطاقة وصفية (Label) للمتغير الجديد لضمان وضوح قاموس المتغيرات في المستقبل:
label variable hours2 "مربع ساعات العمل الأسبوعية"
ورغم بساطة هذا الأسلوب الكلاسيكي، إلا أنه ينطوي على عيب منهجي بارز؛ حيث يتعامل Stata مع المتغير hours2 كمتغير مستقل منفصل تماماً ولا يدرك برمجياً أنه تحويل تربيعي لنفس المتغير hours. هذا الفصل يعيق استخدام العديد من أوامر ما بعد التقدير المتقدمة وحساب التأثيرات الهامشية التلقائية.
5.2 استخدام مشغلات المتغيرات المتقدمة في Stata (Factor Variables)
بدءاً من الإصدار 11، قدم برنامج Stata ميزة قوية للغاية تُعرف بمشغلات المتغيرات الفئوية والمستمرة (Factor-Variable Operators). تتيح هذه المشغلات إمكانية تحديد التفاعلات والحدود التربيعية مباشرة داخل سطر أمر الانحدار دون الحاجة إلى إنشاء متغيرات جديدة في قاعدة البيانات.
للتعامل مع متغير مستمر وتربيعه، نستخدم المشغل c. للدلالة على المتغير المستمر، ونستخدم علامة المربع المزدوجة (##) التي تطلب من Stata تضمين الحد الخطي والحد التربيعي معاً تلقائياً:
regress happiness c.hours##c.hours
يمثل هذا التعبير البرمجي المكافئ التام للمعادلة $Y = \beta_0 + \beta_1 X + \beta_2 X^2$. أما إذا استخدمنا علامة مربع مفردة واحدة (c.hours#c.hours)، فإن Stata سيقوم بإدراج الحد التربيعي فقط دون الحد الخطي، وهو ما يخالف المنهجية الرياضية السليمة. يوفر استخدام مشغل ## لبرنامج Stata المعرفة الكاملة بطبيعة الارتباط بين المتغيرين، مما يمكنه لاحقاً من حساب التفاضلات الرياضية التلقائية للاشتقاق والتنبؤ الهامشي.
5.3 إجراء التمركز حول المتوسط برمجياً (Mean-Centering Implementation)
لتطبيق استراتيجية التمركز حول المتوسط بهدف التخلص من مشكلة التعدد الخطي غير الجوهري وتسهيل تفسير الحد الخطي، يمكننا تنفيذ الخطوات البرمجية في Stata عبر استخراج المتوسط وتوليد المتغيرات المتمركزة:
summarize hours
generate hours_c = hours - r(mean)
label variable hours_c "ساعات العمل متمركزة حول المتوسط"
generate hours_c2 = hours_c^2
label variable hours_c2 "مربع ساعات العمل المتمركزة"
يقوم Stata بعد تنفيذ أمر summarize بتخزين المتوسط الحسابي تلقائياً في متغير النظام المؤقت r(mean). يتم بعد ذلك طرح هذا المتوسط من كل قيمة للمتغير hours لإنتاج المتغير المتمركز hours_c، ثم يتم تربيع هذا المتغير المتمركز لإنتاج hours_c2، لتصبح البيانات مهيأة تماماً للنمذجة المتمركزة الخالية من الارتباطات المصطنعة.
6. تنفيذ نموذج الانحدار التربيعي خطوة بخطوة في Stata
6.1 تنفيذ الانحدار بالصيغة الكلاسيكية المباشرة
لتنفيذ نموذج الانحدار التربيعي باستخدام المتغيرات التي تم توليدها يدوياً، نستخدم أمر الانحدار الخطي العام regress متبوعاً بالمتغير التابع ثم المتغيرات المستقلة (الخطي والتربيعي):
regress happiness hours hours2

يقوم البرنامج بتقدير المعلمات باستخدام طريقة المربعات الصغرى العادية (OLS – Ordinary Least Squares). وللاحتفاظ بهذه النتائج في ذاكرة البرنامج لإجراء المقارنات اللاحقة، يمكن استخدام أمر تخزين التقديرات:
estimates store Quadratic_Manual
6.2 تنفيذ الانحدار باستخدام صياغة المتغيرات المستمرة المدمجة
يُعد الأسلوب الأكثر كفاءة واحترافية في أبحاث العلوم السلوكية المعاصرة هو تنفيذ الانحدار باستخدام مشغلات المتغيرات المستمرة المدمجة:
regress happiness c.hours##c.hours
يعطي هذا الأمر نفس المعاملات الإحصائية والأخطاء المعيارية تماماً كالأمر السابق، ولكنه يمنح البرنامج مرونة برمجية كاملة تمكن الباحث من استدعاء أوامر ما بعد التقدير التلقائية المتقدمة مثل margins و marginsplot و nlcom دون الحاجة إلى إعادة صياغة المعادلات التفاضلية يدوياً. نقوم أيضاً بتخزين هذه التقديرات في الذاكرة:
estimates store Quadratic_Model
6.3 تطبيق خيارات الأخطاء المعيارية القوية (Robust Standard Errors)
من الافتراضات الجوهرية لطريقة المربعات الصغرى العادية هو ثبات تجانس تباين الأخطاء العشوائية (Homoscedasticity). إذا كان هناك شك في عدم تجانس التباين (Heteroscedasticity)، وهو أمر شائع للغاية في البيانات المقطعية والنفسية، فإن الأخطاء المعيارية الكلاسيكية تكون غير دقيقة ومتحيزة، مما يؤدي إلى قيم $t$ واختبارات معنوية زائفة.
يوفر Stata حلاً قياسياً قوياً عبر إضافة خيار الأخطاء المعيارية القوية لـ هوبر-وايت (Huber-White Robust Standard Errors) من خلال كتابة الخيار vce(robust) في نهاية الأمر:
regress happiness c.hours##c.hours, vce(robust)
أما إذا كانت البيانات مأخوذة من عينات عنقودية أو هرمية (مثل موظفين مجمعين داخل شركات مختلفة)، فيتعين استخدام خيار الأخطاء المصححة للعناقيد (Cluster-Robust Standard Errors) لضبط الارتباط الداخلي بين أفراد المجموعة الواحدة:
regress happiness c.hours##c.hours, vce(cluster company_id)
لا يغير هذا الإجراء من قيم المعاملات المقدرة إطلاقاً، ولكنه يضبط بدقة الأخطاء المعيارية وفترات الثقة والقيم الاحتمالية، مما يضمن متانة الاستدلال الإحصائي وحمايته من التضخم الزائف لمعنوية النتائج.
7. القراءة التفسيرية الشاملة لمخرجات الانحدار في Stata
7.1 تفسير جدول تحليل التباين ومؤشرات جودة التوفيق العامة
عند تنفيذ أمر الانحدار في Stata، تظهر مخرجات التقدير مقسمة إلى ثلاثة أقسام رئيسية: جدول تحليل التباين (ANOVA Table) في الجزء العلوي الأيسر، ومؤشرات جودة النموذج في الجزء العلوي الأيمن، وجدول المعاملات الإحصائية في النصف السفلي.

يحتوي جدول تحليل التباين على مجموع المربعات (SS) ودرجات الحرية (df) ومربعات المتوسطات (MS) للنموذج وللبواقي. ومن أهم المؤشرات التي يجب فحصها أولاً:
- إحصائية F المحسوبة (F-statistic) وقيمتها الاحتمالية (Prob > F): تختبر الفرضية الصفرية القائلة بأن جميع معاملات الانحدار في النموذج تساوي الصفر معاً ($H_0: \beta_1 = \beta_2 = 0$). إذا كانت القيمة الاحتمالية أقل من مستوى المعنوية المعتاد ($p < .001$)، فإننا نرفض الفرضية الصفرية ونستنتج أن النموذج ككل دال إحصائياً ويفسر قدراً حقيقياً من التباين في المتغير التابع.
- معامل التحديد ($R^2$): يوضح النسبة المئوية للتباين في درجات السعادة المفسرة بواسطة ساعات العمل وحدها التربيعي معاً. على سبيل المثال، إذا كانت قيمة $R^2 = 0.425$، فهذا يعني أن النموذج يفسر 42.5% من إجمالي التباين في مستويات السعادة.
- معامل التحديد المعدل (Adj $R^2$): يعاقب النموذج على إضافة متغيرات جديدة لا تسهم جوهرياً في التفسير، ويعد مؤشراً أدق للمقارنة بين النماذج ذات الأعداد المختلفة من المعلمات.
- جذر متوسط مربعات الخطأ (Root MSE): يمثل الانحراف المعياري للبواقي، ويعبر عن متوسط خطأ التنبؤ بنفس وحدات قياس المتغير التابع.
7.2 تفسير معاملات المعلمات والحدود الخطية والتربيعية
يقدم جدول المعاملات في Stata تقديرات المربعات الصغرى، والأخطاء المعيارية، وقيم $t$، والقيم الاحتمالية المقابلة ($p$-value)، وفترات الثقة 95%. لنفترض أن مخرجات Stata أظهرت المعادلة المقدرة التالية:
$$\widehat{\text{happiness}} = 35.20 + 2.45 \times \text{hours} – 0.035 \times \text{hours}^2$$
يتم تفكيك وتفسير هذه النتائج وفق الضوابط الإحصائية التالية:
- الحد الثابت ($\hat{\beta}_0 = 35.20, p < .001$): يمثل متوسط درجة السعادة المتوقعة لشخص يعمل صفر ساعة في الأسبوع.
- الحد الخطي ($\hat{\beta}_1 = 2.45, p < .001$): يعبر عن الميل اللحظي الأولي؛ أي أن زيادة ساعات العمل بالقرب من الصفر ترتبط بزيادة فورية في السعادة بمعدل 2.45 نقطة لكل ساعة عمل إضافية.
- الحد التربيعي ($\hat{\beta}_2 = -0.035, p < .001$): يحمل إشارة سالبة ودلالة إحصائية عالية، وهو ما يؤكد رياضياً أن المنحنى مقعر لأسفل ($cap$) ويتخذ شكل حرف $U$ المقلوب، مما يدل على أن الأثر الإيجابي لساعات العمل يتناقص تدريجياً حتى ينعكس ويصبح أثراً سلبياً ضاراً بالسعادة عند مستويات العمل المرتفعة.
7.3 الحساب الدقيق لنقطة التحول والتفسير السيكولوجي لها
بناءً على المعادلة المقدرة، يمكن حساب عدد ساعات العمل الأمثل الذي يحقق أعلى مستوى من السعادة عبر الصيغة الرياضية:
$$\text{Hours}_{vertex} = -\frac{\hat{\beta}_1}{2\hat{\beta}_2} = -\frac{2.45}{2 \times (-0.035)} = \frac{2.45}{0.070} = 35 \text{ ساعة أسبوعياً}$$
لحساب هذه النقطة آلياً في Stata مع استخراج خطئها المعياري وفترة ثقتها بنسبة 95% عبر طريقة دلتا، نستخدم أمر التركيبات غير الخطية nlcom بعد تنفيذ الانحدار مباشرة:
nlcom (Vertex: -_b[hours] / (2 * _b[c.hours#c.hours]))
سيقوم Stata بطباعة جدول يوضح أن النقطة المقدرة هي 35.00 ساعة، مع فترة ثقة تتراوح مثلاً بين [33.20, 36.80] ساعة أسبوعياً. يحمل هذا التقدير دلالة تطبيقية سيكولوجية عميقة؛ فهو يوضح أن زيادة العمل ترفع من الرفاهية والسعادة ما دامت دون عتبة 35 ساعة في الأسبوع، ولكن تجاوز هذا الحد يرهق الموظف ويدخله في نطاق التناقص الحاد في السعادة، مما يوفر دليلاً علمياً لصانعي السياسات لتحديد سقف ساعات العمل الأسبوعية.
8. المقارنة الإحصائية المنهجية بين النموذج الخطي والتربيعي
8.1 المقارنة الهرمية واختبار التغير في معامل التحديد (F-Change Test)
للبرهنة المنهجية على أن العلاقة غير خطية، لا يكتفي الباحث بتقدير النموذج التربيعي منفرداً، بل يتعين عليه إجراء انحدار هرمي متسلسل (Hierarchical Regression) يقارن فيه النموذج الخطي الأساسي (Model 1) بالنموذج التربيعي المتقدم (Model 2)، لاختبار ما إذا كانت إضافة الحد التربيعي تسهم في زيادة ذات دلالة إحصائية في معامل التحديد ($\Delta R^2$).
يمكن إجراء هذا الاختبار الهرمي في Stata إما خطوة بخطوة أو باستخدام الأمر المباشر nestreg:
nestreg: regress happiness (hours) (c.hours#c.hours)
يقوم أمر nestreg بتقدير النموذج الخطي أولاً، ثم يدخل الحد التربيعي في الكتلة الثانية (Block 2)، ويحسب تلقائياً إحصائية $F$ للتغير ($F\text{-change}$) والقيمة الاحتمالية المقابلة للزيادة في تباين السعادة المفسر ($\Delta R^2$). إذا كانت القيمة الاحتمالية لاختبار $F$ أقل من 0.05، يُعد ذلك دليلاً قاطعاً على التفوق الإحصائي للنموذج التربيعي وضرورته المنهجية.
8.2 اختبار نسبة الإمكانية (Likelihood Ratio Test)
عندما يتم تقدير النماذج المتداخلة (Nested Models) عبر أسلوب الإمكانية الأعظم (Maximum Likelihood) أو عند الرغبة في إجراء مقارنة رصينة بين النماذج المخزنة، يمكن تطبيق اختبار نسبة الإمكانية عبر أمر lrtest. يتم تقدير النموذجين وتخزينهما بالترتيب:
regress happiness hours
estimates store Linear_Model
regress happiness c.hours##c.hours
estimates store Quadratic_Model
lrtest Linear_Model Quadratic_Model
يختبر هذا الأمر الفرضية الصفرية القائلة بأن النموذج الخطي البسيط كافٍ ومطابق للبيانات مقارنة بالنموذج التربيعي الأكثر تعقيداً. يولد الأمر إحصائية كاي-تربيع ($\chi^2$) بدرجة حرية واحدة؛ وإذا كانت القيمة الاحتمالية دالة إحصائياً ($p < .001$)، يتم رفض النموذج الخطي وتفضيل النموذج التربيعي بشكل منهجي حاسم.
8.3 المفاضلة بناءً على معايير المعلومات (AIC و BIC)
تُعد معايير المعلومات من أهم الأدوات الإحصائية للمفاضلة بين النماذج التنافسية؛ حيث تقيم جودة مطابقة النموذج للبيانات مع فرض عقوبة رياضية صارمة على زيادة عدد المعلمات المقدرة لحماية الباحث من مشكلة الإفراط في التوفيق (Overfitting). أشهر هذه المقاييس هما معيار آكيكي للمعلومات (AIC) ومعيار بيز للمعلومات (BIC).
في برنامج Stata، بعد تخزين النموذجين، يمكن استخراج جدول مقارنة معايير المعلومات بضغطة واحدة عبر أمر:
estimates stats Linear_Model Quadratic_Model
| النموذج (Model) | درجات الحرية (df) | لوغاريتم الإمكانية (Log-Lik) | معيار آكيكي (AIC) | معيار بيز (BIC) |
|---|---|---|---|---|
| النموذج الخطي (Linear) | 2 | -1850.40 | 3704.80 | 3713.22 |
| النموذج التربيعي (Quadratic) | 3 | -1720.15 | 3446.30 | 3458.93 |
تتم المفاضلة دائماً بترجيح النموذج الذي يحقق قيماً أقل لكل من AIC و BIC. وبما أن النموذج التربيعي يسجل انخفاضاً جوهرياً وحاداً في قيم المعيارين مقارنة بالنموذج الخطي (فارق AIC يتجاوز 250 نقطة)، فإن ذلك يثبت بما لا يدع مجالاً للشك أن النموذج التربيعي يمثل الهيكل الحقيقي المولد للبيانات بكفاءة رياضية عليا.
9. تشخيص افتراضات الانحدار والتحقق من صحة النموذج
9.1 فحص التوزيع الطبيعي للبواقي (Residual Normality)
تفترض الاستدلالات الإحصائية (اختبارات $t$ وفترات الثقة) أن بواقي النموذج ($\hat{\varepsilon}_i = Y_i – \hat{Y}_i$) تتوزع توزيعاً طبيعياً متماثلاً. للتحقق من هذا الافتراض، نقوم أولاً بحساب واستخراج البواقي بعد تنفيذ الانحدار التربيعي عبر أمر predict:
predict resid_quad, residuals
يمكن فحص اعتدالية البواقي بيانياً باستخدام الرسم الاحتمالي الطبيعي ومخطط كثافة النواة (Kernel Density) ومقارنته بالتوزيع الطبيعي النظري:
qnorm resid_quad, title("الرسم الاحتمالي الطبيعي للبواقي (Q-Q Plot)")
kdensity resid_quad, normal title("توزيع كثافة البواقي مقارنة بالتوزيع الطبيعي")
كما يمكن تعزيز الفحص البصري باختبار إحصائي صارم مثل اختبار شابيرو-ويلك (Shapiro-Wilk Test) عبر كتابة:
swilk resid_quad
إذا كانت القيمة الاحتمالية للاختبار أكبر من 0.05 ($p > .05$)، فإننا نقبل الفرضية الصفرية القائلة بأن البواقي تتبع التوزيع الطبيعي، مما يؤكد سلامة واستقرار الاختبارات الاستدلالية للنموذج.
9.2 اختبار تجانس التباين والاستقلال (Homoscedasticity)
يعد افتراض ثبات تباين الأخطاء شرطاً أساسياً لضمان كفاءة مقدرات المربعات الصغرى. يمكن فحص هذا الافتراض بيانياً من خلال رسم البواقي مقابل القيم المتنبأ بها ($\hat{Y}$) باستخدام الأمر المباشر rvfplot (Residual-versus-Fitted Plot):
rvfplot, yline(0, lcolor(red) lpattern(dash)) title("مخطط البواقي مقابل القيم المتنبأ بها")
إذا كانت النقاط موزعة عشوائياً كشريط مستطيل متجانس حول الخط الصفري دون اتخاذ شكل قمعي (Funnel Shape)، فإن افتراض تجانس التباين يكون محققاً بصرياً.
ولدعم الفحص البياني باختبار معلمي دقيق، نطبق اختبار بروش-باغان / كوك-وايزبرغ (Breusch-Pagan / Cook-Weisberg Test) عبر أمر ما بعد التقدير estat hettest:
estat hettest
إذا أظهر الاختبار دلالة إحصائية ($p < .05$)، فإن ذلك يشير إلى وجود مشكلة عدم تجانس التباين، ويكون الحل المنهجي المباشر هو إعادة تقدير النموذج باستخدام خيار الأخطاء المعيارية القوية vce(robust) كما شرحنا سابقاً.
9.3 تقييم التعدد الخطي باستخدام معامل تضخم التباين (VIF)
لفحص مدى تأثير التعدد الخطي بين المتغير وحدّه التربيعي، يوفر Stata أمر حساب معامل تضخم التباين (Variance Inflation Factor – VIF):
estat vif
في النماذج غير المتمركزة، قد تظهر قيم VIF مرتفعة جداً للحدين الخطي والتربيعي (تتجاوز 10 أو حتى 50). من الضروري جداً أن يدرك الباحث هنا التمييز بين التعدد الخطي الجوهري (الناشئ عن ارتباط متغيرين مختلفين مثل الدخل ومستوى التعليم) والتعدد الخطي غير الجوهري (الناشئ عن تربيع نفس المتغير). لا يؤثر التعدد الخطي الناتج عن التربيع إطلاقاً على القوة التنبؤية للنموذج ككل ولا على دلالة الحد التربيعي أو حساب نقطة التحول.
ومع ذلك، إذا قام الباحث بإعادة تقدير النموذج باستخدام المتغير المتمركز حول المتوسط (hours_c و hours_c2) وتشغيل estat vif مرة أخرى، سيلاحظ هبوط قيم VIF فوراً إلى مستويات ممتازة (أقل من 2.0)، مما يبرهن على استقرار النموذج والتخلص من أي تداخل مصطنع في الحسابات.
9.4 اكتشاف المشاهدات المؤثرة والنقاط الحرجة
قد تنشأ بعض المشكلات في النماذج التربيعية نتيجة وجود مشاهدات ذات رافعة إحصائية عالية (High Leverage) أو مشاهدات مؤثرة بصورة شاذة تغير من زاوية الانحناء. لقياس مدى تأثير كل مشاهدة فردية على المعاملات المقدرة ككل، نستخدم مقياس مسافة كوك (Cook’s Distance) عبر أمر:
predict cook_d, cooksd
المعيار الإحصائي الشائع هو أن أي مشاهدة تتجاوز فيها مسافة كوك عتبة $\frac{4}{N}$ (حيث $N$ هو حجم العينة) أو تتجاوز القيمة 1.0 تعتبر نقطة مؤثرة تستدعي الفحص. كما يمكن رسم مخطط الرافعة مقابل مربع البواقي القياسية عبر أمر lvr2plot:
lvr2plot, title("مخطط الرافعة مقابل البواقي الطلابية المربعة")
إذا تم اكتشاف حالات شاذة ناتجة عن أخطاء إدخال بيانات، يتم تصحيحها أو استبعادها، أما إذا كانت حالات واقعية من صلب المجتمع، فينبغي إجراء تحليل الحساسية (Sensitivity Analysis) عبر تقدير النموذج مع وجودها وبدونها لبيان مدى متانة النتائج وتوثيق ذلك بشفافية كاملة في البحث.
10. التمثيل البياني المتقدم والتأثيرات الهامشية في Stata
10.1 حساب التنبؤات الهامشية باستخدام أمر margins
يُعد أمر margins في Stata من أقوى وأدق الأدوات الإحصائية في العالم لتحليل وتفكيك النماذج غير الخطية. يتيح هذا الأمر للباحث حساب مستويات الاستجابة المتوقعة بدقة عند قيم محددة مسبقاً للمتغير المستقل عبر استخدام الخيار at():
margins, at(hours=(10(5)60))
يقوم هذا الأمر بحساب مستوى السعادة المتوقع عندما تكون ساعات العمل 10، 15، 20، وصولاً إلى 60 ساعة أسبوعياً، مع حساب الخطأ المعياري وفترة الثقة 95% لكل قيمة على حدة.
الأمر الأكثر إبهاراً من الناحية التحليلية هو حساب التأثيرات الهامشية الآنية (Instantaneous Marginal Effects) أو ما يُعرف بالميول الهامشية، عبر اشتقاق النموذج بالنسبة لساعات العمل عند مختلف النقاط باستخدام خيار dydx():
margins, dydx(hours) at(hours=(10(10)60))
يوضح هذا الجدول التغير في الميل؛ حيث يظهر ميلاً موجباً ودالاً إحصائياً عند 10 ساعات ($dydx > 0$)، ثم يقترب الميل من الصفر عند 35 ساعة ($dydx \approx 0$) ليعكس بلوغ الذروة، ثم يتحول إلى ميل سالب ودال إحصائياً عند 50 و 60 ساعة ($dydx < 0$)، مما يقدم برهاناً رقمياً شاملاً على ديناميكية المنحنى وتغير اتجاه الأثر السلوكي.
10.2 رسم منحنى الاستجابة وفترات الثقة عبر marginsplot
بعد تنفيذ أمر margins، يتيح Stata رسم منحنى الاستجابة التربيعي الكامل مع نطاقات فترات الثقة (Confidence Bands) بنقرة زر واحدة عبر الأمر فائق التخصيص marginsplot:
margins, at(hours=(10(2)60))
marginsplot, title("المنحنى التربيعي المتوقع لمستوى السعادة وفترات الثقة 95%") xtitle("ساعات العمل الأسبوعية") ytitle("مستوى السعادة المتوقع") recast(line) recastci(rarea) ciopts(color(navy%20)) lineopts(lcolor(navy) lwidth(thick)) plotopts(msymbol(none))
يقوم الخيار recast(line) برسم الاستجابة كخط منحني ناعم ومستمر، بينما يحول الخيار recastci(rarea) فترات الثقة 95% إلى شريط مظلل ناعم حول الخط بلون كحلي شفاف (navy%20)، مما ينتج شكلاً بيانياً شديد الاحترافية والجاذبية يوضح نطاق عدم اليقين حول تقديرات المنحنى عبر كامل نطاق ساعات العمل.
10.3 تصدير الرسوم البيانية بجودة النشر الأكاديمي
تشترط المجلات العلمية المصنفة عالمياً (مثل مجلات APA و Elsevier و Springer) معايير جودة عالية للرسومات البيانية؛ بحيث لا تقل دقتها عن 300 أو 600 نقطة في البوصة (DPI) وأن يتم تصديرها بصيغ متجهة (Vector Graphics) أو بصيغ صور نقطية غير مضغوطة مثل TIFF أو EPS.
يتيح برنامج Stata تصدير الشكل البياني النشط مباشرة عبر أمر graph export:
graph export "Quadratic_Happiness_Curve.png", width(3000) height(2000) replace
graph export "Quadratic_Happiness_Curve.tif", as(tif) dpi(300) replace
graph export "Quadratic_Happiness_Curve.eps", as(eps) replace
يضمن التصدير بصيغة EPS أو بتنسيق TIFF عالي الدقة الحفاظ على الحدة التامة للخطوط والكتابات العربية والإنجليزية عند إدراجها في برامج تحرير النصوص وصف المجلات العلمية.
11. تطبيقات متقدمة: المتغيرات الضابطة والتفاعلات غير الخطية
11.1 دمج المتغيرات الضابطة والمتغيرات الديموغرافية (Covariates)
في الأبحاث النفسية والتطبيقية، لا تحدث الظواهر في فراغ معزول؛ إذ تتأثر السعادة بمجموعة من المتغيرات الأخرى مثل العمر (age)، ومستوى الدخل السنوي (income)، والحالة الاجتماعية (marital_status). لذلك، يجب فحص ما إذا كان الانحناء التربيعي يظل مستقراً ودالاً إحصائياً بعد ضبط وتثبيت تأثير هذه المتغيرات الخارجية (Covariates).
يتم بناء النموذج المتعدد في Stata بسهولة عبر إدراج المتغيرات الضابطة جنباً إلى جنب مع الحدين الخطي والتربيعي:
regress happiness c.hours##c.hours age income i.marital_status
يُستخدم المشغل i. قبل متغير الحالة الاجتماعية لإعلام Stata بأنه متغير فئوي (Categorical Variable) ليقوم البرنامج بإنشاء المتغيرات الوهمية (Dummy Variables) واختيار الفئة المرجعية تلقائياً. إذا ظل معامل الحد التربيعي (c.hours#c.hours) سالباً ودالاً إحصائياً بعد هذا الضبط الشامل، فإن ذلك يعزز بقوة من مصداقية الاستنتاج بأن العلاقة غير الخطية بين ساعات العمل والسعادة هي ظاهرة حقيقية وليست ناتجة عن تباين زائف تسببه متغيرات ديموغرافية أخرى.
11.2 نمذجة التفاعل بين المتغير التربيعي ومتغير تصنيفي (Curvilinear Moderation)
من الأسئلة البحثية المتقدمة والمثيرة في العلوم السلوكية: هل يختلف شكل المنحنى أو موقع نقطة التحول باختلاف فئات الأفراد (مثل الذكور مقابل الإناث، أو العاملين عن بُعد مقابل العاملين من المكتب)؟ يُعرف هذا النوع من النمذجة بالتعديل المنحني أو تفاعل المنحنيات (Curvilinear Moderation).
يمكن صياغة هذا التفاعل المعقد في Stata في سطر برمجي واحد فائق القوة باستخدام المشغلات المزدوجة:
regress happiness c.hours##c.hours##i.gender
يقوم هذا الأمر بتقدير الآثار الرئيسية للجنس وساعات العمل، وتفاعل الجنس مع الحد الخطي (c.hours#i.gender)، وتفاعل الجنس مع الحد التربيعي (c.hours#c.hours#i.gender). إذا كان تفاعل الحد التربيعي دالاً إحصائياً، فهذا يثبت أن درجة انحناء المنحنى تختلف جوهرياً بين الذكور والإناث.
ولتوضيح هذا التفاعل بصرياً، نستخدم الأمرين margins و marginsplot لإنتاج منحنيين منفصلين لكل جنس على نفس الرسم:
margins gender, at(hours=(10(5)60))
marginsplot, title("تعديل الجنس للعلاقة غير الخطية بين ساعات العمل والسعادة") xtitle("ساعات العمل") ytitle("السعادة المتوقعة") legend(order(1 "الذكور" 2 "الإناث"))
11.3 استكشاف النماذج التكعيبية والحدود الأعلى (Cubic Terms)
في بعض السياقات النظرية النادرة، قد تفترض الأدبيات وجود علاقة تتخذ شكل حرف $S$ أو مساراً يتموج مرتين عبر النطاق، وهو ما يستدعي اختبار حد تكعيبي من الدرجة الثالثة ($X^3$). يتم اختبار النموذج التكعيبي في Stata عبر كتابة:
regress happiness c.hours##c.hours##c.hours
ومع ذلك، يجب التعامل مع النماذج التكعيبية والحدود العليا بحذر منهجي شديد؛ فالنماذج متعددة الحدود ذات الدرجات العالية شديدة الحساسية للقيم الشاذة عند أطراف البيانات وتميل بسرعة نحو الإفراط في التوفيق (Overfitting)، مما يجعل المنحنى ينعكس في أقصى الأطراف بصورة غير منطقية سيكولوجياً. لذلك، لا يجوز قبول الحد التكعيبي إلا إذا كان مدعوماً بأساس نظري صلب واختبارات معنوية واضحة وتحسن ملحوظ في معايير AIC و BIC.
12. كتابة وتوثيق نتائج الانحدار التربيعي وفق دليل APA
12.1 بناء وتنسيق جداول النتائج الإحصائية للنشر العلمي
يتطلب النشر في المجلات المعتمدة إعداد جداول إحصائية منظمة تعرض النماذج المتتابعة بوضوح وتلتزم بتعليمات الدليل الإرشادي السابع لجمعية علم النفس الأمريكية (APA 7th Edition). يوفر Stata العديد من الحزم البرمجية المتخصصة لتصدير الجداول مباشرة إلى صيغة Word مثل outreg2 و asdoc وأمر Stata المدمج الجديد etable.
يمكن تصدير جدول مقارنة النماذج باستخدام حزمة outreg2 بعد تثبيتها عبر الأوامر التالية:
regress happiness hours
outreg2 using "Regression_Table.doc", replace ctitle("Model 1 (Linear)") bdec(3) sdec(3) r2 ar2
regress happiness c.hours##c.hours
outreg2 using "Regression_Table.doc", append ctitle("Model 2 (Quadratic)") bdec(3) sdec(3) r2 ar2
regress happiness c.hours##c.hours age income
outreg2 using "Regression_Table.doc", append ctitle("Model 3 (Adjusted)") bdec(3) sdec(3) r2 ar2
| المتغيرات المستقلة | النموذج 1 (الخطي) $\beta$ (SE) | النموذج 2 (التربيعي) $\beta$ (SE) | النموذج 3 (المعدل) $\beta$ (SE) |
|---|---|---|---|
| الحد الثابت (Constant) | 52.120*** (1.450) | 35.200*** (2.100) | 28.450*** (3.200) |
| ساعات العمل (Hours) | 0.120* (0.055) | 2.450*** (0.180) | 2.310*** (0.175) |
| مربع ساعات العمل ($\text{Hours}^2$) | — | -0.035*** (0.003) | -0.033*** (0.003) |
| العمر (Age) | — | — | 0.085** (0.030) |
| الدخل (Income) | — | — | 0.140*** (0.025) |
| معامل التحديد ($R^2$) | .015 | .425 | .468 |
| التغير في معامل التحديد ($\Delta R^2$) | — | .410*** | .043*** |
ملاحظة: القيم المعروضة تمثل معاملات الانحدار غير المعيارية متبوعة بالأخطاء المعيارية بين قوسين. * $p < .05$, ** $p < .01$, *** $p < .001$.
12.2 الصياغة النصية الأكاديمية الدقيقة لتفسير المنحنى
عند كتابة قسم النتائج (Results Section) في تقرير البحث، يجب صياغة الفقرات النصية بأسلوب أكاديمي محكم يربط الأرقام الإحصائية بدلالاتها السيكولوجية، كما في النموذج المقترح التالي:
“لاختبار الفرضية القائلة بوجود علاقة منحنية على شكل حرف U مقلوب بين ساعات العمل الأسبوعية ومستوى السعادة الذاتية، تم إجراء تحليل انحدار هرمي متعدد الخطوات. في الخطوة الأولى، تم إدخال الحد الخطي لساعات العمل، حيث أظهر النموذج تفسيراً ضئيلاً للغاية لتباين السعادة ($R^2 = .015, F(1, 498) = 7.58, p = .006$). وفي الخطوة الثانية، أدى إدخال الحد التربيعي لساعات العمل ($\text{hours}^2$) إلى زيادة جوهرية وذات دلالة إحصائية فائقة في التباين المفسر ($\Delta R^2 = .410, \Delta F(1, 497) = 354.20, p < .001$)، ليرتفع إجمالي التباين المفسر إلى ($R^2 = .425, Adj R^2 = .423$)."
“أظهرت معاملات النموذج التربيعي أن المعامل الخطي كان موجباً ودالاً إحصائياً ($B = 2.450, SE = 0.180, t = 13.61, p < .001, 95% CI [2.096, 2.803]$)، في حين كان معامل الحد التربيعي سالباً ودالاً إحصائياً ($B = -0.035, SE = 0.003, t = -18.82, p < .001, 95% CI [-0.039, -0.031]$). تؤكد الإشارة السالبة للحد التربيعي الطبيعة المقعرة للمنحنى (Inverted U-shape). وباستخدام طريقة دلتا (Delta Method) عبر أمر nlcom، تم تقدير نقطة التحول القصوى (Vertex) عند $35.00$ ساعة عمل أسبوعياً ($SE = 0.92, 95% CI [33.20, 36.80]$). تشير هذه النتيجة إلى أن مستويات السعادة ترتفع طردياً مع زيادة ساعات العمل حتى تبلغ ذروتها عند 35 ساعة أسبوعياً، لتبدأ السعادة بعدها في الانحدار الحاد مع كل زيادة إضافية في ساعات العمل، وهو ما يوفر دعماً تجريبياً كاملاً للفرضية المحددة (انظر الشكل 1)."
12.3 الأخطاء الشائعة في تحليل وتفسير الانحدار التربيعي وكيفية تجنبها
يقع العديد من الباحثين في عثرات منهجية وإحصائية عند التعامل مع النماذج التربيعية؛ ومن أبرز هذه الأخطاء:
- تفسير الحد الخطي بمعزل عن الحد التربيعي غير المتمركز: الوقوع في خطأ القول بأن “ساعات العمل لها أثر إيجابي عام” بمجرد النظر إلى $\beta_1$ الموجب في نموذج غير متمركز، وتجاهل حقيقة أن $\beta_1$ يمثل الميل عند الصفر فقط.
- إسقاط وتعميم المنحنى خارج نطاق البيانات المرصودة (Extrapolation): حساب نقطة تحول تقع خارج نطاق العينة الفعلي (مثلاً حساب قمة عند 85 ساعة عمل بينما أقصى مشاهدة في العينة هي 55 ساعة)؛ حيث يُعد هذا التفسير باطلاً رياضياً ومنهجياً.
- إغفال فحص البواقي والاعتماد الكلي على $R^2$: قد يعطي النموذج التربيعي قيمة $R^2$ مرتفعة بفعل مشاهدات شاذة متطرفة دون أن يمثل الهيكل الحقيقي للبيانات، مما يؤكد ضرورة الفحص التشخيصي الشامل لافتراضات البواقي.
- تجاهل استخدام مشغلات المتغيرات المستمرة في Stata: الإصرار على التوليد اليدوي للمتغيرات وحساب الميول الهامشية يدوياً، مما يرفع احتمالية الخطأ البشري في حساب فترات الثقة ونقاط الانقلاب.
خاتمة
يمثل الانحدار التربيعي أداة إحصائية راقية تمكن الباحثين في العلوم النفسية والسلوكية والاجتماعية من سبر أغوار العلاقات الإنسانية المعقدة ونمذجة نقاط الذروة والتحول بدقة تفوق بكثير ما تقدمه النماذج الخطية المقيدة. ومن خلال بيئة العمل القوية والمرنة لبرنامج Stata، يستطيع الباحث صياغة النماذج المتقدمة، وتشخيص افتراضاتها، وتوليد الرسوم البيانية التفاعلية ومخططات التأثيرات الهامشية، وتوثيق النتائج وفق أعلى معايير النشر الأكاديمي الدولي الرصين.
References
- Aiken, L. S., & West, S. G. (1991). Multiple regression: Testing and interpreting interactions. SAGE Publications.
- Cohen, J., Cohen, P., West, S. G., & Aiken, L. S. (2003). Applied multiple regression/correlation analysis for the behavioral sciences (3rd ed.). Lawrence Erlbaum Associates.
- Fox, J. (2015). Applied regression analysis and generalized linear models (3rd ed.). SAGE Publications.
- Grant, A. M., & Schwartz, B. (2011). Too much of a good thing: The challenge and opportunity of the inverted U. Perspectives on Psychological Science, 6(1), 61–76. https://doi.org/10.1177/1745691610393523
- Haans, R. F., Pieters, C., & He, Z. L. (2016). Thinking about U: Theorizing and testing U- and inverted U-shaped relationships in strategy research. Strategic Management Journal, 37(7), 1177–1195. https://doi.org/10.1002/smj.2399
- Long, J. S., & Freese, J. (2014). Regression models for categorical dependent variables using Stata (3rd ed.). Stata Press.
- Mitchell, M. N. (2012). Interpreting and visualizing regression models using Stata. Stata Press.
- StataCorp. (2023). Stata base reference manual: Release 18. Stata Press. https://www.stata.com/manuals/r.pdf
- Williams, R. (2012). Using the margins command to estimate and interpret adjusted predictions and marginal effects. The Stata Journal, 12(2), 308–331. https://doi.org/10.1177/1536867X1201200209
- Wooldridge, J. M. (2020). Introductory econometrics: A modern approach (7th ed.). Cengage Learning.