الإحصاء والقياس النفسيطرق البحث العلمي

كيفية إجراء الانحدار الخطي يدوياً

دليل أكاديمي شامل يشرح كيفية حساب نموذج الانحدار الخطي البسيط يدوياً خطوة بخطوة باستخدام القوانين الرياضية وطريقة المربعات الصغرى بدقة وإتقان.

تاريخ النشر

يُمثّل تحليل الانحدار الخطي البسيط (Simple Linear Regression) أحد أركان التحليل الإحصائي الاستدلالي والنمذجة القياسية في شتى العلوم التجريبية والسلوكية والاجتماعية والاقتصادية. وعلى الرغم من الهيمنة التقنية الحديثة للبرمجيات الإحصائية المتطورة واللغات البرمجية المتخصصة مثل R وPython وحزم SPSS Statistics، فإن التمكن المعرفي والرياضي من إجراء هذا التحليل يدوياً، خطوة بخطوة، باستخدام الورقة والقلم والآلة الحاسبة البسيطة، يظل مهارة منهجية فارقة لا غنى عنها لأي باحث أو طالب يسعى لفهم حقيقة البنية التحتية للخوارزميات الإحصائية.

إن إجراء الانحدار الخطي يدوياً ينقل المتعلم من مجرد متلقٍ سلبي يُدخل مصفوفات الأرقام داخل “صندوق أسود” وينتظر مخرجات جاهزة، إلى محلل إحصائي متمكن يدرك تماماً كيف تتفاعل التباينات والتغايرات، وكيف تُترجم المسافات الإقليدية بين النقاط المشاهدة والمستقيم النظري إلى معلمات رياضية دقيقة تُجسد مبدأ المربعات الصغرى العادية (Ordinary Least Squares – OLS). ويتيح هذا الفهم العميق تشخيص المشكلات الهيكلية في النماذج، والتحقق من مدى اتساق الافتراضات الإحصائية، وبناء حس علمي سليم يُميز بين الارتباط العرضي والعلاقة التفسيرية الرصينة.

يقدم هذا الدليل المرجعي الشامل دليلاً تعليمياً وتطبيقياً فائق التفصيل لكيفية حساب معلمات الانحدار الخطي البسيط واختبار فروضه ومقاييس جودة توفيقه يدوياً من الصفر. وسنستعرض في هذا المقال الخلفيات الرياضية والاشتقاقات التفاضلية، ثم ننتقل إلى تفكيك العمليات الحسابية للأعمدة التراكمية، واستخراج الميل والمقطع الصادي، وتفكيك مجموع المربعات وبناء جدول تحليل التباين (ANOVA)، وصولاً إلى تطبيق عملي متكامل على بيانات سلوكية حقيقية، مع توضيح استراتيجيات المراجعة الذاتية لمنع الأخطاء الحسابية والمفاهيمية الشائعة.

1. الأسس النظرية والمفاهيمية لتحليل الانحدار الخطي البسيط

1.1 تعريف الانحدار الخطي وطبيعته الرياضية

يُعرف تحليل الانحدار الخطي البسيط بأنه نموذج إحصائي ورياضي يهدف إلى دراسة ونمذجة طبيعة العلاقة التفسيرية أو التنبؤية بين متغيرين كميين: المتغير الأول هو المتغير المستقل أو التفسيري (Explanatory Variable) ويُرمز له عالمياً بالحرف $X$، والمتغير الثاني هو المتغير التابع أو متغير الاستجابة (Response Variable) ويُرمز له بالحرف $Y$. وتستند الطبيعة الرياضية لهذا النموذج إلى افتراض وجود مسار خطي مستقيم يُمثل اتجاه التغير في $Y$ عند حدوث تغيرات منتظمة في $X$.

من الأهمية المنهجية القصوى التمييز الدقيق والواضح بين مفهوم معامل الارتباط الخطي (Linear Correlation) ومفهوم الانحدار الخطي (Linear Regression). فالارتباط، كما يُقاس بمعامل بيرسون للارتباط، هو مقياس ثنائي الاتجاه ومتماثل يقيس قوة واتجاه الاقتران الخطي بين متغيرين دون افتراض تبعية أحدهما للآخر أو تحديد علاقة سببية رياضية؛ أي أن ارتباط $X$ بـ $Y$ يُطابق تماماً ارتباط $Y$ بـ $X$. في المقابل، يتسم الانحدار بعدم التماثل، حيث يفترض نموذجاً توجيهياً يُفسر فيه $X$ التغير الحاصل في $Y$، مما يجعل لمعادلة الانحدار قدرة وظيفية على التنبؤ بسلوك المتغير التابع بناءً على قيم معلومة للمتغير المستقل.

تكمن الأهمية الجوهرية للنمذجة الخطية في قدرتها المزدوجة على “التفسير” و”التنبؤ”. فعلى الصعيد التفسيري، تتيح النمذجة قياس الأثر الكمي الصافي لكل وحدة تغيير إضافية في المتغير التفسيري على متغير النتيجة، مما يوفر لصناع القرار في مجالات علم النفس، والتعليم، والاقتصاد فهماً كمياً دقيقاً لديناميكيات الظاهرة المدروسة. أما على الصعيد التنبؤي، فإنها تُمكن الباحثين من تقدير القيم المستقبلية أو غير المشاهدة لمتغير الاستجابة بدرجة موثوقة من الدقة الإحصائية.

يُصاغ النموذج الرياضي العام للانحدار الخطي البسيط على مستوى المجتمع الإحصائي الكلي (Population Model) بالمعادلة المعيارية التالية:

$$Y_i = \beta_0 + \beta_1 X_i + \varepsilon_i$$

حيث يُمثل $Y_i$ القيمة الفعلية لمتغير الاستجابة للمشاهدة رقم $i$، و$X_i$ قيمة المتغير المستقل المناظرة لها، و$\beta_0$ الحد الثابت للمجتمع (Population Intercept)، و$\beta_1$ معامل الانحدار أو الميل الحقيقي للمجتمع (Population Slope)، في حين يُمثل $\varepsilon_i$ حد الخطأ العشوائي (Random Error Component). ويعكس هذا الحد العشوائي حقيقة أن الظواهر الإنسانية والطبيعية لا تخضع لحتمية جبرية مطلقة، بل تتأثر بمتغيرات كامنة غير مقاسة، وأخطاء قياس عشوائية، وتقلبات طبيعية متأصلة في وحدات المعاينة الإحصائية.

1.2 افتراضات الانحدار الخطي الواجب مراعاتها قبل الحساب اليدوي

قبل الشروع في المعالجة الحسابية اليدوية لمصفوفة البيانات، يتعين على الباحث التحقق المنهجي من استيفاء مجموعة من الافتراضات الإحصائية الكلاسيكية التي تشكل الأساس النظري لصحة وموثوقية المقدرات الناتجة بطريقة المربعات الصغرى. يُعد افتراض “خطية العلاقة” (Linearity) أول وأهم هذه الشروط، حيث يُفترض أن العلاقة الجوهرية بين المتوسط المشروط لـ $Y$ والمتغير $X$ هي علاقة مستقيمة وليست منحنية أو لوغاريتمية. ويمكن التحقق الأولي من هذا الافتراض يدوياً وبصرياً عبر رسم شكل الانتشار (Scatter Plot) للنقاط البيانية وملاحظة النمط الهندسي العام لتوزعها في المستوى الإحداثي.

يتجسد الافتراض الثاني في “استقلالية المشاهدات” (Independence of Observations)، والذي يقتضي أن تكون قيمة الخطأ العشوائي المقترنة بأي مشاهدة مستقلة تماماً عن أخطاء المشاهدات الأخرى، بحيث لا يوجد ارتباط ذاتي (Autocorrelation) بين الأخطاء، وهو افتراض يتحقق أساساً من خلال التصميم التجريبي الرصين والمعاينة العشوائية البسيطة. ويقترن بذلك افتراض “التوزيع الطبيعي للأخطاء العشوائية” بمتوسط حسابي يساوي صفراً، أي أن $E(\varepsilon_i) = 0$ و$\varepsilon_i \sim N(0, \sigma^2)$، وهو ما يضمن صحة الاختبارات التائية والفائية اللاحقة للمعلمات المقدرة.

يُمثل افتراض “ثبات تباين الأخطاء” (Homoscedasticity) ركيزة حاسمة لكفاءة التقديرات اليدوية؛ ويعني هذا الافتراض أن تشتت الأخطاء العشوائية حول خط الانحدار يظل ثابتاً ومستقراً عبر جميع مستويات وقيم المتغير المستقل $X$، دون أن يتسع أو يضيق مع تزايد قيم $X$. ويؤدي انتهاك هذا الفرض (ظاهرة عدم ثبات التباين Heteroscedasticity) إلى فقدان مقدرات المربعات الصغرى لخاصية الكفاءة، مما يجعل الأخطاء المعيارية المحسوبة يدوياً غير دقيقة وقد تؤدي إلى استنتاجات فرضية مضللة.

أخيراً، يجب مراعاة “مستوى قياس المتغيرات” (Level of Measurement)، إذ يشترط الانحدار الخطي البسيط القياسي أن يكون كل من المتغير المستقل والمتغير التابع متغيرات كمية متصلة أو متقطعة مقاسة على مستوى مقياس فئوي (Interval Scale) أو مقياس نسبي (Ratio Scale). يضمن هذا الشرط صلاحية إجراء العمليات الحسابية الأساسية كالجمع والتربيع وحساب المتوسطات الحسابية دون المساس بالبنية المفهومية والرياضية للبيانات المجمعة.

1.3 أهمية التمكن من الحساب اليدوي للانحدار للباحثين والطلاب

إن الاعتماد المفرط على البرمجيات الإحصائية الآلية يُحول عمليات التحليل المتقدمة إلى ما يشبه “الصندوق الأسود” (Black Box) غير المفهوم، حيث يكتفي الباحث بالنقر على أزرار واجهات الاستخدام دون إدراك للعلاقات الرياضية المعقدة التي تدور داخل المعالج الحاسوبي. ومن هنا، فإن التدريب المنهجي على الحساب اليدوي لنموذج الانحدار يُفكك هذه الخوارزميات، ويُبرز كيف تتكامل العمليات الجبرية البسيطة لتوليد مقاييس مركبة مثل التغاير، ومعامل التحديد، وجداول التباين.

يُسهم الإنجاز اليدوي للعمليات الحسابية في بناء “حدس رياضي وإحصائي” (Statistical Intuition) متين وعميق لدى الطلاب والباحثين. فعندما يرى المحلل كيف تؤثر قيمة متطرفة واحدة على سحب البسط في معادلة التغاير، أو كيف يؤدي تشتت قيم $X$ إلى تقليص الخطأ المعياري لمعامل الميل، فإنه يكتسب قدرة فريدة على قراءة النتائج الإحصائية وتفسير الأوزان المعيارية بمستوى أعلى بكثير من مجرد الترديد النمطي للجداول الإحصائية الجاهزة.

إضافة إلى ذلك، يُعزز الحساب اليدوي القدرة التشخيصية والنقدية للمحلل؛ إذ يُصبح قادراً على اكتشاف الأخطاء الحسابية، والمفاهيمية، والطباعية الشائعة في الأوراق البحثية والتقارير الأكاديمية المحكمة. فالمحلل المتمرس يدوياً يستطيع بالنظر السريع تقييم ما إذا كانت إشارة معامل الانحدار تتوافق منطقياً مع مصفوفة الارتباط، أو ما إذا كانت قيمة معامل التحديد $R^2$ متسقة رياضياً مع مجموع مربعات الانحدار والمجموع الكلي للمربعات.

أخيراً، يُرسخ هذا التمرين الفهم الهندسي والتجريدي لكيفية إيجاد “خط أفضل مطابقة” (Line of Best Fit). فمن خلال تتبع خطوات تقليل البواقي العمودية وحساب الإحداثيات المركزية الممثلة بنقطة المتوسطات المشتركة، يدرك الباحث كيف يُشكل خط الانحدار محور ارتكاز هندسي يوازن بدقة متناهية بين جميع المشاهدات المتناثرة في الفضاء الإحصائي ثنائي الأبعاد.

2. الخلفية الرياضية لطريقة المربعات الصغرى العادية (OLS)

2.1 مبدأ تقليل مجموع مربعات البواقي (Residuals Minimization)

تعتمد طريقة المربعات الصغرى العادية (Ordinary Least Squares) على مبدأ هندسي وجبري واضح يهدف إلى إيجاد أفضل خط مستقيم يمر عبر سحابة النقاط المبعثرة. في أي دراسة تجريبية، تتكون البيانات من أزواج مرتبة $(X_i, Y_i)$، وعند محاولة نمذجة هذه المشاهدات بخط مستقيم، فإن النموذج يُولد قيمة تقديرية تنبؤية تُعرف بـ $\hat{Y}_i$ (وتُقرأ Y-hat) لكل قيمة معطاة لـ $X_i$. ويُعرف الفرق الرأسي بين القيمة الفعلية المشاهدة $Y_i$ والقيمة المقدرة بواسطة النموذج $\hat{Y}_i$ باسم “الباقي” أو الخطأ التقديري (Residual)، ويُعبر عنه رياضياً بالصيغة:

$$e_i = Y_i – \hat{Y}_i$$

يثور هنا التساؤل المنهجي والرياضي: لماذا نقوم بتربيع هذه البواقي وجمعها بدلاً من استخدام المجموع المباشر للفروق أو استخدام القيم المطلقة؟ يكمن البرهان المنطقي الأول في أن المجموع البسيط للبواقي الفردية $\sum (Y_i – \hat{Y}_i)$ يساوي دائماً الصفر لأي خط يمر بمتوسط البيانات؛ حيث تُلغي البواقي الموجبة (النقاط التي تقع فوق الخط) البواقي السالبة (النقاط التي تقع تحت الخط) بشكل كامل، مما يجعل المجموع المباشر مقياساً عديماً للجدوى في قياس جودة التوفيق. أما خيار استخدام القيم المطلقة $|Y_i – \hat{Y}_i|$، فرغم وجاهته الحدسية، فإنه يُنشئ دالة غير قابلة للاشتقاق التفاضلي عند نقطة الصفر (Non-differentiable)، مما يعيق استخدام تقنيات التفاضل والتكامل الكلاسيكية لإيجاد الحلول التحليلية المغلقة والمباشرة.

بناءً على ذلك، يتم اللجوء إلى تربيع البواقي، مما يُحقق ميزتين جوهريتين: التخلص من الإشارات السالبة، وفرض عقوبة تصاعدية غير خطية على الانحرافات الكبيرة (حيث يؤدي تربيع خطأ مقداره 4 إلى إضافة 16 للمجموع، بينما تربيع خطأ مقداره 2 يضيف 4 فقط)، وهو ما يضمن توفيقاً يحاذي الكتلة الرئيسية للبيانات دون إفساح المجال لانحرافات فردية جسيمة. وتُصاغ الدالة الهدف (Objective Function) التي تسعى طريقة OLS لتقليلها إلى أدنى حد ممكن (Minimization) على النحو التالي:

$$S = \sum_{i=1}^{n} e_i^2 = \sum_{i=1}^{n} (Y_i – \hat{Y}_i)^2 = \sum_{i=1}^{n} (Y_i – (b_0 + b_1 X_i))^2$$

تكتسب المقدرات المستخرجة عبر هذا المبدأ أهمية استثنائية وفق مبرهنة غاوس-ماركوف (Gauss-Markov Theorem)، والتي تُثبت رياضياً أنه في ظل استيفاء افتراضات الانحدار الكلاسيكية، فإن مقدرات المربعات الصغرى تُمثل “أفضل المقدرات الخطية غير المتحيزة” والمعروفة اختصاراً بـ (BLUE – Best Linear Unbiased Estimators). وتعني هذه الخاصية أن هذه المعلمات لا تتسم فقط بالحيادية وعدم التحيز المنهجي، بل إنها تمتلك أصغر تباين إحصائي ممكن مقارنة بأي مقدرات خطية بديلة.

2.2 الاشتقاق التفاضلي لمعادلتي التقدير لمعاملات الخط

للوصول إلى الصيغ الحسابية الدقيقة لمعلمات الانحدار اليدوي (الميل $b_1$ والحد الثابت $b_0$)، يتم تطبيق أدوات الحسبان التفاضلي على الدالة الهدف $S(b_0, b_1)$ لإيجاد القيم التي تجعل هذه الدالة في نهايتها الصغرى المطلقة (Global Minimum). نبدأ بتطبيق التفاضل الجزئي للدالة $S$ بالنسبة للحد الثابت $b_0$:

$$\frac{\partial S}{\partial b_0} = \frac{\partial}{\partial b_0} \sum_{i=1}^{n} (Y_i – b_0 – b_1 X_i)^2 = \sum_{i=1}^{n} 2(Y_i – b_0 – b_1 X_i)(-1) = -2 \sum_{i=1}^{n} (Y_i – b_0 – b_1 X_i)$$

ولتحقيق النهاية الصغرى، نساوي المشتقة الجزئية بالصفر:

$$-2 \sum_{i=1}^{n} (Y_i – b_0 – b_1 X_i) = 0 implies \sum_{i=1}^{n} Y_i – n b_0 – b_1 \sum_{i=1}^{n} X_i = 0$$

وهذه هي “المعادلة العمودية الأولى” (First Normal Equation). بالانتقال إلى المعلمة الثانية، نقوم بتطبيق التفاضل الجزئي للدالة $S$ بالنسبة لمعامل الميل $b_1$ مستخدمين قاعدة السلسلة:

$$\frac{\partial S}{\partial b_1} = \frac{\partial}{\partial b_1} \sum_{i=1}^{n} (Y_i – b_0 – b_1 X_i)^2 = \sum_{i=1}^{n} 2(Y_i – b_0 – b_1 X_i)(-X_i) = -2 \sum_{i=1}^{n} X_i(Y_i – b_0 – b_1 X_i)$$

وبمساواة هذه المشتقة الجزئية بالصفر:

$$-2 \left( \sum_{i=1}^{n} X_i Y_i – b_0 \sum_{i=1}^{n} X_i – b_1 \sum_{i=1}^{n} X_i^2 \right) = 0 implies \sum_{i=1}^{n} X_i Y_i = b_0 \sum_{i=1}^{n} X_i + b_1 \sum_{i=1}^{n} X_i^2$$

وهذه هي “المعادلة العمودية الثانية” (Second Normal Equation). يُشكل هذا النظام الخطي المكون من معادلتين عموديتين الأساس الرياضي الصارم لاستخراج المعلمات. فبقسمة طرفي المعادلة العمودية الأولى على حجم العينة $n$، نحصل على الصيغة المباشرة للحد الثابت بدلالة المتوسطات الحسابية:

$$\bar{Y} – b_0 – b_1 \bar{X} = 0 implies b_0 = \bar{Y} – b_1 \bar{X}$$

وبالتعويض المباشر بقيمة $b_0$ في المعادلة العمودية الثانية وحلها جبرياً لعزل $b_1$، نصل إلى الصيغة الحسابية التحليلية المغلقة لمعامل الميل:

$$b_1 = \frac{\sum_{i=1}^{n} (X_i – \bar{X})(Y_i – \bar{Y})}{\sum_{i=1}^{n} (X_i – \bar{X})^2} = \frac{n \sum X_i Y_i – (\sum X_i)(\sum Y_i)}{n \sum X_i^2 – (\sum X_i)^2}$$

2.3 الصيغ الحسابية المختلفة لحساب معلمات الانحدار والمقارنة بينها

تتعدد الصيغ الجبرية المستخدمة في الحساب اليدوي لمعلمات الانحدار الخطي، وتتطابق جميعها في النتائج الرياضية النهائية لكنها تختلف جذرياً في كفاءتها التشغيلية ومستوى ملاءمتها للحساب الورقي. تبرز أولاً “صيغة البيانات الخام” (Raw Score Formula)، وتُسمى أيضاً بالصيغة الحاسوبية، وتعتمد اعتماداً كلياً على المجاميع المباشرة للبيانات دون الحاجة لحساب الانحرافات الفردية لكل مشاهدة:

$$b_1 = \frac{n \sum XY – (\sum X)(\sum Y)}{n \sum X^2 – (\sum X)^2}$$

تتميز صيغة البيانات الخام بأنها الصيغة الأكثر سرعة وعملية في التطبيق اليدوي عند التعامل مع بيانات أصلية ذات أرقام صحيحة أو مجاميع معطاة مسبقاً، حيث تُقلل من خطوات العمل الميداني وتلغي الحاجة للتعامل مع الأعداد الكسرية في المراحل المبكرة من الحساب.

تتمثل الصيغة الثانية في “صيغة الانحرافات عن المتوسط” (Deviation Score Formula)، وتعتمد على تحويل كل قيمة إلى انحراف نسبي عن متوسطها الحسابي الفردي، حيث يُرمز لـ $x_i = X_i – \bar{X}$ ولـ $y_i = Y_i – \bar{Y}$، لتأخذ المعادلة الشكل التالي:

$$b_1 = \frac{\sum x y}{\sum x^2}$$

تُعد صيغة الانحرافات بالغة الأهمية من المنظور التعليمي والمفاهيمي؛ إذ توضح بجلاء أن بسط المعادلة ما هو إلا مجموع حواصل ضرب الانحرافات (الممثل المباشر للتغاير المشترك)، بينما يُمثل المقام مجموع مربعات انحرافات المتغير المستقل (الممثل المباشر لتباين $X$). بيد أن عيبها العملي في الحساب اليدوي يكمن في أنها تصبح شديدة التعقيد وعرضة لتراكم أخطاء التقريب العشري إذا كانت المتوسطات الحسابية أرقاماً غير صحيحة وتحتوي على كسور عشرية لامتناهية.

أما الصيغة الثالثة، فهي الصيغة المعتمدة على المقاييس الإحصائية المعيارية الجاهزة، والتي تربط معامل الانحدار بمعامل ارتباط بيرسون ($r$) والانحرافات المعيارية لعينة المتغيرين ($S_x$ و $S_y$):

$$b_1 = r \left( \frac{S_y}{S_x} \right)$$

تُستخدم هذه الصيغة بكثافة في الاختبارات الأكاديمية والمواقف البحثية عندما تكون المقاييس الوصفية الإجمالية متوفرة دون توفر مصفوفة البيانات الخام المفصلة. وتُظهر هذه المعادلة بوضوح أن ميل الانحدار هو مجرد مقياس مقنن للارتباط يُعاد تحجيمه وفقاً للنسبة بين تشتت المتغير التابع وتشتت المتغير المستقل.

3. إعداد وتجهيز مصفوفة البيانات وحساب الجداول التراكمية

3.1 هيكلة مصفوفة البيانات الأولية وتحديد المتغيرات

تبدأ الممارسة العملية الصارمة للحساب اليدوي من مرحلة الهيكلة والتدقيق الأولي لمصفوفة البيانات الأولية. يجب على الباحث أولاً تحديد طبيعة كل متغير وتعيينه بدقة، بحيث يتم فرز المتغير التفسيري وإسناده للمحور الأفقي $X$، وتحديد متغير الاستجابة وإسناده للمحور الرأسي $Y$. إن أي خطأ في هذا التحديد المبدئي سيؤدي إلى قلب نموذج الانحدار بالكامل، حيث إن انحدار $Y$ على $X$ يختلف جذرياً في معلماته وتفسيراته عن انحدار $X$ على $Y$.

تقتضي الخطوة التالية فحصاً بصرياً دقيقاً لكل زوج مرتب $(X_i, Y_i)$ في مصفوفة البيانات لاكتشاف أي أخطاء في تدوين الأرقام أو وجود مدخلات مفقودة، فضلاً عن رصد القيم المتطرفة والشاذة (Outliers). فالقيم الشاذة تمتلك تأثيراً بالغ الضرر على مقدرات المربعات الصغرى يدوياً، حيث إن تربيع المسافات يمنح النقطة البعيدة “عزم تدوير” (Leverage) هائلاً يسحب خط الانحدار باتجاهها بعيداً عن المسار التمثيلي لبقية البيانات.

يجب كذلك توثيق حجم العينة الإجمالي بدقة متناهية، ويُرمز له بالحرف $n$، وهو يُمثل عدد الأزواج المرتبة المشاهدة (وليس عدد الأرقام المنفردة). ويُعد $n$ رقماً محورياً يدخل مباشرة في بسط ومقام جميع المعادلات الخطية، كما يُحدد درجات الحرية (Degrees of Freedom) لجميع الاختبارات الإحصائية اللاحقة للنموذج.

Simple linear regression dataset
Simple linear regression dataset

3.2 بناء الجدول الحسابي الخماسي المعياري

تُعد استراتيجية “الجدول الخماسي المعياري” (Standard Five-Column Table) الأداة التنظيمية الأكثر موثوقية وأماناً لمنع الأخطاء الحسابية والذهنية أثناء إجراء الانحدار يدوياً. يتم رسم جدول ورقي واضح ومسطر يحتوي على خمسة أعمدة رأسية أساسية تُخصص للأغراض الحسابية التالية:

  • العمود الأول ($X$): يحتوي على القيم الأصلية الخام للمتغير المستقل لكل مشاهدة من $1$ إلى $n$.
  • العمود الثاني ($Y$): يحتوي على القيم الأصلية الخام للمتغير التابع المقابلة لكل مشاهدة.
  • العمود الثالث ($XY$ أو $X \cdot Y$): يُخصص لحاصل الضرب الحسابي بين قيمة $X$ وقيمة $Y$ لنفس الصف.
  • العمود الرابع ($X^2$): يُخصص لمربع قيمة المتغير المستقل الفردية المسجلة في العمود الأول.
  • العمود الخامس ($Y^2$): يُخصص لمربع قيمة المتغير التابع الفردية المسجلة في العمود الثاني.

يجب تخصيص الصف السفلي الأخير من هذا الجدول تحت مسمى “صف المجاميع الإجمالية” ($\sum$)، حيث ستُسجل فيه النواتج التراكمية العمودية لكل عمود على حدة. إن التنظيم الورقي المنهجي وترك مساحات كافية بين الأسطر وتنسيق الفواصل العشرية على استقامة واحدة يُمثل الحصن الوقائي الأول ضد أخطاء النقل والجمع اليدوي التي تُهدر وقت الباحث وتُفسد دقة النتائج الإحصائية.

4. الخطوة الأولى: إجراء العمليات الحسابية للأعمدة الأولية (X*Y, X², Y²)

4.1 حساب حاصل ضرب المتغيرين لكل مشاهدة (X * Y)

تبدأ المعالجة الحسابية بملء العمود الثالث عبر إجراء عملية ضرب ثنائية دقيقة لكل قيمة في العمود الأول ($X_i$) بالقيمة المناظرة لها في العمود الثاني ($Y_i$). ومن منظور رياضي وإحصائي، يُعبر حاصل الضرب المشترك $X_i Y_i$ عن المساحة المستطيلة المتولدة بين النقطة والمحاور، ويُشكل هذا الحاصل المكون الأولي لحساب التغاير المشترك (Covariance) بين المتغيرين؛ فالقيم العالية لـ $X$ المقترنة بقيم عالية لـ $Y$ تُعطي نواتج موجبة كبيرة تدفع الميل نحو الاتجاه الطردي، بينما تعكس النواتج المتدنية أو المتنافرة مسارات أخرى.

في حال تضمنت البيانات قيماً سالبة، يجب توخي الحذر الشديد وتطبيق القواعد الجبرية للإشارات بدقة متناهية:

  • حاصل ضرب قيمة موجبة في قيمة موجبة يُعطي ناتجاً موجباً: $(+) \times (+) = (+)$.
  • حاصل ضرب قيمة سالبة في قيمة سالبة يُعطي ناتجاً موجباً: $(-) \times (-) = (+)$.
  • حاصل ضرب قيمة موجبة في قيمة سالبة يُعطي ناتجاً سالباً: $(+) \times (-) = (-)$.

يُنصح الباحث بإجراء مراجعة وتدقيق فوري لكل ناتج ضرب بمجرد تدوينه في الصف، لأن أي خطأ حسابي في حاصل ضرب صف واحد سينتقل بالضرورة إلى المجموع الكلي $\sum XY$، مما يؤدي تلقائياً إلى تحريف قيمة البسط في معادلة الميل والانحدار.

4.2 حساب مربعات قيم المتغير المستقل (X²)

تختص المرحلة التالية بحساب العمود الرابع والمخصص لتربيع قيم المتغير المستقل $X$. يتم أخذ كل رقم مسجل في عمود $X$ وضربه في نفسه ($X_i \times X_i = X_i^2$). ويحمل هذا العمود أهمية إحصائية فائقة، حيث يُمثل المكون الأساسي لقياس التشتت الكلي والقصور الذاتي للمتغير المستقل حول نقطة الأصل، وهو ما سيُستخدم لاحقاً لحساب تباين $X$.

من الضروري هنا التنبيه إلى نقطة مفاهيمية يقع فيها الكثير من المبتدئين، وهي التمييز الصارم بين “مجموع المربعات” الفردية المسجلة في هذا العمود والرمز له بـ $\sum X^2$، وبين “مربع المجموع الكلي” الذي يُرمز له بـ $(\sum X)^2$. فالأولى تعني تربيع كل عنصر على حدة ثم جمع النواتج، بينما الثانية تعني جمع العناصر أولاً ثم تربيع الناتج الإجمالي مرة واحدة؛ وهما قيمتان مختلفتان تماماً من الناحية العددية والرياضية:

$$\sum X_i^2 \neq \left( \sum X_i \right)^2$$

يجب تسجيل نتائج التربيع في العمود المخصص دون إغفال أي منزلة عشرية، لا سيما إذا كانت البيانات الأصلية تحتوي على كسور، حيث إن تقريب قيم المربعات الفردية يُضاعف من حجم الخطأ التراكمي في النتائج الإجمالية.

4.3 حساب مربعات قيم المتغير التابع (Y²)

يُملأ العمود الخامس والأخير من الجدول الحسابي بتربيع القيم الفردية للمتغير التابع $Y$، أي حساب $Y_i^2$ لكل صف. وعلى الرغم من أن قيم هذا العمود لا تدخل بشكل مباشر في استخراج معاملات خط الانحدار ($b_0$ و $b_1$)، إلا أنها تُعد عنصراً لا غنى عنه لحساب مقاييس جودة التوفيق لاحقاً، بما في ذلك التباين الكلي لمتغير الاستجابة، ومجموع المربعات الكلي ($SST$)، ومعامل التحديد الإحصائي ($R^2$).

يجب الفصل الميكانيكي والتركيز الذهني التام أثناء ملء العمودين الرابع والخامس لمنع التداخل بين تربيع قيم $X$ وتربيع قيم $Y$. ويُفضل دائماً استخدام الآلة الحاسبة وإعادة التحقق من نواتج العمود الخامس صفاً بصف لضمان الاتساق الرياضي التام قبل الانتقال إلى مرحلة الجمع الإجمالي.

5. الخطوة الثانية: حساب المجاميع الإحصائية الخمسة الأساسية

5.1 حساب مجموع قيم المتغيرين (ΣX و ΣY) والمتوسطات الحسابية

بعد اكتمال بناء وحساب الأعمدة الخمسة لجميع المشاهدات البالغ عددها $n$، تبدأ خطوة التجميع الرأسي لحساب “المفاتيح الذهبية الخمسة” للانحدار الخطي. نبدأ بجمع كافة الأرقام الواردة في عمود $X$ للحصول على المجموع التراكمي للمتغير المستقل ويرمز له بـ $\sum X$:

$$\sum_{i=1}^{n} X_i = X_1 + X_2 + dots + X_n$$

ثم نجمع كافة الأرقام الواردة في عمود $Y$ للحصول على المجموع التراكمي للمتغير التابع ويرمز له بـ $\sum Y$:

$$\sum_{i=1}^{n} Y_i = Y_1 + Y_2 + dots + Y_n$$

وبمجرد الحصول على هذين المجموعين، نقوم فوراً بحساب المتوسطين الحسابيين للعينة عبر قسمة كل مجموع على حجم العينة $n$:

$$\bar{X} = \frac{\sum X_i}{n}, \quad \bar{Y} = \frac{\sum Y_i}{n}$$

تكتسب نقطة الإحداثيات المركزية المكونة من المتوسطين $(\bar{X}, \bar{Y})$ أهمية استثنائية في الهندسة الإحصائية، إذ تُمثل “مركز ثقل البيانات” (Center of Gravity)، ويجب حتماً أن يمر بها خط الانحدار الخطي المقدر بطريقة المربعات الصغرى، مما يجعلها نقطة ارتكاز حاسمة في التدقيق البياني والعددي.

5.2 حساب مجاميع حواصل الضرب والمربعات (ΣXY, ΣX², ΣY²)

ننتقل بعد ذلك إلى الجمع العمودي للأعمدة الثلاثة المتبقية في الجدول الخماسي لاستخراج المقادير التراكمية الحيوية:

  • مجموع حواصل الضرب المشتركة ($\sum XY$): وهو ناتج جمع الأرقام في العمود الثالث:
    $$\sum_{i=1}^{n} X_i Y_i = X_1 Y_1 + X_2 Y_2 + dots + X_n Y_n$$
  • مجموع مربعات المتغير المستقل ($\sum X^2$): وهو ناتج جمع الأرقام في العمود الرابع:
    $$\sum_{i=1}^{n} X_i^2 = X_1^2 + X_2^2 + dots + X_n^2$$
  • مجموع مربعات المتغير التابع ($\sum Y^2$): وهو ناتج جمع الأرقام في العمود الخامس:
    $$\sum_{i=1}^{n} Y_i^2 = Y_1^2 + Y_2^2 + dots + Y_n^2$$

يتم تدوين هذه النواتج الخمسة بوضوح في الصف الختامي من الجدول الحسابي، لتُشكل مع حجم العينة $n$ المدخلات الرقمية الوحيدة المطلوبة لتنفيذ كافة الحسابات المتقدمة للانحدار والتباين.

Linear regression by hand calculation
Linear regression by hand calculation

5.3 إجراءات التحقق الرياضي الداخلي من صحة المجاميع

قبل الشروع في التعويض بالمعادلات، يتعين على الباحث تطبيق آليات تدقيق رياضي صارمة للتحقق من سلامة المجاميع. إحدى التقنيات الكلاسيكية هي “الجمع العكسي” (Reverse Addition)، حيث يُعاد جمع كل عمود من الأسفل إلى الأعلى؛ فإذا تطابقت النتائج زادت موثوقية الأرقام.

كما يمكن تطبيق “اختبار المجموع المتقاطع” (Cross-Sum Check) باستخدام المتطابقة الجبرية الشهيرة للتربيع الثنائي:

$$\sum (X_i + Y_i)^2 = \sum X_i^2 + 2 \sum X_i Y_i + \sum Y_i^2$$

فإذا قام الباحث بإنشاء عمود إضافي مؤقت لجمع $(X_i + Y_i)$ وتربيعه، فإن المجموع الكلي لهذا العمود يجب أن يتطابق تماماً مع جمع عمود $X^2$ وعمود $Y^2$ ومثلي عمود $XY$. إن استيفاء هذه المتطابقة يمنح المحلل يقيناً رياضياً بنسبة 100% بخلو مصفوفة الحسابات التراكمية من أي خطأ جمع أو تربيع.

6. الخطوة الثالثة: الحساب اليدوي المفصل لمعامل الميل (b₁)

6.1 تشريح وفهم الصيغة الرياضية لحساب معامل الانحدار (b₁)

يُعد معامل الميل $b_1$ (Slope Coefficient) القلب النابض لنموذج الانحدار، وتُكتب معادلته الحسابية بالصيغة المباشرة للبيانات الخام كالتالي:

$$b_1 = \frac{n \sum XY – (\sum X)(\sum Y)}{n \sum X^2 – (\sum X)^2}$$

يكشف التشريح الرياضي الدقيق لبسط ومقام هذه المعادلة عن بنية إحصائية عميقة. فالبسط، المتمثل في المقدار $[n \sum XY – (\sum X)(\sum Y)]$، هو النسخة الموسعة غير المقسمة للتغاير المشترك (Covariance) بين المتغيرين $X$ و $Y$؛ حيث يُعبر عن مدى تحرك المتغيرين معاً في نفس الاتجاه أو في اتجاهات متعاكسة. فإذا كان البسط موجباً دل ذلك على علاقة طردية، وإذا كان سالباً دل على علاقة عكسية، وإذا كان صفراً انعدمت العلاقة الخطية تماماً.

أما المقام، المتمثل في المقدار $[n \sum X^2 – (\sum X)^2]$، فهو النسخة الموسعة غير المقسمة لتباين المتغير المستقل $X$ حول متوسطه الحسابي (مجموع مربعات $X$). ويتميز هذا المقام بخاصية رياضية قطعية: فهو دائماً وأبداً قيمة موجبة تماماً في أي دراسة واقعية، طالما أن قيم $X$ ليست متطابقة بالكامل وتحتوي على تشتت. ومن ثم، فإن إشارة معامل الميل تتحدد حصراً بإشارة البسط؛ فإذا كان التغاير سالباً كان الميل سالباً حتماً، والعكس صحيح.

6.2 التعويض العددي المباشر في معادلة الميل

لإجراء التعويض اليدوي، نتبع الخطوات المتسلسلة التالية بدقة تنظيمية:

  1. حساب البسط:
    • نضرب حجم العينة $n$ في المجموع التراكمي لحواصل الضرب $\sum XY$ للحصول على الطرف الأول: $A = n \cdot \sum XY$.
    • نضرب مجموع $X$ في مجموع $Y$ للحصول على الطرف الثاني: $B = (\sum X) \cdot (\sum Y)$.
    • نطرح الطرف الثاني من الطرف الأول لاستخراج قيمة البسط الصافية: $\text{Numerator} = A – B$.
  2. حساب المقام:
    • نضرب حجم العينة $n$ في مجموع مربعات $X$ للحصول على الطرف الأول: $C = n \cdot \sum X^2$.
    • نحسب المربع الكامل لمجموع $X$ عبر ضرب المجموع في نفسه: $D = (\sum X)^2 = (\sum X) \cdot (\sum X)$.
    • نطرح الطرف الثاني من الطرف الأول لاستخراج قيمة المقام الصافية: $\text{Denominator} = C – D$.
  3. إجراء القسمة النهائية:

    نقسم صافي البسط على صافي المقام لاستخراج القيمة العددية الصريحة للميل:

    $$b_1 = \frac{\text{Numerator}}{\text{Denominator}} = \frac{A – B}{C – D}$$

يجب تثبيت الإشارة الجبرية الناتجة عن عملية القسمة (+ أو -) بوضوح تام، حيث تُمثل العمود الفقري لتفسير مسار الانحدار.

6.3 التحكم في دقة التقريب العشري لمعامل الميل

تُمثل أخطاء التقريب المبكر (Premature Rounding) إحدى أكبر المشكلات التي تُصادف الحساب اليدوي. إن تقريب قيمة الميل $b_1$ إلى منزلة عشرية واحدة أو منزلتين في هذه المرحلة المبكرة سيؤدي إلى انتقال انحرافات حسابية متتالية عند حساب الحد الثابت $b_0$ والبواقي $e_i$ ومجموع المربعات $SSE$.

تقتضي المعايير الأكاديمية الصارمة الاحتفاظ بما لا يقل عن أربع إلى ست منازل عشرية أثناء المراحل الحسابية الوسيطة لمعامل الميل (مثال: $b_1 = 0.857143$). وفقط عند كتابة التقرير النهائي للبحث أو بعد استكمال كافة الجداول الإحصائية، يمكن تقريب المعلمات إلى منزلتين أو ثلاث منازل عشرية وفق متطلبات التوثيق العلمي المعمول بها (مثل دليل جمعية علم النفس الأمريكية APA).

7. الخطوة الرابعة: الحساب اليدوي للحد الثابت أو المقطع الصادي (b₀)

7.1 الصيغة المباشرة القائمة على المجاميع لحساب b₀

يُمثل الحد الثابت $b_0$ (Y-Intercept) النقطة التي يتقاطع عندها خط الانحدار مع المحور الرأسي $Y$. ويمكن حسابه يدوياً وبطريقة مباشرة بالاعتماد الكامل على المجاميع التراكمية عبر الصيغة التالية:

$$b_0 = \frac{(\sum Y)(\sum X^2) – (\sum X)(\sum XY)}{n \sum X^2 – (\sum X)^2}$$

نلاحظ هنا ميزة حسابية بالغة الأهمية: مقام معادلة الحد الثابت $b_0$ يتطابق حرفياً مع مقام معادلة معامل الميل $b_1$ الذي تم حسابه في الخطوة السابقة ($C – D$). ويوفر هذا التطابق جهداً حسابياً كبيراً على الباحث ويُقلل من احتمالات الخطأ، إذ يكفي استخدام نفس قيمة المقام المحسوبة مسبقاً.

ينحصر العمل الحسابي الجديد فقط في معالجة البسط:

  • ضرب مجموع $Y$ في مجموع مربعات $X$: $E = (\sum Y) \cdot (\sum X^2)$.
  • ضرب مجموع $X$ في مجموع حواصل الضرب: $F = (\sum X) \cdot (\sum XY)$.
  • طرح المقدار الثاني من الأول: $\text{Numerator}_{b_0} = E – F$.
  • قسمة هذا الناتج على المقام المشترك لاستخراج $b_0$.

7.2 الصيغة البديلة المبسطة المعتمدة على المتوسطات الحسابية

توجد صيغة بديلة أكثر شيوعاً وسرعة لحساب الحد الثابت، وتعتمد على المتوسطات الحسابية وقيمة الميل $b_1$ المحسوبة مسبقاً:

$$b_0 = \bar{Y} – b_1 \bar{X}$$

يستند البرهان الرياضي لهذه الصيغة إلى الخاصية الجوهرية لخط الانحدار الخطي بأنه يمر حتماً بنقطة مركز الثقل $(\bar{X}, \bar{Y})$. فعند تعويض هذه النقطة في معادلة الخط $\bar{Y} = b_0 + b_1 \bar{X}$ ونقل الحد $b_1 \bar{X}$ إلى الطرف المقابل، نحصل مباشرة على هذه العلاقة المبسطة.

تُعد هذه المعادلة أداة فحص ممتازة؛ إذ يُنصح بحساب $b_0$ باستخدام الصيغة المبسطة ومقارنتها بالصيغة المباشرة القائمة على المجاميع. ويجب أن تتطابق النتيجتان تماماً، شريطة عدم تقريب $b_1$ تقريباً جائراً أثناء التعويض في الصيغة المبسطة.

7.3 تفسير المقطع الصادي من منظور رياضي وهندسي

من المنظور الهندسي، يُحدد $b_0$ موضع بداية الخط على المحور الرأسي عندما تكون قيمة $X = 0$. أما من المنظور التطبيقي والبحثي، فإن تفسير المقطع الصادي يتطلب حذراً علمياً كبيراً:

  • التفسير الميداني المنطقي: يُمثل $b_0$ القيمة المتوقعة لمتغير الاستجابة $Y$ عندما تنعدم قيمة المتغير المستقل ($X = 0$). ولا يكون لهذا التفسير معنى علمي وميداني واقعي إلا إذا كانت القيمة صفر لمتغير $X$ تقع ضمن النطاق التجريبي الفعلي للدراسة ولها مغزى فيزيائي أو سلوكي (مثل: دراسة أثر الجرعة الدوائية على مستوى الألم، حيث $X=0$ تعني عدم إعطاء دواء).
  • القيم النظرية البحتة: إذا كانت قيم $X$ في التجربة بعيدة تماماً عن الصفر (مثل قياس درجات الذكاء أو الطول لدى البالغين)، فإن المقطع الصادي يُعتبر مجرد “مرتكز رياضي وهندسي” يضمن ضبط مسار الخط وميله في الفضاء الإحصائي، وتفقد قيمته المنفردة أي معنى تطبيقي مستقل.

قد يظهر الحد الثابت بقيمة سالبة، وهو أمر طبيعي رياضياً ولا يُشير إلى أي خطأ حسابي، ويعني هندسياً أن امتداد خط الانحدار يقطع المحور الرأسي تحت مستوى الصفر الإحداثي.

8. الخطوة الخامسة: بناء معادلة الانحدار التنبؤية والتفسير الإحصائي

8.1 صياغة المعادلة النهائية للنموذج الخطي

بعد استخراج قيمتي المعلمتين $b_0$ و $b_1$، يتم تجميعهما لصياغة معادلة خط الانحدار التنبؤية النهائية في شكلها المعياري:

$$\hat{Y} = b_0 + b_1 X$$

يجب التمييز الدقيق في التدوين الرياضي بين $Y$ و $\hat{Y}$؛ فالرمز $Y$ يُمثل القيم الفعلية الحقيقية المشاهدة في العينة، بينما يُمثل $\hat{Y}$ القيمة المقدرة أو المتنبأ بها نظرياً بواسطة النموذج الخطي لأي قيمة معطاة لـ $X$.

من القواعد المنهجية الصارمة تحديد “نطاق الانحدار” (Range of the Regression) المسموح بالتنبؤ ضمنه، وهو النطاق المحصور بين أصغر قيمة لـ $X$ ($X_{\min}$) وأكبر قيمة لـ $X$ ($X_{\max}$) في العينة الأصلية. ويجب تجنب الوقوع في فخ “الاستقراء الخارجي” (Extrapolation)، وهو محاولة التنبؤ بقيم لـ $Y$ خارج هذا النطاق؛ إذ لا يمكن ضمان استمرار خطية العلاقة خارج الحدود التجريبية المرصودة فعلياً.

8.2 التفسير الإحصائي الدقيق لمعامل الميل (b₁)

يُصاغ التفسير اللفظي والإحصائي لمعامل الميل $b_1$ بدقة متناهية وفق القالب العلمي التالي:

“لكل زيادة بمقدار وحدة قياس واحدة في المتغير المستقل ($X$)، يُتوقع أن يتغير المتغير التابع ($Y$) بالزيادة (إذا كان $b_1$ موجباً) أو بالنقصان (إذا كان $b_1$ سالباً) بمقدار $|b_1|$ من وحدات قياسه، في المتوسط.”

يجب الانتباه للضوابط التفسيرية التالية أثناء كتابة التقارير:

  • استخدام عبارات تفيد التوقع والمتوسط الإحصائي (مثل: “يُتوقع”، “في المتوسط”) بدلاً من لغة الجزم الحتمي.
  • تجنب الخلط اللغوي بين الارتباط الإحصائي والسببية الحتمية؛ فوجود ميل دال إحصائياً لا يُثبت بمفرده أن $X$ هو المسبب الفعلي لـ $Y$ ما لم تدعمه بيئة تجريبية منضبطة تضبط المتغيرات الدخيلة.
  • ربط الأرقام دائماً بوحدات القياس الأصلية للظاهرة المدروسة (مثل: درجات، ساعات، كيلوغرامات، ريالات) لمنح المعاملات دلالتها الواقعية.

8.3 تطبيق المعادلة لإجراء تنبؤات يدوية بقيم جديدة

لتطبيق النموذج تنبؤياً، يختار الباحث قيمة محددة لـ $X$ تقع ضمن النطاق التجريبي (ولتكن $X_{new}$)، ثم يُعوض بها مباشرة في المعادلة التنبؤية لحساب $\hat{Y}$:

$$\hat{Y}_{new} = b_0 + b_1 (X_{new})$$

كما يُمكن تطبيق المعادلة على جميع نقاط العينة الأصلية لاستخراج القيمة التنبؤية لكل صف $\hat{Y}_i$، ثم حساب البواقي الفردية لكل مشاهدة:

$$e_i = Y_i – \hat{Y}_i$$

ويُعد هذا الإجراء أداة برهان حسابي استثنائية؛ فمن الخصائص الرياضية الجوهرية لطريقة المربعات الصغرى العادية أن مجموع البواقي لجميع المشاهدات يساوي صفراً دائماً:

$$\sum_{i=1}^{n} e_i = \sum_{i=1}^{n} (Y_i – \hat{Y}_i) = 0$$

فإذا قام الباحث بجمع عمود البواقي يدوياً ووجد أن الناتج صفر (أو رقماً متناهي الصغر مثل $0.00001$ بسبب التقريب العشري)، كان ذلك برهاناً قاطعاً على صحة حسابات المعلمات $b_0$ و $b_1$.

9. حساب مقاييس جودة التوفيق وتباين الانحدار يدوياً

9.1 تفكيك مجموع المربعات الكلي (Partitioning Sum of Squares)

يستند التقييم المتقدم لكفاءة نموذج الانحدار إلى مبدأ “تفكيك التباين” (ANOVA Framework)، حيث يتم تقسيم التشتت الكلي في المتغير التابع إلى جزأين مستقلين: جزء ينجح المتغير المستقل $X$ في تفسيره عبر خط الانحدار، وجزء عشوائي عاجز عن التفسير يُمثل أخطاء وبواقي النموذج. ويتم حساب هذه المركبات يدوياً عبر الصيغ الحسابية التالية:

  1. مجموع المربعات الكلي (Total Sum of Squares – SST): يقيس التشتت الكلي لقيم $Y$ حول متوسطها الحسابي العام $\bar{Y}$:
    $$SST = \sum (Y_i – \bar{Y})^2 = \sum Y^2 – \frac{(\sum Y)^2}{n}$$
  2. مجموع مربعات الانحدار (Regression Sum of Squares – SSR): يقيس مقدار التباين في $Y$ الذي نجح النموذج الخطي في تفسيره وتغطيته:
    $$SSR = \sum (\hat{Y}_i – \bar{Y})^2 = b_1 \left[ \sum XY – \frac{(\sum X)(\sum Y)}{n} \right]$$
  3. مجموع مربعات الأخطاء أو البواقي (Error Sum of Squares – SSE): يقيس التشتت العشوائي للبواقي غير المفسرة بواسطة النموذج:
    $$SSE = \sum (Y_i – \hat{Y}_i)^2 = SST – SSR$$

تُمثل متطابقة تحليل التباين الأساسية الميزان الرياضي الحاكم:

$$SST = SSR + SSE$$

ويجب دائماً التأكد يدوياً من أن مجموع $SSR$ و $SSE$ يُعطي بدقة تامة مجموع المربعات الكلي $SST$.

Linear regression by hand
Linear regression by hand

9.2 الحساب اليدوي لمعامل التحديد (R²)

يُعد معامل التحديد $R^2$ (Coefficient of Determination) المقياس المعياري الأكثر استخداماً لتقييم جودة التوفيق (Goodness of Fit) للنموذج الخطي. ويُحسب يدوياً كنسبة بين التباين المفسر بالانحدار والتباين الكلي للمتغير التابع:

$$R^2 = \frac{SSR}{SST} = 1 – \frac{SSE}{SST}$$

في حالة الانحدار الخطي البسيط، يتطابق معامل التحديد رياضياً مع المربع الكامل لمعامل ارتباط بيرسون الخطي بين المتغيرين ($R^2 = r^2$). وتتحدد الخصائص الرياضية لـ $R^2$ في النقاط التالية:

  • تنحصر قيمته دائماً في المدى المغلق بين صفر وواحد صحيح: $0 \leq R^2 \leq 1$.
  • تُعبر القيمة عند ضربها في 100 عن “النسبة المئوية للتباين الكلي في المتغير التابع $Y$ التي تم تفسيرها بواسطة المتغير المستقل $X$ عبر النموذج الخطي”.
  • كلما اقتربت قيمة $R^2$ من الواحد الصحيح، دل ذلك على قوة النموذج وقدرته التفسيرية العالية وتمركز النقاط بالقرب من خط الانحدار. بينما تعني القيمة الصفرية انعدام أي قدرة تفسيرية للنموذج.

9.3 حساب الخطأ المعياري للتقدير (Standard Error of the Estimate)

يُمثل الخطأ المعياري للتقدير ($S_e$ أو $s_{y.x}$) الانحراف المعياري الفعلي للبواقي حول خط الانحدار، ويقيس متوسط المسافة العمودية التي تخطئ بها القيم التنبؤية $\hat{Y}$ في إصابة القيم الفعلية $Y$. وتُصاغ معادلته الحسابية اليدوية كالتالي:

$$S_e = \sqrt{\frac{SSE}{n – 2}} = \sqrt{\frac{\sum (Y_i – \hat{Y}_i)^2}{n – 2}}$$

يرجع استخدام درجات الحرية ($n – 2$) في المقام إلى أن حساب خط الانحدار استهلك درجتي حرية من العينة لتقدير معلمتين أساسيتين هما $b_0$ و $b_1$. ويُعد $S_e$ مقياساً مباشراً للدقة التنبؤية، ويُقاس بنفس وحدات قياس المتغير التابع $Y$؛ وكلما كانت قيمته أصغر، دل ذلك على تماسك المشاهدات حول الخط التنبؤي وارتفاع دقة التقديرات الفردية.

10. إجراء الاختبارات الفرضية للمعلمات يدوياً (اختبار t واختبار F)

10.1 الحساب اليدوي للخطأ المعياري لمعامل الميل Sb₁

قبل الحكم على الدلالة الإحصائية لمعامل الميل $b_1$، يجب قياس مدى تقلبه وتشتته عبر العينات المحتملة، وهو ما يُعرف بـ “الخطأ المعياري لمعامل الميل” ($S_{b_1}$). ويُحسب يدوياً بالصيغة التالية:

$$S_{b_1} = \frac{S_e}{\sqrt{\sum X^2 – \frac{(\sum X)^2}{n}}} = \frac{S_e}{\sqrt{SS_x}}$$

حيث يُمثل $SS_x = \sum (X – \bar{X})^2$ مجموع مربعات المتغير المستقل. نلاحظ من بنية المعادلة أن قيمة $S_{b_1}$ تصغر وتزداد دقة كلما انخفض الخطأ المعياري للتقدير $S_e$ أو زاد تشتت واتساع نطاق قيم $X$ في التجربة، مما يُسهم في تعزيز ثقة الباحث في ثبات قيمة الميل المقدرة وتدني خطئها المعايناتي.

10.2 إجراء اختبار t لدلالة معامل الميل إحصائياً

يُستخدم اختبار t للعينات التائية (Student’s t-test) لاختبار الفرضية الإحصائية حول ما إذا كان المتغير المستقل يؤثر جوهرياً في المتغير التابع، وفق الخطوات المنهجية التالية:

  1. صياغة الفرضيات الإحصائية:
    • الفرضية الصفرية ($H_0$): $\beta_1 = 0$ (لا توجد علاقة خطية دالة إحصائياً بين $X$ و $Y$).
    • الفرضية البديلة ($H_1$): $\beta_1 \neq 0$ (توجد علاقة خطية دالة إحصائياً بين $X$ و $Y$ – اختبار ثنائي الطرفين).
  2. حساب القيمة التائية المحسوبة ($t_{calc}$):

    $$t = \frac{b_1 – \beta_{1(null)}}{S_{b_1}} = \frac{b_1}{S_{b_1}}$$

  3. تحديد القيمة الحرجة واتخاذ القرار:

    يتم استخراج القيمة التائية الحرجة ($t_{crit}$) من جداول توزيع $t$ عند درجات حرية $df = n – 2$ ومستوى دلالة محدد (عادة $\alpha = 0.05$).

    إذا كانت $|t_{calc}| > t_{crit}$، فإننا نرفض الفرضية الصفرية ونقبل الفرضية البديلة، مما يُثبت المعنوية الإحصائية لتأثير المتغير المستقل على متغير الاستجابة عند مستوى الثقة 95%.

10.3 بناء جدول تحليل التباين للانحدار يدوياً (ANOVA Table)

يُشكل جدول تحليل التباين (ANOVA Table) الأداة التلخيصية المتكاملة لتقييم المعنوية الكلية للنموذج الإحصائي. ويتم بناؤه وتنظيمه يدوياً عبر الخطوات الرياضية الموضحة في الهيكل المعياري التالي:

مصدر التباين (Source) مجموع المربعات (SS) درجات الحرية (df) متوسط المربعات (MS) القيمة الفائية المحسوبة (F)
الانحدار (Regression) $SSR$ $df_{reg} = 1$ $MSR = \frac{SSR}{1}$ $F = \frac{MSR}{MSE}$
الخطأ / البواقي (Residual) $SSE$ $df_{err} = n – 2$ $MSE = \frac{SSE}{n – 2}$
المجموع الكلي (Total) $SST$ $n – 1$

في الانحدار الخطي البسيط، توجد علاقة رياضية وثيقة تربط بين اختباري $t$ و $F$، حيث تتطابق القيمة الفائية المحسوبة تماماً مع مربع القيمة التائية المحسوبة لمعامل الميل:

$$F_{calc} = (t_{calc})^2$$

تتم مقارنة $F_{calc}$ بالقيمة الفائية الحرجة من جداول توزيع $F$ عند درجات حرية $(1, n-2)$. فإذا تجاوزت المحسوبة القيمة الحرجة، دل ذلك على المعنوية الإحصائية الشاملة لنموذج الانحدار ككل.

11. استراتيجيات تفادي الأخطاء الحسابية والمفاهيمية الشائعة

11.1 الأخطاء الجبرية الأكثر تكراراً وكيفية تجنبها

تكشف الممارسات التطبيقية للطلاب والباحثين عن وقوع متكرر في مجموعة من الفخاخ الجبرية الكلاسيكية أثناء الحساب اليدوي، والتي يمكن حصر أبرزها وسبل تفاديها فيما يلي:

  • الخلط بين $\sum X^2$ و $(\sum X)^2$: وهو الخطأ الأكثر شيوعاً؛ ويجب دائماً تذكر أن الأولى تمثل جمع عمود المربعات الفردية، بينما الثانية تمثل ضرب مجموع $X$ الكلي في نفسه.
  • أخطاء الإشارات السالبة المزدوجة: عند طرح حدود سالبة في بسط التغاير، يتحول الطرح إلى جمع؛ فالصيغة $A – (-B)$ تصبح $A + B$. وإغفال هذه القاعدة يُؤدي إلى تدمير الحسابات اليدوية بالكامل.
  • ترتيب العمليات الحسابية (Order of Operations): يجب التقيد الصارم بقواعد الجبر الأساسية (PEMDAS)، حيث تُنفذ عمليات الضرب والرفع إلى قوى داخل الأقواس أولاً قبل إجراء عمليات الجمع والطرح.
  • القسمة الخاطئة على $n$: محاولة قسمة المجاميع المباشرة على $n$ في مواضع مخصصة للبيانات الموسعة، مما يؤدي إلى عدم اتساق المقادير في البسط والمقام.

11.2 الأخطاء التفسيرية والمنهجية في التعامل مع النتائج

إلى جانب الأخطاء الحسابية، تبرز أخطاء مفاهيمية ومنهجية تتعلق بكيفية قراءة وتفسير النتائج المستخرجة:

  • مغالطة السببية (Correlation vs. Causation): الوقوع في فخ الجزم بأن $X$ هو المسبب الفاعل والوحيد لـ $Y$ لمجرد الحصول على قيمة $R^2$ مرتفعة أو اختبار $t$ دال إحصائياً؛ إذ قد تكون العلاقة ناتجة عن متغير ثالث خفي أو متداخل (Confounding Variable).
  • مخاطر الاستقراء الخارجي (Extrapolation Hazard): محاولة استخدام المعادلة التنبؤية لتقدير قيم تقع خارج حدود المدى المشاهد لـ $X$، مما يُعطي نتائج غير واقعية قد تكون مضللة تماماً.
  • تجاهل أثر القيم الشاذة (Ignoring Outliers): عدم تدقيق مصفوفة البيانات قبل الحساب يدوياً، مما يسمح لنقطة مفردة شاذة بتشويه مسار خط الانحدار وتوليد معاملات غير ممثلة للغالبية العظمى من العينة.
  • افتراض الخطية القسرية: تطبيق معادلات الانحدار الخطي على علاقات ذات طبيعة منحنية أو تربيعية دون فحص بياني أولي، مما يُؤدي إلى معامل تحديد $R^2$ منخفض واستنتاج خاطئ بعدم وجود علاقة.

11.3 قائمة التحقق الذاتي (Self-Audit Checklist) لمراجعة الحسابات اليدوية

لضمان أعلى معايير الدقة الرياضية، يُنصح كل باحث بإجراء “مراجعة ذاتية” (Self-Audit) إلزامية عبر مطابقة حساباته مع قائمة التدقيق المعيارية التالية:

  • [ ] هل يمر خط الانحدار بالنقطة المركزية؟ (التحقق بتعويض $\bar{X}$ في المعادلة للتأكد من أنها تُعطي $\bar{Y}$ بدقة).
  • [ ] هل مجموع البواقي الفردية يقترب تماماً من الصفر الجبري؟ ($\sum e_i \approx 0$).
  • [ ] هل تقع قيمة معامل التحديد حصراً في المدى الصحيح؟ ($0 \leq R^2 \leq 1$).
  • [ ] هل تتطابق إشارة معامل الميل $b_1$ مع إشارة معامل الارتباط $r$ وإشارة بسط التغاير؟
  • [ ] هل تتحقق متطابقة التباين التامة؟ ($SST = SSR + SSE$).
  • [ ] هل تتطابق القيمة الفائية في جدول ANOVA مع مربع القيمة التائية للميل؟ ($F = t^2$).

12. تطبيق عملي شامل: دراسة حالة متكاملة خطوة بخطوة في القياس السلوكي

12.1 عرض بيانات دراسة الحالة وتحديد المتغيرات البحثية

لتجسيد كافة المفاهيم النظرية والرياضية السابقة في سياق تطبيقي واقعي، سنقوم بإجراء تحليل انحدار خطي يدوي كامل وشامل لدراسة تجريبية في مجال القياس السلوكي وعلم النفس الصناعي. تهدف الدراسة إلى فحص أثر “عدد ساعات التدريب المهني المتخصص” ($X$) على “مستوى الأداء السلوكي والوظيفي” ($Y$) لدى عينة مكونة من $n = 6$ موظفين تم اختيارهم عشوائياً.

تتم صياغة الفرضية الإحصائية للدراسة عند مستوى دلالة $\alpha = 0.05$ على النحو التالي:

  • الفرضية الصفرية ($H_0$): لا يوجد تأثير دال إحصائياً لساعات التدريب على مستوى الأداء الوظيفي ($\beta_1 = 0$).
  • الفرضية البديلة ($H_1$): يوجد تأثير إيجابي دال إحصائياً لساعات التدريب على مستوى الأداء الوظيفي ($\beta_1 > 0$).

تتضمن مصفوفة البيانات المشاهدة للمشاركين الستة الأزواج المرتبة التالية:

  • الموظف 1: $X_1 = 2$ ساعة، $Y_1 = 5$ درجات.
  • الموظف 2: $X_2 = 4$ ساعات، $Y_2 = 7$ درجات.
  • الموظف 3: $X_3 = 5$ ساعات، $Y_3 = 8$ درجات.
  • الموظف 4: $X_4 = 6$ ساعات، $Y_4 = 10$ درجات.
  • الموظف 5: $X_5 = 8$ ساعات، $Y_5 = 11$ درجات.
  • الموظف 6: $X_6 = 11$ ساعة، $Y_6 = 13$ درجة.

12.2 التطبيق العددي الكامل من الجدول التراكمي إلى صياغة المعادلة

نبدأ ببناء الجدول الحسابي الخماسي المعياري وإجراء كافة العمليات الحسابية للصفوف والمجاميع الإجمالية:

المشاهدة ($i$) ساعات التدريب ($X$) مستوى الأداء ($Y$) حاصل الضرب ($XY$) مربع المستقل ($X^2$) مربع التابع ($Y^2$)
1 2 5 10 4 25
2 4 7 28 16 49
3 5 8 40 25 64
4 6 10 60 36 100
5 8 11 88 64 121
6 11 13 143 121 169
المجموع ($\sum$) $\sum X = 36$ $\sum Y = 54$ $\sum XY = 369$ $\sum X^2 = 266$ $\sum Y^2 = 528$

المرحلة 1: حساب المتوسطات الحسابية ($n = 6$):

$$\bar{X} = \frac{\sum X}{n} = \frac{36}{6} = 6.0000$$

$$\bar{Y} = \frac{\sum Y}{n} = \frac{54}{6} = 9.0000$$

المرحلة 2: الحساب اليدوي لمعامل الميل ($b_1$):

$$b_1 = \frac{n \sum XY – (\sum X)(\sum Y)}{n \sum X^2 – (\sum X)^2} = \frac{6(369) – (36)(54)}{6(266) – (36)^2}$$

$$\text{Numerator} = 2214 – 1944 = 270$$

$$\text{Denominator} = 1596 – 1296 = 300$$

$$b_1 = \frac{270}{300} = 0.9000$$

المرحلة 3: الحساب اليدوي للحد الثابت ($b_0$):

$$b_0 = \bar{Y} – b_1 \bar{X} = 9.0000 – (0.9000 \times 6.0000) = 9.0000 – 5.4000 = 3.6000$$

ومن ثم تصبح معادلة الانحدار التنبؤية النهائية هي:

$$\hat{Y} = 3.6000 + 0.9000 X$$

التفسير السلوكي: يعني المقطع الصادي ($b_0 = 3.6$) أن مستوى الأداء الوظيفي المتوقع للموظف الذي لم يتلقَ أي تدريب إطلاقاً ($X = 0$) هو $3.6$ درجات. أما معامل الميل ($b_1 = 0.9$) فيعني أن كل ساعة تدريب إضافية يتلقاها الموظف تؤدي إلى تحسن وزيادة متوقعة في مستوى أدائه السلوكي بمقدار $0.9$ درجة في المتوسط.

المرحلة 4: تفكيك مجموع المربعات وحساب $R^2$ و $S_e$:

  • حساب مجموع المربعات الكلي:
    $$SST = \sum Y^2 – \frac{(\sum Y)^2}{n} = 528 – \frac{(54)^2}{6} = 528 – \frac{2916}{6} = 528 – 486 = 42.0000$$
  • حساب مجموع مربعات الانحدار:
    $$SSR = b_1 \left[ \sum XY – \frac{(\sum X)(\sum Y)}{n} \right] = 0.9000 \left[ 369 – \frac{36 \times 54}{6} \right] = 0.9000 [369 – 324] = 0.9000 \times 45 = 40.5000$$
  • حساب مجموع مربعات الخطأ والبواقي:
    $$SSE = SST – SSR = 42.0000 – 40.5000 = 1.5000$$
  • حساب معامل التحديد ($R^2$):
    $$R^2 = \frac{SSR}{SST} = \frac{40.5000}{42.0000} = 0.9643 \quad (96.43%)$$
    تفسير النتيجة: يفسر نموذج ساعات التدريب ما نسبته $96.43%$ من إجمالي التباين الحاصل في مستوى الأداء السلوكي للموظفين، وهي نسبة توفيق ممتازة تعكس علاقة خطية قوية للغاية.
  • حساب الخطأ المعياري للتقدير ($df = 6 – 2 = 4$):
    $$S_e = \sqrt{\frac{SSE}{n – 2}} = \sqrt{\frac{1.5000}{4}} = \sqrt{0.3750} \approx 0.6124 \text{ درجة}$$

المرحلة 5: اختبار الفرضيات الإحصائية (اختبار t لمعامل الميل):

  • حساب مجموع مربعات $X$ الصافي:
    $$SS_x = \sum X^2 – \frac{(\sum X)^2}{n} = 266 – \frac{1296}{6} = 266 – 216 = 50.0000$$
  • حساب الخطأ المعياري لمعامل الميل:
    $$S_{b_1} = \frac{S_e}{\sqrt{SS_x}} = \frac{0.61237}{\sqrt{50}} = \frac{0.61237}{7.07107} \approx 0.0866$$
  • حساب القيمة التائية المحسوبة ($t_{calc}$):
    $$t = \frac{b_1}{S_{b_1}} = \frac{0.9000}{0.0866} \approx 10.39$$
  • بالرجوع إلى جدول توزيع $t$ عند درجات حرية $df = 4$ ومستوى دلالة طرفين $\alpha = 0.05$، نجد أن القيمة الحرجة هي $t_{crit} = 2.776$.
  • بما أن $|t_{calc}| = 10.39 > 2.776$، فإننا نرفض الفرضية الصفرية قطيعاً، ونستنتج بوجود تأثير إيجابي دال إحصائياً لساعات التدريب على الأداء عند مستوى ثقة 95%.

المرحلة 6: بناء جدول تحليل التباين (ANOVA Table) يدوياً بالأرقام:

مصدر التباين مجموع المربعات (SS) درجات الحرية (df) متوسط المربعات (MS) القيمة الفائية (F) الدلالة الإحصائية (p)
الانحدار 40.5000 1 40.5000 108.00 $p < 0.001$
الخطأ العشوائي 1.5000 4 0.3750
المجموع الكلي 42.0000 5

نلاحظ الاتساق الرياضي التام: $F = 108.00 = (10.3923)^2 = t^2$. وتتجاوز القيمة الفائية المحسوبة بكثير القيمة الفائية الحرجة $F_{crit(1, 4)} = 7.71$ عند مستوى $\alpha = 0.05$.

12.3 التمثيل البياني اليدوي لخط الانحدار ومطابقة النتائج مع البرمجيات

لتمثيل النموذج بيانياً على ورق رسم بياني يدوياً، نتبع الخطوات الهندسية التالية بدقة:

  1. رسم المحورين الإحداثيين: المحور الأفقي يُمثل ساعات التدريب $X$ (من 0 إلى 12)، والمحور الرأسي يُمثل مستوى الأداء $Y$ (من 0 إلى 15).
  2. توقيع النقاط الست الأصلية المشاهدة كأزواج مرتبة في شكل نقاط مبعثرة (Scatter Plot).
  3. تحديد نقطة مركز الثقل $(\bar{X}, \bar{Y}) = (6, 9)$ ووضع علامة مميزة عليها.
  4. تحديد نقطة المقطع الصادي $(0, b_0) = (0, 3.6)$ على المحور الرأسي.
  5. استخدام المسطرة لوصل خط مستقيم دقيق يمر بنقطة المقطع الصادي ونقطة مركز الثقل ويمتد عبر كامل فضاء البيانات.
  6. إسقاط خطوط رأسية متقطعة من كل نقطة مشاهدة إلى الخط المستقيم؛ تُمثل أطوال هذه الخطوط الرأسية البواقي الفردية $e_i$.

عند إدخال مصفوفة البيانات ذاتها إلى حزمة برمجية متقدمة مثل R Project أو SPSS، نجد تطابقاً رقمياً مطلقاً لكافة المخرجات مع نتائج حسابنا اليدوي:

  • معامل الميل التقديري: $\text{Estimate}(X) = 0.9000$، بخطأ معياري $\text{Std. Error} = 0.0866$، وقيمة $t = 10.392$، ودلالة $p = 0.000457$.
  • المقطع الصادي: $\text{Intercept} = 3.6000$، بخطأ معياري $\text{Std. Error} = 0.5809$، وقيمة $t = 6.197$.
  • معامل التحديد: $R^2 = 0.9643$، والخطأ المعياري للنموذج $S_e = 0.6124$.

يُثبت هذا التطابق التام نجاح الحساب اليدوي ويوفر للمتعلم يقيناً علمياً وعملياً شاملاً بكيفية عمل النماذج الإحصائية القياسية.

خاتمة

يُمثل التمكن من إجراء الانحدار الخطي البسيط يدوياً تجربة تعليمية تأسيسية تُكسب الباحثين والمحللين رؤية ثاقبة وفهماً عميقاً يتجاوز مجرد التعامل السطحي مع المخرجات الحاسوبية الجاهزة. ومن خلال تتبع المسار الرياضي من الدالة الهدف لتقليل مربعات البواقي، وصولاً إلى بناء الجداول الخماسية، واستخراج المعلمات، وإجراء اختبارات الفروض وتفكيك التباين، تتجلى البنية المتناسقة للإحصاء الاستدلالي كعلم دقيق يجمع بين الصرامة الجبرية والتطبيق العملي الهادف.

إن المهارات الحسابية والتشخيصية التي يكتسبها الباحث عبر التطبيق اليدوي تُشكل درعاً منهجياً يحميه من الوقوع في الأخطاء الشائعة، وتمنحه القدرة على قراءة الأوراق العلمية ونقدها بموضوعية واقتدار. ونشجع جميع الدارسين والباحثين على تكرار هذه المعالجات اليدوية على مجموعات بيانات متنوعة لترسيخ هذه المعرفة الإحصائية الأصيلة وجعلها ركيزة صلبة لأي تحليلات إحصائية متقدمة في مسيرتهم الأكاديمية والمهنية.

References

اقتباس هذا المقال

looti, M. (2026, أغسطس 27). كيفية إجراء الانحدار الخطي يدوياً. عرب سايكلوجي. https://arabpsychology.com/statistics/how-to-perform-linear-regression-by-hand/
looti, Mohammed. “كيفية إجراء الانحدار الخطي يدوياً.” عرب سايكلوجي, 27 أغسطس 2026, https://arabpsychology.com/statistics/how-to-perform-linear-regression-by-hand/.
looti, Mohammed. “كيفية إجراء الانحدار الخطي يدوياً.” عرب سايكلوجي. أغسطس 27, 2026. https://arabpsychology.com/statistics/how-to-perform-linear-regression-by-hand/.