يُمثّل مفهوم الخطأ المطلق (Absolute Error) ركيزة بنيوية محورية في فضاء القياس النفسي (Psychometrics) والتقييم السلوكي، حيث يعكس الفارق الرياضي والكمي المباشر بين القيمة الملاحظة المقاسة والدرجة الحقيقية لسمة الفرد الخاضعة للفحص دون الالتفات إلى اتجاه الانحراف سواء كان بالزيادة أو النقصان. يكتسب هذا المفهوم أهمية استثنائية في دراسة السلوك البشري؛ إذ تفتقر المتغيرات النفسية والوجدانية إلى وحدات قياس فيزيائية ملموسة، مما يجعل كل استجابة عرضة لتأثيرات تذبذبية ومواقفية تحيد بالدرجة الخام عن موضعها الدقيق. إن التحديد الدقيق لمقدار هذا الخطأ يُشكّل حجر الزاوية في بناء مقاييس واختبارات تتمتع بمستويات مقبولة من الموثوقية والدقة التنبؤية، مما يمنح الممارسين والباحثين أرضية صلبة لتفسير النتائج السريرية والتربوية دون الوقوع في شرك التقديرات المضللة أو الأحكام المعيارية الجائرة.
التأصيل المفاهيمي والإبستيمولوجي للخطأ المطلق في علم النفس
يُعرَّف الخطأ المطلق في أدبيات التحليل النفسي والقياس التجريبي بأنه القيمة الموجبة المطلقة الناتجة عن طرح القيمة الحقيقية للخاصية النفسية من القيمة الظاهرة المحسوبة تجريبياً. إذا كانت الدرجة الملاحظة لفرد ما على مقياس الاكتئاب هي درجات مقدرة، فإن الفارق الرياضي الصرف بين هذه الدرجة وما يمتلكه الفرد واقعياً على المستوى العصبي والوجداني يمثل جوهر الخطأ. لا يركز هذا القياس على ما إذا كان الاختبار قد بالَغ في تقدير شدة العَرَض أو قلل منها، بل ينصب اهتمامه كلياً على مقدار الإزاحة الإجمالي ومدى ابتعاد الملاحظة الميدانية عن الحقيقة الكامنة وراء السلوك الم رصود. هذا التجريد الإحصائي يسمح بتوحيد معايير المقارنة بين أدوات القياس المختلفة وتحديد المدى الذي تعكس فيه البيانات الواقع الفعلي للمبحوثين دون الانشغال بمؤشرات الاتجاه التي قد تلغي بعضها بعضاً عند حساب المتوسطات.
يندرج الخطأ المطلق فلسفياً ضمن إشكالية تمثيل الواقع النفسي بواسطة الأرقام والرموز، وهي معضلة ارتبطت بالتحول الوضعي في العلوم الإنسانية منذ أواخر القرن التاسع عشر. لا يمكن للباحث النفسي أن يلامس السمات غير المرئية كالقلق أو الذكاء بصورة حسية، بل يستدل عليها من خلال وسائط سلوكية واستجابات لفظية وأدائية. هذه الوسائط تتوسطها دائماً فجوة لا مفر منها بين ما يدور في العقل الداخلي وما يُسجل على استمارة الإجابة. بناءً على هذا التصور، يُنظر إلى الخطأ المطلق باعتباره اعترافاً صريحاً بمحدودية أدوات التقييم الإنساني وضرورة التعامل مع كل رقم كمي بوصفه نطاقاً احتمالياً وليس حقيقة سرمدية مطلقة، وهو ما يُعيد صياغة الممارسة الإكلينيكية ضمن أطر الحذر والتأني التأويلي المستمر.
علاوة على ذلك، يتداخل الخطأ المطلق مع نظرية النمذجة الرياضية للسلوك البشري، حيث يُعد معياراً نقدياً لتقييم كفاءة النماذج البنائية في تفسير التباين السلوكي. فعندما نقوم بوضع معادلة رياضية تتنبأ بدرجة التكيف الأكاديمي أو الصلابة النفسية، يتم حساب الفوارق المطلقة بين تنبؤات النموذج والأداء الواقعي للطلاب لتقييم جودة المطابقة. إن انخفاض معدلات هذا الخطأ يعني اقتراب النموذج من التقاط الديناميات الحقيقية الموجهة للنشاط الإنساني، في حين تشير المعدلات المرتفعة إلى وجود متغيرات كامنة غير ملحوظة أو تشوهات منهجية في بنية المقياس ذاته، مما يفرض إعادة النظر في الفرضيات النظرية المعتمدة وتعديل مؤشرات البناء القياسي.
السياق التاريخي وتطور نظرية الخطأ في القياس الإنساني
تعود الجذور الأولى لنظرية الخطأ إلى العلوم الفلكية والفيزيائية مع أعمال كارل فريدريش غاوس (Carl Friedrich Gauss) الذي صاغ التوزيع الطبيعي للأخطاء، بيد أن استعارة هذا المفهوم وتوطينه داخل العلوم السلوكية بدأت بجهود رواد السيكوفيزيقا مثل إرنست فيبر وغوستاف فيشنر. كان هؤلاء العلماء يسعون إلى إيجاد علاقات رياضية دقيقة تربط بين شدة المثير الفيزيائي ومقدار الإحساس النفسي المقابل له، واصطدموا مراراً بتباين الاستجابات الفردية وتذبذبها حول القيم المتوسطة. قاد هذا التذبذب غير المبرر إلى إدراك أن القياس الإنساني محكوم بظاهرة خطأ متأصلة ترتبط بآليات المعالجة الحسية في الجهاز العصبي، مما استدعى وضع حسابات كمية تقيس البعد المطلق بين إدراك الفرد والمقدار الفعلي للمثير.
مع مطلع القرن العشرين، وضع تشارلز سبيرمان (Charles Spearman) اللبنات المنهجية الصلبة لـ نظرية الاختبار الكلاسيكية (Classical Test Theory)، والتي افترضت أن أي درجة ملاحظة تتكون من شقين: الدرجة الحقيقية ودرجة الخطأ العشوائي. في هذا السياق، تطور مفهوم الخطأ من مجرد خلل تجريبي ينبغي التخلص منه إلى مكون رياضي حتمي تفرضه طبيعة الظاهرة السلوكية المقاسة. أصبح التركيز منصباً على عزل التباين الناشئ عن الخطأ المطلق لتقدير معامل الثبات الداخلي للمقاييس النفسية. ساهمت هذه الخطوة التاريخية في تحرير علم النفس من الانطباعية السريرية، ودفعت به نحو مصاف العلوم المنضبطة القائمة على نمذجة ارتياب الملاحظة بدقة وإحكام إحصائي.
شهد النصف الثاني من القرن العشرين ثورة مفاهيمية جديدة مع ظهور نظرية تعميم القياس (Generalizability Theory) على يد لي كرونباخ (Lee Cronbach) وزملائه. في هذه المرحلة المتقدمة، تم التمييز بوضوح قاطع بين نوعين من القرارات المرتبطة بالقياس: القرارات النسبية والقرارات المطلقة. هنا تحديداً، تبلور الخطأ المطلق كعنصر حاسم في اتخاذ القرارات التي لا تستند إلى مقارنة الفرد بأقرانه (مثل الترتيب المئيني)، بل تستند إلى معايير أداء موضوعية ثابتة مثل تحديد ما إذا كان المريض مؤهلاً للخروج من المصحة العقلية أو ما إذا كان الطالب يمتلك الكفاءة الدنيا للنجاح في تخصص حساس، مما رسخ حضور الخطأ المطلق كأداة لا غنى عنها في التقييم القائم على المحك.
التمييز الرياضي والإحصائي: الخطأ المطلق والخطأ النسبي والخطأ المنتظم
يقتضي الفهم العميق للخطأ المطلق التمييز الدقيق بينه وبين المفاهيم الإحصائية المجاورة التي قد تلتبس على الباحث في التحليل النفسي. يُعبر الخطأ المطلق عن المقدار الإجمالي للانحراف بوحدات القياس الأصلية نفسها للمتغير، كأن نقول إن درجة الذكاء الملاحظة تنحرف بمقدار خمس نقاط عن الدرجة الفعلية للشخص. في المقابل، فإن الخطأ النسبي (Relative Error) يربط هذا الانحراف بالحجم الكلي للمتغير المقاس، ويُعرض عادة في شكل نسبة مئوية توضح الوزن الحقيقي للخطأ نسبةً إلى المجموع. إن خطأ مطلقاً مقداره خمس درجات على مقياس مكوَّن من عشر درجات يُعد كارثة قياسية تلغي صلاحية المقياس، بينما يُعتبر الخطأ ذاته هامشاً ضئيلاً ومقبولاً إذا كان المقياس يتألف من خمسمائة درجة.
من زاوية أخرى، يجب الفصل بصرامة بين الخطأ المطلق المعتمد على التباين والخطأ المنتظم أو التحيز المنهجي (Systematic Error). يتسم الخطأ المنتظم باتجاهه الثابت والمتوقع، كأن يُعاني مقياس الاكتئاب من عيب بنيوي يدفع جميع المفحوصين إلى تسجيل درجات أعلى بدرجتين بسبب غموض صياغة أحد البنود أو تحيز المرشد النفسي في إعطاء التقييمات. هذا النوع من الأخطاء يؤثر سلباً في صدق المقياس أكثر من تأثيره في اتساقه الداخلي. أما الخطأ المطلق في إطار التقديرات الشاملة، فيستوعب كلاً من التذبذبات العشوائية غير المتوقعة والانحرافات الثابتة ليُعطي المؤشر النهائي لمستوى البعد الكلي للقياس عن الحقيقة الموضوعية.
تعتمد النمذجة الإحصائية للخطأ المطلق على صيغ رياضية متقدمة، أبرزها حساب متوسط الخطأ المطلق (Mean Absolute Error – MAE)، والذي يُحسب من خلال أخذ متوسط الفروق المطلقة بين التقديرات والواقع لجميع أفراد العينة. يتميز متوسط الخطأ المطلق بمقاومته الفائقة لـ القيم الشاذة (Outliers) مقارنة بمؤشرات أخرى مثل الجذر التربيعي لمتوسط مربعات الخطأ (RMSE) الذي يُضخم الانحرافات الكبيرة عبر التربيع. في الأبحاث العيادية والسلوكية، يُفضل كثير من الإحصائيين استخدام متوسط الخطأ المطلق لتفسير النتائج للأطباء النفسيين؛ نظراً لوضوحه الدلالي البديهي، إذ يخبرنا ببساطة عن متوسط الخطأ المتوقع بالدرجات نفسها التي يقرؤها المعالج على تقرير المريض.
الخطأ المطلق في نظرية تعميم القياس (G-Theory)
تُمثّل نظرية تعميم القياس الإطار النظري الأبرز الذي منح الخطأ المطلق مكانته الإحصائية المركزية الحديثة في القياس النفسي، متجاوزة أوجه القصور المتأصلة في النظرية الكلاسيكية. تُفكك هذه النظرية التباين الإجمالي إلى أوجه أو مصادر متعددة (Facets) للخطأ، مثل وجه الفاحصين، ووجه المناسبات أو الأوقات، ووجه النماذج الاختبارية المستخدمة. في هذا الإطار، لا يُعامل الخطأ ككتلة عشوائية صامتة ومجهولة، بل يُحسب تباين الخطأ المطلق (Absolute Error Variance) من خلال جمع جميع مصادر التباين غير المرتبطة بالسمة المقاسة، بما في ذلك التباينات المشتركة والتأثيرات التفاعلية المتبادلة بين تلك الأوجه المتعددة للقياس.
يُستخدم تباين الخطأ المطلق لحساب معامل الاعتمادية أو الإمكانية (Dependability Coefficient)، والذي يرمز له بالرمز Phi (Φ)، ويُعد البديل الأكثر صرامة لمعامل الثبات التقليدي في اتخاذ القرارات القائمة على المحك (Criterion-Referenced Decisions). بينما يهتم قرار المقارنة المرجعية المعيارية بتحديد ما إذا كان الشخص (أ) يتفوق على الشخص (ب)، يهدف القرار المطلق إلى التحقق مما إذا كان الشخص يمتلك المستوى الكافي من الكفاءة السلوكية أو المعرفية بغض النظر عن رتبة أقرانه في المجموعة. هنا تتجلى خطورة الخطأ المطلق؛ فإذا كان تباينه كبيراً، فإن احتمال اتخاذ قرار خاطئ بتأهيل شخص غير كفء أو استبعاد حالة مؤهلة يرتفع بصورة دراماتيكية تهدد سلامة التطبيقات النفسية.
تتضمن استراتيجيات نظرية التعميم إجراء دراستين متكاملتين: دراسة التعميم (G-Study) التي تُحدد أحجام التباينات المطلقة المرتبطة بكل وجه من أوجه القياس، ودراسة القرار (D-Study) التي تُتيح للباحث التخطيط المسبق لتقليل تباين الخطأ المطلق إلى أدنى مستوياته الممكنة. يُمكن للمصمم القياسي، عبر هذه الحسابات، معرفة ما إذا كان تقليل الخطأ المطلق يتطلب زيادة عدد الأسئلة، أو زيادة عدد الجلسات الإكلينيكية، أو تدريب المقيمين لتوحيد أساليبهم التشخيصية. إن هذا النموذج الرياضي يحول إدارة الخطأ المطلق من إجراء لاحق لتسجيل البيانات إلى عملية هندسية استباقية محكمة تتحكم في جودة القياس النفسي بدقة متناهية.
مصادر ومولدات الخطأ المطلق في الاختبارات والمقاييس النفسية
ينشأ الخطأ المطلق في التقييم النفسي من تضافر شبكة معقدة من العوامل الذاتية والموضوعية والبيئية التي تتداخل أثناء الموقف الاختباري. تتصدر الفروق الفردية في المتغيرات الفسيولوجية والمزاجية اللحظية للمفحوص هذه المصادر؛ فالقلق العابر، والإجهاد البدني، ومستويات اليقظة والانتباه، أو حتى تناول كميات معينة من الكافيين، قد تُحدث انزياحاً في استجابات الفرد اليومية عن موقعه الحقيقي المستقر. هذه التقلبات العابرة تُدخل قدراً حتمياً من الخطأ المطلق على القياس، وتجعل أداء الفرد في صباح يوم الاثنين مختلفاً بدرجة طفيفة أو جوهرية عن أدائه في مساء يوم الأربعاء، حتى وإن كانت السمة المقاسة، كالذكاء السائل، تتسم بالثبات النسبي عبر الزمن.
تتمثل الفئة الثانية من المصادر في الخصائص البنيوية للأداة القياسية ذاتها، وهو ما يُعرف بأخطاء بناء البنود وغموض الدلالات اللغوية. إن وجود مفردات تحتمل التأويل المتعدد، أو صياغة عبارات طويلة ومعقدة تركيبياً، أو استخدام بنود مزدوجة الفكرة، يجبر المفحوصين على تفسير العبارة بناءً على استراتيجياتهم المعرفية الخاصة بدلاً من دلالة البند المقصودة. يضاف إلى ذلك تأثير طول الاختبار؛ فالاختبارات المفرطة في الطول تولد الإرهاق الذهني والملل، مما يدفع المستجيبين إلى إعطاء إجابات عشوائية في النصف الأخير من المقياس، في حين تفشل الاختبارات المقتضبة للغاية في تغطية النطاق السلوكي للسمة، وكلا الأمرين يؤدي مباشرة إلى ارتفاع حاد في مقدار الخطأ المطلق المسجل.
تتعلق الفئة الثالثة بمحددات بيئة القياس وتفاعلات الفاحص مع المفحوص، وتحديداً في الاختبارات الفردية مثل مقاييس الذكاء أو الفحوصات الإسقاطية والعيادية. يُمكن لعوامل فيزيائية بسيطة مثل سوء الإضاءة، أو وجود ضوضاء متبقية في غرفة الفحص، أو ارتفاع درجة الحرارة أن تُربك تركيز المفحوص وتضخم الخطأ. علاوة على ذلك، فإن سلوك الأخصائي النفسي، وتعبيرات وجهه، ونبرة صوته، ومدى التزامه بالتعليمات المعيارية لتطبيق الاختبار وتصحيحه تلعب دوراً حاسماً في توليد أخطاء القياس؛ فأي تساهل أو تشدد غير مقنن في منح الدرجات يُترجم فورياً إلى زيادة في قيمة الخطأ المطلق الذي يُلوث النتيجة الختامية.
التداعيات السريرية والتشخيصية للخطأ المطلق
في الممارسة السريرية والنفس-عصبية، لا يُعد الخطأ المطلق مجرد رقم إحصائي مجرد، بل هو مسألة ترتبط مباشرة بمصائر الأفراد ومسارات حياتهم ومستويات الرعاية الصحية التي يتلقونها. عند استخدام اختبارات الذكاء لتشخيص الإعاقة الذهنية، غالباً ما يتم تبني حد قاطع صارم (مثل الدرجة 70 وفق المعايير الدولية). إذا كانت الدرجة الملاحظة للطفل هي 72، مع وجود خطأ مطلق محتمل مقداره 4 درجات، فإن التمسك بالدرجة الظاهرة وحدها دون حساب مجال الخطأ المطلق قد يحرم هذا الطفل من برامج الدعم التربوي والتأهيلي الحكومية التي يحتاجها بشدة لتطوير استقلاليته السلوكية.
يمتد هذا التأثير الحاسم إلى قرارات المحاكم والطب الشرعي النفسي، ولا سيما في القضايا الجنائية الكبرى التي تنطوي على تقييم الأهلية العقلية للمتهمين أو مدى مسؤوليتهم الجنائية عن أفعالهم. في الولايات المتحدة على سبيل المثال، حظرت المحكمة العليا إعدام الجناة المصابين بإعاقة ذهنية في قضية (Atkins v. Virginia)، مما جعل حساب الخطأ المطلق وخطأ القياس المعياري مسألة حياة أو موت بالمعنى الحرفي للكلمة. إن إهمال الخطأ المطلق في هذه السياقات الحساسة يُعد خرقاً منهجياً وأخلاقياً فادحاً، حيث يجب النظر إلى كل درجة مقاسة بوصفها مركزاً لفترة ثقة (Confidence Interval) تعكس حجم الخطأ الإجمالي المحتمل وتوفر الحماية القانونية للمفحوصين من أخطاء التقدير الإحصائي.
تتجلى خطورة الخطأ المطلق كذلك في مراقبة الفعالية العلاجية والدوائية للأمراض النفسية المزمنة كالفصام واضطرابات المزاج الحادة. عند تطبيق مقاييس الأعراض لتقييم مدى استجابة المريض لعقار مضاد للاكتئاب أو لبروتوكول العلاج المعرفي السلوكي، يحتاج المعالج إلى معرفة ما إذا كان التحسن الملاحظ في الدرجات يعكس تعافياً حقيقياً أم أنه مجرد تذبذب ناتج عن الخطأ المطلق للأداة. يتم هنا استخدام مؤشر التغير الموثوق (Reliable Change Index – RCI)، والذي يعتمد في جوهره على تباين الخطأ لضمان أن الانخفاض في حدة الأعراض يتجاوز بمراحل عتبة الخطأ المطلق الملازمة لعملية القياس السريري.
الاستراتيجيات المنهجية للحد من الخطأ المطلق وضبط الدقة
يتطلب تقليص الخطأ المطلق في القياس النفسي اتباع استراتيجيات منهجية صارمة تبدأ من مرحلة تصميم الأداة وتمتد إلى إجراءات التطبيق والتصحيح الرياضي اللاحق. يمثل استخدام نظرية الاستجابة للمفردة (Item Response Theory – IRT) أحد أحدث الحلول وأكثرها كفاءة في هذا المجال؛ إذ تسمح هذه النمذجة بتقدير دقة القياس ومعلومات الاختبار عند مستويات مختلفة من القدرة بدلاً من افتراض خطأ موحد لجميع المفحوصين. من خلال الاختبارات التكيفية المحوسبة (Computerized Adaptive Testing)، يتم تقديم بنود تتناسب بدقة مع مستوى قدرة الفرد الحالية، مما يُسقط البنود شديدة السهولة أو شديدة الصعوبة التي تُسهم عادة في زيادة معدلات الخطأ المطلق، ويُحقق أعلى درجات الدقة بأقل عدد ممكن من الأسئلة.
تشمل التدابير الأساسية أيضاً توحيد ومعايرة بيئات وإجراءات القياس (Standardization) بأعلى درجات الانضباط الميداني. يقتضي ذلك صياغة كتيبات تشغيل وتطبيق مفصلة للغاية تحدد الكلمات الدقيقة التي يتعين على الفاحص نطقها، والمهل الزمنية المسموح بها لكل مهمة، وطريقة الاستجابة لأي استفسار يصدر عن المفحوص دون تقديم إيحاءات تلميحية توجه سلوكه. كما يُعد التدريب المكثف للفاحصين وإخضاعهم لاختبارات الاتساق بين الملاحظين (Inter-Rater Reliability) شرطاً بنيوياً لتقليص التباين المطلق الناشئ عن ذاتية المصحح، وهو ما يضمن استقرار النتائج بغض النظر عن هوية الأخصائي الذي يُشرف على الجلسة.
من الناحية الإحصائية المعاصرة، يُنصح الباحثون والممارسون بتضمين فترات الثقة القائمة على الخطأ المطلق في جميع التقارير النفسية المعيارية والمحكية. بدلاً من تزويد متخذ القرار برقم قطعي واحد، يجب تقديم المدى الحقيقي المحتمل (مثلاً: الدرجة 105 مع فترة ثقة 95% تتراوح بين 101 و109). بالإضافة إلى ذلك، يساعد تكرار القياس عبر فترات زمنية متقاربة وتطبيق أساليب تحليل النمذجة متعددة المستويات في عزل وتجريد مكونات الخطأ المطلق، مما يمنح الفريق المعالج صورة بانورامية بالغة الدقة تعكس السمة الكامنة بثبات وموضوعية بعيداً عن التشوهات الطارئة التي تفرضها ظروف اللحظة الراهنة.
خاتمة وتأطير نقدي لمستقبل القياس النفسي
يظل مفهوم الخطأ المطلق تذكيراً إبستيمولوجياً دائماً بالطبيعة المعقدة والفريدة للظواهر النفسية التي تأبى الخضوع المطلق للتقطير الرقمي المبسط دون شوائب أو تذبذبات. إن التعامل العلمي السليم مع القياس السلوكي يفرض التخلي عن وهم الوصول إلى درجات حقيقية نقية بنسبة مئة بالمئة، وتبني ثقافة تقدير الارتياب وإدارته بنضج منهجي وأخلاقي. إن كل خطوة تقطعها السيكومتريا المعاصرة لا تهدف إلى إفناء الخطأ بالمطلق، فهذا مستحيل منطقياً وفيزيائياً، بل تهدف إلى محاصرته وفهم أبعاده ومكوناته بدقة متزايدة تضمن صون كرامة المريض والمفحوص وتمنع توظيف الأرقام الإحصائية بصورة قسرية خاطئة.
مع دخول الذكاء الاصطناعي، والقياس النفسي المعتمد على البيانات السلوكية الضخمة (Big Data)، والتقييم اللحظي البيئي عبر الهواتف الذكية وأجهزة الاستشعار القابلة للارتداء، يدخل الخطأ المطلق حقبة جديدة من التحديات والفرص المنهجية. تتيح هذه التقنيات تسجيل آلاف الملاحظات اللحظية للفرد في بيئته الطبيعية دون الحاجة إلى مواقف الاختبارات المصطنعة، مما يُسقط أوجهاً كلاسيكية من أخطاء الموقف، ولكنه في الوقت نفسه يُدخل مصادر جديدة من الخطأ التقني وضجيج البيانات المعقدة. إن مستقبل القياس النفسي سيظل مرهوناً بقدرتنا على صياغة معادلات إحصائية مرنة تفهم الخطأ المطلق ضمن هذه التدفقات السلوكية المتواصلة، وتُحوله من عائق إلى رافعة تعزز فهمنا لأعماق النفس الإنسانية المتغيرة.
المراجع
- American Psychological Association, American Educational Research Association, & National Council on Measurement in Education. (2014). Standards for educational and psychological testing. American Educational Research Association.
- Brennan, R. L. (2001). Generalizability theory. Springer-Verlag.
- Crocker, L., & Algina, J. (2008). Introduction to classical and modern test theory. Cengage Learning.
- Cronbach, L. J., Gleser, G. C., Nanda, H., & Rajaratnam, N. (1972). The dependability of behavioral measurements: Theory of generalizability for scores and profiles. John Wiley & Sons.
- Embretson, S. E., & Reise, S. P. (2000). Item response theory for psychologists. Lawrence Erlbaum Associates.
- Nunnally, J. C., & Bernstein, I. H. (1994). Psychometric theory (3rd ed.). McGraw-Hill.
- Willmott, C. J., & Matsuura, K. (2005). Advantages of the mean absolute error (MAE) over the root mean square error (RMSE) in assessing average model performance. Climate Research, 30(1), 79–82.