القياس النفسيعلم النفس الإكلينيكيعلم النفس المعرفي

التعرف الآلي على الكلام

استعراض أكاديمي شامل لمفهوم التعرف الآلي على الكلام (ASR) وتطبيقاته في علم النفس الإكلينيكي والقياس النفسي العصبي واستخراج الواسمات الحيوية الصوتية.

Mohammed looti أكاديمي وباحث متخصص في علم النفس
تاريخ النشر
تمت المراجعة العلمية · د. مروة عبد العظيم · 28 سبتمبر، 2026
مراجعة وتدقيق علمي معتمد تاريخ التدقيق: 28 سبتمبر، 2026
د. مروة عبد العظيم دكتوراه
أستاذة علم النفس • جامعة كربلاء
معايير التدقيق والاعتماد السريري

يخضع هذا المحتوى لمعايير ضبط الجودة والتدقيق العلمي والأكاديمي الصارمة في شبكة علم النفس العربي، لضمان صحة المعلومات ودقتها السريرية ومطابقتها لأحدث الأدلة والبراهين الصادرة عن الجمعيات النفسية والطبية المعتمدة (APA / WHO).

يمثل التعرف الآلي على الكلام (Automated Speech Recognition – ASR) نقطة التقاء ثورية بين علم النفس المعرفي وهندسة البرمجيات والذكاء الاصطناعي، حيث أحدث تحولاً جذرياً في دراسة السلوك البشري والتواصل الإنساني. لم يعد هذا المجال مجرد واجهة حاسوبية لتحويل الإشارات الصوتية إلى نصوص مكتوبة، بل بات أداة سيكولوجية قياسية متقدمة تتيح لعلماء النفس والباحثين الإكلينيكيين سبر أغوار العمليات العقلية المعقدة، والاضطرابات العاطفية، والوظائف المعرفية الدقيقة. يستند دمج تقنية التعرف الآلي على الكلام في البيئات النفسية إلى افتراض علمي رصين يرى أن الصوت واللغة هما المرآة الصادقة للحالة النفسية والعصبية للإنسان، مما يفتح آفاقاً غير مسبوقة في التشخيص الإكلينيكي والرصد السلوكي المستمر.

مقدمة وتأصيل مفهوم التعرف الآلي على الكلام في السياق النفسي

يُعرف التعرف الآلي على الكلام من الناحية الحاسوبية بأنه قدرة النظام التقني على معالجة واستقبال الإشارات الصوتية المنطوقة، وفك تشفيرها، وترجمتها بدقة إلى سلاسل نصية مفهومة ومطابقة لما تلفظ به الفرد. غير أن هذا المفهوم يكتسب في السياق النفسي والإكلينيكي بُعداً أعمق وأشمل يتجاوز التحويل الحرفي للرموز الصوتية؛ إذ يرتبط ارتباطاً وثيقاً بدراسة علم النفس اللغوي وعلم الصوتيات الإدراكي. يتولى هذا النظام التقني رصد المعالم الفونولوجية والصوتية التي تنعكس عبر نبرات الصوت وسرعته وتردداته، وهي محددات ترتبط مباشرة بالبنية النفسية والعصبية للمتكلم، مما يمنح الباحثين وسيلة علمية موضوعية لملاحظة التغيرات الدقيقة في الأداء التعبيري والانفعالي.

ينطلق علماء النفس في اهتمامهم بهذه التقنية من حقيقة أن إنتاج الكلام يمثل واحدة من أكثر المهام المعرفية والحركية تعقيداً في الجهاز العصبي البشري. فالعملية لا تقتصر على تحريك الأحبال الصوتية وعضلات النطق، بل تتطلب استدعاءً نشطاً للذاكرة العاملة، والتخطيط المفاهيمي، والتنظيم الانفعالي، والتحكم الحركي الدقيق بتنسيق مع القشرة المخية. بالتالي، فإن أي قصور أو تبدّل في الحالة النفسية، كالقلق الحاد أو الاكتئاب السريري، أو في البنية العصبية، كالتدهور المعرفي في الخرف، سينعكس لا محالة كخلل في المعالم الصوتية أو التركيبية للحديث، وهو ما تجعله خوارزميات التعرف الآلي على الكلام قابلاً للقياس الكمي الدقيق بدلاً من الاعتماد الحصري على التقييم السريري الذاتي.

علاوة على ذلك، يمثل التعرف الآلي على الكلام مدخلاً جوهرياً إلى مفهوم «التنميط الظاهري الرقمي» (Digital Phenotyping)، الذي يهدف إلى قياس السلوك البشري في البيئات الطبيعية اللحظية دون تدخل مباشر. تتيح هذه التقنية جمع بيانات صوتية ولسانية بصورة مستمرة وسلبية عبر الأجهزة الذكية، ما يسمح برسم خرائط دقيقة للمسارات السلوكية وتقلبات المزاج لدى المرضى النفسيين على مدار اليوم. إن هذا الانتقال من القياس الدوري المعزول في عيادة المعالج إلى القياس البيئي المستمر يشكل نقلة إبستيمولوجية كبرى في منهجية البحث النفسي والتشخيص السريري الحديث.

التطور التاريخي والأسس النظرية للتقنية

تعود الجذور الأولى لنظم تمييز الكلام إلى منتصف القرن العشرين، حيث اقتصرت النماذج البدائية مثل نظام «أودري» (Audrey) الذي طورته مختبرات بل في خمسينيات القرن الماضي على تمييز الأرقام المفردة المنطوقة بدقة محدودة وبشخص محدد. كانت تلك المحاولات تستند إلى استخلاص الترددات الصوتية التكوينية الأساسية، وكانت بعيدة تماماً عن فهم السياق اللغوي أو النفسي للمتكلم. تلا ذلك في السبعينيات والثمانينيات ظهور نماذج إحصائية متطورة بالاعتماد على نماذج ماركوف الخفية (Hidden Markov Models – HMM)، والتي تعاملت مع الإشارة الصوتية كعملية احتمالية زمنية، مما مكّن الباحثين من الانتقال نحو التعرف على الكلام المتصل والمستقل عن هوية المتكلم.

أحدثت الثورة الحاسوبية الأخيرة وظهور التعلم العميق (Deep Learning) في العقدين الماضيين نقلة نوعية جذرية، حيث استُبدلت النماذج الصوتية التقليدية بشبكات عصبية اصطناعية عميقة مثل الشبكات العصبية الالتفافية (CNN) والشبكات التكرارية (RNN) ونماذج المحولات (Transformers). هذه البنى الحسابية المتقدمة لا تحاكي فقط الترددات السطحية، بل أصبحت قادرة على استيعاب السياق الدلالي الطويل، وتفسير الإشارات الصوتية المليئة بالضوضاء، واستخلاص ميزات التعبير الانفعالي المعقدة. هذا التحول التقني جعل أنظمة التعرف على الكلام قادرة على محاكاة الشبكات العصبية البيولوجية المسؤولة عن معالجة الكلام في الدماغ البشري بدرجة عالية من الشبه المفاهيمي.

من الناحية النظرية، يستند التلاقي بين علم النفس والتعرف على الكلام إلى نظريات إدراك الكلام الكلاسيكية، مثل «النظرية الحركية لإدراك الكلام» (Motor Theory of Speech Perception) ونظرية التحليل عبر التركيب (Analysis-by-Synthesis). تفترض هذه النظريات أن إدراك الكلام وفهمه لا ينفصلان عن الآليات الحركية العصبية لإنتاجه، وأن المستمع يحلل الإشارات اللغوية بناءً على إدراكه الضمني لكيفية صدورها جسدياً وانفعالياً. وبالمثل، تستخدم نماذج التعرف الآلي الحديثة تمثيلات متعددة المستويات تدمج بين الترددات الصوتية وقواعد النحو وعلم الدلالة، بما يحاكي المنظومات الهرمية لمعالجة المعلومات في الفص الصدغي البشري وقشرة الفص الجبهي.

الآليات العصبية والمعرفية لإنتاج الكلام والنمذجة الحاسوبية

يتطلب إنتاج الكلام تنسيقاً فائق التعقيد يبدأ في الفص الجبهي، وتحديداً في باحة بروكا والباحة المحركة الإضافية المسؤولة عن التخطيط النطقي واللغوي، ثم ينتقل عبر القشرة الحركية الأولية إلى الأعصاب القحفية التي تتحكم في عضلات الوجه والفك والحنجرة والتنفس. في الوقت ذاته، تتدخل البنى تحت القشرية مثل العقد القاعدية والمخيخ لضبط توقيتات الكلام وسلاسته الحركية، بينما يقوم الفص الصدغي، وبخاصة باحة فيرنيكه، بمراقبة التغذية الراجعة السمعية وتصحيح الأخطاء اللفظية بشكل فوري وتلقائي. هذه الشبكة العصبية المعقدة تجعل تدفق الكلام مقياساً دقيقاً وحساساً للغاية لأي خلل يمس المسارات العصبية الحركية أو الدوائر المعرفية العليا في الدماغ.

تقوم نظم التعرف الآلي على الكلام بنمذجة هذه المنظومة الحيوية من خلال تقسيم الإشارة الصوتية إلى وحدات زمنية مجهرية بالغة الدقة تُعرف بـ «الأطر»، حيث يتم استخراج معالم الطيف الترددي المعبرة مثل المعاملات الترددية الميلية (MFCCs). تعمل النماذج الصوتية المتقدمة كمرادف اصطناعي لمعالجة القوقعة والقشرة السمعية الأولية، بينما تعمل نماذج اللغة الحاسوبية، المعتمدة على خوارزميات التنبؤ بالسياق، كمعادل للبنى اللغوية والمعرفية العليا التي تتنبأ بالكلمة التالية بناءً على القواعد التركيبية والدلالية العامة، مما يسمح بحل الغموض السمعي الناتج عن تشابه الأصوات أو تمتمة المتحدث.

عندما يتعرض المتحدث لاضطراب انفعالي أو إجهاد إدراكي، يظهر ذلك بوضوح في التناغم العصبي الحركي لجهاز النطق، كأن تتأخر زمنية البدء الصوتي (Voice Onset Time) أو تتذبذب طاقة الترددات الأساسية. تتيح أدوات التعرف الآلي والتحليل الصوتي المرافقة لها رصد هذه الاضطرابات الميكروية التي تعجز الأذن البشرية عن التقاطها وتحديدها بدقة إحصائية. يمنح هذا الارتباط بين فسيولوجيا النطق والنمذجة الخوارزمية العلماء فهماً معمقاً لكيفية ترجمة النشاط العصبي الداخلي إلى دلالات صوتية خارجية ملموسة، مما يجعل التقنية ركيزة محورية في دراسات علم النفس العصبي الحديث.

التطبيقات الإكلينيكية والتشخيصية في الصحة النفسية

أثبتت تقنيات التعرف الآلي على الكلام فعاليتها كأداة تشخيصية مساعدة بالغة الأهمية في مجال علم النفس السريري والطب النفسي، وتحديداً في كشف وتقييم اضطرابات المزاج مثل الاضطراب الاكتئابي الجسيم والاضطراب ثنائي القطب. يُظهر مرضى الاكتئاب عادةً سمات كلامية مميزة تتسم بالبطء، واستطالة فترات الصمت بين الكلمات والجمل، ورتابة النبرة الصوتية (Prosodic Flattening)، وانخفاض تنوع التردد الأساسي. من خلال خوارزميات التعرف على الكلام المقترنة بنماذج التحليل اللساني، يمكن للنظام استخلاص هذه التغيرات الصوتية وتحديد شدة النوبة الاكتئابية بدقة تتطابق في كثير من الدراسات مع مقاييس التقييم المعيارية مثل مقياس هاميلتون للاكتئاب.

تمتد التطبيقات السريرية بفاعلية إلى تشخيص وتتبع الاضطرابات الذهانية، وعلى رأسها الفصام (Schizophrenia). يعاني مرضى الفصام من تدهور في التماسك الدلالي وترابط الأفكار، وهو ما ينعكس لغوياً في شكل «تفكك الروابط الدلالية» والفقر الكلامي ونقص التعبير الانفعالي الصوتي. يستطيع التعرف الآلي على الكلام، حين يُدمج مع معالجة اللغات الطبيعية، قياس المسافة الدلالية المتجهة بين الكلمات المتتالية بدقة فائقة، واكتشاف مؤشرات تشتت التفكير والقفز بين الموضوعات قبل أن تصبح واضحة للعيان في الفحص الطبي التقليدي، مما يتيح التنبؤ بالانتكاسات الذهانية ومآلات التحول الذهاني لدى الأفراد الأكثر عرضة للإصابة.

كما تلعب التقنية دوراً لا غنى عنه في الكشف المبكر عن التدهور المعرفي الخفيف ومرض ألزهايمر وأنواع الخرف الأخرى. يواجه هؤلاء المرضى صعوبات متزايدة في استدعاء المفردات، والتردد في اختيار الكلمات، وزيادة استخدام الكلمات الحشوية أو التوقفات الطويلة المترددة أثناء الكلام العفوي. إن التقييم المعتمد على نظم التعرف الآلي على الكلام يُمكّن من توثيق التراجع الطفيف في الطلاقة اللفظية وثرثرة التعبير والتعويضات النحوية، مما يوفر نافذة تشخيصية مبكرة للغاية قد تسبق التغيرات التشريحية المرئية عبر التصوير بالرنين المغناطيسي لسنوات.

الواسمات الحيوية الصوتية والتحليل اللساني في القياس النفسي

يمثل استخلاص «الواسمات الحيوية الصوتية» (Acoustic Biomarkers) أحد أكثر فروع البحث النفسي الواعدة استناداً إلى أنظمة التعرف على الكلام ومعالجة الإشارات، وتتوزع هذه الواسمات على مستويات صوتية ولغوية متعددة:

  • الخصائص النبرية والعروضية (Prosodic Features): وتتضمن التردد الأساسي للصوت (F0)، وتنوع طبقة الصوت، وديناميكيات الطاقة والشدة الصوتية، حيث تعكس التغيرات في هذه المؤشرات بوضوح درجات الاستثارة الانفعالية في حالات القلق أو الخمود العاطفي في حالات الاكتئاب.
  • المعالم الزمنية والإيقاعية (Temporal Dynamics): وتشمل معدل سرعة النطق، ومتوسط مدة مقاطع الصوت، والنسبة المئوية لفترات الصمت والتوقف، وتعد هذه المعالم مؤشراً سيكولوجياً حساساً لسرعة المعالجة المعرفية وكفاءة الانتباه والجهد الذهني المبذول.
  • المؤشرات الطيفية والجرسية (Spectral and Formant Metrics): وتغطي طاقة الترددات التكوينية وتشوهات الصوت الدقيقة (Jitter and Shimmer)، التي تقيس التذبذبات اللحظية في التردد والاتساع، وتكشف بدقة عن التوتر العضلي اللاإرادي المرتبط بحالات الضغط النفسي الشديد والصدمات.
  • المؤشرات اللسانية والدلالية (Linguistic and Semantic Markers): وتستند إلى النصوص المستخرجة عبر خوارزميات التعرف على الكلام، حيث يتم تحليل تنوع المفردات، وكثافة استخدام ضمائر المتكلم المفرد مقابل ضمائر الجمع، ونسب الكلمات العاطفية الإيجابية والسلبية، مما يعكس التركيز المعرفي الموجه نحو الذات.

إن الميزة الجوهرية لهذه الواسمات الصوتية واللسانية هي طبيعتها الموضوعية وغير الغازية (Non-invasive)، إذ يمكن استخلاصها دون تحميل المريض أي عبء نفسي أو جسدي. بدلاً من الاعتماد المطلق على استبيانات التقرير الذاتي المعرضة للانحياز المعرفي والرغبة الاجتماعية، توفر الواسمات الصوتية المعتمدة على تقنية التعرف الآلي على الكلام مقاييس كمية مستمرة ومستقرة، تتيح مراقبة الاستجابة للعلاجات النفسية والدوائية بمستويات غير مسبوقة من الحساسية والموثوقية العلمية.

التقييم النفسي العصبي المعزز بنظم التعرف على الكلام

تعتمد الاختبارات النفسية العصبية التقليدية اعتماداً كبيراً على إنتاج الاستجابات اللفظية، مثل اختبارات الطلاقة اللفظية الفونيمية والدلالية، واختبار ستروب اللفظي، واختبارات التعلم اللفظي التكراري (مثل اختبار راي للتعلم السمعي اللفظي RAVLT). كان التطبيق التاريخي لهذه الاختبارات يستلزم وجود فاحص خبير يسجل الإجابات يدوياً ويقيس فترات الاستجابة بواسطة ساعة توقيت، مما يجعل النتائج عرضة للخطأ البشري وللتفاوت في التقدير بين فاحص وآخر.

أتاح دمج أنظمة التعرف الآلي على الكلام أتمتة هذه الاختبارات النفسية العصبية بالكامل وبكفاءة معيارية بالغة الدقة. يستطيع النظام المعزز خوارزمياً قياس زمن الاستجابة (Latency) بدقة الميلي ثانية، وتصنيف الكلمات المنتجة بدقة وفق المجموعات الدلالية المحددة مسبقاً، واكتشاف الأخطاء اللفظية الناتجة عن التكرار والمثابرة المرضية تلقائياً. علاوة على ذلك، يتيح التحليل الحاسوبي للكلام استكشاف إستراتيجيات التجميع الدلالي (Clustering) والتبديل (Switching) التي يوظفها المفحوص، وهي مؤشرات حاسمة تكشف سلامة الوظائف التنفيذية في الفص الجبهي ومرونة التفكير الإدراكي.

يفتح هذا التحول الرقمي في القياس النفسي آفاقاً واسعة للتقييم العصبي النفسي عن بُعد، حيث يستطيع المرضى في المناطق النائية أو كبار السن غير القادرين على زيارة المراكز المتخصصة إجراء اختبارات فحص معرفي موثوقة ومقننة عبر تطبيقات الهواتف الذكية أو الحواسيب اللوحية. يقلل هذا النموذج المؤتمت تكاليف الرعاية الصحية، ويزيل العوائق الجغرافية، ويضمن جمع بيانات نفسية عصبية واسعة النطاق تتسم بأعلى درجات التوحيد الإجرائي المعياري.

التحديات المنهجية والأخلاقية والقيود السيكومترية

على الرغم من الآفاق الواعدة للتعرف الآلي على الكلام في المجال النفسي، إلا أن هناك العديد من التحديات المنهجية الصارمة التي تتطلب تدقيقاً علمياً مستمراً. من أبرز هذه التحديات قضية التباين الصوتي واللساني الناتج عن اللهجات المحلية، واللكنات الإقليمية، والفروق الديموغرافية مثل الجنس والعمر. إن غالبية النماذج اللغوية والصوتية تدربت على عينات كلامية غربية وبلغات قياسية، مما يوقعها في فخ «الانحياز الخوارزمي» ويجعلها أقل دقة عند تطبيقها على لهجات متنوعة أو بيئات ثقافية مغايرة، مما يهدد دقة الصدق القياسي للاختبارات النفسية المعززة بهذه التقنيات.

تشكل «الصلاحية الإيكولوجية» (Ecological Validity) وضوضاء البيئة المحيطة عقبة تقنية ونظرية جوهرية؛ إذ إن النظم الصوتية المصممة في بيئات مخبرية منضبطة قد تنخفض كفاءتها بشكل ملحوظ عند استخدامها في البيئات اليومية المليئة بالضجيج الحياتي، وتداخل الأصوات وتغير المسافات بين المتحدث والميكروفون. هذا التراجع في نسبة الإشارة إلى الضوضاء قد ينتج عنه أخطاء في التعرف على المفردات، أو تشويه في تقدير الترددات الصوتية الدقيقة، مما يؤدي إلى نتائج إكلينيكية مضللة قد تفسر التشويش الصوتي الخارجي كخلل نفسي أو انفعالي في أداء المفحوص.

تتصدر القضايا الأخلاقية وحماية الخصوصية قائمة المخاوف النفسية والمهنية المتعلقة بهذه التقنية، فالكلام يحمل هوية بيومترية شديدة الحساسية تتضمن تفاصيل شخصية وانفعالية للمتكلم. إن استخدام التسجيلات الصوتية في مراقبة الحالة النفسية، خاصة عبر أجهزة المراقبة السلبية، يفرض متطلبات صارمة لضمان «الموافقة المستنيرة» وتشفير البيانات وتأمين تخزينها بما يتماشى مع المعايير الأخلاقية للجمعيات النفسية الدولية. يضاف إلى ذلك خطر إساءة تفسير البيانات من قبل أنظمة الذكاء الاصطناعي دون وجود إشراف سريري بشري مؤهل، ما قد ينتج عنه وصم نفسي غير مبرر للأفراد.

الآفاق المستقبلية: نحو نموذج تكاملي بين الذكاء الاصطناعي والتحليل النفسي

يتجه مستقبل التعرف الآلي على الكلام في علم النفس نحو تطوير «الأنظمة متعددة الوسائط» (Multimodal Systems)، التي لا تعتمد على الصوت ومعالجة اللغة فحسب، بل تدمجها تكاملياً مع تحليل تعبيرات الوجه الحركية الدقيقة، وحركات العين، والقياسات الفسيولوجية التلقائية مثل معدل تقلب نبضات القلب والموصلية الجلدية الكهربائية. يتيح هذا الدمج متعدد الوسائط تكوين صورة شمولية وديناميكية للحالة النفسية والمعرفية للفرد في الوقت الحقيقي، متجاوزاً بذلك القيود الفردية لكل أداة على حدة ومحققاً مستويات غير مسبوقة من الدقة التنبؤية.

كما يشهد قطاع العلاج النفسي الرقمي طفرة في تطوير روبوتات الدردشة التفاعلية والمساعدين الافتراضيين المعززين بنظم متطورة للتعرف على الكلام والتحليل العاطفي اللحظي. تمتلك هذه الأنظمة قدرة متنامية على استشعار نبرات الإحباط واليأس أو الأزمات الحادة أثناء الجلسات العلاجية الافتراضية، وتقديم تدخلات فورية مبنية على تقنيات العلاج السلوكي المعرفي، أو إطلاق تحذيرات عاجلة للأطباء النفسيين المشرفين عند رصد علامات دالة على نوايا إيذاء الذات أو الانتكاس النفسي المفاجئ.

إن الهدف النهائي من هذا التكامل العلمي ليس استبدال المختص النفسي بالآلة الخوارزمية، بل تزويده ببيانات تشخيصية دقيقة ومستمرة ترتكز على براهين قياسية كمية لا يمكن بلوغها بالملاحظة المباشرة وحدها. يمهد هذا المسار الطريق لولادة عصر «الطب النفسي الشخصي والدقيق» (Precision Psychiatry)، حيث تصمم التدخلات العلاجية والخطط التأهيلية بدقة متناهية تتوافق مع السمات اللسانية والصوتية والمعرفية الفريدة لكل مريض، مما يعزز نجاح العملية العلاجية واستدامتها على المدى الطويل.

خاتمة

يعد التعرف الآلي على الكلام نقلة نوعية كبرى في مسار علم النفس المعاصر والقياس النفسي العصبي الرقمي؛ إذ نقل دراسة السلوك التواصلي من الحيز الوصفي الذاتي إلى الحيز القياسي الرقمي عالي الدقة. أتاح هذا التطور استكشاف الواسمات الحيوية الصوتية الكامنة في أدق تفاصيل الصوت الإنساني، مما يوفر أدوات موضوعية تساند التشخيص الإكلينيكي في اضطرابات الاكتئاب والفصام والتدهور المعرفي. ومع تزايد التطور التقني للشبكات العصبية العميقة وتكاملها مع المعطيات البيولوجية الأخرى، يظل الوعي بالضوابط الأخلاقية والانحيازات المنهجية ركيزة أساسية لضمان توظيف هذه التقنية المتقدمة بأقصى درجات النزاهة العلمية والفاعلية الإنسانية في خدمة الصحة النفسية والرفاه البشري.

المراجع

  • American Psychological Association. (2020). Publication manual of the American Psychological Association (7th ed.). American Psychological Association.
  • Cummins, N., Scherer, S., Krajewski, J., Schnieder, S., Epps, J., & Quatieri, T. F. (2015). A review of depression and suicide risk assessment using speech analysis. Speech Communication, 71, 10–49. https://doi.org/10.1016/j.specom.2015.03.004
  • Dehak, N., Campbell, W. M., Martinez, D., & Blumstein, S. E. (2012). Speech and language technologies in clinical applications for psychological and cognitive disorders. IEEE Journal of Selected Topics in Signal Processing, 6(4), 317–331.
  • Eyben, F., Wöllmer, M., & Schuller, B. (2010). Opensmile: The Munich versatile and fast open-source audio feature extractor. In Proceedings of the 18th ACM International Conference on Multimedia (pp. 1459–1462). ACM. https://doi.org/10.1145/1873951.1874246
  • Insel, T. R. (2017). Digital phenotyping: Technology for a new science of behavior. JAMA, 318(13), 1215–1216. https://doi.org/10.1001/jama.2017.11295
  • Jurafsky, D., & Martin, J. H. (2023). Speech and language processing: An introduction to natural language processing, computational linguistics, and speech recognition (3rd ed. draft). Pearson.
  • Low, D. M., Bentley, K. H., & Ghosh, S. S. (2020). Automated assessment of psychiatric disorders using speech: A systematic review. Laryngoscope Investigative Otolaryngology, 5(1), 96–116. https://doi.org/10.1002/lio2.354
  • Mundt, J. C., Vogel, A. P., Feltner, D. E., & Lenderking, W. R. (2012). Vocal acoustic biomarkers of depression severity and treatment response. Biological Psychiatry, 72(7), 580–587. https://doi.org/10.1016/j.biopsych.2012.03.015
  • Torous, J., Kiang, M. V., Lorme, J., & Onnela, J. P. (2016). New tools for new research in psychiatry: A scalable and customizable platform to empower data driven smartphone research. JMIR Mental Health, 3(2), e16. https://doi.org/10.2196/mental.5165

اقتباس هذا المقال

looti, M. (2026, سبتمبر 28). التعرف الآلي على الكلام. عرب سايكلوجي. https://arabpsychology.com/dictionary/automated-speech-recognition-psychology/
looti, Mohammed. “التعرف الآلي على الكلام.” عرب سايكلوجي, 28 سبتمبر 2026, https://arabpsychology.com/dictionary/automated-speech-recognition-psychology/.
looti, Mohammed. “التعرف الآلي على الكلام.” عرب سايكلوجي. سبتمبر 28, 2026. https://arabpsychology.com/dictionary/automated-speech-recognition-psychology/.