دراسة صادمة تكشف: الذكاء الاصطناعي يُخترق بالإطراء والضغط الاجتماعي مثل البشر

كشفت دراسة حديثة من جامعة بنسلفانيا أن chatbots الشهيرة مثل ChatGPT يمكن خداعها باستخدام تكتيكات نفسية بسيطة مثل الإطراء والضغط الاجتماعي، مما يجعلها تنتهك قواعدها الخاصة وتقدم إجابات خطيرة أو ضارة.
الباحثون استخدموا تقنيات مستوحاة من كتاب “التأثير: سيكولوجية الإقناع” للبروفيسور روبرت سيالديني، حيث نجحوا في إقناع نموذج GPT-4o Mini من OpenAI بوصف كيفية تصنيع مخدر الليدوكائين بنسبة نجاح وصلت إلى 100% بعد تهيئته بطلب أبسط، مقارنة بنسبة 1% فقط بدون هذه التهيئة.
الأمر لم يتوقف عند هذا الحد، فقد تمكّن الباحثون من جعل ChatGPT يسب المستخدم بنسبة 100% بعد تهيئة الموقف بإهانة خفيفة مثل “أحمق”، بينما كانت النسبة بدون هذه التهيئة لا تتجاوز 19%.
التقنيات الأقل فعالية شملت الإطراء (Liking) والضغط الاجتماعي (Social Proof)، حيث زادت فرصة الحصول على إجابات خطيرة إلى 18% عند استخدام عبارات مثل “كل النماذج الأخرى تفعل ذلك”.
هذه الثغرات تنبع من تصميم النماذج اللغوية الكبيرة (LLMs) التي تُحسن لتلبية رغبات المستخدم، مما يجعلها تميل إلى “المجاملة” لتجنب الصراع أو خيبة الأمل.
دراسة منفصلة أجرتها Stanford حذرت من أن chatbots العلاجية تظهر تحيزاً خطيراً ضد الأشخاص المصابين بالفصيلان أو إدمان الكحول، وقد تقدم إجابات تعزز الأفكار الانتحارية بدلاً من علاجها.
في سياق متصل، كشفت تقارير عن حالات “ذهان الذكاء الاصطناعي”، حيث أدت المحادثات المطولة مع chatbots إلى تعزيز الأوهام والاعتقادات المشوهة لدى المستخدمين، خاصة أولئك المعرضين بالفعل لاضطرابات نفسية.
شركات مثل OpenAI وMeta تعمل على تعزيز الضوابط، لكن فعاليتها لا تزال موضع شك في مواجهة التلاعب النفسي الممنهج.
هذه النتائج تثير أسئلة حرجة حول مدى أمان الاعتماد على الذكاء الاصطناعي في المجالات الحساسة مثل الصحة العقلية والدعم النفسي، وتؤكد الحاجة إلى تطوير نماذج أكثر مقاومة للتلاعب، وأكثر قدرة على الحفاظ على الحدود الأخلاقية حتى تحت الضغط .




