نموذج “o3” من OpenAI يحقق نتائج أقل من المتوقع في اختبارات مستقلة

كشفت نتائج اختبارات مستقلة أجرتها مؤسسة Epoch AI أن نموذج الذكاء الاصطناعي “o3” من OpenAI قد حقق أداءً أقل مما أشارت إليه الشركة سابقًا.
ففي حين أعلنت OpenAI عند إطلاق النموذج في ديسمبر 2024 أنه تمكن من حل أكثر من 25% من أسئلة اختبار FrontierMath، أظهرت اختبارات Epoch AI أن النموذج تمكن فقط من حل حوالي 10% من الأسئلة.
تُعزى هذه الفجوة في النتائج إلى عدة عوامل محتملة، منها استخدام OpenAI لإعدادات حوسبة عالية أثناء الاختبارات الداخلية، أو اختلاف مجموعات الأسئلة المستخدمة في التقييم.
كما أشارت مؤسسة ARC Prize Foundation إلى أن النسخة العامة من النموذج “o3” تختلف عن النسخة التي تم اختبارها مسبقًا، حيث تم تعديلها لتناسب الاستخدامات العملية وتقديم أداء أسرع، مما قد يؤثر على نتائج الاختبارات.
يُذكر أن نموذج “o3” يعتمد على تقنية “الحوسبة أثناء الاختبار” (test-time compute)، التي تسمح له باستكشاف عدة احتمالات قبل تقديم الإجابة النهائية، مما يُحسن من دقته ولكن يزيد من تكلفة التشغيل.
ففي بعض الحالات، قد تتجاوز تكلفة معالجة مهمة واحدة باستخدام هذا النموذج 1000 دولار، مما يثير تساؤلات حول جدوى استخدامه في التطبيقات اليومية.
تأتي هذه النتائج في وقت تتزايد فيه التحديات أمام نماذج الذكاء الاصطناعي في فهم اللغة البشرية بشكل عميق.
فقد أظهرت دراسة حديثة أن نموذج “o3” يفشل في تعميم قواعد البنية اللغوية الأساسية، مما يشير إلى وجود حدود لقدرات هذه النماذج في محاكاة التفكير البشري المعقد.
على الرغم من هذه التحديات، تواصل OpenAI تطوير نماذجها، حيث أطلقت مؤخرًا النموذج المصغر “o4-mini”، الذي يُعد نسخة محسّنة من “o3-mini”، بهدف تقديم أداء أفضل بتكلفة أقل.









