نموذج الذكاء الاصطناعي الأحدث من Meta يتراجع بنتائج مخيبة الآمال

في تطور مثير أثار جدلًا واسعًا في أوساط التقنية، تبيّن أن نموذج الذكاء الاصطناعي الجديد الذي أطلقته شركة Meta تحت اسم Llama-4-Maverick، قد جاء أداؤه دون المتوقع، متراجعًا إلى مراكز متأخرة في أحد أبرز اختبارات النماذج الحوارية.
وبحسب ما كشفه موقع TechCrunch، فإن Meta كانت قد قدمت في البداية نسخة تجريبية خاصة من النموذج، غير متاحة للعامة، إلى منصة LM Arena، وهي منصة شهيرة تعتمد على تقييمات بشرية لمقارنة استجابات نماذج الذكاء الاصطناعي في المحادثات.
هذه النسخة المعدّلة، والمصمّمة خصيصًا لتعزيز الأداء في المهام الحوارية، استطاعت التفوق مؤقتًا على نماذج متقدمة مثل GPT-4o من OpenAI وClaude 3.5 Sonnet من Anthropic، واحتلت مراكز متقدمة.
غير أن المفاجأة كانت عندما اكتشف القائمون على المنصة أن النسخة التي اختبرتها Meta لا تطابق النسخة العامة المتاحة للمطورين والباحثين.
وعلى إثر ذلك، قامت LM Arena بتحديث سياساتها لضمان الشفافية والنزاهة في المستقبل، والتأكد من أن النماذج المشاركة في التقييمات متاحة للجمهور بالفعل.
وعندما خضعت النسخة العامة من نموذج Meta، المعروفة باسم Llama-4-Maverick-17B-128E-Instruct، للاختبار، جاءت نتائجها مخيبة للآمال، إذ حلّت في المرتبة 32، متأخرة عن العديد من النماذج التي تم طرحها قبلها بفترة.
شركة Meta بررت ما حدث بكون النموذج التجريبي كان معدًا لتحسين الأداء التفاعلي تحديدًا بما يتوافق مع معايير LM Arena، مؤكدة أن تطوير نسخ مختلفة واختبارها ممارسة شائعة في صناعة الذكاء الاصطناعي، كما شجعت المطورين على تخصيص النماذج بما يلائم استخداماتهم الخاصة.
هذا الحدث يعيد تسليط الضوء على معضلة القياس في سباق الذكاء الاصطناعي، ويطرح تساؤلات ملحة حول معايير النزاهة والشفافية في تقييم النماذج المتقدمة، وسط منافسة شرسة تسعى فيها الشركات الكبرى إلى إثبات تفوقها التقني بأي وسيلة.




