موتيف 3 يسجل 47 نقطة.. ويدخل قائمة أفضل 10 نماذج عالمية
أُعلن عن نتائج المعايير القياسية العالمية لنماذج الذكاء الاصطناعي المحلية، مع اقتراب انتهاء تقييم المرحلة الثانية من مشروع 'نموذج الذكاء الاصطناعي الأساسي المستقل' (المشار إليه اختصاراً بـ'الذكاء الاصطناعي المستقل') الذي تدفع به وزارة العلوم والتكنولوجيا وتكنولوجيا المعلومات والاتصالات. وتركزت الأنظار بشكل خاص على نتائج المرحلة الثانية من التقييم، لا سيما مع تحقيق 'موتيف 3' من شركة موتيف تكنولوجيز (موتيف)، التي انضمت إلى المشروع عبر استدعاء إضافي للمقترحات، أعلى درجة بين النماذج المحلية.
وفقاً لمنصة تحليل نماذج الذكاء الاصطناعي العالمية 'أرتيفيشيال أناليسيس' (AA) و'مؤشر الذكاء' (AAII) الذي نُشر في 13 من الشهر الجاري، حققت 'موتيف 3' من موتيف 47 نقطة. وتعتبر هذه الدرجة الأعلى عالمياً بين نماذج اللغات الكبيرة (LLM) المسجلة في AAII، مما يضعها ضمن أفضل 10 نماذج عالمية، وتمثل أعلى مرتبة حققتها شركة محلية في هذا التصنيف.
وسجلت نماذج المشاركين الآخرين درجات أقل. حققت 'سولا أوبن 2' من أبستيج 37 نقطة، و'A.X K2' من إسكاي تيليكوم (SKT) 35 نقطة، و'K-إكسا وان 2.0' من معهد LG لأبحاث الذكاء الاصطناعي 31 نقطة. وعند مقارنة درجات AAII الخاصة بالنماذج الأربعة المشاركة في المشروع فقط، يبلغ الفارق بين أعلى وأدنى درجة 16 نقطة.
تُعتبر منصة AA منصة متخصصة في تحليل شامل لأداء نماذج الذكاء الاصطناعي وجودتها وتكاليفها. وتوفر المنصة، بالإضافة إلى أداء النموذج، مؤشرات فعلية تُؤخذ في الاعتبار أثناء عملية اعتماد الخدمة، مثل السعر وسرعة الإنتاج والتأخير الزمني وحجم نافذة السياق وغيرها.
على وجه التحديد، يجمع مؤشر AAII بين نتائج المعايير القياسية في عدة مجالات مثل الرياضيات والعلوم والبرمجة لتقييم القدرات الشاملة لنموذج الذكاء الاصطناعي. وتكمن خصوصية هذا المؤشر في أنه يجمع بين نتائج تقييمات متعددة وليس معيار واحد فقط. غير أن المؤشر لا يتضمن معياراً منفصلاً لتقييم القدرات اللغوية الكورية، مما يحد من قدرته على عكس أداء النموذج بشكل شامل في بيئة الاستخدام المحلية.
ومن الملاحظات الجديرة بالاهتمام أن حجم النموذج ودرجات AAII لم تكونا متناسبة تماماً. من بين النماذج المشاركة في تقييم المرحلة الثانية من المشروع، يُعتبر 'K-إكسا وان 2.0' من معهد LG لأبحاث الذكاء الاصطناعي أكبر نموذج من حيث الحجم، حيث تم تطويره بسعة إجمالية تبلغ 750 مليار (7500 بليون) معامل.
وجاء 'A.X K2' من إسكاي تيليكوم في المرتبة الثانية بـ 688 بليون معامل. بينما 'موتيف 3'، الذي حقق أعلى درجة في AAII، لم يتجاوز حجمه 314 بليون معامل. وتألفت 'سولا أوبن 2' من أبستيج من 250 بليون معامل.
إلا أن درجات AAII قد لا تنعكس بشكل مباشر على نتائج تقييم المرحلة الثانية من المشروع. إذ يتألف التقييم من المعايير القياسية (40 نقطة) والتقييم من قبل الخبراء (35 نقطة) وتقييم المستخدمين (25 نقطة). وتجدر الإشارة إلى أنه في هذا التقييم، قامت لجنة تقييم وطنية تألفت من 200 مواطن عادي بتجربة النماذج الأربعة مباشرة وتقييم أدائها.
لا تزال الفجوة مع نماذج الذكاء الاصطناعي الرائدة عالمياً كبيرة. حققت 'كلود أوبوس 5' من أنثروبيك 63 نقطة في AAII، أي 16 نقطة أعلى من موتيف 3. وسجلت 'جي بي تي 5.6 سول' من أوبن إيه آي و'جروك 4.6' من إكس إيه آي 61 نقطة لكل منهما.
كما يتضح الزحف الملحوظ للنماذج الصينية. حققت 'كيمي K3' من وينشوت إيه آي 60 نقطة، أي فارق بسيط جداً يبلغ نقطة واحدة فقط عن جي بي تي 5.6 سول. وسجلت 'كيوان 3.8 ماكس' من علي بابا 58 نقطة، و'جي إل إم 5.2' من زي إيه آي 53 نقطة، والإصدار الأحدث من 'V4 فلاش' من ديب سيك 52 نقطة. وبالمقارنة مع موتيف 3 الذي يحمل أعلى درجة بين النماذج المحلية، فإن هذه النماذج الصينية تتفوق بفارق يتراوح بين 5 و13 نقطة.
من المتوقع أن تُعلن وزارة العلوم والتكنولوجيا وتكنولوجيا المعلومات والاتصالات قريباً عن نتائج تقييم المرحلة الثانية من مشروع الذكاء الاصطناعي المستقل. وستؤهل نتائج هذا التقييم 3 فرق من أصل 4 فرق نخبة حالياً مشاركة للمرحلة اللاحقة.
* تمت ترجمة هذا المقال تلقائيًا بواسطة الذكاء الاصطناعي.
