السيطرة على النبرة والمشاعر والسرعة من خلال التعليمات باللغة الطبيعية فقط... وتنفيذ الأوامر المعقدة
تحسين سرعة التوليد باستخدام معالج صوتي ذاتي التطوير
طورت شركة كاكاو تقنية توليد الصوت في نموذج الذكاء الاصطناعي الشامل 'كانانا-أو' (Kanana-o) من تطويرها الذاتي. تجاوزت التطورات مستوى مجرد قراءة طبيعية تشبه الإنسان، حيث تم تحسين الأداء ليتمكن المستخدمون من السيطرة على النبرة والمشاعر والسرعة وشدة الصوت وفقاً للتعليمات باللغة الطبيعية.
كشفت كاكاو في الرابع من أغسطس/آب عن تقنية توليد الصوت في نموذج 'كانانا-أو' من خلال مدونتها التقنية. يتمثل أبرز مميزات النموذج الجديد في قدرته على توليد الصوت بعد استقبال تعليمات طبيعية من المستخدم حول طريقة النطق المطلوبة.
على سبيل المثال، يمكن للنموذج فهم تعليمات مثل "اقرأ بسرعة كبيرة جداً"، و"اقرأ بصوت منخفض"، و"اقرأ بصوت حزين"، و"اقرأ باللهجة الاقتصادية" والانعكاس عليها من خلال السيطرة على السرعة وشدة الصوت والتردد إلى جانب المشاعر والتنغيم. كما يمكنه تنفيذ تعليمات قائمة على الأدوار مثل "كما لو كنت تغطي حدثاً رياضياً"، و"مثل المذيع"، و"كما لو كنت تقرأ كتاب قصص أطفال". ويستطيع معالجة أوامر معقدة تتضمن شروطاً متعددة في آنٍ واحد، مثل "اخفض النبرة واقرأ بسرعة وبصوت حزين". وعلى الرغم من أن النموذج تم تدريبه بشكل أساسي على اللغة الكورية، فإنه قادر على تنفيذ نفس التعليمات الصوتية في توليد النصوص باللغة الإنجليزية.
تحسنت الأداء أيضاً. حقق نموذج 'كانانا-أو' درجة 94.50 في معيار اللغة الكورية 'InstructTTSEval' المخصص لتقييم قدرة تنفيذ التعليمات الصوتية، متفوقاً على نموذج 'جي بي تي-فور أو-ميني' (91.10 نقطة).
تحسنت سرعة وكفاءة توليد الصوت أيضاً. طبقت كاكاو معالج الصوت 'إل إم-إس بي تي' من تطويرها الذاتي. تعمل هذه التقنية على ضغط الصوت والتعبير عنه بعدد قليل من الرموز، مما يقلل من حجم البيانات التي يجب أن يعالجها الذكاء الاصطناعي ويرفع سرعة توليد الصوت.
حقق معالج 'إل إم-إس بي تي' أداءً متفوقاً في التقييمات التي قارنت بين نماذج لغوية صوتية متنوعة في مجالات فهم وتوليد الصوت باللغتين الكورية والإنجليزية.
* تمت ترجمة هذا المقال تلقائيًا بواسطة الذكاء الاصطناعي.
