أطلق فريق Qwen التابع لشركة Alibaba نموذجه الجديد Qwen3.8-LiveTranslate المخصص للترجمة الفورية المتزامنة، وهو نموذج يستمع إلى الكلام الحي مع إمكانية إدخال إطارات فيديو اختيارية، ثم يعيد نصًا وصوتًا مترجمًا بينما لا يزال المتحدث يتكلم.
وبحسب تقرير نشره موقع MarkTechPost، يعتمد النموذج على بنية جديدة تحمل اسم Interleave خفضت متوسط زمن التأخير من 2.8 ثانية إلى 2.3 ثانية أي بانخفاض يقارب 18%، مع تحسينات في الأمانة والسلاسة والإيجاز، وهو متاح حاليًا عبر واجهة برمجية مستضافة على منصتي Alibaba Cloud Model Studio وQwenCloud.
تمييز المتحدثين وعرض ثنائي اللغة
يضيف النموذج 3 قدرات جديدة أبرزها تمييز المتحدثين في الوقت الفعلي داخل المحادثات متعددة الأطراف مع الحفاظ على صوت كل متحدث عبر استنساخ صوتي أكثر ثباتًا، إلى جانب عرض متزامن ثنائي اللغة يظهر فيه النص الأصلي والترجمة معًا، وقدرة على إزالة الالتباس في السياقات الطويلة بحيث يظل الاسم الذي ورد في بداية الاجتماع متسقًا في بقية الترجمة.
اللغات والتكلفة
يفهم النموذج 60 لغة وينطق 29 منها بالصوت والنص معًا بينما تعود اللغات الـ31 الباقية بنص فقط، ويشمل الإخراج الصوتي العربية والصينية والإنجليزية والألمانية والفرنسية والإسبانية واليابانية والكورية والهندية وغيرها، وتبدأ الأسعار المعلنة في سنغافورة من 7.5 دولارات لكل مليون رمز صوتي مدخل و30 دولارًا لكل مليون رمز صوتي مخرج، أي ما يعادل نحو 1.54 دولار لساعة كاملة من الكلام دخولًا وخروجًا.














0 تعليق