ذكاء اصطناعي متطور، علي بابا تطلق Qwen3.5-Omni بقدرات تفاعلية تشبه البشر
أعلنت شركة علي بابا إطلاق النسخة الجديدة من نموذجها متعدد الوسائط Qwen3.5-Omni، وتأتي في ثلاثة إصدارات: Plus وFlash وLight، وتدعم جميعها معالجة سياق طويل يصل إلى 256 ألف رمز (Tokens).
علي بابا تطلق نموذجها Qwen3.5-Omni
يمتاز Qwen3.5-Omni بقدرته على التعامل مع أكثر من 10 ساعات من مدخلات الصوت، وأكثر من 400 ثانية من مدخلات الفيديو بدقة 720P بمعدل إطار واحد في الثانية.
وقد تم تدريب النموذج على كميات هائلة من النصوص والبيانات البصرية، بالإضافة إلى أكثر من 100 مليون ساعة من بيانات الصوت والفيديو متعددة الوسائط، مما يعزز قدراته الاستيعابية والإبداعية عبر جميع الوسائط.
شهدت النسخة الجديدة تحسينًا ملحوظًا في الدعم متعدد اللغات مقارنة بسابقه Qwen3-Omni، حيث يدعم النموذج التعرف على الكلام بـ113 لغة ولهجة، وتوليد الصوت بـ36 لغة ولهجة، مما يعزز تجربة المستخدمين حول العالم.
تفاعلية تشبه المحادثات البشرية
أبرزت الشركة تحسينات كبيرة في قدرات التفاعل، حيث يدعم Qwen3.5-Omni ميزات مثل المقاطعة الدلالية، استنساخ الصوت، والتحكم الصوتي الكامل، لتقديم تجربة حوارية أكثر واقعية.
كما أسهمت تقنية ARIA في تحسين استقرار ونقاء الصوت عند التفاعل الصوتي المباشر، ما يجعل التجربة أكثر طبيعية.
كما حقق Qwen3.5-Omni-Plus نتائج SOTA في 215 مهمة ومعيارًا لتقييم الفهم والتفاعل الصوتي والسمعي-البصري، متفوقًا على نموذج Gemini-3.1 Pro في مهام الفهم العام للصوت، والترجمة، والحوار، بينما يوازيه في فهم الفيديو والصوت معًا.
وتتيح إمكانيات التوليد الصوتي والسمعي البصري إنتاج تسميات تفصيلية منظمة، ووصف المشاهد بدقة، مع تقسيم تلقائي للوقت وتوضيح علاقة الشخصيات بالصوت والمشهد، بما في ذلك قدرة جديدة على البرمجة استنادًا إلى تعليمات صوتية-مرئية تُعرف باسم Audio-Visual Vibe Coding.
واجهات برمجية متاحة للمطورين
يتوفر النموذج الآن عبر واجهة برمجة التطبيقات Offline API وRealtime API، حيث يمكن للمطورين الاستفادة من جميع ميزات التفاعل الفوري مثل البحث على الويب، الاستدعاءات المعقدة للوظائف، التحكم بالصوت، وتعديل أسلوب الحوار وفق تعليمات النظام.
يشجع فريق Qwen المستخدمين على تجربة قسم العروض التوضيحية Demo Section لاستكشاف القدرات الجديدة للنموذج بشكل عملي ومباشر.




