نموذج Qwen 3.8 Flash Next يعيد تصميم نماذج المحولات بفصل سعة النموذج عن ذاكرة المسرع باستخدام ثلاث ركائز مبتكرة.
Key Takeaways
- فصل سعة النموذج عن ذاكرة المسرع يحسن الأداء ويقلل استهلاك الذاكرة.
- تقنية DeltaNet المبوّبة تقلل نمو ذاكرة المفتاح والقيمة بنسبة 75%.
- الإيقاع الهجين 3:1 بين DeltaNet والتركيز المتباعد يسرع الاستنتاج بشكل كبير.
- جدول N-gram ضخم يسمح بتوسيع السعة دون زيادة العمليات الحسابية المعقدة.
- النموذج يحافظ على دقة استرجاع المعلومات مع تحسينات كبيرة في السرعة والذاكرة.
What the video covers
- يقدم Qwen 3.8 Flash Next تصميمًا جديدًا يفصل بين سعة النموذج الإجمالية وذاكرة المسرع الفعلية.
- يستخدم النموذج ثلاث ركائز: تركيز هجين 3:1، جدول N-gram بحجم 51 مليار معامل، وطريق سريع رباعي الاتجاهات يعمل بـ FP8.
- يوفر النظام سعة افتراضية تصل إلى 177 مليار معامل مع تفعيل 6 مليارات فقط لكل رمز.
- يحل النموذج مشكلة نمو ذاكرة المفتاح والقيمة المؤقتة باستخدام تقنية DeltaNet المبوّبة في 75% من الطبقات.
- DeltaNet يحافظ على مصفوفة حالة متكررة ثابتة الحجم لا تنمو مع طول التسلسل، مما يقلل استهلاك الذاكرة.
- يستخدم Qwen إيقاع طبقات بنسبة 3:1 بين طبقات DeltaNet وطبقات التركيز المتباعد لتحسين الأداء.
- التركيز المتباعد يقسم السياق إلى كتل صغيرة ويسترجع فقط الكتل الأكثر صلة أثناء فك التشفير.
- يوفر هذا الإيقاع تسريعًا يفوق 10 أضعاف في الأداء وتسريع فك التشفير 6 أضعاف مع الحفاظ على الدقة.
- يحتوي النموذج على جدول تضمين N-gram ضخم بـ 51 مليار معامل وأكثر من 20 مليون مدخل لتوسيع السعة دون تعقيد رياضي.
- النموذج يعالج تحديات الذاكرة والتعقيد الحسابي في نماذج المحولات التقليدية بشكل فعال.
Chapters
- 00:00مقدمة وتصميم نموذج Qwen 3.8 Flash Next
- 00:17تقسيم الاستنتاج إلى ثلاث ركائز
- 00:32تفاصيل الركائز الثلاث للنموذج
- 01:07تحليل الرياضيات والآليات الداخلية
- 01:23مشكلة نمو ذاكرة المفتاح والقيمة في المحولات التقليدية
- 02:15حل DeltaNet وتقليل نمو الذاكرة
- 03:27الإيقاع الهجين بين طبقات DeltaNet والتركيز
- 04:17تفاصيل التركيز المتباعد وتسريع الاستنتاج
- 04:46توسيع سعة النموذج باستخدام جدول N-gram
Full Transcript — Download SRT & Markdown
Speaker A
يقدم نموذج Qwen 3.8 Flash Next تحولاً جذرياً في تصميم النماذج المتطورة، حيث يفصل بين سعة النموذج الإجمالية وذاكرة المسرع الفعلية.
Speaker A
بدلاً من حشر كل معامل في ذاكرة فيديو GPU المحدودة، تقوم البنية بتقسيم الاستنتاج إلى ثلاث ركائز متميزة.
Speaker A
عمود فقري هجين للتركيز بنسبة ثلاثة إلى واحد يوقف نمو ذاكرة المفتاح والقيمة المؤقتة، وجدول N-gram حتمي بـ 51 مليار معامل في ذاكرة النظام المضيف، وطريق سريع متبقي رباعي الاتجاهات يعمل بـ FP8 الأصلي.
Speaker A
تعمل هذه الأنظمة معاً لتوفير سعة افتراضية تبلغ 177 مليار معامل، بينما تقوم بتفعيل 6 مليارات معامل فقط لكل رمز.
Speaker A
دعونا نحلل الرياضيات والآليات الدقيقة التي تعمل تحت غطاء هذا النموذج.
Speaker A
في تقديم نماذج المحولات التقليدية، يؤدي توسيع طول السياق إلى جدار ذاكرة غير مستدام.
Speaker A
بالنسبة للتركيز القياسي متعدد الرؤوس، يجب الاحتفاظ بـ "تنسورات" المفتاح والقيمة لكل رمز تاريخي.
Speaker A
عند مستوى مليون رمز، تتجاوز ذاكرة المفتاح والقيمة المؤقتة 120 جيجابايت، مما يستنزف ذاكرة GPU قبل الوصول إلى تشبع الحوسبة.
Speaker A
يحل نموذج Qwen هذه المشكلة في 75% من طبقاته باستخدام تقنية DeltaNet المبوّبة.
Speaker A
بدلاً من الاحتفاظ بتاريخ خطي للرموز، يحافظ DeltaNet على مصفوفة حالة متكررة مدمجة وثابتة الحجم.
Speaker A
مع وصول الرموز الجديدة، تقوم قاعدة تحديث دلتا بالكتابة فوق الحالة وتنقيتها بشكل مستمر وفي مكانها.
Speaker A
ولأن مصفوفة الحالة لا تنمو أبداً مع طول التسلسل، يتم إلغاء نمو ذاكرة المفتاح والقيمة تماماً في ثلاث من كل أربع طبقات.
Speaker A
تتفوق الحالات المتكررة البحتة في تتبع الأنماط المستمرة، لكن استنتاج الوكيل المعقد لا يزال يتطلب استرجاعاً دقيقاً عبر مئات الآلاف من الرموز.
Speaker A
لتوفير ذلك دون إعادة تكاليف الذاكرة التربيعية، يضع Qwen إيقاع طبقات صارماً بنسبة ثلاثة إلى واحد.
Speaker A
ثلاث طبقات DeltaNet مبوّبة تليها طبقة تركيز متباعدة واحدة من Qwen.
Speaker A
لا يركز التركيز المتباعد على الرموز الفردية عبر تسلسل المليون رمز.
Speaker A
بدلاً من ذلك، يقوم بتقسيم السياق إلى كتل صغيرة بحجم 64 رمزاً ويبني فهرس متجه خفيف الوزن.
Speaker A
أثناء فك التشفير، يتم استرجاع الكتل الأكثر صلة فقط ديناميكياً والتركيز عليها، بينما يتم تجاوز البقية.
Speaker A
يوفر هذا الإيقاع التبادلي الهجين تسريعاً أولياً يفوق عشرة أضعاف وتسريعاً لفك التشفير بستة أضعاف، مع الحفاظ على دقة استرجاع المعلومة المطلوبة.
Speaker A
الاختراق الثاني هو كيفية توسيع Qwen لسعة النموذج دون إضافة عمليات ضرب مصفوفات معقدة.
Speaker A
يحتوي النموذج على جدول تضمين N-gram بـ 51 مليار معامل يضم أكثر من 20 مليون مدخل.
Topics:Qwen 3.8Flash Nextنماذج المحولاتDeltaNetتركيز هجينN-gramFP8ذاكرة GPUتسريع الاستنتاجتعلم الآلة











