Skip to content

Qwen 3.8 Flash Next: Three Pillars (3:1 Attention + 51B N-gram Table + 4-way FP8 Bus)

نموذج Qwen 3.8 Flash Next يعيد تصميم نماذج المحولات بفصل سعة النموذج عن ذاكرة المسرع باستخدام ثلاث ركائز مبتكرة.

Key Takeaways

  • فصل سعة النموذج عن ذاكرة المسرع يحسن الأداء ويقلل استهلاك الذاكرة.
  • تقنية DeltaNet المبوّبة تقلل نمو ذاكرة المفتاح والقيمة بنسبة 75%.
  • الإيقاع الهجين 3:1 بين DeltaNet والتركيز المتباعد يسرع الاستنتاج بشكل كبير.
  • جدول N-gram ضخم يسمح بتوسيع السعة دون زيادة العمليات الحسابية المعقدة.
  • النموذج يحافظ على دقة استرجاع المعلومات مع تحسينات كبيرة في السرعة والذاكرة.

What the video covers

  • يقدم Qwen 3.8 Flash Next تصميمًا جديدًا يفصل بين سعة النموذج الإجمالية وذاكرة المسرع الفعلية.
  • يستخدم النموذج ثلاث ركائز: تركيز هجين 3:1، جدول N-gram بحجم 51 مليار معامل، وطريق سريع رباعي الاتجاهات يعمل بـ FP8.
  • يوفر النظام سعة افتراضية تصل إلى 177 مليار معامل مع تفعيل 6 مليارات فقط لكل رمز.
  • يحل النموذج مشكلة نمو ذاكرة المفتاح والقيمة المؤقتة باستخدام تقنية DeltaNet المبوّبة في 75% من الطبقات.
  • DeltaNet يحافظ على مصفوفة حالة متكررة ثابتة الحجم لا تنمو مع طول التسلسل، مما يقلل استهلاك الذاكرة.
  • يستخدم Qwen إيقاع طبقات بنسبة 3:1 بين طبقات DeltaNet وطبقات التركيز المتباعد لتحسين الأداء.
  • التركيز المتباعد يقسم السياق إلى كتل صغيرة ويسترجع فقط الكتل الأكثر صلة أثناء فك التشفير.
  • يوفر هذا الإيقاع تسريعًا يفوق 10 أضعاف في الأداء وتسريع فك التشفير 6 أضعاف مع الحفاظ على الدقة.
  • يحتوي النموذج على جدول تضمين N-gram ضخم بـ 51 مليار معامل وأكثر من 20 مليون مدخل لتوسيع السعة دون تعقيد رياضي.
  • النموذج يعالج تحديات الذاكرة والتعقيد الحسابي في نماذج المحولات التقليدية بشكل فعال.

Answers

Questions about this video

كيف يحل نموذج Qwen 3.8 مشكلة نمو ذاكرة المفتاح والقيمة في نماذج المحولات؟

يستخدم Qwen تقنية DeltaNet المبوّبة التي تحافظ على مصفوفة حالة متكررة ثابتة الحجم لا تنمو مع طول التسلسل، مما يلغي نمو ذاكرة المفتاح والقيمة في 75% من الطبقات.

ما هي الركائز الثلاث التي يعتمد عليها نموذج Qwen 3.8 Flash Next؟

يعتمد النموذج على تركيز هجين بنسبة 3:1، جدول N-gram حتمي بحجم 51 مليار معامل في ذاكرة النظام المضيف، وطريق سريع رباعي الاتجاهات يعمل بدقة FP8.

كيف يسرع Qwen 3.8 عملية الاستنتاج وفك التشفير؟

يستخدم إيقاع طبقات صارم بين DeltaNet والتركيز المتباعد، حيث يتم تقسيم السياق إلى كتل صغيرة واسترجاع الكتل الأكثر صلة فقط، مما يوفر تسريعًا يفوق 10 أضعاف في الاستنتاج و6 أضعاف في فك التشفير.

Full Transcript — Download SRT & Markdown

00:00
Speaker A
يقدم نموذج Qwen 3.8 Flash Next تحولاً جذرياً في تصميم النماذج المتطورة، حيث يفصل بين سعة النموذج الإجمالية وذاكرة المسرع الفعلية.
00:17
Speaker A
بدلاً من حشر كل معامل في ذاكرة فيديو GPU المحدودة، تقوم البنية بتقسيم الاستنتاج إلى ثلاث ركائز متميزة.
00:32
Speaker A
عمود فقري هجين للتركيز بنسبة ثلاثة إلى واحد يوقف نمو ذاكرة المفتاح والقيمة المؤقتة، وجدول N-gram حتمي بـ 51 مليار معامل في ذاكرة النظام المضيف، وطريق سريع متبقي رباعي الاتجاهات يعمل بـ FP8 الأصلي.
00:50
Speaker A
تعمل هذه الأنظمة معاً لتوفير سعة افتراضية تبلغ 177 مليار معامل، بينما تقوم بتفعيل 6 مليارات معامل فقط لكل رمز.
01:07
Speaker A
دعونا نحلل الرياضيات والآليات الدقيقة التي تعمل تحت غطاء هذا النموذج.
01:23
Speaker A
في تقديم نماذج المحولات التقليدية، يؤدي توسيع طول السياق إلى جدار ذاكرة غير مستدام.
01:40
Speaker A
بالنسبة للتركيز القياسي متعدد الرؤوس، يجب الاحتفاظ بـ "تنسورات" المفتاح والقيمة لكل رمز تاريخي.
01:58
Speaker A
عند مستوى مليون رمز، تتجاوز ذاكرة المفتاح والقيمة المؤقتة 120 جيجابايت، مما يستنزف ذاكرة GPU قبل الوصول إلى تشبع الحوسبة.
02:15
Speaker A
يحل نموذج Qwen هذه المشكلة في 75% من طبقاته باستخدام تقنية DeltaNet المبوّبة.
02:33
Speaker A
بدلاً من الاحتفاظ بتاريخ خطي للرموز، يحافظ DeltaNet على مصفوفة حالة متكررة مدمجة وثابتة الحجم.
02:50
Speaker A
مع وصول الرموز الجديدة، تقوم قاعدة تحديث دلتا بالكتابة فوق الحالة وتنقيتها بشكل مستمر وفي مكانها.
02:58
Speaker A
ولأن مصفوفة الحالة لا تنمو أبداً مع طول التسلسل، يتم إلغاء نمو ذاكرة المفتاح والقيمة تماماً في ثلاث من كل أربع طبقات.
03:05
Speaker A
تتفوق الحالات المتكررة البحتة في تتبع الأنماط المستمرة، لكن استنتاج الوكيل المعقد لا يزال يتطلب استرجاعاً دقيقاً عبر مئات الآلاف من الرموز.
03:27
Speaker A
لتوفير ذلك دون إعادة تكاليف الذاكرة التربيعية، يضع Qwen إيقاع طبقات صارماً بنسبة ثلاثة إلى واحد.
03:44
Speaker A
ثلاث طبقات DeltaNet مبوّبة تليها طبقة تركيز متباعدة واحدة من Qwen.
04:01
Speaker A
لا يركز التركيز المتباعد على الرموز الفردية عبر تسلسل المليون رمز.
04:17
Speaker A
بدلاً من ذلك، يقوم بتقسيم السياق إلى كتل صغيرة بحجم 64 رمزاً ويبني فهرس متجه خفيف الوزن.
04:26
Speaker A
أثناء فك التشفير، يتم استرجاع الكتل الأكثر صلة فقط ديناميكياً والتركيز عليها، بينما يتم تجاوز البقية.
04:38
Speaker A
يوفر هذا الإيقاع التبادلي الهجين تسريعاً أولياً يفوق عشرة أضعاف وتسريعاً لفك التشفير بستة أضعاف، مع الحفاظ على دقة استرجاع المعلومة المطلوبة.
04:46
Speaker A
الاختراق الثاني هو كيفية توسيع Qwen لسعة النموذج دون إضافة عمليات ضرب مصفوفات معقدة.
05:05
Speaker A
يحتوي النموذج على جدول تضمين N-gram بـ 51 مليار معامل يضم أكثر من 20 مليون مدخل.
Topics:Qwen 3.8Flash Nextنماذج المحولاتDeltaNetتركيز هجينN-gramFP8ذاكرة GPUتسريع الاستنتاجتعلم الآلة

Get More with the SozAI App

Transcribe recordings, audio files, and YouTube videos — with AI summaries, speaker detection, and unlimited transcriptions.

Or transcribe another YouTube video here →