Source: https://sozai.app/transcript/youtube-video-transcript-433/

مقدمة شاملة لمقرر CME 295 حول المحولات ونماذج اللغة الكبيرة، تغطي الخلفية، المحتوى، والجمهور المستهدف ومتطلبات الدورة.

## Key Takeaways

- المقرر يشرح بعمق كيفية عمل نماذج اللغة الكبيرة والمحولات.
- الدورة مناسبة لمجموعة واسعة من المتعلمين من مختلف الخلفيات.
- تحديثات مستمرة في المحتوى لتواكب التطورات السريعة في المجال.
- لا توجد واجبات منزلية، لكن هناك امتحانان يغطيان محتوى الدورة.
- الموارد التعليمية متاحة ومتنوعة لدعم عملية التعلم.

## What the video covers

- مقدمة عن المقرر CME 295 والمحاضرون، مع ذكر خلفياتهم الأكاديمية والمهنية.
- شرح هدف الدورة وهو فهم عمل نماذج ماجستير القانون (LLMs) والمحولات.
- تحديد الجمهور المستهدف من الباحثين، المطورين، والمهتمين بمجال الذكاء الاصطناعي.
- متطلبات أساسية تشمل الجبر الخطي والتعلم الآلي لفهم المحتوى بشكل أفضل.
- توضيح نظام المحاضرات، التسجيل، الامتحانات، وعدم وجود واجبات منزلية.
- تحديثات حديثة في مجال ما بعد التدريب، تقنيات جديدة، ووكلاء الذكاء الاصطناعي.
- شرح مفصل لبنية المحول وكيفية عمله وتطوره عبر السنوات.
- تغطية موضوعات مثل التمثيل الرمزي، التضمين، والانتباه المعزز.
- توفير موارد تعليمية مثل الكتاب الدراسي، الملخصات، والشرائح مع تعليقات توضيحية.
- تشجيع التواصل مع المحاضرين عبر منصات متعددة وتوفير دعم للغات مختلفة.

## Chapters

1. 00:00 مقدمة وتعريف بالمحاضرين والمقرر
2. 04:17 التحديثات الحديثة في مجال نماذج اللغة
3. 09:54 الأسئلة والردود حول المقرر والامتحانات
4. 14:36 شرح بنية المحول وكيفية عمله
5. 20:03 تمثيل الرموز وتقنيات التضمين
6. 26:15 مناقشة التحديات والقيود في نماذج اللغة
7. 37:42 آلية الانتباه المعزز وتطبيع الطبقات
8. 46:40 تفاصيل إضافية حول التضمين والعمليات الحسابية

Answers

## Questions about this video

هل هذه الدورة مناسبة لمن ليس لديه خلفية قوية في الذكاء الاصطناعي؟

الدورة تتطلب بعض الأساسيات في الجبر الخطي والتعلم الآلي، لكن يتم شرح المفاهيم الأساسية، لذا يمكن للمهتمين التعلم مع بعض الجهد.

هل هناك واجبات منزلية في هذه الدورة؟

لا توجد واجبات منزلية، لكن هناك امتحانان (منتصف الفصل والنهائي) يشكلان 50% من الدرجة النهائية.

كيف يمكن للطلاب التواصل مع المحاضرين وطرح الأسئلة؟

يمكن التواصل عبر المنصة التعليمية Canvas، البريد الإلكتروني، والقائمة البريدية، كما يتواجد المحاضرون بعد كل محاضرة للرد على الأسئلة.

## Full Transcript — Download SRT & Markdown

00:06

Speaker A

أهلاً بكم جميعاً في مقرر CME 295: المحولات ونماذج اللغة الكبيرة. اسمي أفين، وسأقوم بتدريس هذا المقرر مع شيرفين الموجود في الخلف. قبل أن نبدأ، أودّ أن أعرّفكم بأنفسنا قليلاً. أنا وشيرفين توأمان، ولدينا خلفيات متشابهة جداً. درسنا في مدرسة سنترال باري

00:33

Speaker A

في فرنسا، ثم انتقلنا إلى الولايات المتحدة للدراسات العليا. أنا التحقت بمعهد ماساتشوستس للتكنولوجيا (MIT)، بينما التحق شيرفين بجامعة ستانفورد في قسم الحوسبة التفاعلية والنمذجة (ICM). بعد ذلك، انضممنا إلى قطاع التكنولوجيا.

00:50

Speaker A

عملنا أولاً في أوبر، ثم في جوجل، والآن نعمل في نتفليكس. نحن شغوفان ببرامج الماجستير في اللغة.

01:03

Speaker A

نعمل في هذا المجال منذ أوائل العقد الثاني من القرن الحادي والعشرين. وهذا أحد الأسباب التي تجعلنا محظوظين بتدريس هذا المقرر.

01:12

Speaker A

نقوم بتدريسه منذ عام 2021 بصيغ مختلفة. لكن مع ازدياد الاهتمام ببرنامج ماجستير القانون (LLM)، قمنا بتدريسه رسميًا في جامعة ستانفورد منذ العام الماضي. وهذه الدورة هي الثالثة.

01:32

Speaker A

لذا، إذا كنت تتساءل عما إذا كان هذا البرنامج مناسبًا لك، فإن هدفه هو شرح كيفية عمل برامج ماجستير القانون، وفهم الآلية الأساسية لبنيتها.

01:48

Speaker A

سنتعرف على المحوّل، وكيفية تدريب هذه البرامج، وكيفية استخدامها، ونقاط قوتها وضعفها. نأمل أن تتمكن من تكوين فكرة شاملة عن كل ذلك في هذه الدورة. أما بالنسبة للجمهور المستهدف، فهو جمهور واسع جدًا.

02:11

Speaker A

فإذا كنت ترغب في أن تصبح باحثًا علميًا، فسيكون هذا البرنامج مفيدًا جدًا لتوسيع آفاقك في مجال التقنيات والتطبيقات المختلفة. هذا أولًا.

02:29

Speaker A

ثانيًا، إذا كنت ترغب في إنجاز مشروع شخصي. أصبحت برامج الذكاء الاصطناعي منتشرة في كل مكان هذه الأيام، لذا إذا كنت ترغب في استخدام أداة واحدة فقط لإنجاز مهمة ما، فمن الأفضل أن تعرف نقاط قوة وضعف هذه البرامج. ثالثًا، بغض

02:47

Speaker A

النظر عن وظيفتك، هناك حاجة متزايدة إلى الإلمام بمجال الذكاء الاصطناعي. يُطلق على هذا المصطلح "معرفة الذكاء الاصطناعي".

02:57

Speaker A

لذا، بغض النظر عن مكان عملك أو وظيفتك، فإن معرفة كيفية عمل هذه الأدوات أصبحت ذات أهمية متزايدة. إذا كنت تعتقد أنك تنتمي إلى إحدى هذه الفئات، فقد تكون هذه الدورة مناسبة لك. أما بالنسبة للمتطلبات الأساسية، فأقول إنه من الرائع أن يكون

03:17

Speaker A

لديك بعض الأساسيات في الجبر الخطي، وأن تعرف ما هي المصفوفة وكيفية إجراء عمليات الضرب، بالإضافة إلى بعض الأساسيات في التعلم الآلي. على سبيل المثال، ما هي دالة الخسارة؟ ما هي الشبكة العصبية؟ ما هو التضمين؟ على الرغم من أننا سندرس ذلك في

03:35

Speaker A

الدورة، إلا أنه من الجيد أن تكون لديك هذه المعرفة مسبقًا. هل هذا واضح؟ حسنًا، ممتاز. حسنًا، قد تعلمون أو لا تعلمون أن هذه المحاضرة مسجلة. ترون الكاميرا في الخلف. في الواقع، تم تسجيلها العام الماضي.

03:55

Speaker A

قد تتساءلون: ما فائدة حضور المحاضرة إذا كانت مسجلة بالفعل؟ يتطور هذا المجال بسرعة كبيرة، وظهرت العديد من المستجدات منذ العام الماضي. في الواقع، أحد أهداف هذه المحاضرة هو دمج جميع التطورات التي حدثت.

04:17

Speaker A

سأذكر بعضها. لقد كان هناك بعض التقدم في مجال ما بعد التدريب. على سبيل المثال، في تقطير السياسات (إذا كنتم قد سمعتم به)، ووكلاء الذكاء الاصطناعي، ووكلاء البرمجة، وما إلى ذلك، ونماذج جديدة للتعلم الخطي. تقليديًا، كان يتم التنبؤ بالرموز

04:38

Speaker A

واحدًا تلو الآخر، ولكن في الوقت الحاضر، هناك عدد متزايد من النماذج التي تتعامل مع الأمور بشكل مختلف.

04:47

Speaker A

من منظور الانتشار، من بين أمور أخرى. باختصار، إذا كنتَ تحضر هذه المحاضرات وتستعد للامتحانات، يُرجى الاطلاع على محاضرات هذا العام لأنها ستكون مختلفة تمامًا من حيث الترتيبات. يسعدني جدًا رؤية الكثير منكم هنا يوم الجمعة بعد الظهر. ستُعقد المحاضرات كل جمعة من

05:13

Speaker A

الساعة 3:30 إلى 5:20 في هذه القاعة، وهي محاضرة بوحدتين دراسيتين. يمكنك اختيار التسجيل فيها بنظام التقدير الحرفي أو بنظام التقدير غير الحرفي. جميع المحاضرات مسجلة، وسنحرص على نشر التسجيلات في غضون يومين كحد أقصى من تاريخ المحاضرة. يمكنك مشاهدتها عن بُعد أو

05:40

Speaker A

حضور المحاضرة شخصيًا، فنحن نُفضّل حضوركم شخصيًا. لذا، لك حرية الاختيار. لا توجد واجبات منزلية لهذه المحاضرة، ولكن يوجد امتحانان: امتحان منتصف الفصل الدراسي وامتحان نهائي. سيغطي امتحان منتصف الفصل الدراسي المحاضرات الأربع الأولى، وسيكون موعده بعد شهر تقريبًا. نعم، في 23

06:09

Speaker A

أكتوبر، سيكون الامتحان النهائي على المحاضرات الخمس الأخيرة. أي أن هناك تسع محاضرات إجمالاً، وسيشكل الامتحان 50% من الدرجة النهائية. وبما أن هذه ليست المرة الأولى التي نقدم فيها هذه المادة، فقد نشرنا مسبقًا على الإنترنت شكل امتحان منتصف الفصل الدراسي

06:31

Speaker A

والامتحان النهائي. لذا، إذا دخلتم إلى الموقع الإلكتروني، ستجدون في علامة التبويب 2025 ما نتوقعه من هذا الامتحان. إنه عبارة عن أسئلة اختيار من متعدد، بالإضافة إلى بعض الأسئلة المفتوحة. هذا هو نوع الأسئلة التي سنطرحها.

06:49

Speaker A

هل لديكم أي أسئلة حول الترتيبات اللوجستية حتى الآن؟ نعم. سأكرر السؤال لمن يتابعون عن بُعد: هل هناك ساعات مكتبية؟ لا توجد ساعات مكتبية رسمية. مع ذلك، سأبقى أنا وشيرفين بعد كل محاضرة في حال رغبتم في طرح أي أسئلة.

07:15

Speaker A

وسنستعرضها هنا في حال كان لديكم أي أسئلة. سنستعرضها لاحقًا أيضًا. هناك منصة أخرى لطرح الأسئلة، وسأجيب عليها بكل سرور. حسنًا، بالنسبة للمادة، كنت أتحدث عن اختبارات منتصف الفصل الدراسي وما إلى ذلك. جميعها موجودة على الموقع الإلكتروني، بما في

07:42

Speaker A

ذلك اختبارات العام الماضي. يحتوي الموقع أيضًا على المنهج الدراسي، وسيتم نشر التسجيلات هناك. من الأمور التي نقوم بها نشر الشرائح قبل يوم من المحاضرة، لأن بعض الطلاب طلبوا العام الماضي إضافة تعليقات توضيحية عليها. لذلك، أصبحنا ننشرها قبل يوم

08:08

Speaker A

من المحاضرة. يمكنكم الوصول إليها من الموقع. لدينا كتاب دراسي، وهو دليل دراسة شامل لبرامج الماجستير في القانون (LLMs) والمحولات. أعتقد أن المكتبة لديها بعض النسخ، لذا يمكنك استعارتها منها. يمكنك أيضًا الحصول عليها عبر الإنترنت، فلدينا موقع إلكتروني أيضًا.

08:34

Speaker A

بالإضافة إلى ذلك، لدينا ملخص مُحدّث باستمرار. لقد قمنا أنا وشارون بتحديثه قبل أسبوعين فقط، وهو يُغطي المحتوى بالكامل بإيجاز. لذا، قد يكون رفيقًا جيدًا للدراسة قبل كل امتحان. وأعلم أن الكثير منا من جنسيات مختلفة. إذا لم تجد لغتك مُترجمة،

09:07

Speaker A

فلا تتردد في التواصل معنا. يسعدنا التعاون معك. حاليًا، يتوفر الكتاب بـ 15 لغة، بما فيها الإنجليزية. لذا، نتمنى أن نرى المزيد من اللغات. رائع! حسنًا، فيما يتعلق بكيفية تواصلنا، سننشر الإعلانات على منصة Canvas، ويمكنكم أيضًا الوصول إلى ED من

09:31

Speaker A

خلالها. ولكن إذا كانت لديكم أي أسئلة ترغبون في طرحها علينا بشكل خاص، فيمكننا الإجابة عليها عبر القائمة البريدية الموجودة في الشرائح، بالإضافة إلى بريدنا الإلكتروني في جامعة ستانفورد. أعتقد أنني انتهيت من الأمور اللوجستية. هل لديكم أي أسئلة؟ هل الأمر

09:54

Speaker A

مُقلق؟ لأننا لم نتلقَّ سوى سؤال واحد. كنت أتساءل فقط عما إذا كان هناك أي شيء قد يُثير قلقكم. هل كل شيء واضح؟ واضح جدًا. نعم.

10:06

Speaker A

السؤال هو: هل سنرى كيف يرتبط هذا بما يُمارس في المجال؟ الإجابة هي نعم. أحد الأشياء التي سنراها، خاصة في الجزء الثاني من هذه الدورة، هو كيفية تطبيق شهادات الماجستير في القانون في بيئات مختلفة. وعلى سبيل المثال، أتذكر أنه في العام الماضي

10:23

Speaker A

ظهرت بعض الأمور التي تم إصدارها أثناء تدريسنا للدورة، فقمنا بتحديث المحتوى تباعًا. إذن، أنا متأكد من أننا سنفعل الشيء نفسه في هذه الدورة أيضًا. لذا، نعم، الإجابة هي نعم.

10:38

Speaker A

السؤال هو: ما هي التوصية للتحضير مع العلم أنه لا يوجد واجب منزلي وأن الامتحان النصفي والنهائي متساويان؟ أقول إنه اعتمادًا على طريقة دراستك المعتادة، أعتقد أن الدراسة المنتظمة هي الأفضل. أقول إن الانتباه إلى الأشياء التي نغطيها في الحصة

10:59

Speaker A

هو الأهم. قد تكون هناك مواضيع في الكتاب المدرسي لا نغطيها، وأعتقد أنها غير متوقعة في أي من الامتحانين. لذا، بشكل عام، أي شيء نقوله قد يكون في الامتحان.

11:15

Speaker A

السؤال هو: هل لديكم أي مسائل تدريبية؟ نعم. في العام الماضي قلنا لا، لكن الآن لديكم مسائل 2025. لذا، نعم، لكن الأسئلة ستكون مختلفة. حسنًا، ممتاز.

11:33

Speaker A

ملاحظة: لدينا ساعتان فقط، أو ساعة و50 دقيقة أسبوعيًا. لذا، لن يكون لدينا الوقت الكافي لتغطية كل شيء.

11:43

Speaker A

إذن، من الأمور التي سنلاحظها في كل شريحة من الشرائح التي سنناقشها، وجود مصدر في أسفلها في أغلب الأحيان، يمكنك الرجوع إليه إذا كنت ترغب في معرفة المزيد من التفاصيل. لذا، لا تتردد في الرجوع إلى الشرائح إذا كنت مهتمًا بموضوع ربما

12:04

Speaker A

تطرقنا إليه لبضع دقائق وتريد معرفة المزيد عنه. رائع. أمر آخر، وهو ما شعرت به شخصيًا عندما بدأت العمل في مجال معالجة اللغات الطبيعية قبل بضع سنوات، هو كثرة الاختصارات المنتشرة في كل مكان، مما قد يكون مربكًا. لذا، نأمل أن تتمكن، في

12:28

Speaker A

نهاية هذه الدورة، من تكوين خريطة ذهنية تربط كل اختصار بالمفهوم الذي يقابله، إذا كنت تشعر اليوم بالإرهاق من هذه الاختصارات. هذا هو هدفنا، وسنبدأ بسؤال أنفسنا كيف وصلنا إلى هنا. أتذكر جيدًا كيف كان المجال مختلفًا تمامًا قبل 10 أو 15

12:57

Speaker A

عامًا، في العقد الأول من الألفية الثانية. لم يكن لدينا نموذج واحد يُغطي جميع الاحتياجات، بل كان لدينا عادةً نموذج واحد لكل حالة استخدام. لذا، كان النموذج السائد آنذاك هو الشبكات العصبية المتكررة (RNN)، والتي سنستعرضها بإيجاز في هذه المحاضرة. وكانت

13:18

Speaker A

هناك نماذج أخرى مُخصصة لحالات استخدام مُحددة، مثل استخراج المشاعر. فعندما تسأل نفسك: هل جملة أو مراجعة ما إي

13:39

Speaker A

والمواقع وما إلى ذلك، فلديك أيضًا نموذج مُخصص لذلك. كان أداء العقد الماضي جيدًا، لكن ما أحدث فرقًا حقيقيًا، وشكّل نقطة تحول، كان عام 2017. في ذلك العام، نُشرت ورقة بحثية سنتحدث عنها بالتفصيل اليوم بعنوان "الانتباه هو كل ما تحتاجه"، والتي

14:10

Speaker A

قدمت بنية جديدة تعتمد على نموذج أثبت قابليته العالية للتوسع. أقصد بقابلية التوسع أنه إذا زودت نموذجك بمزيد من البيانات، ومزيد من القدرة الحاسوبية، ومزيد من المعلمات، فستلاحظ تحسناً ملحوظاً في الأداء يفوق بكثير ما كان عليه سابقاً، وهذا ما

14:36

Speaker A

سنراه اليوم. يُطلق على هذه البنية اسم " المُحَوِّل"، وعلى اليمين تجدون رسماً توضيحياً لكيفية عملها كما وردت في الورقة البحثية الأصلية. سنرى كيف تعمل. ومنذ ذلك الحين، قام الباحثون بتطوير هذه البنية وتوسيع نطاقها، ليس فقط من حيث حجم النموذج، بل

14:59

Speaker A

أيضاً من حيث عدد الرموز المميزة التي تم تدريبها عليها. وهكذا ظهرت نماذج التعلم الآلي الحديثة (LLMs)، وهي نماذج قادرة على توليد النصوص والبرمجيات بكفاءة عالية. وفي عام 2022 تحديداً، تم إطلاق نموذج GPT للدردشة، تحديداً في نوفمبر على ما أظن. نعم، لقد كانت

15:29

Speaker A

نقطة تحول من منظور المنتج، لأن المستخدمين قبل ذلك التاريخ لم يكونوا معتادين على التفاعل مع روبوتات الدردشة.

15:39

Speaker A

أعتقد أن ذلك الإصدار كان بمثابة المرة الأولى التي يتعرف فيها الناس على هذا الجانب، وأظن أن الشخص أو الشركة التي أطلقته ربما لم تكن تتوقع مدى انتشاره. أعني، أفترض ذلك لأن تغريداتهم التي نشرت النموذج، على ما أظن، احتوت على

15:59

Speaker A

خطأ مطبعي، وهو أمر أراه طريفًا، لأنه في هذه الأيام، عند إصدار أي نموذج، تتم مراجعة الصياغة عشر مرات. لذا ، أفترض أن هذا لم يكن الحال مع الإعلان هنا.

16:13

Speaker A

على أي حال، هذه نقطة تحول أخرى. وها نحن الآن في عام 2026. أفترض أن الكثير منكم، أو جميعكم، يتفاعل مع وكلاء البرمجة بشكل شبه يومي. لذا، سنرى كيف وصلنا إلى هذه المرحلة، وكيف انتقلنا من نموذج لغة محادثة، ومساعد

16:39

Speaker A

محادثة، إلى سلوك وكيل حقيقي. سنرى ذلك تحديدًا في الجزء الثاني من هذه الدورة. حتى الآن، كل شيء على ما يرام. رائع. حسنًا، سنبدأ بمفهوم أساسي وهو التجزئة. ما هي عملية التجزئة؟ عندما نتحدث عن النصوص، فإن النصوص ليست بالضرورة

17:14

Speaker A

مفهومة للنماذج. النماذج تفهم الأرقام ، لا النصوص. لذا، الهدف الأول هو إيجاد طريقة لتمثيل هذا النص بصيغة تفهمها النماذج ، أي بصيغة الأرقام.

17:37

Speaker A

ولتحقيق ذلك، نحاول أولًا تقسيم النص إلى كيانات يمكننا تمثيلها. وتُسمى عملية تقسيم النص إلى كيانات غير قابلة للتجزئة بالتجزئة. في هذا المثال، لدينا "دب لطيف يقرأ"، وإحدى طرق التجزئة الممكنة هي اعتبار "أ" وحدة غير قابلة للتجزئة، و "

18:07

Speaker A

لطيف" وحدة أخرى، و "دب لطيف" وحدة أخرى، وهكذا. يُسمى كل عنصر من هذه العناصر "رمزًا" ، وهدفنا هو تمثيل هذه الرموز بصيغ رياضية ذات معنى. في هذه الحالة، نريد تمثيل كل رمز بمتجه، متجه من الأرقام. لذا، لكي تتمكن من تجزئة نص

18:46

Speaker A

مُدخل، عليك معرفة الرموز المسموح لك باستخدامها. ولدينا ما يُسمى بالمفردات، والتي تتضمن جميع الرموز الممكنة.

19:02

Speaker A

وبناءً على المفردات التي تختارها، قد تحصل على أطوال تسلسل مختلفة. أقصد بأطوال التسلسل هنا عدد الرموز التي قسمت بها النص. على سبيل المثال ، لدينا في هذه الحالة ستة رموز: 1، 2، 3، 4، 5.

19:22

Speaker A

سنرى بعد قليل وجود علاقة وثيقة بين حجم المفردات وطول التسلسل. وهذا ما سيحدد لنا مُجزئ النصوص الذي يجب اختياره. حتى الآن كل شيء على ما يرام. الآن قد تتساءل: حسنًا، كل هذا رائع، ولكن كيف أعرف كيفية تجزئة النص

19:47

Speaker A

؟ هذا مجرد مفهوم نظري ، فكيف أفعل ذلك؟ إحدى الطرق الطبيعية هي أن تقول: حسنًا، سأجزئ النص إلى كلمات.

20:03

Speaker A

سأعتبر المسافة فاصلاً بين الرموز. على سبيل المثال، سأقول هنا: "دب لطيف يقرأ". كل كلمة في هذا النص تمثل رمزًا. ما هي مزايا وعيوب هذا الأسلوب؟ المزايا بسيطة جدًا، خاصة في اللغة الإنجليزية.

20:24

Speaker A

نربط الرمز بكلماته. الأمر في غاية البساطة . كما أنه قابل للتفسير ، بمعنى أنك تعرف أن تمثيل كلمة ما يطابقها ، أو أن تمثيل رمز ما يطابق كلمة معينة. مع ذلك، في اللغة الإنجليزية على الأقل ، توجد العديد من صيغ

20:47

Speaker A

الكلمات. على سبيل المثال، الاسم له صيغ مفردة وجمع، وله صيغة مذكر وصيغة مؤنثة، وغيرها الكثير. نتيجة لذلك، قد يصبح حجم مفرداتك كبيرًا جدًا.

21:05

Speaker A

هذه إحدى العيوب. أما العيب الثاني، فسنرى بعد قليل أنه عند تعلم تمثيل كل رمز، لا يوجد ما يضمن أن رمزين يمثلان الشيء نفسه سيحصلان على التمثيل نفسه. على سبيل المثال ، إذا نظرنا إلى كلمة " bear" وكلمة "bears"، فهما

21:32

Speaker A

المفرد والجمع لنفس الحيوان، وهو الدب. لذا، من الطبيعي ألا نرغب في أن يكون تمثيل هاتين الكلمتين متباعدًا جدًا لأنهما تمثلان الشيء نفسه. مع هذه الطريقة في تجزئة النص، ستواجه صعوبة أولًا في الاستفادة من المعرفة المتوفرة لديك من الكلمات

21:57

Speaker A

المشابهة، وثانيًا في ضمان تشابه هذه التمثيلات. وثالثًا، من البديهي أنك تحتاج إلى تعلم تمثيل كل كلمة على حدة. أي أن كل كلمة تمثل رمزًا واحدًا. قد تواجه حالةً، عند تدريب مُجزئ النصوص على مجموعة نصوص معينة، قد لا تجد فيها كلمةً

22:28

Speaker A

معينةً تصادفها أثناء الاستدلال. وبالتالي، قد تفقد تمثيلات لم تتح لك فرصة تعلمها لمجرد أنك لم تصادف تلك الكلمة أثناء التدريب. وبالتالي، قد تواجه خطر نفاد المفردات، أي أن كلمةً ما لم تكن قد رأيتها أثناء التدريب، وبالتالي لا يوجد لديك

22:58

Speaker A

تمثيل لها. باختصار، تجزئة الكلمات بسيطة، لكنها تنطوي على بعض العيوب، منها عدم القدرة على الاستفادة من الكلمات ذات الجذور المتشابهة، مما يؤدي إلى ضخامة المفردات وخطر نفادها. السؤال التالي هو: هل يمكننا تحسين ذلك؟ هل هناك طريقة أخرى لتجزئة

23:33

Speaker A

النص تكون أكثر منطقية ؟ قد يتبادر إلى الذهن أن التجزئة لا تعتمد على الكلمات، بل على الأحرف. لديك عدد ثابت من الأحرف المسموح بها ، على الأقل في اللغة الإنجليزية أو أي لغة أخرى. وبالتالي، لن تواجه خطر نفاد

23:56

Speaker A

المفردات، لأنك ستصادف جميع حروف الأبجدية في مجموعة التدريب، أو يمكنك محاولة ذلك. بهذه الطريقة، ستحصل على مفردات صغيرة، وستكون أكثر مقاومة لأخطاء الكتابة والتهجئة الشائعة. أجل، أفعل.

24:23

Speaker A

فعندما أكتب على حاسوبي، أخطئ أحيانًا في كتابة بعض الكلمات، ولا أريد أن يختلف تمثيل الكلمة التي أقصد كتابتها عن الكلمة نفسها. لذا، لن نتطرق هنا إلى حالة عدم التعرف على كلمة لمجرد وجود خطأ إملائي فيها. لكننا سنرى أنه

24:49

Speaker A

إذا فعلنا ذلك، سيزداد طول التسلسل بشكل كبير ، وتعقيد النموذج يعتمد على طول التسلسل . فإذا كان التسلسل طويلًا جدًا، سيستغرق النموذج وقتًا طويلًا لمعالجته، مما يُبطئ العمليات الحسابية ويجعل التضمينات نفسها أقل قابلية للتفسير. فمثلًا، إذا قلنا لك أن الحرف "أ" له

25:24

Speaker A

هذا التمثيل، فسيكون الأمر أكثر تجريدًا من الحديث عن تمثيل الكلمات، وسنرى ذلك بعد قليل. هل هذا واضح حتى الآن؟ نعم. آمل أن أكون قد أوضحت لك المقايضة بشكل كافٍ بحيث يكون تفكيرك التالي هو تجربة شيء ما بينهما، ليس كلمة

25:51

Speaker A

ولا حرفًا، بل ما بينهما، أي أجزاء من الكلمات. إذن، ما رأيك بتقسيم النص إلى رموز باستخدام معرفتنا بالكلمات التي نتعلمها من مجموعة بيانات تدريبية؟ نقوم بتقسيم التكرارات الشائعة للأحرف ونمثلها برمز. على سبيل المثال، كلمة " reading" نمثلها برمز،

26:23

Speaker A

وكلمة "ink" برمز آخر. لنقم بذلك. الميزة هنا هي أننا نستفيد من جذر الكلمات. ففي المثال السابق، كلمتا "bear" و " bears" تشتركان في رمز "bear ". ثانياً، يتم تعلم هذه الطريقة من البيانات نفسها، أي أن طريقة تقسيم النص

26:49

Speaker A

تعتمد على كيفية كتابة الكلمات. لكن العيب هو أنك ستحتاج إلى بذل جهد إضافي. ففي حالة الكلمات، يكفي إنتاج الرموز بتقسيمها بناءً على المسافة.

27:04

Speaker A

لذا، ستحتاج إلى بذل جهد إضافي، وستعتمد طريقة الحصول على هذه الرموز بشكل كبير على نوع البيانات المتوفرة لديك عند تدريب أداة التقسيم.

27:21

Speaker A

هذا عيب آخر. لذا، علينا التأكد من أن البيانات التي تستخدمها لتعلم كيفية تجزئة النصوص تتوافق فعلاً مع هدفك النهائي . لذا، أودّ أن أذكر شيئًا هنا. لقد تحدثتُ عن ثلاث طرق لتجزئة النصوص: على مستوى الكلمة، وعلى مستوى الحرف، وعلى مستوى

27:48

Speaker A

أجزاء الكلمة. من بين هذه الطرق الثلاث، يُعدّ مستوى أجزاء الكلمة الأكثر شيوعًا في الوقت الحالي لجميع الأسباب التي ذكرتها.

27:58

Speaker A

وستسمعون كلمة أو اختصار BPE كثيرًا. BPE هو نوع من مُجزئات أجزاء الكلمة، وهو اختصار لـ Bit Pair Encoding (ترميز أزواج الكلمات).

28:09

Speaker A

ستجدون رابط الورقة البحثية أسفل هذه الشريحة إذا كنتم مهتمين بمعرفة المزيد ، ولكن سأقدم لكم نبذة مختصرة عن كيفية عمله.

28:23

Speaker A

يتعلم BPE الرموز التي يجب أن تكون في مفرداتك من خلال البدء بمجموعة أولية من الرموز وتحديد الأزواج الأكثر تكرارًا في بيانات التدريب، ثم ابتكار رموز مخصصة لدمج هذه الأزواج. على سبيل المثال، سأقدم مثالًا.

28:50

Speaker A

لنفترض أن مفرداتك الأولية هي جميع حروف الأبجدية، ولديك كلمات مثل "لا أعرف" و " فكرة" و "دورة مذهلة".

29:02

Speaker A

إذن، كلمة "لا أعرف" تتكرر كثيرًا. هنا، سيقول النظام: "حسنًا، الحرفان a و n يتكرران معًا كثيرًا". لذا، لنضف رمزًا يجمع بينهما. سيضيف النظام هذا الرمز الجديد إلى المفردات، ثم يكرر العملية حتى يصل إلى حجم المفردات النهائي المطلوب، وهذه هي

29:27

Speaker A

مفرداتك النهائية. الميزة الرائعة هي أن هذه الرموز تُستخلص من البيانات. أي أن الكلمات التي تظهر معًا تُحدد وتُضاف إلى مفرداتك. هذا سيؤدي إلى تقصير طول التسلسل ، وبالتالي لن تحتاج إلى تقسيم النص إلى عدد كبير من الرموز، ولن يستغرق النموذج

29:52

Speaker A

وقتًا طويلًا لمعالجة النص. ومن هنا تأتي الكفاءة. لذا، إذا كان لديك مجموعة بيانات تدريبية تحتوي، على سبيل المثال، على الكثير من الكلمات التي تصادفها في الممارسة، فسيكون طول تسلسل الرموز التي ستحصل عليها من نص يستخدم نفس الكلمات الموجودة في مجموعة

30:15

Speaker A

بياناتك التدريبية أقصر بكثير. لذلك، في حال كنت تعمل على مشاريع متعددة اللغات ، فتأكد من تدريب مُجزئ الكلمات على مجموعة بيانات تمثل جميع اللغات التي تهمك . هذا مثال واحد. حسنًا ، كان هذا كثيرًا.

30:38

Speaker A

سأتوقف لحظة. هل لديك أي أسئلة حتى الآن بخصوص هذا الجزء؟ نعم. السؤال هو: ما العلاقة بين BP و engram؟ في الواقع ، engram شيء منفصل، وكما ذكرت، سيتعلم الرموز من مجموعة بياناتك عن طريق دمج الأزواج الأكثر تكرارًا بطريقة تكرارية حتى

31:05

Speaker A

الوصول إلى حجم المفردات النهائي المطلوب. السؤال الطبيعي التالي هو: حسنًا، لديك الآن الرموز، فكيف تعرف كيفية تمثيلها؟ ربما تتساءلون عن هذا، وسنرى ذلك بعد حوالي خمس دقائق. لذا، سنتحدث عن هذا لاحقًا.

31:24

Speaker A

في الواقع، أنظر إلى الساعة. لا أعتقد أنني ملتزم بالوقت. لذا، سأنتقل على الأرجح إلى موضوع آخر. ولكن إذا كانت لديكم أي أسئلة، فلا تترددوا في مقاطعتي. التجزئة هي أساس كل ما سنراه من الآن فصاعدًا. حسنًا.

31:44

Speaker A

لقد رأينا حتى الآن رموزًا تمثل النصوص التي نريد تجزئتها. ولكن في الحقيقة، لدينا أيضًا بعض الرموز الخاصة. وهذه الرموز الخاصة مخصصة لتمثيل الأشياء التي نريد التعبير عنها في تسلسل. أحد هذه الرموز هو عندما نصادف مصطلحًا أو جزءًا ليس

32:07

Speaker A

جزءًا من مفرداتنا. لذلك، جرت العادة على تخصيص رمز يمثل هذا الجزء من النص غير الموجود في المفردات، ويُسمى رمزًا غير معروف. هذا مثال على رمز خاص. لنأخذ مثالًا: دمية دب. تخيل لو كتبتُ كلمة "teddy d bear" ولم نرَ

32:29

Speaker A

مثل هذه التهجئة في مجموعة بيانات التدريب. إذا كانت مفرداتك تتكون فقط من هذه الكلمات الأربع: teddy، cute، bear، و unknown، فسيتم تقسيم كلمة "teddy bear" إلى كلمتين: unknown و bear. مثال آخر، مجموعة أخرى من الكلمات الخاصة. في كثير من

32:57

Speaker A

الأحيان، نحتاج إلى تحديد بداية ونهاية التسلسل، وسنرى كيف نفعل ذلك. لدينا مجموعتان من الكلمات الخاصة: بداية التسلسل (bos) ونهاية التسلسل (EOS) . تُستخدم هذه الكلمات غالبًا عند توليد النصوص. على سبيل المثال، عند بدء التوليد، يُغذّي النموذج بكلمة "بداية

33:30

Speaker A

التسلسل" للإشارة إلى رغبتك في توليد نص، ثم يُخرج النموذج كلمة " نهاية التسلسل" عند انتهاء التوليد لإعلامك باكتماله.

33:44

Speaker A

هكذا تُستخدم هذه الكلمات. إذن، ما هو رمز بداية التسلسل مع دمية دب لطيفة، ورمز نهاية التسلسل كمثال؟ أما الرمز الأخير الذي قد تصادفه فهو رمز الحشو، وهو يُستخدم لجعل التسلسلات ذات حجم محدد. يُستخدم هذا أحيانًا لتحسين الكفاءة، فإذا أردت أن

34:10

Speaker A

تكون جميع التسلسلات بنفس الطول، لأننا سنرى أنه يمكننا تمثيل ذلك باستخدام المتجهات والمصفوفات والموترات، ولأن الأجهزة تُفضل العناصر ذات الأبعاد المتشابهة، يُمكن استخدام الحشو أيضًا.

34:30

Speaker A

لكن أود أن أشير إلى أن هذه القائمة ليست شاملة بأي حال من الأحوال، وأن هناك العديد من الاصطلاحات المختلفة المُتبعة.

34:40

Speaker A

لذا، فإن طريقة كتابة بداية التسلسل ونهايته، وطريقة كتابة الحشو هذه، ليست عالمية. لذلك، لا تستغرب إذا صادفت اختلافات. وفي الوقت الحاضر، توجد أشياء مثل المساعد، مثل المستخدم والمساعد، وغيرها من الأشياء التي يتم تمثيلها برموز خاصة. إذن، هذه ليست قائمة شاملة،

35:08

Speaker A

ولكن اعلم أن هذه الرموز موجودة، وهي مصممة لنقل معلومات حول النص يجب أن يفهمها النموذج. رائع.

35:23

Speaker A

هذا كل ما يتعلق بتقسيم النص إلى رموز. هل لديك أي أسئلة؟ نعم. السؤال هو: ما هو حجم مفردات Lens حاليًا؟ إنه سؤال ممتاز. إنه في حدود مئات الآلاف.

35:43

Speaker A

سترى أرقامًا مثل 200,000. وهذه مُجزئات قادرة على التعامل مع اللغة الإنجليزية ولغات أخرى. وكما ذكرت، فإن أكثر أنواع المُجزئات شيوعًا اليوم هو BP. لذا ، هذه هي الأمور التي يجب مراعاتها. نعم.

36:07

Speaker A

السؤال هو: هل يجعل دعم مُجزئك للغات متعددة منه أقل خبرة في لغة معينة؟ أعتقد أنه من الصعب الجزم بذلك.

36:18

Speaker A

أقول إنه قد يكون هناك بعض أوجه التآزر بين اللغات. لذا أقول إنه من الصعب الجزم بشكل عام، ولكن مع ذلك، فإن حجم المفردات الذي تحدده عند تشغيل خوارزمية الانتشار العكسي سيمتلئ برموز من لغات مختلفة.

36:39

Speaker A

وبالتالي، قد تحصل على مفردات تؤدي إلى تسلسل أطول إذا كنت مهتمًا بلغة واحدة فقط. من منظور الكفاءة، قد تلاحظ فرقًا، ولكن من منظور التمثيل، فالأمر ليس واضحًا تمامًا. على سبيل المثال، اختصارات المنظمات، والتي قد يستخدمها الناس في العديد من اللغات. لذا

37:11

Speaker A

، قد تستفيد من تعلم هذا التمثيل من نصوص مختلفة بلغات مختلفة. إذن، لكل شيء إيجابياته وسلبياته.

37:24

Speaker A

ممتاز. رائع. الآن، ما تعلمناه هو أنه عند إدخال نص، يمكننا توليد رموز أو تمثيل هذا النص برموز.

37:39

Speaker A

السؤال الطبيعي التالي هو كيفية تمثيل هذه الرموز. هذا ما سنراه الآن. أبسط طريقة للقيام بذلك هي اعتبار كل رمز مختلفًا . إذن، من الواضح جدًا أنه يمكنك تمثيل رموزك بما نسميه ترميزًا أحاديًا ساخنًا.

38:04

Speaker A

لنفترض أن لديّ الرمز soft، يمكنني القول إنه متجه 0 0 واحد. إذا فعلت ذلك مع جميع رموزك، فإن المشكلة هي أنها ستكون جميعها متعامدة مع بعضها البعض عند حساب حاصل الضرب النقطي. هل هذا جيد؟ بالطبع لا، لأنه لا

38:31

Speaker A

يخبرك شيئًا عن ماهية هذه الرموز وكيفية ارتباطها ببعضها. لذا، هذا ليس ما تريده. ما تريده هو تمثيل هذه الرموز بطريقة تعكس مدى تشابهها مع بعضها البعض. هذا هو المطلوب.

38:52

Speaker A

على سبيل المثال، تريد أن يكون teddy bear مشابهًا لـ soft لأن الدببة لينة ، ولكن ربما تريد أن يكون book مستقلًا. هذا ما تريد تعلمه. تريد تعلم تمثيلات ذات معنى . وبالمناسبة، لماذا تريد تعلم تمثيلات ذات معنى؟ حسنًا، السبب هو

39:12

Speaker A

أنك تريد القيام بشيء ما بنصك. أنت بحاجة إليه كمدخل لنموذجك لكي تُخرج شيئًا ما.

39:18

Speaker A

على سبيل المثال، توليد الكلمات التالية أو التنبؤ بفئة معينة. لذا، أنت بحاجة إلى فهم محتوى نصك، وهذا هو سبب رغبتك في الحصول على تمثيلات رمزية ذات معنى. هذا ما حاولت طريقة سابقة تُسمى vWordTovec تحقيقه. الفكرة هنا هي تعلم هذه

39:53

Speaker A

التمثيلات من خلال ما نسميه مهمة وسيطة. المهمة الوسيطة هي مهمة تحاول تعلمها، ولكنها ليست المهمة التي تسعى لتعلمها كهدف نهائي، بل هي مهمة تحاول تعلمها لتحقيق شيء آخر. هنا، المهمة الوسيطة هي شيء مثل التنبؤ بالكلمة التي تقع بين كلمات

40:17

Speaker A

سياقية معينة. هذا هو إصدار حقيبة الكلمات المتصلة من vWordTovec، أو التنبؤ بالكلمات المحيطة بكلمة معينة، وهو إصدار Skip-Gram.

40:31

Speaker A

سنستعرض مثالًا لتوضيح الأمر. هل يعرف الجميع ما هي الشبكة العصبية؟ نعم. حسنًا، لقد مثّلتُ شبكة عصبية أساسية جدًا. يمكنك اعتبارها عملية ضرب مصفوفة إدخال للحصول على تمثيل مخفي بحجم D، ثم عملية ضرب مصفوفة أخرى للعودة إلى حجم V،

40:56

Speaker A

وهو حجم مفرداتك. لنفترض أن لديك الجملة "دب لطيف يقرأ". ولنفترض، تبسيطًا للأمر، أن هدفك هو التنبؤ بكلمة "لطيف" من الكلمة "a". لنفترض إذًا أن مهمتك الأساسية هي التنبؤ بالكلمة التالية. هنا، تمثيلك البسيط للكلمة "a" هو ترميز "one-hot". لنفترض أن

41:32

Speaker A

لديك مفردات بحجم ستة، وأن "a" هي أول كلمة. إذن ، ستمثل "a" بالرموز 1 0 0 0 0. ثم تمررها عبر الشبكة. فكّر في الأمر كعملية ضرب مصفوفة مع هذا المتجه. سيكون لديك حالة مخفية بحجم اثنين. لنفترض وجود

41:54

Speaker A

رقمين 02 و 0.9، ثم تمررها إلى الشبكة. مرة أخرى، عملية ضرب مصفوفة أخرى، وستحصل على تنبؤات مجموعها واحد. يمكنك استخدام دالة مثل softmax لتطبيعها. هدفكم هو جعل هذه الاحتمالات قريبة قدر الإمكان من التصنيف الذي لديكم، وهو التنبؤ بكلمة "

42:24

Speaker A

لطيف". لنفترض أن "لطيف" هي الكلمة الثانية في مفرداتكم، ويتم تمثيلها بالرموز 0 1 0 0.

42:32

Speaker A

هدفكم، كما هو موضح في الشريحة، هو أن تكون قيمة 0.4 قريبة قدر الإمكان من 1. الفكرة هي استخدام دالة خسارة تُعاقب احتمالية أن تكون احتمالية كلمة معينة بعيدة جدًا عن الكلمة التي تحاولون التنبؤ بها. في حال كنتم تعرفون دالة

42:58

Speaker A

خسارة الإنتروبيا المتقاطعة، فإنها تُحدّث أوزان النموذج لتعكس ما تريدون. ولتوضيح الأمر، سأشرح جميع الكميات التي ذكرناها. أولًا، الترميز الذي يُمثل الرمز المميز هو بحجم حجم المفردات. الحالة المخفية، أو ما يُسمى أيضًا بالتمثيل الكامن، هي بحجم D، و D

43:26

Speaker A

هو مُعامل يُمكنكم اختياره، وعادةً ما يكون أصغر بكثير من حجم المفردات. ثانيًا، احتمالات الكلمات المُتوقعة، لديكم احتمال لكل رمز مميز.

43:38

Speaker A

لذا، يجب أن يتطابق حجمه مع حجم المفردات، أي بحجم V. وهذا يتطابق أيضًا مع حجم ترميز Onehood. وهنا يمكنك محاولة معاقبة الانحرافات عن الكلمة التي تحاول التنبؤ بها . لنفترض أنك تفعل ذلك لمحاولة التنبؤ بكلمة "cute". تكرر نفس الشيء

44:03

Speaker A

لكلمة "teddy bear". فعندما تتنبأ بكلمة "cute"، تمثلها باستخدام ترميز Onehood. ثم تمررها عبر الشبكة. لديك تمثيل كامن، واحتمالات أيضًا.

44:14

Speaker A

تقارن هذا التمثيل بالتصنيف الفعلي الذي يمثل كلمة "teddy bear". تحسب الخسارة. تُحدّث الأوزان بناءً على مدى بُعدك عن التصنيف المُتنبأ به. وتكرر هذه العملية على كامل مجموعة البيانات. في النهاية، يدرك المؤلفون أن التمثيل الكامن الذي تتعلمه في منتصف الشبكة منطقي

44:46

Speaker A

بالفعل. بمعنى آخر، يمكنك حساب مقاييس التشابه بين التمثيلات المُتعلمة. وتلاحظ أن تمثيلات الرموز المتشابهة متشابهة بالفعل. في هذا المثال، الدب المحشو ناعم. ما علاقة الشعر الفارسي بالفنون؟ مثال آخر: باريس بالنسبة لفرنسا ، وبرلين بالنسبة لألمانيا. لدينا هذه الروابط الجميلة التي

45:19

Speaker A

يتعلمها النموذج، مما يُعطينا تمثيلات ذات معنى للكلمات. هذه طريقة ظهرت في أوائل العقد الثاني من الألفية، أعتقد أنها كانت في عام ٢٠١٣ إن لم تخني الذاكرة. من يستطيع أن يخبرني ما هي قيود هذا النهج؟ هنا، نرى أن تمثيل

45:47

Speaker A

الكلمات التي تعلمناها ذو معنى، ولكن هل هناك قيود على هذا النهج؟ نعم، أحدها هو أنك ستواجه مشكلة إذا لم تصادف شيئًا رأيته أثناء عملية التدريب. هذا صحيح، وأعتقد أنه صحيح في معظم الحالات باستثناء هذه الحالة تحديدًا. هذا أحد

46:17

Speaker A

القيود. هل هناك قيد آخر؟ الإجابة هنا هي أن الأبعاد تتوسع مع ازدياد حجم المفردات.

46:28

Speaker A

في الواقع، هذا قيدٌ في مُجزئ الكلمات، لأنه هو الذي يُحدد حجم مُفرداتك. وأنت مُحقٌ في أن هذا قيد، ولكنه ليس خاصًا بهذه الطريقة، إذ ستحتاج دائمًا إلى إيجاد تمثيل لكل عنصر في مُفرداتك. أعني أنه قيد، ولكنه قيدٌ في

46:55

Speaker A

الطرق بشكل عام. نعم. الإجابة هي أن الكلمات قد تحمل معاني مُتعددة . هذا صحيح. أحد القيود هنا هو أنه إذا كانت كلمة "لطيف" موجودة في هذه الجملة وفي جملة أخرى، فستحصلان على نفس التمثيل. فإذا قلتَ "دب لطيف" بطريقة

47:22

Speaker A

لطيفة، بينما يقول شخصٌ ما بسخرية "يا له من لطيف"، فقد يعنيان أشياءً مُختلفة بين الكلمات التي تلي كلمة "لطيف". أعتقد أن مثالًا كلاسيكيًا جدًا هو "بنك". فمثلاً " ضفة النهر" مقابل " الذهاب إلى البنك".

47:41

Speaker A

هاتان الكلمتان هما نفس الشيء ولكن بمعنى مُختلف. إذن، تكمن مُشكلة هذه الطريقة في أن تمثيل هذه الكلمة سيكون هو نفسه بغض النظر عن الجملة التي وردت فيها. نقطة رائعة.

47:57

Speaker A

من القيود الأخرى هنا أن ترتيب الكلمات لا يهم. لنفترض أننا نقول "الطفل يعانق الدب" و " الدب يعانق الطفل".

48:10

Speaker A

هاتان الكلمتان متطابقتان تمامًا، لكنهما تحملان معاني مختلفة. سنحصل على نفس التمثيلات المضمنة في كلتا الحالتين. هذه كلها قيود، ولذلك حاول الباحثون حلها بوسائل مختلفة. إحدى هذه الوسائل هي الشبكات العصبية المتكررة (RNNs) ، والتي كما رأينا سابقًا، كانت النموذج

48:43

Speaker A

السائد في العقد الأول من الألفية الثانية. تعتمد الشبكات العصبية المتكررة على كمية إضافية تُحسب، تُمثل هنا بـ "a"، وتُسمى أيضًا الحالة المخفية، والتي تحاول تجسيد معنى الجملة.

49:13

Speaker A

سنرى ذلك كمثال. لنفترض الجملة نفسها: " دب لطيف يقرأ". هنا، سنضع كلمة "a" في الشبكة العصبية المتكررة، وستحاول الشبكة التنبؤ بكلمة "لطيف".

49:29

Speaker A

لكن ما سيفعله هذا النموذج هو الاحتفاظ بما نسميه الحالة الخفية التي تُشفّر معنى التسلسل الذي تمت رؤيته حتى الآن. ستكون هذه الحالة مدخلاً للتنبؤ التالي. لذا، سنستخدم "cute" كمدخل، بالإضافة إلى هذه الحالات الخفية كمدخلات أخرى لتوجيه التمثيل التالي،

49:55

Speaker A

وهكذا دواليك. إذن، ما تفعله هنا هو أنك لا تنظر فقط إلى تضمينات الرموز المميزة بحد ذاتها، بل تنظر أيضًا إلى تضمين التسلسل الذي تم فك تشفيره حتى الآن. وهذا يسمح لك بمراعاة ترتيب الكلمات في الجملة. في الواقع، تُعد الشبكات

50:25

Speaker A

العصبية المتكررة نماذج استُخدمت في العديد من المهام سابقًا. على سبيل المثال، في التصنيفات ، ما تفعله هو معالجة الرموز المميزة واحدًا تلو الآخر، ثم الاحتفاظ بحالة ذاتية التغيير تُشفّر معنى التسلسل الذي تمت رؤيته حتى الآن، وستحاول التنبؤ، على

50:43

Speaker A

سبيل المثال، بمشاعر معينة في حالة استخراج المشاعر. في حالة التصنيف المتعدد، على سبيل المثال، إذا أردت تحديد ما إذا كانت الكلمة اسمًا أم فعلًا ، فستستفيد من التمثيلات المقابلة لكل مُدخل، والتي بدورها ستأخذ في الاعتبار الحالات المخفية أو ببساطة

51:07

Speaker A

عملية التوليد. لكن أحد قيود الشبكات العصبية المتكررة (RNN) هو أنه على الرغم من أنها كانت تأخذ في الاعتبار ترتيب ظهور الكلمات في تسلسل، إلا أنها كانت تواجه صعوبة في تذكر الكلمات التي حدثت في الماضي البعيد ، لأنها كانت تُشفّر

51:35

Speaker A

معنى التسلسل في متجه واحد، والذي كان يُعدّل باستمرار. لذا، كانت هناك مشكلة ما نسميه التبعية طويلة المدى، حيث إذا انتهى بك الأمر بعد جملتين من شيء تحدثت عنه سابقًا، فستواجه صعوبة في استخلاص ذلك باستخدام الحالة المخفية في تلك النقطة

52:02

Speaker A

فقط. وهذا قد يكون إشكاليًا. على سبيل المثال، عندما تشير إلى شيء حدث في الماضي ، كأن تقول: "يا إلهي، دبدوبي لطيف جدًا.

52:18

Speaker A

طوله 90 سم." فهذا يشير إلى شيء حدث في الماضي. لنفترض الآن أن الإشارة تشير إلى شيء حدث في الماضي البعيد.

52:30

Speaker A

عندها نواجه مشكلة في الحصول على مجموعة المعلومات الصحيحة في الحالة المخفية التي ندرسها. لهذا السبب ظهرت بعض أنواع الشبكات العصبية المتكررة (RNN). أحد هذه الأنواع يُسمى LSTM ( الذاكرة طويلة المدى)، والذي حاول معالجة هذه المشكلة ليس فقط من

52:57

Speaker A

خلال الاحتفاظ بحالة مخفية، بل أيضًا بحالة أخرى تُسمى حالة الخلية، والتي صُممت لحمل المعلومات لفترة أطول. لكن في الحقيقة، حتى هذه الأنواع لها حدودها، والتي تعود إلى نفس المشكلة. إذا أردنا استعراض الطرق المتاحة للحصول على تمثيلات الكلمات حتى

53:31

Speaker A

الآن، فقد رأينا Vortac، وهو أسلوب بسيط جدًا لحساب تمثيلات الكلمات. لكن المشكلة تكمن في أنه إذا كانت الكلمة، على سبيل المثال، في تسلسل مختلف، فإن التمثيل يبقى نفسه. هذا قيدٌ، وكما ذُكر سابقًا، قد تحمل الكلمة نفسها معانيَ مختلفة، وهذا

53:57

Speaker A

أيضًا لا يُنقل. في حالة الشبكات العصبية المتكررة (RNN)، نعالج مشكلة ترتيب الكلمات من خلال حالة مخفية تُغلف التسلسل المرئي حتى الآن. لكن المشكلة تكمن في مشكلة التبعية بعيدة المدى، وهي في الواقع ناتجة عن مشكلة أعمق تُسمى مشكلة تلاشي التدرج، وهي

54:25

Speaker A

مشكلة تظهر عند محاولة الانتشار العكسي، ما يُضيف قيدًا آخر. وهناك أمرٌ آخر لم نذكره بخصوص الشبكات العصبية المتكررة: تكمن المشكلة في أنه في كل مرة نريد فيها التنبؤ بالرمز التالي ، نحتاج إلى الحالة المخفية التي تُغلف كل ما رأيناه حتى الآن.

54:48

Speaker A

لذا، علينا دائمًا المرور على الرموز واحدًا تلو الآخر لإجراء التنبؤ التالي. وعند تدريب مثل هذا النموذج، يكون بطيئًا للغاية، وقد حقق نتائج جيدة في حينه، لكنها لم تكن مذهلة. لهذه الأسباب مجتمعة، جرّب الباحثون في العقد الثاني من الألفية

55:18

Speaker A

الثانية تقنياتٍ مختلفة، وبرزت تقنيةٌ واحدةٌ بشكلٍ لافتٍ للنظر، وهي تقنية الانتباه. تقوم فكرتها على ما يلي: بدلاً من الاعتماد كلياً على الحالة المخفية لفهم معنى التسلسل الذي شاهدته حتى الآن، تُمكّن هذه التقنية النموذج من إنشاء روابط مباشرة مع

55:46

Speaker A

الرموز التي شاهدتها سابقاً. بعبارة أخرى، لا ندعو إلى الاعتماد فقط على الحالة المخفية لمعرفة ما حدث في الماضي، بل ندعو إلى إنشاء روابط مباشرة مع الرموز التي شاهدتها سابقاً للتنبؤ بالرمز التالي.

56:09

Speaker A

في مثال الترجمة، لنفترض أنك تريد ترجمة عبارة "دب لطيف يقرأ" إلى الفرنسية، ولنفترض أنك تقول "..." وتريد التنبؤ بالكلمات التالية. من البديهي أنه للتنبؤ بالكلمات التالية، سيكون من الرائع معرفة الكلمة التي تريد ترجمتها. في حالة الشبكات العصبية المتكررة التقليدية،

56:35

Speaker A

لن تتمكن من الوصول المباشر إلى تلك الكلمة. لن تتمكن من الوصول إليه إلا عبر الحالة المخفية.

56:45

Speaker A

الفكرة هنا هي إنشاء اتصال مباشر بالرموز السابقة، والسماح للنموذج بتعلم أيها مهم، وبالتالي يعتمد التنبؤ على الرموز المهمة. هذا هو مفهوم الانتباه. مفهوم الانتباه هو السماح لنموذجك برسم روابط مباشرة من رمز معين إلى بعض الرموز السابقة. وهذا المفهوم

57:20

Speaker A

بالغ الأهمية لأنه أساس ما سنراه الآن. ذكرتُ سابقًا وجود ورقة بحثية بعنوان " الانتباه هو كل ما تحتاجه" صدرت عام ٢٠١٧ ، وكانت نقطة تحول لأن الباحثين لاحظوا قابليتها العالية للتوسع ونتائجها المذهلة. تعتمد هذه الورقة على مفهوم الانتباه الذاتي، وهو

57:52

Speaker A

الانتباه ولكن بشكل مُعزز. وسنشرح بالتفصيل ما نعنيه بذلك. لنفترض أن لديك التسلسل "دب لطيف يقرأ" . إذن، الفكرة الآن ليست أننا سنحسب تمثيل كلمة معينة كدالة للحالة المخفية التي تُغلف معنى التسلسل حتى الآن والكلمة نفسها. لن نقول ذلك

58:24

Speaker A

الآن. ما نقوله هو أنه لحساب تمثيل رمز معين، يمكننا في الواقع القيام بذلك من خلال التعبير عن هذا التمثيل كدالة لجميع الرموز الأخرى في ذلك التسلسل. عذرًا. أعتقد أنك أثرت نقطة مهمة، وهي كيف تعرف ترتيب الكلمات إذا سمحت

58:47

Speaker A

للجميع بالتفاعل مع الجميع؟ في حال كان هذا هو سؤالك. حسنًا، إذا سمحت لرمز بالتفاعل مع جميع الرموز الأخرى، فإنك تفقد مفهوم ترتيب الكلمات، وهو أمر سنتناوله لاحقًا. سنرى هذا الجزء بالتحديد.

59:08

Speaker A

لكن هنا، أنت لا تعرف مكان الرموز لأن لديك اتصالًا مباشرًا في هذا التمثيل البسيط جدًا. أنت لا تعرف مكان الرموز. لذا سنرى كيف يمكنك حل هذه المشكلة.

59:23

Speaker A

لكن هل الفكرة منطقية؟ الفكرة هي أنه لحساب تمثيل رمز معين، عليك التعبير عنه كدالة لجميع الرموز الأخرى في التسلسل. هل هذه الفكرة منطقية بشكل عام؟ نعم، سأعتبرها كذلك. سنستعرض أمثلة، ولدى شيرفين مثال مفصل لاحقًا. نأمل أن يكون هذا أكثر وضوحًا. هناك

59:54

Speaker A

مجموعة من الرموز المستخدمة سنقدمها الآن. هذه الرموز هي الاستعلامات، والمفاتيح، والقيم (Q، K، V). الاستعلام هو الكيان الذي يحاول تحديد ماهية رمز معين.

60:23

Speaker A

الفكرة هي إيجاد رموز مفيدة لبناء تمثيل ذي معنى للرمز الذي هو مسؤول عنه. على سبيل المثال، الاستعلام عن "دب تيدي" يحاول إيجاد رموز أخرى ذات صلة لحساب تمثيل ذي معنى لهذا الرمز. سيقارن الاستعلام مدى تشابه هذه القيمة مع مفاتيح

60:55

Speaker A

التسلسل المرتبطة بكل رمز فيه. وبمجرد تحديد مدى تشابه كل رمز مع كل رمز آخر، سنُسند قيمة لكل رمز. بعبارة أخرى، نريد التعبير عن تمثيل "الدب" كدالة لجميع الرموز الأخرى في التسلسل. لذا، سنبدأ بتحديد الأوزان، أي المتوسط المرجح. تُحدد

61:26

Speaker A

الأوزان بناءً على مدى تشابه الاستعلام عن " الدب" مع كل مفتاح. ثم ستكون القيمة الفعلية هي متجه القيم المقابل لكل رمز. سيكون الأمر أشبه بمجموع عناصر تمثل التشابه، مثل Q و KI و VI. هذا هو استعلامك ، وتحاول تحديد مدى

62:04

Speaker A

تشابهه مع جميع المفاتيح الأخرى باستخدام عملية تشابه معينة، مثل الضرب النقطي كمثال. هذا عدد قياسي، وهذا عدد قياسي ، وتربطه بـ vi، وهو أيضًا متجه. قد يبدو هذا مجردًا بعض الشيء.

62:29

Speaker A

سأعطيك مثالاً. لنفترض أننا نريد معرفة أفضل وصف للدب المحشو. يمكن للاستعلام أن يسأل نفسه: ما هو أفضل وصف للدب المحشو؟ وبالنظر إلى جميع الكلمات، نجد أن كلمة "لطيف" تصف الدب المحشو بشكل جيد.

62:47

Speaker A

لذا، قد يكون حاصل الضرب النقطي بين Q ( الدب المحشو) و K (لطيف) مرتفعًا. وبالتالي، فإن التمثيل الذي تحسبه للدب المحشو يعتمد بشكل كبير على كلمة "لطيف". لنفترض ذلك. هذه هي مفاهيم مفتاح وقيمة الاستعلام. السؤال التالي هو: كيف نحصل

63:12

Speaker A

على هذه المفاهيم؟ كيف نحصل على مفاتيح وقيم الاستعلام؟ هذه في الواقع كميات يمكن تعلمها باستخدام مصفوفات الإسقاط. لديك في البداية بعض الكلمات المدخلة التي تمثل كل كلمة، وما تفعله هو أنك تأخذ هذا التمثيل وتسقطه على فضاء مفاتيح وقيم

63:44

Speaker A

الاستعلام من خلال بعض مصفوفات الإسقاط. ثم تستخدم هذه الكميات لحساب تمثيلات ذات معنى للكلمات. سؤال رائع. السؤال هو: ما هو t؟ إذن، t تعني ببساطة، من الناحية الرياضية، منقولة المصفوفة.

64:11

Speaker A

يمكنك أيضًا كتابتها كـ Q Krpose. هل لديك أي سؤال آخر؟ سنقدم مثالًا مفصلًا لاحقًا ، لذا إذا كان هذا الشرح واضحًا، فأعتقد أنه ممتاز. سنرى ذلك في ...اتضح أن ما وصفته يمكن التعبير عنه رياضيًا باستخدام المصفوفات. على وجه

64:54

Speaker A

الخصوص، يمكن التعبير عن العملية التي ذكرتها للتو كدالة softmax للاستعلام والمفاتيح، ثم ضرب الناتج بمعامل معين مضروبًا في القيم.

65:09

Speaker A

ربما لديّ وقت كافٍ لشرح السبب. لنفترض أن لديك...دالة softmax هي ببساطة طريقة لجعل مجموع المعاملات يساوي واحدًا. هذا ما تفعله تقريبًا. لكن السؤال هو: إذا كان لديك استعلام ومفتاح منقول، أي دالة softmax والضرب، فلماذا تعطينا النتيجة التي رأيناها أعلاه؟ حسنًا

65:44

Speaker A

، لنفترض أن مصفوفة الاستعلامات لديك تحتوي على جميع استعلاماتك، من q1 إلى qn. يمثل الرقم 1 أول عنصر في التسلسل.

65:58

Speaker A

لنفترض في الشريحة السابقة أن أول عنصر هو a، ولنفترض أن a يساوي 1، ثم الرقم n.

66:09

Speaker A

لنفترض أن لدينا الاستعلام عن A حتى الاستعلام عن النقاط، ونفعل الشيء نفسه مع K و V. إذا ضربنا المصفوفة المربعة في منقولها، فسنحصل على K1 ، وهكذا KN. وهنا تكمن أهمية معرفتك ببعض الجبر الخطي، أي ضرب المصفوفات. نضرب هذا

66:53

Speaker A

في هذا، وهو حاصل الضرب النقطي لـ Q1 و K1، ثم يكون العنصر الثاني هو Q1 و K2. إذا كررنا هذه العملية، فسنحصل على مصفوفة Q1 و K2. سأكتبها هنا. سأكتب بالضبط ما هو موجود أعلاه. لديك Q1 و K1 حتى Q1 و KN. ثم نكرر

67:59

Speaker A

ذلك هنا. نضعها هنا. كرر ذلك هنا. الآن، إذا أضفت V هنا، فستحصل على V1 VN. لذا، قم مرة أخرى بضرب المصفوفات، وستحصل هنا على حاصل ضرب هذا في هذا، بالإضافة إلى حاصل ضرب هذا في هذا، بالإضافة إلى حاصل ضرب هذا في

68:33

Speaker A

هذا، وصولًا إلى هنا. لديك إذًا مجموع Q1، KI، VI، ونفس الشيء حتى مجموع QN، KI، VI. باختصار ، أردت فقط أن أقول إن التعبير عن شيء ما كدالة لعملية التشابه هذه والقيم هو أمر يمكنك تمثيله جيدًا باستخدام المصفوفات،

69:24

Speaker A

وسترى هذه الصيغة كثيرًا. أعتقد أنه كان هناك سؤال في الامتحان النصفي. لذا، تلميح: هذه الصيغة قد تكون مهمة. والآن بعد أن عرفنا تعريف الانتباه الذاتي وكيفية عمله، سنرى خلال الـ 17 دقيقة القادمة كيف يُستخدم الانتباه الذاتي في بنية المحول، وهي

69:49

Speaker A

البنية التي تم تقديمها في ورقة " الانتباه هو كل ما تحتاجه". لماذا سُميت بهذا الاسم؟ حسنًا، في ذلك الوقت، كانت معظم النماذج متكررة. كانت هذه النماذج تعتمد على الشبكات العصبية المتكررة (RNN)، لذا كانت تُجري العمليات الحسابية بطريقة تكرارية. لكن ما نقوله

70:20

Speaker A

هنا هو أننا لا نهتم بالاحتفاظ بحالات مخفية من خلال التكرار عبر الرموز. لن نفعل ذلك. ما نفعله بدلاً من ذلك هو السماح للرموز بالتفاعل مع بعضها البعض من خلال اتصالات مباشرة، أي من خلال الانتباه الذاتي، ولهذا السبب يُعدّ

70:41

Speaker A

الانتباه هو كل ما نحتاجه. نُشرت هذه الورقة البحثية في سياق الترجمة الآلية. في هذا السياق، نهتم بترجمة نص مصدر، لنفترض أنه باللغة الإنجليزية، إلى لغة أخرى، لنفترض أنها الفرنسية. ولدينا مكونان في المحوّل.

71:06

Speaker A

على اليسار، لدينا ما نسميه المُشفّر. دور المُشفّر هو حساب تمثيلات ذات معنى للنص المصدر المُدخل.

71:22

Speaker A

ولدينا الجزء الثاني من المحوّل، وهو المُفكّك. ويتمثل دور المُفكِّك في استخدام التمثيلات ذات الدلالة من المُشفِّر ، بالإضافة إلى بعض التضمينات الداخلية التي يحسبها، وذلك لتوليد الترجمة. هذا هو السياق الذي طُرح فيه المُحوِّل، وقد حقق أداءً رائعًا، وهو

71:52

Speaker A

يُشكِّل أساس نماذج اللغة الحديثة، وهذا هو سبب تركيزنا عليه. لهذا السبب نحن هنا. سبب كتابتي لهذه الصيغ على السبورة هو أنني أعتقد أن هذه الصيغة هي الأهم فيما يتعلق بالمُحوِّلات. لذا، فإن تصورها من حيث ضرب المصفوفات أمرٌ في

72:16

Speaker A

غاية الأهمية. حسنًا، ما سنفعله الآن هو استعراض كل مُكوِّن من مُكوِّنات المُحوِّل، ورؤية كيفية ترابطها.

72:28

Speaker A

وأنا أنظر إليكم فيما يتعلق بتضمينات الموضع. سنتحدث عن هذا الآن. في الترجمة الآلية، ما تحصل عليه كمدخل هو نص بلغة المصدر، ومهمتك هي ترجمة هذا النص من لغة المصدر إلى لغة الهدف.

72:55

Speaker A

إذن، مهمتك الأولى هي فهم موضوع النص الأصلي . لديك هنا تضمين إدخال مُكلّف بتحويل هذا النص إلى رموز، ثم ربط كل رمز بتضمين يمكنك تعلمه. هذا التضمين خاص بكل رمز على حدة، ولا يُراعي السياق بأي شكل من الأشكال. ما

73:26

Speaker A

عليك فعله هو إضافة تضمين مرتبط بموقع الرمز في التسلسل. من هنا نتعلم مواقع الرموز. لذا، نجمع تضمين الرمز مع تضمين الموقع. قد تتساءل: كيف نحصل على تضمين الموقع ؟ هناك طرق مختلفة. جرب المؤلفون طريقتين: الأولى هي تعلم التضمين، والثانية هي

74:06

Speaker A

استخدام دالة تعتمد على ترددات مختلفة. هناك بعض الإيجابيات والسلبيات، لكنني أعتقد أن طريقة التعلم طبيعية جدًا، لكن من سلبياتها الواضحة أنه إذا كان لديك نص إدخال أطول مما تعلمته أثناء التدريب، فمثلاً إذا كان لديك ألف رمز كمدخل، لكنك تعلمت فقط

74:33

Speaker A

تمثيلات المواضع حتى 500، فلن تتمكن من تمثيل مواضع أكبر من ذلك. لهذا السبب، قد يكون التمثيل المُحدد مسبقًا مفيدًا. أريد فقط أن أوضح لماذا يُعد اختيار ترددات مختلفة طريقة جيدة لتمثيل شيء مثل الموضع . لنفترض أن لديك ساعة،

75:03

Speaker A

وقد تلاحظ أنك تمثل الوقت بساعة، مثلاً، مع الدقائق، وكلها تدور بترددات مختلفة. فإذا أردت قراءة الوقت ، 449، أي أربعة، وهي الساعة، ثم الدقائق، ثم الثواني، وكل منها يدور بتردد مختلف، وإذا جمعتها معًا، يمكنك معرفة الوقت بدقة. هذه هي الفكرة

75:36

Speaker A

وراء وجود متجه من العناصر التي تتغير بترددات مختلفة. يمكنك الحصول على ذلك باستخدام دالتي الجيب وجيب التمام، وهذا ما يُستخدم هنا. الميزة الجيدة في هذه التمثيلات هي أن المواضع المتقاربة متشابهة جدًا، بينما المواضع المتباعدة مختلفة. هذه إحدى الخصائص المفيدة. هذه

76:06

Speaker A

إحدى طرق تمثيل المواضع. على أي حال، ربما أطلتُ الحديث. سنتحدث أكثر عن المواضع لاحقًا، ولكن باختصار، يمكننا تمثيل الرموز مع مواضعها. في هذه المرحلة، أضفنا تضمين الرمز وتضمين الموضع.

76:28

Speaker A

وهنا نصل إلى المُشفِّر. المُشفِّر هو مُكوِّن المُحوِّل المُكلَّف بحساب تمثيلات ذات معنى للرموز. لدينا هنا نوع مهم جدًا من الطبقات يُسمى طبقة الانتباه، أو طبقة الانتباه الذاتي. فماذا تفعل طبقة الانتباه الذاتي ؟ ما يفعله هو حساب تمثيلات الرموز كدالة

76:58

Speaker A

لجميع الرموز الأخرى. وهنا يحدث ما يُعرف بمفتاح وقيمة الاستعلام. ستلاحظ ذلك في المثال الذي سيشرحه شيرمان. الفكرة هي تعلم مصفوفات الإسقاط التي تسمح لك بإسقاط رموزك في فضاء من الاستعلامات والمفاتيح والقيم، مما يسمح لها بالتفاعل من خلال الصيغة التي

77:26

Speaker A

رأيناها. هذا يسمح لك بتمثيل رموزك كدالة لرموز أخرى. ثم لديك طبقة أخرى تُسمى " مُغذّي الشبكة العصبية"، وهي طريقة لهيكلك لإسقاط التمثيلات في فضاءات ذات أبعاد أعلى، بالإضافة إلى دالة تنشيط تسمح لك بتعلم اللاخطية. عند المرور عبر المُشفّر، ستحصل

78:09

Speaker A

في نهايته على تمثيل ذي معنى لكل رمز، وهو دالة لجميع الرموز في التسلسل. الآن، عندما تريد ترجمة النص، تأخذ الرمز الخاص الذي رأيناه في البداية، نهاية التسلسل، عفواً بداية التسلسل. إذن، تخبر نموذجك أنك تريد بدء عملية التوليد.

78:35

Speaker A

تُدخل تسلسل البداية كمدخل للمفكك. تُضيف ترميز الموضع المرتبط بهذا الرمز المميز، وهو العنصر الأول في التسلسل. ثم تُدخل المفكك الذي يقوم بأمرين. أولًا، لديه آلية انتباه ذاتي تتعلق بالرمز المميز نفسه وجميع الرموز المميزة التي تم توليدها حتى الآن.

79:12

Speaker A

يحاول التعبير عن كل رمز مميز كدالة لنفسه ولجميع الرموز المميزة التي تم توليدها حتى الآن. في حالة بداية التسلسل، يكون الرمز المميز هو الوحيد الذي تم توليده حتى الآن. هذا كل شيء.

79:28

Speaker A

ثانيًا، لديك طبقة انتباه ثانية من نوع مختلف، حيث تسمح لتمثيلات الرموز المميزة التي تم توليدها حتى الآن بالتفاعل مع الرموز المميزة من مصدر الإدخال من لغة المصدر . لست متأكدًا مما إذا كان بإمكانك رؤية سهم واحد في الرسم

79:57

Speaker A

التوضيحي، وهو يمثل ما تم توليده حتى الآن، وسهمين آخرين قادمين من المشفر. إذن، الخطأ الوحيد في النموذج المُولّد حتى الآن هو الاستعلام، حيث تأتي المفاتيح والقيم من المُشفّر لأنك تسأل نفسك كيف يُمكنني التعبير عن هذه الكلمة كدالة لجميع الكلمات

80:20

Speaker A

في النص المُدخل. هل هذا واضح؟ حسنًا. ممتاز. بعد ذلك، تُطبّق ذلك، ثم لديك طبقة أخرى تُسمى " التدريب" للشبكة العصبية، والتي تُتيح لنموذجك تعلّم طرق إسقاط بياناتك، وفي النهاية تحصل على تمثيل ذي معنى للكلمة التي مررتها كمدخل. في

80:49

Speaker A

هذه الحالة، لديك في البداية بداية التسلسل، وفي نهاية المُفكّك لديك تمثيل ذو معنى لتلك الكلمة.

81:03

Speaker A

ما تفعله هو إسقاط هذا التمثيل على فضاء المفردات، فتحصل على احتمالات تُطابق ما تعتقد أنه الكلمة التالية. وبالتالي، فإن الترجمة هنا هي ببساطة تحديد الكلمة التالية. إذن، عليك تحديد الرمز المميز التالي، ثم اختياره بناءً على الاحتمالات ، ثم تكرار ذلك بطريقة

81:32

Speaker A

تصاعدية تلقائية. بعد ذلك، تُدخل الرمز المميز المُفكَّك كمدخل لفك التشفير، وتُكرر ما ذكرته تمامًا. لدينا خمس دقائق. لديّ بعض الحيل لأخبركم بها، لكنني أريد التأكد من أننا جميعًا على دراية بالموضوع. لذا، سأفتح باب النقاش في حال وجود أي أسئلة. لقد

81:55

Speaker A

رأينا الكثير من الأشياء، بالمناسبة، وهذه المحاضرة الأولى هي على الأرجح من أصعب المحاضرات من حيث عدد المفاهيم التي نتناولها. لذا، من الطبيعي تمامًا أن تشعروا بأننا قد رأينا الكثير. هل لديكم أي أسئلة حول هذا؟ نعم.

82:13

Speaker A

السؤال هو: هناك أسهم متعددة تندمج في سهم واحد. حسنًا، هذا لأننا لم نرَ ذلك من قبل. هذه حيلة يمكننا رؤيتها الآن. ربما تقصدون هذه، وهي الاتصالات المتبقية.

82:26

Speaker A

هذه في الواقع حيلةٌ تُساعد نموذجك على التعلّم بشكلٍ أفضل. هذه الوصلات المتبقية مفيدةٌ جدًا في البنى العميقة لأنها تسمح لنموذجك بتمرير الميزات مباشرةً بدلًا من تعديلها بواسطة طبقةٍ فرعية.

82:50

Speaker A

إحدى الطرق التي أُفضّل التفكير بها هي بدلًا من اعتبار كل طبقةٍ بمثابة تعديلٍ للمدخل بأكمله، أي بدلًا من القول إن طبقتي تُغيّر المدخل فقط (لنفترض أن مدخلك هو x)، بدلًا من القول إن مُخرجات الطبقة هي دالةٌ لـ x، فإن

83:19

Speaker A

مُخرجات طبقتك هي دالةٌ لـ x زائد x. الطريقة التي أُفضّل التفكير بها هي كأنك تأخذ X وتُعدّله بدلًا من تغييره بالكامل.

83:41

Speaker A

عمليًا، يُساعد هذا في الانتشار العكسي ويُمكّن نموذجك من التعلّم بشكلٍ أفضل. هذا ما يُشير إليه هذا السهم. حسنًا. بالحديث عن الحيل، لديّ بعض الحيل الأخرى لأُخبرك بها. إحداها هي تطبيع التنشيطات بما يُسمى تطبيع الطبقة. لذا فهو يساعد أيضًا في

84:08

Speaker A

التقارب. ربما رأيت مصطلح "الانتباه الذاتي المقنّع" في وحدة فك التشفير. والسبب في كونه مقنّعًا هو أنك تريد أن تتفاعل الرموز التي تم فك تشفيرها فقط مع الرموز التي تم فك تشفيرها حتى الآن، لأنه لا يمكنك التفاعل مع الرموز التي لم يتم

84:29

Speaker A

فك تشفيرها بعد. الانتباه متعدد الرؤوس. ما وصفته باستخدام QKV، حسنًا، يمكنك القيام به بطرق مختلفة. يمكنك تعلم إسقاطات مختلفة. لذا بالنسبة لأولئك منا الذين لديهم معرفة بنماذج الرؤية، من منا لديه خلفية في الرؤية هنا؟ حسنًا، أولًا، ثانيًا. حسنًا، في حال

84:54

Speaker A

كنت تعرف، عندما يتعلق الأمر بشبكات العصبونات الالتفافية ، فعند إجراء عملية الالتفاف، يمكنك استخدام عدة مرشحات، وهي طرق مختلفة للالتفاف على مدخلاتك.

85:09

Speaker A

لذا فإن وجود رؤوس انتباه مختلفة هو أيضًا طريقة لنموذجك لتعلم طرق مختلفة لتعلم نفس الشيء من خلال مصفوفات إسقاط مختلفة. وعادةً ما يكون لديك h من هذه الرؤوس. خدعة أخرى هي التسرب. من منكم سمع بتقنية التسرب (Dropout)؟ حسنًا، ممتاز. نعم،

85:32

Speaker A

هذه فكرة لا تقتصر على نموذج Transformer فحسب، بل تُستخدم على نطاق واسع . إنها تقنية يتم فيها، أثناء التدريب، حذف بعض الوحدات عمدًا باحتمالية معينة، لكي لا يعتمد النموذج بشكل كبير على بعض الميزات، مما يسمح له بالتعميم بشكل أفضل. وماذا عن

86:00

Speaker A

تقنية تنعيم التصنيفات؟ نعم، إنها تقنية أخرى استُخدمت هنا. تقوم فكرة تنعيم التصنيفات على توجيه النموذج للتنبؤ بالكلمات التالية، فبدلًا من أن نقول "يا له من يوم جميل"، بدلًا من أن نقول "أريدك أن تتنبأ بكلمة يوم بنسبة 100%"، يقول النموذج إنه

86:22

Speaker A

يستطيع التنبؤ بكلمة يوم، ولكن ليس بنسبة 100 %، بل بكلمات أخرى، لأن اللغة تسمح بتكوين الكلمات بطرق مختلفة مع الحفاظ على صحتها.

86:34

Speaker A

لذا، يمكن أن نقول "يا له من يوم جميل"، "يا له من فصل جميل"، "يا له من مساء جميل". على أي حال ، تعمل تقنية تبسيط التصنيفات على تلطيف هذه التصنيفات، فبدلاً من أن يتوقع النموذج هذا التصنيف بدقة تامة (100%)، يُطلب

86:58

Speaker A

منه أن يتوقعه بنسبة 90% ، بينما تمثل النسبة المتبقية (10%) باقي الكلمات في المفردات.

87:18

Speaker A

هذا يسمح للنموذج بالتعميم بشكل أفضل، وقد وجد الباحثون أن هذا يحسن أيضًا مقاييس الترجمة الآلية.

87:29

Speaker A

بالنسبة لمن يعرفون مقياس "الأزرق"(blue)، وهو أحد هذه المقاييس، وأود أن أتركه لشيرفين . شكرًا لك يا أفين. في هذا الجزء الأخير، سنجمع كل ما تحدث عنه أفين في مثال واحد، ونرى كيف تعمل هذه العملية الحسابية في مثال محدد. كما ذكرت،

87:56

Speaker A

فإن المحول الأصلي مُخصص للترجمة الآلية. سنأخذ جملة باللغة الإنجليزية، وسنحاول ترجمتها إلى لغة أخرى.

88:08

Speaker A

في مثال ورقة المحوّل الأصلية، استخدموا الفرنسية والألمانية. لنأخذ هذا المثال ولنبدأ بمثال لعبتنا المفضلة: دب لطيف يقرأ.

88:20

Speaker A

وكما تتذكرون، فإن الخطوة الأولى هي التجزئة. وقد ذكر آين أنها طريقة لتقسيم الكلمات إلى وحدات أساسية. وأشار إلى أن الكلمات الفرعية هي الطريقة المثلى لذلك.

88:38

Speaker A

ولكن لأغراض هذا المثال، سأستخدم تقسيمًا آخر لإثبات أنه عشوائي. لنفترض أننا قسمناها هكذا. وكما ذكرت، لدينا أيضًا رموز خاصة، مثل بداية الجملة ونهايتها، والتي تُستخدم لتحديد بداية ونهاية التسلسل. الآن، دعونا نرى كيف نُشفّرها. لدينا في هذه البنية جدول بحث

89:09

Speaker A

مُكوّن من أوزان قابلة للتعلم، وهذا ما نسميه التضمينات، وسيتم تعلمها كجزء من عملية التعلم. وكما ذكر أحدهم هنا، إذا أردتَ تطبيق الانتباه بطريقةٍ تراعي السياق وتعرف مواقع الرموز الأخرى، فأنت بحاجة إلى معلومات الموقع.

89:33

Speaker A

وتضع ورقة المحول الأصلية هذه المعلومات في بداية المدخلات، لذا تُضاف بشكلٍ جمعي. لنفترض أنك تُسمّي تضمينك بحجم D نموذجًا. سيكون تضمين الموقع، الذي وصفته بسلسلة من الإشارات والترددات المختلفة، متجهًا بنفس الطول، وعملية جمعه جمعية. في هذه المرحلة، ستحصل على

90:03

Speaker A

تضمين قابل للتعلم بنسبة 50%على الأقل. لذا ، فإن جدول البحث الذي ذكرته لك قابل للتعلم على الأقل. ربما تكون المواقع قابلة للتعلم أيضًا، وهذا ما ستُدخله إلى المُشفّر.

90:19

Speaker A

ماذا يحدث بعد ذلك؟ لكل رمز هذا التمثيل، ويمكنك تمثيله في شكل مصفوفة. حسنًا، لنبدأ.

90:31

Speaker A

ستنتقل الآن إلى المُشفِّر، وكما رأينا، فإنّ المكوّن الأول فيه هو طبقة الانتباه الذاتي. ستقوم بإسقاط هذا المُدخل في فضاء الاستعلامات. ولذلك، لديك مصفوفة إسقاط WQ.

90:53

Speaker A

ستحصل على استعلامات بنفس التضمينات الأولية. ستقوم بإسقاطها على المفاتيح. وبالتالي، ستحصل على مصفوفة إسقاط WQ W K التي ستتعلم إسقاطها على المفاتيح K، وستفعل الشيء نفسه مع القيم V. حسنًا، ممتاز. بعد ذلك، بناءً على ذلك، ستطبق الصيغة التي ذكرناها، وهي

91:21

Speaker A

صيغة softmax بالغة الأهمية، وسنقوم بضرب المصفوفات، ثم نحصل على مصفوفة أخرى بنفس أبعاد المصفوفة V. قبل أن نتعمق في التفاصيل، أريد فقط أن نتفق على مفهوم الأبعاد، لأننا تحدثنا كثيرًا عن التضمينات هنا. نقوم بإسقاط الأشياء، وأريد فقط التأكد من

91:50

Speaker A

أننا نتحدث بنفس اللغة فيما يتعلق بحجم هذه الكائنات. لذا، فإنّ تسلسل الإدخال الخاص بك، كما ذكرنا، طوله n.

92:03

Speaker A

إحدى الرموز المستخدمة لوصف حجم التضمين هي نموذج D. تقوم مصفوفات الإسقاط Q و K و V بتحويل عالم D إلى عالم الاستعلام، ثم عالم المفاتيح، ثم عالم القيم. لذا، يكون حجم كل مصفوفة إسقاط D هو DQ، وبالمثل D هو DK، D

92:34

Speaker A

هو DV. وبذلك، نحصل على مفاتيح وقيم الاستعلامات بحجم n صف ، موزعة على فضاء مفاتيح وقيم الاستعلام. عدد الأعمدة هو DQ و DK و DV.

92:55

Speaker A

ولأننا نجري عملية ضرب المصفوفات، نحتاج إلى شرط أن يكون DQ مساويًا لـ DK. لذا، استخدمتُ DQ و DK هنا لتسمية العناصر بشكل صحيح، ولكن يجب أن يكون DQ مساويًا لـ DK بحسب التصميم. وهذا ما نحصل عليه. كل شيء على ما

93:16

Speaker A

يرام حتى الآن. حسنًا، ممتاز. لنتوقف لحظة، ثم نعود إلى هذا المثال لنرى كيف تتم عملية حساب المصفوفات.

93:32

Speaker A

كما ذكر آين سابقًا، يمكن تمثيل كل رمز مميز بتضمين صف، وهذا ينطبق على Q. إذا أخذنا منقولة K في الاعتبار، فسيكون كل عمود هو تضمين لمتجه معين. عند إجراء عملية ضرب المصفوفات، ستحصل على مصفوفة بحجم n × n، حيث

93:58

Speaker A

تمثل كل خلية فيها قيمة تشابه، مثل حاصل الضرب النقطي الدقيق بين استعلام معين ومفتاح معين. لنفترض أنك ضربت هذا في v.

94:16

Speaker A

ستحصل في النهاية على استعلام معين لكل صف. تقوم بإسقاطه على فضاء المفاتيح الموجودة في جملتك. ستحصل على توزيع احتمالي للمفاتيح، ثم تستخدم هذه الأوزان لترجيح القيم، ثم تجمع كل هذه القيم. الآن قد تقول: حسنًا يا شفين وآشين، "

94:45

Speaker A

نتحدث عن qkranspose v، هذه ليست الصيغة الصحيحة." وهذا صحيح: الصيغة تقريبًا هي كالتالي. نستخدم دالة softmax للحصول على توزيع احتمالي مجموعه يساوي واحدًا ويتمتع بخصائص جيدة. ومن الأمور التي لم نذكرها، والتي اختارها المؤلفون، هي ضرورة التطبيع بمعامل معين، لأن البُعد dk K

95:11

Speaker A

يؤثر على التباين الناتج عن المجموع. لذا، لضمان التطبيع الصحيح، يمكن القسمة على الانحراف المعياري. وهذا ما يحدث هنا. وكما ذكرنا، هذه عملية متعددة المراحل، أي أنها لا تُنفذ مرة واحدة، بل ثماني مرات. تتم عملية تعلم الاستعلامات والمفاتيح والقيم

95:44

Speaker A

بالتوازي، ثم في النهاية يتم دمج جميع دوال softmax لـ KQ و Q و krpose على الجذر التربيعي لـ DK\*V، لنحصل على مصفوفة إسقاط نهائية تُسمى WO، والتي تُعيد هذه التضمينات في الفضاء H DV إلى النموذج. ومن الخصائص الجيدة في

96:10

Speaker A

المحول أن العديد من العمليات تجعل البُعد الأصلي للتضمينات ثابتًا. إذن، تبدأ بنموذج D، ثم تُجري سلسلة من حسابات الانتباه، لتنتهي بنموذج D آخر. بعد ذلك، تنتقل إلى الطبقة التالية، وهي شبكة عصبية أمامية مُدربة، تتكون من طبقة مخفية واحدة، تُسقط تمثيل

96:35

Speaker A

نموذج D هذا في DFF1. عادةً ما يكون لديك بُعد أكبر من النموذج للسماح بتعلم تمثيلات معقدة. وتُكرر كل ذلك عدة مرات. في ورقة Transformer الأصلية، قيمة Big N تساوي ستة. تُكرر هذه العملية عدة مرات.

96:56

Speaker A

في نهاية المُشفِّر، يكون لديك لكل رمز تمثيل يُمثله بطريقة واعية بالسياق ومُتعلمة. هل كل شيء واضح حتى الآن؟ ممتاز.

97:16

Speaker A

أسأل لأننا سننتقل إلى المُفكِّك. أريد فقط التأكد من أن كل شيء منطقي. الآن، كما ذكرنا، يُستخدم Transformer الأصلي في الترجمة الآلية. لذا، عليك البدء من بداية الجملة المُترجمة. إحدى طرق فرض البداية هي استخدام رمز نائب.

97:41

Speaker A

بإضافة رمز POS هذا، والاطلاع على جدول البحث الخاص بالتضمينات، ستجد تضمينًا أوليًا، ثم تضيف إليه تضمين الموضع، وبعد ذلك تُمرره إلى وحدة فك التشفير. وهنا يأتي دور طبقة الانتباه الذاتي التي ذكرها آشين، وهي طبقة انتباه ذاتي مُقنّعة، لأنها

98:02

Speaker A

تعمل بطريقة سببية. ينظر كل رمز إلى نفسه وإلى الرموز التي تسبقه. وبمجرد حدوث ذلك، تنتقل إلى طبقة انتباه أخرى تُسمى الانتباه المتقاطع، حيث يكون الاستعلام هو الرمز الذي تم فك تشفيره، بينما تكون المفاتيح والقيم هي الرموز القادمة من

98:27

Speaker A

وحدة التشفير. لذا، عند النظر إلى مجموعة وحدات التشفير، ثم إلى تضمين الإخراج، ستحصل كل طبقة من طبقات وحدة فك التشفير، أي كل وحدة فك تشفير، على هذا التضمين الأخير كمفاتيح وقيم. حسنًا، بعد ذلك، كما هو الحال في المُشفِّر، لديك

98:47

Speaker A

طبقة من الشبكة العصبية الأمامية المُلائمة التي تسمح بتعلم الميزات المعقدة، ثم لديك طبقة خطية، ثم طبقة سوفتماكس التي تُحوِّل هذه التمثيلات إلى توزيع احتمالي على فضاء الكلمات، أي على فضاء المفردات، للتنبؤ بالكلمة التالية. سنرى في المحاضرات القادمة ما هي الطرق

99:16

Speaker A

الاستدلالية لاختيار الكلمة التالية. لنفترض أننا اخترنا القيمة القصوى. باختيار القيمة القصوى، تعرف الكلمة التي تنبأنا بها، ثم تُعيدها كمدخل إلى المُفكِّك وتُكرِّر العملية نفسها. هنا نُدخل بداية التسلسل، فنحصل على الرمز التالي، وهو ما يُعادل كلمة "دب تيدي"، وهكذا،

99:43

Speaker A

ثم نحصل في النهاية على التسلسل في اللغة الهدف، ونُكرِّر ذلك حتى نصل إلى رمز نهاية التسلسل. عندها نعلم أنه يجب إيقاف عملية الترجمة. حسنًا، هكذا نبدأ بجملة في لغة معينة وننتهي بجملة في اللغة المستهدفة. هل لديكم أي أسئلة حتى

100:13

Speaker A

الآن؟ نعم. التعليق هنا هو: يبدو الأمر معقدًا. لو أردنا تلخيص ما يجعله يعمل، فماذا سيكون؟ حسنًا، الانتباه هو كل ما نحتاجه. عنوان الورقة البحثية يترجم قليلاً إلى "السر". طبقة الانتباه هنا هي المفتاح. سنرى في المحاضرات القادمة أننا نتخلى عن الكثير

100:42

Speaker A

من هذه الأشياء ونعتمد على مجموعة فرعية من هذه المكونات نكررها مرارًا وتكرارًا. لذا، طبقة الانتباه هذه هي المفتاح. ثم هناك الشبكة العصبية ذات التغذية الأمامية حيث توجد معظم معلمات الشبكة. إذا حسبت معلمات نموذجك بدقة، ستدرك أن هذه المعلمات

101:02

Speaker A

تحتوي على معظم السعة، وهنا يحدث التعلم. لذا ، إذا سألتني عن هذين الأمرين، والباقي مجرد حيل لتحسين التعلم، ثم بالطبع جودة البيانات التي تمثل طبقة أخرى من التعقيد. نعم. نعم. إذن ، السؤال هو: هل يمكنك التحدث أكثر عن الجزء

101:26

Speaker A

المُقنّع؟ إنها خدعة حسابية حيث تستخدم مصفوفة مثلثية لإخفاء بعض روابط طبقة الانتباه الذاتي، وأثناء التدريب تمنع هذه المصفوفة الروابط التي لا ينبغي معرفتها من الظهور. هذا هو جوهر الأمر. نعم، بالضبط.

101:50

Speaker A

السؤال هو: كيف يرتبط هذا بدالة softmax؟ لديك قيم سالبة لا نهائية، ثم ستكون النتيجة صفرًا. على سبيل المثال، دالة softmax لقيمة سالبة لا نهائية تساوي صفرًا. هذه هي العلاقة. نعم. نعم. لكن هذه خدع حسابية أكثر.

102:06

Speaker A

أعتقد أن أهم شيء يجب مراعاته هو تجاهل جميع الروابط من رمز معين، وجميع الروابط التي نجحت. أعتقد أن هذا جيد بما فيه الكفاية كنموذج ذهني. نعم.

102:20

Speaker A

حسنًا. رائع. نعم. السؤال هنا يتعلق بالاستخدامات المختلفة لدالة softmax. تلك المستخدمة في طبقات الانتباه الذاتي وطبقات الانتباه المتقاطع لها وظيفة مختلفة عن تلك المستخدمة في الطبقة الأخيرة. يجب أن تنظر إلى العناصر الموجودة في طبقة الانتباه على أنها إسقاط للاستعلام على

102:42

Speaker A

فضاء المفاتيح. ما نفعله هو إسقاط تمثيل رمز معين عبر الرموز، بينما طبقة softmax الأخيرة لها وظيفة مختلفة، وهي محاولة التنبؤ بالرمز التالي.

102:58

Speaker A

لذا، بمعنى ما، نعم، أفهم ذلك. أعتقد أنها نقطة رائعة أننا نستخدم هذه الوظيفة عدة مرات لأغراض مختلفة. أعتقد أن هذا كان صحيحًا. السؤال هو: لماذا لا يحتوي الانتقال على بداية التسلسل؟ بل يحتوي عليها. نعم، إنه الرمز الأول هنا. أوه، نعم.

103:20

Speaker A

الرمز الأول هنا هو عنصر نائب للتنبؤ بالرمز التالي الذي يليه. لذا، فهو لا يأتي كمخرج للمفكك، بل هو مدخل له. ثم ما تحصل عليه كمخرج للمفكك، والذي يجب أن تنتبه إليه، هو نهاية التسلسل، لأن هذه هي النقطة التي يجب أن

103:37

Speaker A

تتوقف عندها. نعم. حسنًا. رائع. وبعد كل هذا، أودّ أن أؤكد لكم أن ما عرضناه اليوم ليس سوى البداية. فنحن في عام ٢٠١٧، وكما تعلمون، فقد ظهرت استخدامات عديدة لهذه التقنية التي تُشغّل الآن جميع برامج الدردشة الآلية التي نستخدمها. لذا،

104:01

Speaker A

سنتناول في المحاضرات القليلة القادمة كيفية تدريب هذه النماذج. ثم في الجزء الثاني من المحاضرة، سنتناول كيفية استخدام هذه النماذج لتشغيل الأنظمة التي نتفاعل معها ونستخدمها اليوم، وكيف يمكن توظيفها في أنظمة متعددة. شكرًا لكم على حسن استماعكم، وأتمنى لكم عطلة نهاية

104:22

Speaker A

أسبوع رائعة.

Topics: المحولات نماذج اللغة الكبيرة الذكاء الاصطناعي التعلم الآلي معالجة اللغة الطبيعية Stanford MIT CME 295 نماذج ماجستير القانون تدريس

ذاكر هذا الفيديو

- [بطاقات تعليمية من هذا الفيديو](https://sozai.app/ar/tools/ai-flashcard-generator/?from=transcript&id=73767)
- [اختبار عن هذا الفيديو](https://sozai.app/ar/tools/quiz-generator/?from=transcript&id=73767)

مجاني، يصنعه الذكاء الاصطناعي من هذا النص المفرَّغ. دون تسجيل.


---
This is the markdown twin of https://sozai.app/transcript/youtube-video-transcript-433/ — the same content, without the markup.
Published by SozAI (https://sozai.app). Reuse and quotation are allowed with attribution and a link back.
Machine-readable index: https://sozai.app/llms.txt · data API: https://sozai.app/api/
