خطوات الاستخدام
أدخل قيمة أبعاد النموذج (model dimension)، وهي عدد القنوات أو الأبعاد الكلية للمدخلات في طبقة الانتباه. في المحولات (Transformers)، يُرمز لها بـ d_model. هذه القيمة تحدد سعة النموذج وتؤثر على عدد المعلمات. تأكد من إدخال عدد صحيح موجب، مثل 768 لـ BERT أو 12288 لـ GPT-3.
أدخل عدد رؤوس الانتباه (number of attention heads)، وهو عدد الرؤوس المستقلة التي تعمل بالتوازي في طبقة الانتباه متعددة الرؤوس. يُرمز له بـ h أو num_heads. القيم الشائعة هي 12، 16، 96، إلخ. يجب أن يكون عدداً صحيحاً موجباً، وعادة ما يكون قابلاً لقسمة d_model.
سيقوم الحساب بقسمة d_model على num_heads لإعطاء بُعد كل رأس انتباه (d_k = d_model / num_heads). هذا البعد هو حجم الفضاء الذي يعمل فيه كل رأس على حدة. يجب أن تكون النتيجة عدداً صحيحاً في معظم الحالات، وإلا فقد يشير ذلك إلى خطأ في التصميم (غالباً ما تكون الرؤوس متساوية الحجم).