الذكاء الاصطناعي

معمارية Transformer شرح كامل: الورقة التي غيّرت الذكاء الاصطناعي

شرح تقني عميق لمعمارية Transformer، الورقة الأصلية Attention Is All You Need (2017)، مكوّناتها (Self-Attention, Multi-Head, Encoder-Decoder)، ولماذا هي أساس كل نموذج لغوي حديث.

فريق مقالات، قسم التقنية ٤ سبتمبر ٢٠٢٦ 6 دقيقة قراءة

في ديسمبر 2017، نُشرت ورقة بحثية بعنوان بسيط: Attention Is All You Need. لم يتوقّع أحد أنها ستُطلق ثورة الذكاء الاصطناعي التي نعيشها اليوم. GPT, Claude, Gemini, Llama، كلها مبنية على المعمارية التي قدّمتها هذه الورقة: Transformer.

هذا المقال شرح تقني معمّق. تحذير: يحتاج بعض المعرفة الأساسية بالشبكات العصبية.

السياق: مشاكل قبل Transformer

قبل 2017، الشبكات العصبية الرئيسية لمعالجة اللغة كانت:

RNN (Recurrent Neural Networks)

  • تُعالج الكلمات تسلسلياً (واحدة تلو الأخرى).
  • كل كلمة تُغذّي "حالة داخلية" تنتقل للتالية.
  • مشكلة: بطيء (لا توازي)، ينسى المعلومات البعيدة (vanishing gradients).

LSTM/GRU

  • تحسينات على RNN تحلّ مشكلة النسيان جزئياً.
  • لا تزال تسلسلية (بطيئة).

CNN

  • سريعة (متوازية)، لكنها تلتقط علاقات محلّية فقط (نافذة صغيرة).

الحاجة: معمارية سريعة (متوازية) + قادرة على التقاط علاقات بعيدة المدى.

الفكرة الجوهرية: Attention

Attention كانت موجودة قبل 2017 كإضافة على RNN. الورقة قالت: "لا نحتاج RNN إطلاقاً، Attention وحدها كافية."

ما هو Attention؟

آلية تحسب "درجة الأهمية" لكل جزء من المدخل بالنسبة لكل جزء آخر.

مثال: في جملة "ذهب أحمد إلى المطعم لأنه كان جائعاً"

  • "هو" في "كان" يجب أن ينتبه لـ"أحمد" (فاعل)، لا لـ"المطعم".

Attention تُعلّم النموذج من ينتبه لمن، أوتوماتيكياً من البيانات.

معمارية Transformer: نظرة عامّة

المعمارية الأصلية لها جزءان: Encoder و Decoder (للترجمة الآلية، من إنجليزي لألماني مثلاً).

اليوم:

  • GPT / Claude / Llama = Decoder-only (توليد نصّ).
  • BERT = Encoder-only (فهم/تصنيف).
  • T5 / BART = Encoder-Decoder كامل.

مكوّنات كل طبقة (Layer)

كل طبقة Transformer تحوي:

  1. Multi-Head Self-Attention
  2. Feed-Forward Network (FFN)
  3. Layer Normalization + Residual Connections

نُكرّر هذه الطبقة N مرّة (12 في GPT-2 صغير، 96 في GPT-3، أكثر في النماذج الأحدث).

المكوّنات بالتفصيل

1. Tokenization

النموذج لا يرى نصّاً بل أرقاماً. نُقسّم النصّ إلى tokens (كلمات أو أجزاء كلمات) ونُعطي كل واحد رقماً.

مثال: "الذكاء الاصطناعي" ← ["الذكاء", "الاصطناعي"] ← [15234, 89012]

النماذج الحديثة تستخدم BPE (Byte Pair Encoding) أو SentencePiece.

2. Embeddings

كل token يُحوَّل إلى متّجه (vector) بأبعاد كثيرة (768 في GPT-2، 12288 في GPT-3).

هذا المتّجه يُلخّص "معنى" الـ token في فضاء رياضي.

كلمات متشابهة المعنى لها متّجهات قريبة رياضياً:

  • "ملك" - "رجل" + "امرأة" ≈ "ملكة" (المثال الكلاسيكي من Word2Vec).

3. Positional Encoding

مشكلة: Transformer لا يعرف ترتيب الكلمات (بعكس RNN). نُضيف معلومات الموقع لكل token.

الطريقة الأصلية: دوال جيب وجيب تمام بترددات مختلفة. الطرق الحديثة: Rotary Positional Embeddings (RoPE)، Alibi.

4. Self-Attention (الجوهر)

لكل token، نحسب ثلاثة متّجهات:

  • Query (Q): "ما الذي أبحث عنه؟"
  • Key (K): "ما الذي أُمثّله؟"
  • Value (V): "ما القيمة التي أُقدّمها إذا انتُبِه لي؟"

المعادلة:

Attention(Q,K,V) = softmax(QK^T / √d_k) V

بالكلمات:

  1. لكل زوج (token1, token2)، نحسب حاصل ضربهما (Q1 · K2). النتيجة = "كم يهتمّ token1 بـ token2".
  2. نُطبّق softmax → أوزان مجموعها 1.
  3. نُضرب الأوزان في Values → المخرج.

5. Multi-Head Attention

بدل حساب Attention واحد، نحسب h رأساً بالتوازي (h=8 أو 12 أو 16 عادةً).

كل رأس يتعلّم نمطاً مختلفاً:

  • رأس قد يتعلّم الروابط النحوية (فاعل-فعل).
  • رأس يتعلّم الروابط الدلالية.
  • رأس يتعلّم علاقات الضمائر.
  • إلخ.

ثمّ نُدمجهم في مخرج واحد.

6. Feed-Forward Network

بعد Attention، كل token يمرّ عبر شبكة تقليدية بطبقتين مخفيّتين (توسّع ثمّ تقلّص).

دورها: معالجة إضافية لكل token بشكل مستقلّ.

7. Layer Normalization + Residual Connections

  • Residual: نُضيف المدخل الأصلي للمخرج (شبكات ResNet). يمنع اختفاء الغراديانت في الشبكات العميقة.
  • LayerNorm: تنظيم إحصائي يُسرّع التدريب.

Decoder-only (نموذج GPT)

نماذج مثل GPT تستخدم Masked Self-Attention:

عند توقّع الكلمة رقم N، النموذج لا يرى الكلمات N+1, N+2,... (وإلا لغشّ).

هذا يسمح بتدريب توقّع الكلمة التالية بكفاءة على كل موقع في النصّ دفعة واحدة.

Encoder-Decoder (الترجمة)

  • Encoder يُشفّر الجملة المدخلة كاملة.
  • Decoder يُولّد الترجمة، مع Cross-Attention يُتيح للـ decoder أن ينتبه لـ encoder.

لماذا Transformer فاز؟

1. التوازي الكامل

RNN: يجب معالجة الكلمة 1 قبل الكلمة 2. Transformer: كل الكلمات تُعالج دفعة واحدة.

على GPU (آلاف الأنوية المتوازية)، هذا 10-100× أسرع.

2. علاقات بعيدة المدى

في RNN، المعلومة من الكلمة الأولى تضعف بعد 100 كلمة. في Transformer، كل كلمة تنتبه مباشرة لكل كلمة أخرى، لا مسافة.

3. قابلية التوسّع (Scaling)

قوانين Scaling (Kaplan et al. 2020) أظهرت: زيادة الحجم = تحسّن متوقّع.

  • GPT-2: 1.5B → GPT-3: 175B → GPT-4: ~1.7T → GPT-5:...
  • كل قفزة حجم = قفزة أداء.

4. عمومية المعمارية

نفس المعمارية تعمل على:

  • اللغة: GPT, Claude, Llama.
  • الصور: Vision Transformer (ViT).
  • البروتينات: AlphaFold 2/3.
  • الصوت: Whisper.
  • الفيديو: Sora, Veo.
  • الروبوتات: RT-2 من Google.

المؤلّفون الثمانية

باحثو Google الذين كتبوا الورقة الأصلية:

  1. Ashish Vaswani، أسّس Essential AI.
  2. Noam Shazeer، أسّس Character.AI، عاد لـ Google 2024.
  3. Niki Parmar، Essential AI.
  4. Jakob Uszkoreit، أسّس Inceptive.
  5. Llion Jones، الوحيد الذي بقي في Google (غادر 2023 لـ Sakana AI).
  6. Aidan Gomez، أسّس Cohere.
  7. Łukasz Kaiser، انضمّ لـ OpenAI.
  8. Illia Polosukhin، أسّس NEAR Protocol.

ملاحظة: كل الثمانية تقريباً غادر Google خلال 5 سنوات، من أشهر "brain drains" في تاريخ التقنية.

بدائل ناشئة

Mamba / State Space Models

  • ورقة 2023 من CMU.
  • تعقيد خطّي بدل تربيعي (Transformer O(n²) للنصوص الطويلة).
  • أداء قريب من Transformer في بعض المهام، أفضل في التسلسلات الطويلة جداً.
  • لم يُهدّد تجارياً حتى الآن، نظام Transformer + GPU + المكتبات ناضج جداً.

RWKV

هجين RNN + Transformer، سرعة استدلال أعلى.

Hyena, RetNet

بدائل بحثية أخرى.

الحدود والمشاكل

  • تعقيد تربيعي: نصّ بطول 100k token يحتاج مصفوفة Attention 100k×100k = 10 مليار قيمة.
  • الذاكرة: تكلفة رهيبة على GPU.
  • الاستدلال البطيء: كل token جديد يعيد حساب كل شيء.

تحسينات:

  • KV Caching: حفظ Keys/Values السابقة.
  • Flash Attention: تحسين استخدام ذاكرة GPU.
  • Grouped-Query Attention: مشاركة KV بين رؤوس متعدّدة.
  • Sliding Window Attention: انتباه على نافذة محدودة.

للاستزادة


اقرأ أيضاً:

هل أفادك هذا المقال؟

كن أول من يقيّم

الأسئلة الشائعة

معمارية شبكة عصبية اقترحها باحثون في Google عام 2017 تعتمد كلياً على آلية Attention بدل الشبكات المتكرّرة (RNN) والالتفافية (CNN). أساس كل نماذج اللغة الحديثة: GPT, Claude, Gemini, Llama.
ثمانية باحثين في Google، أشهرهم Ashish Vaswani و Noam Shazeer، في ورقة Attention Is All You Need التي نشرت ديسمبر 2017 في مؤتمر NeurIPS. معظمهم غادر Google لاحقاً وأسّس شركات ذكاء اصطناعي.
RNN يعالج الكلمات واحدة تلو الأخرى (تسلسلياً)، بطيء ويصعب توازي حسابه. Transformer يعالج كل الكلمات دفعة واحدة عبر Attention، أسرع بكثير على GPU، ويلتقط علاقات بعيدة المدى بشكل أفضل.
آلية تُتيح لكل كلمة في الجملة أن 'تنظر' إلى كل الكلمات الأخرى وتحسب أوزاناً، كم تعتمد على كل واحدة منها لفهم معناها. الكلمة 'هو' في 'أخي زار المتحف الذي في وسط المدينة، وقال إنه رائع' تنتبه لـ'المتحف' لا لـ'الأخ'.
بدل حساب Attention واحد، نحسب عدّة (مثلاً 8 أو 12) بالتوازي، كل رأس يتعلّم نمطاً مختلفاً من العلاقات (نحوي، دلالي، سببي). ثمّ نُدمجهم. يُشبه رؤية الجملة من زوايا متعدّدة في آنٍ واحد.
1) يتوازى بكفاءة على GPU (أسرع تدريب)، 2) يلتقط العلاقات البعيدة (أفضل فهم)، 3) يتوسّع رقمياً (نموذج أكبر = أذكى)، 4) قابل للتكيّف عبر مجالات (لغة، صور، بروتينات، صوت).
Mamba/S4 (State Space Models) تعد بأداء مماثل بتكلفة أقل للنصوص الطويلة جداً. RWKV يجمع بين RNN و Transformer. لكن حتى 2026، Transformer لا يزال المهيمن التجاري بلا منازع.

مقالات ذات صلة

نشرة مقالات الأسبوعية

اشترك تصلك أحدث المقالات + مختارات نادرة كل أحد. بلا سبام، ألغي الاشتراك بضغطة.

لا نشارك بريدك مع أي طرف ثالث. راجع سياسة الخصوصية.

التعليقات

بريدك لن يظهر ولن يُرسل إليه شيء — يُستخدم فقط لمنع الإزعاج.

لا تعليقات بعد — كن أول من يكتب.