معمارية Transformer شرح كامل: الورقة التي غيّرت الذكاء الاصطناعي
شرح تقني عميق لمعمارية Transformer، الورقة الأصلية Attention Is All You Need (2017)، مكوّناتها (Self-Attention, Multi-Head, Encoder-Decoder)، ولماذا هي أساس كل نموذج لغوي حديث.
في ديسمبر 2017، نُشرت ورقة بحثية بعنوان بسيط: Attention Is All You Need. لم يتوقّع أحد أنها ستُطلق ثورة الذكاء الاصطناعي التي نعيشها اليوم. GPT, Claude, Gemini, Llama، كلها مبنية على المعمارية التي قدّمتها هذه الورقة: Transformer.
هذا المقال شرح تقني معمّق. تحذير: يحتاج بعض المعرفة الأساسية بالشبكات العصبية.
السياق: مشاكل قبل Transformer
قبل 2017، الشبكات العصبية الرئيسية لمعالجة اللغة كانت:
RNN (Recurrent Neural Networks)
- تُعالج الكلمات تسلسلياً (واحدة تلو الأخرى).
- كل كلمة تُغذّي "حالة داخلية" تنتقل للتالية.
- مشكلة: بطيء (لا توازي)، ينسى المعلومات البعيدة (vanishing gradients).
LSTM/GRU
- تحسينات على RNN تحلّ مشكلة النسيان جزئياً.
- لا تزال تسلسلية (بطيئة).
CNN
- سريعة (متوازية)، لكنها تلتقط علاقات محلّية فقط (نافذة صغيرة).
الحاجة: معمارية سريعة (متوازية) + قادرة على التقاط علاقات بعيدة المدى.
الفكرة الجوهرية: Attention
Attention كانت موجودة قبل 2017 كإضافة على RNN. الورقة قالت: "لا نحتاج RNN إطلاقاً، Attention وحدها كافية."
ما هو Attention؟
آلية تحسب "درجة الأهمية" لكل جزء من المدخل بالنسبة لكل جزء آخر.
مثال: في جملة "ذهب أحمد إلى المطعم لأنه كان جائعاً"
- "هو" في "كان" يجب أن ينتبه لـ"أحمد" (فاعل)، لا لـ"المطعم".
Attention تُعلّم النموذج من ينتبه لمن، أوتوماتيكياً من البيانات.
معمارية Transformer: نظرة عامّة
المعمارية الأصلية لها جزءان: Encoder و Decoder (للترجمة الآلية، من إنجليزي لألماني مثلاً).
اليوم:
- GPT / Claude / Llama = Decoder-only (توليد نصّ).
- BERT = Encoder-only (فهم/تصنيف).
- T5 / BART = Encoder-Decoder كامل.
مكوّنات كل طبقة (Layer)
كل طبقة Transformer تحوي:
- Multi-Head Self-Attention
- Feed-Forward Network (FFN)
- Layer Normalization + Residual Connections
نُكرّر هذه الطبقة N مرّة (12 في GPT-2 صغير، 96 في GPT-3، أكثر في النماذج الأحدث).
المكوّنات بالتفصيل
1. Tokenization
النموذج لا يرى نصّاً بل أرقاماً. نُقسّم النصّ إلى tokens (كلمات أو أجزاء كلمات) ونُعطي كل واحد رقماً.
مثال: "الذكاء الاصطناعي" ← ["الذكاء", "الاصطناعي"] ← [15234, 89012]
النماذج الحديثة تستخدم BPE (Byte Pair Encoding) أو SentencePiece.
2. Embeddings
كل token يُحوَّل إلى متّجه (vector) بأبعاد كثيرة (768 في GPT-2، 12288 في GPT-3).
هذا المتّجه يُلخّص "معنى" الـ token في فضاء رياضي.
كلمات متشابهة المعنى لها متّجهات قريبة رياضياً:
- "ملك" - "رجل" + "امرأة" ≈ "ملكة" (المثال الكلاسيكي من Word2Vec).
3. Positional Encoding
مشكلة: Transformer لا يعرف ترتيب الكلمات (بعكس RNN). نُضيف معلومات الموقع لكل token.
الطريقة الأصلية: دوال جيب وجيب تمام بترددات مختلفة. الطرق الحديثة: Rotary Positional Embeddings (RoPE)، Alibi.
4. Self-Attention (الجوهر)
لكل token، نحسب ثلاثة متّجهات:
- Query (Q): "ما الذي أبحث عنه؟"
- Key (K): "ما الذي أُمثّله؟"
- Value (V): "ما القيمة التي أُقدّمها إذا انتُبِه لي؟"
المعادلة:
Attention(Q,K,V) = softmax(QK^T / √d_k) V
بالكلمات:
- لكل زوج (token1, token2)، نحسب حاصل ضربهما (Q1 · K2). النتيجة = "كم يهتمّ token1 بـ token2".
- نُطبّق softmax → أوزان مجموعها 1.
- نُضرب الأوزان في Values → المخرج.
5. Multi-Head Attention
بدل حساب Attention واحد، نحسب h رأساً بالتوازي (h=8 أو 12 أو 16 عادةً).
كل رأس يتعلّم نمطاً مختلفاً:
- رأس قد يتعلّم الروابط النحوية (فاعل-فعل).
- رأس يتعلّم الروابط الدلالية.
- رأس يتعلّم علاقات الضمائر.
- إلخ.
ثمّ نُدمجهم في مخرج واحد.
6. Feed-Forward Network
بعد Attention، كل token يمرّ عبر شبكة تقليدية بطبقتين مخفيّتين (توسّع ثمّ تقلّص).
دورها: معالجة إضافية لكل token بشكل مستقلّ.
7. Layer Normalization + Residual Connections
- Residual: نُضيف المدخل الأصلي للمخرج (شبكات ResNet). يمنع اختفاء الغراديانت في الشبكات العميقة.
- LayerNorm: تنظيم إحصائي يُسرّع التدريب.
Decoder-only (نموذج GPT)
نماذج مثل GPT تستخدم Masked Self-Attention:
عند توقّع الكلمة رقم N، النموذج لا يرى الكلمات N+1, N+2,... (وإلا لغشّ).
هذا يسمح بتدريب توقّع الكلمة التالية بكفاءة على كل موقع في النصّ دفعة واحدة.
Encoder-Decoder (الترجمة)
- Encoder يُشفّر الجملة المدخلة كاملة.
- Decoder يُولّد الترجمة، مع Cross-Attention يُتيح للـ decoder أن ينتبه لـ encoder.
لماذا Transformer فاز؟
1. التوازي الكامل
RNN: يجب معالجة الكلمة 1 قبل الكلمة 2. Transformer: كل الكلمات تُعالج دفعة واحدة.
على GPU (آلاف الأنوية المتوازية)، هذا 10-100× أسرع.
2. علاقات بعيدة المدى
في RNN، المعلومة من الكلمة الأولى تضعف بعد 100 كلمة. في Transformer، كل كلمة تنتبه مباشرة لكل كلمة أخرى، لا مسافة.
3. قابلية التوسّع (Scaling)
قوانين Scaling (Kaplan et al. 2020) أظهرت: زيادة الحجم = تحسّن متوقّع.
- GPT-2: 1.5B → GPT-3: 175B → GPT-4: ~1.7T → GPT-5:...
- كل قفزة حجم = قفزة أداء.
4. عمومية المعمارية
نفس المعمارية تعمل على:
- اللغة: GPT, Claude, Llama.
- الصور: Vision Transformer (ViT).
- البروتينات: AlphaFold 2/3.
- الصوت: Whisper.
- الفيديو: Sora, Veo.
- الروبوتات: RT-2 من Google.
المؤلّفون الثمانية
باحثو Google الذين كتبوا الورقة الأصلية:
- Ashish Vaswani، أسّس Essential AI.
- Noam Shazeer، أسّس Character.AI، عاد لـ Google 2024.
- Niki Parmar، Essential AI.
- Jakob Uszkoreit، أسّس Inceptive.
- Llion Jones، الوحيد الذي بقي في Google (غادر 2023 لـ Sakana AI).
- Aidan Gomez، أسّس Cohere.
- Łukasz Kaiser، انضمّ لـ OpenAI.
- Illia Polosukhin، أسّس NEAR Protocol.
ملاحظة: كل الثمانية تقريباً غادر Google خلال 5 سنوات، من أشهر "brain drains" في تاريخ التقنية.
بدائل ناشئة
Mamba / State Space Models
- ورقة 2023 من CMU.
- تعقيد خطّي بدل تربيعي (Transformer O(n²) للنصوص الطويلة).
- أداء قريب من Transformer في بعض المهام، أفضل في التسلسلات الطويلة جداً.
- لم يُهدّد تجارياً حتى الآن، نظام Transformer + GPU + المكتبات ناضج جداً.
RWKV
هجين RNN + Transformer، سرعة استدلال أعلى.
Hyena, RetNet
بدائل بحثية أخرى.
الحدود والمشاكل
- تعقيد تربيعي: نصّ بطول 100k token يحتاج مصفوفة Attention 100k×100k = 10 مليار قيمة.
- الذاكرة: تكلفة رهيبة على GPU.
- الاستدلال البطيء: كل token جديد يعيد حساب كل شيء.
تحسينات:
- KV Caching: حفظ Keys/Values السابقة.
- Flash Attention: تحسين استخدام ذاكرة GPU.
- Grouped-Query Attention: مشاركة KV بين رؤوس متعدّدة.
- Sliding Window Attention: انتباه على نافذة محدودة.
للاستزادة
- The Illustrated Transformer، Jay Alammar، الشرح المرئي الأفضل.
- Attention Is All You Need، الورقة الأصلية.
- Andrej Karpathy YouTube: "Let's build GPT"، بناء Transformer من الصفر.
اقرأ أيضاً:
هل أفادك هذا المقال؟
الأسئلة الشائعة
مقالات ذات صلة
الذكاء الاصطناعي العام (AGI): هل قريب؟ الجدل الكامل
شرح لجدل AGI، ما هو تعريفه الحقيقي، آراء Sam Altman و Demis Hassabis و Yann LeCun و Gary Marcus، الاختبارات المقترحة، والتوقّعات الواقعية للوصول إليه.
AGI و Superintelligence، النقاش الحقيقي بلا خيال
شرح تفصيلي للذكاء العام (AGI) والذكاء الفائق (ASI): التعاريف، المتفائلون، المتحفّظون، ماذا يعني للحياة اليومية.
مصنّعو رقائق الذكاء الاصطناعي، NVIDIA، AMD، TSMC، Intel
دليل لصناعة رقائق AI: NVIDIA، AMD، Intel، Broadcom، TSMC، Samsung، الحصص، الحرب الجيوسياسية، والسعودية.
نشرة مقالات الأسبوعية
اشترك تصلك أحدث المقالات + مختارات نادرة كل أحد. بلا سبام، ألغي الاشتراك بضغطة.
لا نشارك بريدك مع أي طرف ثالث. راجع سياسة الخصوصية.