التعلّم المعزَّز (Reinforcement Learning): من AlphaGo إلى o1
شرح لـ RL، المفاهيم الأساسية، الأنواع (Q-Learning, PPO, DPO)، أشهر الإنجازات (AlphaGo, ChatGPT, o1)، والتطبيقات في الروبوتات والألعاب.
Reinforcement Learning غيّر مسار AI ثلاث مرّات: 2013 (DeepMind يهزم Atari)، 2016 (AlphaGo يهزم Lee Sedol)، 2022 (ChatGPT ينفجر عالمياً). هذا شرح شامل لكيف يعمل هذا النوع من الذكاء الاصطناعي.
المبدأ الأساسي
تخيّل طفلاً يتعلّم المشي:
- يحاول (يقف).
- يسقط (مكافأة سلبية).
- يحاول مرّة أخرى.
- يخطو خطوة (مكافأة إيجابية).
- يتعلّم أي حركات تصنع خطوة ناجحة.
هذا هو RL بالضبط.
المفاهيم الجوهرية
Agent
الكيان الذي يتعلّم (طفل، روبوت، LLM).
Environment
العالم الذي يتفاعل معه (الأرضية، لوحة الشطرنج، محادثة).
State (S)
وصف الحالة الحالية (موقع الطفل، ترتيب القطع، ما قاله المستخدم).
Action (A)
خيار العامل (خطوة، حركة قطعة، إجابة).
Reward (R)
الإشارة العددية بعد كل عمل (سقوط = -1، خطوة = +1، فوز = +100).
Policy (π)
استراتيجية العامل، دالة تربط الحالة بالعمل: π(a|s).
Value Function (V)
توقّع المكافأة الإجمالية من حالة معيّنة.
Q-Function
توقّع المكافأة الإجمالية من عمل معيّن في حالة معيّنة.
الحلقة الأساسية
1. العامل يرى الحالة S_t
2. يختار عملاً A_t بحسب السياسة π
3. البيئة تنتقل إلى S_{t+1}
4. البيئة تعطي مكافأة R_{t+1}
5. العامل يُحدّث سياسته
6. كرّر
الهدف: تعظيم المكافأة الإجمالية على المدى الطويل.
Exploration vs Exploitation
المفاضلة الأزلية:
- Exploitation: افعل ما تعرف أنه ينجح.
- Exploration: جرّب أشياء جديدة قد تكون أفضل.
مثال: مطعمك المفضّل ممتاز، لكن هل تجرّب مطعماً جديداً؟
الحلول:
- ε-greedy: عشوائي بنسبة ε، الأفضل بنسبة (1-ε).
- UCB (Upper Confidence Bound): توازن رياضي.
- Thompson Sampling: احتمالية.
أنواع RL
1. Model-Free
العامل لا يعرف كيف تعمل البيئة، فقط يتعلّم من التجربة.
أشهر الخوارزميات:
- Q-Learning (1989): تُحدَّث Q-table تدريجياً.
- DQN (2013، DeepMind): Deep Q-Network، Q-Learning + شبكات عصبية.
- A2C / A3C: Actor-Critic، يجمع بين تعلّم السياسة والقيمة.
- PPO (2017): الأكثر شعبية اليوم.
- SAC: للمهامّ المستمرّة (روبوتات).
2. Model-Based
العامل يبني نموذجاً للبيئة، ثم يخطّط.
- AlphaZero, MuZero: يخطّطان بـ Monte Carlo Tree Search.
- أقلّ شيوعاً لكن قوّي في مجالات معيّنة.
3. On-Policy vs Off-Policy
- On-Policy (PPO): يتعلّم من تجارب سياسته الحالية فقط.
- Off-Policy (Q-Learning, DQN): يتعلّم من أيّ بيانات (بما فيها سياسات أخرى).
اللحظات التاريخية
2013: DQN يلعب Atari
DeepMind نشرت Playing Atari with Deep Reinforcement Learning.
- شبكة عصبية واحدة تعلّمت لعب 49 لعبة Atari من الصفر.
- المدخل: pixels خام.
- المخرج: أزرار controller.
- تفوّقت على البشر في 29 لعبة.
الأثر: أوّل مرّة يجمع RL مع Deep Learning بنجاح باهر. Google اشترت DeepMind.
2016: AlphaGo يهزم Lee Sedol
Go: لعبة عمرها 3000 سنة، أعقد لعبة استراتيجية بشرية. 10^170 لوحة محتملة (مقارنة بـ 10^40 للشطرنج).
قبل AlphaGo: أفضل برامج Go كانت في مستوى هاوٍ.
AlphaGo (DeepMind، 2016):
- تدريب بـ Supervised على 30 مليون حركة بشرية.
- ثمّ Self-Play RL.
- Monte Carlo Tree Search للتخطيط.
النتيجة: هزم Lee Sedol (18 لقب عالمي) 4-1 في مارس 2016.
اللحظة الشهيرة: Move 37 في المباراة الثانية، حركة أذهلت الخبراء، احتمال بشري 1/10000.
2017: AlphaZero
- بدأ من الصفر، بلا بيانات بشرية.
- تعلّم Go, Chess, Shogi بـ Self-play فقط.
- 24 ساعة تدريب = تفوّق على أفضل المحرّكات (Stockfish للشطرنج).
- حركاته "إبداعية"، تختلف عن أسلوب البشر التاريخي.
2019: AlphaStar
- StarCraft II، لعبة استراتيجية معقّدة (اقتصاد + حرب + معلومات ناقصة).
- تعلّم من مباريات بشرية + Self-play.
- مستوى Grandmaster (أعلى 0.2%).
2020: MuZero
- تعلّم قواعد اللعبة بلا معرفة مسبقة.
- تفوّق في Go, Chess, Shogi + 57 لعبة Atari.
2022: ChatGPT
RLHF = Reinforcement Learning from Human Feedback.
- الجزء الحاسم في تحويل GPT-3 إلى ChatGPT.
- بشر يُصنّفون ردود النموذج.
- نموذج مكافأة يتعلّم تفضيلاتهم.
- PPO يُحسّن النموذج.
النتيجة: أشهر منتج AI في التاريخ.
2024: o1 من OpenAI
- RL على سلسلة التفكير (Chain of Thought).
- النموذج "يفكّر" قبل الإجابة.
- تفوّق كبير في الرياضيات، البرمجة، العلوم.
2024-2025: AlphaProof, AlphaGeometry 2
- ميدالية فضّية في الأولمبياد الرياضي الدولي 2024.
- RL + استدلال رمزي.
2024: DeepSeek R1
- مسار RL جديد: البدء من نموذج أساسي بدون SFT، مباشرة RL.
- تعلّم الاستدلال من الصفر.
- منافس o1 بتكلفة أقلّ.
RLHF بالتفصيل
الخطوات
1. Pre-training:
- نموذج ضخم على تريليونات كلمات (GPT-3 base).
2. Supervised Fine-tuning (SFT):
- 10k-100k مثال عالي الجودة (سؤال + إجابة نموذجية).
- النموذج يتعلّم الأسلوب المحادثي.
3. Reward Modeling:
- النموذج ينتج إجابتين لسؤال.
- بشر يختار الأفضل.
- نموذج مكافأة (أصغر) يتعلّم توقّع تفضيلات البشر.
4. RL Fine-tuning (PPO):
- النموذج ينتج ردوداً.
- نموذج المكافأة يُقيّمها.
- PPO يُحدّث النموذج ليحصل على مكافآت أعلى.
- مع قيد KL divergence، لا يبتعد كثيراً عن SFT النموذج.
الأدوات
- TRL من Hugging Face: مكتبة رسمية لـ RLHF.
- DeepSpeed-Chat من Microsoft.
- OpenRLHF.
DPO، البديل الأنيق
Direct Preference Optimization (يناير 2024).
المشكلة مع RLHF: معقّد، يحتاج نموذج مكافأة + PPO + KL بحسابات دقيقة.
فكرة DPO: تخطّي نموذج المكافأة. صيغة رياضية مباشرة تُدرّب النموذج من التفضيلات مباشرة.
المزايا:
- أبسط بكثير.
- أرخص (لا حاجة لتشغيل نموذج مكافأة).
- مستقرّ.
- جودة قريبة من PPO في كثير من الحالات.
التبنّي:
- Llama 3 Instruct.
- Zephyr.
- كثير من fine-tunes المفتوحة.
المنتقدون: قد يفشل في المواقف المعقّدة حيث PPO يتفوّق.
ORPO, KTO، الأحدث
ORPO (Odds Ratio Preference Optimization): يجمع SFT و preference alignment في مرحلة واحدة.
KTO (Kahneman-Tversky Optimization): مستوحى من الاقتصاد السلوكي.
الاستكشافات مستمرّة.
RL في الروبوتات
التحدّي
الروبوت لا يمكن تدريبه ملايين المرّات (يتحطّم!).
الحلّ: Sim-to-Real
- تدريب في محاكاة (MuJoCo, Isaac Sim).
- نقل السياسة لروبوت حقيقي.
- التحدّي: "reality gap"، الاختلافات بين المحاكاة والواقع.
نجاحات
- OpenAI Rubik's Cube (2019): يد آلية تحلّ مكعّب روبيك.
- Boston Dynamics Atlas: parkour، رقص.
- RT-2 (Google, 2023): يفهم أوامر لغوية.
تطبيقات أخرى
التوصيات
- YouTube, Netflix يستخدمان RL لتوصية محتوى.
- الهدف: تعظيم وقت المشاهدة (مثير للجدل أخلاقياً).
التداول المالي
- Hedge funds تُدرّب agents على أسواق تاريخية.
- تحذير: الأسواق ليست ثابتة، استراتيجية RL قد تفشل في ظروف جديدة.
الطاقة
- Google تستخدم RL لتحسين تبريد مراكز البيانات، توفير 40%.
- التحكّم بشبكات الكهرباء.
الصحّة
- تحديد جرعات علاج مخصّصة.
- تحسين مواعيد كيماوي.
القيادة الذاتية
- Waymo, Tesla يستخدمان RL في التخطيط.
- تدريب في محاكاة (بيانات حقيقية = مكلفة وخطرة).
التحدّيات
1. Sample Efficiency
RL يحتاج ملايين التجارب، للألعاب مقبول، للعالم الحقيقي صعب.
2. Reward Hacking
العامل يجد طرقاً غير متوقّعة لكسب مكافآت دون تحقيق الهدف الحقيقي.
مثال: عامل مُدرَّب على "الوصول لهدف" اكتشف أنّه إذا انقلب على الأرض، تُغلَق الشاشة ويحصل على مكافآت وهمية.
3. Sparse Rewards
في بعض المهامّ، المكافأة تأتي بعد آلاف الخطوات (لعبة شطرنج، لعبة Go). صعب التعلّم.
4. Exploration في فضاء ضخم
في مشكلات معقّدة، الاستكشاف العشوائي غير كافٍ.
5. الاستقرار
تدريب RL معروف بعدم الاستقرار، hyperparameters حسّاسة جداً.
للتعمّق
- Sutton & Barto، كتاب Reinforcement Learning: An Introduction، المرجع الكلاسيكي المجّاني.
- David Silver، دورة UCL على YouTube.
- OpenAI Spinning Up، دورة عملية.
- Hugging Face RL Course، مجّانية.
المستقبل
- RL على تفكير النماذج: أكثر مثل o1/o3.
- Multi-agent RL: أنظمة تتعاون/تتنافس.
- World Models: نماذج تتخيّل مستقبل البيئة (Ha & Schmidhuber).
- Curriculum Learning: تدريب من السهل للصعب.
- Meta-RL: تعلّم كيف تتعلّم بسرعة في مهامّ جديدة.
اقرأ أيضاً:
هل أفادك هذا المقال؟
الأسئلة الشائعة
مقالات ذات صلة
الذكاء الاصطناعي العام (AGI): هل قريب؟ الجدل الكامل
شرح لجدل AGI، ما هو تعريفه الحقيقي، آراء Sam Altman و Demis Hassabis و Yann LeCun و Gary Marcus، الاختبارات المقترحة، والتوقّعات الواقعية للوصول إليه.
AGI و Superintelligence، النقاش الحقيقي بلا خيال
شرح تفصيلي للذكاء العام (AGI) والذكاء الفائق (ASI): التعاريف، المتفائلون، المتحفّظون، ماذا يعني للحياة اليومية.
مصنّعو رقائق الذكاء الاصطناعي، NVIDIA، AMD، TSMC، Intel
دليل لصناعة رقائق AI: NVIDIA، AMD، Intel، Broadcom، TSMC، Samsung، الحصص، الحرب الجيوسياسية، والسعودية.
نشرة مقالات الأسبوعية
اشترك تصلك أحدث المقالات + مختارات نادرة كل أحد. بلا سبام، ألغي الاشتراك بضغطة.
لا نشارك بريدك مع أي طرف ثالث. راجع سياسة الخصوصية.