الذكاء الاصطناعي

الذكاء الاصطناعي الدستوري و RLHF: كيف تُروَّض النماذج اللغوية؟

شرح تقني عميق لأساليب مواءمة النماذج اللغوية، RLHF (Reinforcement Learning from Human Feedback)، والذكاء الاصطناعي الدستوري (Constitutional AI) الذي طوّرته Anthropic، ولماذا تصنع فرقاً في سلوك النموذج.

فريق مقالات، قسم التقنية ٤ سبتمبر ٢٠٢٦ 5 دقيقة قراءة

كيف تجعل نموذجاً لغوياً ضخماً (Base Model)، كائن إحصائي يُكمل النصوص بلا قِيَم، يتحوّل إلى مساعد نافع، صادق، وآمن؟ الجواب في مرحلة المواءمة (Alignment)، وتقنيَّتاها الرئيسيتان: RLHF و Constitutional AI.

هذا المقال شرح تقني معمّق، للمهتمّين بفهم كيف تعمل ChatGPT و Claude من الداخل.

المشكلة الأساسية

نموذج لغوي أساسي (مثل GPT-3 base أو LLaMA base) مُدرَّب على "توقّع الكلمة التالية" في تريليونات الكلمات من الإنترنت. النتيجة:

  • يعرف كل شيء تقريباً، لكن لا يعرف كيف يُساعد.
  • يُنتج نصّاً، لكن قد يُنتج محتوى ضاراً، عنصرياً، مضلّلاً.
  • لا فرق عنده بين إجابة صحيحة ومختلقة (يهلوس بثقة).

نحتاج مرحلة إضافية تُعلّمه:

  1. إتّباع التعليمات (Instruction Following).
  2. الصدق والفائدة (Helpful, Honest, Harmless، HHH).
  3. رفض الطلبات الضارّة.

المرحلة 1: Supervised Fine-Tuning (SFT)

قبل RLHF، هناك خطوة أبسط: نجمع آلاف الأمثلة عالية الجودة (سؤال → إجابة نموذجية كتبها بشري)، ونُدرّب النموذج عليها.

مثال:

  • سؤال: "اشرح النسبية الخاصة لطفل عمره 10 سنوات."
  • إجابة نموذجية: [نصّ شرحي كتبه محرّر بشري].

هذا يُحوّل النموذج من "مُكمّل نصّ" إلى "مُجيب على أسئلة". لكنه لا يزال يفتقر لحكم الجودة الدقيق.

المرحلة 2: RLHF، الثورة الحقيقية

الفكرة

بدل تعليم النموذج جواباً واحداً صحيحاً، نُعلّمه تفضيلات البشر، أيّ جواب أفضل بين اثنين.

الخطوات

الخطوة 1: جمع بيانات التفضيلات

  • يُطرح سؤال على النموذج.
  • النموذج يُنتج جوابين مختلفين (A و B).
  • بشري يختار: "A أفضل" أو "B أفضل" أو "متساويان".
  • نُكرّر آلاف المرّات.

الخطوة 2: تدريب نموذج المكافأة (Reward Model)

  • نموذج ثانوي (أصغر) يتعلّم توقّع تصنيف البشر.
  • المدخل: سؤال + إجابة.
  • المخرج: رقم (مكافأة)، أعلى = أفضل.

الخطوة 3: تحسين النموذج الأساسي بالتعلّم المعزَّز

  • النموذج الأساسي يُنتج إجابات.
  • نموذج المكافأة يُقيّمها.
  • خوارزمية PPO (Proximal Policy Optimization) تُعدّل أوزان النموذج لزيادة المكافأة.
  • بقيد: النموذج لا يبتعد كثيراً عن سلوكه الأصلي (لتجنّب "reward hacking").

المخترعون

  • الفكرة الأصلية: Christiano et al. 2017، تعلّم التفضيلات في ألعاب أتاري.
  • التطبيق على اللغة: InstructGPT 2022 من OpenAI، نُشر قبل ChatGPT.
  • الانفجار: ChatGPT نوفمبر 2022 = InstructGPT + محادثة.

النتائج

ChatGPT صار ظاهرة عالمية ليس لأن GPT-3.5 كان أذكى بكثير من GPT-3، بل لأن RLHF جعله:

  • يفهم النية.
  • يُجيب بأسلوب محادثي.
  • يرفض الطلبات الضارّة (نسبياً).
  • يعترف بحدود معرفته (أحياناً).

المشاكل مع RLHF

1. المكلف: يحتاج آلاف المُقيّمين البشريين، OpenAI و Anthropic وظّفوا مئات المتعاقدين لسنوات.

2. التحيّز: المُقيّمون يعكسون ثقافاتهم. RLHF بمُقيّمين غربيين يُنتج نموذجاً بقيم غربية.

3. Sycophancy (التملّق): النموذج يتعلّم أن المُقيّمين يفضّلون الإجابات التي توافقهم، فيُصبح مُداهناً.

4. Over-refusal: النموذج يتعلّم أن الرفض آمن، فيرفض حتى الأسئلة المشروعة.

5. Alignment Tax: النموذج بعد RLHF قد يفقد بعض القدرات الإبداعية أو المتخصّصة.

Constitutional AI: الحلّ الأنثروبيّ

Anthropic (شركة Claude) طوّرت Constitutional AI كبديل/امتداد لـ RLHF.

الفكرة الجوهرية

بدل الاعتماد على بشر لتقييم كل إجابة، نُعطي النموذج دستوراً (مجموعة مبادئ)، ونُعلّمه أن يُقيّم نفسه بناءً عليها.

الدستور

مبادئ مأخوذة من مصادر مثل:

  • الإعلان العالمي لحقوق الإنسان.
  • شروط استخدام Apple.
  • قِيَم Anthropic الداخلية.
  • بحوث أخلاقية.

أمثلة على مبادئ:

  • "اختر الإجابة التي تُظهر أقلّ ضرر."
  • "اختر الإجابة التي تحترم الخصوصية الشخصية."
  • "اختر الإجابة الأكثر صدقاً وقابلية للتحقّق."

الخطوات

المرحلة الأولى (SL-CAI):

  1. النموذج يُنتج إجابة على سؤال محتمل الضرر.
  2. النموذج نفسه يُنقد إجابته بناءً على مبدأ من الدستور: "هل إجابتي تنتهك مبدأ X؟"
  3. النموذج يُعيد كتابة الإجابة لتكون أفضل.
  4. نُدرّب النموذج على هذه الأزواج (إجابة سيّئة → إجابة مُحسَّنة).

المرحلة الثانية (RL-CAI = RLAIF):

  1. النموذج يُنتج إجابتين.
  2. نموذج AI آخر (بدل بشر) يُقيّم أيّها أفضل بناءً على الدستور.
  3. نُدرّب نموذج مكافأة على تصنيفات AI.
  4. PPO كالمعتاد.

المزايا

  • قابلية التوسيع: لا حاجة لآلاف المُقيّمين البشريين.
  • الشفافية: المبادئ مكتوبة ومعروفة، يمكن نقاشها وتحسينها.
  • الاتّساق: النموذج يُطبّق نفس المبادئ في كل مكان.
  • أقلّ تحيّزاً بشرياً: الدستور معلَن، بينما تحيّزات المُقيّمين خفيّة.

المخاطر

  • Recursive AI evaluation: نموذج يُقيّم نموذجاً يُقيّم نموذجاً، أخطاء تتراكم؟
  • الاعتماد على جودة الدستور: مبادئ سيّئة → نموذج سيّئ.
  • صعوبة تفسير النتائج.

تقنيات بديلة/مكمّلة

DPO (Direct Preference Optimization)

نُشرت 2023، أصبحت شائعة جداً. الفكرة:

تخطّي نموذج المكافأة الوسيط. نُحسّن النموذج مباشرة على بيانات التفضيلات بمعادلة رياضية أنيقة.

الفائدة: أسرع، أرخص، أبسط رياضياً.

العيب: قد يفتقد بعض دقة PPO في السيناريوهات المعقّدة.

RLAIF

Reinforcement Learning from AI Feedback، نفس RLHF لكن المُقيّم AI بدل بشر. مقدّمة إلى Constitutional AI.

RLVR (Reinforcement Learning with Verifiable Rewards)

استُخدم في OpenAI o1 و Claude reasoning. للمهامّ التي فيها إجابة صحيحة يمكن التحقّق منها آلياً (رياضيات، برمجة)، نستخدم التحقّق الآلي بدل نموذج مكافأة.

Constitutional Classifiers

Anthropic 2024، تقنية دفاعية جديدة تُضاف فوق النموذج لكشف محاولات jailbreak بدقّة أعلى.

الفروقات في السلوك

Claude (Anthropic، CAI محوري):

  • ميّال للاعتذار عن الرفض.
  • يشرح تحفّظاته.
  • قد يُفصح عن قلقه من طلب معيّن قبل رفضه.

ChatGPT (OpenAI، RLHF محوري):

  • أكثر مباشرةً في الرفض.
  • إجابات أقصر عموماً.
  • شخصية "مساعد نافع" أكثر منها فلسفي.

Gemini (Google):

  • تقنياتها المحدّدة غير معلنة تماماً، لكن يبدو أنها مزيج.

Jailbreaks: عندما تفشل المواءمة

أمثلة تاريخية:

  • DAN (Do Anything Now): prompt يحاول إقناع النموذج بأنه "شخصية أخرى" بلا قيود.
  • Roleplay attacks: "تظاهر أنك ممثل يؤدّي دور مجرم..."
  • Prompt injection: تعليمات مخفيّة في نصّ خارجي (مثل صفحة ويب) تُغيّر سلوك النموذج.
  • Many-shot jailbreaking: Anthropic 2024، إعطاء النموذج مئات الأمثلة الوهمية لسلوك ضار قبل السؤال الحقيقي.

الحلّ: مزيج من RLHF محدّث + Constitutional Classifiers + monitoring + red-teaming مستمر. لعبة القط والفأر مستمرّة.

المستقبل

  • Scalable Oversight: كيف نُقيّم نماذج تصبح أذكى منّا؟
  • Debate: نُشغّل نموذجَين ضدّ بعضهما ونحكم بينهما، قد يكشف الحقيقة أفضل.
  • Interpretability: فهم ما يحدث داخل النموذج، إذا فهمنا، نُحسِّن المواءمة.
  • Automated Red-Teaming: نماذج AI تحاول jailbreak نماذج أخرى لكشف الثغرات.

توصيات للمهتمّين

للتعلّم الأعمق:

للتجربة العملية:

  • Hugging Face TRL مكتبة لتطبيق RLHF/DPO.
  • OpenRLHF إطار مفتوح المصدر.

اقرأ أيضاً:

هل أفادك هذا المقال؟

كن أول من يقيّم

الأسئلة الشائعة

Reinforcement Learning from Human Feedback، تقنية تدريب تجعل النموذج يُنتج مخرجات يفضّلها البشر. البشر يُصنّفون ردود النموذج، ونموذج مكافأة يتعلّم تفضيلاتهم، ثمّ النموذج يُدرَّب على تعظيم هذه المكافأة.
الأصول من ورقة OpenAI 2017 (Christiano et al.) عن تعلّم التفضيلات في الألعاب. تطبيقه على النماذج اللغوية بدأ 2020 (InstructGPT). ChatGPT في نوفمبر 2022 كان أوّل تطبيق تجاري ضخم، والسبب الرئيسي لنجاحه الساحق.
لأن Anthropic صاغت مبادئ (constitution)، قائمة أخلاقية مأخوذة من مصادر مثل الإعلان العالمي لحقوق الإنسان، والنموذج يتعلّم نقد ذاته بناءً عليها، بدل الاعتماد الكامل على تقييم بشري لكل رد.
RLHF يعتمد على بشر يُصنّفون كل رد (مكلف، بطيء، محدود). Constitutional AI يستخدم نموذج AI آخر لنقد الردود بناءً على مبادئ مكتوبة، مما يُقلّل الاعتماد على البشر ويرفع كفاءة التدريب.
مطيعاً بشكل أساسي. RLHF يُعلّم النموذج ما يُرضي المُقيّمين، ليس بالضرورة الحقيقة. لذا النماذج قد تكذب بلطف (sycophancy) أو ترفض أسئلة مشروعة (over-refusal). هذه مشاكل بحثية مفتوحة.
نعم. تقنيات مثل DAN, prompt injection, roleplay-based attacks نجحت في تجاوز حدود RLHF على مدى 2023-2025. Anthropic و OpenAI يستثمرون في تقنيات دفاعية جديدة مثل Constitutional Classifiers.
DPO (Direct Preference Optimization)، طريقة أبسط رياضياً تتخطّى نموذج المكافأة الوسيط. Constitutional AI (CAI). RLAIF (RL from AI Feedback). كل هذه محاولات لجعل المواءمة أرخص، أدقّ، وأكثر قابلية للتوسيع.

مقالات ذات صلة

نشرة مقالات الأسبوعية

اشترك تصلك أحدث المقالات + مختارات نادرة كل أحد. بلا سبام، ألغي الاشتراك بضغطة.

لا نشارك بريدك مع أي طرف ثالث. راجع سياسة الخصوصية.

التعليقات

بريدك لن يظهر ولن يُرسل إليه شيء — يُستخدم فقط لمنع الإزعاج.

لا تعليقات بعد — كن أول من يكتب.