نماذج الانتشار (Diffusion Models): كيف تُولَّد الصور من الضوضاء؟
شرح تقني معمّق لنماذج Diffusion، الفكرة الرياضية، الفرق بين DDPM و DDIM و Latent Diffusion، وكيف تعمل Stable Diffusion و Midjourney و DALL-E 3 من الداخل.
منذ 2022، Diffusion Models أصبحت التقنية المهيمنة على توليد الصور والفيديو بالذكاء الاصطناعي. Midjourney, DALL-E 3, Stable Diffusion, Flux, Sora، كلها تعتمد عليها. هذا شرح تقني معمّق لكيفية عملها.
الحدس المبدئي
تخيّل عملية "إتلاف تدريجي":
- تبدأ بصورة نظيفة.
- تضيف قليلاً من الضجيج → لا تزال مرئية.
- تكرّر 1000 مرّة → صورة عشوائية بالكامل (ضجيج نقي).
السؤال العبقري: ماذا لو دربنا نموذجاً على عكس هذه العملية؟
- نبدأ من ضجيج عشوائي.
- في كل خطوة، النموذج يُخمّن "ما شكل الصورة قبل إضافة الضجيج؟"
- نصل تدريجياً لصورة نظيفة جديدة لم يرها من قبل.
الرياضيات المبسّطة
العملية الأمامية (Forward Diffusion)
تدريجياً نضيف ضجيجاً غاوسياً:
x_t = √(1-β_t) · x_{t-1} + √(β_t) · ε
x_0= الصورة الأصلية.x_T= ضجيج كامل (T ~ 1000).β_t= جدول ضجيج (يزيد مع t).ε~ N(0, I) = ضجيج غاوسي.
خاصّية جميلة: يمكننا الانتقال مباشرة لأي x_t بمعادلة مغلقة، دون المرور بكل الخطوات.
العملية العكسية (Reverse Diffusion)
نُدرّب شبكة عصبية ε_θ(x_t, t) لتوقّع الضجيج المُضاف في الخطوة t.
دالة الخسارة:
L = ||ε - ε_θ(x_t, t)||²
نأخذ صورة نظيفة، نضيف ضجيجاً معلوماً، ونُدرّب النموذج على توقّع هذا الضجيج.
عند التوليد:
- ابدأ من
x_T~ N(0, I). - لكل t من T إلى 1:
- توقّع الضجيج
ε_θ(x_t, t). - أزل جزءاً منه:
x_{t-1} = f(x_t, ε_θ).
- توقّع الضجيج
- النتيجة:
x_0= صورة نظيفة جديدة.
المعمارية: U-Net
U-Net هو النموذج المُستخدم لتوقّع الضجيج:
- بدأ في التصوير الطبّي 2015.
- شكل حرف U: encoder (تقليل الحجم) + decoder (إعادة البناء) + skip connections بينهما.
- يحفظ التفاصيل عالية التردّد.
في Diffusion:
- المدخل: صورة مضوضَأة + الخطوة الزمنية t.
- المخرج: توقّع الضجيج (بنفس أبعاد المدخل).
التطوّرات الرئيسية
1. DDPM (2020، Ho et al.)
Denoising Diffusion Probabilistic Models، أوّل تطبيق ناضج. جودة صور أفضل من GAN على CIFAR-10.
2. DDIM (2020)
Denoising Diffusion Implicit Models، يُقلّل عدد الخطوات المطلوبة (من 1000 إلى 20-50) دون خسارة جودة كبيرة. ضروري للاستخدام العملي.
3. Classifier-Free Guidance (2021)
تقنية لتوجيه التوليد نحو شرط معيّن (نصّ مثلاً):
ε_final = ε_uncond + w · (ε_cond - ε_uncond)
w= "guidance scale" (عادةً 5-15).- أعلى = التزام أكثر بالنصّ لكن جودة أقلّ أحياناً.
4. Latent Diffusion (2021)
High-Resolution Image Synthesis with Latent Diffusion Models، الابتكار الذي أطلق Stable Diffusion.
المشكلة: صورة 512×512×3 = 786432 قيمة. Diffusion عليها يحتاج قوّة حاسوبية هائلة.
الحلّ:
- VAE Encoder: يضغط الصورة إلى فضاء latent (مثلاً 64×64×4 = 16384 قيمة).
- Diffusion في فضاء latent (أرخص 50x).
- VAE Decoder: يعيد بناء الصورة النهائية.
النتيجة: Stable Diffusion يعمل على GPU منزلي (8-16 GB).
5. Cross-Attention للشرط النصّي
- النصّ يُحوَّل لـ embeddings (CLIP في SD 1.x/2.x، T5 في SD 3، Flux).
- في كل طبقة من U-Net، Cross-Attention يُتيح للصورة "الالتفات" للنصّ.
Stable Diffusion، التسلسل الزمني
- 1.4/1.5 (أغسطس 2022): الإطلاق العام. مفتوح تماماً. ثورة.
- 2.0/2.1 (نوفمبر 2022): تحسينات لكن جودة إبداعية أضعف بسبب تنظيف بيانات التدريب.
- XL (يوليو 2023): جودة أعلى بكثير، دعم prompts معقّدة.
- 3 (فبراير 2024): بنية جديدة (MMDiT بدل U-Net)، جودة نصّ محسَّنة.
- 3.5 (أكتوبر 2024): إصدار أفضل، مع مخاوف ترخيص.
- Flux (Black Forest Labs، أغسطس 2024): بدأه مؤسّسو Stability السابقون. جودة تنافس Midjourney.
Midjourney
- شركة بحث خاصة (لم تنشر تفاصيل تقنية).
- يعتمد أيضاً على Diffusion + Latent + CLIP-like guidance.
- تركيز على الجودة الجمالية، تفوّق عام على Stable Diffusion منذ v5.
- V6 (2024)، V7 (2025) قفزات نوعية.
DALL-E 3 (OpenAI)
- بُنيَ فوق DALL-E 2.
- ابتكار: استخدام GPT-4 لـ "إعادة صياغة" الـ prompt قبل التوليد، يُنتج prompts أدقّ وأوصف.
- جودة نصّ في الصور ممتازة (لافتات، شعارات).
ControlNet والامتدادات
ControlNet (2023، Zhang et al.): يُضاف لـ Stable Diffusion لتحكّم دقيق:
- Canny edges: تُعطي الحواف، يُلوّنها.
- OpenPose: تُعطي هيكل بشري، يُلبسه.
- Depth: تُعطي خريطة عمق، يُنشئ مشهداً 3D.
- Scribble: رسمة تخطيطية → صورة كاملة.
LoRA (Low-Rank Adaptation): fine-tuning خفيف لـ Stable Diffusion:
- تدريب على 20-100 صورة (شخصية، أسلوب، منتج).
- ملفات صغيرة (~150MB).
- الأساس لآلاف النماذج المخصّصة على CivitAI و Hugging Face.
توسّع للفيديو
Sora (OpenAI، 2024) و Veo (Google، 2024):
- تعميم Diffusion من الصور إلى الفيديو.
- التحدّي: الاتّساق الزمني بين الإطارات.
- الحلّ: Diffusion Transformers (DiT) بدل U-Net.
Runway Gen-3, Kling بدائل تجارية.
تسريع الاستدلال
Latent Consistency Models (LCM): توليد بـ 2-4 خطوات فقط.
SDXL Turbo, SD3 Turbo: نسخ مقطّرة تولّد في خطوة واحدة أو خطوتين، سريعة جداً، جودة مقبولة.
Distillation: نموذج طالب صغير يتعلّم من نموذج معلّم كبير.
Diffusion خارج الصور
الصوت
- AudioLDM, Stable Audio: توليد موسيقى وأصوات بيئة.
النصّ
- محاولات (Diffusion-LM) لكن Transformer اللي فاز حالياً.
الجزيئات
- RFDiffusion لتصميم البروتينات.
- توليد جزيئات دوائية جديدة.
التصميم ثلاثي الأبعاد
- Dream Gaussian, Zero-1-to-3 لتوليد نماذج 3D.
المشاكل والتحدّيات
1. البطء
كل خطوة = مرور كامل عبر U-Net الضخم. حتى مع تحسينات، توليد صورة 1024x1024 = 5-30 ثانية.
2. التحيّز
بيانات التدريب من الإنترنت = تحيّزات ثقافية وعنصرية. "طبيب" في SD 1.5 = ذكر أبيض 90% من الوقت.
3. حقوق النشر
- نماذج تُدرَّب على صور محمية.
- دعاوى قضائية (Getty Images ضد Stability AI 2023).
- Adobe Firefly ادّعى تدريباً على بيانات مرخّصة فقط.
4. Deepfakes وسوء الاستخدام
- الوجوه الواقعية أصبحت سهلة التوليد.
- تايلور سويفت 2024 (صور مزيّفة انتشرت واسعاً).
- الحاجة لعلامات مائية (SynthID من Google) وقوانين تنظيمية.
5. جودة النصّ في الصور
Diffusion يُعاني في كتابة نصّ صحيح. SD3, DALL-E 3, Flux حسّنوا هذا لكن لا يزال يُخفق أحياناً.
استخدامات عملية
- تصميم منتجات: تصوّر أفكار قبل التصنيع.
- مواد تسويقية: صور موقع، إعلانات، سوشيال ميديا.
- قصص مصوّرة، فنّ مفهومي للألعاب والأفلام.
- تصور معماري: تحويل رسمة لصورة واقعية.
- موضة: تصميم قطع افتراضية قبل الإنتاج.
المستقبل
- Diffusion Transformers (DiT) يحلّ محلّ U-Net.
- Multi-modal Diffusion: نموذج واحد يُنتج صورة + صوت + فيديو.
- Real-time Diffusion: توليد أثناء الحديث.
- Personalization: نموذج يتعلّم أسلوبك في دقائق.
للاستزادة
- Hugging Face Diffusers، مكتبة Python للتشغيل والتدريب.
- Lil'Log Blog، أفضل شرح رياضي أونلاين.
- Fast.ai Course، دورة عملية.
اقرأ أيضاً:
هل أفادك هذا المقال؟
الأسئلة الشائعة
مقالات ذات صلة
الذكاء الاصطناعي العام (AGI): هل قريب؟ الجدل الكامل
شرح لجدل AGI، ما هو تعريفه الحقيقي، آراء Sam Altman و Demis Hassabis و Yann LeCun و Gary Marcus، الاختبارات المقترحة، والتوقّعات الواقعية للوصول إليه.
AGI و Superintelligence، النقاش الحقيقي بلا خيال
شرح تفصيلي للذكاء العام (AGI) والذكاء الفائق (ASI): التعاريف، المتفائلون، المتحفّظون، ماذا يعني للحياة اليومية.
مصنّعو رقائق الذكاء الاصطناعي، NVIDIA، AMD، TSMC، Intel
دليل لصناعة رقائق AI: NVIDIA، AMD، Intel، Broadcom، TSMC، Samsung، الحصص، الحرب الجيوسياسية، والسعودية.
نشرة مقالات الأسبوعية
اشترك تصلك أحدث المقالات + مختارات نادرة كل أحد. بلا سبام، ألغي الاشتراك بضغطة.
لا نشارك بريدك مع أي طرف ثالث. راجع سياسة الخصوصية.