الذكاء الاصطناعي

نماذج الانتشار (Diffusion Models): كيف تُولَّد الصور من الضوضاء؟

شرح تقني معمّق لنماذج Diffusion، الفكرة الرياضية، الفرق بين DDPM و DDIM و Latent Diffusion، وكيف تعمل Stable Diffusion و Midjourney و DALL-E 3 من الداخل.

فريق مقالات، قسم التقنية ٤ سبتمبر ٢٠٢٦ 6 دقيقة قراءة

منذ 2022، Diffusion Models أصبحت التقنية المهيمنة على توليد الصور والفيديو بالذكاء الاصطناعي. Midjourney, DALL-E 3, Stable Diffusion, Flux, Sora، كلها تعتمد عليها. هذا شرح تقني معمّق لكيفية عملها.

الحدس المبدئي

تخيّل عملية "إتلاف تدريجي":

  1. تبدأ بصورة نظيفة.
  2. تضيف قليلاً من الضجيج → لا تزال مرئية.
  3. تكرّر 1000 مرّة → صورة عشوائية بالكامل (ضجيج نقي).

السؤال العبقري: ماذا لو دربنا نموذجاً على عكس هذه العملية؟

  • نبدأ من ضجيج عشوائي.
  • في كل خطوة، النموذج يُخمّن "ما شكل الصورة قبل إضافة الضجيج؟"
  • نصل تدريجياً لصورة نظيفة جديدة لم يرها من قبل.

الرياضيات المبسّطة

العملية الأمامية (Forward Diffusion)

تدريجياً نضيف ضجيجاً غاوسياً:

x_t = √(1-β_t) · x_{t-1} + √(β_t) · ε
  • x_0 = الصورة الأصلية.
  • x_T = ضجيج كامل (T ~ 1000).
  • β_t = جدول ضجيج (يزيد مع t).
  • ε ~ N(0, I) = ضجيج غاوسي.

خاصّية جميلة: يمكننا الانتقال مباشرة لأي x_t بمعادلة مغلقة، دون المرور بكل الخطوات.

العملية العكسية (Reverse Diffusion)

نُدرّب شبكة عصبية ε_θ(x_t, t) لتوقّع الضجيج المُضاف في الخطوة t.

دالة الخسارة:

L = ||ε - ε_θ(x_t, t)||²

نأخذ صورة نظيفة، نضيف ضجيجاً معلوماً، ونُدرّب النموذج على توقّع هذا الضجيج.

عند التوليد:

  1. ابدأ من x_T ~ N(0, I).
  2. لكل t من T إلى 1:
    • توقّع الضجيج ε_θ(x_t, t).
    • أزل جزءاً منه: x_{t-1} = f(x_t, ε_θ).
  3. النتيجة: x_0 = صورة نظيفة جديدة.

المعمارية: U-Net

U-Net هو النموذج المُستخدم لتوقّع الضجيج:

  • بدأ في التصوير الطبّي 2015.
  • شكل حرف U: encoder (تقليل الحجم) + decoder (إعادة البناء) + skip connections بينهما.
  • يحفظ التفاصيل عالية التردّد.

في Diffusion:

  • المدخل: صورة مضوضَأة + الخطوة الزمنية t.
  • المخرج: توقّع الضجيج (بنفس أبعاد المدخل).

التطوّرات الرئيسية

1. DDPM (2020، Ho et al.)

Denoising Diffusion Probabilistic Models، أوّل تطبيق ناضج. جودة صور أفضل من GAN على CIFAR-10.

2. DDIM (2020)

Denoising Diffusion Implicit Models، يُقلّل عدد الخطوات المطلوبة (من 1000 إلى 20-50) دون خسارة جودة كبيرة. ضروري للاستخدام العملي.

3. Classifier-Free Guidance (2021)

تقنية لتوجيه التوليد نحو شرط معيّن (نصّ مثلاً):

ε_final = ε_uncond + w · (ε_cond - ε_uncond)
  • w = "guidance scale" (عادةً 5-15).
  • أعلى = التزام أكثر بالنصّ لكن جودة أقلّ أحياناً.

4. Latent Diffusion (2021)

High-Resolution Image Synthesis with Latent Diffusion Models، الابتكار الذي أطلق Stable Diffusion.

المشكلة: صورة 512×512×3 = 786432 قيمة. Diffusion عليها يحتاج قوّة حاسوبية هائلة.

الحلّ:

  1. VAE Encoder: يضغط الصورة إلى فضاء latent (مثلاً 64×64×4 = 16384 قيمة).
  2. Diffusion في فضاء latent (أرخص 50x).
  3. VAE Decoder: يعيد بناء الصورة النهائية.

النتيجة: Stable Diffusion يعمل على GPU منزلي (8-16 GB).

5. Cross-Attention للشرط النصّي

  • النصّ يُحوَّل لـ embeddings (CLIP في SD 1.x/2.x، T5 في SD 3، Flux).
  • في كل طبقة من U-Net، Cross-Attention يُتيح للصورة "الالتفات" للنصّ.

Stable Diffusion، التسلسل الزمني

  • 1.4/1.5 (أغسطس 2022): الإطلاق العام. مفتوح تماماً. ثورة.
  • 2.0/2.1 (نوفمبر 2022): تحسينات لكن جودة إبداعية أضعف بسبب تنظيف بيانات التدريب.
  • XL (يوليو 2023): جودة أعلى بكثير، دعم prompts معقّدة.
  • 3 (فبراير 2024): بنية جديدة (MMDiT بدل U-Net)، جودة نصّ محسَّنة.
  • 3.5 (أكتوبر 2024): إصدار أفضل، مع مخاوف ترخيص.
  • Flux (Black Forest Labs، أغسطس 2024): بدأه مؤسّسو Stability السابقون. جودة تنافس Midjourney.

Midjourney

  • شركة بحث خاصة (لم تنشر تفاصيل تقنية).
  • يعتمد أيضاً على Diffusion + Latent + CLIP-like guidance.
  • تركيز على الجودة الجمالية، تفوّق عام على Stable Diffusion منذ v5.
  • V6 (2024)، V7 (2025) قفزات نوعية.

DALL-E 3 (OpenAI)

  • بُنيَ فوق DALL-E 2.
  • ابتكار: استخدام GPT-4 لـ "إعادة صياغة" الـ prompt قبل التوليد، يُنتج prompts أدقّ وأوصف.
  • جودة نصّ في الصور ممتازة (لافتات، شعارات).

ControlNet والامتدادات

ControlNet (2023، Zhang et al.): يُضاف لـ Stable Diffusion لتحكّم دقيق:

  • Canny edges: تُعطي الحواف، يُلوّنها.
  • OpenPose: تُعطي هيكل بشري، يُلبسه.
  • Depth: تُعطي خريطة عمق، يُنشئ مشهداً 3D.
  • Scribble: رسمة تخطيطية → صورة كاملة.

LoRA (Low-Rank Adaptation): fine-tuning خفيف لـ Stable Diffusion:

  • تدريب على 20-100 صورة (شخصية، أسلوب، منتج).
  • ملفات صغيرة (~150MB).
  • الأساس لآلاف النماذج المخصّصة على CivitAI و Hugging Face.

توسّع للفيديو

Sora (OpenAI، 2024) و Veo (Google، 2024):

  • تعميم Diffusion من الصور إلى الفيديو.
  • التحدّي: الاتّساق الزمني بين الإطارات.
  • الحلّ: Diffusion Transformers (DiT) بدل U-Net.

Runway Gen-3, Kling بدائل تجارية.

تسريع الاستدلال

Latent Consistency Models (LCM): توليد بـ 2-4 خطوات فقط.

SDXL Turbo, SD3 Turbo: نسخ مقطّرة تولّد في خطوة واحدة أو خطوتين، سريعة جداً، جودة مقبولة.

Distillation: نموذج طالب صغير يتعلّم من نموذج معلّم كبير.

Diffusion خارج الصور

الصوت

  • AudioLDM, Stable Audio: توليد موسيقى وأصوات بيئة.

النصّ

  • محاولات (Diffusion-LM) لكن Transformer اللي فاز حالياً.

الجزيئات

  • RFDiffusion لتصميم البروتينات.
  • توليد جزيئات دوائية جديدة.

التصميم ثلاثي الأبعاد

  • Dream Gaussian, Zero-1-to-3 لتوليد نماذج 3D.

المشاكل والتحدّيات

1. البطء

كل خطوة = مرور كامل عبر U-Net الضخم. حتى مع تحسينات، توليد صورة 1024x1024 = 5-30 ثانية.

2. التحيّز

بيانات التدريب من الإنترنت = تحيّزات ثقافية وعنصرية. "طبيب" في SD 1.5 = ذكر أبيض 90% من الوقت.

3. حقوق النشر

  • نماذج تُدرَّب على صور محمية.
  • دعاوى قضائية (Getty Images ضد Stability AI 2023).
  • Adobe Firefly ادّعى تدريباً على بيانات مرخّصة فقط.

4. Deepfakes وسوء الاستخدام

  • الوجوه الواقعية أصبحت سهلة التوليد.
  • تايلور سويفت 2024 (صور مزيّفة انتشرت واسعاً).
  • الحاجة لعلامات مائية (SynthID من Google) وقوانين تنظيمية.

5. جودة النصّ في الصور

Diffusion يُعاني في كتابة نصّ صحيح. SD3, DALL-E 3, Flux حسّنوا هذا لكن لا يزال يُخفق أحياناً.

استخدامات عملية

  • تصميم منتجات: تصوّر أفكار قبل التصنيع.
  • مواد تسويقية: صور موقع، إعلانات، سوشيال ميديا.
  • قصص مصوّرة، فنّ مفهومي للألعاب والأفلام.
  • تصور معماري: تحويل رسمة لصورة واقعية.
  • موضة: تصميم قطع افتراضية قبل الإنتاج.

المستقبل

  • Diffusion Transformers (DiT) يحلّ محلّ U-Net.
  • Multi-modal Diffusion: نموذج واحد يُنتج صورة + صوت + فيديو.
  • Real-time Diffusion: توليد أثناء الحديث.
  • Personalization: نموذج يتعلّم أسلوبك في دقائق.

للاستزادة


اقرأ أيضاً:

هل أفادك هذا المقال؟

كن أول من يقيّم

الأسئلة الشائعة

نماذج تتعلّم توليد صور بعكس عملية 'إتلاف تدريجي بالضوضاء'. نبدأ من ضجيج عشوائي كامل، وفي كل خطوة النموذج يزيل جزءاً من الضجيج، حتى نصل لصورة نظيفة. تُشبه نحت تمثال من كتلة رخام.
الفكرة الأصلية 2015 (Sohl-Dickstein). التطبيق العملي المُنجز 2020 في ورقة DDPM (Ho et al.). ثمّ Stable Diffusion 2022 جعلها متاحة للجميع بجعلها تعمل في فضاء latent أصغر، تحسين ضخم في الكفاءة.
GAN يُدرَّب مولّد+مُميِّز يتنافسان، سريع لكن غير مستقرّ. Diffusion يُدرَّب على إزالة الضجيج تدريجياً، أبطأ (10-50 خطوة) لكن أكثر استقراراً وجودة. Diffusion هيمن على توليد الصور منذ 2022.
عبر Cross-Attention مع embedding نصّي من CLIP أو T5. الوصف النصّي يُشفَّر لمتّجه، ونموذج Diffusion يُشرَط عليه، في كل خطوة إزالة الضجيج، ينظر للنصّ ليُوجّه الصورة نحو المعنى المطلوب.
الابتكار الذي جعل Stable Diffusion ممكناً. بدل توليد صورة كاملة (512×512×3 = 786k قيمة)، نُدرِّب في فضاء أصغر (64×64×4 = 16k). VAE يُحوّل الصورة → فضاء latent → صورة. تسريع ضخم.
امتداد لـ Stable Diffusion يُتيح التحكّم الدقيق في الصورة المُولَّدة عبر شرط إضافي: صورة رسمة تخطيطية، pose بشري، عمق، حواف. تُنتج صوراً تحترم البنية المُدخلة مع تفاصيل جديدة.
توسّع للفيديو (Sora, Veo) والصوت (audio diffusion) والنماذج ثلاثية الأبعاد. تحسينات السرعة (LCM, Turbo، خطوة واحدة أو خطوتين). تكامل مع LLMs في نماذج multimodal.

مقالات ذات صلة

نشرة مقالات الأسبوعية

اشترك تصلك أحدث المقالات + مختارات نادرة كل أحد. بلا سبام، ألغي الاشتراك بضغطة.

لا نشارك بريدك مع أي طرف ثالث. راجع سياسة الخصوصية.

التعليقات

بريدك لن يظهر ولن يُرسل إليه شيء — يُستخدم فقط لمنع الإزعاج.

لا تعليقات بعد — كن أول من يكتب.