الذكاء الاصطناعي

DeepSeek: الشركة الصينية التي هزّت وول ستريت

قصّة DeepSeek، من شركة صينية غير معروفة إلى بطل التكلفة المنخفضة الذي أطلق R1 وأسقط أسهم NVIDIA 600 مليار دولار في يوم واحد.

فريق مقالات، قسم التقنية ٤ سبتمبر ٢٠٢٦ 5 دقيقة قراءة

في يناير 2025، شركة صينية لم يسمع بها أحد أسقطت أسهم NVIDIA 17% في يوم واحد، فقدان 600 مليار دولار من القيمة السوقية. الاسم: DeepSeek. النموذج: R1. الرسالة: الاحتكار الأمريكي على AI الحدودي ينكسر.

من أين جاءت؟

High-Flyer، صندوق تحوّط كمّي (Quant Hedge Fund) صيني تأسّس 2016. مؤسّسه Liang Wenfeng (بن مدينة صغيرة، خرّيج جامعة تشجيانغ).

السرّ: High-Flyer اشترى 10,000 GPU من A100 بين 2019-2021، قبل أن يفكّر أحد جدياً في LLMs. كانت للتداول الكمّي، لكنها أصبحت الأساس.

2023: Liang قرّر تحويل جزء من قدرة GPU للذكاء الاصطناعي. أُسّست DeepSeek كفرع بحثي.

التسلسل الزمني للنماذج

DeepSeek Coder (نوفمبر 2023)

نموذج برمجة أوّلي بأحجام 1B-33B. Apache 2.0.

DeepSeek LLM (نوفمبر 2023)

7B و 67B نماذج عامّة.

DeepSeek-V2 (مايو 2024)

  • 236B معامل MoE، 21B نشطة.
  • Multi-Head Latent Attention (MLA)، ابتكار جوهري.
  • سعر API: $0.14 لكل مليون token، أرخص 100× من GPT-4.

MLA: تُقلّل حجم KV cache بشكل كبير عبر ضغط تمثيلي، تسريع استدلال ضخم.

DeepSeek-V2.5 (سبتمبر 2024)

تحسينات على V2.

DeepSeek-V3 (ديسمبر 2024)

  • 671B معامل MoE، 37B نشطة.
  • تدريب FP8 (نصف دقّة عن BF16)، توفير 50% ذاكرة/كلفة.
  • ادّعوا تدريب بـ 5.6 مليون دولار (حوالي 2000 GPU × 55 يوم × سعر ساعة).
  • ينافس GPT-4o.

الأوراق البحثية، DeepSeek نشرت تفاصيل تقنية معمّقة (أكثر من OpenAI/Anthropic).

DeepSeek-R1 (يناير 2025)

النموذج الذي هزّ العالم.

  • منافس مباشر لـ OpenAI o1 في الاستدلال.
  • Chain-of-Thought مُدرَّب عبر Reinforcement Learning.
  • GRPO، خوارزمية RL جديدة بديلاً عن PPO المُكلف.
  • MIT License، مفتوح تماماً.

R1-Zero (نسخة تجريبية): بدأت من نموذج أساسي بدون SFT، تعلّمت الاستدلال بالكامل عبر RL. حقّقت نتائج مذهلة بلا بيانات بشرية موجَّهة.

R1: نسخة أكثر صقلاً (SFT + RL)، الإصدار العام.

التقطير (Distillation): DeepSeek أطلقت نُسخاً مُقطَّرة صغيرة (1.5B, 7B, 14B, 32B, 70B) قابلة للتشغيل محلياً.

DeepSeek-V3.1 وما بعده (2025-2026)

تحسينات مستمرّة، توسّع في القدرات المتعدّدة الوسائط.

ماذا صنع "لحظة DeepSeek"؟

27 يناير 2025:

  • تطبيق DeepSeek يقفز إلى #1 في Apple App Store الأمريكي.
  • الوسائل الأمريكية تكتشف "شركة صينية بذكاء GPT-4 مجّاناً".
  • NVIDIA -17% (سعر السهم).
  • Meta, Microsoft, Alphabet كلهم يفقدون ~5-10%.

السبب النفسي:

  • الاعتقاد السائد كان: تدريب النماذج الحدودية = عشرات مليارات $$.
  • DeepSeek قال: يمكن بالملايين.
  • إذا صحّ = كل استثمار في مراكز البيانات مبالَغ فيه؟

التحقيقات لاحقاً:

  • الأرقام تقديرية بشكل مضلّل (لا تشمل التدريب المسبق، البيانات، البنية التحتية).
  • التكلفة الحقيقية على الأرجح 50-100 مليون $$ لا 6.
  • مع ذلك، كفاءة DeepSeek حقيقية 10-20× أفضل من OpenAI.

الابتكارات التقنية

1. Multi-Head Latent Attention (MLA)

المشكلة: KV cache في Attention يستهلك ذاكرة هائلة أثناء الاستدلال.

الحلّ في MLA:

  • ضغط K و V إلى تمثيل latent مضغوط.
  • استخراجهما ديناميكياً عند الحاجة.
  • توفير 60-90% من KV cache.

2. DeepSeekMoE

تحسين MoE مع:

  • Fine-grained experts: خبراء أصغر عدداً أكبر (256 خبير بدل 8).
  • Shared experts: خبير مشترك دائماً نشط + متخصّصون.
  • توزيع أفضل للحمل بين الخبراء.

3. تدريب FP8

كل نموذج قبل V3 يُدرَّب بـ FP16 أو BF16 (16 بت لكل رقم).

V3 يُدرَّب بـ FP8 (8 بت)، نصف الذاكرة، دقّة قريبة (بفضل تقنيات ضبط دقيقة).

4. GRPO (Group Relative Policy Optimization)

بديل خفيف لـ PPO في RLHF.

  • لا يحتاج Value Network منفصلة (توفير ذاكرة كبير).
  • يستخدم مقارنة داخل مجموعة بدل نموذج مكافأة معياري.
  • أرخص، أسرع، مماثل الجودة.

البيئة الصينية

السياق الجيوسياسي:

  • الحكومة الأمريكية حظرت بيع H100 و A100 لبكين.
  • الشركات الصينية تستخدم H800 و H20 (نسخ مُقيَّدة سرعة).
  • بعضها استوردت GPUs عبر أطراف ثالثة.

Response صيني:

  • Huawei Ascend 910B، منافس محلّي (لكن أقلّ نضجاً).
  • استثمارات ضخمة في نماذج مفتوحة.
  • التركيز على الكفاءة (لأن الحصول على GPU أصعب).

الرقابة والقيود

API الرسمي لـ DeepSeek:

  • يرفض أسئلة سياسية حسّاسة: تيان آنمن 1989، تايوان، الأويغور، تبت.
  • يُقدّم إجابات "قانونية صينية" على أسئلة معيّنة.

النموذج المفتوح:

  • الرقابة مطبَّقة في مستوى الـ system prompt، لا في أوزان النموذج.
  • إذا شغّلته محلياً بلا الـ system prompt الرسمي، يُجيب على معظم الأسئلة.
  • يمكن للمطوّرين تجاوز القيود بسهولة.

للمستخدم العربي: هذا يعني حرّية أكبر في الاستخدام المحلّي مقابل قيود في API.

الدعم العربي

التقييم الواقعي:

  • DeepSeek يفهم العربية.
  • الجودة أقلّ من GPT-4o و Claude 3.5.
  • أفضل من Grok والنماذج المفتوحة الأصغر.
  • استدلال رياضي/برمجي بالعربية = جيّد.
  • كتابة أدبية عربية = ضعيف.

الأسعار (API)

  • DeepSeek-Chat: $0.14 / مليون token input، $0.28 output.
  • DeepSeek-Reasoner (R1): $0.55 / مليون input، $2.19 output.

للمقارنة:

  • GPT-4o: $2.50 input, $10.00 output.
  • Claude 3.5 Sonnet: $3.00 input, $15.00 output.

DeepSeek 5-10× أرخص.

المشاكل والتحفّظات

1. البيانات الشخصية

  • API صيني = البيانات في الصين تحت قوانين بيجين.
  • لبيانات حسّاسة، لا تستخدم API، شغّل محلياً.

2. الجودة في اللغات الأصغر

  • العربية، الهندية، اللغات الأفريقية = ضعيف.

3. التكامل مع الأدوات

  • Tool use, function calling أقلّ نضجاً من OpenAI.
  • الأنظمة البيئية (integrations) أضعف.

4. الشفافية المشكوك فيها

  • الأرقام "6 مليون دولار" قد تكون مضلّلة.
  • بعض benchmarks قد تكون overfit.

الأثر على السوق

قبل DeepSeek:

  • الاعتقاد: قدرة AI الحدودية = رأسمال ضخم = قلّة مطلقة.
  • سعر API GPT-4 ثابت (بلا ضغط تنافسي).

بعد DeepSeek:

  • OpenAI اضطرّت لخفض الأسعار.
  • Meta سرّعت Llama 4.
  • Google/Anthropic راجعت استراتيجياتها.
  • الفكرة: الكفاءة > الحجم، تعيد رسم الاقتصاد.

المستقبل

  • V4, R2 متوقّعان 2025-2026.
  • توسّع multimodal (صور، صوت، فيديو).
  • منافسة أكبر مع Alibaba Qwen و Zhipu GLM في الصين.
  • ضغط مستمرّ على أسعار السوق العالمية.

ماذا يعني للسعودية والعرب؟

فرص:

  • نماذج قوّية مفتوحة يمكن استضافتها محلياً، سيادة كاملة على البيانات.
  • تكاليف أقلّ = تطبيقات AI أكثر جدوى اقتصادية.

تحدّيات:

  • الاعتماد على تقنية صينية له تبعات جيوسياسية.
  • HUMAIN و ALLaM يجب أن تُبرز تمايزها العربي.

اقرأ أيضاً:

هل أفادك هذا المقال؟

كن أول من يقيّم

الأسئلة الشائعة

شركة صينية للذكاء الاصطناعي مقرّها هانغتشو، فرع بحثي من صندوق تحوّط اسمه High-Flyer. أسّسها Liang Wenfeng عام 2023. أشهر نماذجها DeepSeek V3 و R1 التي فاجأت العالم بأداء عالمي بتكاليف تدريب أقلّ 10-20× من المنافسين الأمريكيين.
في يناير 2025، أطلقوا R1، نموذج استدلال يُنافس OpenAI o1 لكن بتكلفة تدريب ادّعت الشركة أنها ~6 مليون دولار (مقابل 100+ مليون للمنافسين). أسهم NVIDIA انخفضت 17% (فقدان 600 مليار دولار) في يوم واحد.
ابتكارات تقنية حقيقية: DeepSeekMoE (MoE محسَّن)، Multi-Head Latent Attention (MLA)، تدريب FP8 (بدل BF16)، وقفزة في RLHF عبر GRPO. الأرقام مشكوك فيها لكن الابتكارات حقيقية.
نعم، R1, V3, وأجيال سابقة (V2, Coder) كلها تحت MIT License أو مشابهة. أوزان النماذج + الأوراق البحثية متاحة. هذا شكل يومياً معايير الشفافية في السوق.
من الناحية التقنية آمن كأي نموذج. لكن سياسياً، الشركة صينية تحت قوانين بيجين. للاستخدام الحسّاس، شغّل النموذج المفتوح محلياً بدل استدعاء API الرسمي. الرقابة الصينية على المواضيع (تايوان، تيان آنمن) موجودة في API لكن يمكن تجاوزها في self-hosted.
متساو في الاستدلال الرياضي/البرمجي. أقلّ متطوّراً في: توليد الصور، الصوت، الأدوات (tool use)، وإتقان اللغات الأصغر (بما فيها العربية). أرخص بكثير عبر API.
قصّة الحظر معقّدة. DeepSeek استخدمت H100 و H800 (نسخة مُقيَّدة للصين). خلّف الأداء المذهل: (1) تحسينات معمارية، (2) استخدام رقائق أقلّ لكن بكفاءة أعلى، (3) خبرة مالية من صندوق التحوّط الأمّ.

مقالات ذات صلة

نشرة مقالات الأسبوعية

اشترك تصلك أحدث المقالات + مختارات نادرة كل أحد. بلا سبام، ألغي الاشتراك بضغطة.

لا نشارك بريدك مع أي طرف ثالث. راجع سياسة الخصوصية.

التعليقات

بريدك لن يظهر ولن يُرسل إليه شيء — يُستخدم فقط لمنع الإزعاج.

لا تعليقات بعد — كن أول من يكتب.