DeepSeek: الشركة الصينية التي هزّت وول ستريت
قصّة DeepSeek، من شركة صينية غير معروفة إلى بطل التكلفة المنخفضة الذي أطلق R1 وأسقط أسهم NVIDIA 600 مليار دولار في يوم واحد.
في يناير 2025، شركة صينية لم يسمع بها أحد أسقطت أسهم NVIDIA 17% في يوم واحد، فقدان 600 مليار دولار من القيمة السوقية. الاسم: DeepSeek. النموذج: R1. الرسالة: الاحتكار الأمريكي على AI الحدودي ينكسر.
من أين جاءت؟
High-Flyer، صندوق تحوّط كمّي (Quant Hedge Fund) صيني تأسّس 2016. مؤسّسه Liang Wenfeng (بن مدينة صغيرة، خرّيج جامعة تشجيانغ).
السرّ: High-Flyer اشترى 10,000 GPU من A100 بين 2019-2021، قبل أن يفكّر أحد جدياً في LLMs. كانت للتداول الكمّي، لكنها أصبحت الأساس.
2023: Liang قرّر تحويل جزء من قدرة GPU للذكاء الاصطناعي. أُسّست DeepSeek كفرع بحثي.
التسلسل الزمني للنماذج
DeepSeek Coder (نوفمبر 2023)
نموذج برمجة أوّلي بأحجام 1B-33B. Apache 2.0.
DeepSeek LLM (نوفمبر 2023)
7B و 67B نماذج عامّة.
DeepSeek-V2 (مايو 2024)
- 236B معامل MoE، 21B نشطة.
- Multi-Head Latent Attention (MLA)، ابتكار جوهري.
- سعر API: $0.14 لكل مليون token، أرخص 100× من GPT-4.
MLA: تُقلّل حجم KV cache بشكل كبير عبر ضغط تمثيلي، تسريع استدلال ضخم.
DeepSeek-V2.5 (سبتمبر 2024)
تحسينات على V2.
DeepSeek-V3 (ديسمبر 2024)
- 671B معامل MoE، 37B نشطة.
- تدريب FP8 (نصف دقّة عن BF16)، توفير 50% ذاكرة/كلفة.
- ادّعوا تدريب بـ 5.6 مليون دولار (حوالي 2000 GPU × 55 يوم × سعر ساعة).
- ينافس GPT-4o.
الأوراق البحثية، DeepSeek نشرت تفاصيل تقنية معمّقة (أكثر من OpenAI/Anthropic).
DeepSeek-R1 (يناير 2025)
النموذج الذي هزّ العالم.
- منافس مباشر لـ OpenAI o1 في الاستدلال.
- Chain-of-Thought مُدرَّب عبر Reinforcement Learning.
- GRPO، خوارزمية RL جديدة بديلاً عن PPO المُكلف.
- MIT License، مفتوح تماماً.
R1-Zero (نسخة تجريبية): بدأت من نموذج أساسي بدون SFT، تعلّمت الاستدلال بالكامل عبر RL. حقّقت نتائج مذهلة بلا بيانات بشرية موجَّهة.
R1: نسخة أكثر صقلاً (SFT + RL)، الإصدار العام.
التقطير (Distillation): DeepSeek أطلقت نُسخاً مُقطَّرة صغيرة (1.5B, 7B, 14B, 32B, 70B) قابلة للتشغيل محلياً.
DeepSeek-V3.1 وما بعده (2025-2026)
تحسينات مستمرّة، توسّع في القدرات المتعدّدة الوسائط.
ماذا صنع "لحظة DeepSeek"؟
27 يناير 2025:
- تطبيق DeepSeek يقفز إلى #1 في Apple App Store الأمريكي.
- الوسائل الأمريكية تكتشف "شركة صينية بذكاء GPT-4 مجّاناً".
- NVIDIA -17% (سعر السهم).
- Meta, Microsoft, Alphabet كلهم يفقدون ~5-10%.
السبب النفسي:
- الاعتقاد السائد كان: تدريب النماذج الحدودية = عشرات مليارات $$.
- DeepSeek قال: يمكن بالملايين.
- إذا صحّ = كل استثمار في مراكز البيانات مبالَغ فيه؟
التحقيقات لاحقاً:
- الأرقام تقديرية بشكل مضلّل (لا تشمل التدريب المسبق، البيانات، البنية التحتية).
- التكلفة الحقيقية على الأرجح 50-100 مليون $$ لا 6.
- مع ذلك، كفاءة DeepSeek حقيقية 10-20× أفضل من OpenAI.
الابتكارات التقنية
1. Multi-Head Latent Attention (MLA)
المشكلة: KV cache في Attention يستهلك ذاكرة هائلة أثناء الاستدلال.
الحلّ في MLA:
- ضغط K و V إلى تمثيل latent مضغوط.
- استخراجهما ديناميكياً عند الحاجة.
- توفير 60-90% من KV cache.
2. DeepSeekMoE
تحسين MoE مع:
- Fine-grained experts: خبراء أصغر عدداً أكبر (256 خبير بدل 8).
- Shared experts: خبير مشترك دائماً نشط + متخصّصون.
- توزيع أفضل للحمل بين الخبراء.
3. تدريب FP8
كل نموذج قبل V3 يُدرَّب بـ FP16 أو BF16 (16 بت لكل رقم).
V3 يُدرَّب بـ FP8 (8 بت)، نصف الذاكرة، دقّة قريبة (بفضل تقنيات ضبط دقيقة).
4. GRPO (Group Relative Policy Optimization)
بديل خفيف لـ PPO في RLHF.
- لا يحتاج Value Network منفصلة (توفير ذاكرة كبير).
- يستخدم مقارنة داخل مجموعة بدل نموذج مكافأة معياري.
- أرخص، أسرع، مماثل الجودة.
البيئة الصينية
السياق الجيوسياسي:
- الحكومة الأمريكية حظرت بيع H100 و A100 لبكين.
- الشركات الصينية تستخدم H800 و H20 (نسخ مُقيَّدة سرعة).
- بعضها استوردت GPUs عبر أطراف ثالثة.
Response صيني:
- Huawei Ascend 910B، منافس محلّي (لكن أقلّ نضجاً).
- استثمارات ضخمة في نماذج مفتوحة.
- التركيز على الكفاءة (لأن الحصول على GPU أصعب).
الرقابة والقيود
API الرسمي لـ DeepSeek:
- يرفض أسئلة سياسية حسّاسة: تيان آنمن 1989، تايوان، الأويغور، تبت.
- يُقدّم إجابات "قانونية صينية" على أسئلة معيّنة.
النموذج المفتوح:
- الرقابة مطبَّقة في مستوى الـ system prompt، لا في أوزان النموذج.
- إذا شغّلته محلياً بلا الـ system prompt الرسمي، يُجيب على معظم الأسئلة.
- يمكن للمطوّرين تجاوز القيود بسهولة.
للمستخدم العربي: هذا يعني حرّية أكبر في الاستخدام المحلّي مقابل قيود في API.
الدعم العربي
التقييم الواقعي:
- DeepSeek يفهم العربية.
- الجودة أقلّ من GPT-4o و Claude 3.5.
- أفضل من Grok والنماذج المفتوحة الأصغر.
- استدلال رياضي/برمجي بالعربية = جيّد.
- كتابة أدبية عربية = ضعيف.
الأسعار (API)
- DeepSeek-Chat: $0.14 / مليون token input، $0.28 output.
- DeepSeek-Reasoner (R1): $0.55 / مليون input، $2.19 output.
للمقارنة:
- GPT-4o: $2.50 input, $10.00 output.
- Claude 3.5 Sonnet: $3.00 input, $15.00 output.
DeepSeek 5-10× أرخص.
المشاكل والتحفّظات
1. البيانات الشخصية
- API صيني = البيانات في الصين تحت قوانين بيجين.
- لبيانات حسّاسة، لا تستخدم API، شغّل محلياً.
2. الجودة في اللغات الأصغر
- العربية، الهندية، اللغات الأفريقية = ضعيف.
3. التكامل مع الأدوات
- Tool use, function calling أقلّ نضجاً من OpenAI.
- الأنظمة البيئية (integrations) أضعف.
4. الشفافية المشكوك فيها
- الأرقام "6 مليون دولار" قد تكون مضلّلة.
- بعض benchmarks قد تكون overfit.
الأثر على السوق
قبل DeepSeek:
- الاعتقاد: قدرة AI الحدودية = رأسمال ضخم = قلّة مطلقة.
- سعر API GPT-4 ثابت (بلا ضغط تنافسي).
بعد DeepSeek:
- OpenAI اضطرّت لخفض الأسعار.
- Meta سرّعت Llama 4.
- Google/Anthropic راجعت استراتيجياتها.
- الفكرة: الكفاءة > الحجم، تعيد رسم الاقتصاد.
المستقبل
- V4, R2 متوقّعان 2025-2026.
- توسّع multimodal (صور، صوت، فيديو).
- منافسة أكبر مع Alibaba Qwen و Zhipu GLM في الصين.
- ضغط مستمرّ على أسعار السوق العالمية.
ماذا يعني للسعودية والعرب؟
فرص:
- نماذج قوّية مفتوحة يمكن استضافتها محلياً، سيادة كاملة على البيانات.
- تكاليف أقلّ = تطبيقات AI أكثر جدوى اقتصادية.
تحدّيات:
- الاعتماد على تقنية صينية له تبعات جيوسياسية.
- HUMAIN و ALLaM يجب أن تُبرز تمايزها العربي.
اقرأ أيضاً:
هل أفادك هذا المقال؟
الأسئلة الشائعة
مقالات ذات صلة
الذكاء الاصطناعي العام (AGI): هل قريب؟ الجدل الكامل
شرح لجدل AGI، ما هو تعريفه الحقيقي، آراء Sam Altman و Demis Hassabis و Yann LeCun و Gary Marcus، الاختبارات المقترحة، والتوقّعات الواقعية للوصول إليه.
AGI و Superintelligence، النقاش الحقيقي بلا خيال
شرح تفصيلي للذكاء العام (AGI) والذكاء الفائق (ASI): التعاريف، المتفائلون، المتحفّظون، ماذا يعني للحياة اليومية.
مصنّعو رقائق الذكاء الاصطناعي، NVIDIA، AMD، TSMC، Intel
دليل لصناعة رقائق AI: NVIDIA، AMD، Intel، Broadcom، TSMC، Samsung، الحصص، الحرب الجيوسياسية، والسعودية.
نشرة مقالات الأسبوعية
اشترك تصلك أحدث المقالات + مختارات نادرة كل أحد. بلا سبام، ألغي الاشتراك بضغطة.
لا نشارك بريدك مع أي طرف ثالث. راجع سياسة الخصوصية.