الذكاء الاصطناعي

Embeddings في نماذج اللغة: كيف تفهم الآلة المعنى؟

شرح للـ Embeddings، كيف تُحوَّل الكلمات لمتّجهات معنى، من Word2Vec إلى نماذج OpenAI و Cohere الحديثة، واستخداماتها في البحث الدلالي والتوصيات و RAG.

فريق مقالات، قسم التقنية ٤ سبتمبر ٢٠٢٦ 6 دقيقة قراءة

Embeddings هي الجسر بين اللغة البشرية والحساب الرياضي، الطريقة التي تُحوّل الآلة بها "معنى" إلى أرقام يمكنها معالجتها. هذا المقال يشرح ما هي، كيف تعمل، وكيف تُستخدم في التطبيقات الحديثة.

المشكلة الأساسية

الحاسوب لا "يفهم" اللغة. يحتاج تمثيلاً رياضياً للنصّ يسمح بـ:

  • قياس التشابه ("قط" أقرب لـ"كلب" منها لـ"طاولة").
  • إجراء عمليات ("ملك" - "رجل" + "امرأة" = "ملكة").
  • التصنيف والبحث.

الحلّ: Embeddings، متّجهات أرقام تُمثّل المعنى.

التاريخ المختصر

1. Word2Vec (2013، Google)

Tomas Mikolov اقترح تدريب شبكة بسيطة على مهمّة بديلة:

  • CBOW: توقّع الكلمة من السياق.
  • Skip-gram: توقّع السياق من الكلمة.

النتيجة: الأوزان المُتعلَّمة تصير تمثيلات المعنى.

الاكتشاف الشهير: العلاقات الدلالية تظهر رياضياً:

  • vec("king") - vec("man") + vec("woman") ≈ vec("queen")
  • vec("Paris") - vec("France") + vec("Italy") ≈ vec("Rome")

2. GloVe (2014، Stanford)

بديل يعتمد على مصفوفات التوافق (co-occurrence) العالمية بدل النافذة المحلّية. جودة مماثلة، تدريب أسرع.

3. FastText (2016، Facebook)

يعمل على n-grams من الحروف، يتعامل مع كلمات جديدة (out-of-vocabulary) أفضل. مهمّ للغات ذات الصرف الغني كالعربية.

4. ELMo (2018، AllenAI)

أول من قدّم contextual embeddings، المتّجه يتغيّر بحسب السياق. LSTM ثنائي الاتجاه.

5. BERT (2018، Google)

ثورة. Transformer + Masked Language Modeling.

  • Embeddings سياقية عالية الجودة.
  • fine-tuning للمهمّة النهائية.

6. Sentence-BERT (2019)

BERT معدَّل لإنتاج embeddings للجمل (لا الكلمات)، أفضل بكثير للبحث.

7. النماذج الحديثة (2022-2026)

  • OpenAI text-embedding-ada-002 (2022)، قفزة تجارية.
  • text-embedding-3-small/large (2024).
  • Cohere Embed v3 (2023) مع دعم متعدد اللغات ممتاز.
  • Voyage AI، متخصّصون في embeddings.
  • BGE-M3, E5-Mistral، مفتوحة عالية الجودة.

كيف تعمل Embeddings الحديثة

التدريب

Contrastive Learning:

  1. جمع أزواج نصوص (query + relevant document).
  2. تدريب النموذج على جعل embeddings الأزواج المتشابهة قريبة، والمختلفة بعيدة.
  3. خسارة: L = -log(exp(sim(q,d+)) / sum(exp(sim(q,d_i)))).

التقنيات الحديثة:

  • Matryoshka Representation (OpenAI, 2024): متّجه واحد يعمل بأبعاد متعدّدة (تقلّص إلى 256 من 3072 مع خسارة قليلة).
  • Multilingual training: نصوص متوازية من لغات كثيرة.
  • Hard negatives: أمثلة صعبة (متشابهة سطحياً، مختلفة معنوياً).

أبعاد المتّجه

| النموذج | الأبعاد | |---|---| | Word2Vec | 100-300 | | BERT | 768 | | ada-002 | 1536 | | text-embedding-3-small | 1536 (قابل للتقليص) | | text-embedding-3-large | 3072 (قابل للتقليص) | | Cohere Embed v3 | 1024 | | BGE-M3 | 1024 |

قاعدة: أبعاد أعلى = دقّة أفضل + تكلفة أعلى (ذاكرة، سرعة).

قياس التشابه

Cosine Similarity (الأشيع)

cos(A,B) = (A·B) / (|A| × |B|)
  • النتيجة بين -1 و 1.
  • 1 = متطابق.
  • 0 = لا علاقة.
  • -1 = عكسي.

لماذا مُفضَّل؟ يتجاهل حجم المتّجه (norm) ويركّز على الاتّجاه، المعنى لا يعتمد على "طول" النصّ.

Dot Product

A·B = A₁B₁ + A₂B₂ +...

مماثل لـ Cosine إذا كانت المتّجهات مُطبَّعة (norm=1). أسرع حسابياً.

Euclidean Distance

المسافة الهندسية. أقلّ استخداماً في NLP لكنه شائع في computer vision.

Vector Databases

عندما يكون لديك ملايين المتّجهات، البحث اللينيار بطيء. Vector DBs تُتيح البحث السريع:

  • Pinecone (سحابي، الأشهر).
  • Weaviate (مفتوح المصدر + سحابي).
  • Qdrant (مفتوح، Rust، سريع).
  • Milvus (مفتوح، توسّع كبير).
  • Chroma (بسيط، ممتاز للبداية).
  • pgvector (إضافة PostgreSQL).

الخوارزميات: HNSW, IVF, PQ، تُقايض بين دقّة وسرعة. راجع مقال قواعد بيانات المتّجهات.

التطبيقات الرئيسية

1. البحث الدلالي (Semantic Search)

التقليدي: بحث بالكلمات الحرفية (BM25). "قط" لا يجد "hair". الدلالي: بحث بالمعنى. "قط" يجد "قطّة"، "hair"، "feline".

التطبيق: تُخبّئ embeddings لكل وثيقة. عند البحث، تحسب embedding الاستفسار وتجد أقرب k من المتّجهات.

2. RAG (Retrieval-Augmented Generation)

الجمع بين البحث الدلالي ونماذج التوليد. أساس معظم chatbots الشركات.

  1. المستخدم يسأل سؤالاً.
  2. نبحث في قاعدة معرفة (embeddings) عن الوثائق ذات الصلة.
  3. نُغذّي هذه الوثائق + السؤال إلى LLM.
  4. LLM يُجيب مستنداً للوثائق.

3. أنظمة التوصية

  • Spotify: embed لكل أغنية، توصية بالمتّجهات القريبة من قائمتك.
  • Netflix: embed للأفلام والمستخدمين.
  • Amazon: embed للمنتجات والمشترين.

4. Deduplication وكشف التشابه

  • Plagiarism detection: مقالات متشابهة معنوياً حتى لو أُعيدت صياغتها.
  • Product deduplication: نفس المنتج بأوصاف مختلفة.

5. Clustering

تجميع وثائق متشابهة تلقائياً، تحليل موضوعات آلاف تعليقات العملاء.

6. Zero-shot Classification

بدل تدريب مصنّف لكل فئة جديدة:

  1. embed كل فئة (نصّ الوصف).
  2. embed الوثيقة.
  3. الفئة الأقرب = التصنيف.

Embeddings للصور والفيديو

CLIP (OpenAI, 2021)

نموذج يُنتج embeddings للنصّ والصور في نفس الفضاء.

  • الاستخدام: تبحث بنصّ "قط أسود على أريكة" → يجد الصور المطابقة.
  • التدريب: 400 مليون زوج (صورة، نصّ) من الويب.
  • الأثر: أساس Stable Diffusion وأدوات كثيرة.

SigLIP, ImageBind

تحسينات لاحقة، دعم أكثر من الوسائط (صوت، فيديو، عمق).

الدعم العربي

أفضل النماذج للعربية

تجارية:

  • OpenAI text-embedding-3-large: ممتاز.
  • Cohere Embed v3 (multilingual): جيّد جداً.
  • Voyage AI: يدّعي أداءً عالياً على العربية.

مفتوحة:

  • multilingual-e5-large-instruct: قوي.
  • BGE-M3: ممتاز، من Beijing Academy.

عربية أصلية:

  • AraBERT embeddings.
  • MARBERT.

تحدّيات

  • التشكيل (تقفّز الجودة إن كان النصّ مشكولاً، معظم النماذج تتوقّع بلا تشكيل).
  • اللهجات (خليجية، مصرية، مغربية)، دقّة أقلّ من الفصحى.
  • الأخطاء الإملائية الشائعة (الألف المهموز، التاء المربوطة).

نصائح عملية

1. اختر النموذج بناءً على بياناتك

لا تعتمد على leaderboards عمياء. جهّز مجموعة اختبار من بياناتك الفعلية واختبر.

2. Chunk الوثائق بذكاء

للـ RAG:

  • Chunks صغيرة جداً (100 token) = تفقد سياقاً.
  • Chunks كبيرة جداً (2000 token) = تخفّف دقّة الاسترجاع.
  • قاعدة أوّلية: 300-800 token مع 10-20% تداخل.

3. Normalize قبل التخزين

طبّق x = x / |x| لكل متّجه. يُسرّع Dot Product = Cosine.

4. Cache الـ Embeddings

حسابها مكلف (~$0.02 لمليون token). خزّنها ولا تحسبها مرّتين.

5. أضف Metadata

لا تعتمد على المتّجه فقط. أضف: تاريخ، مؤلّف، فئة، يُتيح فلترة قبل/بعد البحث.

6. Hybrid Search

اجمع بين semantic (embeddings) و lexical (BM25). النتيجة أفضل من كليهما منفرداً.

الأخطاء الشائعة

**** استخدام نموذج مختلف للـ query عن الوثائق. النتائج فوضى.

**** خلط أبعاد مختلفة في نفس المخزن.

**** نسيان Normalization.

**** تجاهل التكلفة، 100M token = $200-500 لبعض النماذج.

**** الاعتماد الكامل على Cosine بدون فلترة metadata.

المستقبل

  • Embeddings متعدّدة المهامّ: نموذج واحد لأي مهمّة (Instruct-Embeddings).
  • Sparse + Dense hybrids: SPLADE, ColBERT.
  • Long-context embeddings: تعامل مع وثائق كبيرة كوحدة.
  • Multimodal universal: نموذج واحد للنصّ + صور + فيديو + صوت + كود.

اقرأ أيضاً:

هل أفادك هذا المقال؟

كن أول من يقيّم

الأسئلة الشائعة

متّجه (قائمة أرقام، عادة 384-3072 قيمة) يُمثّل معنى كلمة، جملة، فقرة، أو حتى صورة في فضاء رياضي. كلمات متشابهة المعنى لها متّجهات قريبة، 'ملك' قريب من 'ملكة' و'أمير'.
البحث الدلالي (Semantic Search)، أنظمة التوصية، تصنيف النصوص، اكتشاف الفروق (anomaly detection)، تجميع الوثائق (clustering)، وبناء أنظمة RAG (Retrieval-Augmented Generation).
Word Embeddings تعطي متّجهاً لكل كلمة بمعزل عن السياق (Word2Vec, GloVe). Sentence/Contextual Embeddings تعطي متّجهاً يتغيّر بحسب السياق (BERT, ada-002)، 'بنك النهر' vs 'بنك مالي' لهما متّجهان مختلفان.
text-embedding-3-large من OpenAI، Cohere Embed v3، و Voyage AI جيّدون. من المفتوح: multilingual-e5-large-instruct و BGE-M3 من Beijing. اختبار على بياناتك الفعلية أفضل من الاعتماد على leaderboards.
فضاء رياضي بأبعاد كثيرة (مثلاً 1536 لـ text-embedding-3-small) تُمثَّل فيه المعاني كنقاط. الأبعاد الأعلى = دقّة أكثر لكن استهلاك ذاكرة/سرعة أعلى. الاختيار يعتمد على المقياس والمتطلّبات.
أشيعاً Cosine Similarity (زاوية بينهما، من -1 لـ 1؛ 1 = متطابق). أيضاً Dot Product و Euclidean Distance. Cosine مفضّل لأنه يتجاهل حجم المتّجه ويركّز على الاتجاه (المعنى).
نعم، CLIP من OpenAI يعمل embedding نصّ + صور في نفس الفضاء (تبحث بالنصّ فتجد صور). Whisper embeddings للصوت. متعدّد الوسائط أصبح معياراً، نموذج واحد يفهم كل الأنواع.

مقالات ذات صلة

نشرة مقالات الأسبوعية

اشترك تصلك أحدث المقالات + مختارات نادرة كل أحد. بلا سبام، ألغي الاشتراك بضغطة.

لا نشارك بريدك مع أي طرف ثالث. راجع سياسة الخصوصية.

التعليقات

بريدك لن يظهر ولن يُرسل إليه شيء — يُستخدم فقط لمنع الإزعاج.

لا تعليقات بعد — كن أول من يكتب.