الذكاء الاصطناعي والتعلم الآلي

بنية نماذج اللغة الكبيرة: كيف تعمل LLMs فعلياً

تعمق تقني في بنية LLM: التوكنة، التضمينات، كتل المحولات، آليات الانتباه، ولماذا تتصرف هذه الأنظمة بالطريقة التي تتصرف بها—بما في ذلك الهلوسات والقيود.

Khalid Aboubakr
32 دقيقة قراءة
LlmTransformersAttention MechanismGptNeural NetworksDeep LearningNlp

لماذا فهم بنية LLM مهم

إذا كنت تدمج LLMs في أنظمة الإنتاج، تحتاج أكثر من وثائق API. تحتاج لفهم لماذا تهلوس هذه الأنظمة، ولماذا تعاني مع مهام معينة، ولماذا تعمل هندسة الموجهات. هذا الفهم يأتي من البنية.

هذا ليس شرحاً مبسطاً "الشبكات العصبية مثل الأدمغة". إنه جولة تقنية للمهندسين الذين يحتاجون لاتخاذ قرارات مستنيرة حول متى وكيف يستخدمون LLMs.

خط الأنابيب عالي المستوى

عندما ترسل نصاً إلى LLM، هذا ما يحدث فعلاً:

نص الإدخال → التوكنة → التضمين → كتل المحولات → احتمالات الإخراج → اختيار التوكن → النص المفكوك

كل مرحلة لها تأثيرات بنيوية تؤثر على السلوك. دعنا نفحص كل منها.

المرحلة 1: التوكنة

LLMs لا ترى النص—ترى تسلسلات من الأعداد الصحيحة تمثل التوكنات. التوكنة هي عملية التحويل.

كيف تعمل التوكنة:

LLMs الحديثة تستخدم توكنة الكلمات الفرعية (عادةً Byte-Pair Encoding أو SentencePiece). الخوارزمية:

  1. تبدأ بمفردات من الأحرف الفردية
  2. تدمج بشكل تكراري أكثر الأزواج المتجاورة تكراراً
  3. تتوقف عندما تصل المفردات للحجم المستهدف (عادةً 32K-100K توكن)
"Understanding" → ["Under", "stand", "ing"] → [15496, 9122, 278]
"AI" → ["AI"] → [15836]
"الذكاء" → ["ال", "ذ", "كاء"] → [معرفات توكن مختلفة]

لماذا هذا مهم للمهندسين:

  • حدود التوكن ليست حدود كلمات: حد 4096 توكن قد يكون 3000 كلمة بالإنجليزية لكن أقل بلغات أخرى أو الكود.
  • التوكنة تؤثر على الاستدلال: النموذج يعالج "understanding" كثلاث توكنات، وليس كوحدة دلالية. هذا يمكن أن يؤثر على كيفية تعامله مع الكلمات المعقدة صرفياً.
  • التكلفة لكل توكن: تسعير API مبني على التوكنات. فهم التوكنة يساعد في توقع التكاليف.
  • الكلمات النادرة تنقسم أكثر: المصطلحات الخاصة بالمجال غالباً تصبح توكنات كثيرة، مما يقلل نافذة السياق الفعالة.

المرحلة 2: التضمينات

كل معرف توكن يُربط بمتجه عالي الأبعاد (تضمين). لنماذج فئة GPT-4، هذا عادةً 4096-12288 بُعد.

ما تشفره التضمينات:

  • التشابه الدلالي (المعاني المتشابهة → متجهات متشابهة)
  • الدور النحوي (أقسام الكلام تتجمع معاً)
  • العلاقات (التشبيهات مثل ملك - رجل + امرأة ≈ ملكة)

مصفوفة التضمين:

حجم المفردات: 100,000 توكن
بُعد التضمين: 4096

مصفوفة التضمين: 100,000 × 4096 = 409M معلمة فقط للتضمينات

ترميز الموضع:

المحولات ليس لها إحساس متأصل بالموضع. معلومات الموضع تُضاف للتضمينات:

  • ترميز الموضع المطلق: أنماط ثابتة بناءً على فهرس الموضع
  • ترميز الموضع الدوراني (RoPE): دورات في فضاء التضمين تشفر المواضع النسبية
  • ALiBi: انحياز الانتباه بناءً على المسافة بين التوكنات

RoPE و ALiBi يسمحان باستقراء أفضل خارج أطوال سياق التدريب، وهذا لماذا LLMs الحديثة يمكنها التعامل مع سياقات أطول مما احتوته بيانات تدريبها.

المرحلة 3: كتل المحولات

جوهر LLM هو مكدس من كتل المحولات (عادةً 32-96 طبقة). كل كتلة تحتوي:

  1. الانتباه الذاتي متعدد الرؤوس: حيث "تنظر" التوكنات إلى توكنات أخرى
  2. شبكة التغذية الأمامية: حيث تُحول تمثيلات التوكن الفردية
  3. تطبيع الطبقة: يستقر التدريب
  4. الاتصالات المتبقية: تسمح بتدفق التدرجات عبر الشبكات العميقة

الانتباه الذاتي: الآلية الأساسية

الانتباه الذاتي يحسب كم يجب أن ينتبه كل توكن لكل توكن آخر.

لكل توكن، نحسب ثلاثة متجهات:

  • الاستعلام (Q): "عم أبحث؟"
  • المفتاح (K): "ما الذي أحتويه؟"
  • القيمة (V): "ما المعلومات التي أقدمها؟"

حساب الانتباه:

Attention(Q, K, V) = softmax(QK^T / √d_k) × V

حيث:

  • QK^T ينتج درجات الانتباه (كم ذو صلة كل توكن بكل آخر)
  • تحجيم √d_k يمنع softmax من التشبع
  • Softmax يُطبع إلى توزيع احتمالي
  • الضرب مع V ينتج تركيبة مرجحة من القيم

الانتباه متعدد الرؤوس:

بدلاً من انتباه واحد، نشغل آليات انتباه متوازية متعددة ("رؤوس")، كل منها يتعلم أنماطاً مختلفة:

  • بعض الرؤوس تتعلم العلاقات النحوية
  • بعضها يتعلم التشابه الدلالي
  • بعضها يتعلم أنماط الموضع
  • بعضها يتعلم علاقات خاصة بالمجال

التدريب مقابل الاستدلال

التدريب (التدريب المسبق):

LLMs تُدرب للتنبؤ بالتوكن التالي بالنظر لكل التوكنات السابقة:

الإدخال: "عاصمة فرنسا هي"
الهدف: "باريس"

الخسارة = -log P("باريس" | "عاصمة فرنسا هي")

هذا يُكرر تريليونات المرات عبر نص بمقياس الإنترنت:

  • GPT-3: ~300 مليار توكن
  • LLaMA 2: ~2 تريليون توكن
  • GPT-4: تقدير 10+ تريليون توكن

الاستدلال:

خلال الاستدلال، النموذج يولد توكناً واحداً في كل مرة:

  1. يعالج الإدخال، يحصل على توزيع احتمالي على المفردات
  2. يختار عينة أو يختار التوكن التالي
  3. يلحق بالإدخال، يكرر

التوليد الانحداري تسلسلي: كل توكن جديد يتطلب معالجة التسلسل بأكمله. لهذا:

  • التوليد أبطأ من الترميز
  • طول السياق يؤثر مباشرة على التأخير
  • تخزين KV المؤقت حاسم للأداء

لماذا تهلوس LLMs

فهم البنية يفسر الهلوسة:

1. هدف التدريب: LLMs تُدرب للتنبؤ بتوكنات معقولة تالية، وليس صحيحة. "أول شخص على المريخ كان نيل أرمسترونج" يبدو معقولاً حتى لو كان خاطئاً.

2. لا تحقق من المعرفة: لا توجد آلية للتحقق من الادعاءات مقابل قاعدة معرفة. النموذج يطابق أنماط بيانات التدريب، وليس الحقائق.

3. معايرة الثقة: Softmax ينتج احتمالات تبدو واثقة حتى للمخرجات غير المؤكدة. النموذج قد يخرج "بالتأكيد" بينما هو إحصائياً غير متأكد.

4. أعراض التوزيع: إذا احتوت بيانات التدريب على حالات X أكثر من Y، النموذج سيفضل X حتى عندما Y صحيح للسياق المحدد.

التأثيرات البنيوية:

  • التوليد المعزز بالاسترجاع (RAG): حقن المستندات ذات الصلة في السياق لتثبيت الردود
  • موجهات سلسلة التفكير: إجبار خطوات استدلال وسيطة يمكن التحقق منها
  • ضبط درجة الحرارة: حرارة أقل للمهام الواقعية، أعلى للإبداعية
  • التحقق بالتجميع: استخدام استعلامات أو نماذج متعددة للتحقق المتبادل

القيود البنيوية

نافذة السياق الثابتة: الانتباه O(n²) في طول السياق. حتى مع التحسينات، هناك حدود صعبة لكم السياق الذي يمكن للنموذج استخدامه بفعالية.

لا استدلال حقيقي: LLMs تقارب الاستدلال من خلال مطابقة الأنماط على أمثلة الاستدلال في بيانات التدريب. سلاسل الاستدلال الجديدة التي لم تكن في بيانات التدريب غير موثوقة.

لا ذاكرة: كل طلب مستقل. النموذج لا يستطيع التعلم من التفاعلات إلا إذا أُعيد تدريبه صراحة.

أعراض التوكنة: الحساب، التلاعب على مستوى الحروف، واللغات غير الإنجليزية يمكن أن تتضرر من خيارات التوكنة.

حساسية الموجهات: تغييرات صغيرة في صياغة الموجهات يمكن أن تغير المخرجات بشكل كبير. هذه ميزة لآلية الانتباه، وليست عيباً، لكنها تجعل الأنظمة هشة.

قرارات البنية العملية

عند دمج LLMs في الأنظمة، معرفة البنية توجه القرارات:

إدارة نافذة السياق:

السياق المتاح: 128K توكن
موجه النظام: 2K توكن
المستندات المسترجعة: 10K توكن
تاريخ المحادثة: X توكن
استعلام المستخدم: 500 توكن
ميزانية الرد: 4K توكن

المتاح للتاريخ: 128K - 2K - 10K - 500 - 4K = 111.5K توكن

ميزانية التأخير:

وقت أول توكن: ~200-500ms (يعتمد على طول الموجه)
وقت لكل توكن إخراج: ~20-50ms
الإجمالي لرد 500 توكن: ~10-25 ثانية

للتطبيقات في الوقت الفعلي، فكر في بث الردود.

تقدير التكلفة:

GPT-4 Turbo: $10/مليون توكن إدخال، $30/مليون توكن إخراج

1000 طلب/يوم × 2000 توكن إدخال × 500 توكن إخراج
= 2M إدخال + 0.5M إخراج يومياً
= $20 + $15 = $35/يوم = ~$1000/شهر

هذا يتوسع بسرعة. افهم أنماط استخدام التوكن.

ثورة المحولات: لماذا فازت هذه البنية

بنية المحولات (قُدمت في "Attention Is All You Need" 2017) استبدلت الشبكات المتكررة لأن:

  1. التوازي: بخلاف RNNs، المحولات تعالج كل المواضع في وقت واحد خلال التدريب
  2. التبعيات بعيدة المدى: الانتباه يربط مباشرة أي موضعين، لا تدرجات متلاشية
  3. قابلية التوسع: الأداء يتوسع بشكل متوقع مع الحوسبة والبيانات

هذا مكّن التدريب على مقاييس غير مسبوقة، مما أدى إلى قدرات ناشئة لم تُرَ في النماذج الأصغر.

مقالات ذات صلة

مقالات ذات صلة

الذكاء الاصطناعي والتعلم الآليقراءة 25 دقيقة

الذكاء الاصطناعي للمهندسين: الأساسيات بدون المبالغات

شرح واقعي لماهية الذكاء الاصطناعي الحقيقية، وكيف يختلف عن التعلم الآلي الكلاسيكي والتعلم العميق، وما يحتاج المهندسون العاملون لفهمه بعيداً عن ضجيج التسويق.

الذكاء الاصطناعي والتعلم الآليقراءة 23 دقيقة

التعلم العميق (Goodfellow وآخرون): مراجعة نقدية

تحليل نقدي من ممارس لكتاب التعلم العميق الكلاسيكي—ما يفعله جيداً، أين يقصر، وما يجب أن يعرفه المهندسون العاملون قبل قراءته.