انتقل إلى المحتوى الرئيسي
أكاديمية MLOps MENA

جلسة مسجّلة

مقدمة في محركات الاستدلال للنماذج اللغوية الكبيرة

· 1 س و30 د

مع محمد رشاد، قائد هندسي وشريك مؤسس، Hyperion وDevisionX

  • LLMOps
  • خدمة النماذج
اللغة
العربية والإنجليزية

التسجيل

سيُنشر التسجيل هنا قريبًا.

عن الجلسة

كيف تحوّل محركات الاستدلال نموذجًا لغويًا كبيرًا مُدرَّبًا إلى خدمة سريعة ومنخفضة التكلفة وقابلة للتوسع وموثوقة: توليد الـ tokens، والذاكرة، والتجميع (Batching)، والجدولة، والتخزين المؤقت، والتكميم (Quantization)، والتنفيذ على العتاد.

ما ستتعلمه

  • أين يقع محرك الاستدلال بين أوزان النموذج والتطبيق.
  • مقارنة بين معماريات vLLM وTensorRT-LLM وSGLang وllama.cpp وغيرها.
  • إدارة KV cache، والتجميع المستمر (Continuous Batching)، وفك الترميز التخميني (Speculative Decoding)، وتوازي الموترات (Tensor Parallelism)، والتكميم.
  • اختيار المحرك المناسب وضبطه، من وحدة GPU محلية واحدة إلى عناقيد إنتاج عالية الإنتاجية.

المتحدثون