جلسة مسجّلة
مقدمة في محركات الاستدلال للنماذج اللغوية الكبيرة
· 1 س و30 د
مع محمد رشاد، قائد هندسي وشريك مؤسس، Hyperion وDevisionX
- LLMOps
- خدمة النماذج
- اللغة
- العربية والإنجليزية
التسجيل
سيُنشر التسجيل هنا قريبًا.
عن الجلسة
كيف تحوّل محركات الاستدلال نموذجًا لغويًا كبيرًا مُدرَّبًا إلى خدمة سريعة ومنخفضة التكلفة وقابلة للتوسع وموثوقة: توليد الـ tokens، والذاكرة، والتجميع (Batching)، والجدولة، والتخزين المؤقت، والتكميم (Quantization)، والتنفيذ على العتاد.
ما ستتعلمه
- أين يقع محرك الاستدلال بين أوزان النموذج والتطبيق.
- مقارنة بين معماريات vLLM وTensorRT-LLM وSGLang وllama.cpp وغيرها.
- إدارة KV cache، والتجميع المستمر (Continuous Batching)، وفك الترميز التخميني (Speculative Decoding)، وتوازي الموترات (Tensor Parallelism)، والتكميم.
- اختيار المحرك المناسب وضبطه، من وحدة GPU محلية واحدة إلى عناقيد إنتاج عالية الإنتاجية.

