وظّف كبار مهندسي vLLM المُدقَّقين
24 ساعة
أول رد
72 ساعة
من الإحاطة إلى
قائمة المرشحين
1 من كل 7
يجتاز التدقيق
75/100
الحد الأدنى للاجتياز
وظّف كبار مهندسي vLLM عبر Mahala. مختصّون مُدقَّقون في خدمة النماذج اللغوية المستضافة ذاتياً: تحسين الإنتاجية، واستغلال المعالجات الرسومية، والاستدلال المتوافق مع إقامة البيانات، يصلونك خلال 72 ساعة من تلقّي الإيجاز. يخضع كل ملف لمنهجية التقييم لدينا قبل أن يبلغ قائمتك المختصرة.
التوظيف الخاطئ في vLLM يُقيم عنقود معالجاتٍ رسومية يجلس عند 20% من الاستغلال، ويخدم الطلبات واحداً تلو الآخر بينما الدفعات المستمرة تُضاعِف الإنتاجية، ويُكلِّف لكل رمزٍ أكثر من واجهة OpenAI التي كان يُفترض أن يحلّ محلّها. استضافة النموذج اللغوي ذاتياً لا تكون منطقيةً إلا حين تُنفَّذ جيّداً؛ فإن نُفِّذت بسوء، جمعت أسوأ العالمين: تكلفة معالجاتٍ ثابتة عالية، وإنتاجية منخفضة.
استضافة نموذج لغوي ذاتياً هي الإجابة للفرق التي لا تقدر أن تُرسِل بيانات إلى واجهة خارجية: المصارف، والحكومات، والرعاية الصحية، وكل من لديه قواعد إقامة بيانات. لكن القيمة لا تظهر إلا بهندسة حقيقية. ما نُدقِّق عليه هو: هل يقدرون على تشغيل vLLM بإنتاجية عالية: الدفعات المستمرة، وPagedAttention، والتوازي التنسوري عبر المعالجات، والتكميم، ونقطة نهاية متوافقة مع OpenAI فلا تتغيّر شيفرة تطبيقكم. هنا تلتقي MLOps مع واقع إقامة البيانات في الخليج.
ما نُقدّمه
01
خدمة نماذج لغوية مستضافة ذاتياً عبر vLLM: دفعات مستمرة وPagedAttention لإنتاجية عالية.
02
توازٍ تنسوري وضبط استغلال المعالجات الرسومية فيكون العتاد الذي تدفعون ثمنه هو العتاد الذي تستخدمونه.
03
تكميم (AWQ، GPTQ) لملاءمة نماذج أكبر على معالجات أقل دون فقدان الجودة.
04
خدمة متوافقة مع OpenAI فلا تتغيّر شيفرة تطبيقكم، إضافة إلى التوسّع التلقائي والرصد.
كيف تُميّز مهندس
vLLM القوي
- يتحدّث عن استغلال المعالجات الرسومية والدفعات المستمرة أوّلاً، لأنّ هناك تكمن الاقتصاديات.
- يستخدم التكميم لملاءمة نماذج أكبر على معالجاتٍ أقل دون فقدان جودةٍ يمكن قياسها.
- يعرض نقطة نهايةٍ متوافقةً مع OpenAI فتتغيّر شيفرة تطبيقك بعنوانٍ واحدٍ لا بإعادة كتابة.
كيف يسير
التعاقد
- أخبِرنا: الدور، والتقنيات، ومرحلة المشروع، والجدول، ونموذج الوصول (VDI).
- نُطابِق من قاعدة خبرائنا المُدقَّقة.
- ملفّان أو ثلاثة، دون أسماء أو صور، خلال 72 ساعة من تلقّي الإيجاز الواضح.
- قابِل النهائيين، واختر الأنسب.
- تتولّى Mahala التعاقد، والتحقّقات المهنية والأمنية عند الحاجة، والانطلاق. عقد واحد، وفاتورة شهرية واحدة.
اتفاقية عدم إفصاح (NDA) عند الطلب. إن انطوى إيجازك على تفاصيل حسّاسة تخصّ المشروع أو الفريق أو الملكية الفكرية، نُقدِّم اتفاقية عدم إفصاح تمهيدية كخدمة. وهي غير مطلوبة لاستلام القائمة المختصرة.
ملف تعريفي
نموذجي
مهندس عمليات تعلّم آلة كبير، سبع سنوات في المنصات والبنية التحتية. بنى منصة خدمة النماذج اللغوية المستضافة ذاتياً لبنك من الفئة الأولى لم يقدر أن يُرسِل بيانات إلى واجهة خارجية: vLLM مع دفعات مستمرة وتوازٍ تنسوري، وتكميم AWQ لملاءمة نموذج بحجم 70 مليار على أربعة معالجات، ونقطة نهاية متوافقة مع OpenAI فلم يُغيِّر فريق التطبيق شيئاً. حقّق ثلاثة أضعاف إنتاجية الإعداد الساذج بنفس تكلفة المعالجات. قوي في vLLM، Kubernetes، CUDA، Prometheus، Terraform. متاح للعمل عن بُعد في أوروبا ودول الخليج، متعاقد عبر Mahala.ai. مُقيَّم عند 91/100.
أسئلة ذات صلة
متى يجب أن نستضيف نموذجاً لغوياً ذاتياً بدل استخدام واجهة؟
حين تعني قواعد إقامة البيانات أو الخصوصية أنكم لا تقدرون أن تُرسِلوا بيانات إلى واجهة خارجية. شائع في مصارف الخليج والحكومات والرعاية الصحية. الاستضافة الذاتية عبر vLLM تُبقي الاستدلال داخل محيطكم. مهندسونا يجعلون ذلك اقتصادياً، وهو الجزء الصعب.
كيف تحصلون على إنتاجية عالية من vLLM؟
الدفعات المستمرة وPagedAttention هما جوهر vLLM. أضيفوا التوازي التنسوري عبر المعالجات، والتكميم لملاءمة نماذج أكبر، وجدولة طلبات دقيقة. نشر vLLM مضبوط جيّداً يقدر أن يحقّق أضعاف إنتاجية النشر الساذج بنفس تكلفة المعالجات.
هل يقدرون على إبقاء شيفرة تطبيقنا دون تغيير؟
نعم. vLLM يعرض نقطة نهاية متوافقة مع OpenAI. مهندسونا يُقيمونها فيُشير تطبيقكم الذي يستدعي واجهة OpenAI مسبقاً إلى نموذجكم المستضاف ذاتياً بتغيير عنوان فقط ولا شيء آخر.
هل يناسب هذا متطلبات الـ VDI وإقامة البيانات لدينا؟
نعم. هذه بالضبط الحالة التي بُنيت لها الاستضافة الذاتية. الاستدلال يعمل داخل بنيتكم التحتية، وبياناتكم لا تغادر محيطكم، ومهندسونا يعملون داخل الـ VDI الخاص بكم. نُؤكِّد المتطلب في الطلب.
هل يتعاملون مع تحسين تكلفة المعالجات الرسومية؟
نعم. التكميم لملاءمة النماذج على معالجات أقل، وضبط الاستغلال فلا تدفعون ثمن عتاد خامل، والتوسّع التلقائي. اقتصاديات المعالجات جزء من سقف التدقيق.
كيف يتم التسعير؟
التوصيل الكبير يُسعَّر على أساس أجر يومي أو ساعي، حسب نموذج التكليف. نُشارِك نطاقات الأجور خلال المكالمة الأولى.