ABOUTOwns production operations for LLM and agentic workloads — serving, cost, and observability for a fundamentally less predictable class of system than classical ML.
KEY RESPONSIBILITIESOwn production serving and scaling for LLM/agentic workloads (inference infra, load balancing, caching) Monitor and control inference cost — token usage, retry/loop cost, model routing decisions Build observability for LLM-specific failure modes: hallucination rate, latency spikes, prompt drift Manage model/version rollout strategy (canary releases, fallback models, A/B testing) Own incident response for LLM/agent production issues Partner with Gen AI Engineers and Agentic AI Architects on production-readiness reviews Explain token-cost dynamics to client finance/business stakeholders Collaborate closely with Gen AI Engineers without needing a hard line between build and run Support the practice in setting cost governance policy for LLM workloads
REQUIREMENTS & SKILLS4–6 yrs platform/MLOps engineering with hands-on LLM/Gen AI production experience Deep understanding of LLM inference economics — token costs, batching, caching, model routing Experience with LLM observability tooling (tracing, eval pipelines, prompt/version management) Familiarity with multiple model hosting platforms and their cost/performance tradeoffs — Microsoft Azure AI Foundry, AWS Bedrock, and Google Vertex AI, plus self-hosted open-source options (v LLM, TGI) as a good-to-have Experience building canary/rollback strategies for probabilistic systems Comfortable with the higher unpredictability of agentic workloads vs. classical ML serving Cost-conscious communicator — can explain a token-cost blowup to a client's finance stakeholder Collaborates closely with Gen AI Engineers without needing a hard line between “build” and “run”Calm under pressure during live incidents affecting client-facing systems
نبذة: يتولى مسؤولية عمليات الإنتاج لأحمال عمل النماذج اللغوية الكبيرة (LLM) والوكلاء (Agentic) — بما في ذلك تقديم الخدمة، والتكلفة، والمراقبة لفئة من الأنظمة التي تعتبر أقل قابلية للتنبؤ بشكل أساسي مقارنة بتعلم الآلة التقليدي.
المسؤوليات الرئيسية: امتلاك عمليات تقديم الخدمة والقياس لأحمال عمل النماذج اللغوية الكبيرة والوكلاء (بنية الاستدلال التحتية، موازنة الأحمال، التخزين المؤقت) مراقبة والتحكم في تكلفة الاستدلال — استخدام الرموز (tokens)، تكاليف إعادة المحاولة/الحلقات، قرارات توجيه النماذج بناء آليات مراقبة لأنماط فشل النماذج اللغوية الكبيرة المحددة: معدل الهلوسة، طفرات زمن الاستجابة، انحراف المطالبات إدارة استراتيجية طرح النماذج/الإصدارات (إصدارات كناري، نماذج بديلة، اختبار أ/ب) تولي مسؤولية الاستجابة للحوادث المتعلقة بمشاكل إنتاج النماذج اللغوية الكبيرة/الوكلاء الشراكة مع مهندسي الذكاء الاصطناعي التوليدي ومهندسي وكلاء الذكاء الاصطناعي في مراجعات جاهزية الإنتاج شرح ديناميكيات تكلفة الرموز لأصحاب المصلحة الماليين/التجاريين لدى العميل التعاون الوثيق مع مهندسي الذكاء الاصطناعي التوليدي دون الحاجة إلى خط فاصل صارم بين مرحلتي البناء والتشغيل دعم الممارسة في وضع سياسة حوكمة التكلفة لأحمال عمل النماذج اللغوية الكبيرة
المتطلبات والمهارات: 4-6 سنوات من الخبرة في هندسة المنصات/عمليات تعلم الآلة (MLOps) مع خبرة عملية في إنتاج النماذج اللغوية الكبيرة/الذكاء الاصطناعي التوليدي فهم عميق لاقتصاديات استدلال النماذج اللغوية الكبيرة — تكاليف الرموز، المعالجة بالدفعات، التخزين المؤقت، توجيه النماذج خبرة في أدوات مراقبة النماذج اللغوية الكبيرة (التتبع، خطوط أنابيب التقييم، إدارة المطالبات/الإصدارات) الإلمام بمنصات استضافة النماذج المتعددة ومقايضات التكلفة/الأداء الخاصة بها — Microsoft Azure AI Foundry، وAWS Bedrock، وGoogle Vertex AI، بالإضافة إلى الخيارات مفتوحة المصدر ذاتية الاستضافة (vLLM، TGI) كميزة إضافية خبرة في بناء استراتيجيات الإصدار التجريبي (كاناري)/التراجع للأنظمة الاحتمالية القدرة على التعامل مع عدم اليقين العالي في أحمال عمل الوكلاء مقارنة بخدمات تعلم الآلة التقليدية التواصل بوعي تكلفي — القدرة على شرح ارتفاع تكاليف الرموز لأصحاب المصلحة الماليين لدى العميل التعاون الوثيق مع مهندسي الذكاء الاصطناعي التوليدي دون الحاجة إلى خط فاصل صارم بين "البناء" و"التشغيل" الهدوء تحت الضغط أثناء الحوادث المباشرة التي تؤثر على الأنظمة التي يواجهها العميل