Job description
Position Summary
We are seeking a highly motivated and skilled Senior HPC Systems Administrator to join the KAUST Supercomputing Laboratory (KSL). The successful candidate will be responsible for managing an HPC cluster of approximately 600 CPU and GPU nodes, HPC storage systems, InfiniBand and Ethernet networks, and day-to-day operational issues. The role provides broad support to researchers and end-users across computational science, engineering, big data analysis, and artificial intelligence/machine learning workloads.
Major Responsibilities – include but are not limited to -
- Provide timely and effective user support via telephone, walk-in, email, and ticketing system for all inquiry types while maintain high customer service standards.
- Install, configure, and manage HPC subsystems including compute nodes, high-performance storage systems, InfiniBand, Ethernet, and configuration management tools (e.g., Ansible, Puppet).
- Deploy and manage cluster management software, monitoring tools, and supporting services for operating HPC clusters.
- Install and administer the Slurm workload manager, manage QOS policies, accounts, accounting, and related automation scripts (Python and C++).
- Develop and maintain automation scripts in Bash and Python to streamline system administration tasks.
- Deploy and manage container environments (Singularity/Apptainer, Docker) for HPC workloads.
- Benchmark HPC system components like CPU, memory, InfiniBand, and storage periodically to ensure optimal performance and identify tuning opportunities across hardware, driver, and application layers.
- Enforce security best practices including node hardening, kernel patching, and compliance across all systems.
- Manage parallel file systems such as Lustre, GPFS, Weka, or Vast, including performance tuning and capacity planning.
- Directly support research activities in computational science, engineering, data analysis, and AI/ML by working closely with faculty, researchers, collaboration partners, and industrial partners in collaboration with application support teams.
- Develop software tools and utilities as needed to support research projects on cluster systems and subsystems.
- Drive proof-of-concept projects and technology evaluations end-to-end and research industry best practices and advocate system enhancements.
- Coordinate with vendors and third-party service providers to report and resolve issues in a timely manner.
- Develop and maintain user documentation, standard operating procedures, and training materials in the internal wiki.
- Stay at the forefront of HPC advancements through continuous learning, industry conferences, and professional collaboration, while driving benchmarking initiatives to inform future hardware procurement.
Competencies
- Expertise in supporting users of computational science and engineering, data analysis, and artificial intelligence applications and libraries in different HPC environments.
- Strong expertise in Linux system administration (RHEL, Rocky Linux, or CentOS) in large-scale HPC environments.
- Proficiency with HPC applications and programming models (Fortran, C/C++, Python, MPI, OpenMP, CUDA, OpenACC).
- Demonstrated track record of managing complex HPC systems, including parallel file systems, job schedulers, InfiniBand/Ethernet networks, and monitoring systems.
- Experience with configuration management tools (Ansible, Puppet, or equivalent).
- Familiarity with computational science, data analysis, and AI/ML applications and libraries used in HPC environments.
- Knowledge of project management principles and practices.
- Demonstrated ability to support research activities in a highly collaborative HPC environment.
- Strong analytical, problem-solving, and decision-making skills.
- Proactively identifies and implements system improvements; takes initiative and sees tasks through to closure.
- Ability to manage multiple concurrent projects and deliver high-quality results within deadlines.
- Proven ability to collaborate cross-functionally with researchers, application teams, and vendors.
- Effective in multi-cultural, international work environments.
- Excellent verbal and written communication skills in English, including the ability to prepare and deliver technical reports and presentations.
Qualifications
Education requirement, minimum:
Bachelor’s or master’s degree in computer science/engineering, Information Systems, or equivalent
Experience
Experience requirement, minimum:
- Five years of experience supporting large scale computing platforms and related subsystems.
- Experience troubleshooting complex hardware issues and documenting root cause analysis.
- Experience managing parallel storage systems (Lustre, GPFS, Weka, Vast, or similar).
- Experience benchmarking HPC system components (CPU, memory, InfiniBand, storage).
- Experience administering workload managers/schedulers (Slurm, LSF, or PBS).
- Strong Linux system administration experience (RHEL, Rocky Linux, or CentOS).
- Experience with configuration management tools such as Ansible or Puppet.
- Ability to coordinate with researchers, application support teams, and vendors to resolve complex issues and drive them to closure.
- Proven ability to collaborate cross-functionally and drive initiatives to completion.
- Familiarity with Kubernetes and container orchestration platforms would be desirable
Preferred candidate
Years of experience
No experience required
Degree
Bachelor's degree / higher diploma
الوصف الوظيفي
ملخص الوظيفة
نحن نبحث عن مسؤول أول أنظمة الحوسبة عالية الأداء (HPC) يتمتع بدافعية عالية ومهارات متميزة للانضمام إلى مختبر جامعة الملك عبد الله للعلوم والتكنولوجيا للحوسبة الفائقة (KSL). سيكون المرشح الناجح مسؤولاً عن إدارة مجموعة حوسبة عالية الأداء تتكون من حوالي 600 عقدة وحدة معالجة مركزية (CPU) ووحدة معالجة رسومات (GPU)، وأنظمة تخزين الحوسبة عالية الأداء، وشبكات InfiniBand وEthernet، والمشكلات التشغيلية اليومية. يوفر هذا الدور دعمًا واسع النطاق للباحثين والمستخدمين النهائيين عبر أعباء العمل في العلوم الحاسوبية والهندسة وتحليل البيانات الضخمة والذكاء الاصطناعي/التعلم الآلي.
المسؤوليات الرئيسية - تشمل على سبيل المثال لا الحصر -
- تقديم دعم للمستخدمين في الوقت المناسب وبفعالية عبر الهاتف، والحضور الشخصي، والبريد الإلكتروني، ونظام التذاكر لجميع انواع الاستفسارات مع الحفاظ على معايير عالية لخدمة العملاء.
- تثبيت وتكفين وإدارة الأنظمة الفرعية للحوسبة عالية الأداء بما في ذلك عقد الحوسبة، وأنظمة التخزين عالية الأداء، وشبكات InfiniBand وEthernet، وأدوات إدارة التكوين (مثل Ansible وPuppet).
- نشر وإدارة برامج إدارة المجموعات (Clusters)، وأدوات المراقبة، والخدمات الداعمة لتشغيل مجموعات الحوسبة عالية الأداء.
- تثبيت وإدارة مدير أعباء العمل Slurm، وإدارة سياسات جودة الخدمة (QOS)، والحسابات، والمحاسبة، وسكربتات الأتمتة ذات الصلة (Python وC++).
- تطوير وصيانة سكربتات الأتمتة بلغة Bash وPython لتيسير مهام إدارة النظام.
- نشر وإدارة بيئات الحاويات (Singularity/Apptainer وDocker) لأعباء عمل الحوسبة عالية الأداء.
- إجراء اختبارات قياس الأداء (Benchmarking) لمكونات نظام الحوسبة عالية الأداء مثل وحدة المعالجة المركزية، والذاكرة، وInfiniBand، والتخزين بشكل دوري لضمان الأداء الأمثل وتحديد فرص التحسين عبر طبقات العتاد والمحركات والتطبيقات.
- تطبيق أفضل ممارسات الأمان بما في ذلك تحصين العقد (node hardening)، وتحديثات النواة (kernel patching)، والامتثال عبر جميع الأنظمة.
- إدارة أنظمة الملفات المتوازية مثل Lustre أو GPFS أو Weka أو Vast، بما في ذلك ضبط الأداء وتخطيط السعة.
- دعم الأنشطة البحثية بشكل مباشر في العلوم الحاسوبية والهندسة وتحليل البيانات والذكاء الاصطناعي/التعلم الآلي من خلال العمل عن كثب مع أعضاء هيئة التدريس والباحثين وشركاء التعاون والشركاء الصناعيين بالتعاون مع فرق دعم التطبيقات.
- تطوير البرمجيات والأدوات المساعدة حسب الحاجة لدعم المشاريع البحثية على أنظمة المجموعات والأنظمة الفرعية.
- قيادة مشاريع إثبات المفهوم وتقييم التكنولوجيا من البداية إلى النهاية وبحث أفضل ممارسات القطاع والمطالبة بتحسينات النظام.
- التنسيق مع الموردين ومزودي الخدمات من الأطراف الخارجية للإبلاغ عن المشكلات وحلها في الوقت المناسب.
- تطوير وصيانة وثائق المستخدم، وإجراءات التشغيل القياسية، والمواد التدريبية في الويكي الداخلي.
- البقاء في طليعة التطورات في مجال الحوسبة عالية الأداء من خلال التعلم المستمر والمؤتمرات القطاعية والتعاون المهني، مع قيادة مبادرات قياس الأداء لتوجيه عمليات الشراء المستقبلية للعتاد.
الكفاءات
- خبرة في دعم مستخدمي تطبيقات ومكتبات العلوم الحاسوبية والهندسة وتحليل البيانات والذكاء الاصطناعي في بيئات الحوسبة عالية الأداء المختلفة.
- خبرة قوية في إدارة أنظمة Linux (RHEL أو Rocky Linux أو CentOS) في بيئات الحوسبة عالية الأداء واسعة النطاق.
- إتقان تطبيقات ونماذج البرمجة الخاصة بالحوسبة عالية الأداء (Fortran وC/C++ وPython وMPI وOpenMP وCUDA وOpenACC).
- سجل حافل ومثبت في إدارة أنظمة الحوسبة عالية الأداء المعقدة، بما في ذلك أنظمة الملفات المتوازية، وجدولة المهام، وشبكات InfiniBand/Ethernet، وأنظمة المراقبة.
- خبرة في أدوات إدارة التكوين (Ansible أو Puppet أو ما يعادلها).
- المعرفة بتطبيقات ومكتبات العلوم الحاسوبية وتحليل البيانات والذكاء الاصطناعي/التعلم الآلي المستخدمة في بيئات الحوسبة عالية الأداء.
- معرفة بمبادئ وممارسات إدارة المشاريع.
- قدرة مثبتة على دعم الأنشطة البحثية في بيئة حوسبة عالية الأداء تتسم بالتعاون العالي.
- مهارات قوية في التحليل وحل المشكلات واتخاذ القرارات.
- تحديد وتحسين الأنظمة بشكل استباقي؛ وأخذ المبادرة ومتابعة المهام حتى إنجازها بالكامل.
- القدرة على إدارة مشاريع متزامنة متعددة وتقديم نتائج عالية الجودة في المواعيد المحكورة.
- قدرة مثبتة على التعاون عبر الوظائف المختلفة مع الباحثين وفرق التطبيقات والموردين.
- الفعالية في بيئات العمل المتعددة الثقافات والدولية.
- مهارات تواصل ممتازة شفهية وخطية باللغة الإنجليزية، بما في ذلك القدرة على إعداد وتقديم التقارير والعروض التقديمية الفنية.
المؤهلات
المؤهل العلمي المطلوب (الحد الأدنى):
درجة البكالوريوس أو الماجستير في علوم/هندسة الحاسوب، أو نظم المعلومات، أو ما يعادلها
الخبرة
الخبرة المطلوبة (الحد الأدنى):
- خمس سنوات من الخبرة في دعم منصات الحوسبة واسعة النطاق والأنظمة الفرعية ذات الصلة.
- خبرة في استكشاف أخطاء العتاد المعقدة وإصلاحها وتوثيق تحليل السبب الجذر.
- خبرة في إدارة أنظمة التخزين المتوازية (Lustre أو GPFS أو Weka أو Vast أو ما شابه).
- خبرة في قياس أداء مكونات نظام الحوسبة عالية الأداء (وحدة المعالجة المركزية، الذاكرة، InfiniBand، التخزين).
- خبرة في إدارة مديرات/مجدولات أعباء العمل (Slurm أو LSF أو PBS).
- خبرة قوية في إدارة أنظمة Linux (RHEL أو Rocky Linux أو CentOS).
- خبرة في أدوات إدارة التكوين مثل Ansible أو Puppet.
- القدرة على التنسيق مع الباحثين وفرق دعم التطبيقات والموردين لحل المشكلات المعقدة ومتابعتها حتى إنهائها.
- قدرة مثبتة على التعاون عبر الوظائف المختلفة وقيادة المبادرات حتى إتمامها.
- يُفضل الإلمام بـ Kubernetes ومنصات تنظيم الحاويات
المرشح المفضل
سنوات الخبرة
لا يشترط وجود خبرة
المؤهل العلمي
درجة البكالوريوس / دبلوم عالي