Responsibilities
Design, develop, and maintain scalable ETL/ELT pipelines for data ingestion, transformation, validation, and delivery.
Build, schedule, and orchestrate production-grade data workflows using Apache Airflow .
Develop distributed data-processing jobs using Apache Spark .
Write efficient, reusable, and maintainable Python code for data processing, automation, and pipeline development.
Develop and optimize complex SQL queries for data transformation, analysis, and quality validation.
Design pipelines capable of processing large-scale structured, semi-structured, and unstructured datasets.
Implement Redis for caching, high-performance data access, and data-intensive application requirements.
Integrate data from APIs, relational databases, files, third-party providers, and other internal and external sources.
Implement data validation, monitoring, logging, error handling, alerting, and pipeline observability.
Optimize pipeline performance, data storage, processing time, and infrastructure costs.
Develop reusable data-ingestion and transformation frameworks instead of one-off scripts.
Troubleshoot pipeline failures, performance bottlenecks, and data-quality issues to ensure timely resolution.
Collaborate with BI, Product, Data Science, and Engineering teams to deliver reliable, production-ready datasets.
Establish and maintain data-engineering standards, technical documentation, and development best practices.
Preferred Qualification
Experience with cloud data platforms and object storage services such as AWS, Azure, or GCP .
Experience working with PostgreSQL , data warehouses, or analytical databases.
Experience processing geospatial data or large-scale location-based datasets.
Familiarity with DuckDB, Apache Sedona, Trino, Presto , or similar analytical technologies.
Experience processing high-volume event, mobility, transactional, or geospatial data.
Familiarity with CI/CD pipelines and infrastructure-as-code practices.
Experience supporting data products, analytics platforms, or AI/ML pipelines .
Desired Candidate Profile
Bachelor s degree in Computer Science, Software Engineering, Data Science , or a related field.
4 6 years of professional experience in Data Engineering or a closely related role.
Strong hands-on experience designing and implementing production-grade ETL/ELT pipelines .
Strong proficiency in Python for data processing, automation, and data-engineering workflows.
Advanced SQL skills and a strong understanding of relational databases.
Practical production experience with Apache Airflow for workflow orchestration.
Hands-on experience with Apache Spark and distributed data processing.
Strong understanding of data modelling, transformation patterns, and data-pipeline architecture.
Experience with Redis , caching strategies, and high-performance data-access patterns.
Experience processing large datasets and optimizing pipeline and query performance.
Strong understanding of data quality, validation, monitoring, observability, and pipeline reliability.
Familiarity with Linux, Git, Docker/containers , and modern software-engineering practices.
Strong analytical, troubleshooting, communication, and cross-functional collaboration skills.
المسؤوليات
تصميم وتطوير وصيانة أنابيب البيانات ETL/ELT القابلة للتوسع لاستيعاب البيانات وتحويلها والتحقق من صحتها وتسليمها.
بناء وجدولة وتنسيق مسارات عمل البيانات الجاهزة للإنتاج باستخدام Apache Airflow.
تطوير مهام معالجة البيانات الموزعة باستخدام Apache Spark.
كتابة كود Python فعال وقابل لإعادة الاستخدام والصيانة لمعالجة البيانات والأتمتة وتطوير أنابيب البيانات.
تطوير وتحسين استعلامات SQL المعقدة لتحويل البيانات وتحليلها والتحقق من جودتها.
تصميم أنابيب بيانات قادرة على معالجة مجموعات البيانات الهيكلية وشبه الهيكلية وغير الهيكلية ضخمة الحجم.
تطبيق Redis للتخزين المؤقت، والوصول عالي الأداء إلى البيانات، ومتطلبات التطبيقات كثيفة البيانات.
دمج البيانات من واجهات برمجة التطبيقات (APIs)، وقواعد البيانات العلاقية، والملفات، ومزودي الخدمات من الأطراف الخارجية، والمصادر الداخلية والخارجية الأخرى.
تنفيذ عمليات التحقق من صحة البيانات، والمراقبة، وتسجيل السجلات، ومعالجة الأخطاء، وإرسال التنبيهات، وملاحظة أنابيب البيانات.
تحسين أداء أنابيب البيانات، وتخزين البيانات، وزمن المعالجة، وتكاليف البنية التحتية.
تطوير أطر عمل قابلة لإعادة الاستخدام لاستيعاب وتحويل البيانات بدلاً من البرامج النصية المؤقتة.
استكشاف أعطال أنابيب البيانات وإصلاحها، وحل اختناقات الأداء ومشاكل جودة البيانات لضمان حلها في الوقت المناسب.
التعاون مع فرق ذكاء الأعمال (BI)، والمنتجات، وعلم البيانات، والهندسة لتقديم مجموعات بيانات موثوقة وجاهزة للإنتاج.
وضع وصيانة معايير هندسة البيانات، والتوثيق الفني، وأفضل ممارسات التطوير.
المؤهلات المفضلة
خبرة في منصات البيانات السحابية وخدمات التخزين الكائنية مثل AWS أو Azure أو GCP.
خبرة في العمل مع PostgreSQL، أو مستودعات البيانات، أو قواعد البيانات التحليلية.
خبرة في معالجة البيانات الجغرافية المكانية أو مجموعات البيانات القائمة على الموقع الجغرافي ضخمة الحجم.
الإلمام بـ DuckDB أو Apache Sedona أو Trino أو Presto أو التقنيات التحليلية المماثلة.
خبرة في معالجة البيانات ضخمة الحجم الخاصة بالأحداث، أو التنقل، أو المعاملات، أو البيانات الجغرافية المكانية.
الإلمام بأنابيب CI/CD وممارسات البنية التحتية ككود.
خبرة في دعم منتجات البيانات، أو منصات التحليلات، أو أنابيب الذكاء الاصطناعي/تعلم الآلة.
ملف المرشح المطلوب
درجة البكالوريوس في علوم الحاسوب، أو هندسة البرمجيات، أو علم البيانات، أو أي مجال ذي صلة.
خبرة مهنية من 4 إلى 6 سنوات في هندسة البيانات أو مجال وثيق الصلة.
خبرة عملية قوية في تصميم وتطبيق أنابيب ETL/ELT الجاهزة للإنتاج.
إتقان قوي للغة Python لمعالجة البيانات، والأتمتة، ومسارات عمل هندسة البيانات.
مهارات متقدمة في SQL وفهم قوي لقواعد البيانات العلاقية.
خبرة عملية في البيئة الإنتاجية مع Apache Airflow لتنسيق مسارات العمل.
خبرة عملية في Apache Spark ومعالجة البيانات الموزعة.
فهم قوي لنمذجة البيانات، وأنماط التحويل، وبنية أنابيب البيانات.
خبرة في Redis، واستراتيجيات التخزين المؤقت، وأنماط الوصول عالي الأداء إلى البيانات.
خبرة في معالجة مجموعات البيانات الكبيرة وتحسين أداء الأنابيب والاستعلامات.
فهم قوي لجودة البيانات، والتحقق من صحتها، والمراقبة، وإمكانية الملاحظة، وموثوقية أنابيب البيانات.
الإلمام بـ Linux وGit وDocker/الحاويات وممارسات هندسة البرمجيات الحديثة.
مهارات قوية في التحليل، واستكشاف الأخطاء وإصلاحها، والتواصل، والتعاون بين الفرق المختلفة.