Mindrift is looking for highly skilled Senior Python Data Scraping Engineers to join the Tendem project and drive specialized data scraping workflows for real-world applications. In this role, you'll apply your expertise in web scraping, data extraction, and data processing to deliver accurate, reliable, and high-quality results. This part-time remote opportunity is ideal for technical professionals with hands-on experience in web scraping, data extraction and processing.
The Mindrift platform connects specialists with innovative technology projects. Our mission is to help develop high-quality AI technologies by combining real-world expertise from professionals across the globe with advanced AI development efforts.
This is a freelance role for a Tendem project. As a Senior Python Data Scraping Engineer, you'll handle data scraping tasks requiring technical precision for web extraction and processing, utilizing tools such as Apify, OpenRouter, and other technologies, alongside your own technical expertise and approaches.
Key Responsibilities
- Own end-to-end data extraction workflows across complex websites, ensuring complete coverage, accuracy, and reliable delivery of structured datasets.
- Leverage available tools and custom workflows to accelerate data collection, validation, and task execution while meeting defined requirement.
- Ensure reliable extraction from dynamic and interactive web sources, adapting approaches as needed to handle JavaScript-rendered content and changing site behavior.
- Enforce data quality standards through validation checks, cross-source consistency controls, adherence to formatting specifications, and systematic verification prior to delivery.
- Scale scraping operations for large datasets using efficient batching or parallelization, monitor failures, and maintain stability against minor site structure changes.
Technical Skills (Essential)
- Strong experience in Python web scraping (BeautifulSoup, Selenium or similar), including dynamic content (JS, AJAX, infinite scroll) and APIs via proxies
- Proven ability to extract data from complex structures (hierarchies, archived pages, inconsistent HTML)
- Solid background in data cleaning, normalization, and validation, delivering structured datasets (CSV, JSON, Google Sheets)
Desired Candidate Profile
Educational qualifications
At least 5+ years of relevant experience in data engineering, web scraping, automation, or software development (required). Bachelor s or Master s Degree in Engineering, Applied Mathematics, Computer Science, or related technical fields is a plus.
Academic and/or Professional Experience
Candidates should have a strong technical foundation and practical experience with scripting, automation, and data extraction workflows. We are looking for specialists who can solve non-trivial problems, work confidently with modern development tools and technologies, and systematically collect, structure, and validate data from diverse sources. A methodical, detail-oriented approach and the ability to work independently are essential.
تبحث Mindrift عن مهندسين سابقين بارعين في استخراج البيانات باستخدام بايثون للعمل في مشروع Tendem وتوجيه سير عمل استخراج البيانات المتخصصة لتطبيقات العالم الواقعي. في هذه الوظيفة، ستطبق خبرتك في استخراج البيانات من الويب، واستخراج البيانات، ومعالجة البيانات لتقديم نتائج دقيقة وموثوقة عالية الجودة. هذه الفرصة بدوام جزئي عن بُعد مثالية للمهنيين الفنيين ذوي الخبرة العملية في استخراج البيانات عبر الويب، واستخراج البيانات ومعالجتها.
تتصل منصة Mindrift المتخصصين بمشروعات تقنية مبتكرة. هدفنا هو المساعدة في تطوير تقنيات الذكاء الاصطناعي عالية الجودة من خلال دمج الخبرة الواقعية من محترفين حول العالم مع جهود تطوير الذكاء الاصطناعي المتقدمة.
هذه وظيفة مستقلة لمشروع Tendem. كمهندس أول لاستخراج البيانات باستخدام بايثون، ستتعامل مع مهام استخراج البيانات التي تتطلب دقة تقنية لاستخراج ومعالجة الويب، باستخدام أدوات مثل Apify وOpenRouter، وتقنيات أخرى، إلى جانب خبرتك ومناهجك التقنية الخاصة.
المسؤوليات الأساسية
- التملك الكامل لسير عمل استخراج البيانات من مواقع معقدة، لضمان التغطية الكاملة والدقة والتسليم الموثوق لمجموعات البيانات المهيكلة.
- استخدام الأدوات المتاحة وسير العمل المخصصة لتسريع جمع البيانات، والتحقق منها، وتنفيذ المهام مع الالتزام بالمتطلبات المحددة.
- ضمان استخراج موثوق من مصادر ويب ديناميكية وتفاعلية، مع تكييف الأساليب حسب الحاجة لمعالجة المحتوى المعروض جافاسكريبت وتغير سلوك المواقع.
- فرض معايير جودة البيانات من خلال فحص التحقق، والتحكم في التناسق عبر المصادر، والالتزام بمواصفات التنسيق، والتحقق المنهجي قبل التسليم.
- تصعيد عمليات الاختراق للبيانات لمجموعات بيانات كبيرة باستخدام دفعات فعالة أو توازي، مراقبة الإخفاقات، والحفاظ على الاستقرار أمام تغييرات طفيفة في بنية الموقع.
المهارات الفنية (أساسية)
- خبرة قوية في استخراج البيانات من الويب باستخدام بايثون (BeautifulSoup، Selenium أو ما يماثلها)، بما في ذلك المحتوى الديناميكي (JS، AJAX، التمرير غير المحدود) وواجهات برمجة التطبيقات عبر الـ proxies
- إثبات القدرة على استخراج البيانات من هياكل معقدة (الهياكل، الصفحات المؤرشفة، HTML غير المتسق)
- خلفية قوية في تنظيف البيانات، التطبيع، والتحقق، وتقديم مجموعات بيانات مهيكلة (CSV، JSON، Google Sheets)
الملف الشخصي المرغوب فيه للمرشح
المؤهلات التعليمية
خبرة لا تقل عن 5 سنوات في الهندسة البيانات، استخراج البيانات من الويب، الأتمتة، أو تطوير البرمجيات (مطلوة). درجة البكالوريوس أو الماجستير في الهندسة، الرياضيات التطبيقية، علوم الكمبيوتر، أو المجالات التقنية ذات الصلة تعتبر ميزة.
الخبرة الأكاديمية و/أو المهنية
يجب أن يكون لدى المرشحين أساس تقني قوي وخبرة عملية في البرمجة النصية، الأتمتة، وتدفقات استخراج البيانات. نحن نبحث عن متخصصين يستطيعون حل مشكلات غير تافهة، والعمل بثقة مع أدوات وتكنولوجيات التطوير الحديثة، وجمع البيانات وهيكلتها والتحقق منها بشكل منهجي من مصادر متنوعة. نهج منهجي دقيق وقدرة على العمل بشكل مستقل أساسيان.