وصف الوظيفة
تبحث Mindrift عن مهندسين كبار في استخراج البيانات باستخدام بايثون ذوي مهارات عالية للانضمام إلى مشروع Tendem ودفع سير عمل استخراج البيانات المتخصص ضمن نظامنا الهجين من الذكاء الاصطناعي البشري.
في هذا الدور، كـ Pilot AI – هكذا نُشير إلى هذا الدور في Mindrift – ستت collabor مع وكلاء Tendem الذين يتولون المهام المتكررة، بينما تقدم التفكير النقدي، والخبـرة الميدانية، وضمان الجودة لتقديم نتائج دقيقة وقابلة للتنفيذ.
هذه الفرصة عن بعد بدوام جزئي مثالية للمهنيين التقنيين ذوي الخبرة العملية في استخراج البيانات من الويب، واستخراجها ومعالجتها.
ماذا نفعل؟ منصة Mindrift تربط المتخصصين بمشاريع AI من كبار مبتكري التكنولوجيا.
مهمتنا هي فتح إمكانات الذكاء الاصطناعي التوليدي من خلال الاستفادة من خبرات العالم الحقيقي من جميع أنحاء العالم.
هذا دور مستقل لمشروع Tendem.
كـ كبير مهندسي استخراج بيانات باستخدام بايثون، ستهتم بمهام استخراج البيانات التي تتطلب دقة تقنية في الاستخراج ومعالجة الويب، باستخدام أدوات مختلفة مثل Apify وOpenRouter المقدمة إلى جانب أساليبك المبتكرة الخاصة.
المسؤوليات الأساسية: امتلاك تدفقات استخراج البيانات من البداية إلى النهاية عبر مواقع معقدة، مع ضمان التغطية الكاملة والدقة وتسليم مجموعات البيانات المهيكلة بشكل موثوق.
الاستفادة من الأدوات الداخلية (Apify، OpenRouter) بجانب تدفقات العمل المخصصة لتسريع جمع البيانات، والتحقق منها، وتنفيذ المهام مع الالتزام بالمتطلبات المحددة.
ضمان استخراج موثوق من مصادر ويب ديناميكية وتفاعلية، وتكييف الأساليب عند الحاجة للتعامل مع المحتوى المُولَّد بجافاسكريبت وسلوك المواقع المتغير.
فرض معايير جودة البيانات من خلال فحوصات التحقق، وضوابط الاتساق عبر المصادر، والالتزام بمواصفات التنسيق، والتحقق المنهجي قبل التسليم.
توسيع عمليات السحب للبيانات لواجهات بيانات كبيرة باستخدام دفعات فعالة أو توازي، رصد الإخفاقات، والحفاظ على الاستقرار ضد تغيّر بسيط في بنية الموقع.
المتطلبات: خبرة لا تقل عن 5+ سنوات ذات صلة في هندسة البيانات، استخراج البيانات من الويب، الأتمتة، أو تطوير البرمجيات (مطلوب).
درجة البكالوريوس أو الماجستير في الهندسة، الرياضيات التطبيقية، علوم الكمبيوتر، أو مجالات تقنية ذات صلة ميزة إضافية.
يجب أن يمتلك المرشحون أساساً تقنياً قوياً وتجربة عملية في البرمجة النصية، الأتمتة، وتدفقات العمل المساندة بالذكاء الاصطناعي.
نحن نبحث عن متخصصين قادرين على حل المشكلات غير البسيطة، والعمل بثقة مع نماذج لغوية كبيرة (LLMs)، وجمع البيانات وهيكلتها والتحقق منها من مصادر متنوعة بشكل منهجي.
نهج منهجي، واهتمام بالتفاصيل، والقدرة على العمل بشكل مستقل أمر أساسي.
خبرة قوية في استخراج البيانات باستخدام بايثون (BeautifulSoup، Selenium أو ما يماثله)، بما في ذلك المحتوى الديناميكي (JS, AJAX, التمرير اللانهائي) وواجهات برمجة التطبيقات عبر البروكسيات، القدرة المثبتة على استخراج البيانات من هياكل معقدة (الهياكل الهرمية، الصفحات المؤرشفة، HTML غير المتسق)، خلفية صلبة في تنظيف البيانات، التطبيع، والتحقق، وتقديم مجموعات بيانات منظمة (CSV، JSON، Google Sheets)، خبرة مثبتة في التعامل مع آليات مضاد الروبوت وبُنى المواقع الديناميكية على نطاق واسع، خبرة مع بنية سحابية (AWS أو ما يعادلها) وتعبئة الحاويات (Docker) كجزء من تدفقات العمل الحقيقية، خبرة عملية مع أطر LLM (LangChain، OpenRouter، أو ما يماثلها) المطبقة على مهام الأتمتة، اهتمام قوي بالتفاصيل والتزام بالدقة في البيانات، وجدان عمل ذاتي مع القدرة على استكشاف الأخطاء بشكل مستقل. رابط GitHub ميزة إضافية، الكفاءة الإنجليزية: فوق المتوسط (B2) أو أعلى (مطلوب). توقعات الوقت للمشروع: لهذا المشروع، من المتوقع أن تستغرق المهام حوالي 10–20 ساعة في الأسبوع خلال المراحل النشطة، بناءً على متطلبات المشروع.
هذه تقديرية وليست عبء عمل مضمون، وتطبق فقط أثناء نشاط المشروع.
التعويض: في هذا المشروع، يمكن للمساهمين كسب حتى 37 دولارًا في الساعة الواحدة مع مراعاة مستواهم وسرعة مساهمتهم.
يتفاوت التعويض عبر المشاريع اعتماداً على النطاق، التعقيد، والخبرة المطلوبة.
يرجى ملاحظة أن مشاريع أخرى على المنصة قد تقدم مستويات كسب مختلفة بناءً على متطلباتها.