اختيار النمط المعماري الملائم لمنصة البيانات الضخمة بين المستودع والبحيرة والبحيرة المستودعية، وتوثيق القرارات المعمارية وتبعاتها.
هندسة البيانات الضخمة (Big Data Architecture) للتحول الرقمي
يتعلم المشارك تصميم منصة بيانات ضخمة متكاملة: اختيار النمط المعماري، وبناء خطوط استيعاب دفعية ولحظية، ومعالجة موزعة بصيغ جداول مفتوحة، وخدمة البيانات للتحليلات والذكاء الاصطناعي بموثوقية وكلفة مضبوطة.
لمحة عن الدورة
تتراكم في المؤسسة التي تتحول رقمياً سجلات التطبيقات وأحداث المستخدمين وقراءات الأجهزة ومعاملات الأنظمة التشغيلية بمعدلات تتجاوز قدرة قواعد البيانات التقليدية، فتظهر أعراض مألوفة: تقارير تتأخر، ونماذج ذكاء اصطناعي تنتظر بيانات لا تصل، وفواتير سحابية ترتفع دون تفسير. تعالج هندسة البيانات الضخمة (Big Data Architecture) هذه الأعراض بتصميم منصة تستوعب البيانات وتعالجها وتخدمها بموثوقية وكلفة مضبوطة. تغطي الدورة أنماط البنية من المستودع إلى البحيرة المستودعية ونمط الطبقات، والاستيعاب الدفعي واللحظي عبر Kafka والتقاط تغير البيانات، والمعالجة الموزعة وصيغ الجداول المفتوحة، ثم خدمة البيانات للتحليلات والذكاء الاصطناعي، وقابلية الرصد والكلفة والأمن، وأخيراً نماذج الملكية كشبكة البيانات ومسار تحديث المنصات القديمة بما يخدم التحول الرقمي. تجمع الجلسات بين تحليل مخططات معمارية ومختبرات عملية على بيئة معالجة موزعة، وتنتهي بتصميم معماري متكامل يعدّه المشارك لمبادرة من مؤسسته.
الأهداف المتوقعة من الدورة
تصميم خطوط استيعاب ومعالجة دفعية ولحظية موثوقة تتعامل مع تغير المخططات والأحداث المتأخرة وضمانات التسليم.
بناء طبقات تخزين وخدمة بيانات تلبي احتياجات التقارير والتحليلات التفاعلية ونماذج الذكاء الاصطناعي بأداء وكلفة مضبوطين.
وضع خارطة تحديث للمنصة تتضمن نموذج الملكية وقابلية الرصد وضوابط الأمن والكلفة ومراحل الترحيل من الأنظمة القديمة.
المستهدفون
مهندسو البيانات والمعماريون التقنيون المسؤولون عن تصميم منصات البيانات أو تحديثها.
قادة فرق البيانات والتحليلات الذين يوازنون بين احتياجات المستخدمين وموثوقية المنصة وكلفتها.
مهندسو البرمجيات والبنية السحابية المنتقلون إلى أعمال المعالجة الموزعة وتدفق الأحداث.
مديرو تقنية المعلومات ومكاتب التحول الرقمي الذين يقررون الاستثمار في منصات البيانات ومسارات ترحيلها.
المحاور العلمية
اضغط على أي محور لاستعراض جلساته وبنوده.
01المحور الأول: متطلبات البيانات الضخمة وأنماط البنية المعمارية
2 جلسات · 6 نقاط
1الجلسة الأولى: من أحمال البيانات وحالات الاستخدام إلى متطلبات المنصة
- توصيف أحمال البيانات بالحجم والسرعة والتنوع، وتحديد متطلبات زمن الوصول من الدفعات اليومية إلى المعالجة اللحظية.
- حصر ما ستخدمه المنصة من تقارير تنظيمية وتحليلات تفاعلية وتدريب نماذج وخدمات لحظية، وأثر كل استخدام على التصميم.
- توثيق القرارات في سجلات القرار المعماري (ADR) التي تبين البدائل المدروسة وأسباب الاختيار وتبعاته اللاحقة.
2الجلسة الثانية: المستودع والبحيرة والبحيرة المستودعية
- مقارنة مستودع البيانات التقليدي وبحيرة البيانات والبحيرة المستودعية (Lakehouse) من حيث المرونة والحوكمة والكلفة.
- بنيتا لامدا وكابا لمعالجة الدفعات والتدفقات، وأسباب اتجاه التصاميم الحديثة إلى مسار معالجة موحد.
- نمط الطبقات البرونزية والفضية والذهبية (Medallion) لتنظيم البيانات من حالتها الخام إلى الجاهزية للاستهلاك.
02المحور الثاني: استيعاب البيانات الضخمة ومعالجتها على نطاق واسع
2 جلسات · 6 نقاط
1الجلسة الأولى: الاستيعاب الدفعي وتدفق الأحداث والتقاط التغيرات
- أنماط الاستيعاب: الاستخراج الدفعي، والتقاط تغير البيانات (CDC) من قواعد البيانات التشغيلية، واستقبال الأحداث من التطبيقات والأجهزة.
- منصات تدفق الأحداث مثل Apache Kafka: الموضوعات والتقسيمات ومجموعات المستهلكين وضمانات التسليم.
- إدارة تطور المخطط (Schema Evolution) عبر سجل مخططات يمنع تعطل التطبيقات المستهلكة عند تغير بنية الرسائل.
2الجلسة الثانية: المعالجة الموزعة وصيغ الجداول المفتوحة
- المعالجة الموزعة باستخدام Apache Spark: التنفيذ الكسول، والتقسيم، وإعادة توزيع البيانات (Shuffle)، وأسباب بطء المهام.
- معالجة التدفقات ذات الحالة: النوافذ الزمنية، والأحداث المتأخرة، والعلامات المائية، ودلالة المعالجة مرة واحدة فقط.
- اختيار صيغ التخزين العمودية كـ Parquet وصيغ الجداول المفتوحة كـ Delta Lake وApache Iceberg لدعم المعاملات والرجوع إلى الإصدارات.
03المحور الثالث: تخزين البيانات ونمذجتها وخدمتها للمستهلكين
2 جلسات · 6 نقاط
1الجلسة الأولى: تصميم التخزين والتقسيم وتحسين الأداء
- استراتيجيات تقسيم البيانات وترتيبها وضغطها، ومعالجة مشكلة الملفات الصغيرة التي تبطئ الاستعلامات.
- نمذجة البيانات للتحليل بالنماذج النجمية والجداول العريضة ونمذجة Data Vault، ومتى يناسب كل منها.
- فصل التخزين عن الحوسبة في المنصات السحابية وأثره على قابلية التوسع والكلفة وتشغيل أعباء عمل متعددة.
2الجلسة الثانية: خدمة البيانات للتحليلات وتطبيقات الذكاء الاصطناعي
- طبقة دلالية موحدة (Semantic Layer) تضمن حساب المؤشر نفسه بالطريقة نفسها في جميع أدوات التحليل.
- مخازن الخصائص (Feature Stores) وقواعد البيانات المتجهية لخدمة نماذج تعلم الآلة وتطبيقات الاسترجاع المعزز بالتوليد.
- واجهات الوصول إلى البيانات لتطبيقات الأعمال اللحظية، والموازنة بين حداثة البيانات وكلفة الاستعلام.
04المحور الرابع: تشغيل منصة البيانات وموثوقيتها وضبط كلفتها
2 جلسات · 6 نقاط
1الجلسة الأولى: تنسيق خطوط البيانات وقابلية رصدها
- تنسيق خطوط البيانات بأدوات مثل Apache Airflow: الاعتماديات، وإعادة المحاولة، وإعادة معالجة الفترات السابقة.
- قابلية رصد البيانات (Data Observability) بمراقبة الحداثة والحجم والتوزيع والمخطط والنسب، والتنبيه قبل أن يكتشف المستخدم الخلل.
- اتفاقيات مستوى الخدمة لمنتجات البيانات وعقود البيانات (Data Contracts) بين الفرق المنتجة والفرق المستهلكة.
2الجلسة الثانية: إدارة كلفة المنصة وأمنها واستمراريتها
- ممارسات العمليات المالية السحابية (FinOps) لمنصات البيانات: وسم الموارد، والتوسع التلقائي، وإيقاف العناقيد الخاملة، وتتبع الاستعلامات المكلفة.
- تأمين المنصة بالتشفير أثناء النقل والتخزين، والتحكم الدقيق في الوصول على مستوى الصف والعمود، وإخفاء الحقول الحساسة.
- التخطيط للتعافي من الكوارث بالنسخ بين المناطق الجغرافية، وتحديد هدف نقطة الاسترجاع وهدف زمن الاسترجاع لكل مجموعة بيانات.
05المحور الخامس: هندسة البيانات الضخمة في خدمة التحول الرقمي
2 جلسات · 6 نقاط
1الجلسة الأولى: نموذج الملكية وتنظيم فرق هندسة البيانات
- مبادئ شبكة البيانات (Data Mesh): الملكية حسب المجال، والبيانات بوصفها منتجاً، والمنصة ذاتية الخدمة، والحوكمة الحاسوبية الموحدة.
- متى تناسب المؤسسة منصة مركزية ومتى تستفيد من اللامركزية، وتقييم الجاهزية التنظيمية قبل الانتقال.
- بناء فريق هندسة البيانات: الأدوار والمهارات ومعايير الشيفرة والمراجعة والاختبار الآلي لخطوط البيانات.
2الجلسة الثانية: خارطة تحديث المنصات القديمة وترحيلها
- تقييم المنصة القائمة وتحديد مسار التحديث، بما في ذلك الترحيل التدريجي من المستودعات القديمة وعناقيد Hadoop إلى البنى السحابية الحديثة.
- ترتيب مراحل الترحيل حسب قيمة حالات الاستخدام ومخاطر الانقطاع، مع التشغيل المتوازي والتحقق من تطابق النتائج.
- مشروع ختامي: تصميم معماري لمنصة بيانات تخدم مبادرة تحول رقمي محددة، مع مخطط التدفقات وقرارات التقنية وتقدير الكلفة التشغيلية.
ما يحصل عليه المشارك
5 محاور علمية
مخطّط علميّ متدرّج
10 جلسة تدريبية
موزَّعة على 5 أيام
30 بنداً تفصيلياً
محتوى تطبيقي مفصَّل
شهادة حضور معتمدة
بعد إتمام البرنامج
أكمل بيانات التسجيل
سنتواصل معك خلال يوم عمل لتأكيد الحجز.
جاهز للبدء؟
احجز مقعدك في البرنامج وابدأ رحلة تطوير مهاراتك.
