Hubungi Kami
 Durasi 35 jam

Kerangka Materi

Pendahuluan, Tujuan, dan Strategi Migrasi

  • Tujuan kursus, keselarasan profil peserta, dan kriteria keberhasilan
  • Pendekatan migrasi tingkat tinggi dan pertimbangan risiko
  • Persiapan workspace, repositori, dan dataset laboratorium

Day 1 — Fondasi Migrasi dan Arsitektur

  • Konsep Lakehouse, gambaran Delta Lake, dan arsitektur Databricks
  • Perbedaan SMP vs MPP dan implikasinya untuk migrasi
  • Desain Medallion (Bronze→Silver→Gold) dan gambaran Unity Catalog

Day 1 Lab — Mentranslasikan Stored Procedure

  • Migrasi hands-on stored procedure sampel ke notebook
  • Memetakan tabel sementara dan kursor ke transformasi DataFrame
  • Validasi dan perbandingan dengan output asli

Day 2 — Delta Lake Lanjutan & Pemuatan Inkremental

  • Transaksi ACID, log commit, versioning, dan time travel
  • Auto Loader, pola MERGE INTO, upserts, dan evolusi skema
  • OPTIMIZE, VACUUM, Z-ORDER, partisi, dan penyetelan penyimpanan

Day 2 Lab — Ingestion & Optimasi Inkremental

  • Menerapkan ingestion Auto Loader dan alur kerja MERGE
  • Menerapkan OPTIMIZE, Z-ORDER, dan VACUUM; validasi hasil
  • Ukuran peningkatan performa baca/tulis

Day 3 — SQL di Databricks, Performa & Debugging

  • Fitur SQL analitik: window functions, higher-order functions, penanganan JSON/array
  • Membaca Spark UI, DAG, shuffle, stage, tugas, dan diagnosis bottleneck
  • Pola penyetelan kueri: broadcast joins, hints, caching, dan pengurangan spill

Day 3 Lab — Refactoring SQL & Penyetelan Performa

  • Refactor proses SQL yang berat menjadi Spark SQL yang dioptimalkan
  • Gunakan jejak Spark UI untuk mengidentifikasi dan memperbaiki masalah skew dan shuffle
  • Benchmark sebelum/sesudah dan dokumentasikan langkah penyetelan

Day 4 — PySpark Taktis: Mengganti Logika Prosedural

  • Model eksekusi Spark: driver, executor, evaluasi malas, dan strategi partisi
  • Transformasi loop dan kursor ke operasi DataFrame tervektorisasi
  • Modularisasi, UDF/pandas UDF, widget, dan pustaka yang dapat digunakan ulang

Day 4 Lab — Refactoring Skrip Prosedural

  • Refactor skrip ETL prosedural ke notebook PySpark modular
  • Perkenalkan parametrization, tes gaya unit, dan fungsi yang dapat digunakan ulang
  • Review kode dan penerapan checklist praktik terbaik

Day 5 — Orkestrasi, Pipeline End-to-End & Praktik Terbaik

  • Databricks Workflows: desain tugas, dependensi tugas, pemicu, dan penanganan error
  • Merancang pipeline Medallion inkremental dengan aturan kualitas dan validasi skema
  • Integrasi dengan Git (GitHub/Azure DevOps), CI, dan strategi pengujian untuk logika PySpark

Day 5 Lab — Bangun Pipeline End-to-End Lengkap

  • Rakit pipeline Bronze→Silver→Gold yang diorkestrasikan dengan Workflows
  • Terapkan logging, audit, retry, dan validasi otomatis
  • Jalankan pipeline lengkap, validasi output, dan siapkan catatan deployment

Operasionalisasi, Tata Kelola, dan Kesiapan Produksi

  • Tata kelola Unity Catalog, lineage, dan praktik terbaik kontrol akses
  • Biaya, ukuran cluster, autoscaling, dan pola konkurensi tugas
  • Checklist deployment, strategi rollback, dan pembuatan runbook

Review Akhir, Transfer Pengetahuan, dan Langkah Selanjutnya

  • Presentasi peserta tentang pekerjaan migrasi dan pelajaran yang dipelajari
  • Analisis kesenjangan, kegiatan tindak lanjut yang direkomendasikan, dan penyerahan materi pelatihan
  • Rujukan, jalur pembelajaran lanjutan, dan opsi dukungan

Persyaratan

  • Pemahaman tentang konsep rekayasa data
  • Pengalaman dengan SQL dan stored procedure (Synapse / SQL Server)
  • Kenalan dengan konsep orkestrasi ETL (ADF atau sejenisnya)

Audience

  • Manajer teknologi dengan latar belakang rekayasa data
  • Insinyur data yang bertransisi dari logika OLAP prosedural ke pola Lakehouse
  • Insinyur platform yang bertanggung jawab atas adopsi Databricks

Jumlah Peserta


Harga per Peserta

Kursus Mendatang

Kategori Terkait