Terima kasih telah mengirimkan pertanyaan Anda! Salah satu anggota tim kami akan segera menghubungi Anda.
Terima kasih telah mengirimkan pemesanan Anda! Salah satu anggota tim kami akan segera menghubungi Anda.
Durasi 35 jam
Kerangka Materi
Pendahuluan, Tujuan, dan Strategi Migrasi
- Tujuan kursus, keselarasan profil peserta, dan kriteria keberhasilan
- Pendekatan migrasi tingkat tinggi dan pertimbangan risiko
- Persiapan workspace, repositori, dan dataset laboratorium
Day 1 — Fondasi Migrasi dan Arsitektur
- Konsep Lakehouse, gambaran Delta Lake, dan arsitektur Databricks
- Perbedaan SMP vs MPP dan implikasinya untuk migrasi
- Desain Medallion (Bronze→Silver→Gold) dan gambaran Unity Catalog
Day 1 Lab — Mentranslasikan Stored Procedure
- Migrasi hands-on stored procedure sampel ke notebook
- Memetakan tabel sementara dan kursor ke transformasi DataFrame
- Validasi dan perbandingan dengan output asli
Day 2 — Delta Lake Lanjutan & Pemuatan Inkremental
- Transaksi ACID, log commit, versioning, dan time travel
- Auto Loader, pola MERGE INTO, upserts, dan evolusi skema
- OPTIMIZE, VACUUM, Z-ORDER, partisi, dan penyetelan penyimpanan
Day 2 Lab — Ingestion & Optimasi Inkremental
- Menerapkan ingestion Auto Loader dan alur kerja MERGE
- Menerapkan OPTIMIZE, Z-ORDER, dan VACUUM; validasi hasil
- Ukuran peningkatan performa baca/tulis
Day 3 — SQL di Databricks, Performa & Debugging
- Fitur SQL analitik: window functions, higher-order functions, penanganan JSON/array
- Membaca Spark UI, DAG, shuffle, stage, tugas, dan diagnosis bottleneck
- Pola penyetelan kueri: broadcast joins, hints, caching, dan pengurangan spill
Day 3 Lab — Refactoring SQL & Penyetelan Performa
- Refactor proses SQL yang berat menjadi Spark SQL yang dioptimalkan
- Gunakan jejak Spark UI untuk mengidentifikasi dan memperbaiki masalah skew dan shuffle
- Benchmark sebelum/sesudah dan dokumentasikan langkah penyetelan
Day 4 — PySpark Taktis: Mengganti Logika Prosedural
- Model eksekusi Spark: driver, executor, evaluasi malas, dan strategi partisi
- Transformasi loop dan kursor ke operasi DataFrame tervektorisasi
- Modularisasi, UDF/pandas UDF, widget, dan pustaka yang dapat digunakan ulang
Day 4 Lab — Refactoring Skrip Prosedural
- Refactor skrip ETL prosedural ke notebook PySpark modular
- Perkenalkan parametrization, tes gaya unit, dan fungsi yang dapat digunakan ulang
- Review kode dan penerapan checklist praktik terbaik
Day 5 — Orkestrasi, Pipeline End-to-End & Praktik Terbaik
- Databricks Workflows: desain tugas, dependensi tugas, pemicu, dan penanganan error
- Merancang pipeline Medallion inkremental dengan aturan kualitas dan validasi skema
- Integrasi dengan Git (GitHub/Azure DevOps), CI, dan strategi pengujian untuk logika PySpark
Day 5 Lab — Bangun Pipeline End-to-End Lengkap
- Rakit pipeline Bronze→Silver→Gold yang diorkestrasikan dengan Workflows
- Terapkan logging, audit, retry, dan validasi otomatis
- Jalankan pipeline lengkap, validasi output, dan siapkan catatan deployment
Operasionalisasi, Tata Kelola, dan Kesiapan Produksi
- Tata kelola Unity Catalog, lineage, dan praktik terbaik kontrol akses
- Biaya, ukuran cluster, autoscaling, dan pola konkurensi tugas
- Checklist deployment, strategi rollback, dan pembuatan runbook
Review Akhir, Transfer Pengetahuan, dan Langkah Selanjutnya
- Presentasi peserta tentang pekerjaan migrasi dan pelajaran yang dipelajari
- Analisis kesenjangan, kegiatan tindak lanjut yang direkomendasikan, dan penyerahan materi pelatihan
- Rujukan, jalur pembelajaran lanjutan, dan opsi dukungan
Persyaratan
- Pemahaman tentang konsep rekayasa data
- Pengalaman dengan SQL dan stored procedure (Synapse / SQL Server)
- Kenalan dengan konsep orkestrasi ETL (ADF atau sejenisnya)
Audience
- Manajer teknologi dengan latar belakang rekayasa data
- Insinyur data yang bertransisi dari logika OLAP prosedural ke pola Lakehouse
- Insinyur platform yang bertanggung jawab atas adopsi Databricks