Kerangka Materi
Fundament Platform Databricks dan Lakehouse
- Arsitektur dan komponen Lakehouse Databricks
- Menyelenggarakan workspace dan katalog
Ruang Kerja dan Notebook Databricks
- Navigasi ruang kerja dan pengembangan berbasis notebook
- Memstrukturkan kode menjadi notebook yang dapat digunakan kembali
Arsitektur dan Eksekusi Apache Spark
- Arsitektur runtime Spark dan model eksekusi
- Evaluasi lambat (lazy evaluation) dan DAG pekerjaan
PySpark DataFrames dan API DataFrame
- Abstraksi DataFrame dan skema
- Operasi inti DataFrame dan ekspresi kolom
Menerjemahkan SQL ke PySpark DataFrames
- Menerjemahkan klausa SQL inti menjadi operasi DataFrame
- Fungsi jendela (window functions) dan agregasi di PySpark
Membaca dan Menulis Data di Databricks
- Membaca dari sumber file dan database umum
- Menulis dan mempartisi data di Lakehouse
Delta Lake dan Manajemen Tabel
- Tabel Delta dan transaksi ACID
- Time travel dan evolusi skema
Pola Pembersihan dan Transformasi Data
- Pembersihan data dan konversi tipe data
- Membangun logika transformasi yang dapat digunakan kembali
Fungsi Buatan Pengguna dan Kode Modular
- UDF Python dan UDF pandas
- Meng-modularisasi logika prosedural menjadi fungsi
Penalaan Kinerja dan Optimasi
- Strategi partisi dan caching
- Mendiagnosis kemacetan dengan Spark UI
Fundament Aliran Data Terstruktur (Structured Streaming)
\r- Model pemrosesan batch versus streaming
- DataFrame streaming dan agregasi dasar
Pekerjaan dan Orkestrasi Alur Kerja Databricks
- Menjadwalkan notebook sebagai pekerjaan dan tugas
- Membangun alur kerja multi-langkah dengan ketergantungan
Unity Catalog dan Tata Kelola Data
- Arsitektur dan nama ruang (namespaces) Unity Catalog
- Kontrol akses dan silsilah data (data lineage)
Pengujian, Pen_debug-an, dan Praktik Produksi
- Pengujian unit logika PySpark
- Pen_debug-an dan standar kualitas kode
Kasus Penggunaan Jasa Keuangan End-to-End
- Membangun pipa ETL perbankan end-to-end
- Menerjemahkan proses SQL warisan (legacy) ke PySpark
Memigrasikan Beban Kerja SQL ke PySpark
- Strategi dan pola perencanaan migrasi
- Konversi bertahap alur kerja SQL ke PySpark
Persyaratan
- Pengalaman dengan pemrograman Python, termasuk fungsi dan tipe data
- Pemahaman tentang SQL, termasuk join, agregasi, dan subkueri
- Tidak diperlukan pengalaman sebelumnya dengan Databricks atau PySpark
Audiens
- Insinyur data, analis data, dan profesional data
- Tim yang memigrasikan alur kerja berbasis SQL yang ada ke Databricks dan PySpark
Testimoni (1)
Saya suka karena praktis. Saya senang dapat menerapkan pengetahuan teoritis dengan contoh-contoh praktis.
Aurelia-Adriana - Allianz Services Romania
Kursus - Python and Spark for Big Data (PySpark)
Diterjemahkan Mesin