Hubungi Kami

Kerangka Materi

Fundament Platform Databricks dan Lakehouse

  • Arsitektur dan komponen Lakehouse Databricks
  • Menyelenggarakan workspace dan katalog

Ruang Kerja dan Notebook Databricks

  • Navigasi ruang kerja dan pengembangan berbasis notebook
  • Memstrukturkan kode menjadi notebook yang dapat digunakan kembali

Arsitektur dan Eksekusi Apache Spark

  • Arsitektur runtime Spark dan model eksekusi
  • Evaluasi lambat (lazy evaluation) dan DAG pekerjaan

PySpark DataFrames dan API DataFrame

  • Abstraksi DataFrame dan skema
  • Operasi inti DataFrame dan ekspresi kolom

Menerjemahkan SQL ke PySpark DataFrames

  • Menerjemahkan klausa SQL inti menjadi operasi DataFrame
  • Fungsi jendela (window functions) dan agregasi di PySpark

Membaca dan Menulis Data di Databricks

  • Membaca dari sumber file dan database umum
  • Menulis dan mempartisi data di Lakehouse

Delta Lake dan Manajemen Tabel

  • Tabel Delta dan transaksi ACID
  • Time travel dan evolusi skema

Pola Pembersihan dan Transformasi Data

  • Pembersihan data dan konversi tipe data
  • Membangun logika transformasi yang dapat digunakan kembali

Fungsi Buatan Pengguna dan Kode Modular

  • UDF Python dan UDF pandas
  • Meng-modularisasi logika prosedural menjadi fungsi

Penalaan Kinerja dan Optimasi

  • Strategi partisi dan caching
  • Mendiagnosis kemacetan dengan Spark UI

Fundament Aliran Data Terstruktur (Structured Streaming)

\r
  • Model pemrosesan batch versus streaming
  • DataFrame streaming dan agregasi dasar

Pekerjaan dan Orkestrasi Alur Kerja Databricks

  • Menjadwalkan notebook sebagai pekerjaan dan tugas
  • Membangun alur kerja multi-langkah dengan ketergantungan

Unity Catalog dan Tata Kelola Data

  • Arsitektur dan nama ruang (namespaces) Unity Catalog
  • Kontrol akses dan silsilah data (data lineage)

Pengujian, Pen_debug-an, dan Praktik Produksi

  • Pengujian unit logika PySpark
  • Pen_debug-an dan standar kualitas kode

Kasus Penggunaan Jasa Keuangan End-to-End

  • Membangun pipa ETL perbankan end-to-end
  • Menerjemahkan proses SQL warisan (legacy) ke PySpark

Memigrasikan Beban Kerja SQL ke PySpark

  • Strategi dan pola perencanaan migrasi
  • Konversi bertahap alur kerja SQL ke PySpark

Persyaratan

  • Pengalaman dengan pemrograman Python, termasuk fungsi dan tipe data
  • Pemahaman tentang SQL, termasuk join, agregasi, dan subkueri
  • Tidak diperlukan pengalaman sebelumnya dengan Databricks atau PySpark

Audiens

  • Insinyur data, analis data, dan profesional data
  • Tim yang memigrasikan alur kerja berbasis SQL yang ada ke Databricks dan PySpark
 35 Jam

Jumlah Peserta


Harga per Peserta

Testimoni (1)

Kursus Mendatang

Kategori Terkait