Hubungi Kami

Kerangka Materi

Modul 1: Dasar-dasar Big Data & Spark

  • Ringkasan ekosistem Big Data dan peran Spark dalam platform data modern
  • Pemahaman arsitektur Spark: driver, eksekutor, cluster manager, evaluasi lazy, DAG, dan perencanaan eksekusi
  • Perbedaan antara API RDD dan DataFrame serta kapan menggunakan masing-masing pendekatan
  • Membuat dan mengonfigurasi SparkSession serta memahami dasar-dasar konfigurasi aplikasi

Modul 2: PySpark DataFrames

  • Membaca dan menulis data dari sumber dan format perusahaan: CSV, JSON, Parquet, dan Delta
  • Bekerja dengan PySpark DataFrames: transformasi, aksi, ekspresi kolom, penyaringan, penggabungan, dan agregasi
  • Mengimplementasikan operasi lanjutan seperti fungsi window, penanganan timestamp, dan bekerja dengan data bersarang
  • Menerapkan pemeriksaan kualitas data dan menulis kode PySpark yang dapat digunakan kembali dan mudah dipelihara

Modul 3: Dasar-dasar Kubernetes & Docker untuk Pengguna Spark

  • Mengerti bagaimana image Docker dan pod Kubernetes berhubungan dengan proses driver dan eksekutor Spark — pandangan konseptual untuk pengguna cluster, bukan administrator
  • Mengapa apa yang terjadi ketika sebuah pekerjaan Spark berjalan di Kubernetes: penjadwalan pod, permintaan dan batas sumber daya, serta bagaimana pengaturan sesi dipetakan ke dalamnya
  • Mengerti apa yang Anda kendalikan melalui parameter sesi Spark versus apa yang dikendalikan oleh tim platform melalui penyediaan cluster — dan mengapa batas ini penting untuk tuning
  • Latihan langsung: Periksalah pekerjaan Spark-on-Kubernetes yang berjalan di cluster sandbox dan identifikasi pod driver dan eksekutor

Modul 4: Konfigurasi Sesi Spark di Kubernetes — Penjelasan Mendalam

  • Mengerti jumlah eksekutor versus ukuran eksekutor: kompromi antara memori dan core, serta bagaimana bernalar tentang keduanya
  • Alokasi memori driver dan eksekutor, overhead memori, dan bagaimana hal ini diterjemahkan menjadi sumber daya pod
  • Alokasi dinamis: bagaimana perilakunya di Kubernetes, kapan menghemat sumber daya, dan kapan tidak
  • Latihan langsung: Jalankan pekerjaan yang sama dengan konfigurasi eksekutor dan core yang berbeda dan bandingkan waktu eksekusi serta penggunaan sumber daya

Modul 5: Perilaku Skalabilitas & Optimasi Biaya

  • Mengerti bagaimana penambahan atau pengurangan node mengubah perilaku pekerjaan, waktu penyelesaian, dan konsumsi sumber daya
  • Membandingkan banyak eksekutor kecil versus beberapa yang besar: kompromi kinerja dan biaya
  • Perilaku shuffle dan penyetelan partisi shuffle, termasuk estimasi dampak biaya dari pilihan konfigurasi
  • Latihan langsung: Skala cluster sandbox dari lima menjadi sepuluh node dan amati efeknya pada waktu penyelesaian pekerjaan dan konsumsi sumber daya

Modul 6: Ingesti & Partisi Data yang Efisien

  • Mengerti masalah file kecil: mengapa sumber yang terbagi dalam banyak file Parquet berukuran 1–5 MB menurunkan kinerja dan mengganggu partisi
  • Strategi repartisi dan koalesensi
  • Mengontrol ukuran partisi saat membaca dan menulis
  • Menulis Parquet secara efisien untuk menghindari munculnya kembali masalah file kecil di hilir
  • Latihan langsung: Muat dataset yang terdiri dari banyak partisi Parquet kecil, terapkan strategi repartisi yang berbeda, dan bandingkan kinerja sebelum dan sesudah optimasi

Modul 7: Manajemen Memori Pandas & Diagnosis Kegagalan

  • Mengerti penyebab utama kesalahan out-of-memory di Pandas dan mengenali gejalanya
  • Menerapkan pola konversi yang efisien secara memori antara Spark dan Pandas
  • Menghindari ledakan memori saat menulis dataset besar ke CSV
  • Menggunakan pemrosesan chunked dan optimasi dtype untuk lingkungan yang terbatas
  • Latihan langsung: Reproduksi skenario out-of-memory Pandas yang umum dan selesaikan menggunakan chunking dan optimasi dtype

Modul 8: Polars sebagai Alat Pelengkap

  • Posisi Polars relatif terhadap Pandas: karakteristik kinerja, evaluasi lazy, dan perilaku memori
  • Mengerti di mana Polars cocok berdampingan dengan PySpark dan Pandas dalam stack data cloud modern dan peta jalan migrasi, termasuk lingkungan AWS
  • Latihan langsung: Tulis ulang transformasi yang padat Pandas menggunakan Polars dan bandingkan penggunaan memori serta kecepatan pemrosesan

Modul 9: Menerapkan Optimasi pada Beban Kerja ETL & ML

  • Menerapkan prinsip konfigurasi, partisi, dan manajemen memori pada pipeline ETL yang realistis
  • Mengerti pertimbangan optimasi yang spesifik untuk beban kerja machine learning yang berjalan di cluster yang sama
  • Menerapkan alur kerja tuning praktis untuk mendiagnosis masalah biaya dan kinerja secara sistematis
  • Latihan langsung: Selesaikan proyek mini end-to-end yang menggabungkan pemuatan data, transformasi, dan langkah pelatihan model sederhana, dengan partisipan menyetel konfigurasi Spark mereka sendiri

Persyaratan

Partisipan harus memiliki:

  • Pengalaman praktis dalam program Python, termasuk fungsi, modul, dan konsep berorientasi objek dasar.
  • Pengalaman dasar hingga menengah dalam bekerja dengan Pandas dan alur kerja pemrosesan data tabular.
  • Keterampilan dasar dalam PySpark dan Spark DataFrames, termasuk pembacaan data, transformasi, aksi, penggabungan (joins), dan agregasi.
  • Pemahaman umum tentang SQL dan konsep pemrosesan data, termasuk penyaringan, pengelompokan, dan penggabungan dataset.
  • Keterampilan dasar dalam konsel Docker dan Kubernetes, seperti kontainer, image, dan pod. Pengalaman administrasi Kubernetes tidak diperlukan.
  • Pemahaman dasar tentang format data umum seperti CSV, JSON, dan Parquet.

Partisipan tak perlu menjadi administrator Kubernetes atau spesialis infrastruktur. Kursus ini berfokus pada bagaimana data engineer, pengembang, dan ilmuwan data dapat memahami dan mengoptimalkan beban kerja Spark mereka yang berjalan di Kubernetes dari perspektif aplikasi dan konfigurasi.

Audiens Sasaran

Kursus ini dirancang untuk profesional yang mengembangkan, memelihara, atau mengoptimalkan beban kerja pemrosesan data dan machine learning menggunakan Python dan Spark di lingkungan cloud atau terkontainerisasi.

Khususnya cocok untuk:

  • Insinyur Data yang bekerja dengan PySpark, pemrosesan data terdistribusi, dan pipeline ETL.
  • Ilmuwan Data yang memproses dataset besar atau menjalankan beban kerja machine learning dengan Spark, Pandas, atau Polars.
  • Pengembang Python yang bekerja dengan aplikasi berintensitas data dan ingin meningkatkan efisiensi memori dan kinerja pemrosesan.
  • Insinyur Machine Learning yang mengelola beban kerja persiapan data dan pelatihan model di lingkungan Kubernetes atau cloud bersama.
  • Insinyur Analitik yang bekerja dengan dataset besar dan mencari cara untuk meningkatkan efisiensi pemrosesan data.
  • Insinyur DevOps, Platform, dan Cloud yang mendukung beban kerja Spark di Kubernetes dan perlu memahami bagaimana konfigurasi tingkat aplikasi memengaruhi penggunaan sumber daya dan kinerja.
  • Pemimpin Teknis dan Arsitek Solusi yang terlibat dalam merancang atau mengoptimalkan platform pemrosesan data modern.
 21 Jam

Jumlah Peserta


Harga per Peserta

Testimoni (1)

Kursus Mendatang

Kategori Terkait