Hubungi Kami

Kerangka Materi

PySpark & Pembelajaran Mesin 

Modul 1: Dasar-dasar Big Data dan Spark

  • Gambaran umum mengenai ekosistem Big Data serta peran Spark dalam platform data modern
  • Memahami arsitektur Spark: driver, executor, cluster manager, mekanisme evaluasi lambat (lazy evaluation), DAG, dan perencanaan eksekusi
  • Perbedaan antara API RDD dan DataFrame serta kapan masing-masing metode sebaiknya digunakan
  • Membuat serta mengonfigurasi SparkSession, beserta konsep dasar pengaturan aplikasi

Modul 2: PySpark DataFrames

  • Membaca dan menulis data dari berbagai sumber serta format yang umum digunakan perusahaan (CSV, JSON, Parquet, Delta)
  • Mengoperasikan PySpark DataFrames: transformasi, aksi data, ekspresi kolom, penyaringan, penggabungan dataset, serta agregasi
  • Menerapkan operasi lanjutan seperti fungsi window, penanganan data waktu, dan manipulasi struktur data bersarang
  • Melakukan pemeriksaan kualitas data serta menulis kode PySpark yang terstruktur dan mudah dipertahankan

Modul 3: Pemrosesan Dataset Besar Secara Efisien

  • Memahami aspek performa utama: strategi partisi, perilaku operasi shuffle, serta teknik caching dan persistensi data
  • Menggunakan teknik optimisasi seperti metode broadcast join dan analisis rencana eksekusi Spark
  • Strategi pengolahan dataset besar secara efektif serta praktik terbaik untuk membangun alur kerja data yang dapat diskalakan
  • Memahami mekanisme evolusi skema dan format penyimpanan kontemporer yang umum dipakai di lingkungan perusahaan

Modul 4: Rekayasa Fitur dalam Skala Besar

  • Melakukan rekayasa fitur menggunakan Spark MLlib: menangani data yang mengandung nilai kosong, pengkodean variabel kategoris, serta penyesuaian skala fitur
  • Merancang langkah-langkah pra-pemrosesan data yang dapat dipakai kembali dan menyiapkan dataset untuk digunakan dalam alur kerja Pembelajaran Mesin
  • Pengenalan mengenai teknik pemilihan fitur optimal serta penanganan kasus dataset tidak seimbang

Modul 5: Pembelajaran Mesin dengan Spark MLlib

  • Memahami struktur arsitektural MLlib serta pola Estimator/Transformer dalam kerangka kerjanya
  • Melatih model regresi dan klasifikasi pada skala besar (Regresi Linear, Regresi Logistik, Pohon Keputusan, Random Forest)
  • Membandingkan berbagai model serta menginterpretasikan hasilnya dalam konteks alur kerja Pembelajaran Mesin terdistribusi

Modul 6: Alur Kerja ML End-to-End

  • Membangun alur kerja Pembelajaran Mesin lengkap yang menggabungkan langkah pra-pemrosesan data, rekayasa fitur, serta pemodelan
  • Menerapkan strategi pembagian data ke dalam kelompok pelatihan, validasi, dan uji coba
  • Melakukan validasi silang serta penyetelan parameter model melalui metode grid search maupun random search
  • Mengorganisir eksperimen Pembelajaran Mesin sehingga mudah direplikasi dan diulangi prosesnya

Modul 7: Evaluasi Model & Pengambilan Keputusan Praktis dalam Pembelajaran Mesin

  • Memilih metrik evaluasi yang tepat untuk masalah regresi maupun klasifikasi
  • Mengidentifikasi gejala overfitting atau underfitting serta membuat keputusan rasional dalam pemilihan model terbaik
  • Menganalisis pentingnya masing-masing fitur bagi model dan memahami perilaku umum suatu algoritma Pembelajaran Mesin

Modul 8: Penerapan dalam Lingkungan Produksi & Praktik Perusahaan

  • Menyimpan dan memuat kembali model di lingkungan Spark
  • Membangun alur kerja inferensi batch guna mengolah kumpulan data besar secara massal
  • Memahami tahapan kehidupan hidup suatu model Pembelajaran Mesin di perusahaan modern
  • Pengenalan konsep versioning, pelacakan eksperimen, serta strategi pengujian dasar dalam proyek ML

 

Hasil yang Diperoleh Setelah Pelatihan

  • Kemampuan bekerja secara mandiri menggunakan PySpark
  • Kemampuan mengolah kumpulan data besar dengan efisien
  • Kemampuan melakukan rekayasa fitur dalam skala yang luas
  • Kemampuan menyusun alur kerja Pembelajaran Mesin yang dapat diskalakan secara komprehensif

Persyaratan

Diperlukan latar belakang berikut dari para peserta:

Pengetahuan dasar pemrograman Python, termasuk penggunaan fungsi, struktur data, dan pustaka
Pemahaman mendasar mengenai konsep analisis data seperti dataset, transformasi, dan agregasi
Pengetahuan dasar SQL serta prinsip-prinsip basis data relasional
Pengenalan singkat terhadap konsep-konsep Pembelajaran Mesin seperti dataset pelatihan, fitur model, dan metrik evaluasi
Disarankan sudah terbiasa dengan lingkungan command line serta praktik pengembangan perangkat lunak umum

Pengalaman menggunakan pustaka pemrosesan data seperti Pandas atau NumPy tentu akan sangat membantu, meskipun tidak menjadi syarat mutlak.

 21 Jam

Jumlah Peserta


Harga per Peserta

Testimoni (1)

Kursus Mendatang

Kategori Terkait