Terima kasih telah mengirimkan pertanyaan Anda! Salah satu anggota tim kami akan segera menghubungi Anda.
Terima kasih telah mengirimkan pemesanan Anda! Salah satu anggota tim kami akan segera menghubungi Anda.
Kerangka Materi
Modul 1: Dasar-dasar Big Data & Spark
- Ringkasan ekosistem Big Data dan peran Spark dalam platform data modern
- Pemahaman arsitektur Spark: driver, eksekutor, cluster manager, evaluasi lazy, DAG, dan perencanaan eksekusi
- Perbedaan antara API RDD dan DataFrame serta kapan menggunakan masing-masing pendekatan
- Membuat dan mengonfigurasi SparkSession serta memahami dasar-dasar konfigurasi aplikasi
Modul 2: PySpark DataFrames
- Membaca dan menulis data dari sumber dan format perusahaan: CSV, JSON, Parquet, dan Delta
- Bekerja dengan PySpark DataFrames: transformasi, aksi, ekspresi kolom, penyaringan, penggabungan, dan agregasi
- Mengimplementasikan operasi lanjutan seperti fungsi window, penanganan timestamp, dan bekerja dengan data bersarang
- Menerapkan pemeriksaan kualitas data dan menulis kode PySpark yang dapat digunakan kembali dan mudah dipelihara
Modul 3: Dasar-dasar Kubernetes & Docker untuk Pengguna Spark
- Mengerti bagaimana image Docker dan pod Kubernetes berhubungan dengan proses driver dan eksekutor Spark — pandangan konseptual untuk pengguna cluster, bukan administrator
- Mengapa apa yang terjadi ketika sebuah pekerjaan Spark berjalan di Kubernetes: penjadwalan pod, permintaan dan batas sumber daya, serta bagaimana pengaturan sesi dipetakan ke dalamnya
- Mengerti apa yang Anda kendalikan melalui parameter sesi Spark versus apa yang dikendalikan oleh tim platform melalui penyediaan cluster — dan mengapa batas ini penting untuk tuning
- Latihan langsung: Periksalah pekerjaan Spark-on-Kubernetes yang berjalan di cluster sandbox dan identifikasi pod driver dan eksekutor
Modul 4: Konfigurasi Sesi Spark di Kubernetes — Penjelasan Mendalam
- Mengerti jumlah eksekutor versus ukuran eksekutor: kompromi antara memori dan core, serta bagaimana bernalar tentang keduanya
- Alokasi memori driver dan eksekutor, overhead memori, dan bagaimana hal ini diterjemahkan menjadi sumber daya pod
- Alokasi dinamis: bagaimana perilakunya di Kubernetes, kapan menghemat sumber daya, dan kapan tidak
- Latihan langsung: Jalankan pekerjaan yang sama dengan konfigurasi eksekutor dan core yang berbeda dan bandingkan waktu eksekusi serta penggunaan sumber daya
Modul 5: Perilaku Skalabilitas & Optimasi Biaya
- Mengerti bagaimana penambahan atau pengurangan node mengubah perilaku pekerjaan, waktu penyelesaian, dan konsumsi sumber daya
- Membandingkan banyak eksekutor kecil versus beberapa yang besar: kompromi kinerja dan biaya
- Perilaku shuffle dan penyetelan partisi shuffle, termasuk estimasi dampak biaya dari pilihan konfigurasi
- Latihan langsung: Skala cluster sandbox dari lima menjadi sepuluh node dan amati efeknya pada waktu penyelesaian pekerjaan dan konsumsi sumber daya
Modul 6: Ingesti & Partisi Data yang Efisien
- Mengerti masalah file kecil: mengapa sumber yang terbagi dalam banyak file Parquet berukuran 1–5 MB menurunkan kinerja dan mengganggu partisi
- Strategi repartisi dan koalesensi
- Mengontrol ukuran partisi saat membaca dan menulis
- Menulis Parquet secara efisien untuk menghindari munculnya kembali masalah file kecil di hilir
- Latihan langsung: Muat dataset yang terdiri dari banyak partisi Parquet kecil, terapkan strategi repartisi yang berbeda, dan bandingkan kinerja sebelum dan sesudah optimasi
Modul 7: Manajemen Memori Pandas & Diagnosis Kegagalan
- Mengerti penyebab utama kesalahan out-of-memory di Pandas dan mengenali gejalanya
- Menerapkan pola konversi yang efisien secara memori antara Spark dan Pandas
- Menghindari ledakan memori saat menulis dataset besar ke CSV
- Menggunakan pemrosesan chunked dan optimasi dtype untuk lingkungan yang terbatas
- Latihan langsung: Reproduksi skenario out-of-memory Pandas yang umum dan selesaikan menggunakan chunking dan optimasi dtype
Modul 8: Polars sebagai Alat Pelengkap
- Posisi Polars relatif terhadap Pandas: karakteristik kinerja, evaluasi lazy, dan perilaku memori
- Mengerti di mana Polars cocok berdampingan dengan PySpark dan Pandas dalam stack data cloud modern dan peta jalan migrasi, termasuk lingkungan AWS
- Latihan langsung: Tulis ulang transformasi yang padat Pandas menggunakan Polars dan bandingkan penggunaan memori serta kecepatan pemrosesan
Modul 9: Menerapkan Optimasi pada Beban Kerja ETL & ML
- Menerapkan prinsip konfigurasi, partisi, dan manajemen memori pada pipeline ETL yang realistis
- Mengerti pertimbangan optimasi yang spesifik untuk beban kerja machine learning yang berjalan di cluster yang sama
- Menerapkan alur kerja tuning praktis untuk mendiagnosis masalah biaya dan kinerja secara sistematis
- Latihan langsung: Selesaikan proyek mini end-to-end yang menggabungkan pemuatan data, transformasi, dan langkah pelatihan model sederhana, dengan partisipan menyetel konfigurasi Spark mereka sendiri
Persyaratan
Partisipan harus memiliki:
- Pengalaman praktis dalam program Python, termasuk fungsi, modul, dan konsep berorientasi objek dasar.
- Pengalaman dasar hingga menengah dalam bekerja dengan Pandas dan alur kerja pemrosesan data tabular.
- Keterampilan dasar dalam PySpark dan Spark DataFrames, termasuk pembacaan data, transformasi, aksi, penggabungan (joins), dan agregasi.
- Pemahaman umum tentang SQL dan konsep pemrosesan data, termasuk penyaringan, pengelompokan, dan penggabungan dataset.
- Keterampilan dasar dalam konsel Docker dan Kubernetes, seperti kontainer, image, dan pod. Pengalaman administrasi Kubernetes tidak diperlukan.
- Pemahaman dasar tentang format data umum seperti CSV, JSON, dan Parquet.
Partisipan tak perlu menjadi administrator Kubernetes atau spesialis infrastruktur. Kursus ini berfokus pada bagaimana data engineer, pengembang, dan ilmuwan data dapat memahami dan mengoptimalkan beban kerja Spark mereka yang berjalan di Kubernetes dari perspektif aplikasi dan konfigurasi.
Audiens Sasaran
Kursus ini dirancang untuk profesional yang mengembangkan, memelihara, atau mengoptimalkan beban kerja pemrosesan data dan machine learning menggunakan Python dan Spark di lingkungan cloud atau terkontainerisasi.
Khususnya cocok untuk:
- Insinyur Data yang bekerja dengan PySpark, pemrosesan data terdistribusi, dan pipeline ETL.
- Ilmuwan Data yang memproses dataset besar atau menjalankan beban kerja machine learning dengan Spark, Pandas, atau Polars.
- Pengembang Python yang bekerja dengan aplikasi berintensitas data dan ingin meningkatkan efisiensi memori dan kinerja pemrosesan.
- Insinyur Machine Learning yang mengelola beban kerja persiapan data dan pelatihan model di lingkungan Kubernetes atau cloud bersama.
- Insinyur Analitik yang bekerja dengan dataset besar dan mencari cara untuk meningkatkan efisiensi pemrosesan data.
- Insinyur DevOps, Platform, dan Cloud yang mendukung beban kerja Spark di Kubernetes dan perlu memahami bagaimana konfigurasi tingkat aplikasi memengaruhi penggunaan sumber daya dan kinerja.
- Pemimpin Teknis dan Arsitek Solusi yang terlibat dalam merancang atau mengoptimalkan platform pemrosesan data modern.
21 Jam
Testimoni (1)
Saya suka karena praktis. Saya senang dapat menerapkan pengetahuan teoritis dengan contoh-contoh praktis.
Aurelia-Adriana - Allianz Services Romania
Kursus - Python and Spark for Big Data (PySpark)
Diterjemahkan Mesin