Kerangka Materi
1. Pengenalan Deep Reinforcement Learning
- Apa itu Reinforcement Learning?
- Perbedaan antara Supervised, Unsupervised, dan Reinforcement Learning
- Aplikasi DRL di tahun 2025 (robotika, kesehatan, keuangan, logistik)
- Memahami loop interaksi agen-lingkungan
2. Fondasi Reinforcement Learning
- Markov Decision Processes (MDP)
- State, Action, Reward, Policy, dan fungsi Nilai
- Trade-off antara Eksplorasi vs. Eksploitasi
- Metode Monte Carlo dan pembelajaran Temporal-Difference (TD)
3. Implementasi Algoritma RL Dasar
- Metode tabel: Dynamic Programming, Evaluasi Kebijakan, dan Iterasi
- Q-Learning dan SARSA
- Eksplorasi Epsilon-greedy dan strategi meluruh (decaying)
- Implementasi lingkungan RL dengan OpenAI Gymnasium
4. Transisi ke Deep Reinforcement Learning
- Keterbatasan metode tabel
- Menggunakan jaringan saraf untuk aproksimasi fungsi
- Arsitektur dan alur kerja Deep Q-Network (DQN)
- Experience replay dan target networks
5. Algoritma DRL Lanjutan
- Double DQN, Dueling DQN, dan Prioritized Experience Replay
- Metode Policy Gradient: algoritma REINFORCE
- Arsitektur Actor-Critic (A2C, A3C)
- Proximal Policy Optimization (PPO)
- Soft Actor-Critic (SAC)
6. Bekerja dengan Ruang Aksi Kontinu
- Tantangan dalam kontrol kontinu
- Menggunakan DDPG (Deep Deterministic Policy Gradient)
- Twin Delayed DDPG (TD3)
7. Alat dan Framework Praktis
- Menggunakan Stable-Baselines3 dan Ray RLlib
- Pencatatan log dan pemantauan dengan TensorBoard
- Penyetelan hiperparameter untuk model DRL
8. Reward Engineering dan Desain Lingkungan
- Pembentukan reward (reward shaping) dan penyeimbangan penalti
- Konsep transfer learning dari simulasi ke dunia nyata (sim-to-real)
- Pembuatan lingkungan kustom di Gymnasium
9. Lingkungan Partially Observable dan Generalisasi
- Menangani informasi keadaan yang tidak lengkap (POMDPs)
- Pendekatan berbasis memori menggunakan LSTMs dan RNNs
- Meningkatkan ketangguhan dan generalisasi agen
10. Teori Permainan dan Multi-Agent Reinforcement Learning
- Pengenalan lingkungan multi-agen
- Kerja sama vs. kompetisi
- Aplikasi dalam pelatihan adversarial dan optimasi strategi
11. Studi Kasus dan Aplikasi Dunia Nyata
- Simulasi pengemudian otonom
- Strategi harga dinamis dan perdagangan keuangan
- Robotika dan otomasi industri
12. Pemecahan Masalah dan Optimasi
- Mendiagnosis ketidakstabilan pelatihan
- Mengelola kelangkaan reward (reward sparsity) dan overfitting
- Skala model DRL di GPU dan sistem terdistribusi
13. Ringkasan dan Langkah Selanjutnya
- Ringkasan arsitektur DRL dan algoritma kunci
- Tren industri dan arah riset (misalnya, RLHF, model hibrida)
- Sumber daya lanjutan dan materi bacaan
Persyaratan
- Kemampuan dalam pemrograman Python
- Pemahaman tentang Kalkulus dan Aljabar Linear
- Pengetahuan dasar Probabilitas dan Statistika
- Pengalaman membangun model machine learning menggunakan Python dan NumPy atau TensorFlow/PyTorch
Audience
- Developer yang tertarik pada AI dan sistem cerdas
- Data Scientist yang mengeksplorasi framework reinforcement learning
- Insinyur Machine Learning yang bekerja dengan sistem otonom
Testimoni (3)
Saya sangat menyukai bagian akhir di mana kita menghabiskan waktu untuk bermain dengan CHAT GPT. Ruangan tidak disiapkan dengan baik untuk ini—sebaiknya menggunakan beberapa meja kecil agar kita bisa berkumpul dalam kelompok-kelompok kecil dan melakukan brainstorming, daripada satu meja besar.
Nola - Laramie County Community College
Kursus - Artificial Intelligence (AI) Overview
Diterjemahkan Mesin
Bekerja berdasarkan prinsip-prinsip dasar secara fokus, dan beralih ke penerapan studi kasus pada hari yang sama
Maggie Webb - Department of Jobs, Regions, and Precincts
Kursus - Artificial Neural Networks, Machine Learning, Deep Thinking
Diterjemahkan Mesin
Bahwa itu menggunakan data perusahaan nyata. Instruktur memiliki pendekatan yang sangat baik dengan membuat peserta pelatihan berpartisipasi dan bersaing
Jimena Esquivel - Zaklad Uslugowy Hakoman Andrzej Cybulski
Kursus - Applied AI from Scratch in Python
Diterjemahkan Mesin