Terima kasih telah mengirimkan pertanyaan Anda! Salah satu anggota tim kami akan segera menghubungi Anda.
Terima kasih telah mengirimkan pemesanan Anda! Salah satu anggota tim kami akan segera menghubungi Anda.
Durasi 14 jam
Kerangka Materi
Panduan Dasar Penerapan Tencent Hunyuan dalam Produksi
- Gambaran umum mengenai situasi penerapan model Tencent Hunyuan di lingkungan produksi
- Karakteristik produksi model bahasa besar serta model MoE
- Hambatan khas terkait latensi, kecepatan pemrosesan data, dan biaya operasional
- Penetapan tujuan tingkat layanan yang relevan bagi beban kerja inferensi
Arsitektur Penerapan dan Alur Kerja Inferensi
- Komponen utama dari sistem penyajian inferensi berskala besar
- Pemilihan model penerapan: berbasis kontainer, di lingkungan lokal, atau pada cloud
- Pengelolaan proses pemuatan model, penyaluran permintaan, serta alokasi sumber daya GPU secara dasar
- Prinsip-prinsip merancang sistem yang andal dan mudah dikelola
Penerapan Teknik Optimisasi Latensi
- Pemanfaatan mesin inferensi teroptimalisasi seperti TensorRT bila diperlukan
- Konsep KV-cache dan strategi penyetelan cache yang efektif
- Cara mengurangi waktu proses inisialisasi, pemanasan sistem, serta penundaan respons
- Cara mengukur durasi hingga token pertama dihasilkan serta kecepatan generasi token selanjutnya
Optimalisasi Kecepatan Pemrosesan Data, Pengelompokan Permintaan & Efisiensi GPU
- Penerapan strategi pengelompokan permintaan baik secara kontinu maupun berdasarkan kumpulan khusus
- Pengaturan tingkat konkurensi serta perilaku antrian permintaan
- Cara meningkatkan pemanfaatan GPU tanpa mengganggu kenyamanan pengguna akhir
- Penanganan situasi dengan panjang konteks data yang besar maupun kombinasi beban kerja yang bervariasi
Strategi Kuantisasi dan Pengendalian Biaya
- Alasan pentingnya teknik kuantisasi bagi penerapan model dalam produksi
- Pertimbangan praktis terkait penggunaan presisi seperti FP16, INT8, maupun opsi lainnya
- Cara menyeimbangkan kualitas model, latensi, serta besaran biaya infrastruktur
- Pembentukan daftar periksa sederhana untuk meningkatkan efisiensi pengeluaran finansial<\/li>
Operasional Sehari-hari, Pemantauan Sistem & Peninjauan Kesiapan
- Pemicu auto-scaling yang relevan bagi layanan inferensi
- Pemantauan parameter seperti latensi, kecepatan pemrosesan data, penggunaan cache, serta kesehatan perangkat GPU
- Teknik dasar pencatatan aktivitas sistem, pengaturan peringatan, serta penanganan insiden yang mungkin terjadi
- Peninjauan contoh penerapan konkret dan penyusunan rencana pengembangan lebih lanjut
Persyaratan
- Pemahaman dasar mengenai proses penerapan model bahasa besar serta alur kerja inferensi
- Pengalaman menggunakan kontainer, infrastruktur berbasis cloud atau lokal, serta layanan berbasis API
- Kemampuan praktis dalam pemrograman Python maupun tugas-tugas teknik sistem
Target Peserta
- Insinyur ML yang bertanggung jawab atas penerapan model bahasa besar dalam produksi
- Insinyur platform yang menangani layanan inferensi berbasis GPU
- Arsitek solusi yang merancang infrastruktur penyajian AI yang skalabel