Hubungi Kami

Kerangka Materi

Panduan Dasar Penerapan Tencent Hunyuan dalam Produksi

  • Gambaran umum mengenai situasi penerapan model Tencent Hunyuan di lingkungan produksi
  • Karakteristik produksi model bahasa besar serta model MoE
  • Hambatan khas terkait latensi, kecepatan pemrosesan data, dan biaya operasional
  • Penetapan tujuan tingkat layanan yang relevan bagi beban kerja inferensi

Arsitektur Penerapan dan Alur Kerja Inferensi

  • Komponen utama dari sistem penyajian inferensi berskala besar
  • Pemilihan model penerapan: berbasis kontainer, di lingkungan lokal, atau pada cloud
  • Pengelolaan proses pemuatan model, penyaluran permintaan, serta alokasi sumber daya GPU secara dasar
  • Prinsip-prinsip merancang sistem yang andal dan mudah dikelola

Penerapan Teknik Optimisasi Latensi

  • Pemanfaatan mesin inferensi teroptimalisasi seperti TensorRT bila diperlukan
  • Konsep KV-cache dan strategi penyetelan cache yang efektif
  • Cara mengurangi waktu proses inisialisasi, pemanasan sistem, serta penundaan respons
  • Cara mengukur durasi hingga token pertama dihasilkan serta kecepatan generasi token selanjutnya

Optimalisasi Kecepatan Pemrosesan Data, Pengelompokan Permintaan & Efisiensi GPU

  • Penerapan strategi pengelompokan permintaan baik secara kontinu maupun berdasarkan kumpulan khusus
  • Pengaturan tingkat konkurensi serta perilaku antrian permintaan
  • Cara meningkatkan pemanfaatan GPU tanpa mengganggu kenyamanan pengguna akhir
  • Penanganan situasi dengan panjang konteks data yang besar maupun kombinasi beban kerja yang bervariasi

Strategi Kuantisasi dan Pengendalian Biaya

  • Alasan pentingnya teknik kuantisasi bagi penerapan model dalam produksi
  • Pertimbangan praktis terkait penggunaan presisi seperti FP16, INT8, maupun opsi lainnya
  • Cara menyeimbangkan kualitas model, latensi, serta besaran biaya infrastruktur
  • Pembentukan daftar periksa sederhana untuk meningkatkan efisiensi pengeluaran finansial<\/li>

Operasional Sehari-hari, Pemantauan Sistem & Peninjauan Kesiapan

  • Pemicu auto-scaling yang relevan bagi layanan inferensi
  • Pemantauan parameter seperti latensi, kecepatan pemrosesan data, penggunaan cache, serta kesehatan perangkat GPU
  • Teknik dasar pencatatan aktivitas sistem, pengaturan peringatan, serta penanganan insiden yang mungkin terjadi
  • Peninjauan contoh penerapan konkret dan penyusunan rencana pengembangan lebih lanjut

Persyaratan

  • Pemahaman dasar mengenai proses penerapan model bahasa besar serta alur kerja inferensi
  • Pengalaman menggunakan kontainer, infrastruktur berbasis cloud atau lokal, serta layanan berbasis API
  • Kemampuan praktis dalam pemrograman Python maupun tugas-tugas teknik sistem

Target Peserta

  • Insinyur ML yang bertanggung jawab atas penerapan model bahasa besar dalam produksi
  • Insinyur platform yang menangani layanan inferensi berbasis GPU
  • Arsitek solusi yang merancang infrastruktur penyajian AI yang skalabel
 14 Jam

Jumlah Peserta


Harga per Peserta

Kursus Mendatang

Kategori Terkait