Hubungi Kami

Kerangka Materi

Pengantar Model Visual-Bahasa

  • Gambaran umum tentang VLM dan perannya dalam sistem AI multimodal
  • Arsitektur populer: CLIP, Flamingo, BLIP, dll.
  • Aplikasi praktis: mesin pencari, pembuatan deskripsi gambar, sistem otonom, analisis konten

Persiapan Lingkungan Penyetunan

  • Pengaturan OpenCLIP serta perpustakaan VLM lainnya
  • Format dataset untuk pasangan gambar-teks
  • Rangkaian proses preprocessing input visual dan bahasa

Penyetunan Model CLIP dan Serupa

  • Fungsi loss kontrasif serta pembentukan ruang embedding gabungan
  • Praktikum: menyetuning CLIP menggunakan dataset khusus
  • Cara mengatasi kendala data domain-spesifik maupun multibahasa

Teknik Penyetunan Tingkat Lanjut

  • Pemanfaatan metode LoRA dan adapter untuk efisiensi operasional
  • Konsep prompt tuning serta penyuntikan prompt visual
  • Perbandingan evaluasi model zero-shot vs hasil penyetunan

Evaluasi dan Pengujian Kinerja

  • Metrik evaluasi VLM: tingkat akurasi pengambilan data, nilai BLEU, CIDEr, recall
  • Pengukuran ketersejajaran antara elemen visual dan teks
  • Cara memvisualisasikan ruang embedding serta kasus kesalahan klasifikasi

Implementasi ke dalam Aplikasi Nyata

  • Ekspor model untuk digunakan dalam inferensi (format TorchScript, ONNX)
  • Integrasi VLM ke dalam alur kerja atau API sistem tertentu
  • Pertimbangan penggunaan sumber daya dan skalabilitas model

Studi Kasus dan Skenario Aplikatif

  • Analisis media serta moderasi konten secara otomatis
  • Sistem pencarian data pada e-commerce dan perpustakaan digital<\/li>
  • Pemanfaatan interaksi multimodal dalam sistem robotika dan otonom

Penutup dan Rekomendasi Selanjutnya

Persyaratan

  • Pemahaman dasar mengenai deep learning untuk visi komputer dan NLP
  • Pengalaman menggunakan PyTorch serta model berbasis transformer
  • Pengetahuan tentang arsitektur model multimodal

Target Peserta

  • Insinyur komputer visi
  • Pengembang AI
 14 Jam

Jumlah Peserta


Harga per Peserta

Kursus Mendatang

Kategori Terkait