Hubungi Kami
 Durasi 21 jam

Kerangka Materi

Pengenalan Multimodal AI dan Ollama

  • Ikhtisar pembelajaran multimodal
  • Tantangan utama dalam integrasi visi-bahasa
  • Kemampuan dan arsitektur Ollama

Persiapan Lingkungan Ollama

  • Instalasi dan konfigurasi Ollama
  • Penanganan deployment model lokal
  • Integrasi Ollama dengan Python dan Jupyter

Penanganan Input Multimodal

  • Integrasi teks dan gambar
  • Penggunaan audio dan data terstruktur
  • Perancangan pipeline pra-pemrosesan

Aplikasi Pemahaman Dokumen

  • Pengekstrakan informasi terstruktur dari PDF dan gambar
  • Kombinasi OCR dengan model bahasa
  • Pembangunan workflow analisis dokumen cerdas

Visual Question Answering (VQA)

  • Persiapan dataset dan benchmark VQA
  • Pelatihan dan evaluasi model multimodal
  • Pembangunan aplikasi VQA interaktif

Perancangan Agen Multimodal

  • Prinsip perancangan agen dengan penalaran multimodal
  • Kombinasi persepsi, bahasa, dan aksi
  • Deployment agen untuk kasus penggunaan dunia nyata

Integrasi dan Optimasi Lanjutan

  • Fine-tuning model multimodal dengan Ollama
  • Optimasi performa inferensi
  • Pertimbangan skalabilitas dan deployment

Ringkasan dan Langkah Berikutnya

Persyaratan

  • Pemahaman yang kuat tentang konsep machine learning
  • Pengalaman dengan framework deep learning seperti PyTorch atau TensorFlow
  • Kenalan dengan natural language processing dan computer vision

Target Audiens

  • Insinyur machine learning
  • Peneliti AI
  • Pengembang produk yang mengintegrasikan workflow visi dan teks

Jumlah Peserta


Harga per Peserta

Kursus Mendatang

Kategori Terkait