Terima kasih telah mengirimkan pertanyaan Anda! Salah satu anggota tim kami akan segera menghubungi Anda.
Terima kasih telah mengirimkan pemesanan Anda! Salah satu anggota tim kami akan segera menghubungi Anda.
Durasi 21 jam
Kerangka Materi
Pengenalan Multimodal AI dan Ollama
- Ikhtisar pembelajaran multimodal
- Tantangan utama dalam integrasi visi-bahasa
- Kemampuan dan arsitektur Ollama
Persiapan Lingkungan Ollama
- Instalasi dan konfigurasi Ollama
- Penanganan deployment model lokal
- Integrasi Ollama dengan Python dan Jupyter
Penanganan Input Multimodal
- Integrasi teks dan gambar
- Penggunaan audio dan data terstruktur
- Perancangan pipeline pra-pemrosesan
Aplikasi Pemahaman Dokumen
- Pengekstrakan informasi terstruktur dari PDF dan gambar
- Kombinasi OCR dengan model bahasa
- Pembangunan workflow analisis dokumen cerdas
Visual Question Answering (VQA)
- Persiapan dataset dan benchmark VQA
- Pelatihan dan evaluasi model multimodal
- Pembangunan aplikasi VQA interaktif
Perancangan Agen Multimodal
- Prinsip perancangan agen dengan penalaran multimodal
- Kombinasi persepsi, bahasa, dan aksi
- Deployment agen untuk kasus penggunaan dunia nyata
Integrasi dan Optimasi Lanjutan
- Fine-tuning model multimodal dengan Ollama
- Optimasi performa inferensi
- Pertimbangan skalabilitas dan deployment
Ringkasan dan Langkah Berikutnya
Persyaratan
- Pemahaman yang kuat tentang konsep machine learning
- Pengalaman dengan framework deep learning seperti PyTorch atau TensorFlow
- Kenalan dengan natural language processing dan computer vision
Target Audiens
- Insinyur machine learning
- Peneliti AI
- Pengembang produk yang mengintegrasikan workflow visi dan teks