Hubungi Kami
 Durasi 14 jam

Kerangka Materi

Pengenalan Multimodalitas Gemini 3

  • Kemampuan lintas teks, gambar, audio, dan video
  • Seleksi model dan tinjauan endpoint
  • Konsep kunci dalam penalaran multimodal

Bekerja dengan Teks dan Masukan Terstruktur

  • Strategi prompting untuk generasi teks
  • Metadata, jendela konteks, dan embedding
  • Orkestrasi tugas multimodal berbasis teks

Pemahaman Gambar dan Alur Kerja Visual

  • Analisis dan interpretasi gambar dengan Gemini 3
  • Membuat alat pencarian visual dan penandaan
  • Membangun interaksi gambar-ke-teks dan teks-ke-gambar

Prosesi Masukan Audio

  • Alur kerja pengenalan ucapan dan transkripsi
  • Deteksi dan interpretasi peristiwa audio
  • Integrasi audio dengan masukan teks dan visual

Inteligensi Video dan Analisis Adegan

  • Penalaran video per bingkai dan berkelanjutan
  • Membuat alat ringkasan dan ekstraksi sorotan
  • Otomatisasi berbasis video dan alur kerja konten

Merancang Arsitektur Aplikasi Multimodal

  • Menggabungkan beberapa jenis masukan dalam satu pipeline
  • Pertimbangan latensi, biaya, dan komputasi
  • Praktik terbaik untuk sistem multimodal yang dapat diskalakan

Prototipe Aplikasi Multimodal

  • Pembuatan prototipe multimodal secara langsung
  • Iterasi cepat dengan teknik pemromptan
  • Uji coba dan penyempurnaan alur pengalaman pengguna

Meluncurkan Solusi Multimodal

  • Strategi peluncuran dan pengaturan lingkungan
  • Pemantauan kinerja dunia nyata
  • Pertimbangan keamanan dan kepatuhan

Ringkasan dan Langkah Selanjutnya

Persyaratan

  • Pemahaman tentang konsep AI modern
  • Pengalaman dengan Python atau JavaScript
  • Kepatuhan dengan REST APIs

Audience

  • Desainer
  • Pembuat konten
  • Tim produk teknis

Jumlah Peserta


Harga per Peserta

Testimoni (1)

Kursus Mendatang

Kategori Terkait