Terima kasih telah mengirimkan pertanyaan Anda! Salah satu anggota tim kami akan segera menghubungi Anda.
Terima kasih telah mengirimkan pemesanan Anda! Salah satu anggota tim kami akan segera menghubungi Anda.
Durasi 14 jam
Kerangka Materi
Pengenalan Multimodalitas Gemini 3
- Kemampuan lintas teks, gambar, audio, dan video
- Seleksi model dan tinjauan endpoint
- Konsep kunci dalam penalaran multimodal
Bekerja dengan Teks dan Masukan Terstruktur
- Strategi prompting untuk generasi teks
- Metadata, jendela konteks, dan embedding
- Orkestrasi tugas multimodal berbasis teks
Pemahaman Gambar dan Alur Kerja Visual
- Analisis dan interpretasi gambar dengan Gemini 3
- Membuat alat pencarian visual dan penandaan
- Membangun interaksi gambar-ke-teks dan teks-ke-gambar
Prosesi Masukan Audio
- Alur kerja pengenalan ucapan dan transkripsi
- Deteksi dan interpretasi peristiwa audio
- Integrasi audio dengan masukan teks dan visual
Inteligensi Video dan Analisis Adegan
- Penalaran video per bingkai dan berkelanjutan
- Membuat alat ringkasan dan ekstraksi sorotan
- Otomatisasi berbasis video dan alur kerja konten
Merancang Arsitektur Aplikasi Multimodal
- Menggabungkan beberapa jenis masukan dalam satu pipeline
- Pertimbangan latensi, biaya, dan komputasi
- Praktik terbaik untuk sistem multimodal yang dapat diskalakan
Prototipe Aplikasi Multimodal
- Pembuatan prototipe multimodal secara langsung
- Iterasi cepat dengan teknik pemromptan
- Uji coba dan penyempurnaan alur pengalaman pengguna
Meluncurkan Solusi Multimodal
- Strategi peluncuran dan pengaturan lingkungan
- Pemantauan kinerja dunia nyata
- Pertimbangan keamanan dan kepatuhan
Ringkasan dan Langkah Selanjutnya
Persyaratan
- Pemahaman tentang konsep AI modern
- Pengalaman dengan Python atau JavaScript
- Kepatuhan dengan REST APIs
Audience
- Desainer
- Pembuat konten
- Tim produk teknis
Testimoni (1)
Alur, suasana, dan topik pada presentasi
Lukasz Kowalczyk - Allegro Sp. z o.o.
Kursus - Google Gemini AI for Data Analysis
Diterjemahkan Mesin