Terima kasih telah mengirimkan pertanyaan Anda! Salah satu anggota tim kami akan segera menghubungi Anda.
Terima kasih telah mengirimkan pemesanan Anda! Salah satu anggota tim kami akan segera menghubungi Anda.
Kerangka Materi
Ringkasan Teknologi Pengenalan Ucapan
- Sejarah dan evolusi pengenalan ucapan
- Model akustik, model bahasa, dan decoding
- Arsitektur modern: RNN, transformer, dan Whisper
Dasar Pra-pemrosesan Audio dan Transkripsi
- Penanganan format audio dan sample rate
- Pembersihan, pemangkasan, dan segmentasi audio
- Menghasilkan teks dari audio: real-time vs batch
Hands-on dengan Whisper dan API Lainnya
- Menginstal dan menggunakan OpenAI Whisper
- Memanggil API cloud (Google, Azure) untuk transkripsi
- Membandingkan kinerja, latensi, dan biaya
Bahasa, Aksen, dan Adaptasi Domain
- Bekerja dengan berbagai bahasa dan aksen
- Kosakata khusus dan toleransi kebisingan
- Penanganan bahasa hukum, medis, atau teknis
Format Output dan Integrasi
- Menambahkan timestamp, tanda baca, dan label pembicara
- Mengekspor ke format teks, SRT, atau JSON
- Mengintegrasikan transkripsi ke aplikasi atau basis data
Laboratorium Implementasi Kasus Penggunaan
- Mentranskripsi pertemuan, wawancara, atau podcast
- Sistem perintah suara ke teks
- Subtitle real-time untuk streaming video/audio
Evaluasi, Keterbatasan, dan Etika
- Metrik akurasi dan benchmarking model
- Bias dan keadilan dalam model suara
- Pertimbangan privasi dan kepatuhan
Ringkasan dan Langkah Berikutnya
Persyaratan
- Pemahaman tentang konsep umum AI dan machine learning
- Kefamiliaran dengan format file audio atau media dan alat terkait
Auditorium
- Ilmuwan data dan insinyur AI yang bekerja dengan data suara
- Pengembang perangkat lunak yang membangun aplikasi berbasis transkripsi
- Organisasi yang mengeksplorasi pengenalan ucapan untuk otomatisasi
14 Jam