Hubungi Kami

Kerangka Materi

Ringkasan Teknologi Pengenalan Ucapan

  • Sejarah dan evolusi pengenalan ucapan
  • Model akustik, model bahasa, dan decoding
  • Arsitektur modern: RNN, transformer, dan Whisper

Dasar Pra-pemrosesan Audio dan Transkripsi

  • Penanganan format audio dan sample rate
  • Pembersihan, pemangkasan, dan segmentasi audio
  • Menghasilkan teks dari audio: real-time vs batch

Hands-on dengan Whisper dan API Lainnya

  • Menginstal dan menggunakan OpenAI Whisper
  • Memanggil API cloud (Google, Azure) untuk transkripsi
  • Membandingkan kinerja, latensi, dan biaya

Bahasa, Aksen, dan Adaptasi Domain

  • Bekerja dengan berbagai bahasa dan aksen
  • Kosakata khusus dan toleransi kebisingan
  • Penanganan bahasa hukum, medis, atau teknis

Format Output dan Integrasi

  • Menambahkan timestamp, tanda baca, dan label pembicara
  • Mengekspor ke format teks, SRT, atau JSON
  • Mengintegrasikan transkripsi ke aplikasi atau basis data

Laboratorium Implementasi Kasus Penggunaan

  • Mentranskripsi pertemuan, wawancara, atau podcast
  • Sistem perintah suara ke teks
  • Subtitle real-time untuk streaming video/audio

Evaluasi, Keterbatasan, dan Etika

  • Metrik akurasi dan benchmarking model
  • Bias dan keadilan dalam model suara
  • Pertimbangan privasi dan kepatuhan

Ringkasan dan Langkah Berikutnya

Persyaratan

  • Pemahaman tentang konsep umum AI dan machine learning
  • Kefamiliaran dengan format file audio atau media dan alat terkait

Auditorium

  • Ilmuwan data dan insinyur AI yang bekerja dengan data suara
  • Pengembang perangkat lunak yang membangun aplikasi berbasis transkripsi
  • Organisasi yang mengeksplorasi pengenalan ucapan untuk otomatisasi
 14 Jam

Jumlah Peserta


Harga per Peserta

Kursus Mendatang

Kategori Terkait