Hubungi Kami
 Durasi 14 jam (2 hari)

Kerangka Materi

Pengenalan Sintesis Suara dan Penciptaan Suara

  • Tinjauan umum text-to-speech (TTS) dan sintesis suara saraf
  • Penciptaan suara vs sintesis suara: kasus penggunaan dan batasan
  • Model kunci: Tacotron, WaveNet, FastSpeech, VITS

Bekerja dengan Platform Komersial

  • Menggunakan ElevenLabs dan Resemble AI
  • Pembuatan, penciptaan, dan pengeditan suara
  • Akses API dan workflow text-to-speech

Membangun dengan Alat Sumber Terbuka (Open-Source)

  • Menginstal dan mengatur Coqui TTS
  • Melatih suara kustom dan mengelola dataset
  • Menghasilkan suara dengan kontrol halus (nada, kecepatan, emosi)

Persiapan Data dan Pengelolaan Dataset Suara

  • Mengumpulkan dan membersihkan sampel suara
  • Segmentasi, pelabelan, dan penyesuaian transkrip
  • Pengambilan sumber etis dan persetujuan suara

Integrasi Aplikasi

  • Mengintegrasikan TTS ke dalam situs web dan aplikasi
  • Membuat sistem IVR dan bot interaktif
  • Menghasilkan dialog sintetis untuk video dan permainan

Mengevaluasi Kualitas dan Realisme

  • MOS (Mean Opinion Score) dan tes kecerdasan/pemahaman
  • Mengontrol ekspresivitas dan prosodi
  • Membandingkan latensi, fidelitas, dan realisme

Pertimbangan Etis, Legal, dan Tata Kelola (Governance)

  • Risiko deepfake dan penggunaan yang bertanggung jawab
  • Persetujuan, atribusi, dan implikasi hak cipta
  • Regulasi dan kebijakan organisasi

Ringkasan dan Langkah Selanjutnya

Persyaratan

  • Pemahaman tentang dasar-dasar machine learning
  • Keterfakiran dengan format file audio dan alat editing
  • Keterampilan pemrograman Python dasar

Audience

  • Pengembang dan insinyur AI yang tertarik dengan sintesis suara
  • Kreator konten dan teknolog media yang menjelajahi pembuatan suara
  • Tim R&D yang membangun sistem audio yang dipersonalisasi atau dinamis

Jumlah Peserta


Harga per Peserta

Kursus Mendatang

Kategori Terkait