Terima kasih telah mengirimkan pertanyaan Anda! Salah satu anggota tim kami akan segera menghubungi Anda.
Terima kasih telah mengirimkan pemesanan Anda! Salah satu anggota tim kami akan segera menghubungi Anda.
Kerangka Materi
Pengantar Sintesis Suara dan Pengklonan Suara
- Gambaran umum mengenai text-to-speech (TTS) serta sintesis suara berbasis neural
- Perbedaan antara pengklonan suara dan generasi ucapan: contoh penerapannya serta batasnya
- Model-model utama: Tacotron, WaveNet, FastSpeech, VITS
Penggunaan Platform Komersial
- Memakai ElevenLabs dan Resemble AI
- Proses pembuatan, pengklonan, serta pengeditan suara
- Akses API dan alur kerja text-to-speech
Pengembangan dengan Alat Open-Source
- Instalasi serta konfigurasi Coqui TTS
- Pelatihan suara kustom dan pengelolaan dataset
- Generasi ucapan dengan kontrol tingkat lanjut (pitch, kecepatan, emosi)
Persiapan Data dan Pengelolaan Dataset Suara
- Mengumpulkan serta membersihkan sampel suara
- Membagi, memberi label, serta menyelaraskan transkrip teks
- Pendekatan etis dalam pengambilan sumber suara serta memperoleh persetujuan
Integrasi ke dalam Aplikasi
- Memasukkan teknologi TTS ke dalam situs web maupun aplikasi
- Pembuatan sistem IVR serta bot interaktif
- Generasi dialog sintetis untuk video maupun permainan
Evaluasi Kualitas dan Tingkat Realisme
- Pengukuran MOS (Mean Opinion Score) serta uji kejelasan ucapan
- Pengendalian tingkat ekspresivitas dan prosodi suara
- Perbandingan aspek latensi, fidilitas, serta realisme hasil sintesis
Aspek Etika, Hukum, dan Tata Kelola
- Risiko pembuatan deepfake serta penggunaan teknologi secara bertanggung jawab
- Permasalahan izin, atribusi, dan hak cipta terkait suara
- Peraturan hukum serta kebijakan organisasi terkait penggunaan AI
Penutup dan Langkah Selanjutnya
Persyaratan
- Pemahaman dasar mengenai konsep machine learning
- Kenalan dengan format file audio serta alat pengeditan suara
- Kemampuan dasar pemrograman Python
Target Peserta
- Para pengembang dan insinyur AI yang tertarik dengan sintesis suara
- Kreator konten serta teknolog media yang ingin mengeksplorasi generasi suara
- Tim R&D yang sedang mengembangkan sistem audio dinamis atau personalisasi
14 Jam