Terima kasih telah mengirimkan pertanyaan Anda! Salah satu anggota tim kami akan segera menghubungi Anda.
Terima kasih telah mengirimkan pemesanan Anda! Salah satu anggota tim kami akan segera menghubungi Anda.
Durasi 14 jam (2 hari)
Kerangka Materi
Pengenalan Sintesis Suara dan Penciptaan Suara
- Tinjauan umum text-to-speech (TTS) dan sintesis suara saraf
- Penciptaan suara vs sintesis suara: kasus penggunaan dan batasan
- Model kunci: Tacotron, WaveNet, FastSpeech, VITS
Bekerja dengan Platform Komersial
- Menggunakan ElevenLabs dan Resemble AI
- Pembuatan, penciptaan, dan pengeditan suara
- Akses API dan workflow text-to-speech
Membangun dengan Alat Sumber Terbuka (Open-Source)
- Menginstal dan mengatur Coqui TTS
- Melatih suara kustom dan mengelola dataset
- Menghasilkan suara dengan kontrol halus (nada, kecepatan, emosi)
Persiapan Data dan Pengelolaan Dataset Suara
- Mengumpulkan dan membersihkan sampel suara
- Segmentasi, pelabelan, dan penyesuaian transkrip
- Pengambilan sumber etis dan persetujuan suara
Integrasi Aplikasi
- Mengintegrasikan TTS ke dalam situs web dan aplikasi
- Membuat sistem IVR dan bot interaktif
- Menghasilkan dialog sintetis untuk video dan permainan
Mengevaluasi Kualitas dan Realisme
- MOS (Mean Opinion Score) dan tes kecerdasan/pemahaman
- Mengontrol ekspresivitas dan prosodi
- Membandingkan latensi, fidelitas, dan realisme
Pertimbangan Etis, Legal, dan Tata Kelola (Governance)
- Risiko deepfake dan penggunaan yang bertanggung jawab
- Persetujuan, atribusi, dan implikasi hak cipta
- Regulasi dan kebijakan organisasi
Ringkasan dan Langkah Selanjutnya
Persyaratan
- Pemahaman tentang dasar-dasar machine learning
- Keterfakiran dengan format file audio dan alat editing
- Keterampilan pemrograman Python dasar
Audience
- Pengembang dan insinyur AI yang tertarik dengan sintesis suara
- Kreator konten dan teknolog media yang menjelajahi pembuatan suara
- Tim R&D yang membangun sistem audio yang dipersonalisasi atau dinamis