Terima kasih telah mengirimkan pertanyaan Anda! Salah satu anggota tim kami akan segera menghubungi Anda.
Terima kasih telah mengirimkan pemesanan Anda! Salah satu anggota tim kami akan segera menghubungi Anda.
Kerangka Materi
Kedaulatan AI dan Penyelenggaraan Model Bahasa Besar Secara Mandiri
- Risiko penggunaan model bahasa besar berbasis cloud: penyimpanan data, pelatihan model dari input pengguna, serta kewenangan yurisdiksi luar negeri.
- Arsitektur Ollama: server model, registri, dan antarmuka API kompatibel OpenAI.
- Perbandingan dengan alat sejenis seperti vLLM, llama.cpp, dan Text Generation Inference.
- Aspek lisensi model: syarat penggunaan untuk Llama, Mistral, Qwen, serta Gemma.
Instalasi dan Konfigurasi Perangkat Keras
- Menginstal Ollama pada sistem Linux yang didukung CUDA maupun ROCm.
- Penggunaan mode fallback prosesor biasa beserta optimalisasi AVX/AVX2.
- Penerapan Ollama melalui Docker serta pengaturan volume penyimpanan permanen.
- Penyiapan sistem multi-GPU dan strategi alokasi VRAM yang efektif.
Manajemen Model
- Mengunduh model dari registri Ollama: perintah ollama pull llama3.
- Mengimpor model berformat GGUF dari HuggingFace maupun TheBloke.
- Berbagai tingkat kuantisasi: perbedaan kinerja antara Q4_K_M, Q5_K_M, dan Q8_0.
- Peralihan antarmodel serta batasan jumlah model yang dapat dijalankan secara bersamaan.
Membuat File Konfigurasi Modelfile Kustom
- Sintaks penulisan Modelfile: perintah FROM, PARAMETER, SYSTEM, serta TEMPLATE.
- Penyetelan parameter seperti temperature, top_p, dan repeat_penalty.
- Perancangan prompt sistemik untuk mencapai perilaku model yang sesuai tujuan penggunaan.
- Cara membuat serta menerbitkan model kustom ke dalam registri lokal.
Integrasi API
- Pemanfaatan endpoint /v1/chat/completions yang kompatibel dengan standar OpenAI.
- Pengelolaan respons dalam bentuk aliran data serta aktivasi mode JSON.
- Integrasi dengan alat seperti LangChain, LlamaIndex, maupun aplikasi kustom buatan sendiri.
- Penerapan mekanisme otentikasi dan batasan permintaan via reverse proxy.
Optimisasi Kinerja
- Teknik pengaturan ukuran jendela konteks serta manajemen cache KV.
- Pengelolaan permintaan inferensi secara paralel dalam batch.
- Alokasi thread prosesor dan penerapan konsep NUMA pada sistem multi-core.
- Pemantauan intensitas penggunaan GPU serta tingkat tekanan memori.
Keamanan dan Kepatuhan Regulasi
- Membatasi akses jaringan menuju titik akhir layanan model.
- Penerapan penyaringan input serta sistem moderasi output.
- Penyelenggaraan log audit mengenai prompt dan hasil inferensi.
- Tahap verifikasi keaslian model melalui cek nilai hash uniknya.
Persyaratan
- Pengalaman menengah dalam administrasi sistem Linux serta kontainer.
- Pemahaman dasar mengenai teknologi pembelajaran mesin dan model transformer.
- Kelancaran menggunakan REST API dan format JSON.
Target Peserta
- Insinyur AI dan pengembang yang hendak mengganti API model bahasa besar berbasis cloud.
- Organisasi dengan kebutuhan privasi data tinggi yang tidak dapat memanfaatkan layanan cloud untuk menjalankan model.
- Tim pemerintah serta pertahanan yang memerlukan penggunaan model bahasa besar tanpa koneksi internet.
14 Jam