Hubungi Kami

Kerangka Materi

Kedaulatan AI dan Penyelenggaraan Model Bahasa Besar Secara Mandiri

  • Risiko penggunaan model bahasa besar berbasis cloud: penyimpanan data, pelatihan model dari input pengguna, serta kewenangan yurisdiksi luar negeri.
  • Arsitektur Ollama: server model, registri, dan antarmuka API kompatibel OpenAI.
  • Perbandingan dengan alat sejenis seperti vLLM, llama.cpp, dan Text Generation Inference.
  • Aspek lisensi model: syarat penggunaan untuk Llama, Mistral, Qwen, serta Gemma.

Instalasi dan Konfigurasi Perangkat Keras

  • Menginstal Ollama pada sistem Linux yang didukung CUDA maupun ROCm.
  • Penggunaan mode fallback prosesor biasa beserta optimalisasi AVX/AVX2.
  • Penerapan Ollama melalui Docker serta pengaturan volume penyimpanan permanen.
  • Penyiapan sistem multi-GPU dan strategi alokasi VRAM yang efektif.

Manajemen Model

  • Mengunduh model dari registri Ollama: perintah ollama pull llama3.
  • Mengimpor model berformat GGUF dari HuggingFace maupun TheBloke.
  • Berbagai tingkat kuantisasi: perbedaan kinerja antara Q4_K_M, Q5_K_M, dan Q8_0.
  • Peralihan antarmodel serta batasan jumlah model yang dapat dijalankan secara bersamaan.

Membuat File Konfigurasi Modelfile Kustom

  • Sintaks penulisan Modelfile: perintah FROM, PARAMETER, SYSTEM, serta TEMPLATE.
  • Penyetelan parameter seperti temperature, top_p, dan repeat_penalty.
  • Perancangan prompt sistemik untuk mencapai perilaku model yang sesuai tujuan penggunaan.
  • Cara membuat serta menerbitkan model kustom ke dalam registri lokal.

Integrasi API

  • Pemanfaatan endpoint /v1/chat/completions yang kompatibel dengan standar OpenAI.
  • Pengelolaan respons dalam bentuk aliran data serta aktivasi mode JSON.
  • Integrasi dengan alat seperti LangChain, LlamaIndex, maupun aplikasi kustom buatan sendiri.
  • Penerapan mekanisme otentikasi dan batasan permintaan via reverse proxy.

Optimisasi Kinerja

  • Teknik pengaturan ukuran jendela konteks serta manajemen cache KV.
  • Pengelolaan permintaan inferensi secara paralel dalam batch.
  • Alokasi thread prosesor dan penerapan konsep NUMA pada sistem multi-core.
  • Pemantauan intensitas penggunaan GPU serta tingkat tekanan memori.

Keamanan dan Kepatuhan Regulasi

  • Membatasi akses jaringan menuju titik akhir layanan model.
  • Penerapan penyaringan input serta sistem moderasi output.
  • Penyelenggaraan log audit mengenai prompt dan hasil inferensi.
  • Tahap verifikasi keaslian model melalui cek nilai hash uniknya.

Persyaratan

  • Pengalaman menengah dalam administrasi sistem Linux serta kontainer.
  • Pemahaman dasar mengenai teknologi pembelajaran mesin dan model transformer.
  • Kelancaran menggunakan REST API dan format JSON.

Target Peserta

  • Insinyur AI dan pengembang yang hendak mengganti API model bahasa besar berbasis cloud.
  • Organisasi dengan kebutuhan privasi data tinggi yang tidak dapat memanfaatkan layanan cloud untuk menjalankan model.
  • Tim pemerintah serta pertahanan yang memerlukan penggunaan model bahasa besar tanpa koneksi internet.
 14 Jam

Jumlah Peserta


Harga per Peserta

Kursus Mendatang

Kategori Terkait