Hubungi Kami
 Durasi 21 jam

Kerangka Materi

Pengenalan pada Penskalaan Ollama

  • Arsitektur Ollama dan pertimbangan penskalaan
  • Bottleneck umum dalam implementasi multi-user
  • Best practices untuk kesiapan infrastruktur

Alokasi Sumber Daya dan Optimasi GPU

  • Strategi pemanfaatan CPU/GPU yang efisien
  • Pertimbangan memori dan bandwidth
  • Batasan sumber daya tingkat kontainer

Implementasi dengan Kontainer dan Kubernetes

  • Mengontainerkan Ollama dengan Docker
  • Menjalankan Ollama di cluster Kubernetes
  • Load balancing dan service discovery

Autoscaling dan Batching

  • Merancang kebijakan autoscaling untuk Ollama
  • Teknik inferensi batch untuk optimasi throughput
  • Kompromi antara latensi dan throughput

Optimasi Latensi

  • Profiling performa inferensi
  • Strategi caching dan model warm-up
  • Mengurangi overhead I/O dan komunikasi

Pemantauan dan Observabilitas

  • Integrasi Prometheus untuk metrik
  • Membangun dashboard dengan Grafana
  • Alerting dan respons insiden untuk infrastruktur Ollama

Manajemen Biaya dan Strategi Penskalaan

  • Alokasi GPU yang mempertimbangkan biaya
  • Pertimbangan implementasi cloud vs on-prem
  • Strategi untuk penskalaan berkelanjutan

Ringkasan dan Langkah Selanjutnya

Persyaratan

  • Pengalaman dengan administrasi sistem Linux
  • Pemahaman tentang kontainerisasi dan orkestrasi
  • Keakraban dengan implementasi model pembelajaran mesin

Audience

  • DevOps engineers
  • Tim infrastruktur ML
  • Site reliability engineers

Jumlah Peserta


Harga per Peserta

Kursus Mendatang

Kategori Terkait