Liên hệ với chúng tôi
 Thời gian kéo dài 21 Giờ học

Đề cương khóa học

Giới thiệu về việc mở rộng Ollama

  • Kiến trúc của Ollama và các yếu tố cần cân nhắc khi mở rộng
  • Các điểm nghẽn chung trong các triển khai đa người dùng
  • Các thực hành tốt nhất để chuẩn bị hạ tầng

Phân bổ tài nguyên và tối ưu hóa GPU

  • Các chiến lược khai thác hiệu quả CPU/GPU
  • Các cân nhắc về bộ nhớ và băng thông
  • Ràng buộc tài nguyên ở cấp độ container

Triển khai với Container và Kubernetes

  • Container hóa Ollama với Docker
  • Chạy Ollama trong các cụm Kubernetes
  • Cân bằng tải (load balancing) và khám phá dịch vụ (service discovery)

Tự động mở rộng và Xử lý theo lô

  • Thiết kế các chính sách tự động mở rộng cho Ollama
  • Kỹ thuật suy luận theo lô (batch inference) để tối ưu hóa thông lượng
  • Quy đổi giữa độ trễ và thông lượng

Tối ưu hóa độ trễ

  • Phân tích hiệu suất suy luận (profiling inference performance)
  • Các chiến lược bộ nhớ đệm (caching) và làm ấm mô hình (model warm-up)
  • Giảm thiểu chi phí I/O và liên lạc

Giám sát và Quan sát (Observability)

  • Tích hợp Prometheus cho các chỉ số đo lường
  • Xây dựng bảng điều khiển (dashboards) với Grafana
  • Cảnh báo và phản ứng sự cố cho hạ tầng Ollama

Quản lý chi phí và Chiến lược mở rộng

  • Phân bổ GPU dựa trên ý thức về chi phí
  • Các cân nhắc khi triển khai trên đám mây (cloud) so với tại chỗ (on-prem)
  • Các chiến lược cho việc mở rộng bền vững

Tổng kết và Các bước tiếp theo

Yêu cầu

  • Kinh nghiệm quản trị hệ thống Linux
  • Hiểu biết về container hóa (containerization) và điều phối (orchestration)
  • Quen thuộc với việc triển khai các mô hình học máy

Đối tượng tham gia

  • Kỹ sư DevOps
  • Đội ngũ hạ tầng học máy (ML infrastructure teams)
  • Kỹ sư độ tin cậy của trang (Site reliability engineers)

Số người tham gia


Giá cho mỗi học viên

Các khóa học sắp tới

Các danh mục liên quan