Cảm ơn bạn đã gửi yêu cầu! Một thành viên trong đội ngũ của chúng tôi sẽ liên hệ với bạn ngay lập tức.
Cảm ơn bạn đã gửi đặt chỗ! Một thành viên trong đội ngũ của chúng tôi sẽ liên hệ với bạn ngay lập tức.
Thời gian kéo dài 21 Giờ học
Đề cương khóa học
Giới thiệu về việc mở rộng Ollama
- Kiến trúc của Ollama và các yếu tố cần cân nhắc khi mở rộng
- Các điểm nghẽn chung trong các triển khai đa người dùng
- Các thực hành tốt nhất để chuẩn bị hạ tầng
Phân bổ tài nguyên và tối ưu hóa GPU
- Các chiến lược khai thác hiệu quả CPU/GPU
- Các cân nhắc về bộ nhớ và băng thông
- Ràng buộc tài nguyên ở cấp độ container
Triển khai với Container và Kubernetes
- Container hóa Ollama với Docker
- Chạy Ollama trong các cụm Kubernetes
- Cân bằng tải (load balancing) và khám phá dịch vụ (service discovery)
Tự động mở rộng và Xử lý theo lô
- Thiết kế các chính sách tự động mở rộng cho Ollama
- Kỹ thuật suy luận theo lô (batch inference) để tối ưu hóa thông lượng
- Quy đổi giữa độ trễ và thông lượng
Tối ưu hóa độ trễ
- Phân tích hiệu suất suy luận (profiling inference performance)
- Các chiến lược bộ nhớ đệm (caching) và làm ấm mô hình (model warm-up)
- Giảm thiểu chi phí I/O và liên lạc
Giám sát và Quan sát (Observability)
- Tích hợp Prometheus cho các chỉ số đo lường
- Xây dựng bảng điều khiển (dashboards) với Grafana
- Cảnh báo và phản ứng sự cố cho hạ tầng Ollama
Quản lý chi phí và Chiến lược mở rộng
- Phân bổ GPU dựa trên ý thức về chi phí
- Các cân nhắc khi triển khai trên đám mây (cloud) so với tại chỗ (on-prem)
- Các chiến lược cho việc mở rộng bền vững
Tổng kết và Các bước tiếp theo
Yêu cầu
- Kinh nghiệm quản trị hệ thống Linux
- Hiểu biết về container hóa (containerization) và điều phối (orchestration)
- Quen thuộc với việc triển khai các mô hình học máy
Đối tượng tham gia
- Kỹ sư DevOps
- Đội ngũ hạ tầng học máy (ML infrastructure teams)
- Kỹ sư độ tin cậy của trang (Site reliability engineers)