Cảm ơn bạn đã gửi yêu cầu! Một thành viên trong đội ngũ của chúng tôi sẽ liên hệ với bạn ngay lập tức.
Cảm ơn bạn đã gửi đặt chỗ! Một thành viên trong đội ngũ của chúng tôi sẽ liên hệ với bạn ngay lập tức.
Đề cương khóa học
Chủ quyền AI và Triển khai LLM Cục bộ
- Rủi ro của LLM trên đám mây: lưu giữ dữ liệu, đào tạo dựa trên đầu vào, tuân thủ luật pháp nước ngoài.
- Kiến trúc Ollama: máy chủ mô hình, kho lưu trữ và API tương thích OpenAI.
- So sánh với vLLM, llama.cpp và Text Generation Inference.
- Licensing mô hình: Điều khoản sử dụng của Llama, Mistral, Qwen và Gemma.
Cài đặt và Thiết lập Phần cứng
- Cài đặt Ollama trên Linux với hỗ trợ CUDA và ROCm.
- Phương án dự phòng chỉ sử dụng CPU và tối ưu hóa AVX/AVX2.
- Triển khai Docker và ánh xạ ổ đĩa vĩnh viễn.
- Cấu hình đa GPU và các chiến lược phân bổ VRAM.
Quản lý Mô hình
- Lấy mô hình từ kho lưu trữ Ollama: lệnh ollama pull llama3.
- Nhập các mô hình GGUF từ HuggingFace và TheBloke.
- Các mức lượng tử hóa: sự đánh đổi giữa Q4_K_M, Q5_K_M và Q8_0.
- Chuyển đổi mô hình và giới hạn tải đồng thời nhiều mô hình.
Tệp Mô hình Tùy chỉnh (Custom Modelfiles)
- Viết cú pháp Modelfile: FROM, PARAMETER, SYSTEM, TEMPLATE.
- Tinh chỉnh temperature, top_p và repeat_penalty.
- Kỹ thuật gợi ý hệ thống để điều khiển hành vi theo vai trò cụ thể.
- Tạo và xuất bản các mô hình tùy chỉnh vào kho lưu trữ cục bộ.
Tích hợp API
- Điểm cuối /v1/chat/completions tương thích OpenAI.
- Xuất dữ liệu dạng stream (streaming) và chế độ JSON.
- Tích hợp với LangChain, LlamaIndex và các ứng dụng tùy chỉnh.
- Xác thực và giới hạn tốc độ yêu cầu bằng proxy ngược.
Tối ưu hóa Hiệu suất
- Thiết lập cửa sổ ngữ cảnh (context window) và quản lý bộ nhớ cache KV.
- Suy luận theo lô (batch inference) và xử lý song song nhiều yêu cầu.
- Phân bổ luồng CPU và nhận thức về NUMA.
- Giám sát việc sử dụng GPU và áp lực lên bộ nhớ.
Bảo mật và Tuân thủ
- Cách ly mạng cho các điểm cuối phục vụ mô hình.
- Dòng lọc đầu vào và kiểm duyệt kết quả đầu ra.
- Ghi nhật ký kiểm toán cho các gợi ý (prompts) và kết quả hoàn thành (completions).
- Xác minh nguồn gốc mô hình và xác thực mã hash.
Yêu cầu
- Kỹ năng quản trị Linux và container ở mức độ trung cấp.
- Hiểu biết về máy học và mô hình transformer ở tầm cao.
- Quen thuộc với API REST và JSON.
Đối tượng hướng đến
- Kỹ sư AI và nhà phát triển muốn thay thế các API LLM trên đám mây.
- Các tổ chức có dữ liệu nhạy cảm, không cho phép sử dụng mô hình trên đám mây.
- Đội ngũ chính phủ và quốc phòng yêu cầu các mô hình ngôn ngữ được cách ly mạng (air-gapped).
14 Giờ