Liên hệ với chúng tôi

Đề cương khóa học

Chủ quyền AI và Triển khai LLM Cục bộ

  • Rủi ro của LLM trên đám mây: lưu giữ dữ liệu, đào tạo dựa trên đầu vào, tuân thủ luật pháp nước ngoài.
  • Kiến trúc Ollama: máy chủ mô hình, kho lưu trữ và API tương thích OpenAI.
  • So sánh với vLLM, llama.cpp và Text Generation Inference.
  • Licensing mô hình: Điều khoản sử dụng của Llama, Mistral, Qwen và Gemma.

Cài đặt và Thiết lập Phần cứng

  • Cài đặt Ollama trên Linux với hỗ trợ CUDA và ROCm.
  • Phương án dự phòng chỉ sử dụng CPU và tối ưu hóa AVX/AVX2.
  • Triển khai Docker và ánh xạ ổ đĩa vĩnh viễn.
  • Cấu hình đa GPU và các chiến lược phân bổ VRAM.

Quản lý Mô hình

  • Lấy mô hình từ kho lưu trữ Ollama: lệnh ollama pull llama3.
  • Nhập các mô hình GGUF từ HuggingFace và TheBloke.
  • Các mức lượng tử hóa: sự đánh đổi giữa Q4_K_M, Q5_K_M và Q8_0.
  • Chuyển đổi mô hình và giới hạn tải đồng thời nhiều mô hình.

Tệp Mô hình Tùy chỉnh (Custom Modelfiles)

  • Viết cú pháp Modelfile: FROM, PARAMETER, SYSTEM, TEMPLATE.
  • Tinh chỉnh temperature, top_p và repeat_penalty.
  • Kỹ thuật gợi ý hệ thống để điều khiển hành vi theo vai trò cụ thể.
  • Tạo và xuất bản các mô hình tùy chỉnh vào kho lưu trữ cục bộ.

Tích hợp API

  • Điểm cuối /v1/chat/completions tương thích OpenAI.
  • Xuất dữ liệu dạng stream (streaming) và chế độ JSON.
  • Tích hợp với LangChain, LlamaIndex và các ứng dụng tùy chỉnh.
  • Xác thực và giới hạn tốc độ yêu cầu bằng proxy ngược.

Tối ưu hóa Hiệu suất

  • Thiết lập cửa sổ ngữ cảnh (context window) và quản lý bộ nhớ cache KV.
  • Suy luận theo lô (batch inference) và xử lý song song nhiều yêu cầu.
  • Phân bổ luồng CPU và nhận thức về NUMA.
  • Giám sát việc sử dụng GPU và áp lực lên bộ nhớ.

Bảo mật và Tuân thủ

  • Cách ly mạng cho các điểm cuối phục vụ mô hình.
  • Dòng lọc đầu vào và kiểm duyệt kết quả đầu ra.
  • Ghi nhật ký kiểm toán cho các gợi ý (prompts) và kết quả hoàn thành (completions).
  • Xác minh nguồn gốc mô hình và xác thực mã hash.

Yêu cầu

  • Kỹ năng quản trị Linux và container ở mức độ trung cấp.
  • Hiểu biết về máy học và mô hình transformer ở tầm cao.
  • Quen thuộc với API REST và JSON.

Đối tượng hướng đến

  • Kỹ sư AI và nhà phát triển muốn thay thế các API LLM trên đám mây.
  • Các tổ chức có dữ liệu nhạy cảm, không cho phép sử dụng mô hình trên đám mây.
  • Đội ngũ chính phủ và quốc phòng yêu cầu các mô hình ngôn ngữ được cách ly mạng (air-gapped).
 14 Giờ

Số người tham gia


Giá cho mỗi học viên

Các khóa học sắp tới

Các danh mục liên quan