Liên hệ với chúng tôi

Đề cương khóa học

Những yếu tố cơ bản về Triển khai Sản xuất Tencent Hunyuan

  • Tổng quan về các kịch bản phục vụ mô hình Tencent Hunyuan.
  • Đặc điểm sản xuất của các mô hình lớn và MoE.
  • Các nút thắt thường gặp về độ trễ, thông lượng và chi phí.
  • Xác định mục tiêu dịch vụ (SLO) cho tải trọng suy luận.

Kiến trúc Triển khai và Luồng Phục vụ

  • Các thành phần cốt lõi của ngăn xếp suy luận sản xuất.
  • Lựa chọn giữa các mô hình triển khai containerized, tại chỗ và trên đám mây.
  • Cơ bản về tải mô hình, định tuyến yêu cầu và phân bổ GPU.
  • Thiết kế cho độ tin cậy và sự đơn giản trong vận hành.

Tối ưu hóa Độ trễ trong Thực tế

  • Sử dụng các công cụ suy luận tối ưu như TensorRT khi phù hợp.
  • Khái niệm KV-cache và điều chỉnh cache thực tiễn.
  • Giảm thiểu thời gian khởi động, làm nóng (warmup) và độ trễ phản hồi.
  • Đo lường thời gian tới token đầu tiên và tốc độ tạo token.

Thông lượng, Gom Batch và Hiệu quả GPU

  • Chiến lược gom batch liên tục và theo từng lô (request batching).
  • Quản lý tính đồng thời và hành vi hàng đợi.
  • Cải thiện khả năng sử dụng GPU mà không làm ảnh hưởng đến trải nghiệm người dùng.
  • Xử lý các yêu cầu ngữ cảnh dài và tải trọng hỗn hợp.

Lượng tử hóa và Kiểm soát Chi phí

  • Tại sao lượng tử hóa lại quan trọng đối với việc phục vụ sản xuất.
  • Sự đánh đổi thực tiễn của các tùy chọn độ chính xác phổ biến như FP16, INT8.
  • Cân bằng giữa chất lượng mô hình, độ trễ và chi phí cơ sở hạ tầng.
  • Xây dựng danh sách kiểm tra tối ưu hóa chi phí đơn giản.

Vận hành, Giám sát và Đánh giá Sẵn sàng

  • Các kích hoạt tự động giãn nở cho dịch vụ suy luận.
  • Giám sát độ trễ, thông lượng, mức sử dụng cache và sức khỏe GPU.
  • Cơ bản về ghi nhật ký, cảnh báo và phản ứng sự cố.
  • Đánh giá một triển khai tham chiếu và lập kế hoạch cải tiến.

Yêu cầu

  • Hiểu biết cơ bản về quy trình triển khai và suy luận của mô hình ngôn ngữ lớn (LLM).
  • Kinh nghiệm làm việc với container, cơ sở hạ tầng đám mây hoặc tại chỗ, và các dịch vụ dựa trên API.
  • Kiến thức thực tế về Python hoặc các tác vụ kỹ thuật hệ thống.

Đối tượng tham gia

  • Kỹ sư ML triển khai LLM vào môi trường sản xuất.
  • Kỹ sư nền tảng chịu trách nhiệm về các dịch vụ suy luận dựa trên GPU.
  • Kiến trúc sư giải pháp thiết kế các nền tảng phục vụ AI có khả năng mở rộng.
 14 Giờ

Số người tham gia


Giá cho mỗi học viên

Các khóa học sắp tới

Các danh mục liên quan