Liên hệ với chúng tôi
 Thời gian kéo dài 14 Giờ học

Đề cương khóa học

Giới thiệu về Tính Đa Phương Thức của Gemini 3

  • Khả năng xử lý văn bản, hình ảnh, âm thanh và video
  • Lựa chọn mô hình và tổng quan về các endpoint
  • Các khái niệm chính trong suy luận đa phương thức

Làm việc với Văn bản và Đầu Vào Có Cấu Trúc

  • Chiến lược prompt cho việc tạo văn bản
  • Metadata, cửa sổ ngữ cảnh và embeddings
  • Điều phối các tác vụ đa phương thức dựa trên văn bản

Hiểu Biết Hình Ảnh và Luồng Công Việc Hình Ảnh

  • Phân tích và diễn giải hình ảnh với Gemini 3
  • Tạo các công cụ tìm kiếm và gắn thẻ hình ảnh
  • Xây dựng các tương tác từ hình ảnh sang văn bản và từ văn bản sang hình ảnh

Xử Lý Đầu Vào Âm Thanh

  • Luồng công việc nhận dạng giọng nói và chuyển ngữ
  • Nhận biết và diễn giải sự kiện âm thanh
  • Tích hợp âm thanh với đầu vào văn bản và hình ảnh

Trí Tuệ Video và Phân Tích Cảnh

  • Suy luận video theo từng khung hình và liên tục
  • Xây dựng các công cụ tóm tắt và trích xuất điểm nổi bật
  • Tự động hóa và luồng công việc nội dung dựa trên video

Thiết Kế Kiến Trúc Ứng Dụng Đa Phương Thức

  • Kết hợp nhiều loại đầu vào trong một pipeline đơn lẻ
  • Cân nhắc về độ trễ, chi phí và tính toán
  • Các thực tiễn tốt nhất cho các hệ thống đa phương thức có khả năng mở rộng

Tạo Nguyên Mẫu Ứng Dụng Đa Phương Thức

  • Tạo nguyên mẫu đa phương thức thực hành
  • Lặp lại nhanh với kỹ thuật prompt
  • Kiểm thử và tinh chỉnh các luồng trải nghiệm người dùng

Triển Khai Các Giải Pháp Đa Phương Thức

  • Chiến lược triển khai và thiết lập môi trường
  • Theo dõi hiệu suất thực tế
  • Cân nhắc về bảo mật và tuân thủ

Tóm tắt và Các Bước Tiếp Theo

Yêu cầu

  • Hiểu biết về các khái niệm AI hiện đại
  • Kinh nghiệm làm việc với Python hoặc JavaScript
  • Quen thuộc với REST APIs

Đối tượng

  • Nhà thiết kế
  • Người sáng tạo nội dung
  • Đội ngũ sản phẩm kỹ thuật

Số người tham gia


Giá cho mỗi học viên

Đánh giá (1)

Các khóa học sắp tới

Các danh mục liên quan