Liên hệ với chúng tôi
 Thời gian kéo dài 14 Giờ học (2 ngày)

Đề cương khóa học

Giới thiệu về Tổng hợp giọng nói và Nhân bản giọng nói

  • Tổng quan về văn bản sang giọng nói (TTS) và tổng hợp giọng nói thần kinh
  • Nhân bản giọng nói so với tạo giọng nói: các trường hợp sử dụng và ranh giới
  • Các mô hình chính: Tacotron, WaveNet, FastSpeech, VITS

Làm việc với các Nền tảng Thương mại

  • Sử dụng ElevenLabs và Resemble AI
  • Tạo, nhân bản và chỉnh sửa giọng nói
  • Truy cập API và quy trình làm việc văn bản sang giọng nói

Xây dựng với các Công cụ Mã nguồn mở

  • Cài đặt và cấu hình Coqui TTS
  • Huấn luyện giọng nói tùy chỉnh và quản lý bộ dữ liệu
  • Tạo giọng nói với khả năng kiểm soát chi tiết (giọng cao, tốc độ, cảm xúc)

Chuẩn bị dữ liệu và Quản lý bộ dữ liệu giọng nói

  • Thu thập và làm sạch các mẫu giọng nói
  • Tách đoạn, gán nhãn và căn chỉnh bản ghi chép
  • Thu thập có đạo đức và sự đồng ý giọng nói

Tích hợp ứng dụng

  • Nhúng TTS vào các trang web và ứng dụng
  • Tạo hệ thống IVR và các bot tương tác
  • Tạo hội thoại tổng hợp cho video và trò chơi

Đánh giá Chất lượng và Sự chân thực

  • MOS (Điểm ý kiến trung bình) và các bài kiểm tra độ rõ ràng
  • Kiểm soát tính biểu cảm và ngữ điệu
  • So sánh độ trễ, độ trung thực và sự chân thực

Các cân nhắc về Đạo đức, Pháp lý và Quản trị

  • Rủi ro deepfake và việc sử dụng có trách nhiệm
  • Sự đồng ý, ghi công và các vấn đề bản quyền
  • Các quy định và chính sách tổ chức

Tóm tắt và Các bước tiếp theo

Yêu cầu

  • Hiểu biết về các nguyên lý cơ bản của máy học
  • Thành thạo các định dạng tệp âm thanh và công cụ chỉnh sửa
  • Kỹ năng lập trình Python cơ bản

Đối tượng người học

  • Các nhà phát triển và kỹ sư AI quan tâm đến tổng hợp giọng nói
  • Các nhà sáng tạo nội dung và công nghệ viên truyền thông đang khám phá tạo giọng nói
  • Các nhóm R&D xây dựng các hệ thống âm thanh cá nhân hóa hoặc động

Số người tham gia


Giá cho mỗi học viên

Các khóa học sắp tới

Các danh mục liên quan