Cảm ơn bạn đã gửi yêu cầu! Một thành viên trong đội ngũ của chúng tôi sẽ liên hệ với bạn ngay lập tức.
Cảm ơn bạn đã gửi đặt chỗ! Một thành viên trong đội ngũ của chúng tôi sẽ liên hệ với bạn ngay lập tức.
Thời gian kéo dài 14 Giờ học (2 ngày)
Đề cương khóa học
Giới thiệu về Tổng hợp giọng nói và Nhân bản giọng nói
- Tổng quan về văn bản sang giọng nói (TTS) và tổng hợp giọng nói thần kinh
- Nhân bản giọng nói so với tạo giọng nói: các trường hợp sử dụng và ranh giới
- Các mô hình chính: Tacotron, WaveNet, FastSpeech, VITS
Làm việc với các Nền tảng Thương mại
- Sử dụng ElevenLabs và Resemble AI
- Tạo, nhân bản và chỉnh sửa giọng nói
- Truy cập API và quy trình làm việc văn bản sang giọng nói
Xây dựng với các Công cụ Mã nguồn mở
- Cài đặt và cấu hình Coqui TTS
- Huấn luyện giọng nói tùy chỉnh và quản lý bộ dữ liệu
- Tạo giọng nói với khả năng kiểm soát chi tiết (giọng cao, tốc độ, cảm xúc)
Chuẩn bị dữ liệu và Quản lý bộ dữ liệu giọng nói
- Thu thập và làm sạch các mẫu giọng nói
- Tách đoạn, gán nhãn và căn chỉnh bản ghi chép
- Thu thập có đạo đức và sự đồng ý giọng nói
Tích hợp ứng dụng
- Nhúng TTS vào các trang web và ứng dụng
- Tạo hệ thống IVR và các bot tương tác
- Tạo hội thoại tổng hợp cho video và trò chơi
Đánh giá Chất lượng và Sự chân thực
- MOS (Điểm ý kiến trung bình) và các bài kiểm tra độ rõ ràng
- Kiểm soát tính biểu cảm và ngữ điệu
- So sánh độ trễ, độ trung thực và sự chân thực
Các cân nhắc về Đạo đức, Pháp lý và Quản trị
- Rủi ro deepfake và việc sử dụng có trách nhiệm
- Sự đồng ý, ghi công và các vấn đề bản quyền
- Các quy định và chính sách tổ chức
Tóm tắt và Các bước tiếp theo
Yêu cầu
- Hiểu biết về các nguyên lý cơ bản của máy học
- Thành thạo các định dạng tệp âm thanh và công cụ chỉnh sửa
- Kỹ năng lập trình Python cơ bản
Đối tượng người học
- Các nhà phát triển và kỹ sư AI quan tâm đến tổng hợp giọng nói
- Các nhà sáng tạo nội dung và công nghệ viên truyền thông đang khám phá tạo giọng nói
- Các nhóm R&D xây dựng các hệ thống âm thanh cá nhân hóa hoặc động