Cảm ơn bạn đã gửi yêu cầu! Một thành viên trong đội ngũ của chúng tôi sẽ liên hệ với bạn ngay lập tức.
Cảm ơn bạn đã gửi đặt chỗ! Một thành viên trong đội ngũ của chúng tôi sẽ liên hệ với bạn ngay lập tức.
Thời gian kéo dài 14 Giờ học (2 ngày)
Đề cương khóa học
Tổng quan về các công nghệ nhận dạng giọng nói
- Lịch sử và sự phát triển của nhận dạng giọng nói
- Mô hình âm thanh, mô hình ngôn ngữ và giải mã
- Các kiến trúc hiện đại: RNN, transformer và Whisper
Tiền xử lý âm thanh và cơ bản chuyển văn bản
- Xử lý định dạng âm thanh và tốc độ lấy mẫu
- Làm sạch, cắt bỏ và phân đoạn âm thanh
- Tạo văn bản từ âm thanh: thời gian thực so với theo lô
Thực hành với Whisper và các API khác
- Cài đặt và sử dụng OpenAI Whisper
- Gọi các API đám mây (Google, Azure) để chuyển văn bản
- So sánh hiệu suất, độ trễ và chi phí
Ngôn ngữ, giọng địa phương và thích ứng theo lĩnh vực
- Làm việc với nhiều ngôn ngữ và giọng địa phương
- Bộ từ vựng tùy chỉnh và khả năng chịu nhiễu
- Xử lý ngôn ngữ pháp lý, y tế hoặc kỹ thuật
Định dạng đầu ra và tích hợp
- Thêm mốc thời gian, dấu câu và nhãn người nói
- Xuất sang các định dạng văn bản, SRT hoặc JSON
- Tích hợp bản chuyển văn bản vào ứng dụng hoặc cơ sở dữ liệu
Phòng lab triển khai trường hợp sử dụng
- Chuyển văn bản cho các cuộc họp, phỏng vấn hoặc podcast
- Hệ thống lệnh giọng nói thành văn bản
- Phụ đề thời gian thực cho các luồng video/âm thanh
Đánh giá, giới hạn và đạo đức
- Các chỉ số độ chính xác và chuẩn đoán hiệu năng mô hình
- Thiên vị và công bằng trong các mô hình giọng nói
- Cân nhắc về quyền riêng tư và tuân thủ
Tóm tắt và các bước tiếp theo
Yêu cầu
- Hiểu biết về các khái niệm AI và máy học nói chung
- Familiarity with audio or media file formats and tools
Đối tượng
- Các nhà khoa học dữ liệu và kỹ sư AI làm việc với dữ liệu giọng nói
- Các nhà phát triển phần mềm xây dựng ứng dụng dựa trên chuyển văn bản
- Các tổ chức đang khám phá nhận dạng giọng nói cho tự động hóa