Liên hệ với chúng tôi
 Thời gian kéo dài 14 Giờ học (2 ngày)

Đề cương khóa học

Tổng quan về các công nghệ nhận dạng giọng nói

  • Lịch sử và sự phát triển của nhận dạng giọng nói
  • Mô hình âm thanh, mô hình ngôn ngữ và giải mã
  • Các kiến trúc hiện đại: RNN, transformer và Whisper

Tiền xử lý âm thanh và cơ bản chuyển văn bản

  • Xử lý định dạng âm thanh và tốc độ lấy mẫu
  • Làm sạch, cắt bỏ và phân đoạn âm thanh
  • Tạo văn bản từ âm thanh: thời gian thực so với theo lô

Thực hành với Whisper và các API khác

  • Cài đặt và sử dụng OpenAI Whisper
  • Gọi các API đám mây (Google, Azure) để chuyển văn bản
  • So sánh hiệu suất, độ trễ và chi phí

Ngôn ngữ, giọng địa phương và thích ứng theo lĩnh vực

  • Làm việc với nhiều ngôn ngữ và giọng địa phương
  • Bộ từ vựng tùy chỉnh và khả năng chịu nhiễu
  • Xử lý ngôn ngữ pháp lý, y tế hoặc kỹ thuật

Định dạng đầu ra và tích hợp

  • Thêm mốc thời gian, dấu câu và nhãn người nói
  • Xuất sang các định dạng văn bản, SRT hoặc JSON
  • Tích hợp bản chuyển văn bản vào ứng dụng hoặc cơ sở dữ liệu

Phòng lab triển khai trường hợp sử dụng

  • Chuyển văn bản cho các cuộc họp, phỏng vấn hoặc podcast
  • Hệ thống lệnh giọng nói thành văn bản
  • Phụ đề thời gian thực cho các luồng video/âm thanh

Đánh giá, giới hạn và đạo đức

  • Các chỉ số độ chính xác và chuẩn đoán hiệu năng mô hình
  • Thiên vị và công bằng trong các mô hình giọng nói
  • Cân nhắc về quyền riêng tư và tuân thủ

Tóm tắt và các bước tiếp theo

Yêu cầu

  • Hiểu biết về các khái niệm AI và máy học nói chung
  • Familiarity with audio or media file formats and tools

Đối tượng

  • Các nhà khoa học dữ liệu và kỹ sư AI làm việc với dữ liệu giọng nói
  • Các nhà phát triển phần mềm xây dựng ứng dụng dựa trên chuyển văn bản
  • Các tổ chức đang khám phá nhận dạng giọng nói cho tự động hóa

Số người tham gia


Giá cho mỗi học viên

Các khóa học sắp tới

Các danh mục liên quan