Đề cương khóa học
Giới thiệu
Hiểu về Dữ liệu lớn (Big Data)
Tổng quan về Spark
Tổng quan về Python
Tổng quan về PySpark
- Phân phối dữ liệu sử dụng khung Resilient Distributed Datasets (RDD)
- Phân phối tính toán sử dụng các toán tử API của Spark
Cấu hình Python với Spark
Cấu hình PySpark
Sử dụng các bản địa EC2 của Amazon Web Services (AWS) cho Spark
Cấu hình Databricks
Cấu hình cụm AWS EMR
Học các khái niệm cơ bản về lập trình Python
- Bắt đầu với Python
- Sử dụng Jupyter Notebook
- Sử dụng biến và các kiểu dữ liệu đơn giản
- Thực hành với List (Danh sách)
- Sử dụng câu lệnh if
- Sử dụng đầu vào từ người dùng
- Thực hành với vòng lặp while
- Thực hiện các hàm (Functions)
- Thực hành với lớp (Classes)
- Thực hành với tệp tin và ngoại lệ (Exceptions)
- Thực hành với dự án, dữ liệu và API
Học các khái niệm cơ bản về Spark DataFrame
- Bắt đầu với Spark DataFrames
- Thực hiện các thao tác cơ bản với Spark
- Sử dụng Groupby và các thao tác tổng hợp
- Thực hành với dấu vết thời gian (Timestamps) và ngày tháng
Thực hành dự án Spark DataFrame
Hiểu về Học máy (Machine Learning) với MLlib
Thực hành với MLlib, Spark và Python cho Học máy
Hiểu về Hồi quy (Regressions)
- Học lý thuyết về Hồi quy tuyến tính (Linear Regression)
- Thực hiện mã hóa đánh giá hồi quy
- Thực hành mẫu về Hồi quy tuyến tính
- Học lý thuyết về Hồi quy logistic (Logistic Regression)
- Thực hiện mã hóa Hồi quy logistic
- Thực hành mẫu về Hồi quy logistic
Hiểu về Rừng ngẫu nhiên (Random Forests) và Cây quyết định (Decision Trees)
- Học lý thuyết về các phương pháp cây
- Thực hiện mã hóa Cây quyết định và Rừng ngẫu nhiên
- Thực hành mẫu về Phân loại Rừng ngẫu nhiên
Thực hành với Nhóm hóa K-means (K-means Clustering)
- Hiểu lý thuyết về Nhóm hóa K-means
- Thực hiện mã hóa Nhóm hóa K-means
- Thực hành mẫu về Nhóm hóa
Thực hành với Hệ thống khuyến nghị (Recommender Systems)
Thực hiện Xử lý Ngôn ngữ Tự nhiên (NLP)
- Hiểu về Xử lý Ngôn ngữ Tự nhiên (NLP)
- Tổng quan về các công cụ NLP
- Thực hành mẫu về NLP
Luồng dữ liệu (Streaming) với Spark trên Python
- Tổng quan về Streaming với Spark
- Thực hành mẫu về Spark Streaming
Yêu cầu
- Kỹ năng lập trình chung
Đối tượng tham gia
- Người phát triển phần mềm (Developers)
- Chuyên gia CNTT
- Nhà khoa học dữ liệu
Đánh giá (6)
Tôi thích vì nó thực tế. Tôi rất thích áp dụng kiến thức lý thuyết với các ví dụ thực tế.
Aurelia-Adriana - Allianz Services Romania
Khóa học - Python and Spark for Big Data (PySpark)
Dịch thuật bằng máy
Khóa học đề cập đến một loạt các chủ đề phức tạp và có liên quan, và Pablo có chuyên môn sâu rộng về từng chủ đề. Đôi khi, những chi tiết tinh tế bị mất trong quá trình giao tiếp và/hoặc do áp lực thời gian, dẫn đến việc kỳ vọng có thể không được đáp ứng đầy đủ. Ngoài ra, đã xảy ra một số vấn đề liên quan đến việc cài đặt UHG/Azure Databricks, tuy nhiên Pablo và UHG đã giải quyết nhanh chóng ngay khi các vấn đề này xuất hiện - điều này cho tôi thấy sự hiểu biết và chuyên nghiệp cao giữa UHG và Pablo,
Michael Monks - Tech NorthWest Skillnet
Khóa học - Python and Spark for Big Data (PySpark)
Dịch thuật bằng máy
Sự chú ý cá nhân.
ARCHANA ANILKUMAR - PPL
Khóa học - Python and Spark for Big Data (PySpark)
Dịch thuật bằng máy
Đào tạo thực hành..
Abraham Thomas - PPL
Khóa học - Python and Spark for Big Data (PySpark)
Dịch thuật bằng máy
Các bài học được giảng dạy trong một Jupyter notebook. Các chủ đề được tổ chức theo trình tự logic và tự nhiên giúp phát triển buổi học từ phần dễ đến phần khó hơn. Tôi đã là người dùng nâng cao của Python với kiến thức về Machine Learning, nên tôi thấy khóa học dễ theo dõi hơn so với có thể là một số bạn đồng lớp khác tham gia khóa đào tạo. Tôi đánh giá cao việc các khái niệm cơ bản nhất được bỏ qua và tập trung vào những vấn đề quan trọng nhất.
Angela DeLaMora - ADT, LLC
Khóa học - Python and Spark for Big Data (PySpark)
Dịch thuật bằng máy
các nhiệm vụ thực hành
Pawel Kozikowski - GE Medical Systems Polska Sp. Zoo
Khóa học - Python and Spark for Big Data (PySpark)
Dịch thuật bằng máy