Đề cương khóa học
Nền tảng Databricks và Khái niệm cơ bản về Lakehouse
- Kiến trúc và các thành phần của Databricks Lakehouse.
- Tổ chức không gian làm việc (workspace) và danh mục (catalog).
Không gian làm việc và Sổ tay trên Databricks
- Điều hướng không gian làm việc và phát triển dựa trên sổ tay (notebook-based development).
- Cấu trúc hóa mã nguồn thành các sổ tay có thể tái sử dụng.
Kiến trúc và Thực thi Apache Spark
- Kiến trúc môi trường chạy (runtime) và mô hình thực thi của Spark.
- Đánh giá lười (lazy evaluation) và biểu đồ phụ thuộc tác vụ (job DAG).
DataFrame PySpark và API DataFrame
- Trừu tượng hóa DataFrame và lược đồ dữ liệu.
- Các thao tác DataFrame cốt lõi và biểu thức cột.
Chuyển đổi SQL sang DataFrame PySpark
- Chuyển đổi các mệnh đề SQL cốt lõi sang các thao tác DataFrame.
- Hàm cửa sổ (window functions) và tổng hợp trong PySpark.
Đọc và Ghi dữ liệu trên Databricks
- Đọc từ các nguồn tệp phổ thông và cơ sở dữ liệu.
- Ghi và phân vùng dữ liệu trong Lakehouse.
Delta Lake và Quản lý Bảng
- Bảng Delta và giao dịch ACID.
- Khám phá dữ liệu theo thời gian (time travel) và tiến hóa lược đồ (schema evolution).
Mẫu Dữ liệu Làm sạch và Biến đổi
- Làm sạch dữ liệu và chuyển đổi kiểu dữ liệu.
- Xây dựng logic biến đổi có thể tái sử dụng.
Hàm do Người dùng Định nghĩa (UDF) và Mã Mô-đun
- Python UDFs và pandas UDFs.
- Tách biệt logic quy trình thành các hàm riêng biệt.
Tinh chỉnh Hiệu suất và Tối ưu hóa
- Các chiến lược phân vùng và bộ nhớ đệm (caching).
- Chẩn đoán điểm nghẽn bằng Spark UI.
Những khái niệm cơ bản về Structured Streaming
- Mô hình xử lý theo lô (batch) so với xử lý luồng (streaming).
- DataFrame theo luồng và các phép tổng hợp cơ bản.
Công việc Databricks và Điều phối Quy trình công việc
- Hẹn giờ sổ tay dưới dạng công việc và nhiệm vụ.
- Xây dựng quy trình nhiều bước với các phụ thuộc.
Unity Catalog và Quản trị Dữ liệu
- Kiến trúc Unity Catalog và không gian tên (namespaces).
- Kiểm soát truy cập và dòng chảy dữ liệu (data lineage).
Kiểm thử, Gỡ lỗi và Thực tiễn Sản xuất
- Viết bài kiểm thử đơn vị cho logic PySpark.
- Gỡ lỗi và tiêu chuẩn chất lượng mã nguồn.
Các Trường hợp Sử dụng Dịch vụ Tài chính Toàn diện
- Xây dựng đường ống ETL ngân hàng toàn diện.
- Chuyển đổi các quy trình SQL cũ sang PySpark.
Di chuyển Khối lượng công việc SQL sang PySpark
- Chiến lược di chuyển và các mẫu hoạch định.
- Chuyển đổi tăng dần các quy trình công việc SQL sang PySpark.
Yêu cầu
- Kinh nghiệm lập trình Python, bao gồm hàm và các kiểu dữ liệu.
- Hiểu biết về SQL, bao gồm phép nối (joins), tổng hợp (aggregations) và truy vấn con (subqueries).
- Không yêu cầu kinh nghiệm trước đây với Databricks hoặc PySpark.
Đối tượng hướng đến
- Kỹ sư dữ liệu, nhà phân tích dữ liệu và chuyên gia dữ liệu.
- Các đội ngũ đang di chuyển các quy trình công việc dựa trên SQL sang Databricks và PySpark.
Đánh giá (1)
Tôi thích vì nó thực tế. Tôi rất thích áp dụng kiến thức lý thuyết với các ví dụ thực tế.
Aurelia-Adriana - Allianz Services Romania
Khóa học - Python and Spark for Big Data (PySpark)
Dịch thuật bằng máy