Cảm ơn bạn đã gửi yêu cầu! Một thành viên trong đội ngũ của chúng tôi sẽ liên hệ với bạn ngay lập tức.
Cảm ơn bạn đã gửi đặt chỗ! Một thành viên trong đội ngũ của chúng tôi sẽ liên hệ với bạn ngay lập tức.
Thời gian kéo dài 35 Giờ học
Đề cương khóa học
Giới thiệu, Mục tiêu và Chiến lược Di chuyển
- Mục tiêu của khóa học, sự phù hợp với hồ sơ người tham gia và tiêu chí thành công
- Các phương pháp tiếp cận di chuyển dữ liệu ở cấp độ cao và các cân nhắc về rủi ro
- Cài đặt không gian làm việc (workspaces), kho mã (repositories) và bộ dữ liệu thực hành
Ngày 1 — Nền tảng và Kiến trúc Di chuyển
- Khái niệm Lakehouse, tổng quan Delta Lake và kiến trúc Databricks
- Sự khác biệt giữa SMP và MPP và tác động đối với việc di chuyển dữ liệu
- Thiết kế Medallion (Bronze→Silver→Gold) và tổng quan Unity Catalog
Phòng thực hành Ngày 1 — Chuyển đổi một Thủ tục lưu trữ
- Di chuyển thủ công một thủ tục lưu trữ mẫu sang notebook
- Ánh xạ các bảng tạm (temp tables) và con trỏ (cursors) thành các phép biến đổi DataFrame
- Xác thực và so sánh với kết quả đầu ra gốc
Ngày 2 — Delta Lake Nâng cao & Nạp dữ liệu Gia tăng
- Giao dịch ACID, nhật ký commit, kiểm soát phiên bản và du hành thời gian (time travel)
- Auto Loader, các mẫu MERGE INTO, upsert và diễn tiến schema (schema evolution)
- OPTIMIZE, VACUUM, Z-ORDER, phân vùng (partitioning) và tinh chỉnh lưu trữ
Phòng thực hành Ngày 2 — Nạp dữ liệu Gia tăng & Tối ưu hóa
- Triển khai nạp dữ liệu bằng Auto Loader và các luồng công việc MERGE
- Áp dụng OPTIMIZE, Z-ORDER và VACUUM; xác thực kết quả
- Đo lường sự cải thiện hiệu năng đọc/ghi
Ngày 3 — SQL trong Databricks, Hiệu năng & Gỡ lỗi
- Các tính năng SQL phân tích: hàm cửa sổ (window functions), hàm bậc cao (higher-order functions), xử lý JSON/mảng (JSON/array)
- Đọc Spark UI, DAG, shuffle, giai đoạn (stages), tác vụ (tasks) và chẩn đoán điểm nghẽn
- Các mẫu tinh chỉnh truy vấn: broadcast joins, gợi ý (hints), bộ nhớ đệm (caching) và giảm tràn (spill reduction)
Phòng thực hành Ngày 3 — Tái cấu trúc SQL & Tinh chỉnh Hiệu năng
- Tái cấu trúc một quy trình SQL nặng thành Spark SQL tối ưu
- Sử dụng vết truy vết (traces) của Spark UI để xác định và khắc phục các vấn đề mất cân bằng (skew) và shuffle
- Đánh giá hiệu năng trước/sau và ghi lại các bước tinh chỉnh
Ngày 4 — PySpark Chiến thuật: Thay thế Logic Thủ tục
- Mô hình thực thi Spark: trình điều khiển (driver), thực thi (executors), đánh giá lười (lazy evaluation) và các chiến lược phân vùng
- Chuyển đổi các vòng lặp (loops) và con trỏ (cursors) thành các thao tác DataFrame vectơ hóa
- Phân rông (Modularization), UDF/pandas UDF, tiện ích (widgets) và các thư viện có thể tái sử dụng
Phòng thực hành Ngày 4 — Tái cấu trúc Mã nguồn Thủ tục
- Tái cấu trúc mã nguồn ETL thủ tục thành các notebook PySpark có phân rông (modular)
- Giới thiệu tham số hóa (parametrization), kiểm thử kiểu đơn vị (unit-style tests) và các hàm có thể tái sử dụng
- Đánh giá mã nguồn và áp dụng danh sách kiểm tra các thực hành tốt
Ngày 5 — Điều phối, Đường ống xử lý Từ đầu đến cuối & Thực hành Tốt nhất
- Databricks Workflows: thiết kế việc làm (job design), phụ thuộc tác vụ, kích hoạt (triggers) và xử lý lỗi
- Thiết kế các đường ống Medallion gia tăng với các quy tắc chất lượng và xác thực schema
- Tích hợp với Git (GitHub/Azure DevOps), CI và các chiến lược kiểm thử cho logic PySpark
Phòng thực hành Ngày 5 — Xây dựng một Đường ống xử lý Hoàn chỉnh Từ đầu đến cuối
- Lắp ráp đường ống Bronze→Silver→Gold được điều phối bằng Workflows
- Triển khai ghi nhật ký (logging), kiểm toán (auditing), chạy lại (retries) và xác thực tự động
- Chạy toàn bộ đường ống, xác thực đầu ra và chuẩn bị ghi chú triển khai
Vận hành hóa, Quản trị và Sẵn sàng cho Sản xuất
- Quản trị Unity Catalog, dòng họ dữ liệu (lineage) và các thực hành tốt nhất về kiểm soát truy cập
- Chi phí, kích thước cụm (cluster sizing), tự động mở rộng (autoscaling) và các mẫu song song hóa việc làm (job concurrency patterns)
- Danh sách kiểm tra triển khai, chiến lược hoàn tác (rollback) và tạo sổ tay vận hành (runbook)
Đánh giá Cuối cùng, Chuyển giao Kiến thức và Các Bước Tiếp Theo
- Bài thuyết trình của người tham gia về công việc di chuyển dữ liệu và bài học kinh nghiệm
- Phân tích khoảng cách, các hoạt động tiếp theo được đề xuất và bàn giao tài liệu đào tạo
- Các tài liệu tham khảo, lộ trình học tập thêm và các tùy chọn hỗ trợ
Yêu cầu
- Hiểu biết về các khái niệm kỹ thuật dữ liệu
- Kinh nghiệm với SQL và thủ tục lưu trữ (Synapse / SQL Server)
- Nắm vững các khái niệm điều phối ETL (ADF hoặc tương tự)
Đối tượng tham gia
- Các quản lý công nghệ có nền tảng kỹ thuật dữ liệu
- Các kỹ sư dữ liệu đang chuyển đổi logic OLAP thủ tục sang các mẫu Lakehouse
- Các kỹ sư nền tảng chịu trách nhiệm về việc áp dụng Databricks