Liên hệ với chúng tôi

Đề cương khóa học

Giới thiệu, Mục tiêu và Chiến lược di chuyển

  • Mục tiêu khóa học, đối chiếu hồ sơ người tham gia và tiêu chí thành công
  • Các phương pháp tiếp cận di chuyển ở cấp độ tổng quan và các yếu tố rủi ro cần xem xét
  • Cài đặt không gian làm việc (workspaces), kho lưu trữ mã nguồn và bộ dữ liệu lab

Ngày 1 — Nền tảng di chuyển và Kiến trúc

  • Các khái niệm Lakehouse, tổng quan Delta Lake và kiến trúc Databricks
  • So sánh khác biệt giữa SMP và MPP cùng các hệ quả cho việc di chuyển
  • Thiết kế mô hình huy chương (Bronze→Silver→Gold) và tổng quan Unity Catalog

Lab Ngày 1 — Chuyển đổi một thủ tục lưu trữ

  • Thực hành di chuyển một thủ tục lưu trữ mẫu sang notebook
  • Ánh xạ bảng tạm và con trỏ (cursors) sang các phép biến đổi DataFrame
  • Xác thực và so sánh với kết quả đầu ra gốc

Ngày 2 — Delta Lake nâng cao & Nạp dữ liệu tăng dần

  • Giao dịch ACID, nhật ký commit, phiên bản hóa và du hành thời gian (time travel)
  • Auto Loader, các mẫu MERGE INTO, upsert và tiến hóa schema (schema evolution)
  • OPTIMIZE, VACUUM, Z-ORDER, phân vùng và tinh chỉnh lưu trữ

Lab Ngày 2 — Nhập liệu tăng dần & Tối ưu hóa

  • Triển khai nhập liệu Auto Loader và các quy trình làm việc MERGE
  • Áp dụng OPTIMIZE, Z-ORDER và VACUUM; xác thực kết quả
  • Đo lường cải thiện hiệu năng đọc/ghi

Ngày 3 — SQL trong Databricks, Hiệu năng & Gỡ lỗi

  • Các tính năng SQL phân tích: hàm cửa sổ, hàm bậc cao, xử lý JSON/mảng
  • Đọc Spark UI, DAGs, shuffles, các giai đoạn (stages), tác vụ và chẩn đoán điểm nghẽn
  • Các mẫu tinh chỉnh truy vấn: broadcast joins, gợi ý (hints), đệm (caching) và giảm tràn (spill)

Lab Ngày 3 — Tái cấu trúc SQL & Tối ưu hiệu năng

  • Tái cấu trúc một quy trình SQL nặng sang Spark SQL được tối ưu
  • Sử dụng vết theo dõi Spark UI để xác định và khắc phục các vấn đề về mất cân bằng (skew) và shuffle
  • Chạy benchmark trước/sau và tài liệu hóa các bước tinh chỉnh

Ngày 4 — PySpark thực chiến: Thay thế logic thủ tục

  • Mô hình thực thi Spark: trình điều khiển (driver), bộ thực thi (executors), đánh giá trì hoãn (lazy evaluation) và các chiến lược phân vùng
  • Chuyển đổi vòng lặp và con trỏ sang các thao tác DataFrame vector hóa
  • Modular hóa, UDFs/pandas UDFs, widget và các thư viện có thể tái sử dụng

Lab Ngày 4 — Tái cấu trúc các script thủ tục

  • Tái cấu trúc một script ETL thủ tục sang các notebook PySpark có cấu trúc module
  • Giới thiệu tham số hóa, kiểm thử dạng đơn vị (unit-style tests) và các hàm có thể tái sử dụng
  • Rà soát mã nguồn và áp dụng danh sách kiểm tra thực hành tốt

Ngày 5 — Điều phối, Pipeline từ đầu đến cuối & Thực hành tốt

  • Databricks Workflows: thiết kế job, các phụ thuộc tác vụ, kích hoạt (triggers) và xử lý lỗi
  • Thiết kế pipeline Medallion tăng dần với các quy tắc chất lượng và xác thực schema
  • Tích hợp với Git (GitHub/Azure DevOps), CI và các chiến lược kiểm thử cho logic PySpark

Lab Ngày 5 — Xây dựng một Pipeline hoàn chỉnh từ đầu đến cuối

  • Lắp ráp pipeline Bronze→Silver→Gold được điều phối bằng Workflows
  • Triển khai ghi log, kiểm toán, thử lại (retries) và xác thực tự động
  • Chạy toàn bộ pipeline, xác thực đầu ra và chuẩn bị ghi chú triển khai

Vận hành hóa, Quản trị và Sẵn sàng cho môi trường sản xuất

  • Quản trị Unity Catalog, dòng dữ liệu (lineage) và các thực hành tốt về kiểm soát truy cập
  • Chi phí, kích thước cụm (cluster sizing), tự động mở rộng (autoscaling) và các mẫu đồng thời job
  • Danh sách kiểm tra triển khai, chiến lược hoàn tác (rollback) và tạo sổ tay vận hành (runbook)

Xem xét cuối cùng, Chuyển giao kiến thức và Các bước tiếp theo

  • Bài trình bày của người tham gia về công tác di chuyển và bài học kinh nghiệm
  • Phân tích khoảng trống, các hoạt động theo dõi được đề xuất và bàn giao tài liệu đào tạo
  • Tham khảo, lộ trình học tập nâng cao và các tùy chọn hỗ trợ

Yêu cầu

  • Hiểu biết về các khái niệm kỹ thuật dữ liệu
  • Kinh nghiệm với SQL và thủ tục lưu trữ (Synapse / SQL Server)
  • Nắm vững các khái niệm điều phối ETL (ADF hoặc tương tự)

Đối tượng

  • Các quản lý công nghệ có nền tảng kỹ thuật dữ liệu
  • Các kỹ sư dữ liệu đang chuyển đổi logic OLAP thủ tục sang các mô hình Lakehouse
  • Các kỹ sư nền tảng chịu trách nhiệm triển khai Databricks
 35 Giờ

Số người tham gia


Giá cho mỗi học viên

Các khóa học sắp tới

Các danh mục liên quan