Talend Big Data Integration Khóa Học Đào Tạo
Talend Open Studio for Big Data là một công cụ ETL nguồn mở để xử lý dữ liệu lớn. Nó bao gồm môi trường phát triển để tương tác với các nguồn và đích dữ liệu lớn, và chạy các công việc mà không cần phải viết mã.
Khóa học trực tiếp do giảng viên hướng dẫn (trực tuyến hoặc tại chỗ) này nhằm vào những người kỹ thuật muốn triển khai Talend Open Studio for Big Data để đơn giản hóa quá trình đọc và xử lý dữ liệu lớn.
Đến cuối khóa học, người tham gia sẽ có thể:
- Cài đặt và cấu hình Talend Open Studio for Big Data.
- Kết nối với các hệ thống dữ liệu lớn như Cloudera, HortonWorks, MapR, Amazon EMR và Apache.
- Hiểu và thiết lập các thành phần và bộ kết nối dữ liệu lớn của Open Studio.
- Cấu hình các tham số để tự động tạo mã MapReduce.
- Sử dụng giao diện kéo thả của Open Studio để chạy công việc Hadoop.
- Xây dựng nguyên mẫu các đường ống dữ liệu lớn.
- Tự động hóa các dự án tích hợp dữ liệu lớn.
Định dạng khóa học
- Bài giảng và thảo luận tương tác.
- Nhiều bài tập và thực hành.
- Thực hiện trên môi trường lab trực tiếp.
Tùy chỉnh khóa học
- Để yêu cầu một khóa học tùy chỉnh, vui lòng liên hệ với chúng tôi để sắp xếp.
Đề cương khóa học
Giới thiệu
Tổng quan về đặc điểm và kiến trúc của "Open Studio for Big Data"
Cài đặt Open Studio for Big Data
Điều hướng giao diện người dùng
Hiểu về các thành phần và bộ kết nối dữ liệu lớn
Kết nối với cụm Hadoop
Đọc và viết dữ liệu
Xử lý dữ liệu bằng Hive và MapReduce
Phân tích kết quả
Cải thiện chất lượng dữ liệu lớn
Xây dựng một đường ống dữ liệu lớn
Quản lý người dùng, nhóm, vai trò và dự án
Triển khai Open Studio vào môi trường sản xuất
Giám sát Open Studio
Khắc phục sự cố
Tóm tắt và kết luận
Yêu cầu
- Hiểu về cơ sở dữ liệu quan hệ
- Hiểu về kho dữ liệu
- Hiểu các khái niệm ETL (Extract, Transform, Load)
Đối tượng học viên
- Chuyên gia thông tin kinh doanh
- Chuyên gia cơ sở dữ liệu
- Nhà phát triển SQL
- Nhà phát triển ETL
- Kiến trúc sư giải pháp
- Kiến trúc sư dữ liệu
- Chuyên gia kho dữ liệu
- Quản trị viên hệ thống và tích hợp
Khóa học đào tạo mở cần có ít nhất 5 người tham gia.
Talend Big Data Integration Khóa Học Đào Tạo - Đặt chỗ
Talend Big Data Integration Khóa Học Đào Tạo - Yêu cầu thông tin
Talend Big Data Integration - Yêu cầu tư vấn
Đánh giá (1)
Bài tập thực hành. Lớp học dự kiến kéo dài 5 ngày, nhưng 3 ngày đã giúp giải đáp nhiều câu hỏi mà tôi gặp phải khi làm việc với NiFi.
James - BHG Financial
Khóa học - Apache NiFi for Administrators
Dịch thuật bằng máy
Các khóa học sắp tới
Các khóa học liên quan
Apache Iceberg Nâng Cao
21 GiờKhóa học này được dẫn dắt trực tiếp (online hoặc trực tiếp) được thiết kế cho các chuyên gia dữ liệu cấp cao muốn tối ưu hóa luồng xử lý dữ liệu, đảm bảo tính toàn vẹn của dữ liệu, và triển khai các giải pháp data lakehouse mạnh mẽ có thể xử lý các phức tạp của các ứng dụng big data hiện đại.
Đến cuối khóa học, các thí sinh sẽ có thể:
- Hiểu sâu về kiến trúc của Iceberg, bao gồm quản lý metadata và bố cục tập tin.
- Cấu hình Iceberg để đạt hiệu suất tối ưu trong các môi trường khác nhau và tích hợp nó với nhiều engine xử lý dữ liệu.
- Quản lý các bảng Iceberg lớn, thực hiện các thay đổi schema phức tạp và xử lý tiến hóa phân vùng.
- Thao tác kỹ thuật để tối ưu hóa hiệu suất truy vấn và hiệu suất quét dữ liệu cho các bộ dữ liệu lớn.
- Triển khai các cơ chế để đảm bảo tính nhất quán của dữ liệu, quản lý các bảo đảm giao dịch và xử lý sự cố trong môi trường phân tán.
Cơ bản về Apache Iceberg
14 GiờKhóa học trực tiếp do giáo viên hướng dẫn (trực tuyến hoặc tại chỗ) này dành cho các chuyên gia dữ liệu cấp độ cơ bản muốn thu được kiến thức và kỹ năng cần thiết để có thể sử dụng Apache Iceberg để quản lý các bộ dữ liệu lớn, đảm bảo tính toàn vẹn dữ liệu, và tối ưu hóa quy trình xử lý dữ liệu.
Đến cuối khóa học, các thí sinh sẽ có thể:
- Hiểu rõ về kiến trúc, tính năng và lợi ích của Apache Iceberg.
- Học về các định dạng bảng, phân vùng, tiến hóa sơ đồ và khả năng du lịch thời gian.
- Cài đặt và cấu hình Apache Iceberg trong các môi trường khác nhau.
- Tạo, quản lý và thao tác với các bảng Iceberg.
- Hiểu quá trình di chuyển dữ liệu từ các định dạng bảng khác sang Iceberg.
Big Data Phân tích dữ liệu với Google Colab và Apache Spark
14 Giờkhóa học trực tuyến hoặc tại chỗ này do giảng viên hướng dẫn (ở Việt Nam) được thiết kế cho các nhà khoa học dữ liệu và kỹ sư cấp trung muốn sử dụng Google Colab và Apache Spark để xử lý và phân tích dữ liệu lớn.
Đến cuối khóa học, người tham gia sẽ có thể:
- Cài đặt môi trường dữ liệu lớn bằng cách sử dụng Google Colab và Spark.
- Xử lý và phân tích các tập dữ liệu lớn một cách hiệu quả với Apache Spark.
- Biểu đồ hóa dữ liệu lớn trong môi trường hợp tác.
- Tích hợp Apache Spark với công cụ dựa trên đám mây.
Apache NiFi cho Quản trị viên
21 GiờApache NiFi là một nền tảng tích hợp dữ liệu và xử lý sự kiện dựa trên luồng mã nguồn mở. Nó cho phép tự động hóa, truyền tải dữ liệu thời gian thực, biến đổi và trung gian hệ thống giữa các hệ thống khác nhau, với giao diện người dùng web và kiểm soát chi tiết.
Khóa đào tạo trực tiếp do giảng viên hướng dẫn (trực tiếp hoặc từ xa) này dành cho quản trị viên và kỹ sư trung cấp có mong muốn triển khai, quản lý, bảo mật và tối ưu hóa các dòng dữ liệu NiFi trong môi trường sản xuất.
Sau khi kết thúc khóa học, người tham gia sẽ có thể:
- Cài đặt, cấu hình và bảo trì các cụm Apache NiFi.
- Thiết kế và quản lý dòng dữ liệu từ nhiều nguồn và đích.
- Triển khai tự động hóa luồng, định tuyến và biến đổi logic.
- Tối ưu hóa hiệu suất, giám sát hoạt động và khắc phục sự cố.
Định dạng của khóa học
- Bài giảng tương tác với thảo luận về kiến trúc thực tế.
- Thực hành phòng thí nghiệm: xây dựng, triển khai và quản lý dòng dữ liệu.
- Bài tập dựa trên kịch bản trong môi trường phòng thí nghiệm trực tiếp.
Tùy chọn tùy chỉnh khóa học
- Để yêu cầu khóa đào tạo được tùy chỉnh, vui lòng liên hệ với chúng tôi để sắp xếp.
PySpark và Học máy
21 GiờKhóa đào tạo này cung cấp một cái nhìn thực tiễn về việc xây dựng các quy trình xử lý dữ liệu có khả năng mở rộng và quy trình Học máy (Machine Learning) bằng PySpark. Người học sẽ tìm hiểu cách Apache Spark hoạt động trong các hệ sinh thái Dữ liệu lớn (Big Data) hiện đại cũng như cách xử lý hiệu quả các tập dữ liệu lớn dựa trên các nguyên lý tính toán phân tán.
Cơ sở của Apache Spark
21 GiờKhóa đào tạo trực tiếp, do giảng viên hướng dẫn này (trực tuyến hoặc tại chỗ) dành cho các kỹ sư muốn thiết lập và triển khai hệ thống Apache Spark để xử lý lượng dữ liệu rất lớn.
Khi kết thúc khóa đào tạo này, người tham gia sẽ có thể:
- Cài đặt và cấu hình Apache Spark.
- Xử lý và phân tích nhanh chóng các tập dữ liệu rất lớn.
- Hiểu sự khác biệt giữa Apache Spark và Hadoop MapReduce và khi nào nên sử dụng cái nào.
- Tích hợp Apache Spark với các công cụ học máy khác.
Quản lý Apache Spark
35 GiờKhóa đào tạo trực tiếp, do giảng viên hướng dẫn này tại Việt Nam (trực tuyến hoặc tại chỗ) dành cho các quản trị viên hệ thống ở trình độ mới bắt đầu đến trung cấp, những người muốn triển khai, duy trì và tối ưu hóa các cụm Spark.
Khi kết thúc khóa đào tạo này, người tham gia sẽ có thể:
- Cài đặt và cấu hình Apache Spark trong nhiều môi trường.
- Quản lý tài nguyên cụm và giám sát các ứng dụng Spark.
- Tối ưu hóa hiệu suất của các cụm Spark.
- Triển khai các biện pháp bảo mật và đảm bảo tính khả dụng cao.
- Gỡ lỗi và khắc phục các sự cố phổ biến của Spark.
Apache Spark trên đám mây
21 GiờĐường cong học tập của Apache Spark tăng chậm ở giai đoạn đầu, đòi hỏi rất nhiều nỗ lực để đạt được kết quả đầu tiên. Khóa học này hướng đến việc vượt qua phần khó khăn ban đầu đó. Sau khi hoàn thành khóa học này, người tham gia sẽ hiểu các kiến thức cơ bản về Apache Spark, phân biệt rõ ràng RDD và DataFrame, học API Python và Scala, hiểu về executors và tasks, v.v. Đồng thời, tuân thủ các phương pháp thực hành tốt nhất, khóa học tập trung mạnh vào triển khai trên nền tảng đám mây, Databricks và AWS. Người học cũng sẽ hiểu sự khác biệt giữa AWS EMR và AWS Glue, một trong những dịch vụ Spark mới nhất của AWS.
ĐỐI TƯỢNG:
Kỹ sư Dữ liệu, DevOps, Nhà khoa học Dữ liệu
Python và Spark cho Dữ liệu Lớn (PySpark)
21 GiờTrong khóa đào tạo trực tiếp, do giảng viên hướng dẫn này tại Việt Nam, người tham gia sẽ học cách sử dụng Python và Spark cùng nhau để phân tích dữ liệu lớn thông qua các bài tập thực hành.
Khi kết thúc khóa đào tạo này, người tham gia sẽ có thể:
- Học cách sử dụng Spark với Python để phân tích Big Data.
- Thực hành các bài tập mô phỏng các trường hợp thực tế.
- Sử dụng các công cụ và kỹ thuật khác nhau để phân tích dữ liệu lớn bằng PySpark.
Python, Spark, và Hadoop cho Big Data
21 GiờKhóa đào tạo trực tiếp, do giảng viên hướng dẫn này (trực tuyến hoặc tại chỗ) dành cho các nhà phát triển muốn sử dụng và tích hợp Spark, Hadoop và Python để xử lý, phân tích và chuyển đổi các tập dữ liệu lớn và phức tạp.
Khi kết thúc khóa đào tạo này, người tham gia sẽ có thể:
- Thiết lập môi trường cần thiết để bắt đầu xử lý dữ liệu lớn với Spark, Hadoop và Python.
- Hiểu các tính năng, thành phần cốt lõi và kiến trúc của Spark và Hadoop.
- Tìm hiểu cách tích hợp Spark, Hadoop và Python để xử lý dữ liệu lớn.
- Khám phá các công cụ trong hệ sinh thái Spark (Spark MlLib, Spark Streaming, Kafka, Sqoop, Kafka và Flume).
- Xây dựng các hệ thống khuyến nghị lọc cộng tác tương tự như Netflix, YouTube, Amazon, Spotify và Google.
- Sử dụng Apache Mahout để mở rộng quy mô các thuật toán học máy.
Stratio: Rocket và Các Mô-đun Trí Tuệ với PySpark
14 GiờStratio là một nền tảng tập trung vào dữ liệu, tích hợp big data, AI và quản lý thành một giải pháp duy nhất. Các mô-đun Rocket và Trí Tuệ của nó cho phép khám phá dữ liệu nhanh chóng, chuyển đổi và phân tích nâng cao trong môi trường doanh nghiệp.
Khóa đào tạo trực tiếp này (trực tuyến hoặc tại chỗ) dành cho các chuyên gia dữ liệu trung cấp muốn sử dụng hiệu quả các mô-đun Rocket và Trí Tuệ trong Stratio với PySpark, tập trung vào cấu trúc lặp, hàm do người dùng định nghĩa và logic dữ liệu nâng cao.
Sau khóa đào tạo này, học viên sẽ có thể:
- Điều hướng và làm việc trong nền tảng Stratio bằng cách sử dụng các mô-đun Rocket và Trí Tuệ.
- Áp dụng PySpark trong bối cảnh nhập liệu, chuyển đổi và phân tích dữ liệu.
- Sử dụng các cấu trúc lặp và logic điều kiện để kiểm soát quy trình xử lý dữ liệu và tác vụ kỹ thuật đặc trưng.
- Tạo và quản lý hàm do người dùng định nghĩa (UDFs) cho các thao tác dữ liệu có thể tái sử dụng trong PySpark.
Định dạng Khóa Học
- Bài giảng tương tác và thảo luận.
- Nhiều bài tập và thực hành.
- Thực hiện trong môi trường lab trực tiếp.
Tùy chỉnh Khóa Học
- Để yêu cầu khóa đào tạo tùy chỉnh cho khóa học này, vui lòng liên hệ với chúng tôi để sắp xếp.
Trung tâm Quản trị Talend (TAC)
14 GiờKhóa đào tạo trực tiếp, do giảng viên hướng dẫn này tại Việt Nam (trực tuyến hoặc tại chỗ) dành cho các quản trị viên hệ thống, nhà khoa học dữ liệu và chuyên viên phân tích kinh doanh, những người muốn thiết lập Trung tâm Quản trị Talend để triển khai và quản lý các vai trò và nhiệm vụ của tổ chức.
Khi kết thúc khóa đào tạo này, người tham gia sẽ có thể:
- Cài đặt và cấu hình Trung tâm Quản trị Talend.
- Hiểu và triển khai các nguyên tắc quản lý Talend.
- Xây dựng, triển khai và chạy các dự án hoặc nhiệm vụ kinh doanh trong Talend.
- Giám sát bảo mật của tập dữ liệu và phát triển các quy trình kinh doanh dựa trên khung TAC.
- Có được sự hiểu biết sâu sắc hơn về các ứng dụng dữ liệu lớn.
Quản lý Dữ liệu Talend
14 GiờKhóa đào tạo trực tiếp, do giảng viên hướng dẫn này (trực tuyến hoặc tại chỗ) dành cho các nhà phân tích dữ liệu ở trình độ sơ cấp đến trung cấp, những người muốn nâng cao hiểu biết và kỹ năng của họ trong việc quản lý và cải thiện chất lượng dữ liệu bằng Talend Data Stewardship.
Khi kết thúc khóa đào tạo này, người tham gia sẽ có thể:
- Có được sự hiểu biết toàn diện về vai trò của quản trị dữ liệu trong việc duy trì chất lượng dữ liệu.
- Sử dụng Talend Data Stewardship để quản lý các tác vụ liên quan đến chất lượng dữ liệu.
- Tạo, giao và quản lý các tác vụ trong Talend Data Stewardship, bao gồm tùy chỉnh quy trình làm việc.
- Sử dụng khả năng báo cáo và giám sát của công cụ để theo dõi chất lượng dữ liệu và các nỗ lực quản trị.
Talend Open Studio for ESB
21 GiờIn this instructor-led live training in Việt Nam, participants will learn how to use Talend Open Studio for ESB to create, connect, mediate, and manage services and their interactions.
By the end of this training, participants will be able to
- Integrate, enhance, and deliver ESB technologies as unified packages across various deployment environments.
- Understand and utilize the most commonly used components of Talend Open Studio.
- Integrate any application, database, API, or Web services.
- Seamlessly connect heterogeneous systems and applications.
- Incorporate existing Java code libraries to extend project capabilities.
- Leverage community components and code to extend projects.
- Rapidly integrate systems, applications, and data sources within a drag-and-drop Eclipse environment.
- Reduce development time and maintenance costs by generating optimized, reusable code.