Liên hệ với chúng tôi

Đề cương khóa học

Mỗi phiên là 2 giờ

Ngày 1: Phiên 1: Tổng quan Kinh doanh về Tại sao Trí tuệ kinh doanh Dữ liệu lớn trong Chính phủ

  • Các nghiên cứu trường hợp từ NIH, DoE
  • Tỷ lệ thích ứng Dữ liệu lớn trong các Cơ quan Chính phủ và cách họ đang điều hướng hoạt động tương lai của mình xoay quanh Phân tích Dự đoán Dữ liệu lớn
  • Lĩnh vực ứng dụng quy mô lớn trong DoD, NSA, IRS, USDA v.v.
  • Giao tiếp Dữ liệu lớn với dữ liệu Cũ
  • Hiểu biết cơ bản về các công nghệ hỗ trợ trong phân tích dự đoán
  • Tích hợp Dữ liệu & trực quan hóa Bảng điều khiển
  • Quản lý Gian lận
  • Trích xuất Quy tắc Kinh doanh / Phát hiện Gian lận
  • Phát hiện và xác định hồ sơ mối đe dọa
  • Phân tích lợi ích chi phí cho việc triển khai Dữ liệu lớn

Ngày 1: Phiên 2: Giới thiệu về Dữ liệu lớn-1

  • Các đặc điểm chính của Dữ liệu lớn - khối lượng, sự đa dạng, tốc độ và độ chính xác. Kiến trúc MPP cho khối lượng.
  • Kho dữ liệu – schema tĩnh, bộ dữ liệu tiến hóa chậm
  • Các cơ sở dữ liệu MPP như Greenplum, Exadata, Teradata, Netezza, Vertica v.v.
  • Các giải pháp dựa trên Hadoop – không có điều kiện về cấu trúc của bộ dữ liệu.
  • Mẫu hình điển hình: HDFS, MapReduce (crunch), truy xuất từ HDFS
  • Batch - phù hợp cho phân tích / không tương tác
  • Khối lượng: Dữ liệu dòng CEP
  • Lựa chọn điển hình – các sản phẩm CEP (vd. Infostreams, Apama, MarkLogic v.v)
  • Ít sẵn sàng cho sản xuất hơn – Storm/S4
  • Cơ sở dữ liệu NoSQL – (cột và khóa-giá trị): Phù hợp nhất như phần phụ trợ phân tích cho kho dữ liệu / cơ sở dữ liệu

Ngày 1: Phiên 3: Giới thiệu về Dữ liệu lớn-2

Các giải pháp NoSQL

  • Trình lưu trữ KV - Keyspace, Flare, SchemaFree, RAMCloud, Oracle NoSQL Database (OnDB)
  • Trình lưu trữ KV - Dynamo, Voldemort, Dynomite, SubRecord, Mo8onDb, DovetailDB
  • Trình lưu trữ KV (Cấp bậc) - GT.m, Cache
  • Trình lưu trữ KV (Có thứ tự) - TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB, Actord
  • Bộ nhớ đệm KV - Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity, Terracoqua
  • Trình lưu trữ Tuple - Gigaspaces, Coord, Apache River
  • Cơ sở dữ liệu Đối tượng - ZopeDB, DB40, Shoal
  • Trình lưu trữ Tài liệu - CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, XML-Databases, ThruDB, CloudKit, Prsevere, Riak-Basho, Scalaris
  • Trình lưu trữ Cột Rộng - BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase, KDI

Sự đa dạng của Dữ liệu: Giới thiệu về vấn đề Làm sạch Dữ liệu trong Dữ liệu lớn

  • RDBMS – cấu trúc / schema tĩnh, không thúc đẩy môi trường linh hoạt, khám phá.
  • NoSQL – bán cấu trúc, đủ cấu trúc để lưu trữ dữ liệu mà không cần schema chính xác trước khi lưu trữ dữ liệu
  • Các vấn đề làm sạch dữ liệu

Ngày 1: Phiên 4: Giới thiệu Dữ liệu lớn-3 : Hadoop

  • Khi nào nên chọn Hadoop?
  • CÓ CẤU TRÚC - Các kho dữ liệu / cơ sở dữ liệu doanh nghiệp có thể lưu trữ dữ liệu khổng lồ (với một chi phí) nhưng áp đặt cấu trúc (không tốt cho việc khám phá chủ động)
  • Dữ liệu BÁN CẤU TRÚC – khó thực hiện bằng các giải pháp truyền thống (DW/DB)
  • Lưu kho dữ liệu = nỗ lực KHỔNG LỘ và tĩnh ngay cả sau khi triển khai
  • Đối với sự đa dạng & khối lượng của dữ liệu, được xử lý trên phần cứng hàng hóa – HADOOP
  • Cần phần cứng Hàng hóa để tạo một Cluster Hadoop

Giới thiệu về Map Reduce /HDFS

  • MapReduce – phân phối tính toán trên nhiều máy chủ
  • HDFS – làm cho dữ liệu có sẵn cục bộ cho quá trình tính toán (với sự dự phòng)
  • Dữ liệu – có thể không có cấu trúc / không có schema (khác với RDBMS)
  • Trách nhiệm của nhà phát triển là để hiểu ý nghĩa của dữ liệu
  • Lập trình MapReduce = làm việc với Java (lợi ích / bất lợi), tự động nạp dữ liệu vào HDFS

Ngày 2: Phiên 1: Hệ sinh thái Dữ liệu lớn-Xây dựng ETL Dữ liệu lớn: vũ trụ của các Công cụ Dữ liệu lớn-công cụ nào để sử dụng và khi nào?

  • Hadoop so với. Các giải pháp NoSQL khác
  • Đối với tương tác, truy cập ngẫu nhiên vào dữ liệu
  • Hbase (cơ sở dữ liệu định hướng cột) trên nền Hadoop
  • Truy cập ngẫu nhiên vào dữ liệu nhưng có các hạn chế bị áp đặt (tối đa 1 PB)
  • Không tốt cho phân tích ad-hoc, tốt cho ghi nhật ký, đếm, chuỗi thời gian
  • Sqoop - Import từ cơ sở dữ liệu vào Hive hoặc HDFS (truy cập JDBC/ODBC)
  • Flume – Dữ liệu dòng (vd. dữ liệu nhật ký) vào HDFS

Ngày 2: Phiên 2: Hệ thống Quản lý Dữ liệu lớn

  • Các bộ phận di chuyển, các nút tính toán bắt đầu / thất bại :ZooKeeper - Đối với dịch vụ cấu hình / điều phối / đặt tên
  • Đường ống / luồng công việc phức tạp: Oozie – quản lý luồng công việc, sự phụ thuộc, chuỗi liên kết
  • Triển khai, cấu hình, quản lý cluster, nâng cấp v.v (quản trị hệ thống) :Ambari
  • Trong Đám mây : Whirr

Ngày 2: Phiên 3: Phân tích dự đoán trong Trí tuệ kinh doanh -1: Các Kỹ thuật Cơ bản & Trí tuệ kinh doanh dựa trên Học máy :

  • Giới thiệu về Học máy
  • Học các kỹ thuật phân loại
  • Dự đoán Bayes - chuẩn bị tệp đào tạo
  • Support Vector Machine
  • KNN p-Tree Đại số & khai thác dọc
  • Mạng thần kinh
  • Vấn đề biến lớn của Dữ liệu lớn - Rừng ngẫu nhiên (RF)
  • Vấn đề Tự động hóa Dữ liệu lớn – Ensemble đa mô hình RF
  • Tự động hóa qua Soft10-M
  • Công cụ phân tích văn bản-Treeminer
  • Học linh hoạt
  • Học dựa trên Agent
  • Học phân tán
  • Giới thiệu các Công cụ Mã nguồn mở cho phân tích dự đoán : R, Rapidminer, Mahut

Ngày 2: Phiên 4 Hệ sinh thái phân tích dự đoán-2: Các vấn đề phân tích dự đoán phổ biến trong Chính phủ.

  • Phân tích Thông tin chuyên sâu
  • Phân tích Trực quan hóa
  • Phân tích dự đoán có cấu trúc
  • Phân tích dự đoán không có cấu trúc
  • Xác định hồ sơ Mối đe dọa/gian lận/vendor
  • Trình động Khuyến nghị
  • Phát hiện Mẫu hình
  • Khám phá Quy tắc/Kịch bản – thất bại, gian lận, tối ưu hóa
  • Khám phá Nguyên nhân gốc
  • Phân tích Cảm xúc
  • Phân tích CRM
  • Phân tích Mạng
  • Phân tích Văn bản
  • Xem xét hỗ trợ bởi công nghệ
  • Phân tích Gian lận
  • Phân tích Thời gian thực

Ngày 3 : Phiên 1 : Phân tích Thời gian thực và Khả năng mở rộng Trên Hadoop

  • Tại sao các thuật toán phân tích phổ biến thất bại trong Hadoop/HDFS
  • Apache Hama- cho tính toán phân tán Đồng bộ Khối
  • Apache SPARK- cho tính toán cụm cho phân tích thời gian thực
  • CMU Graphics Lab2- Cách tiếp cận bất đồng bộ dựa trên Đồ thị cho tính toán phân tán
  • Cách tiếp cận dựa trên KNN p-Đại số từ Treeminer để giảm chi phí phần cứng vận hành

Ngày 3: Phiên 2: Công cụ cho eDiscovery và Pháp lý

  • eDiscovery trên Dữ liệu lớn so với. dữ liệu Cũ – sự so sánh về chi phí và hiệu suất
  • Viết mã dự đoán và xem xét hỗ trợ bởi công nghệ (TAR)
  • Trình diễn trực tiếp của một sản phẩm Tar (vMiner) để hiểu cách TAR hoạt động cho khám phá nhanh hơn
  • Chỉ mục nhanh hơn thông qua HDFS – tốc độ của dữ liệu
  • NLP hoặc Xử lý Ngôn ngữ Tự nhiên – các kỹ thuật và sản phẩm mã nguồn mở khác nhau
  • eDiscovery bằng ngoại ngữ-công nghệ cho xử lý ngôn ngữ nước ngoài

Ngày 3 : Phiên 3: Trí tuệ kinh doanh Dữ liệu lớn cho An ninh mạng – Hiểu toàn bộ góc nhìn 360 độ từ thu thập dữ liệu nhanh chóng đến nhận dạng mối đe dọa

  • Hiểu các khái niệm cơ bản của phân tích bảo mật- bề mặt tấn công, cấu hình bảo mật sai, phòng thủ máy chủ
  • Hạ tầng Mạng / Ống dữ liệu lớn / ETL Phản hồi cho phân tích thời gian thực
  • Cách viết lệnh so với dự đoán – Cố định dựa trên quy tắc so với tự động khám phá các quy tắc mối đe dọa từ Dữ liệu Meta

Ngày 3: Phiên 4: Dữ liệu lớn trong USDA : Ứng dụng trong Nông nghiệp

  • Giới thiệu về IoT (Internet of Things) cho nông nghiệp-Dữ liệu lớn dựa trên cảm biến và điều khiển
  • Giới thiệu về ảnh vệ tinh và ứng dụng của nó trong nông nghiệp
  • Tích hợp dữ liệu cảm biến và hình ảnh cho độ màu mỡ của đất, khuyến nghị canh tác và dự báo
  • Bảo hiểm nông nghiệp và Dữ liệu lớn
  • Dự báo tổn thất mùa màng

Ngày 4 : Phiên 1: Trí tuệ kinh doanh phòng chống gian lận từ Dữ liệu lớn trong Chính phủ-Phân tích gian lận:

  • Phân loại cơ bản của phân tích Gian lận- dựa trên quy tắc so với phân tích dự đoán
  • Học máy có giám sát so với không giám sát cho phát hiện mẫu hình Gian lận
  • Gian lận/vendor / quá mức hóa đơn cho các dự án
  • Gian lận Medicare và Medicaid- kỹ thuật phát hiện gian lận cho xử lý yêu cầu
  • Gian lận hoàn tiền du lịch
  • Gian lận hoàn thuế IRS
  • Sẽ có các nghiên cứu trường hợp và trình diễn trực tiếp khi có dữ liệu.

Ngày 4 : Phiên 2: Phân tích Mạng xã hội- Thu thập và phân tích thông tin tình báo

  • API ETL Dữ liệu lớn để trích xuất dữ liệu mạng xã hội
  • Văn bản, hình ảnh, dữ liệu meta và video
  • Phân tích Cảm xúc từ luồng mạng xã hội
  • Lọc ngữ cảnh và không ngữ cảnh của luồng mạng xã hội
  • Bảng điều khiển Mạng xã hội để tích hợp các mạng xã hội đa dạng
  • Xác định hồ sơ tự động của hồ sơ mạng xã hội
  • Sẽ có trình diễn trực tiếp của mỗi phân tích thông qua Công cụ Treeminer.

Ngày 4 : Phiên 3: Phân tích Dữ liệu lớn trong xử lý ảnh và luồng video

  • Kỹ thuật Lưu trữ Ảnh trong Dữ liệu lớn- Giải pháp lưu trữ cho dữ liệu vượt quá petabyte
  • LTFS và LTO
  • GPFS-LTFS (Giải pháp lưu trữ phân tầng cho dữ liệu hình ảnh lớn)
  • Nền tảng của phân tích hình ảnh
  • Nhận dạng Đối tượng
  • Phân đoạn Hình ảnh
  • Theo dõi Chuyển động
  • Khôi phục ảnh 3-D

Ngày 4: Phiên 4: Ứng dụng Dữ liệu lớn trong NIH:

  • Các lĩnh vực mới nổi của Sinh học tin học
  • Metalomics và các vấn đề khai thác Dữ liệu lớn
  • Phân tích dự đoán Dữ liệu lớn cho Dược genomics, Metabolomics và Proteomics
  • Dữ liệu lớn trong quy trình Genomics cuối chuỗi
  • Ứng dụng của phân tích dự đoán Dữ liệu lớn trong Y tế công cộng

Bảng điều khiển Dữ liệu lớn để truy cập nhanh chóng các dữ liệu đa dạng và hiển thị :

  • Tích hợp nền tảng ứng dụng hiện có với Bảng điều khiển Dữ liệu lớn
  • Quản lý Dữ liệu lớn
  • Nghiên cứu Trường hợp của Bảng điều khiển Dữ liệu lớn: Tableau và Pentaho
  • Sử dụng ứng dụng Dữ liệu lớn để đẩy mạnh các dịch vụ dựa trên vị trí trong Chính phủ.
  • Hệ thống Theo dõi và quản lý

Ngày 5 : Phiên 1: Làm thế nào để biện minh cho việc triển khai Trí tuệ kinh doanh Dữ liệu lớn trong một tổ chức:

  • Định nghĩa ROI cho việc triển khai Dữ liệu lớn
  • Nghiên cứu trường hợp cho tiết kiệm Thời gian Phân tích viên cho việc thu thập và chuẩn bị Dữ liệu –tăng cường lợi ích năng suất
  • Nghiên cứu trường hợp về lợi ích doanh thu từ việc tiết kiệm chi phí cơ sở dữ liệu được cấp phép
  • Lợi ích doanh thu từ dịch vụ dựa trên vị trí
  • Tiết kiệm từ phòng chống gian lận
  • Một cách tiếp cận bảng tính tích hợp để tính toán chi phí xấp xỉ so với. Doanh thu gia tăng/tiết kiệm từ việc triển khai Dữ liệu lớn.

Ngày 5 : Phiên 2: Quy trình từng bước để thay thế hệ thống dữ liệu cũ bằng Hệ thống Dữ liệu lớn:

  • Hiểu bản đồ đường di trú Dữ liệu lớn thực tế
  • Các thông tin quan trọng cần thiết trước khi kiến trúc một triển khai Dữ liệu lớn là gì
  • Các cách khác nhau để tính toán khối lượng, tốc độ, sự đa dạng và độ chính xác của dữ liệu là gì
  • Cách ước tính tăng trưởng dữ liệu
  • Nghiên cứu trường hợp

Ngày 5: Phiên 4: Xem xét các Nhà cung cấp Dữ liệu lớn và xem xét các sản phẩm của họ. Phiên Hỏi/Đáp:

  • Accenture
  • APTEAN (Trước đây là CDC Software)
  • Cisco Systems
  • Cloudera
  • Dell
  • EMC
  • GoodData Corporation
  • Guavus
  • Hitachi Data Systems
  • Hortonworks
  • HP
  • IBM
  • Informatica
  • Intel
  • Jaspersoft
  • Microsoft
  • MongoDB (Trước đây là 10Gen)
  • MU Sigma
  • Netapp
  • Opera Solutions
  • Oracle
  • Pentaho
  • Platfora
  • Qliktech
  • Quantum
  • Rackspace
  • Revolution Analytics
  • Salesforce
  • SAP
  • SAS Institute
  • Sisense
  • Software AG/Terracotta
  • Soft10 Automation
  • Splunk
  • Sqrrl
  • Supermicro
  • Tableau Software
  • Teradata
  • Think Big Analytics
  • Tidemark Systems
  • Treeminer
  • VMware (Phần của EMC)

Yêu cầu

  • Kiến thức cơ bản về vận hành kinh doanh và hệ thống dữ liệu trong Chính phủ trong lĩnh vực của họ
  • Hiểu biết cơ bản về SQL/Oracle hoặc cơ sở dữ liệu quan hệ
  • Hiểu biết cơ bản về Thống kê (ở cấp độ Bảng tính)
 35 Giờ

Số người tham gia


Giá cho mỗi học viên

Đánh giá (1)

Các khóa học sắp tới

Các danh mục liên quan