Hubungi Kami
 Durasi 35 jam

Kerangka Materi

Setiap sesi berlangsung 2 jam

Hari-1: Sesi -1: Gambaran Bisnis Mengapa Big Data Business Intelligence di Pemerintah

  • Studi Kasus dari NIH, DoE
  • Laju adaptasi Big Data di Lembaga Pemerintah & bagaimana mereka menyelaraskan operasi masa depan mereka di sekitar Big Data Predictive Analytics
  • Area Aplikasi Skala Luas di DoD, NSA, IRS, USDA, dll.
  • Interfacing Big Data dengan data Legacy
  • Pemahaman dasar tentang teknologi pendukung dalam analitik prediktif
  • Integrasi Data & visualisasi Dashboard
  • Manajemen Kecurangan
  • Generasi Business Rule/ Deteksi Kecurangan
  • Deteksi dan profil ancaman
  • Analisis biaya-manfaat untuk implementasi Big Data

Hari-1: Sesi-2 : Pengenalan Big Data-1

  • Karakteristik utama Big Data - volume, variasi, kecepatan, dan kebenaran. Arsitektur MPP untuk volume.
  • Gudang Data – skema statis, set data yang berevolusi perlahan
  • Database MPP seperti Greenplum, Exadata, Teradata, Netezza, Vertica, dll.
  • Solusi Berbasis Hadoop – tidak ada kondisi pada struktur set data.
  • Polik khas: HDFS, MapReduce (crunch), mengambil dari HDFS
  • Batch - cocok untuk analitik/non-interaktif
  • Volume: data streaming CEP
  • Pilihan tipikal – produk CEP (e.g. Infostreams, Apama, MarkLogic, dll)
  • Kurang siap produksi – Storm/S4
  • Database NoSQL – (kolom dan kunci-nilai): Paling cocok sebagai adjunct analitik untuk gudang data/database

Hari-1 : Sesi -3 : Pengenalan Big Data-2

Solusi NoSQL

  • Penyimpanan KV - Keyspace, Flare, SchemaFree, RAMCloud, Oracle NoSQL Database (OnDB)
  • Penyimpanan KV - Dynamo, Voldemort, Dynomite, SubRecord, Mo8onDb, DovetailDB
  • Penyimpanan KV (Hierarki) - GT.m, Cache
  • Penyimpanan KV (Terurut) - TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB, Actord
  • Kache KV - Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity, Terracoqua
  • Penyimpanan Tuple - Gigaspaces, Coord, Apache River
  • Database Objek - ZopeDB, DB40, Shoal
  • Penyimpanan Dokumen - CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, XML-Databases, ThruDB, CloudKit, Prsevere, Riak-Basho, Scalaris
  • Penyimpanan Kolom Lebar - BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase, KDI

Berbagai Jenis Data: Pengenalan masalah Pembersihan Data di Big Data

  • RDBMS – struktur/skema statis, tidak mendorong lingkungan agile, eksploratif.
  • NoSQL – semi terstruktur, cukup struktur untuk menyimpan data tanpa skema tepat sebelum menyimpan data
  • Isu pembersihan data

Hari-1 : Sesi-4 : Pengenalan Big Data-3 : Hadoop

  • Kapan memilih Hadoop?
  • TERSTRUKTUR - Gudang database/data perusahaan dapat menyimpan data masif (dengan biaya) tetapi memaksakan struktur (tidak baik untuk eksplorasi aktif)
  • Data SEMI TERSTRUKTUR – sulit dilakukan dengan solusi tradisional (DW/DB)
  • Penyimpanan data = usaha BESAR dan statis bahkan setelah implementasi
  • Untuk variasi & volume data, diproses di perangkat keras komoditas – HADOOP
  • Perangkat keras H/W komoditas diperlukan untuk membuat Klaster Hadoop

Pengenalan Map Reduce /HDFS

  • MapReduce – mendistribusikan komputasi di beberapa server
  • HDFS – membuat data tersedia secara lokal untuk proses komputasi (dengan redundansi)
  • Data – dapat tidak terstruktur/tanpa skema (berbeda dengan RDBMS)
  • Tanggung jawab pengembang untuk membuat makna data
  • Memprogram MapReduce = bekerja dengan Java (kelebihan/kekurangan), memuat data ke HDFS secara manual

Hari-2: Sesi-1: Ekosistem Big Data-Membangun Big Data ETL: alam semesta Alat Big Data - yang harus digunakan dan kapan?

  • Hadoop vs. Solusi NoSQL lainnya
  • Untuk akses acak interaktif ke data
  • Hbase (database berorientasi kolom) di atas Hadoop
  • Akses acak ke data tetapi pembatasan dipaksakan (maks 1 PB)
  • Tidak baik untuk analitik ad-hoc, baik untuk log, penghitungan, seri waktu
  • Sqoop - Impor dari database ke Hive atau HDFS (akses JDBC/ODBC)
  • Flume – Aliran data (e.g. data log) ke HDFS

Hari-2: Sesi-2: Sistem Manajemen Big Data

  • Pembagian bagian, node komputasi mulai/gagal :ZooKeeper - Untuk layanan konfigurasi/koordinasi/penamaan
  • Pipeline/workflow kompleks: Oozie – kelola workflow, dependensi, rantai daisy
  • Deploy, konfigurasi, manajemen klaster, upgrade, dll (sys admin) :Ambari
  • Di Awan : Whirr

Hari-2: Sesi-3: Analitik Prediktif dalam Business Intelligence -1: Teknik Fundamental & BI berbasis Machine learning :

  • Pengenalan Machine learning
  • Belajar teknik klasifikasi
  • Peramalan Bayesian-mempersiapkan file pelatihan
  • Support Vector Machine
  • KNN p-Tree Algebra & penambangan vertikal
  • Neural Network
  • Permasalahan variabel besar Big Data-Random forest (RF)
  • Permasalahan Otomasi Big Data – Ensemble Multi-model RF
  • Otomasi melalui Soft10-M
  • Alat analitik teks-Treeminer
  • Belajar Agile
  • Pembelajaran berbasis agen
  • Pembelajaran terdistribusi
  • Pengenalan Alat Open source untuk analitik prediktif : R, Rapidminer, Mahut

Hari-2: Sesi-4 Ekosistem analitik prediktif-2: Masalah analitik prediktif umum di pemerintah.

  • Analitik wawasan
  • Analitik visualisasi
  • Analitik prediktif terstruktur
  • Analitik prediktif tidak terstruktur
  • Profil ancaman/fraudstar/vendor
  • Engine Rekomendasi
  • Deteksi pola
  • Penemuan Rule/Skenario – kegagalan, kecurangan, optimasi
  • Penemuan akar penyebab
  • Analisis sentimen
  • Analitik CRM
  • Analitik jaringan
  • Analitik Teks
  • Peninjauan dengan bantuan teknologi
  • Analitik Kecurangan
  • Analitik Real Time

Hari-3 : Sesi-1 : Analitik Real Time dan Skalabel di atas Hadoop

  • Mengapa algoritma analitik umum gagal di Hadoop/HDFS
  • Apache Hama- untuk komputasi terdistribusi Bulk Synchronous
  • Apache SPARK- untuk komputasi klaster untuk analitik real time
  • CMU Graphics Lab2- Pendekatan asinkron berbasis Graph untuk komputasi terdistribusi
  • Pendekatan berbasis KNN p-Algebra dari Treeminer untuk mengurangi biaya perangkat keras operasi

Hari-3: Sesi-2: Alat untuk eDiscovery dan Forensik

  • eDiscovery di atas Big Data vs. data Legacy – perbandingan biaya dan kinerja
  • Pengkodean prediktif dan peninjauan dengan bantuan teknologi (TAR)
  • Live demo produk Tar (vMiner) untuk memahami bagaimana TAR bekerja untuk penemuan yang lebih cepat
  • Indeksasi yang lebih cepat melalui HDFS –kecepatan data
  • NLP atau pemrosesan Bahasa Alami –berbagai teknik dan produk open source
  • eDiscovery dalam bahasa asing-teknologi untuk pemrosesan bahasa asing

Hari-3 : Sesi 3: Big Data BI untuk Keamanan Siber – Memahami pandangan 360 derajat penuh dari pengumpulan data cepat hingga identifikasi ancaman

  • Memahami dasar-dasar analitik keamanan- permukaan serangan, salah konfigurasi keamanan, pertahanan host
  • Infrastruktur jaringan/ Pip data besar / Respons ETL untuk analitik real time
  • Preskriptif vs prediktif – Berbasis aturan tetap vs penemuan otomatis aturan ancaman dari Meta data

Hari-3: Sesi 4: Big Data di USDA : Aplikasi dalam Pertanian

  • Pengenalan IoT ( Internet of Things) untuk pertanian- Big Data berbasis sensor dan kontrol
  • Pengenalan pencitraan Satelit dan aplikasinya dalam pertanian
  • Integrasi data sensor dan gambar untuk kesuburan tanah, rekomendasi budidaya, dan prakiraan
  • Asuransi Pertanian dan Big Data
  • Prakiraan Kerugian Panen

Hari-4 : Sesi-1: BI pencegahan kecurangan dari Big Data di pemerintah- analitik kecurangan:

  • Klasifikasi dasar analitik kecurangan- berbasis aturan vs analitik prediktif
  • Machine learning bersupervisi vs tidak bersupervisi untuk deteksi pola kecurangan
  • Kecurangan vendor/ over charging untuk proyek
  • Kecurangan Medicare dan Medicaid- teknik deteksi kecurangan untuk pemrosesan klaim
  • Kecurangan penggantian perjalanan
  • Kecurangan pengembalian IRS
  • Studi kasus dan live demo akan diberikan di mana pun data tersedia.

Hari-4 : Sesi-2: Analitik Media Sosial- Pengumpulan dan analisis intelijen

  • API Big Data ETL untuk mengekstrak data media sosial
  • Teks, gambar, meta data dan video
  • Analisis sentimen dari feed media sosial
  • Penyaringan kontekstual dan non-kontekstual feed media sosial
  • Dashboard Media Sosial untuk mengintegrasikan media sosial yang beragam
  • Profil otomatis profil media sosial
  • Live demo setiap analitik akan diberikan melalui Alat Treeminer.

Hari-4 : Sesi-3: Analitik Big Data dalam pemrosesan gambar dan feed video

  • Teknik Penyimpanan Gambar di Big Data- Solusi penyimpanan untuk data yang melebihi petabyte
  • LTFS dan LTO
  • GPFS-LTFS ( Solusi penyimpanan berlapis untuk Big image data)
  • Fundamental analitik gambar
  • Objek pengenalan
  • Segmentasi Gambar
  • Motion tracking
  • Rekonstruksi gambar 3-D

Hari-4: Sesi-4: Aplikasi Big Data di NIH:

  • Lembar baru Bio-informatics
  • Meta-genomics dan isu penambangan Big Data
  • Analityk Prediktif Big Data untuk Farmakogenomik, Metabolomik, dan Proteomik
  • Big Data dalam proses Genomik hilir
  • Aplikasi analitik prediktif big data dalam kesehatan publik

Dashboard Big Data untuk aksesibilitas cepat data yang beragam dan tampilan :

  • Integrasi platform aplikasi yang ada dengan Dashboard Big Data
  • Manajemen Big Data
  • Studi Kasus Dashboard Big Data: Tableau dan Pentaho
  • Gunakan aplikasi Big Data untuk mendorong layanan berbasis lokasi di pemerintah.
  • Sistem pelacakan dan manajemen

Hari-5 : Sesi-1: Cara menjustifikasi implementasi Big Data BI dalam suatu organisasi:

  • Menentukan ROI untuk implementasi Big Data
  • Studi kasus untuk menghemat Waktu Analis untuk pengumpulan dan persiapan Data –peningkatan keuntungan produktivitas
  • Studi kasus keuntungan pendapatan dari menghemat biaya database berlisensi
  • Keuntungan pendapatan dari layanan berbasis lokasi
  • Hemat dari pencegahan kecurangan
  • Penyelesaian spreadsheet terintegrasi untuk menghitung perkiraan pengeluaran vs. Keuntungan pendapatan/hematan dari implementasi Big Data.

Hari-5 : Sesi-2: Prosedur langkah demi langkah untuk mengganti sistem data legacy dengan Sistem Big Data:

  • Memahami Roadmap Migrasi Big Data praktis
  • Apa saja informasi penting yang diperlukan sebelum mengarsiteki implementasi Big Data
  • Apa saja cara yang berbeda untuk menghitung volume, kecepatan, variasi, dan kebenaran data
  • Bagaimana memperkirakan pertumbuhan data
  • Studi kasus

Hari-5: Sesi 4: Tinjauan Vendor Big Data dan tinjauan produk mereka. Sesi T/K:

  • Accenture
  • APTEAN (Dulunya CDC Software)
  • Cisco Systems
  • Cloudera
  • Dell
  • EMC
  • GoodData Corporation
  • Guavus
  • Hitachi Data Systems
  • Hortonworks
  • HP
  • IBM
  • Informatica
  • Intel
  • Jaspersoft
  • Microsoft
  • MongoDB (Dulunya 10Gen)
  • MU Sigma
  • Netapp
  • Opera Solutions
  • Oracle
  • Pentaho
  • Platfora
  • Qliktech
  • Quantum
  • Rackspace
  • Revolution Analytics
  • Salesforce
  • SAP
  • SAS Institute
  • Sisense
  • Software AG/Terracotta
  • Soft10 Automation
  • Splunk
  • Sqrrl
  • Supermicro
  • Tableau Software
  • Teradata
  • Think Big Analytics
  • Tidemark Systems
  • Treeminer
  • VMware (Bagian dari EMC)

Persyaratan

  • Pengetahuan dasar tentang operasi bisnis dan sistem data di lingkungan pemerintah dalam domain mereka
  • Pemahaman dasar tentang SQL/Oracle atau database relasional
  • Pemahaman dasar tentang Statistik (di level Spreadsheet)

Jumlah Peserta


Harga per Peserta

Testimoni (1)

Kursus Mendatang

Kategori Terkait