Terima kasih telah mengirimkan pertanyaan Anda! Salah satu anggota tim kami akan segera menghubungi Anda.
Terima kasih telah mengirimkan pemesanan Anda! Salah satu anggota tim kami akan segera menghubungi Anda.
Durasi 35 jam
Kerangka Materi
Setiap sesi berlangsung 2 jam
Hari-1: Sesi -1: Gambaran Bisnis Mengapa Big Data Business Intelligence di Pemerintah
- Studi Kasus dari NIH, DoE
- Laju adaptasi Big Data di Lembaga Pemerintah & bagaimana mereka menyelaraskan operasi masa depan mereka di sekitar Big Data Predictive Analytics
- Area Aplikasi Skala Luas di DoD, NSA, IRS, USDA, dll.
- Interfacing Big Data dengan data Legacy
- Pemahaman dasar tentang teknologi pendukung dalam analitik prediktif
- Integrasi Data & visualisasi Dashboard
- Manajemen Kecurangan
- Generasi Business Rule/ Deteksi Kecurangan
- Deteksi dan profil ancaman
- Analisis biaya-manfaat untuk implementasi Big Data
Hari-1: Sesi-2 : Pengenalan Big Data-1
- Karakteristik utama Big Data - volume, variasi, kecepatan, dan kebenaran. Arsitektur MPP untuk volume.
- Gudang Data – skema statis, set data yang berevolusi perlahan
- Database MPP seperti Greenplum, Exadata, Teradata, Netezza, Vertica, dll.
- Solusi Berbasis Hadoop – tidak ada kondisi pada struktur set data.
- Polik khas: HDFS, MapReduce (crunch), mengambil dari HDFS
- Batch - cocok untuk analitik/non-interaktif
- Volume: data streaming CEP
- Pilihan tipikal – produk CEP (e.g. Infostreams, Apama, MarkLogic, dll)
- Kurang siap produksi – Storm/S4
- Database NoSQL – (kolom dan kunci-nilai): Paling cocok sebagai adjunct analitik untuk gudang data/database
Hari-1 : Sesi -3 : Pengenalan Big Data-2
Solusi NoSQL
- Penyimpanan KV - Keyspace, Flare, SchemaFree, RAMCloud, Oracle NoSQL Database (OnDB)
- Penyimpanan KV - Dynamo, Voldemort, Dynomite, SubRecord, Mo8onDb, DovetailDB
- Penyimpanan KV (Hierarki) - GT.m, Cache
- Penyimpanan KV (Terurut) - TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB, Actord
- Kache KV - Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity, Terracoqua
- Penyimpanan Tuple - Gigaspaces, Coord, Apache River
- Database Objek - ZopeDB, DB40, Shoal
- Penyimpanan Dokumen - CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, XML-Databases, ThruDB, CloudKit, Prsevere, Riak-Basho, Scalaris
- Penyimpanan Kolom Lebar - BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase, KDI
Berbagai Jenis Data: Pengenalan masalah Pembersihan Data di Big Data
- RDBMS – struktur/skema statis, tidak mendorong lingkungan agile, eksploratif.
- NoSQL – semi terstruktur, cukup struktur untuk menyimpan data tanpa skema tepat sebelum menyimpan data
- Isu pembersihan data
Hari-1 : Sesi-4 : Pengenalan Big Data-3 : Hadoop
- Kapan memilih Hadoop?
- TERSTRUKTUR - Gudang database/data perusahaan dapat menyimpan data masif (dengan biaya) tetapi memaksakan struktur (tidak baik untuk eksplorasi aktif)
- Data SEMI TERSTRUKTUR – sulit dilakukan dengan solusi tradisional (DW/DB)
- Penyimpanan data = usaha BESAR dan statis bahkan setelah implementasi
- Untuk variasi & volume data, diproses di perangkat keras komoditas – HADOOP
- Perangkat keras H/W komoditas diperlukan untuk membuat Klaster Hadoop
Pengenalan Map Reduce /HDFS
- MapReduce – mendistribusikan komputasi di beberapa server
- HDFS – membuat data tersedia secara lokal untuk proses komputasi (dengan redundansi)
- Data – dapat tidak terstruktur/tanpa skema (berbeda dengan RDBMS)
- Tanggung jawab pengembang untuk membuat makna data
- Memprogram MapReduce = bekerja dengan Java (kelebihan/kekurangan), memuat data ke HDFS secara manual
Hari-2: Sesi-1: Ekosistem Big Data-Membangun Big Data ETL: alam semesta Alat Big Data - yang harus digunakan dan kapan?
- Hadoop vs. Solusi NoSQL lainnya
- Untuk akses acak interaktif ke data
- Hbase (database berorientasi kolom) di atas Hadoop
- Akses acak ke data tetapi pembatasan dipaksakan (maks 1 PB)
- Tidak baik untuk analitik ad-hoc, baik untuk log, penghitungan, seri waktu
- Sqoop - Impor dari database ke Hive atau HDFS (akses JDBC/ODBC)
- Flume – Aliran data (e.g. data log) ke HDFS
Hari-2: Sesi-2: Sistem Manajemen Big Data
- Pembagian bagian, node komputasi mulai/gagal :ZooKeeper - Untuk layanan konfigurasi/koordinasi/penamaan
- Pipeline/workflow kompleks: Oozie – kelola workflow, dependensi, rantai daisy
- Deploy, konfigurasi, manajemen klaster, upgrade, dll (sys admin) :Ambari
- Di Awan : Whirr
Hari-2: Sesi-3: Analitik Prediktif dalam Business Intelligence -1: Teknik Fundamental & BI berbasis Machine learning :
- Pengenalan Machine learning
- Belajar teknik klasifikasi
- Peramalan Bayesian-mempersiapkan file pelatihan
- Support Vector Machine
- KNN p-Tree Algebra & penambangan vertikal
- Neural Network
- Permasalahan variabel besar Big Data-Random forest (RF)
- Permasalahan Otomasi Big Data – Ensemble Multi-model RF
- Otomasi melalui Soft10-M
- Alat analitik teks-Treeminer
- Belajar Agile
- Pembelajaran berbasis agen
- Pembelajaran terdistribusi
- Pengenalan Alat Open source untuk analitik prediktif : R, Rapidminer, Mahut
Hari-2: Sesi-4 Ekosistem analitik prediktif-2: Masalah analitik prediktif umum di pemerintah.
- Analitik wawasan
- Analitik visualisasi
- Analitik prediktif terstruktur
- Analitik prediktif tidak terstruktur
- Profil ancaman/fraudstar/vendor
- Engine Rekomendasi
- Deteksi pola
- Penemuan Rule/Skenario – kegagalan, kecurangan, optimasi
- Penemuan akar penyebab
- Analisis sentimen
- Analitik CRM
- Analitik jaringan
- Analitik Teks
- Peninjauan dengan bantuan teknologi
- Analitik Kecurangan
- Analitik Real Time
Hari-3 : Sesi-1 : Analitik Real Time dan Skalabel di atas Hadoop
- Mengapa algoritma analitik umum gagal di Hadoop/HDFS
- Apache Hama- untuk komputasi terdistribusi Bulk Synchronous
- Apache SPARK- untuk komputasi klaster untuk analitik real time
- CMU Graphics Lab2- Pendekatan asinkron berbasis Graph untuk komputasi terdistribusi
- Pendekatan berbasis KNN p-Algebra dari Treeminer untuk mengurangi biaya perangkat keras operasi
Hari-3: Sesi-2: Alat untuk eDiscovery dan Forensik
- eDiscovery di atas Big Data vs. data Legacy – perbandingan biaya dan kinerja
- Pengkodean prediktif dan peninjauan dengan bantuan teknologi (TAR)
- Live demo produk Tar (vMiner) untuk memahami bagaimana TAR bekerja untuk penemuan yang lebih cepat
- Indeksasi yang lebih cepat melalui HDFS –kecepatan data
- NLP atau pemrosesan Bahasa Alami –berbagai teknik dan produk open source
- eDiscovery dalam bahasa asing-teknologi untuk pemrosesan bahasa asing
Hari-3 : Sesi 3: Big Data BI untuk Keamanan Siber – Memahami pandangan 360 derajat penuh dari pengumpulan data cepat hingga identifikasi ancaman
- Memahami dasar-dasar analitik keamanan- permukaan serangan, salah konfigurasi keamanan, pertahanan host
- Infrastruktur jaringan/ Pip data besar / Respons ETL untuk analitik real time
- Preskriptif vs prediktif – Berbasis aturan tetap vs penemuan otomatis aturan ancaman dari Meta data
Hari-3: Sesi 4: Big Data di USDA : Aplikasi dalam Pertanian
- Pengenalan IoT ( Internet of Things) untuk pertanian- Big Data berbasis sensor dan kontrol
- Pengenalan pencitraan Satelit dan aplikasinya dalam pertanian
- Integrasi data sensor dan gambar untuk kesuburan tanah, rekomendasi budidaya, dan prakiraan
- Asuransi Pertanian dan Big Data
- Prakiraan Kerugian Panen
Hari-4 : Sesi-1: BI pencegahan kecurangan dari Big Data di pemerintah- analitik kecurangan:
- Klasifikasi dasar analitik kecurangan- berbasis aturan vs analitik prediktif
- Machine learning bersupervisi vs tidak bersupervisi untuk deteksi pola kecurangan
- Kecurangan vendor/ over charging untuk proyek
- Kecurangan Medicare dan Medicaid- teknik deteksi kecurangan untuk pemrosesan klaim
- Kecurangan penggantian perjalanan
- Kecurangan pengembalian IRS
- Studi kasus dan live demo akan diberikan di mana pun data tersedia.
Hari-4 : Sesi-2: Analitik Media Sosial- Pengumpulan dan analisis intelijen
- API Big Data ETL untuk mengekstrak data media sosial
- Teks, gambar, meta data dan video
- Analisis sentimen dari feed media sosial
- Penyaringan kontekstual dan non-kontekstual feed media sosial
- Dashboard Media Sosial untuk mengintegrasikan media sosial yang beragam
- Profil otomatis profil media sosial
- Live demo setiap analitik akan diberikan melalui Alat Treeminer.
Hari-4 : Sesi-3: Analitik Big Data dalam pemrosesan gambar dan feed video
- Teknik Penyimpanan Gambar di Big Data- Solusi penyimpanan untuk data yang melebihi petabyte
- LTFS dan LTO
- GPFS-LTFS ( Solusi penyimpanan berlapis untuk Big image data)
- Fundamental analitik gambar
- Objek pengenalan
- Segmentasi Gambar
- Motion tracking
- Rekonstruksi gambar 3-D
Hari-4: Sesi-4: Aplikasi Big Data di NIH:
- Lembar baru Bio-informatics
- Meta-genomics dan isu penambangan Big Data
- Analityk Prediktif Big Data untuk Farmakogenomik, Metabolomik, dan Proteomik
- Big Data dalam proses Genomik hilir
- Aplikasi analitik prediktif big data dalam kesehatan publik
Dashboard Big Data untuk aksesibilitas cepat data yang beragam dan tampilan :
- Integrasi platform aplikasi yang ada dengan Dashboard Big Data
- Manajemen Big Data
- Studi Kasus Dashboard Big Data: Tableau dan Pentaho
- Gunakan aplikasi Big Data untuk mendorong layanan berbasis lokasi di pemerintah.
- Sistem pelacakan dan manajemen
Hari-5 : Sesi-1: Cara menjustifikasi implementasi Big Data BI dalam suatu organisasi:
- Menentukan ROI untuk implementasi Big Data
- Studi kasus untuk menghemat Waktu Analis untuk pengumpulan dan persiapan Data –peningkatan keuntungan produktivitas
- Studi kasus keuntungan pendapatan dari menghemat biaya database berlisensi
- Keuntungan pendapatan dari layanan berbasis lokasi
- Hemat dari pencegahan kecurangan
- Penyelesaian spreadsheet terintegrasi untuk menghitung perkiraan pengeluaran vs. Keuntungan pendapatan/hematan dari implementasi Big Data.
Hari-5 : Sesi-2: Prosedur langkah demi langkah untuk mengganti sistem data legacy dengan Sistem Big Data:
- Memahami Roadmap Migrasi Big Data praktis
- Apa saja informasi penting yang diperlukan sebelum mengarsiteki implementasi Big Data
- Apa saja cara yang berbeda untuk menghitung volume, kecepatan, variasi, dan kebenaran data
- Bagaimana memperkirakan pertumbuhan data
- Studi kasus
Hari-5: Sesi 4: Tinjauan Vendor Big Data dan tinjauan produk mereka. Sesi T/K:
- Accenture
- APTEAN (Dulunya CDC Software)
- Cisco Systems
- Cloudera
- Dell
- EMC
- GoodData Corporation
- Guavus
- Hitachi Data Systems
- Hortonworks
- HP
- IBM
- Informatica
- Intel
- Jaspersoft
- Microsoft
- MongoDB (Dulunya 10Gen)
- MU Sigma
- Netapp
- Opera Solutions
- Oracle
- Pentaho
- Platfora
- Qliktech
- Quantum
- Rackspace
- Revolution Analytics
- Salesforce
- SAP
- SAS Institute
- Sisense
- Software AG/Terracotta
- Soft10 Automation
- Splunk
- Sqrrl
- Supermicro
- Tableau Software
- Teradata
- Think Big Analytics
- Tidemark Systems
- Treeminer
- VMware (Bagian dari EMC)
Persyaratan
- Pengetahuan dasar tentang operasi bisnis dan sistem data di lingkungan pemerintah dalam domain mereka
- Pemahaman dasar tentang SQL/Oracle atau database relasional
- Pemahaman dasar tentang Statistik (di level Spreadsheet)
Testimoni (1)
Kemampuan instruktur untuk menyelaraskan kursus dengan kebutuhan organisasi, bukan hanya memberikan kursus demi penyampaian materi semata.
Masilonyane - Revenue Services Lesotho
Kursus - Big Data Business Intelligence for Govt. Agencies
Diterjemahkan Mesin