Seputar Big Data edisi #4 - idBigData idBigData

Kumpulan berita, artikel, tutorial dan blog mengenai Big Data yang dikutip dari berbagai site. Berikut ini beberapa hal menarik yang layak untuk dibaca kembali selama terakhir bulan Januari 2017 dan awal Februari 2017

Artikel dan berita

All You Need To Know About Business Models in Digital Transformation
Dalam istilah yang sangat sederhana, Model Bisnis adalah bagaimana perencaam kita untuk menghasilkan uang dari bisnis yang kita jalani. Sebuah versi halus adalah bagaimana kita menciptakan dan memberikan nilai kepada pelanggan.
Five Ways Data Analytics Will Storm the Stage in 2017
Telah menjadi sesuatu yang jelas saat ini, bagaimana analisis data mengarahkan pendapatan di bidang e-commerce. Dan perkembangan ini telah memaksa perusahaan e-tailers dan e-commerce untuk mempekerjakan lebih banyak data scientist dalam rangka untuk lebih memahami bagaimana faktor pelanggan berdampak kepada pendapatan dan penjualan.
Stream Processing Myths Debunked
Stream processing menjadi bagian yang penting dalam sebuah sistem big data, dan semakin banyak aplikasi dan platform yang mendukungnya. Meskipun demikian, masih banyak miskonsepsi yang terjadi terkait dengan stream processing. Dalam artikel ini para ahli dari data Artisans mengupas dan membongkar 6 mitos dan miskonsepsi mengenai stream processing.
How Madden Got So Good at Predicting Super Bowl Winners
Bagaimana Madden, sebuah videogame, dapat memanfaatkan data untuk memprediksikan pemenang superbowl, perhelatan olahraga terbesar di Amerika, hingga 9 dari 13 kali.

Tutorial dan pengetahuan teknis

The Top Predictive Analytics Pitfalls to Avoid
Tidak dapat dipungkiri lagi bahwa predictive modelling dan machine learning memberikan kontribusi signifikan untuk bisnis, namun keduanya sangat sensitif terhadap data dan perubahan di dalamnya, sehingga pemilihan teknik yang tepat dan menghindari kesalahan dan perangkap dalam membangun model data sains. Berikut ini beberapa perangkap utama yang perlu dihindari.
How to set up a Twitter bot using R
Dalam rangka dirilisnya package R ke 10.000 di CRAN, eoda menjalankan akun Twitter yang otomatis menampilkan jumlah package yang tersedia di CRAN sampai package ke 10 ribu tercapai pada tanggal 28 Januari 2017. Artikel ini menjelaskan mengenai cara set up account Twitter tersebut dengan R script.
Journey Science: Combining 18 Data Sources + 1 Billion Interactions to take UX to The Next Level
Journey Science, yang menyatukan data dari berbagai aktifitas pelanggan, telah menjadi bagian penting bagi industri telekomunikasi. Data tersebut dapat digunakan untuk meningkatkan customer experience dan retention. Dengan menggunakan insight yang didapat dari customer journey analytics, bisnis telekomunikasi dapat mengukur user experience dengan lebih baik, dan membuat keputusan yang tepat untuk meningkatkannya. Mulai dari melakukan tindakan proaktif untuk kepuasan pelanggan, namun juga untuk memprediksi dan mengantisipasi kegagalan yang mungkin terjadi di masa datang. Berikut ini sekilas mengenai bagaimana memanfaatkan customer journey untuk meningkatkan pelayanan dan kepuasan pelanggan.
Performance comparison of different file formats and storage engines in the Hadoop ecosystem
CERN telah mempublikasikan perbandingan kinerja Apache Avro, Apache Parquet, Apache HBase dan Apache Kudu. Ujicoba ini untuk mengevaluasi efficiency, ingestion performance, analytic scans and random data lookup pada data layanan CERN Hadoop.
Working with UDFs in Apache Spark
Dalam tulisan ini, akan dijelaskan contoh yang sederhana pembuatan UDF dan UDAF pada Apache Spark menggunakan Python, Java dan Scala
Perfecting Lambda Architecture with Oracle Data Integrator (and Kafka / MapR Streams)
Artikel yang menjelaskan konfogurasi pada Oracle Data Integrator menggunakan Apache Kafka/MapR Stream untuk menangkap perubahan yang terjadi pada MySQL.

Rilis produk

Google : Using Machine Learning to predict parking difficulty
Saat ini sebagian besar waktu mengemudi dihabiskan dalam kemacetan atau berputar-putar mencari tempat parkir. Salah satu tujuan produk-produk semacam Google Maps dan Waze adalah membantu pengguna kendaraan untuk mengemudi dengan lebih mudah dan efisien. Namun sampai saat ini, belum ada tool yang khusus mengatasi permasalahan parkir. Minggu lalu, Google merilis fitur baru untuk Android Google Map, yang menawarkan prediksi kondisi perparkiran di sekitar tempat tujuan anda, sehingga anda dapat mengantisipasinya dengan lebih baik. Fitur ini memanfaatkan kombinasi antara crowdsourcing dan machine learning. Saat ini fitur tersebut baru terdapat di di 25 kota di Amerika Serikat saja.
Apache Atlas 0.7.1-incubating released
Apache Atlas 0.7.1-incubating telah dirilis. Ada banyak perbaikan bugs dan beberapa peningkatan yang bersifat minor.
Cloudera Enterprise 5.10 is Now Available
Cloudera telah mengumumkan bahwa Cloudera Enterprise 5.10 telah dirilis dengan support GA untuk Apache Kudu, peningkatan kinerja pada cloud, peningkatan pada pengelolaan data dalam Amazon S3, dan banyak lagi.
Announcing The Latest Hortonworks Data Cloud Release !
Hortonworks mengumumkan rilis baru dari Hortonworks Data Cloud for AWS. Versi 1.11 ini terus mendorong untuk membuat pengolahan data menjadi mudah dan berbiaya efektif dalam komputasi awan.
Announcing Data Collector ver 2.3.0.0
StreamSets Data Collector versi 2.3.0.0 telah dirilis. Fokus utama dari rilis kali ini adalah mulithreaded pipelines, dukungan terhadap multitable copy, MongoDB change data capture, and HTTP API untuk Elasticsearch
[ANNOUNCE] Apache Bahir 2.0.2
Apache Bahir, tools yang menyediakan ekstensi dari Apache Spark, merilis versi 2.0.2

Contributor :

Tim idbigdata
always connect to collaborate every innovation 🙂