對於Java程式設計師,大數據的主流平台hadoop是基於Java開發的,所以Java大數據程式設計師從語言環境上更為順暢,另外很多基於大數據的應用框架也是Java的,所以在很多大數據專案裡掌握Java語言是有一定優勢的。
當然,hadoop核心價值在於提供了分散式檔案系統和分散式運算引擎,對於大部分公司而言,並不需要對這個引擎進行修改。這時候除了熟悉編程,你通常還需要學習資料處理和資料探勘的一些知識。尤其是往資料探勘工程師方向發展,則你需要掌握更多的演算法相關的知識。
對於資料探勘工程師而言,雖然也需要掌握程式設計工具,但大部分情況下是把hadoop當作平台和工具,借助這個平台和工具提供的介面使用各種腳本語言進行資料處理和資料探勘。因此,如果你是往資料探勘工程方向,那麼,熟練分佈式程式語言如scala、spark-mllib等可能更為重要。
Java大資料工程師的學習路線圖:
第一步:分散式運算框架
掌握hadoop與spark分散式運算框架,了解檔案系統、訊息佇列和Nosql資料庫,學習相關元件如hadoop、MR、spark、hive、hbase、redies、kafka等;
##第二步:演算法與工具
#學習了解各種資料探勘演算法,如分類、聚類、關聯規則、迴歸、決策樹、神經網路等,熟練一門資料探勘程式設計工具:Python或Scala。目前主流平台和框架已經提供了演算法庫,如hadoop上的Mahout和spark上的Mllib,你也可以從學習這些介面和腳本語言開始學習這些演算法。第三步:數學
補充數學知識:高數、機率論與線代第四步:專案實踐
1)開源專案:tensorflow:Google的開源程式庫,已經有40000多個star,非常驚人,支援行動裝置;2)參加資料競賽#3)透過企業實習獲取專案經驗如果你只是做大數據開發和維運,則可以跳過第二步和第三步,如果你專注於應用已有演算法進行資料探勘,那麼第三步也可以先跳過。以上是java大數據學什麼內容的詳細內容。更多資訊請關注PHP中文網其他相關文章!