Hadoop家族產品學習線路圖和簡單產品介紹
Hadoop家族產品學習線路圖
簡單產品介紹:
Apache Hadoop: 是Apache開源組織的一個分散式計算開源框架,提供了一個分散式檔案系統子專案(HDFS)和支援MapReduce分散式計算的軟體架構。
Apache Hive: 是基於Hadoop的一個資料倉儲工具,可以將結構化的資料檔案對映為一張資料庫表,通過類SQL語句快速實現簡單的MapReduce統計,不必開發專門的MapReduce應用,十分適合資料倉儲的統計分析。
Apache Pig: 是一個基於Hadoop的大規模資料分析工具,它提供的SQL-LIKE語言叫Pig Latin,該語言的編譯器會把類SQL的資料分析請求轉換為一系列經過優化處理的MapReduce運算。
Apache HBase: 是一個高可靠性、高效能、面向列、可伸縮的分散式儲存系統,利用HBase技術可在廉價PC Server上搭建起大規模結構化儲存叢集。
Apache Sqoop: 是一個用來將Hadoop和關係型資料庫中的資料相互轉移的工具,可以將一個關係型資料庫(MySQL ,Oracle ,Postgres等)中的資料導進到Hadoop的HDFS中,也可以將HDFS的資料導進到關係型資料庫中。
Apache Zookeeper: 是一個為分散式應用所設計的分佈的、開源的協調服務,它主要是用來解決分散式應用中經常遇到的一些資料管理問題,簡化分散式應用協調及其管理的難度,提供高效能的分散式服務
Apache Mahout:是基於Hadoop的機器學習和資料探勘的一個分散式框架。Mahout用MapReduce實現了部分資料探勘演算法,解決了並行挖掘的問題。
Apache Cassandra:是一套開源分散式NoSQL資料庫系統。它最初由Facebook開發,用於儲存簡單格式資料,集Google BigTable的資料模型與Amazon Dynamo的完全分散式的架構於一身
Apache Avro: 是一個資料序列化系統,設計用於支援資料密集型,大批量資料交換的應用。Avro是新的資料序列化格式與傳輸工具,將逐步取代Hadoop原有的IPC機制
Apache Ambari: 是一種基於Web的工具,支援Hadoop叢集的供應、管理和監控。
Apache Chukwa: 是一個開源的用於監控大型分散式系統的資料收集系統,它可以將各種各樣型別的資料收整合適合 Hadoop 處理的檔案儲存在 HDFS 中供 Hadoop 進行各種 MapReduce 操作。
Apache Hama: 是一個基於HDFS的BSP(Bulk Synchronous Parallel)平行計算框架, Hama可用於包括圖、矩陣和網路演算法在內的大規模、大資料計算。
Apache Flume: 是一個分佈的、可靠的、高可用的海量日誌聚合的系統,可用於日誌資料收集,日誌資料處理,日誌資料傳輸。
Apache Giraph: 是一個可伸縮的分散式迭代圖處理系統, 基於Hadoop平臺,靈感來自 BSP (bulk synchronous parallel) 和 Google 的 Pregel。
Apache Oozie: 是一個工作流引擎伺服器, 用於管理和協調執行在Hadoop平臺上(HDFS、Pig和MapReduce)的任務。
Apache Crunch: 是基於Google的FlumeJava庫編寫的Java庫,用於建立MapReduce程式。與Hive,Pig類似,Crunch提供了用於實現如連線資料、執行聚合和排序記錄等常見任務的模式庫
Apache Whirr: 是一套執行於雲服務的類庫(包括Hadoop),可提供高度的互補性。Whirr學支援Amazon EC2和Rackspace的服務。
Apache Bigtop: 是一個對Hadoop及其周邊生態進行打包,分發和測試的工具。
Apache HCatalog: 是基於Hadoop的資料表和儲存管理,實現中央的後設資料和模式管理,跨越Hadoop和RDBMS,利用Pig和Hive提供關係檢視。
Cloudera Hue: 是一個基於WEB的監控和管理系統,實現對HDFS,MapReduce/YARN, HBase, Hive, Pig的web化操作和管理。
簡單產品介紹:
Apache Hadoop: 是Apache開源組織的一個分散式計算開源框架,提供了一個分散式檔案系統子專案(HDFS)和支援MapReduce分散式計算的軟體架構。
Apache Hive: 是基於Hadoop的一個資料倉儲工具,可以將結構化的資料檔案對映為一張資料庫表,通過類SQL語句快速實現簡單的MapReduce統計,不必開發專門的MapReduce應用,十分適合資料倉儲的統計分析。
Apache Pig: 是一個基於Hadoop的大規模資料分析工具,它提供的SQL-LIKE語言叫Pig Latin,該語言的編譯器會把類SQL的資料分析請求轉換為一系列經過優化處理的MapReduce運算。
Apache HBase: 是一個高可靠性、高效能、面向列、可伸縮的分散式儲存系統,利用HBase技術可在廉價PC Server上搭建起大規模結構化儲存叢集。
Apache Sqoop: 是一個用來將Hadoop和關係型資料庫中的資料相互轉移的工具,可以將一個關係型資料庫(MySQL ,Oracle ,Postgres等)中的資料導進到Hadoop的HDFS中,也可以將HDFS的資料導進到關係型資料庫中。
Apache Zookeeper: 是一個為分散式應用所設計的分佈的、開源的協調服務,它主要是用來解決分散式應用中經常遇到的一些資料管理問題,簡化分散式應用協調及其管理的難度,提供高效能的分散式服務
Apache Mahout:是基於Hadoop的機器學習和資料探勘的一個分散式框架。Mahout用MapReduce實現了部分資料探勘演算法,解決了並行挖掘的問題。
Apache Cassandra:是一套開源分散式NoSQL資料庫系統。它最初由Facebook開發,用於儲存簡單格式資料,集Google BigTable的資料模型與Amazon Dynamo的完全分散式的架構於一身
Apache Avro: 是一個資料序列化系統,設計用於支援資料密集型,大批量資料交換的應用。Avro是新的資料序列化格式與傳輸工具,將逐步取代Hadoop原有的IPC機制
Apache Ambari: 是一種基於Web的工具,支援Hadoop叢集的供應、管理和監控。
Apache Chukwa: 是一個開源的用於監控大型分散式系統的資料收集系統,它可以將各種各樣型別的資料收整合適合 Hadoop 處理的檔案儲存在 HDFS 中供 Hadoop 進行各種 MapReduce 操作。
Apache Hama: 是一個基於HDFS的BSP(Bulk Synchronous Parallel)平行計算框架, Hama可用於包括圖、矩陣和網路演算法在內的大規模、大資料計算。
Apache Flume: 是一個分佈的、可靠的、高可用的海量日誌聚合的系統,可用於日誌資料收集,日誌資料處理,日誌資料傳輸。
Apache Giraph: 是一個可伸縮的分散式迭代圖處理系統, 基於Hadoop平臺,靈感來自 BSP (bulk synchronous parallel) 和 Google 的 Pregel。
Apache Oozie: 是一個工作流引擎伺服器, 用於管理和協調執行在Hadoop平臺上(HDFS、Pig和MapReduce)的任務。
Apache Crunch: 是基於Google的FlumeJava庫編寫的Java庫,用於建立MapReduce程式。與Hive,Pig類似,Crunch提供了用於實現如連線資料、執行聚合和排序記錄等常見任務的模式庫
Apache Whirr: 是一套執行於雲服務的類庫(包括Hadoop),可提供高度的互補性。Whirr學支援Amazon EC2和Rackspace的服務。
Apache Bigtop: 是一個對Hadoop及其周邊生態進行打包,分發和測試的工具。
Apache HCatalog: 是基於Hadoop的資料表和儲存管理,實現中央的後設資料和模式管理,跨越Hadoop和RDBMS,利用Pig和Hive提供關係檢視。
Cloudera Hue: 是一個基於WEB的監控和管理系統,實現對HDFS,MapReduce/YARN, HBase, Hive, Pig的web化操作和管理。
來自 “ ITPUB部落格 ” ,連結:http://blog.itpub.net/15498/viewspace-2134562/,如需轉載,請註明出處,否則將追究法律責任。
相關文章
- 大資料hadoop入門之hadoop家族產品詳解大資料Hadoop
- CAD夢想畫圖產品簡介
- 表格識別產品介紹
- 2019 年 SpreadJS產品路線圖(Roadmap)JS
- Flutter 2022 產品路線圖釋出Flutter
- 談產品經理入門和學習路徑
- 主要門戶產品簡介
- 雲端儲存產品介紹
- 產品學習之路
- Flutter 2019 產品路線圖正式公佈Flutter
- 集智學園知識星空——產品介紹篇
- AI產品經理的進階路線圖AI
- 文通產品及解決方案介紹
- 上門家政小程式產品功能介紹
- 水面蒸發感測器產品介紹
- 英特爾公佈全新至強產品路線圖
- 產品路線圖要避免的10個錯誤 - roman
- 【產品經理入門記】產品經理在早期如何快速學習?
- 產品經理的私房菜 - 騰訊產品模型 - 學習能力篇模型
- 元學習簡單介紹
- 產品經理如何做好產品和需求管理
- 簡單介紹網路(伺服器)線路伺服器
- 產品型公司的“偽產品”?
- 主流雲端計算廠商產品服務介紹
- STM32F446高效能MCU產品介紹
- 海康安防產品-[監控]影片監控原理介紹
- 資料安全產品之堡壘機詳細介紹
- 實時計算 Flink> 產品簡介——最新動態
- .net core 和 WPF 開發升訊威線上客服與營銷系統:背景和產品介紹
- 履約產品:產品體系&履約監控產品搭建
- 簡單的圖神經網路介紹神經網路
- Windows10和Spartan瀏覽器 產品與技術特性簡介Windows瀏覽器
- 「轉」產品助理、產品經理、產品負責人、產品總監有什麼區別?
- 長達一年的產品路線圖是一種幻想 - Rogers
- SAP CRM產品主資料ID的生成邏輯介紹
- 佩京科技VR/AR產品介紹之安全教育篇VR
- 雲端全託管搜尋引擎Elasticsearch Service產品介紹Elasticsearch
- AI產品經理成長路AI
- 新產品如何推廣?推廣新產品的方法和技巧