Spark-stream基礎---sparkStreaming和Kafka整合wordCount單詞計數

一行資料發表於2019-04-12

原文網址 : https://blog.csdn.net/qq_42554007/article/details/89242155

專案

sprak-stream與kafak整合wordCount
在IDEA上接收kafka傳來的資料，並進行單詞統計

linux端開啟kafka

//1.先開啟zookeeper（3臺）
zkServer.sh start 
//2.在開啟kafka(3臺)
 bin/kafka-server-start.sh config/server.properties &
//3.建立生產者
bin/kafka-console-producer.sh --broker-list hou-01:9092 --topic wc
//4.控制檯輸入任意單詞

IDEA新增依賴

    <dependency>
        <groupId>org.apache.spark</groupId>
        <artifactId>spark-streaming-kafka-0-8_2.11</artifactId>
        <version>${spark.version}</version>
    </dependency>

1.0版本單詞計數


package day08
import org.apache.spark.SparkConf
import org.apache.spark.streaming.dstream.{DStream, ReceiverInputDStream}
import org.apache.spark.streaming.kafka.KafkaUtils
import org.apache.spark.streaming.{Milliseconds, StreamingContext}

/*
需求：kafka消費資料到sparkStreaming計算
 */
object KafkaWordCount {
  def main(args: Array[String]): Unit = {
    //1.建立StreamingContext
    val conf: SparkConf = new SparkConf().setAppName("kafkaWordCount").setMaster("local[2]")
    val ssc: StreamingContext = new StreamingContext(conf,Milliseconds(2000))


    //2.接入kafka資料來源(如何訪問kafka叢集？zookeeper)
    val zkQuorm: String = "192.168.64.111,192.168.64.112,192.168.64.113"
    //訪問組
    val groupID = "g1"
    //訪問主題
    val topic: Map[String, Int] = Map[String,Int]("wc"->1)
    //建立Dstream
    val kafkaStream: ReceiverInputDStream[(String, String)] = KafkaUtils
      .createStream(ssc,zkQuorm,groupID,topic)

    //3.處理資料
    val data: DStream[String] = kafkaStream.map(_._2)

    //4.啟動streaming程式
    val r: DStream[(String, Int)] = data.flatMap(_.split(" ")).map((_,1)).reduceByKey(_+_)
    r.print()
    ssc.start()

    //5.關閉資源
    ssc.awaitTermination()

  }
}

結果

在這裡插入圖片描述

2.0版本單詞計數

將歷史記錄儲存下來，顯示出來，主要使用dataFunc

package day08

import org.apache.spark.{HashPartitioner, SparkConf}
import org.apache.spark.streaming.dstream.{DStream, ReceiverInputDStream}
import org.apache.spark.streaming.kafka.KafkaUtils
import org.apache.spark.streaming.{Milliseconds, StreamingContext}

object StatusKafkaWordCount {
  //保持歷史狀態 wc 單詞，次數 聚合的key
  //第一個型別：單詞，第二個型別：在每一個分割槽中出現的次數累加的結果
  //第三個型別：是以前的結果
  val updateFunc = (iter:Iterator[(String,Seq[Int],Option[Int])]) => {
    //總的次數= 當前出現的次數 + 以前返回的結果
    iter.map(t => (t._1, t._2.sum + t._3.getOrElse(0)))
  }

  def main(args: Array[String]): Unit = {

    //1.建立程式入口
    val conf: SparkConf = new SparkConf().setAppName("StateKafkaWC").setMaster("local[2]")
    val ssc: StreamingContext = new StreamingContext(conf,Milliseconds(2000))

    //2.需要累加歷史資料 checkpoints
    ssc.checkpoint("hdfs://192.168.64.111:9000/ck")

    //3.接入kafka資料來源
    val zkQuorm: String = "192.168.64.111,192.168.64.112,192.168.64.113"
    //訪問組
    val groupID = "g1"
    //訪問主題
    val topic: Map[String, Int] = Map[String,Int]("wc"->1)
    //建立Dstream
    val kafkaStream: ReceiverInputDStream[(String, String)] = KafkaUtils
      .createStream(ssc,zkQuorm,groupID,topic)

    //4.處理資料
    val data: DStream[String] = kafkaStream.map(_._2)

    //5.加入歷史資料計算

    val r: DStream[(String, Int)] = data.flatMap(_.split(" ")).map((_, 1))
      //引數1：自定義業務函式 引數2：分割槽器設定 引數3：是否使用
      .updateStateByKey(updateFunc, new HashPartitioner(ssc.sparkContext.defaultParallelism), true)

    //6.列印
    r.print()
    //7.啟動程式
    ssc.start()
    //8.關閉資源
    ssc.awaitTermination()

  }
}

結果

在這裡插入圖片描述

sparkStreaming 之 kafka源
2020-11-07
SparkKafka
資料採集元件：Flume基礎用法和Kafka整合
2021-03-05
元件Kafka
圖解SparkStreaming與Kafka的整合，這些細節大家要注意！
2021-01-05
圖解SparkKafka
Kafka結合SparkStreaming開發
2021-09-09
KafkaSpark
Flink從Kafka取數WordCount後TableApi寫入ES
2021-06-20
KafkaAPI
Java、Scala、Python ☞ 本地WordCount詞頻統計對比
2018-09-06
JavaPython
使用map：單詞計數程式
2020-10-27
C++ 統計單詞數
2024-09-10
C++
SpringBoot整合Kafka和Storm
2018-05-10
Spring BootKafkaORM
kafka基礎原理
2022-05-06
Kafka
【Spark篇】---SparkStreaming+Kafka的兩種模式receiver模式和Direct模式
2018-03-06
SparkKafka模式
基礎程式設計題(PTA) 7-26 單詞長度 (15分)
2020-11-17
程式設計
Kafka基礎認識
2018-05-03
Kafka
kafka及redis基礎
2020-09-27
KafkaRedis
kafka基礎學習
2024-10-11
Kafka
Kafka 基礎知識
2024-06-09
Kafka
Kafka基礎入門
2021-09-21
Kafka
詞法分析基礎
2024-04-07
詞法分析
Kafka基礎：表和流的區別 - Edward Loveall
2019-08-27
Kafka
Storm系列(六)storm和kafka整合
2019-01-08
ORMKafka
Kafka基礎入門篇
2021-10-09
Kafka
kafka基礎知識梳理
2021-06-22
Kafka
nlp基礎之詞、子詞或字元
2024-08-09
字元
Flink 熱詞統計(1): 基礎功能實現
2019-05-01
統計檔案中出現的單詞次數
2018-03-29
Kafka原理分析之基礎篇
2021-05-04
Kafka
數理統計基礎統計量
2020-11-01
計算機基礎:離散數學和完備性
2020-11-25
計算機
超越單詞計數：上下文位置編碼CoPE
2024-05-30
Go基礎系列：常量和變數
2018-10-27
Go變數
.net core整合JWT（基礎）
2020-11-14
JWT
面試-JS基礎知識-變數型別和計算
2024-09-10
面試JS變數型別
WordCount
2018-09-23
表單運用和基礎練習
2020-11-20
MapReduce 程式設計模型 & WordCount 示例
2019-08-01
程式設計模型
ElasticSearch-IK分詞器和整合使用
2021-01-26
Elasticsearch分詞
為了收集和整理程式設計的常用單詞，我寫了個背單詞應用
2019-10-13
程式設計
Storm與kafka整合
2018-06-12
ORMKafka

Spark-stream基礎---sparkStreaming和Kafka整合wordCount單詞計數

專案

linux端開啟kafka

IDEA新增依賴

1.0版本單詞計數

結果

2.0版本單詞計數

將歷史記錄儲存下來，顯示出來，主要使用dataFunc

結果

相關文章