[Hive]建表例項與引數解釋——自定義表的儲存格式(textfile、sequencefile、refile)

TOMOCAT發表於2018-08-14

一、建表例項

create external table `beatles_bi_dm.driver_butie_order_info`(
    `drive_license_number`    bigint   COMMENT '1',
    `drive_num`               bigint   COMMENT '2',
    `order_num`               bigint   COMMENT '3',
    `coupon_num`              bigint   COMMENT '4',
    `passenger_num`           bigint   COMMENT '5',
    `total_coupon_amount`     bigint   COMMENT '6'
    )
COMMENT '表描述'
PARTITIONED BY (
    `event_day` string)
ROW FORMAT DELIMITED FIELDS TERMINATED BY '\t'
STORED AS orcfile
TBLPROPERTIES('creater'='me') --按鍵值對的格式為表增加額外的文件說明

二、表的儲存格式

1、textfile

預設格式;

儲存方式為行儲存;

磁碟開銷大 資料解析開銷大;

但使用這種方式,hive不會對資料進行切分,從而無法對資料進行並行操作。

2、sequencefile

二進位制檔案,以<key,value>的形式序列化到檔案中;
儲存方式:行儲存;
可分割 壓縮;
一般選擇block壓縮;
優勢是檔案和Hadoop api中的mapfile是相互相容的

3、refile

儲存方式:資料按行分塊 每塊按照列儲存;
壓縮快 快速列存取;
讀記錄儘量涉及到的block最少;
讀取需要的列只需要讀取每個row group 的頭部定義;
讀取全量資料的操作 效能可能比sequencefile沒有明顯的優勢,

4、orcfile

儲存方式:資料按行分塊 每塊按照列儲存;

壓縮快 快速列存取;

效率比rcfile高,是rcfile的改良版本。

 

相關文章