-
好程序员大数据培训分享Hive的静态分区与动态分区
- 网站名称:好程序员大数据培训分享Hive的静态分区与动态分区
- 网站分类:技术文章
- 收录时间:2025-09-22 16:41
- 网站地址:
“好程序员大数据培训分享Hive的静态分区与动态分区” 网站介绍
好程序员大数据培训分享Hive的静态分区与动态分区:分区是hive存放数据的一种方式。将列值作为目录来存放数据,就是一个分区。这样查询时使用分区列进行过滤,只需根据列值直接扫描对应目录下的数据,不扫描其他不关心的分区,快速定位,提高查询效率。分动态和静态分区两种:
1. 静态分区:若分区的值是确定的,那么称为静态分区。新增分区或者是加载分区数据时,已经指定分区名。
create table if not exists day_part1(
uid int,
uname string
)
partitioned by(year int,month int)
row format delimited fields terminated by '\t';
##加载数据指定分区
load data local inpath '/root/Desktop/student.txt' into table day_part1
partition(year=2017,month=04);
##新增分区指定分区名
alter table day_part1 add partition(year=2017,month=1)
partition(year=2016,month=12);
2. 动态分区:分区的值是非确定的,由输入数据来确定
2.1 动态分区的相关属性:
hive.exec.dynamic.partition=true :是否允许动态分区
hive.exec.dynamic.partition.mode=strict :分区模式设置
strict:最少需要有一个是静态分区
nostrict:可以全部是动态分区
hive.exec.max.dynamic.partitions=1000 :允许动态分区的最大数量
hive.exec.max.dynamic.partitions.pernode =100
:单个节点上的mapper/reducer允许创建的最大分区
2.2 动态分区的操作
##创建临时表
create table if not exists tmp
(uid int,
commentid bigint,
recommentid bigint,
year int,
month int,
day int)
row format delimited fields terminated by '\t';
##加载数据
load data local inpath '/root/Desktop/comm' into table tmp;
##创建动态分区表
create table if not exists dyp1
(uid int,
commentid bigint,
recommentid bigint)
partitioned by(year int,month int,day int)
row format delimited fields terminated by '\t';
##严格模式
insert into table dyp1 partition(year=2016,month,day)
select uid,commentid,recommentid,month,day from tmp;
##非严格模式
##设置非严格模式动态分区
set
hive.exec.dynamic.partition.mode=nostrict;
##创建动态分区表
create table if not exists dyp2
(uid int,
commentid bigint,
recommentid bigint)
partitioned by(year int,month int,day int)
row format delimited fields terminated by '\t';
##为非严格模式动态分区加载数据
insert into table dyp2 partition(year,month,day)
select uid,commentid,recommentid,year,month,day from tmp;
3.分区注意细节
(1)、尽量不要用动态分区,因为动态分区的时候,将会为每一个分区分配reducer数量,当分区数量多的时候,reducer数量将会增加,对服务器是一种灾难。
(2)、动态分区和静态分区的区别,静态分区不管有没有数据都将会创建该分区,动态分区是有结果集将创建,否则不创建。
(3)、hive动态分区的严格模式和hive提供的hive.mapred.mode的严格模式。
hive提供我们一个严格模式:为了阻止用户不小心提交恶意hql
hive.mapred.mode=nostrict : strict
如果该模式值为strict,将会阻止以下三种查询:
(1)、对分区表查询,where中过滤字段不是分区字段。
(2)、笛卡尔积join查询,join查询语句,不带on条件或者where条件。
(3)、对order by查询,有order by的查询不带limit语句。
更多相关网站
- 在实际操作过程中如何避免出现SQL注入漏洞
- MyBatis-Plus码之重器 lambda 表达式使用指南,开发效率瞬间提升80%
- 第三篇|Spark SQL编程指南_spark sql语句
- hive相关概念详解--架构、读写文件机制、数据存储
- Mybatis入门看这一篇就够了_mybatis教程视频
- 在 MySQL 中使用 UUID 作为主键的存在问题及如何优化?
- 盘点JPA中的骚操作_jpa ql
- 大雨暴雨!考生注意,昆明将迎强降雨,最强时段在→
- 大数据Hadoop之——数据仓库Hive_hadoop数据仓库实战肖睿
- 福建新画卷,把福建成绩“画”给你看!
- hive无法insert数据_hive with as insert
- hive存储过程_hive存储过程setenv
- 大数据调度平台 Airflow(六):Airflow Operators 及案例
- 从0到1详解Apache Hive_apache-hive-2.1.1-bin.tar.gz
- 记一次生产环境jvm内存泄漏的排查
- 为什么很多人不愿意用hibernate了?
- 数仓|HQL隐藏错误的坑,你遇到过吗?
- 最近发表
- 标签列表
-
- mydisktest_v298 (35)
- sql 日期比较 (33)
- document.appendchild (35)
- 头像打包下载 (35)
- 梦幻诛仙表情包 (36)
- java面试宝典2019pdf (26)
- disk++ (30)
- 加密与解密第四版pdf (29)
- iteye (26)
- centos7.4下载 (32)
- intouch2014r2sp1永久授权 (33)
- jdk1.8.0_191下载 (27)
- axure9注册码 (30)
- 兔兔工程量计算软件下载 (27)
- ccproxy破解版 (31)
- aida64模板 (28)
- engine=innodb (33)
- shiro jwt (28)
- segoe ui是什么字体 (27)
- head first java电子版 (32)
- clickhouse中文文档 (28)
- jdk-8u181-linux-x64.tar.gz (32)
- 计算机网络自顶向下pdf (34)
- -dfile.encoding=utf-8 (33)
- jdk1.9下载 (32)