MySQL综合练习
数据准备数据表介绍123456789101112131415--1.学生表Student(SId,Sname,Sage,Ssex)--SId 学生编号,Sname 学生姓名,Sage 出生年月,Ssex 学生性别 --2.课程表Course(CId,Cname,TId)--CId 课程编号,Cname 课程名称,TId 教师编号 --3.教师表Teacher(TId,Tname)--TId 教师编号,Tname 教师姓名 --4.成绩表SC(SId,CId,score)--SId 学生编号,CId 课程编号,score 分数
数据表创建1234567891011121314151617181920212223242526272829303132333435363738394041424344-- 学生表 Studentcreate table Student(SId varchar(10),Sname varchar(10),Sage datetime,Ssex varchar(10));insert into Student values('01' , ...
数仓项目需求及技术架构
Interview Summary1234567891011121314151617181920212223242526272829303132333435363738394041424344454647484950515253545556575859606162636465666768697071727374757677787980818283841,请简述你常用的Linux命令. # df -h, free... 2. 大数据的特点是什么? # 5V(大多值快信) 3. namenode是如何管理datanode的? # 心跳机制, 副本机制, 负载均衡. 4. HDFS的默认副本数是3, 那么这3个副本是如何存储的呢?5. Hive的三种部署方式, 内嵌模式, 本地模式, 远程模式的区别是什么? # 需不需要手动开启metastore(元数据服务) # 是否可以使用第三方的数据库 # 是否可以实现共享... 内嵌模式: 不需要, 不能, 不能. 本地模式: 不需要, 能, 能(metastore服务不能 ...
HDFS及上手Hive
HDFS的常见shell命令Summary(总结)第一点:书写HDFS的shell命令大致就是在shell的基础上在开头添加Hadoop fs 或者hdfs dfs这种,并且在命令起始添加 - 。
第二点:基础命令中只有put,get命令,还有appendToFile命令是Linux路径和HDFS路径进行交互的。
12345678910111213141516171819202122232425262728293031323334353637383940# HDFS的Shell命令指的是, 在CRT 或者 Tabby等工具中, 写Shell命令, 操作HDFS文件系统.# 格式, 如下两种方式, 除了通用性以外, 其它没区别. hadoop fs -命令名 [选项] [参数] # 更通用, 可以操作多种文件系统.hdfs dfs -命令名 [选项] [参数] # 只能操作HDFS文件系统.# ls命令, 查看指定目录的(子级)信息的hadoop fs -ls / # 只能查看单级hdfs dsf -ls / # 只能查看单级hadoop fs -lsr / # 查看目录的信息 ...
Linux进阶(Shell编程)
Summary:总结
echo输出的三种情况:(这几种情况固然很难区分,那么就每种情况记忆1个好了!标红的是)
和输出变量相关:(name=zhangsan) (大-括号)
echo $name ==>输出name变量的值
echo ${name}123 ==> 输出zhangsan123 (细节:如果只有变量名,大括号可以不写)
和数学运算相关(中-括号)
echo $((5+5)) ==>输出10
echo $[5+5]
echo `expr 5+5’
和执行Linux命令相关(小-括号)
echo `linux命令` ==> echo `pwd`
echo (Linux命令) ==> echo (ll -h)
开始前的准备修改Linux中默认制表符
linux中默认制表符即Tab键为8个空格,在shell编程中略有不便
12vim /etc/vim/vimrc # 编辑系 ...
Hadoop生态圈集群搭建
Linux搭建Hadoop集群环境
资料是我在网络上收集的,如有侵权请告知,我会第一时间删除
详细资料移步:阿里云盘
前期准备工作
友情提醒: 提前安装好vmware软件,准备好连接虚拟机的客户端
一. 基础环境1.配置ip地址1[root@node1 /]# vim /etc/sysconfig/network-scripts/ifcfg-ens33
123456789101112131415161718192021222324TYPE="Ethernet"PROXY_METHOD="none"BROWSER_ONLY="no"# 1.修改staticBOOTPROTO="static"DEFROUTE="yes"IPV4_FAILURE_FATAL="no"IPV6INIT="yes"IPV6_AUTOCONF="yes"IPV6_DEFROUTE="yes"IPV6_FAILURE_FATAL ...
【Interview】ZooKeeper原理
以我一己之见,全篇将Zookeeper最重要的东西就是:
Watch监听机制(如何实现主备切换,即热备知道老大宕机了)。
Leader选举机制(过半原则:Paxos算法)。
SSH免密登陆原理(非对称加密-公钥加密,私钥解密)
Zookeeper简介及用途ZooKeeper,它是一个开放源码的分布式协调服务,它是一个集群的管理者,它将简单易用的接口提供给用户。
可以基于Zookeeper 实现诸如数据发布/订阅、负载均衡、命名服务、分布式协调/通知、集群管理、Master 选举、分布式锁和分布式队列等功能。Zookeeper的用途:命名服务、配置管理、集群管理、分布式锁、队列管理
概述ZooKeeper概念: Zookeeper是一个分布式协调服务的开源框架。本质上是一个分布式的小文件存储系统
ZooKeeper作用: 主要用来解决分布式集群中应用系统的一致性问题。
ZooKeeper结构: 采用树形层次结构,ZooKeeper树中的每个节点被称为—Znode。且树中的每个节点可以拥有子节点
特性
全局数据一致:集群中每个服务器保存一份相同的数据副本,client无论连接 ...
【Interview】Hive原理及调优
关于Hive的参数配置:Hive的参数配置有 3 种配置方式:方式1: 在hive的配置文件中直接进行修改.方式2: 在开启Hive服务的时候, 设置参数 nohup hive --service hiveserver2 --hiveconf 参数名=参数值 &方式3: 通过 set方式进行修改. set mapreduce.job.reduces = 3; -- 分桶查询的时候用的.
上述三种参数设置的优先级及作用范围从高到低分别是:
配置文件(所有客户端有效) > hiveconf, hive服务(本服务运行期间, 所有客户端有效) > set方式(本次会话有效)
优先级从高到低分别是:
set方式 > hive服务方式 > 配置文件
Hive调优方案介绍hive调优四句话
更改硬件.
增大或者开启某些设置. (Fetch抓取, 开启负载均衡(解决group by数据倾斜), 动态分区数, join优化, 开启严格模式(禁用低效SQL)
减小或者关闭某些设置. (推测执行, 严格模式(动 ...
【Interview】MapReduce和Yarn原理
MapReduce原理问题1. 什么是计算, 什么是分布式计算?答案: 计算指的是从海量数据中提取出有效的价值信息的过程(广义上解释), 狭义上指的是 1 + 1 = 2 即: 数学运算. 分布式计算指的是 多台机器协调, 共同完成同1个计算任务.
问题2: 分布式计算的两种模式?答案: 分散汇总模式: 大家各自做各自的, 最后交由主节点汇总. 例如: MR程序就属于这种. 中心化模式, 步骤执行: 由老大(主节点)统筹安排各机器的计算任务, 第一步, 第二步等…, 最后将结果交由主节点汇总.
问题3: 那么是不是所有的场景都适合用分而治之呢?
我们知道MR是一种分布式计算架构, 采用的是 分而治之 的思想,
答案: 不一定, 看需求, 如果把大任务拆分成n个小任务之后, 小任务之间的依赖度比较高的情况下, 就不适合用分而治之思想. 例如: 求平均数.(1-7所有数的和,如1+2 交给一台机器,2+3交给一台机器,最后汇总求平均会变成4.3333,而1+2+…+7=28/7=4 ...
【Interview】Hadoop相关
Hadoop相关问题1: 为什么要用分布式?答案: 解决单机存储容量有限的问题, 可以通过分布式解决(即: 横向扩展, 加机器).
问题2: HDFS是什么, 有几种角色, 各自作用是什么?答案: HDFS全称叫Hadoop Distributed FileSystem, 分布式文件存储系统, 采用分布式的方式来存储数据. HDFS是主从架构, 主要角色有3个: NameNode: 主节点管理整个HDFS集群,维护和管理元数据. SecondaryNameNode: 辅助节点,辅助namenode管理元数据的. DataNode: 从节点,负责数据的读写操作,负责存储具体的数据(Block块).
问题3: HDFS的默认副本是是几, 默认的块大小是多少?答案: 默认副本是是 3, 每个Block块的大小为: 128MB. 实际开发中, 副本数一般是2-5, 副本数越高带来的好处是容错率越高, 带来的弊端是磁盘的利用率降低. 块的大小 和 副本数都是可以设置的, 即: /export/server/hadoop/etc/hadoop ...
【Hive】窗口函数
窗口函数介绍:概述: 窗口函数指的是 over()函数, 它可以结合特定的函数一起使用, 完成不同的功能. 目的/作用: 窗口函数 = 给表新增一列, 至于新增的内容是什么, 取决于窗口函数和什么函数一起使用.
格式: 能和窗口函数一起使用的函数 over(partition by 分组字段 order by 排序字段 rows between 起始行 and 结束行) 能和窗口函数一起使用的函数解释:
聚合函数: count(), sum(), max(), min(), avg()排序函数: row_number(), rank(), dense_rank(), ntile()其它函数: lag(), lead(), first_value(), last_value()
这里要注意ntile函数ntiile( 3 )—>表示分成3份
细节: 1. 窗口函数相当于给表新增一列, 至于新增的内容是什么, 取决于窗口函数和什么函数一起使用.
2. 如果不写partit ...





