京公网安备 11010802034615号
经营许可证编号:京B2-20210330
Hadoop集群是由许多的节点服务器组成的,当我们启动hadoop集群时,hadoop的Namenode需要连接并且管理这些节点服务器(主要是DataNode)。
此时系统会要求用户输入密码,提示内容与上篇文章中的ssh连接localhost时的提示是一样的,这从侧面说明Hadoop的Namenode是通过ssh方式连接控制节点DataNode服务的。
如下图所示,hadoop使用ssh连接各个节点,ssh会对传输的数据进行加密,防止在数据传输过程中发生泄漏的问题。
为了让系统可以顺利的运行而不用一次一次的输入密码,我们需采用一种方法,将SSH设置为免密登录(免密登录并不是不需要密码就可以登录,只是换了一种身份认证方式而已)。
1、 SSH免密登录的原理
上篇文章中介绍过SSH的两种安全验证方式,其中第二种基于密钥的安全验证的过程如下:
A提供一对密钥(公钥和私钥),把公钥放在需要访问的服务器B上,如果A连接到SSH服务器B上,客户端A就会向服务器B发出请求,请求用密钥进行安全验证,服务器B收到请求之后,先在该服务器的主目录下寻找公钥,然后把它和发送过来的公钥进行比较。
如果两个密钥一致,服务器B就用公钥加密随机字符串,并把它发送给客户端A。客户端A收到加密随机字符串之后就可以用私钥解密再把它发给服务器端B。
服务端B进行比对如果比对结果正确则A加入服务器B的授权列表。基于这种方式,相对比较安全。其原理图如下所示:
2、Ubuntu中实现SSH免密登录的操作
打开终端(Ctrl+Alt+t),执行命令 cd .ssh进入用户主目录下的.ssh文件夹,如果没有该文件夹则手动创建:mkdir .ssh
可以执行ls命令查看.ssh文件目录下的文件
如上图所示,由于之前登录过localhost,所以此时.ssh文件夹下有known_hosts文件,手动创建.ssh文件夹的没有该文件。
创建一对公私钥,在.ssh文件夹下执行命令:ssh-keygen -t rsa ,生成过程会有停顿让你做选择,直接回车键按默认配置执行即可。
执行完成后公私钥文件就已经生成在当前目录下(.ssh文件夹下),通过执行ls命令查看当前文件下的文件如下图所示:
Id_rsa为私钥文件id_rsa.pub为公钥文件,known_hosts为登录过的设备记录。
将id_rsa.pub追加到需要免密登录的ssh服务器的许可文件中,在这里我们免密登录的是当前电脑即localhost,只需将文件id_rsa.pub内容追加到authorized_keys即可。执行命令:cat ./id_rsa.pub >> ./authorized_keys
此时执行命令ls查看当前目录下的文件变化如下图所示,增加了授权文件authorized_keys
免密登录的配置操作到此就完成了,我们可以通过执行ssh localhost命令测试一下,如下图所示没有输入密码即可成功登陆。
小伙伴们你成功了没?高兴之余不要忘记执行exit退出ssh登录,养成好习惯减少人为原因造成的失误。今天的内容就到这里喽,拜拜┏(^0^)┛。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
CDA数据分析师 出品 作者:李诗怡 一、数据分析四大思维 1. 对比思维:没有对比就没有分析 核心观点:单独一个数字没有意义,有 ...
2026-10-05Kimball 是方法,星型模型是它产出的形状。 很多人把"Kimball vs 星型模型"当成一道选择题——这本身就是个误会:Kimball 是动词 ...
2026-10-05写在开头 老板在微信上甩来一句: "帮我看下为什么销量跌了。" ” 你回工位,打开 SQL,开始写。查订单表、拉近三个月、按 ...
2026-10-03CDA数据分析师 出品 作者:李诗怡 1. 事实表 vs 维度表 对比维度 事实表 维度表 核心问题 记录“业务发生了什么事” 描述 ...
2026-10-02做数据聚合时,PySpark的groupBy()确实能完成统计,这也是它的本职工作。但它有一个根本性局限:每一组数据,最终只能返回一行 ...
2026-10-01热力地图是数据可视化中极具辨识度与实用性的空间分析图表,结合地理空间维度与数据密度特征,通过颜色深浅、色阶渐变直观展示数 ...
2026-09-30 很多数据分析师做过按月份的销售额趋势图,画过按天的流量折线图,但当被问到“时间序列和普通数据有什么本质区别”“季节性 ...
2026-09-30同样是“银行数据岗”,在国有大行总行数据中心、在一家城商行的零售部、在银行系金融科技子公司、在保险公司,工作内容、成长节 ...
2026-09-29在数据分析与统计学研究中,数据往往不是独立存在的,不同变量之间普遍存在相互关联、相互影响的关系。相关性统计分析是挖掘变量 ...
2026-09-29 导读:大多数人只把 dataclasses 当成偷懒工具,用来少写 __init__、__repr__ 这类魔法方法。但它的能力远不止于此。本文带 ...
2026-09-29 很多数据分析师能熟练地计算指标、搭建标签体系,但当被问到“画像到底在解决什么问题”“画像和标签是什么关系”“画像如何 ...
2026-09-29在MySQL数据库运维与业务开发中,行业普遍存在“数据达到千万级就必须分表”的说法。但在实际生产环境中,千万条数据并不是强制 ...
2026-09-28CDA数据分析师 出品 作者:李诗怡 1. 5W1H 分析法 定义:经典系统性思维框架,通过六个核心维度对问题进行全方位拆解与剖析,确 ...
2026-09-28 很多分析师在设计标签时思路清晰,但真到落地环节却面临“数据在手,不知如何转化为可用标签”的困境:或因加工方式选择不当 ...
2026-09-28CDA数据分析师 出品 作者:李诗怡 1. 用户标签体系 定义: 通过一系列高度精炼的特征标识,对用户属性、行为与偏好进行量化刻画 ...
2026-09-24Pandas是Python生态中用于表格数据处理的核心库,广泛应用于数据清洗、统计运算、报表输出、数据分析建模等场景。在处理极大数值 ...
2026-09-24随着数字经济快速发展,数据已成为核心生产要素,各行各业的业务沉淀、用户行为、设备运行、市场交易均产生海量数据。数据处理作 ...
2026-09-24 很多分析师每天和数据打交道,但当被问到“标签是什么”“标签和指标有什么区别”“标签体系如何设计”时,却常常答不上来。 ...
2026-09-24在时序数据分析中,大部分业务数据并非持续平稳变化,而是会在某些时间节点出现突然抬升、断崖下跌、趋势反转、波动异变等现象, ...
2026-09-23在统计学与数据分析中,研究多组数据差异最常用的方法为单因素方差分析与事后多重比较。很多数据分析初学者容易混淆两者功能,认 ...
2026-09-23