京公网安备 11010802034615号
经营许可证编号:京B2-20210330
作者:刘早起
来源:早起Python
大家好,这个国庆,你出去旅游了吗?每次假期后网友总爱去微博、知乎吐槽国庆旅游的坑爹景点,相关话题也频上热榜,在国庆期间也有相关文章[1]通过整理对应话题统计出最坑爹城市前五名分别为杭州、西安、厦门、北京、南京,而最坑爹景点则有西湖、兵马俑、鼓浪屿、故宫、夫子庙、黄鹤楼等[2]。
本文通过Python爬取旅游网站评论数据,分析这些城市和景点在国庆期间到底表现如何,是否真的像网友吐槽的那样坑爹。
01、数据来源与说明
本文使用的数据均来源于携程旅行官网对应景点评论,采集时间段为2020-09-30至2020-10-08。因其所有数据均来自于具体订单完成后评价,使用该的数据相比社交平台讨论数据而言将更加真实。下面将以故宫为例简单说明如何使用Python爬取数据,首先打开对应页面
https://you.ctrip.com/sight/beijing1/229.html
如上图所示,按下F12之后在评论区域点击最新即可找到存储打分、评价等数据的包,之后只需查看headers等相关信息,使用Requests构造请求即可取下数据,要注意的是该请求为post形式,所以需要传入对应参数才可以,此处不做过多讲解。
但由于我们只需要国庆期间的数据,最多的景点也不过100多页评论,所以另外一种方法是使用Selenium模拟浏览器操作也可以轻松成功拿下数据,之后使用pandas清洗即可。
最终本文选取的字段为:
02、不同城市旅游热度分析
本节我们将国庆期间各省份排名前三的景点评论数量进行汇总,整理后数据的视为该省份的旅游热度,计算得到不同省份旅游热度,最热门的城市为北京,其次是江浙沪以及湖北、四川、广东、福建等省份。而这个热度排名也基本与前文提到的社交平台吐槽排名符合。
现在我们对网友评出最坑爹城市前五名的杭州、西安、厦门、北京、南京的旅游景点热度单独分析。
从评论数量来看,热度排行前列的景点基本在北京和西安,最受欢迎的景点为西安的兵马俑,而备受吐槽的西湖、鼓浪屿、夫子庙等地在网站并没有太多的评论,可能与这些景点无需门票而无法产生订单有关。
03、“坑爹”景点分析
——好评度分析
本节我们进一步对上述五个城市的景点进一步分析其坑爹程度,我们对不同景点的网友好评度进行分析。
根据该网站数据,兵马俑和故宫分别斩获近9成网友的好评,而西湖和鼓浪屿的好评度仅在80%左右,黄鹤楼也有近85%的网友给出好评,当然这里的好评仅为网友给出的总分,可以视为整体评价,接下来将对具体的评论内容进行分析。
——评论情感分析
现在我们将每一个评论的具体内容进行情感分析。
可以看到,虽然上一节的好评度分析中,每个景点都有超过8成的网友给出好评,但是从评价内容来看,给出正向的评价网友除了故宫之外,均不足8成,而整体评价较好的兵马俑,却有24.79%的网友给出负向评价。
——其他指标分析
在我们采集到的数据字段中除了总得分(好评)之外,还有景色、趣味、性价比三个指标,现在看一下不同总分的各项指标得分对比
不难看出在高分评价中,性价比指标的得分高于趣味性,而低分评价中则恰好相反,说明性价比不足更容易更容易让网友反感。研究该部分评论发现大多是在吐槽景区的(额外)消费高。
04、“坑爹”景点说什么
最后让我们来看看上述五个景点的词云分析,看看网友到底在吐槽什么。
北京—故宫
今天恰逢紫禁城600周年,故宫也有很多的特别展出,大多数网友都在赞叹故宫的宏伟磅礴,而由于疫情原因,故宫限流,也有小部分人在吐槽门票难抢。
厦门—鼓浪屿
下面是鼓浪屿的评论词云,除了景色不错之外,体验一般也很突出,其次就是上面说过的性价比不足,景点消费贵。
杭州—西湖
西湖词云同样是景色不错,但是不够好玩,性价比不足,其次就是排队时间太久
其实西湖景区并不大,国庆期间难免会人人人人人
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
主讲人简介 张冲,海归统计学硕士,CDA 认证数据分析师,前云南白药集团资深数据分析师,自媒体 Python 讲师,全网课程播放量破 ...
2026-04-10在数据可视化与业务分析中,同比分析是衡量业务发展趋势、识别周期波动的核心手段,其核心逻辑是将当前周期数据与上年同期数据进 ...
2026-04-10在机器学习模型的落地应用中,预测精度并非衡量模型可靠性的唯一标准,不确定性分析同样不可或缺。尤其是在医疗诊断、自动驾驶、 ...
2026-04-10数据本身是沉默的,唯有通过有效的呈现方式,才能让其背后的规律、趋势与价值被看见、被理解、被运用。统计制图(数据可视化)作 ...
2026-04-10在全球化深度发展的今天,跨文化传播已成为连接不同文明、促进多元共生的核心纽带,其研究核心围绕“信息传递、文化解读、意义建 ...
2026-04-09在数据可视化领域,折线图是展示时序数据、趋势变化的核心图表类型之一,其简洁的线条的能够清晰呈现数据的起伏规律。Python ECh ...
2026-04-09在数据驱动的时代,数据分析早已不是“凭经验、靠感觉”的零散操作,而是一套具备固定逻辑、标准化流程的系统方法——这就是数据 ...
2026-04-09长短期记忆网络(LSTM)作为循环神经网络(RNN)的重要改进模型,凭借其独特的门控机制(遗忘门、输入门、输出门),有效解决了 ...
2026-04-08在数据分析全流程中,数据质量是决定分析结论可靠性的核心前提,而异常值作为数据集中的“异类”,往往会干扰统计检验、模型训练 ...
2026-04-08在数字经济飞速发展的今天,数据已渗透到各行各业的核心场景,成为解读趋势、优化决策、创造价值的核心载体。而数据分析,作为挖 ...
2026-04-08在数据分析全流程中,数据处理是基础,图形可视化是核心呈现手段——前者负责将杂乱无章的原始数据转化为干净、规范、可分析的格 ...
2026-04-07在数据分析与统计推断中,p值是衡量假设检验结果显著性的核心指标,其本质是在原假设(通常为“无效应”“无差异”)成立的前提 ...
2026-04-07在数字经济深度渗透的今天,数据已成为企业生存发展的核心资产,企业的竞争本质已转变为数据利用能力的竞争。然而,大量来自生产 ...
2026-04-07Python凭借简洁的语法、丰富的生态库,成为算法开发、数据处理、机器学习等领域的首选语言。但受限于动态类型、解释性执行的特性 ...
2026-04-03在深度学习神经网络中,卷积操作是实现数据特征提取的核心引擎,更是让模型“看懂”数据、“解读”数据的关键所在。不同于传统机 ...
2026-04-03当数字化转型从企业的“战略口号”落地为“生存之战”,越来越多的企业意识到,转型的核心并非技术的堆砌,而是数据价值的深度挖 ...
2026-04-03在日常办公数据分析中,数据透视表凭借高效的汇总、分组功能,成为Excel、WPS等办公软件中最常用的数据分析工具之一。其中,“计 ...
2026-04-02在数字化交互的全场景中,用户的每一次操作都在生成动态的行为轨迹——电商用户的“浏览商品→点击详情→加入购物车”,内容APP ...
2026-04-02在数字化转型深度推进的今天,企业数据已成为驱动业务增长、构建核心竞争力的战略资产,而数据安全则是守护这份资产的“生命线” ...
2026-04-02在数据驱动决策的浪潮中,数据挖掘与数据分析是两个高频出现且极易被混淆的概念。有人将二者等同看待,认为“做数据分析就是做数 ...
2026-04-01