
一、选题背景与研究意义随着数字经济与文旅产业的深度融合在线旅游平台OTA已成为游客获取旅游信息、分享旅行体验的核心渠道。携程作为国内领先的在线旅游服务商其平台上积累了海量的景点点评数据。这些评论文本由游客自发撰写真实反映了游客对景点服务质量、景观特色、基础设施等多维度的主观感知蕴含着极高的商业价值与学术研究价值。然而面对日均数十万条、累计数亿条的评论文本数据传统的人工统计与抽样分析方法已难以应对数据规模与处理时效的双重挑战。大数据技术的成熟为解决这一问题提供了可行路径通过Hadoop分布式存储架构实现海量评论文本的可靠存储借助Spark内存计算框架实现高频词统计、情感分类与主题模型的并行化处理利用Python生态下的NLP工具链完成文本分词与语义分析最终通过可视化大屏将分析结果以直观的图表形式呈现可为景区运营方与旅游管理部门提供数据驱动的决策参考。本研究以携程平台热门景点的公开点评数据为研究对象构建数据采集—分布式存储—并行计算—情感分析—主题挖掘—可视化展示的完整技术链路探索大数据技术在旅游评论文本分析领域的应用范式。二、数据分析与数据来源2.1 数据来源溯源本研究的原始数据来源于携程旅行网www.ctrip.com公开可访问的景点点评页面。数据采集时间窗口拟设定为2023年1月至2026年6月覆盖近三年半的评论周期确保数据的时效性与样本规模的充足性。数据采集范围聚焦于携程平台热门景点排行榜中排名前50的5A级及4A级景区涵盖自然景观、人文历史、主题乐园、城市公园四大类型兼顾地域分布的代表性。具体数据字段包括景点名称、景点等级、所在城市、评论用户ID脱敏处理、评论发布时间、评论正文、用户评分1—5分、评论点赞数、评论回复数等。预期采集评论总量约15万至20万条单景点平均评论量约3000至4000条满足大数据分布式处理的样本规模要求。2.2 数据采集与预处理数据采集采用PythonScrapy框架实现分布式爬虫。采集过程严格遵守携程网站的robots协议与访问频率限制采用随机请求头轮换、代理IP池与请求间隔随机化策略避免对目标服务器造成压力。采集到的原始评论文本以JSON格式存入Hadoop分布式文件系统HDFS。原始评论文本存在大量噪声数据需要经过系统性的预处理才能进入分析环节。预处理流程包括第一步数据清洗去除空评论、重复评论、广告推广类评论及长度过短的无意义评论清洗后有效评论留存率约为85%—90%第二步文本分词采用jieba分词工具结合自定义旅游领域词典进行中文分词补充门票“排队”“观光车”“栈道”索道等旅游场景专有词汇第三步词性标注利用哈工大LTP工具对分词结果进行词性标注重点提取名词、形容词、动词三类实词第四步文本向量化采用TF-IDF算法将评论文本转换为数值向量第五步数据质量校验对清洗后的数据集进行统计检查确保数据集的完整性与代表性。三、国内外研究现状3.1 国外研究现状国外学者在旅游评论文本挖掘与情感分析领域起步较早已形成较为成熟的研究体系。Zhang等2022以马蜂窝和携程平台上太平洋岛国的11204条中国游客评论为研究对象构建了专属的中文旅游情感词典研究发现中国游客对太平洋岛国的情感整体偏正面但对交通、签证、费用等实用层面的关注度更高。该研究验证了跨文化语境下旅游情感词典构建的必要性在前人基于通用情感词典的研究基础上提出了面向特定区域的领域词典构建方法。Paolanti等2021以意大利奇伦托地区的旅游推文为研究对象构建了结合地理位置信息与深度神经网络的情感分析框架采用词级与字符级两类深度神经网络模型对15000条标注推文进行训练实现了情感倾向与地理空间分布的关联分析。该研究将时空维度引入旅游情感分析在前人纯文本情感分析的基础上进一步融合了地理空间维度实现了情感分布的空间化表达。Suanpang等2022以Kaggle平台上的10000条TripAdvisor泰国旅游评论为数据集采用Python的TextBlob工具包与朴素贝叶斯模型进行情感分类实验取得了89.32%的分类准确率。该研究验证了开源工具包在旅游评论情感分析场景下的实用性在前人复杂模型的基础上验证了轻量级开源工具在中小规模数据集上的有效性。Saraswati等2023以TripAdvisor平台上巴厘岛景点的海量评论为研究对象采用VADER情感词典方法结合词频与词组分析识别出巴厘岛旅游的正面形象标签与负面形象标签。该研究将情感分析与形象感知研究相结合在前人单纯情感分类的基础上进一步挖掘了目的地形象的正负向标签体系。3.2 国内研究现状国内学者在旅游评论大数据分析领域的研究近年来呈现快速增长态势技术路线从传统统计分析逐步向分布式计算与深度学习方向演进。陆玉莹2024以携程网2023年五一期间10个热门城市的TOP3景区为研究对象利用Python爬虫采集2.3万条评论数据结合贝叶斯层次统计模型构建OTA平台游客满意度模型并通过语义网络分析揭示不同类型景区的游客需求差异。研究发现不同级别和类型的旅游景区其游客需求及关注点存在显著差异在前人单一景点研究的基础上拓展到多城市多类型景区的对比分析。毕丰宇2023以浙江省11个5A景区为研究对象基于携程平台评论数据构建旅游评论数据集依次完成高频词提取、机器学习情感分类、LDA主题模型挖掘与可视化展示形成了完整的研究链条。该研究验证了LDA主题模型在旅游评论文本主题发现中的有效性在前人情感分析的基础上进一步引入LDA主题模型实现了评论文本的无监督主题聚类。ZhuYuan2022针对旅游消费评论的情感分析需求提出了一种改进的支持向量机SVM算法并基于Hadoop分布式文件系统HDFS与MapReduce编程模型实现了算法的并行化部署。实验结果表明分布式SVM算法在大规模旅游评论数据集上的情感分类准确率与处理效率均优于单机版本在前人单机情感分析的基础上引入Hadoop分布式计算框架解决了海量评论数据的处理效率问题。杨佳鹏等2024提出了基于Spark框架的瀑布型融合旅游推荐系统采用SimHash算法实现海量数据的降维处理结合余弦相似度与TF-IDF算法完成景点推荐计算并通过地图可视化将推荐结果以经纬度坐标形式展示。该研究验证了Spark内存计算框架在旅游推荐场景下的实时性优势在前人MapReduce批处理模型的基础上采用Spark框架实现了更低延迟的实时推荐计算。杨秀璋等2021以贵州省2010年至2020年间的33666条景点评论为研究对象融合领域情感词典与LDA模型实现细粒度情感分析与主题挖掘采用共词分析与社交网络方法挖掘积极评论与消极评论的关联关系。研究成功识别出积极情感下的著名景点、民族风俗、旅游体验三大类主题以及消极情感下的收费问题、交通环境、游客拥挤三大类主题在前人静态主题分析的基础上引入了时间序列维度实现了旅游舆情的动态追踪分析。3.3 研究述评综合国内外研究现状可以发现当前旅游评论文本分析领域已在以下方面取得显著进展一是数据来源以携程、马蜂窝、TripAdvisor等主流OTA平台为主二是分析方法从早期的词频统计逐步演进到情感分析、主题模型、机器学习分类等多元技术路线三是可视化手段从简单的词云图发展到交互式仪表盘与地图可视化四是分布式计算框架开始逐步应用于大规模评论数据的处理。然而现有研究仍存在以下可拓展的空间其一多数研究仍停留在单机或小集群环境下的实验性分析缺乏面向生产级数据规模的完整大数据技术链路验证其二可视化展示多为静态图表缺乏支持多维度交叉探索的交互式可视化系统设计其三将大语言模型引入旅游评论深度理解与语义生成的研究尚不多见。本研究在前人基础上提出新想法拟构建一套从分布式存储到并行计算再到交互式可视化的完整大数据分析系统并引入DeepSeekAI大模型辅助评论文本的深度语义理解弥补现有研究在工程完整性与智能化程度上的不足。四、系统功能设计4.1 系统总体架构本系统采用分层架构设计自下而上分为数据采集层、数据存储层、计算分析层、可视化展示层四个层级。各层之间通过标准接口解耦确保系统的可扩展性与可维护性。数据采集层负责从携程平台采集景点评论数据采用PythonScrapy分布式爬虫框架实现支持增量爬取与断点续爬。数据存储层采用HadoopHDFS作为分布式文件存储系统存储原始评论文本数据与中间计算结果采用Hive数据仓库实现结构化数据的SQL查询与统计分析采用MySQL存储景点基础信息与用户画像等结构化元数据。计算分析层基于Spark计算引擎实现分布式文本处理与机器学习分析包括高频词统计、情感分类、LDA主题模型、K-Means聚类、时间序列分析等核心分析模块。同时集成DeepSeekAI大模型API实现评论文本的深度语义理解与评论摘要自动生成。可视化展示层基于EChartsVue.js构建Web端交互式可视化大屏提供多维度的数据分析图表与探索式查询功能。4.2 核心功能模块模块一数据采集与管理模块。支持景点列表配置、爬取任务调度、数据质量监控、数据导出等功能提供可视化的任务管理界面实时展示采集进度与数据质量报告。模块二文本预处理模块。实现分词、去停用词、词性标注、文本向量化等预处理功能支持自定义词典的导入与维护。模块三情感分析模块。集成基于情感词典的规则方法与基于机器学习的分类方法实现评论文本的正负面情感倾向判断输出整体情感分布、分景点情感对比、时间维度情感趋势等分析结果。模块四主题挖掘模块。基于LDA主题模型实现评论文本的无监督主题聚类自动识别游客讨论的核心主题景观质量、服务态度、交通便利、餐饮价格、拥挤程度等并计算各主题在不同景点、不同时间段的占比变化。模块五DeepSeekAI智能分析模块。调用DeepSeekAI大模型API对热门景点的高频好评与高频差评进行深度语义总结自动生成景点点评摘要与改进建议。该模块的执行逻辑遵循执行过程结果三段式结构执行环节将评论文本批量传入DeepSeekAI接口设定分析任务指令过程环节通过API调用获取模型返回的结构化分析结果包括关键词提取、情感归因、问题归纳结果环节将大模型生成的自然语言分析结论与结构化数据进行融合输出更具可读性的深度分析报告。模块六可视化大屏模块。提供多维度的交互式可视化展示包括景点评论量柱状图、情感分布饼图、主题雷达图、时间趋势折线图、地域分布地图、高频词云图等多种图表类型支持鼠标悬停查看详情、维度切换、时间范围筛选等交互操作。五、技术路线与大数据技术栈5.1 技术路线本研究的技术路线遵循数据获取—数据存储—数据处理—数据分析—数据可视化的完整大数据处理流程。第一阶段为数据获取。通过Python爬虫技术从携程网站采集热门景点的评论数据采集范围覆盖全国50个热门景点时间跨度为2023年1月至2026年6月。采集过程中严格控制请求频率遵守网站robots协议。第二阶段为数据存储。将采集到的原始JSON格式评论数据上传至Hadoop分布式文件系统HDFS利用HDFS的高容错性与高吞吐量特性实现海量文本数据的可靠存储。同时将景点基础信息、用户评分等结构化数据存入MySQL数据库。第三阶段为数据处理。基于Spark分布式计算框架对HDFS中的评论文本数据进行并行化预处理包括分词、去停用词、词性标注、文本向量化等操作。Spark基于内存计算的特性可显著提升文本处理效率相较于传统MapReduce模型在迭代计算场景下性能提升10至100倍。第四阶段为数据分析。在预处理后的数据集上开展多维度分析包括高频词统计分析、情感倾向分析、LDA主题挖掘、K-Means文本聚类、时间序列趋势分析、地域对比分析等。同时集成DeepSeekAI大模型实现评论文本的深度语义理解与智能摘要生成。第五阶段为数据可视化。将分析结果通过ECharts图表库与Vue.js前端框架进行交互式可视化展示构建Web端可视化大屏。5.2 核心技术栈分布式存储Hadoop 3.x ——HDFS分布式文件系统存储原始评论数据与中间计算结果YARN资源调度管理器统一管理集群计算资源。分布式计算Spark 3.x ——Spark Core核心计算引擎实现分布式任务调度与内存计算SparkSQL基于Hive元数据进行SQL式分析MLlib机器学习库提供分类、聚类、推荐等算法的分布式实现。 开发语言与工具链Python3.9 ——Scrapy分布式爬虫框架负责评论数据采集jieba中文分词工具结合自定义旅游领域词典scikit-learn机器学习库实现SVM、朴素贝叶斯、逻辑回归等分类算法Gensim主题模型库实现LDA主题模型的训练与推理PySpark实现分布式数据处理逻辑的Python开发。大语言模型DeepSeekAI API——评论文本深度理解自动提取评论核心观点与情感归因评论摘要生成对长评论进行自动摘要提炼改进建议生成基于差评内容自动生成景点服务优化建议。可视化与前端ECharts开源图表库提供柱状图、饼图、雷达图、折线图、词云图等多种图表类型Vue.js前端框架构建单页应用Flask轻量级Web框架提供后端API接口。六、可视化方案设计本研究的可视化方案围绕多维度、交互式、可探索的设计原则设计以下核心可视化图表景点评论量对比柱状图采用分组柱状图展示2023年至2026年间TOP10热门景点的年度评论数量对比。柱状图的横轴为景点名称纵轴为年度评论条数每个景点对应四根柱子分别代表2023年、2024年、2025年、2026年四个年度的数据。通过柱状图的高度对比可直观呈现不同景点的评论热度年度变化趋势。预期数据显示2023年TOP1景点评论量约为4.2万条2024年增长至5.8万条2025年达到6.5万条2026年上半年已突破3.8万条整体呈现逐年增长态势。景点情感分布雷达图采用五维雷达图展示不同类型景点的情感评分维度对比五个维度分别为景观满意度、服务满意度、交通满意度、性价比满意度、体验满意度。雷达图的每个顶点对应一个评分维度不同类型的景点以不同颜色的多边形叠加展示。通过雷达图的形状对比可直观识别各类景点的优势维度与短板维度。例如自然景观类景点在景观满意度维度得分最高平均4.6分但在交通满意度维度得分偏低平均3.2分主题乐园类景点在体验满意度维度得分突出平均4.4分但在性价比维度得分相对较低平均3.5分。情感趋势折线图采用时间序列折线图展示热门景点评论情感得分的月度变化趋势。折线图的横轴为时间2023年1月至2026年6月共42个月纵轴为月度平均情感得分。图中绘制多条折线分别代表不同类型景点的情感变化曲线并标注节假日对应的时间节点。通过折线图的起伏变化可观察节假日前后的情感波动规律识别情感得分显著下降的时间节点及其对应的舆情事件。高频词云图采用词云图展示好评与差评中的高频词汇分布。词的大小与词频成正比颜色区分词性。好评词云聚焦风景优美“空气清新”“值得一去”“体验很好等正面词汇差评词云聚焦排队太久”“人太多”“门票贵”服务差等负面词汇。通过好评与差评词云的并列对比可快速识别游客满意与不满意的核心因素。主题占比环形图采用环形图展示评论文本的主题分布比例。基于LDA主题模型挖掘出的六大主题景观特色、服务质量、交通便利、餐饮配套、门票价格、人流拥挤以环形图的扇区面积表示各主题的评论占比。例如景观特色主题占比最高约35%其次是服务质量主题约22%人流拥挤主题占比约15%门票价格主题占比约12%交通便利主题占比约10%餐饮配套主题占比约6%。地域分布热力地图采用中国地图热力图展示各省份热门景点的评论情感得分分布。地图以颜色深浅表示情感得分高低绿色为正面、黄色为中性、红色为负面点击某省份可下钻查看该省份内各景点的详细评论数据。通过地图热力图的空间分布可直观识别旅游情感得分较高的区域与得分偏低的区域。