liuxymax / case_pysparkLinks
基于Python语言的Spark数据处理分析案例集锦(PySpark)
☆26Updated 4 years ago
Alternatives and similar repositories for case_pyspark
Users that are interested in case_pyspark are comparing it to the libraries listed below
Sorting:
- 本次数据分析基于阿里云天池数据集(用户行为数据集),使用转化漏斗,AARRR模型,对常见电商分析指标,包括转化率,PV,UV,留存率,复购率等进行分析,分析过程中使用python进行数据清洗及可视化。☆32Updated 5 years ago
- 根据用户数据及消费行为数据,使用Python对客户进行聚类分群,并给出用户画像。通过数据,分析用户群体的核心特征。☆30Updated 5 years ago
- Python电商平台数据分析☆93Updated 4 years ago
- 3个小项目分别是利用 Python 实现报表自动化、某连锁超市、某银行数据分析,展示了问题分解、数据清洗、数据分析与可视化的过程。☆45Updated 6 years ago
- 本项目以数据采集、处理、分析及数据可视化为项目流程,实现百万级电影数据离线处理与计算。功能包括python爬虫,Matplotlib、Echarts数据可视化、Mapreduce、hive数据统计、情感分析、词图云、电影票房与评分预测☆219Updated 3 years ago
- 大众点评评论文本挖掘,包括点评数据爬取、数据清洗入库、数据分析、评论情感分析等的完整挖掘项目☆890Updated 7 years ago
- 实时爬取新华网新闻并存入mysql数据库当中,对爬取的数据进行处理和清洗然后还要做可视化和数据分析☆33Updated 2 years ago
- 利用Python编程爬虫搜集微博平台上关于大学生网课的评论,使用SPSS、机器学习、自然语言处理等方法,对收集到的文本数据进行分词、数据清洗、词频统计和聚类分析。最后根据所得到的数据进行以及分析,发现目前在线教学 中学生体验的现状、趋势以及一些待解决的问题。☆45Updated 4 years ago
- 牛客网上的sql实战题解,准备面试大数据开发,数据分析同学可以进来学习☆24Updated 3 years ago
- Data Analysis and Mining(数据分析与挖掘)☆340Updated 4 years ago
- 携程/榛果民宿实时评论挖掘软件,包含数据的实时采集/数据清洗/结构化保存/ UGC 数据主题提取/情感分析/后结构化可视化等技术的综合性演示 Demo。基于在线民宿 UGC 数据的意见挖掘项目,包含数据挖掘和 NLP 相关的处理,负责数据采集、主题抽取、情感分析等任务。主要…☆80Updated 4 years ago
- 计算机毕业设计之Python+Spark+LSTM电商爬虫 商品推荐系统 商品评论情感分析 电商大数据 电商推荐系统 大数据毕业设计☆21Updated 3 years ago
- 京东评论爬虫,包含对数据的采集、清洗、可视化、分析等过程,作为数据库课程设计项目☆321Updated 10 months ago
- 爬虫+数据分析实战项目☆557Updated 6 years ago
- 数据挖掘可视化系统(Data Mining Visualization System)通过数据挖掘理论、机器学习算法以及数据可视化等信息技术,并基于 Flask 框架搭建 Web 服务器,实现数据挖掘可视化。☆104Updated 4 years ago
- 基于豆瓣电影爬虫及Spark数据分析可视化设计毕业源码案例设计☆17Updated 2 years ago
- 利用Python网络爬虫对京东商城中指定商品下的用户评论进行爬取,对数据预处理操作后进行文本情感分析并可视化显示。☆73Updated 3 years ago
- 本项目利用Python的scrapy框架爬取链家网的上海市租房信息,利用pandas、numpy、matplotlib、seaborn、folium 、wordcloud 等库进行数据分析和可视化,通过one-hot编码和文本特征提取出120个训练特征,搭建3层神经网络对上…☆71Updated 4 years ago
- python数据分析与数据挖掘实例☆63Updated 2 years ago
- 《python数据分析与挖掘实战》项目实践及拓展☆230Updated 6 years ago
- 使用 flask + pyecharts 搭建的新冠肺炎疫情数据可视化交互分析网站平台,包含疫情数据获取、每日疫情地图、曲线图展示,数据统计分析、态势感知、确诊人数预测分析算法设计、NLP舆情监测等任务(部署在http://covid.yunwei123.tech/)☆332Updated 3 years ago
- 基于python与Anaconda Navigator软件的历年影片数据分析,通过数据再基于机器学习来获取影片的最佳阵容,最后预测以最佳整容去拍摄一部电影时所获取的票房与评分。☆21Updated 7 years ago
- Django+Python+Echarts对招聘数据进行可视化分析☆112Updated 2 years ago
- Jobs-Recommendation-System使用Scrapy爬虫框架对招聘网站进行爬取,并使用ETL工具将数据存储到分布式文件系统;利用大数据,机器学习等技术对求职者和职位信息进行画像建模,并通过推荐算法对求职者做出职位的智能推荐。☆124Updated 5 years ago
- 数据挖掘大作业, 东野圭吾小说集文本挖掘☆71Updated 8 years ago
- 本项目旨在建立一个基于大数据处理的大学生就业方向分析预测系统,通过爬虫技术获取各大公司和著名招聘网站的大量招聘信息,然后将获取的数据进行清洗分类后储存在数据库中,最后从大学生的就业角度出发,通过算法分析数据,建立一个帮助大学生明确就业方向与社会需求的平台☆120Updated 7 years ago
- 基于在线民宿 UGC 数据的意见挖掘项目,包含数据挖掘和NLP 相关的处理,负责数据采集、主题抽取、情感分析等任务。目的是克服用户打分和评论不一致,实时对在线民宿的满意度评测,包含在线评论采集和情感可视化分析。搭建了百度地图POI查询入口,可以进行自动化的批量查询 POI …☆437Updated last year
- 基于BOSS直聘“数据分析师”职位信息的爬虫实现、数据分析、数据可视化及机器学习预测与结果分析。☆91Updated 7 years ago
- 爬虫爬取北京天气数据,pandas和numpy处理数据,matplot可视化展示数据,sklearn机器学习方法预测空气状况。☆135Updated 5 years ago
- kaggle贷款违约预测 :主要研究如何借助非平衡数据分类的思想对银行等金融机构的历史贷款数据进行分析,并基于随机森林分类模型预测贷款违约的可能性☆22Updated 6 years ago