flicck / CninfoDistributedSpider
针对巨潮资讯网上市公司公告的分布式爬虫,采用scrapy和kafka的分布式架构。可以爬取爬取指定上市公司列表、指定时间段内的所有公告并保存PDF。后续会加入搜索引擎功能
☆19Updated 5 years ago
Alternatives and similar repositories for CninfoDistributedSpider:
Users that are interested in CninfoDistributedSpider are comparing it to the libraries listed below
- a crawler for wallstreetcn,finance.sina by Scrapy-新浪财经,同花顺财经,华尔街见闻的爬虫☆31Updated 8 years ago
- 本项目对美股股票的涨跌进行了研究,从问题出发并提出猜想,然后定义了机器学习的实验任务。通过多次实验得到实验数据,最终证明了所提出的猜想:中国股市确实和美国股市存在着一定的联系,并且通过这些隐含的联系可以预测某些美国股票的涨跌。☆47Updated 8 years ago
- scrapy+Fiddler+celery+ redis +mysql实现分布式定时启动并异步快速动态爬取股票数据功能☆57Updated 2 years ago
- 提取金融相关领域研究报告的主要结论(key idea)☆59Updated 6 years ago
- 金融问答平台文本数据采集/爬取,数据源涉及上交所,深交所,全景网及新浪股吧☆39Updated 7 years ago
- 对通达信数据进行去重和清洗处理,并将数据存入MongoDB,方便往后研究☆26Updated 7 years ago
- 金融新闻增量式聚焦爬虫☆21Updated 7 years ago
- 利用Scikit Learn对秒级股票数据进行建模预测☆55Updated 6 years ago
- 根据股票帐号,自动下载www.cninfo.com.上对应的企业年报(pdf格式),然后将这些pdf格式的文件转换为txt文件,然后从中提取出有用的信息,进行数据分析和图标展示☆52Updated 8 years ago