Root-lee / DocReplaceLinks
Batch replace strings in all specific format documents in a certain folder.
☆9Updated 9 years ago
Alternatives and similar repositories for DocReplace
Users that are interested in DocReplace are comparing it to the libraries listed below
Sorting:
- 黄金舆情数据分析☆52Updated 8 years ago
- 读书笔记《自己动手写网络爬虫》,自己敲的代码。主要记录了网络爬虫的基本实现,网页去重的算法,网页指纹算法,文本信息挖掘☆47Updated 10 years ago
- 面向证券信息类专业搜索引擎,基于WEB信息挖掘技术的 专业搜索引擎设计与实现并着重分析基于特定主题的爬取方法,通过下载Internet上WEB文档,进行过滤、分词、转换等处理工作,并建立索引数据库,最终可由检索器通过用户输入查询关键字,搜索器支持微博客、短信等内容短小而又不规…☆23Updated 6 years ago
- 企查查企业分类信息采集☆43Updated 5 years ago
- 猫头鹰搜索引擎,爬虫,分词,索引,搜索☆27Updated 9 years ago
- 基于Map/Reduce爬虫,可抽取各大新闻网站的新闻正文并进行分类和聚类☆75Updated 11 years ago
- 新闻网站爬虫,目前能够爬取网易,新浪,qq,搜狐等三家网站的新闻页面,并保存到本地。☆34Updated 10 years ago
- 智联招聘网职位的抓取☆52Updated 8 years ago
- 全国房价数据爬取+分析☆109Updated 6 years ago
- ☆20Updated 8 years ago
- 爬取去哪儿景点进行数据分析并生成热力图☆74Updated 6 years ago
- TuShare是一个免费、开源的python财经数据接口包。主要实现对股票等金融数据从数据采集、清洗加工 到 数据存储的过程,能够为金融分析人员提供快速、整洁、和多样的便于分析的数据,为他们在数据获取方面极大地减轻工作量,使他们更加专注于策略和模型的研究与实现上。☆36Updated 9 years ago
- 互联网新闻推荐系统(myNews)--2016全国计算机设计大赛企业命题参赛作品☆45Updated 8 years ago
- 爬取百度指数和阿里指数,采用selenium,存入hbase,验证码自动识别,多线程控制☆32Updated 8 years ago
- 电商爬虫系统:京东,当当,一号店,国美爬虫(代理使用);论坛、新闻、豆瓣爬虫☆105Updated 7 years ago
- 该项目为scrapy框架脚手架,整合了自动切换agent,自动切换代理ip等中间件,可以下载后自行编写爬虫。 支持: 豆瓣电影,某东商品信息(名称价格等)。☆35Updated 6 years ago
- java 算法设计与实现--《剑指offer》《编程之美》等Java实现☆16Updated 6 years ago
- 搜集链家自如品牌房源,并使用百度地图可视化。☆27Updated 7 years ago
- python3 scrapy crawler crawl taobao.com, data import to MySQL☆21Updated 8 years ago
- 自动网站监测系统,用于监测网站变化并使用微信进行提醒☆83Updated 5 years ago
- 基于wifi 抓取信息的大数据查询分析系统☆107Updated 8 years ago
- 微博情感分析☆12Updated 11 years ago
- 人工智能Python全栈工程师 人工智能时代已经来临,再不学习就会被淘汰! python考试,已经被列为国家计算机二级考试 python课程,已经被浙江的中学列为必修课内容之一 python课程,已经被山东的小学列为选修课课程之一 零基础? 怕啥,君社教育来帮你! Pyt…☆105Updated 4 years ago
- 新闻评论观点挖掘系统,粗粒度的分析出新闻网评观点的倾向和走势☆53Updated 10 years ago
- 知乎用户爬虫数据分析☆15Updated 7 years ago
- 贝壳网房价爬虫,基于Scrapy, 采集北京上海广州深圳等21个中国主要城市的房价数据(小区,二手房),稳定可靠快速!支持csv存储,注释丰富,链家网爬虫见我另一个项目☆53Updated 6 years ago
- 基于Redis实现的简单到爆的分布式爬虫☆47Updated 7 years ago
- 利用 tesseract 解析简单数字验证码图片☆21Updated 7 years ago
- GuozhongCrawler的是一个无须配置、便于二次开发的爬虫开源框架,它提供简单灵活的API,只需少量代码即可实现一个爬虫。其设计灵感来源于多个爬虫国内外爬虫框架的总结。采用完全模块化的设计,功能覆盖整个爬虫的生命周期(链接提取、页面下载、内容抽取、持久化),支持多线…☆96Updated 10 years ago
- 房价数据爬取+分析☆33Updated 8 years ago