houking-can / PDFConverterLinks
Best PDF Converter! PDF to any format, pdf2word/excel/xml/html/txt...
☆153Updated 4 years ago
Alternatives and similar repositories for PDFConverter
Users that are interested in PDFConverter are comparing it to the libraries listed below
Sorting:
- 裁判文书数据☆11Updated 4 years ago
- 百度百科爬虫☆72Updated 11 months ago
- 时间关键词正则提取以及标准化☆21Updated 3 years ago
- 中文PDF转TXT的实用工具☆30Updated 3 years ago
- CCKS2019评测任务五-公众公司公告信息抽取,第3名☆121Updated 5 years ago
- ☆22Updated 4 years ago
- 中英文敏感词、语言检测 、中外手机/电话归属地/运营商查询、名字推断性别、手机号抽取、身份证抽取、邮箱抽取、中日文人名库、中文缩写库、拆字词典、词汇情感值、停用词、反动词表、暴恐词表、繁简体转换、英文模拟中文发音、汪峰歌词生成器、职业名称词库、同义词库、反义词库、否定词库、汽…☆32Updated 6 years ago
- 有一个通用实体关系事件抽取的任务,需要使用到UIE模框架,而且需要将起部署到昇腾310服务器上,因为UIE模型底层使用的是ernie3.0,但是目前paddle官方还不支持ernie3.0模型在昇腾310上部署,所以才有了以下的操作,主要过程是,先试用paddle训练处模型…☆18Updated 2 years ago
- 基于正则表达式和AC自动机多模匹配进行不规则处方文本理解,识别药品名、给药总量、用法用量等目标内容。☆15Updated 5 years ago
- ☆10Updated 5 years ago
- benchmark of KgCLUE, with different models and methods☆27Updated 3 years ago
- It's a python script that convert PDF to txt using PDFMiner☆46Updated 3 years ago
- FinanceEventGraph,金融领域事件图谱开放数据集,可用于事件图谱搭建于实验,包括3865个acquire并购事件、9093个invest投资事件,总计12960的事件☆19Updated last year
- 🌳CED: Catalog Extraction from Documents☆16Updated last year
- Recognize tables and text from scanned images that contain tables. 从包含表格的扫描图片中识别表格和文字☆255Updated 2 years ago
- rasa 2.0中文nlu系统搭建☆30Updated 2 years ago
- A Multi-Modal Dataset of Chinese Governmental Docunments☆34Updated 4 years ago
- 中文新词发现算法PNW算法,可以识别任意长度的新词。☆15Updated last year
- It's for a research for AI and law☆43Updated 4 years ago
- company name parser, extract company name brand. 中文公司名称分词工具,支持公司名称中的地名,品牌名(主词),行业词,公司名后缀提取。☆90Updated 2 years ago
- 利用文本分析算法和Python脚本,自动纠正word中的英语单词拼写错误☆47Updated 6 years ago
- 【间隙·树·排序算法】 对OCR结果或PDF提取的文本进行版面分析,按人类阅读顺序进行排序。☆136Updated last year
- 公司名简称生成, 采用马尔科夫构造序列标注概率分布,使用维特比前后向算法推导生成。☆27Updated 7 years ago
- 百度百科爬虫☆34Updated 5 years ago
- 图书名语料库。含部分电影、游戏名称。☆71Updated last year
- 互联网舆情企业风险事件的识别和预警,将公司名称进行实体提取,对新闻进行舆情分类,比赛地址为:http://ailab.aiwin.org.cn/competitions/48#learn_the_details☆16Updated 4 years ago
- PaddleOCR 输出结果的行对齐,表格制式图像OCR行对齐☆44Updated 3 years ago
- 通用版面分析 | 中文文档解析 |Document Layout Analysis | layout paser☆46Updated 11 months ago
- chinese anti semantic word search interface based on dict crawled from online resources, ChineseAntiword,针对中文词语的反义词查询接口☆59Updated 6 years ago
- 该仓库目的是实现基于知识图谱的中文问答系统☆55Updated 3 years ago