GuohuaZhuang / deduplication-detecting
文档去重功能是为了解决搜索引擎的文档语义重复的问题,方法是多重哈希下的语义指纹算法。
☆12Updated 11 years ago
Alternatives and similar repositories for deduplication-detecting:
Users that are interested in deduplication-detecting are comparing it to the libraries listed below
- 文本去重算法,研究自推荐系统中新闻的去重,采用了雅虎的Near-duplicates and shingling算法,服务端用c实现,客户端用java实现,利用thrift框架进行通信,为了提高扩展性,去重可以在服务端实现,服务器也提供了计算的接口,方便客户端自己扩展☆23Updated 11 years ago
- 一个以文本类算法为基础、结合场景的风险防控系统☆15Updated 8 years ago
- 基于标题分类的主题句提取方法可描述为: 给定一篇新闻报道, 计算标题与新闻主题词集的相似度, 判断标题是否具有提示性。对于提示性标题,抽取新闻报道中与其最相似的句子作为主题句; 否则, 综合利用多种特征计算新闻报道中句子的重要性, 将得分最高的句子作为主题句。☆40Updated 8 years ago
- 此文本分类项目主要面向机器学习初学者和文本分类效果测试者,项目内部含有朴素贝叶斯,余弦定理,逻辑回归多种分类算法以及mm,rmm分词器,同时从某新闻站点爬取了多个分类共6000多篇文章,以及一个中文词典。项目方便自由拓展各种分类器和分词器,并通过组装测试分类效果。☆35Updated 7 years ago
- 常用文本聚类算法java实现☆15Updated 10 years ago
- 基于SVM的短文本分类研究☆19Updated 10 years ago
- 搜狐实习自动回复项目:语音识别、问题过滤、答案推荐☆8Updated 10 years ago
- ☆21Updated 10 years ago
- 实现中文文本分类,支持文件、文本分类,基于多项式分布的朴素贝叶斯分类器。由于工作实际应用是二分类,加之考虑到每个分类属性都建立map存储词语向量可能引起的内存问题,所以目前只支持二分类。当然,直接复用这个结构扩展到多分类也是很容易。之所以自己写,主要原因是没有仔细研读mah…☆22Updated 8 years ago
- 语义、情感、相似度分析。☆58Updated 9 years ago
- 2013,05-2015,02 产品评论情感分析☆15Updated 9 years ago
- 一种尝试解决情绪分类任务中的不平衡问题的分类方法研究。☆9Updated 7 years ago
- tensorflow-seq2seq-chatbot-zh中文聊天机器人☆27Updated 8 years ago
- 基于词典的负面舆情信息评分算法。☆26Updated 10 years ago
- 双端trie树的python实现☆11Updated 6 years ago
- 高级结构双数组Trie树(DoubleArrayTrie) java实现☆23Updated 4 years ago
- 知识图谱轻量框架☆62Updated 9 years ago
- 基于自然语言处理的知识库系统、咨询、问答库 欢迎添加qq群: 366526312☆9Updated 6 years ago
- Tree-split 搬新家..给各位带来的不便深表歉意☆56Updated 8 years ago
- 毕业设计,通过新浪微博api获取网上的微博信息,然后通过一个简单的k-means算法进行简单的分类,以便找到热点事件☆21Updated 11 years ago
- xmnlp中文分词工具,java编写,统计概率分词+规则分词实现,功能包括人名识别,词性标注,用户自定义词典扩展,分词效果速度都超过开源版的jieba分词。☆36Updated 3 years ago
- 面向证券信息类专业搜索引擎,基于WEB信息挖掘技术的专业搜索引擎设计与实现并着重分析基于特定主题的爬取方法,通过下载Internet上WEB文档,进行过滤、分词、转换等处理工作,并建立索引数据库,最终可由检索器通过用户输入查询关键字,搜索器支持微博客、短信等内容短小而又不规…☆23Updated 6 years ago
- 《实体数据挖掘与知识图谱构建》一书的代码和实验数据。☆43Updated 9 years ago
- Online Web News Extraction via Tag Path Feature Weighted by Text Block Density☆11Updated 8 years ago
- 把李航老师《统计学习方法》的后几章的算法都用java实现了一遍,实现盒子与球的EM算法,扩展到去GMM训练,后来实现了HMM分词(实现了HMM分词的参数训练)和CRF分词(借用CRF++训练的参数模型),最后利用tensorFlow把BiLSTM+CRF实现了,然后为luc…☆23Updated 2 years ago
- 这是一个最大熵的简明Java实现,提供提供训练与预测接口。训练算法采用GIS训练算法,附带示例训练集和一个天气预测的Demo。☆46Updated 10 years ago
- 个人实现的基于Django与semantic-ui的语言计算实验平台, 功能包括自然语言综合处理,词语计算,社会热点计算,人物计算,文学画像,职位画像等社会计算功能☆29Updated 7 years ago
- 新词发现分布式机器学习算法。☆15Updated 10 years ago
- csdn用户画像的源码☆20Updated 7 years ago
- 机器学习文本分类器☆46Updated 8 years ago