Corpus Open Source Projects
Browse 399 Corpus open source projects, ranked by GitHub stars. Find the most popular Corpus tools and libraries.
nltk/nltk
NLTK Source
Metrics details
| Stars | 14,680 |
brightmart/nlp_chinese_corpus
大规模中文自然语言处理语料 Large Scale Chinese Corpus for NLP
Metrics details
| Stars | 9,904 |
nl8590687/ASRT_SpeechRecognition
A Deep-Learning-Based Chinese Speech Recognition System 基于深度学习的中文语音识别系统
Metrics details
| Stars | 8,377 |
stanfordnlp/GloVe
Software in C and data files for the popular GloVe model for distributed word representations, a.k.a. word vectors or embeddings
Metrics details
| Stars | 7,226 |
vespa-engine/vespa
The AI search platform
Metrics details
| Stars | 7,021 |
codertimo/BERT-pytorch
Google AI 2018 BERT pytorch implementation
Metrics details
| Stars | 6,528 |
shibing624/pycorrector
pycorrector is a toolkit for text error correction. 文本纠错,实现了Kenlm,T5,MacBERT,ChatGLM3,Qwen2.5等模型应用在纠错场景,开箱即用。
Metrics details
| Stars | 6,492 |
adbar/trafilatura
Python & Command-line tool to gather text and metadata on the Web: Crawling, scraping, extraction, output as CSV, JSON, HTML, MD, TXT, XML
Metrics details
| Stars | 6,318 |
niderhoff/nlp-datasets
Alphabetical list of free/public domain datasets with text data for use in Natural Language Processing (NLP)
Metrics details
| Stars | 5,990 |
ibab/tensorflow-wavenet
A TensorFlow implementation of DeepMind's WaveNet paper
Metrics details
| Stars | 5,428 |
dariusk/corpora
A collection of small corpuses of interesting data for the creation of bots and similar stuff.
Metrics details
| Stars | 5,102 |
dvyukov/go-fuzz
Randomized testing for Go
Metrics details
| Stars | 4,853 |
CLUEbenchmark/CLUEDatasetSearch
搜索所有中文NLP数据集,附常用英文NLP数据集
Metrics details
| Stars | 4,458 |
first20hours/google-10000-english
This repo contains a list of the 10,000 most common English words in order of frequency, as determined by n-gram frequency analysis of the Google's Trillion Word Corpus.
Metrics details
| Stars | 4,425 |
wainshine/Chinese-Names-Corpus
中文人名语料库。人名生成器。中文姓名,姓氏,名字,称呼,日本人名,翻译人名,英文人名。可用于中文分词、人名实体识别。
Metrics details
| Stars | 4,317 |
facebook/duckling
Language, engine, and tooling for expressing, testing, and evaluating composable language rules on input strings.
Metrics details
| Stars | 4,297 |
CLUEbenchmark/CLUE
中文语言理解测评基准 Chinese Language Understanding Evaluation Benchmark: datasets, baselines, pre-trained models, corpus and leaderboard
Metrics details
| Stars | 4,270 |
codemayq/chinese_chatbot_corpus
中文公开聊天语料库
Metrics details
| Stars | 4,190 |
buriburisuri/speech-to-text-wavenet
Speech-to-Text-WaveNet : End-to-end sentence level English speech recognition based on DeepMind's WaveNet and tensorflow
Metrics details
| Stars | 4,006 |
facebookresearch/LASER
Language-Agnostic SEntence Representations
Metrics details
| Stars | 3,661 |
jsvine/markovify
A simple, extensible Markov chain generator.
Metrics details
| Stars | 3,400 |
dbiir/UER-py
Open Source Pre-training Model Framework in PyTorch & Pre-trained Model Zoo
Metrics details
| Stars | 3,110 |
endymecy/awesome-deeplearning-resources
Deep Learning and deep reinforcement learning research papers and some codes
Metrics details
| Stars | 3,021 |
Kyubyong/nlp_tasks
Natural Language Processing Tasks and References
Metrics details
| Stars | 3,010 |
Conchylicultor/DeepQA
My tensorflow implementation of "A neural conversational model", a Deep learning based chatbot
Metrics details
| Stars | 2,912 |
jinfagang/weibo_terminater
Final Weibo Crawler Scrap Anything From Weibo, comments, weibo contents, followers, anything. The Terminator
Metrics details
| Stars | 2,319 |
googleprojectzero/fuzzilli
A JavaScript Engine Fuzzer
Metrics details
| Stars | 2,314 |
jim-schwoebel/voice_datasets
🔊 A comprehensive list of open-source datasets for voice and sound computing (95+ datasets).
Metrics details
| Stars | 2,208 |
fendouai/Awesome-Chatbot
Awesome Chatbot Projects,Corpus,Papers,Tutorials.Chinese Chatbot =>:
Metrics details
| Stars | 2,178 |
candlewill/Dialog_Corpus
用于训练中英文对话系统的语料库 Datasets for Training Chatbot System
Metrics details
| Stars | 2,052 |
thu-coai/CDial-GPT
A Large-scale Chinese Short-Text Conversation Dataset and Chinese pre-training dialog models
Metrics details
| Stars | 1,956 |
philipperemy/tensorflow-1.4-billion-password-analysis
Deep Learning model to analyze a large corpus of clear text passwords.
Metrics details
| Stars | 1,952 |
LIAAD/yake
Single-document unsupervised keyword extraction
Metrics details
| Stars | 1,874 |
imcaspar/gpt2-ml
GPT2 for Multiple Languages, including pretrained models. GPT2 多语言支持, 15亿参数中文预训练模型
Metrics details
| Stars | 1,704 |
juand-r/entity-recognition-datasets
A collection of corpora for named entity recognition (NER) and entity recognition tasks. These annotated datasets cover a variety of languages, domains and entity types.
Metrics details
| Stars | 1,573 |
dennybritz/chatbot-retrieval
Dual LSTM Encoder for Dialog Response Generation
Metrics details
| Stars | 1,570 |
crownpku/Rasa_NLU_Chi
Turn Chinese natural language into structured data 中文自然语言理解
Metrics details
| Stars | 1,532 |
NiuTrans/Classical-Modern
非常全的文言文(古文)-现代文平行语料
Metrics details
| Stars | 1,464 |
deepwel/Chinese-Annotator
Annotator for Chinese Text Corpus (UNDER DEVELOPMENT) 中文文本标注工具
Metrics details
| Stars | 1,431 |
gunthercox/chatterbot-corpus
A multilingual dialog corpus
Metrics details
| Stars | 1,418 |
deepmind/rc-data
Question answering dataset featured in "Teaching Machines to Read and Comprehend
Metrics details
| Stars | 1,296 |
wainshine/Company-Names-Corpus
公司名语料库。机构名语料库。公司简称,缩写,品牌词,企业名。可用于中文分词、机构名实体识别。
Metrics details
| Stars | 1,294 |
maciejkula/glove-python
Toy Python implementation of http://www-nlp.stanford.edu/projects/glove/
Metrics details
| Stars | 1,253 |
shangjingbo1226/AutoPhrase
AutoPhrase: Automated Phrase Mining from Massive Text Corpora
Metrics details
| Stars | 1,201 |
pemistahl/lingua-rs
The most accurate natural language detection library for Rust, suitable for short text and mixed-language text
Metrics details
| Stars | 1,106 |
allenai/s2orc
S2ORC: The Semantic Scholar Open Research Corpus: https://www.aclweb.org/anthology/2020.acl-main.447/
Metrics details
| Stars | 1,073 |
chatopera/insuranceqa-corpus-zh
:helicopter: 保险行业语料库,聊天机器人
Metrics details
| Stars | 1,062 |
RaRe-Technologies/gensim-data
Data repository for pretrained NLP models and NLP corpora.
Metrics details
| Stars | 1,056 |
pisa-engine/pisa
PISA: Performant Indexes and Search for Academia
Metrics details
| Stars | 1,052 |
CLUEbenchmark/CLUECorpus2020
Large-scale Pre-training Corpus for Chinese 100G 中文预训练语料
Metrics details
| Stars | 1,015 |
PlexPt/chatgpt-corpus
ChatGPT 中文语料库 对话语料 小说语料 客服语料 用于训练大模型
Metrics details
| Stars | 965 |
OYE93/Chinese-NLP-Corpus
Collections of Chinese NLP corpus
Metrics details
| Stars | 921 |
karthikncode/nlp-datasets
A list of datasets/corpora for NLP tasks, in reverse chronological order.
Metrics details
| Stars | 918 |
oh-my-ocr/text_renderer
Generate text line images for training deep learning OCR models
Metrics details
| Stars | 914 |
cltk/cltk
The Classical Language Toolkit
Metrics details
| Stars | 912 |
quanteda/quanteda
An R package for the Quantitative Analysis of Textual Data
Metrics details
| Stars | 886 |
soskek/bookcorpus
Crawl BookCorpus
Metrics details
| Stars | 863 |
CBLUEbenchmark/CBLUE
[CBLUE1] 中文医疗信息处理基准CBLUE: A Chinese Biomedical Language Understanding Evaluation Benchmark
Metrics details
| Stars | 847 |
zhezhaoa/ngram2vec
Four word embedding models implemented in Python. Supporting arbitrary context features
Metrics details
| Stars | 846 |
tensorlayer/seq2seq-chatbot
Chatbot in 200 lines of code using TensorLayer
Metrics details
| Stars | 837 |
