Natural Language Processing
brightmart/nlp_chinese_corpus
大规模中文自然语言处理语料 Large Scale Chinese Corpus for NLP
🗂️ Text Classification❓ Question Answering🧬 Embeddings🤖 Language Models
OtherMITupdated Feb 6, 2026
MNBVC(Massive Never-ending BT Vast Chinese corpus)超大规模中文语料集。对标chatGPT训练的40T数据。MNBVC数据集不但包括主流文化,也包括各个小众文化甚至火星文的数据。MNBVC数据集包括新闻、作文、小说、书籍、杂志、论文、台词、帖子、wiki、古诗、歌词、商品介绍、笑话、糗事、聊天记录等一切形式的纯文本中文数据。
$ git clone https://github.com/esbatmop/MNBVC.git大规模中文自然语言处理语料 Large Scale Chinese Corpus for NLP
Chinese-LLaMA 1&2、Chinese-Falcon 基础模型;ChatFlow中文对话模型;中文OpenLLaMA模型;NLP预训练/指令微调数据集
Chinese Open Information Extraction (Tree-based Triple Relation Extraction Module)
Chinese version of GPT2 training code, using BERT tokenizer.
ansj分词.ict的真正java实现.分词效果速度都超过开源版的ict. 中文分词,人名识别,词性标注,用户自定义词典
Chinese version of CLIP which achieves Chinese cross-modal retrieval and representation generation.
Data from GitHub · snapshot Sep 24, 2026