Language Models
explosion/spacy-transformers
πΈ Use pretrained transformers like BERT, XLNet and GPT-2 in spaCy
π§ Natural Language Processing
PythonMITupdated Mar 27, 2026
π₯ Fast State-of-the-Art Tokenizers optimized for Research and Production
$ git clone https://github.com/huggingface/tokenizers.gitπΈ Use pretrained transformers like BERT, XLNet and GPT-2 in spaCy
π Awesome Treasure of Transformers Models for Natural Language processing contains papers, videos, blogs, official repo along with colab Notebooks. π«βοΈ
Korean BERT pre-trained cased (KoBERT)
Revisiting Pre-trained Models for Chinese Natural Language Processing (MacBERT)
a sklearn wrapper for Google's BERT model
ExtremeBERT is a toolkit that accelerates the pretraining of customized language models on customized datasets, described in the paper βExtremeBERT: A Toolkit for Accelerating Pretraining of Customized BERTβ.
Data from GitHub Β· snapshot Sep 24, 2026