Repository to show how NLP can tacke real problem. Including the source code, dataset, state-of-the art in NLP
| Section | Sub-Section | Research Lab | Story | Paper & Code |
|---|---|---|---|---|
| Augmentation | Data Augmentation in NLP | Medium | ||
| Augmentation | Data Augmentation library for text | Medium | ||
| Augmentation | Data Augmentation library for Speech Recognition | Medium | ||
| Augmentation | Data Augmentation library for Audio | Medium |
| Section | Sub-Section | Description | Link |
|---|---|---|---|
| Tokenization | Subword Tokenization | Medium | |
| Tokenization | Word Tokenization | MediumGithub | |
| Tokenization | Sentence Tokenization | MediumGithub | |
| Part of Speech | MediumGithub | ||
| Lemmatization | MediumGithub | ||
| Stemming | MediumGithub | ||
| Stop Words | MediumGithub | ||
| Phrase Word Recognition | |||
| Spell Checking | Lexicon-based | Peter Norvig algorithm | MediumGithub |
| Lexicon-based | Symspell | MediumGithub | |
| Machine Translation | Statistical Machine Translation | Medium | |
| Machine Translation | Attention | Medium | |
| String Matching | Fuzzywuzzy | MediumGithub |
| Section | Sub-Section | Research Lab | Story | Paper & Code |
|---|---|---|---|---|
| Pattern-based Recognition | Medium | |||
| Lexicon-based Recognition | Medium | |||
| Pre-trained NER | Spacy | MediumGithub | ||
| Custom NER |
| Section | Sub-Section | Research Lab | Story | Paper & Code |
|---|---|---|---|---|
| Printed Text | Google Cloud Vision API | Medium | Paper | |
| Handwriting | LSTM | Medium | Paper |
| Section | Sub-Section | Description | Link |
|---|---|---|---|
| Extractive Approach | MediumGithub | ||
| Abstractive Approach |
| Section | Sub-Section | Description | Link | Paper |
|---|---|---|---|---|
| Euclidean Distance, Cosine Similarity and Jaccard Similarity | MediumGithub | |||
| Edit Distance | Levenshtein Distance | MediumGithub | ||
| Word Moving Distance (WMD) | MediumGithub | |||
| Supervised Word Moving Distance (S-WMD) | Medium | |||
| Manhattan LSTM | Medium | Paper |
| Section | Sub-Section | Research Lab | Story | Paper & Code |
|---|---|---|---|---|
| Traditional Method | Bag-of-words (BoW) | MediumGithub | ||
| Latent Semantic Analysis (LSA) and Latent Dirichlet Allocation (LDA) | MediumGithub | |||
| Character Level | Character Embedding | New York University | MediumGithub | Paper |
| Word Level | Negative Sampling and Hierarchical Softmax | Medium | ||
| Word2Vec, GloVe, fastText | MediumGithub | |||
| Contextualized Word Vectors (CoVe) | Salesforce | MediumGithub | PaperCode | |
| Embeddings from Language Models (ELMo) | AI2 | MediumGithub | PaperCode | |
| Generative Pre-Training (GPT) | OpenAI | Medium | PaperCode | |
| Contextual String Embeddings | Zalando Research | Medium | PaperCode | |
| Self-Governing Neural Networks (SGNN) | Medium | Paper | ||
| Multi-Task Deep Neural Networks (MT-DNN) | Microsoft | Medium | Paper | |
| Generative Pre-Training-2 (GPT-2) | OpenAI | Medium | PaperCode | |
| Universal Language Model Fine-tuning (ULMFiT) | OpenAI | Medium | PaperCode | |
| Sentence Level | Skip-thoughts | MediumGithub | PaperCode | |
| InferSent | MediumGithub | PaperCode | ||
| Quick-Thoughts | Medium | PaperCode | ||
| General Purpose Sentence (GenSen) | Medium | PaperCode | ||
| Bidirectional Encoder Representations from Transformers (BERT) | Medium | PaperCode | ||
| BERT in Science Domain | Medium | SciBERT PaperBioBERT Paper | ||
| BERT in Clinical Domain | Medium | Clincical BERT Embeddings PaperClinicalBert Paper | ||
| Document Level | lda2vec | Medium | Paper | |
| doc2vec | MediumGithub | Paper |
| Section | Sub-Section | Description | Link |
|---|---|---|---|
| ELI5, LIME and Skater | MediumGithub | ||
| SHapley Additive exPlanations (SHAP) | MediumGithub | ||
| Anchors | MediumGithub |
| Section | Sub-Section | Description | Link |
|---|---|---|---|
| Using Deep Learning can resolve all problem? | MediumKaggle |
| Section | Sub-Section | Description | Link |
|---|---|---|---|
| Spellcheck | Github | ||
| InferSent | Github |