Skip to content

Repository files navigation

Question-Classification

Classifying questions from UIUC's CogComp QC Dataset

Classifying Questions into Coarse (6 classes) and Fine (50 classes) classes.

Approach

  1. Text Exploration
  2. Text Cleaning
  3. Obtaing POS Tags, Identifying Named Entities, Lemmas, Syntactic Dependency Relations and Orthographic Features.
  4. Using the obtained properties as Features.
  5. Using a Linear SVM model on the engineered features.

Results

  • 88.2% accuracy on Coarse classes.
  • 81.6% accuracy on Fine classes.
Variations in Features UsedCoarse Set AccuracyCoarse:Fine Set AccuracyFine Set Accuracy
Named Entity Recognition + Lemmas + POS Tags + Syntactic Dependency + Shape87.880.480.8
Named Entity Recognition + Lemmas + POS Tags + Syntactic Dependency87.280.681.4
Named Entity Recognition + Lemmas + POS Tags88.281.481.2
Named Entity Recognition + Lemmas86.480.681.6
Lemmas86.280.481.6

References

https://nlp.stanford.edu/courses/cs224n/2010/reports/olalerew.pdf

Releases

Packages

Contributors

Languages