Sarcasm classification in non-English languages, like Telugu, presents NLP challenges due to data scarcity and model limitations. Our approach integrates FastText, IndicFT embeddings, and classifiers such as decision tree, k-NN, random forest, Naive Bayes, and SVM to detect sarcasm in Telugu. Addressing class imbalance via undersampling, oversampling, ensembling, and anomaly detection methods, we achieve balanced datasets and enhance model performance. SVM consistently attains high accuracy (0.76–0.801 in validation, 0.67–0.88 in test), followed by strong performances from random forest and Naive Bayes (up to 0.91) in anomaly detection. Our work advances sarcasm detection in non-English languages, offering effective strategies for Telugu text.

错误:搜索内容不能为空,请输入英文关键词
错误:关键词超出字数限制,请精简
高级检索

Enhancing Telugu Sarcasm Classification Models with Word Embeddings in Imbalanced Datasets

  • Venkataramana Battula,
  • Nikhil Teja Nune,
  • Anirudh Bojji,
  • Bollu Siddharth Reddy,
  • Chandrababu Namani,
  • Saini Polisetty,
  • Pradyumna Chacham,
  • Koushik Pyarasani

摘要

Sarcasm classification in non-English languages, like Telugu, presents NLP challenges due to data scarcity and model limitations. Our approach integrates FastText, IndicFT embeddings, and classifiers such as decision tree, k-NN, random forest, Naive Bayes, and SVM to detect sarcasm in Telugu. Addressing class imbalance via undersampling, oversampling, ensembling, and anomaly detection methods, we achieve balanced datasets and enhance model performance. SVM consistently attains high accuracy (0.76–0.801 in validation, 0.67–0.88 in test), followed by strong performances from random forest and Naive Bayes (up to 0.91) in anomaly detection. Our work advances sarcasm detection in non-English languages, offering effective strategies for Telugu text.