Enhancing Telugu Sarcasm Classification Models with Word Embeddings in Imbalanced Datasets
摘要
Sarcasm classification in non-English languages, like Telugu, presents NLP challenges due to data scarcity and model limitations. Our approach integrates FastText, IndicFT embeddings, and classifiers such as decision tree, k-NN, random forest, Naive Bayes, and SVM to detect sarcasm in Telugu. Addressing class imbalance via undersampling, oversampling, ensembling, and anomaly detection methods, we achieve balanced datasets and enhance model performance. SVM consistently attains high accuracy (0.76–0.801 in validation, 0.67–0.88 in test), followed by strong performances from random forest and Naive Bayes (up to 0.91) in anomaly detection. Our work advances sarcasm detection in non-English languages, offering effective strategies for Telugu text.