Comparative Analysis of Multiple Embedding Models for Text Based Document Similarity
摘要
Document similarity is a foundational task when it comes to applications such as plagiarism detection, information retrieval, and other Natural language processing domains. Traditional similarity measures, primarily based on lexical comparison, such as Jaccard index and cosine similarity, have constrained capability of capturing semantic relationship. Recent progression in embedding models, including BERT, RoBERTa, XLNet and SBERT, have significantly enhanced the capability to represent semantic similarity within vector spaces. This study focuses on consolidating the model preference based on use case correlating embedding models and similarity metrics while considering their effectiveness for capturing semantic document similarity. We employ advanced metrics such as Soft Cosine Similarity and Jensen-Shannon distance to assess the performance of these embeddings on benchmark datasets. Our findings indicate that the Soft Cosine Similarity metric, when coupled with the SBERT paraphrase-MiniLM-L6-v2 model, demonstrates superior performance in accurately capturing semantic document similarity.