<p>The rapid integration of large language models into scholarly writing raises urgent questions about the detectability and linguistic consequences of AI-assisted academic prose. This study presents a corpus-based analysis of 200 Scopus-indexed Q1 research articles (2.76 million words, 2021–2024), comparing AI-assisted texts with human-authored controls across seven linguistically motivated feature categories: Academic Vocabulary List density, passive-voice frequency, hedging ratio, metadiscourse density, type–token ratio, nominalisation rate, and mean sentence length. A mixed-methods design combining quantitative corpus tools (AntConc 4.2, LIWC-22, Coh-Metrix 3.0) with qualitative discourse analysis reveals statistically significant between-group differences across all seven dimensions, with large-to-very-large effect sizes (Cohen's d = 1.25–3.52, <i>p</i> &lt; .001 after Bonferroni correction). Confirmatory factor analysis identifies a single latent AI-Register Factor (ARF, CFI = .97, RMSEA = .048) accounting for 68% of shared variance. These findings contribute a theoretically grounded register profile of AI-assisted academic prose with immediate relevance for computational detection pipelines, register theory, and academic integrity policy.</p>

错误:搜索内容不能为空,请输入英文关键词
错误:关键词超出字数限制,请精简
高级检索

Detecting AI-generated academic language in recently published research articles: a corpus-based linguistic analysis

  • Dilyorjon Solidjonov

摘要

The rapid integration of large language models into scholarly writing raises urgent questions about the detectability and linguistic consequences of AI-assisted academic prose. This study presents a corpus-based analysis of 200 Scopus-indexed Q1 research articles (2.76 million words, 2021–2024), comparing AI-assisted texts with human-authored controls across seven linguistically motivated feature categories: Academic Vocabulary List density, passive-voice frequency, hedging ratio, metadiscourse density, type–token ratio, nominalisation rate, and mean sentence length. A mixed-methods design combining quantitative corpus tools (AntConc 4.2, LIWC-22, Coh-Metrix 3.0) with qualitative discourse analysis reveals statistically significant between-group differences across all seven dimensions, with large-to-very-large effect sizes (Cohen's d = 1.25–3.52, p < .001 after Bonferroni correction). Confirmatory factor analysis identifies a single latent AI-Register Factor (ARF, CFI = .97, RMSEA = .048) accounting for 68% of shared variance. These findings contribute a theoretically grounded register profile of AI-assisted academic prose with immediate relevance for computational detection pipelines, register theory, and academic integrity policy.