Analysis and Extraction of Semantic Genes
摘要
This chapter presents a principled method for extracting semantic genes from the contemporary Chinese lexicon. Drawing on prior studies of semantic primitives—basic vocabulary, definitional atoms, analytical primitives, and conceptual primes—it formulates extraction criteria that integrate resource reuse, linguistic analysis, and statistical optimization. The approach combines top-down with bottom-up strategies, predefined inventories with structural discovery, and linguistic expertise with encyclopedic knowledge. The procedure proceeds in six stages: (1) constructing a top-level general-vocabulary ontology, (2) predefining a core gene set, (3) selecting a semantic class, (4) delineating a minimal semantic field, (5) performing semantic analysis and extraction, and (6) iterative refinement.