<p>Permutation groups provide a natural framework for modeling genomes and their rearrangement events, which is crucial for understanding evolutionary relationships. Double cosets can be used to model objects arising from multiple symmetries, such as circular genomes with repeated genes. Suppose <InlineEquation ID="IEq1"> <EquationSource Format="TEX">\({\varvec{\lambda } = \varvec{( \lambda _1,}\varvec{\lambda _2,} \varvec{\dots , \lambda _k)}}\)</EquationSource> <EquationSource Format="MATHML"><math> <mrow> <mrow> <mi mathvariant="bold-italic">λ</mi> </mrow> <mo>=</mo> <mrow> <mo mathvariant="bold" stretchy="false">(</mo> <msub> <mi mathvariant="bold-italic">λ</mi> <mn mathvariant="bold">1</mn> </msub> <mo mathvariant="bold">,</mo> </mrow> <mrow> <msub> <mi mathvariant="bold-italic">λ</mi> <mn mathvariant="bold">2</mn> </msub> <mo mathvariant="bold">,</mo> </mrow> <mrow> <mo mathvariant="bold">⋯</mo> <mo mathvariant="bold">,</mo> <msub> <mi mathvariant="bold-italic">λ</mi> <mi mathvariant="bold-italic">k</mi> </msub> <mrow> <mo mathvariant="bold" stretchy="false">)</mo> </mrow> </mrow> </mrow> </math></EquationSource> </InlineEquation> is a partition of <InlineEquation ID="IEq2"> <EquationSource Format="TEX">\({{\varvec{n}}}\)</EquationSource> <EquationSource Format="MATHML"><math> <mrow> <mi mathvariant="bold-italic">n</mi> </mrow> </math></EquationSource> </InlineEquation> which indicates the number of repeated regions or genes of different types (<InlineEquation ID="IEq3"> <EquationSource Format="TEX">\(\varvec{\lambda _i}\)</EquationSource> <EquationSource Format="MATHML"><math> <mrow> <msub> <mi mathvariant="bold-italic">λ</mi> <mi mathvariant="bold-italic">i</mi> </msub> </mrow> </math></EquationSource> </InlineEquation> of type <InlineEquation ID="IEq4"> <EquationSource Format="TEX">\({{\varvec{i}}}\)</EquationSource> <EquationSource Format="MATHML"><math> <mrow> <mi mathvariant="bold-italic">i</mi> </mrow> </math></EquationSource> </InlineEquation> with <InlineEquation ID="IEq5"> <EquationSource Format="TEX">\({{\varvec{n}}}\)</EquationSource> <EquationSource Format="MATHML"><math> <mrow> <mi mathvariant="bold-italic">n</mi> </mrow> </math></EquationSource> </InlineEquation> total regions). A circular genome with <InlineEquation ID="IEq6"> <EquationSource Format="TEX">\({{\varvec{n}}}\)</EquationSource> <EquationSource Format="MATHML"><math> <mrow> <mi mathvariant="bold-italic">n</mi> </mrow> </math></EquationSource> </InlineEquation> oriented regions determined by <InlineEquation ID="IEq7"> <EquationSource Format="TEX">\(\varvec{\lambda }\)</EquationSource> <EquationSource Format="MATHML"><math> <mrow> <mi mathvariant="bold-italic">λ</mi> </mrow> </math></EquationSource> </InlineEquation> can be identified with the double coset space <InlineEquation ID="IEq8"> <EquationSource Format="TEX">\({\varvec{S}}_{\varvec{\lambda }} \backslash {\varvec{B}}_{\varvec{n}} / {\varvec{D}}_{\varvec{n}}\)</EquationSource> <EquationSource Format="MATHML"><math> <mrow> <msub> <mrow> <mi mathvariant="bold-italic">S</mi> </mrow> <mrow> <mi mathvariant="bold-italic">λ</mi> </mrow> </msub> <mrow> <mo stretchy="true">\</mo> </mrow> <msub> <mrow> <mi mathvariant="bold-italic">B</mi> </mrow> <mrow> <mi mathvariant="bold-italic">n</mi> </mrow> </msub> <mo stretchy="false">/</mo> <msub> <mrow> <mi mathvariant="bold-italic">D</mi> </mrow> <mrow> <mi mathvariant="bold-italic">n</mi> </mrow> </msub> </mrow> </math></EquationSource> </InlineEquation>, where <InlineEquation ID="IEq9"> <EquationSource Format="TEX">\(\varvec{B_n}\)</EquationSource> <EquationSource Format="MATHML"><math> <mrow> <msub> <mi mathvariant="bold-italic">B</mi> <mi mathvariant="bold-italic">n</mi> </msub> </mrow> </math></EquationSource> </InlineEquation> is the hyperoctahedral group, <InlineEquation ID="IEq10"> <EquationSource Format="TEX">\(\varvec{D_n}\)</EquationSource> <EquationSource Format="MATHML"><math> <mrow> <msub> <mi mathvariant="bold-italic">D</mi> <mi mathvariant="bold-italic">n</mi> </msub> </mrow> </math></EquationSource> </InlineEquation> the dihedral group extended to <InlineEquation ID="IEq11"> <EquationSource Format="TEX">\(\varvec{B_n}\)</EquationSource> <EquationSource Format="MATHML"><math> <mrow> <msub> <mi mathvariant="bold-italic">B</mi> <mi mathvariant="bold-italic">n</mi> </msub> </mrow> </math></EquationSource> </InlineEquation>, and <InlineEquation ID="IEq12"> <EquationSource Format="TEX">\(\varvec{S_\lambda }\)</EquationSource> <EquationSource Format="MATHML"><math> <mrow> <msub> <mi mathvariant="bold-italic">S</mi> <mi mathvariant="bold-italic">λ</mi> </msub> </mrow> </math></EquationSource> </InlineEquation> the Young subgroup extended to <InlineEquation ID="IEq13"> <EquationSource Format="TEX">\(\varvec{B_n}\)</EquationSource> <EquationSource Format="MATHML"><math> <mrow> <msub> <mi mathvariant="bold-italic">B</mi> <mi mathvariant="bold-italic">n</mi> </msub> </mrow> </math></EquationSource> </InlineEquation>. This paper develops this correspondence and derives formulas for the sizes of double cosets and the number of double cosets in special cases. The size of double cosets gives the induced probability distribution on genomes from uniformly sampling <InlineEquation ID="IEq14"> <EquationSource Format="TEX">\(\varvec{B_n}\)</EquationSource> <EquationSource Format="MATHML"><math> <mrow> <msub> <mi mathvariant="bold-italic">B</mi> <mi mathvariant="bold-italic">n</mi> </msub> </mrow> </math></EquationSource> </InlineEquation>. The representation is utilized to define Markov chains which capture the processes of inversions, transpositions, and translocations.</p>

错误:搜索内容不能为空,请输入英文关键词
错误:关键词超出字数限制,请精简
高级检索

Genome rearrangements as double coset Markov chains

  • Mackenzie A. Simper

摘要

Permutation groups provide a natural framework for modeling genomes and their rearrangement events, which is crucial for understanding evolutionary relationships. Double cosets can be used to model objects arising from multiple symmetries, such as circular genomes with repeated genes. Suppose \({\varvec{\lambda } = \varvec{( \lambda _1,}\varvec{\lambda _2,} \varvec{\dots , \lambda _k)}}\) λ = ( λ 1 , λ 2 , , λ k ) is a partition of \({{\varvec{n}}}\) n which indicates the number of repeated regions or genes of different types ( \(\varvec{\lambda _i}\) λ i of type \({{\varvec{i}}}\) i with \({{\varvec{n}}}\) n total regions). A circular genome with \({{\varvec{n}}}\) n oriented regions determined by \(\varvec{\lambda }\) λ can be identified with the double coset space \({\varvec{S}}_{\varvec{\lambda }} \backslash {\varvec{B}}_{\varvec{n}} / {\varvec{D}}_{\varvec{n}}\) S λ \ B n / D n , where \(\varvec{B_n}\) B n is the hyperoctahedral group, \(\varvec{D_n}\) D n the dihedral group extended to \(\varvec{B_n}\) B n , and \(\varvec{S_\lambda }\) S λ the Young subgroup extended to \(\varvec{B_n}\) B n . This paper develops this correspondence and derives formulas for the sizes of double cosets and the number of double cosets in special cases. The size of double cosets gives the induced probability distribution on genomes from uniformly sampling \(\varvec{B_n}\) B n . The representation is utilized to define Markov chains which capture the processes of inversions, transpositions, and translocations.