|
由于篇幅限制,有谁需要,留邮箱.
DNA序列分类
摘要
本问题是一个“有人管理分类问题” (即模式识别中的“有监督模式识别”问题)。 首先分别列举出20个学习样本序列中1字符串、2字符串、3字符串出现的频率,构成含41个变量的基本特征集,接着用主成分分析法从中提取出4个特征。然后用Fisher线性判别法进行分类,得出了所求20个人工制造序列及182个自然序列的分类结果如下:
1)20个人工序列:22, 23,25,27,29,34,35,36,37为A类,其余为B类。
2)182个自然序列:1,4,8,10,27,29,32,41,43,48,54,63,70,72,75,76,81,86,90,92,102,110,116,119,126,131,144,150,157,159,160,161,162,163,164,165,166,169,170,182为B类,其余为A类。
最后通过检验证明所用的分类数学模型效率较高。
|
|