基于计算机的启动子识别技术
2026/9/24 11:39:19点击:
1=SimSun中分类号523+.8文献标识码汨人们获得各种核酸和蛋白质序列的目的是为了了解这些序列在生物体中充当了什么样的角色。例如,0入序列中重复片段编码区内含子外显子转录因子结合位点等信息。虽然用实验的方法是多年以来解决这类问的主要途径,但随着人类基因组计划的完成,新的思路是利用己有的对生物序列结构和功能特性的认识,用生物信息学的方法通过计算机模拟和分析来预测出这些信息或提供与之相关的辅助信息。
在人类基因组的,以入序列当中,编码了两类重要的功能信息。类是入序列的编码区,它决定了基因产物的结构和功能;另类是调控区,它控制和调控基因在什么时间什么地点以及如何达,从而实现预定有序不可逆转的分化发育过程。启动子就是*重要的调控区,它决定了基因达的关键性的第步,的转录。
1启动子简介启动子这个术语*先于1964年被遗传学家用于描述乳糖操纵子中位于3个基因紧邻上游的区段的功能。当该位点突变失活后,基因就不能达因此这位点似乎负责启动下游基因的达。现在我们知道这是由于该位点是负责转录操纵子位于基因编码区起点上游20600个核苷酸。
在真核生物中,启动子词用于指所有对基因转录起始有重要作用的序列。对于某些基因,这些序列可能有多个,各具有不同的功能,不仅包括作为起始复合物组装位点的核心启动子6 9,106还包括!或多个位于核心启动子上游的上游启动子元件。核心启动子上起始复合物的组装通常可以在没有上游元件的情况下发生,但效率很低。这明结合于上游起始复合物的蛋白质中至少有些是可以启动基因达的转录激活物,通过试验手段也证实了这些序列在启动子中的存在。真核生物的种聚合酶分别识别不同的启动子序列。在这里根据我们的目的,把以转录起始位点,3为中心。上下游500,+100区间的范围作为启动子的定义范围。
总的来说,启动子是非常重要的控制和调控转录的DNA区域。启动子结构的研究对于基因达模式基因调控网络细胞特异性等方面是十分重要的。鉴于启动子具有如此重要中包含的信息,已经成为后基因组时代个非常重要的课。
本篇文章主要介绍下当前国际上应用计算机技术对启动子进行识别的技术发展水平。
2基于计算机的启动子识别技术研究目前基于计算机的启动子识别技术根据研究目标大体可以分为两类类是共性启动子的识别技术明肪阳1出,38,另类是特异性启动子的识别技术866爪,168,1出,43.共性启动子识别技术主要目标是在基因组中识别出基因的转录起始位点巧3和或核心启动子,将启动子区域与其他的基因组的区域分特异性启动子的识别技术主要是寻找与组特定转录有关的基因的转录因子结合位点,该方法可以为下游基因的功能研究提供直接线索。
2.1特异性启动子识别技术特异性启动子识别技术的主要目的是寻找特异性转录因子在入序列上的结合位点转录因子结合位点。特异性启动子所以特异,就是因为它们具有组特异性转录因子结合位点,该位点与特异转录因子结合,调控目的基因达。如何识别这些特异性转录因子结合位点,就成为启动子识别的关键。目前进行启动子特异性转录因子结合位点识别的方法有以下几种手段,05369,如6共有序列方法,耶此369,6方法是*早的用于搜寻转录因子结合位点的方法,它是指给定组位点样本,经过对齐,得到个可以近似地匹配所有位点样本的共有序列,但并不要求在各个位置上完全匹配。共有序列中允许的不匹配的数目模糊性与共有序列用于搜寻时所具有的精确性敏感性息息相关。
目前共有序列如何定义存在某种程度上具有定的任意性,还在积极探索。
位置加权矩阵法03出0613,贾肘另种可供选择的方法就是位置加权矩阵法。它是用位置加权矩阵来组己知位点样本,然后用该矩阵搜寻未知的位点。利用该矩阵,转录因子结合位点的各位置上每种可能出现的核苷酸都分配个权值,对个特定的序列,将各位置的相应分数加和后给出该序列作为潜在位点的得分,通过与个事先确定好的阈值进行比较,来判断该特定序列是否为位点。在些情况下,这些分数大约与转录因子的结合能成正比。
该方法的原理是基于8叫和7,987提出来的关于调控蛋白转录因子选择,以入结合位点的理论为了解释在DNA序列中许多位点所具有的简并性,Berg和vonHippel提出特异性结合位点的选择是要满足定功能性限制的,例如结合的亲和力或者活性必须在定的允许范围内,所有能够满足这个要求的序列都可能成为特异性转录因子结合位点。这个理论己经通过实验手段检验,成为,肘贾方法的理论基础。
该方法大致思路如下首先获得组已知的转录因子结合位点集合,将该集合作为训练集,得到该组集合的位置加权矩阵,利用优化程序,确定结合位点判定阈值。对于任意长因子结合位点的相似性。这个序列的总得分为序列中每位置碱基的得分之和,任何得分超过特定阈值的序列就认为是个转录因子结合位点。
对于组功能相近的已知位点的序列,在无法进行对齐丁1元组思想,151;是指在序列中相匹配的很短的序列片段。反加抖3的基本思想就是在集合中自动搜寻过达的16.根据模体特点的不同,可以采用不同的模体搜寻方法。
对于短的具有高度保守序列的模体例如在酵母中的转录因子结合位点,可以米用相对信息法尺613如6尺1法是*简单的方法,计算在样本集合和目标集合中的所有元组的频率,来确定转录因子结合位点。23哗,肘。于1999年应用该方法用于酵母启动子的分析识别。贾,41方法与尺1方法近似,但是要求搜寻的模体要被大多数序列所拥有。
对于长的具有简并性的4,证8,可以采用多序列比对算法或局部比对算法,对于序列数为1序列长度为模体长度为的集合,共有,民+1爪种比对数。目前采用该方案的程序,1撕1腿8方法是个贪婪算法,1989年由8印3,和出提出,其大致过程如下对于要比对的第条序列,首先形成该序列中每个反元组的频率矩阵;然后对于这些矩阵,再和第条序列的每个反元组形成新的包含两个反元组的的矩阵;对于每个反元组矩阵,只保留*佳的民元组矩阵通过信息容量infomlationcontent函数来度量;然后进入下循环,对于每个保留下来的矩阵,再和第条序列组。同样,根据信息容量0001再只保留*佳的矩阵。如此循环,直至*后个序列的反元组也加入到矩阵中,在*后个循环保留下来的所有矩阵中,信息容量*好的矩阵就认为是代了要搜寻的模体。
1990年*先提出的,并且用循环磷酸盐受体蛋白结合位点对它进行了测试,该方法包括迭代进行的两个步骤第步是求期望值步骤,第步是求*大值,反复迭代以上两个步骤,直至收敛到估计的参数不再改变为止。
肘肘方法是87和13在1994年提出的,对肘方法进行了些改进肘肘根据数据集,自动地选择起始点;它消除了个序列个,迸的假设,允许个序列可以含有零个个甚至几个共有迸。另外在找到个1以后,厘可以消除它的影响,不影响以后的搜寻。
2.2特异性启动子识别方法的发展特异性启动子识别方法随着基因组研究技术的发展。数据的不断积累而不断前进,未来的发展方向有以下几个方面由于启动子是在复合的转录因子协同作用下工作的,所以搜寻复合的转录因子结合位点更加具有意义;随着大规模基因过反元组法多序列比对法探测出来。
使用大规模达数据来探测启动子并推断调控网络将在功能基因组时代具有非常重要的地位;随着更多的基因组被测序,通过比较基因组中的非编码区来进行启动子探测己成为种重要的方案。
3通用启动子识别方法通用启动子识别方法主要目的是预测转录起始位点丁35和或核心启动子,目前对于通用启动子的识别方法主要有以下几种方法3.1基于0口6岛的搜寻方法在真核生物中,染色体DNA中的胞嘧啶有时可被DNA甲基转移酶加入个甲基而变成5甲基胞嘧啶。胞嘧啶甲基化现象在低等真核生物中较少,但在脊椎动物基因组中,高达10的胞嘧啶都被甲基化,植物中可高达3甲基化与基因活性抑制有关,通过克隆把甲基化或未甲基化的基因引入细胞,检测它们的达水平,实验结果明甲基化的DNA不达。甲基化常发生在某些基因连接区的,3,序列位点称,0岛,在动物的0财共有70的,被甲基化,造成0,岛的含量在基因组中大大降低旱娜笔б话惚蝗衔,怯,于甲基化,使得C变成T,从而导致CpG岛变成了TpG岛。然而在转录活化区,仅有30到40的,00被甲基化。在人类基因组中,具有同样的现象。在非基因区域,+含量低,而在基因区,0+的占量相当5口0岛含量高。,出加,346和50.在分辨率为2诎的情况下,通过搜寻,岛的方法来识别丁33,已经被证实是个很有效的方法。
3.2基于转录位点扫描的方法由于转录因子结合位点在启动子区域是过达的,所以可以通过转录因子结合位点的密度来识别丁33.该方法基本思想如下收集组数据集,包括启动子数据集转录因子数据集和非启动子数据集;对于启动子序列和非启动子序列分别计算公认的转录因子结合位点的密度,通过扫描测试序列,根据转录因子结合位点的密度来推测丁3.3基于元组的方法等3.4统计学原理方法各种基于公认的转录因子结合位点的方法具有以下些局限性基因的前后关系被忽略;被公认的位点中有相当多的是假阳性等等。为了克服这些问,科学家们又发展了基于统计学原理的方法,不使用任何公认的转录因子位点信息。
4结论以上只是简单介绍了启动子识别的些方法,还有许多方法可以应用到启动子的计算机识别当中来,例如神经网络方法隐马尔可夫模型方法。
1系统组成2,1.510.51入83工程塑料组成的缸体;半圆体玻璃钢罩;320240点阵10;单片机组成的电脑控制系统;恒温消毒过滤循环部分;高保真000影音播放系统;负离子发生器等。系统组成的原理框如下2治疗机理专用配制的漂浮液可以漂浮人体,电脑控制系统完成漂浮液的恒温消毒过滤循环,电脑控制的电磁阀规律开关,形成模拟水流,负离子发生器发出的大于500万个3负离子空气,呼吸负离子空气使血液呈弱碱性,增强抵抗力,进而消除疲劳,增进组织及细胞活化,促进血液循环和新陈代谢,调整改善由自律神经失调所导致的各种神经衰弱头疼失眠忧郁等症状;人体漂浮于水上,如失负重,全身放松,配合美妙的音乐,治疗效果更加明显。
3功能实现本机硬件电脑部分采用集成度高性能优越的公司805020单片机,美观大方的320,240点阵0,外围电路等组成,软件功能有温度控制8个循环程序模拟水流菜单,可以多种治疗方式,治疗时间消毒等。电脑驱动循环泵的开启电磁阀的启停,此时,漂浮液流过过滤器,紫外线消毒器,保证漂浮液的干净卫生。
4安全特征安全是整机的优先保证,因此,除选用优质的元器件漏电保护器外,本机电加热部分采用隔离加热技术,安全有效保证万无失。
5结论本机通过电子仿真技术成功模拟死海,治疗康复功能与体,安全,实用。经临床实践证明,本治疗仪为更多的精神压力患者解除痛苦,对大中小学生学习和运动员技能与心理训练有极好的帮助。
近10年来,生物学序列信息的爆炸性,长大大促进了各种序列分析和预测技术的发展,目前已经可以用理论预测预测方法都基于现有的生物学数据和己有的生物学知识,但在不同模型或算法基础上建立的不同分析程序有其定的适用范围和相应的限制条件,生物信息学的分析只是为生物学研究提供参考,这些信息能提研究的效率或提供研究的思路,但很多问还需要通过实验的方法得到验证。
启动子是基因达所必需的重要序列信号,识别出启动子对于基因辨识十分重要。上述的各种方法根据实验获得的转录因子结合特性来描述启动子的序列特征,并依次作为启动子预测的依据,但实际的效果并不十分理想,遗漏和假阳性都比较严重。总的来说,启动子仍是值得继续研究探索的难第军医大学生物医学工程系西安市710032 1赵国屏,等。生物信息学。北京科学出版社,2002 2张成岗,贺福初。生物信息学方法与实践。北京科学出版社,2002 3丁30如啤卫叫3碰1和3啤计算分子生物学前沿课。北京清华大学出版社2002
- 上一篇:没有啦
- 下一篇:脱机手写体汉字识别技术研究的几点思考 2026/9/24
