生物医学信息检索论文
当代,论文常用来指进行各个学术领域的研究和描述学术研究成果的文章,简称之为论文。下面是生物医学信息检索论文,请参考!
生物医学信息检索课程中双语教学研究
摘要: 本文探讨了双语教学在生物医学信息检索课程中的应用,小结了医学信息检索课程双语教学的方法和技巧,并基于教学实践,对潜在的问题提出了相应的解决方案。
关键词: 生物医学信息检索;双语教学;高等教育
0前言
21世纪全球经济一体化,科学技术飞速发展,英语作为国际上的全球化通用语言,其重要性不言而喻,它发挥的马太效应已经愈来愈明显。而我国传统的英语教育更侧重于理论知识的学习,对更为实际的语言应用能力则有所忽视,尤其是专业英语的教育存在较大的空白,导致相当多的学生在专业领域内英语的实际运用能力有限。但是现如今,无论是各类型企业还是科研机构,对同时具备良好的专业知识和高水平的英语应用能力的人才的需求非常大。可以说,作为高层次的人才,仅仅具备专业知识,而英语应用能力存在短板会极大地限制专业水平的进一步提高,降低国际交流与协作的效率,对职业生涯造成无法低估的伤害。高等教育应从多方面入手,努力培养有国际视野的“专业+英语”复合型人才,满足这一需求。双语教学作为一种与国际接轨的教学模式,一方面有利于提高学生的英语学习能力,另一方面可以更快速更全面地获取专业相关的科技进展,有利于提升学生的专业水平。而生物医学信息检索是一门关于信息获取、知识更新的课程,只有当学生具备良好的英语能力,才能更高效更全面地获取最前沿的信息,学习最先进的知识,更好地服务于生物医学行业。将双语教学应用于生物医学信息检索,是一个事半功倍的方法。①②笔者在生物医学信息检索的双语教学实践中,总结了一些方法与技巧,并对其潜在的问题提供相应的解决方案。
1方法与技巧
精选教材且及时调整课程难度
“工欲善其事,必先利其器”,双语教学的首要问题便是双语教材的选择,教材选择的好与坏,直接影响着教学效果的好坏。教育部高等教育司曾提出:“在有条件的高等学校的某些信息科学和技术课程中推动使用国外优秀教材的影印版进行英语或双语教学,以缩短我国与国际先进水平的差距,同时也有助于强化我国大学生的英语水平。”原版外文教材在内容上更具有前瞻性、专业的前沿知识也更加规范和优越,更利于学生接触到新知识,选择原版外文教材也是营造全英文环境的一个有利措施,可以高效率地学习专业词汇的使用、专业内容的表达。但是,到目前为止,我国的生物医学信息检索的双语教材选择比较少。而直接采用美国等发达国家的生物医学信息检索原版教材,其课程内容并不一致,而且由于国外教材是按照英文的思维方式编写的,对于学生来讲难度较大,会对学生造成很大的学习压力。综合以上原因,我们在授课中参考了国外的一部分原版教材以后,自编了适合学生全英文的教材和练习。该教材兼顾学生按教学大纲要求掌握专业知识和基本技能,重点强调与现行的生物医学前沿进展的联系。最后在教学实践过程中,根据学生的学习和掌握情况随时进行修改和调整。
多媒体教学结合上机实践
现代计算机和网络的普及大大减轻了双语教学中的困难。随着网络技术的发展和网络信息资源的大幅度增长,生物医学信息检索也更多地在网络上进行。为了配合这一现实的应用现状,我们在教学中采用了教师多媒体讲授和学生上机实践相结合的方式,旨在让学生们能摆脱纸上谈兵的桎梏,充分地将字面的知识固化为自己掌握的本领,能利用网络进行生物医学信息的检索。教师在教学中利用课件控制,对临场情况做出及时的响应调整教学策略和学习内容,以适应动态教学环境所带来的变化。在多媒体演示教学环境中,老师可将操作过程和所得到的结果展现在学生面前,让学生亲自动手操作,以使学生对知识的理解更加具体透彻。上机实践使得整个教学环境由静态向动态转变。这个方式一则是充分发挥学生的积极主动性,从老师“教”转化为学生“学”,二则有利于学生将理论学习和技能提升有机地结合在一起。这一方式在没有增加学时的情况下,本科生的生物医学信息检索课程的教学质量有了比较大的提升,得到学生的普遍好评。
小班教学增强师生交流
双语教学要考虑到学生之间的水平差异,采用小班教学的模式。我们在教学中发现双语教学的最大困难在于学生之间存在专业英语水平的差异,尤其是对于生源来源广泛的民族院校,这种情况尤其突出,教师如何平衡这种差异、并且及时调整教学的进度和难度是重中之重。而小班教学的方式能够保证信息的充分交流和师生的顺畅沟通,有利于增进学生对专业知识的理解和应用,也可以给授课老师及时反馈。小班教学可以营造一个良好的每个人都可以参与其中的双语氛围,获得更好的教学效果。
2问题与对策
加强专业英语学习
笔者在双语教学实践中发现,教学效果的好坏很大程度取决于学生自身的英文水平,尤其是专业英文水平。当学生的专业英文水平有限的'时候,会出现不能理解关键词的准确含义、无法阅读摘要的主要内容,进而不能获得所需要的信息。在这种情形之下,无论老师如何讲授信息检索的原理,介绍信息检索的方法,对于学生来讲,都会出现茫然不知所措的状态。比如说指定检索癌症相关信息,部分同学只知道cancer可以表示癌症,不知道还有tumor、carcinoma也可以表示癌症,并且词义在医学领域存在差异。再比如,在表述胃癌的时候,可以用stomachcancer,也可以用gastricCancer。针对这一情况,笔者在授课之初会详细讲解MeSH(MedicalSubjectHeadings),即由美国国家医学图书馆建立的一套完整详细的生物医学领域的主题词库。同时,笔者也建议先导课的专业课老师在授课的过程中,尽量采用全英文幻灯片展示,中英文对照学习的方式。上述措施可以有意识地帮助学生扩大专业词汇量和帮助学生理解专业描述,进而帮助学生克服双语教学中的最大障碍。这是从根本上解决双语教学对于学生来说较为困难的方式,也唯有真正具备良好的专业英语水平才可以从本质上掌握生物医学信息检索的方法,才能够满足今后的学习和工作的需求。另一方面,对于生物医学数据库的英文界面不熟悉才会增加学生学习的难度。笔者比较困惑的是,在上课之初,一部分同学不太理解starmenu的含义,对于全英文界面的数据库NCBI(NationalCenterforBiotechnologyInformation),ScienceDirect,Highwire,以及软件Endnote初次接触的时候更是如同看天书。这本身并不困难,但是会极大地增加学生的心理压力,所以这需要授课老师对界面进行详细的讲解和介绍,并给予学生足够的时间去熟悉界面,达到能够熟练掌握的水平,消除学生的畏难心理。
循序渐进
为了避免在学习过程中,学生出现习得性无助的情况,双语教学一定要采用循序渐进的方式进行。切忌一开始就加重学习任务加大学习难度,这样的结果是多数同学会跟不上老师的进度,产生严重的厌学心理,进而会完全放弃这门课程的学习。教师授课以前需要对学生的英文水平和专业覆盖面有一个大概的了解,和学生沟通交流他们的学习兴趣、需求和困难所在,并根据获取的信息结合教学大纲及时调整授课的内容、重点和难点。当学生第一次接触到该门课程的双语学习时,教师需利用其最初的新奇感和参与意识激发同学们的学习兴趣,从简到难的学习进度中,让同学们自主地参与到课程的学习中来,收获到成功的喜悦是进一步深入学习的强大动力。教师在课堂讲授中要循序渐进地增加英语表达的比例,在遇到部分专业词汇时需要做详尽的中文解释;在遇到英文表意较为复杂的情况也需要辅以中文指导,全场和学生保持沟通顺畅,把握教学难点和内容。双语授课不能单纯为了英文表达而表达,忽视了学生在课堂上专业水平的提升。同时也可以让学生自发组成学习小组,让英语基础比较好的同学带动其他同学的学习,同学之间互相促进互相合作,形成一个良好的互动氛围,从教师的“教”彻底转变为学生的“学”,让所有的同学参与到这个过程中来,避免个别同学落后于集体学习进度的情况。
3结语
双语医学信息检索这门课程既有利于学生英语应用能力的提高,同时也有利于学生专业知识的扩展和深化,可以极大地增强学生在今后的深造和就业中的竞争力。虽然这门课中还存在很多问题有待我们做进一步思考与改进,但是只要我们勇于拓新,这门课一定会发挥其作用、展现其价值。随着高等教育中教育理念的更新,双语教学在医学信息检索教学课中的运用会真正服务于学生,服务于社会。
生物医学动物实验研究论文
1实验设计
在开展生物医学研究时,研究者通过正确地运用统计学知识,可直接影响研究的质量。统计学设计的任务在于对研究的部署、实施,直到研究结果的解释进行系统的安排,力争做到以最少的人力、物力获得可靠的结论和信息。其目的在于确定某种处理是否会表现出某种特定的效应。在实验设计时应遵循惟一差异原则,即在进行两组比较时,两者之间仅有因处理因素不同而引起的差异,而其他实验条件相关的非处理因素都应保持等同。然而,处理组与对照组在反应上表现出的差别并不一定意味着是处理的结果。另有两种引起差别的可能性,即偏倚和偶然性。偏倚是指系统性差别,它不是因组间在处理上的不同所引起。生物医学实验中统计学设计和分析的目标就是消除潜在的偏倚,减少偶然性[2]。
实验的偏倚和控制
偏倚是在研究中从设计到实验实施和结果分析的各环节存在一些人为的、有系统倾向的非随机误差,它不是由于抽样造成的,而是某种偏性使得实验结果偏离它的真值。从所选择的生物医学问题到研究方案的制订与实施、实验的完成过程、实验的分析与解释,乃至实验结果的发表,均可能存在各式各样的偏倚[2]。这种偏倚常常表现为系统误差。偏倚的大小取决于研究的方法和具体的实验条件。常见的偏倚主要有选择性偏倚、观察性偏倚和混杂性偏倚。必须认识实验过程的偏倚,从实验设计起直到整个研究过程结束均要加以控制。正确的实验设计可控制选择性的偏倚,事前人为控制和采取相应的措施可避免和减少观察性的偏倚。对于混杂性偏倚,可将重要的混杂因素在设计阶段进行分层随机设计,使混杂因素在组间分布均衡;在统计分析阶段将混杂因素作为分层因素或采用有协变量分析方法,以消除混杂因素的影响。只有有效地控制或消除偏倚,方可减少结果的假阳性或假阴性。
减少偶然性的潜在影响
偶然性因素的作用可以减少,但不能完全排除。因为即使是在精心实施的研究中,接受同样处理的动物,其反应也不可能完全一样。适当的统计分析可使实验人员评估出现假阳性的概率,即根本不存在处理效应的情况下观察到差异的概率。这种概率越小,实验者发现真实效应的可能性就越大。为了更有把握地检测出真实效应,有必要减少偶然性的作用,并通过实验设计确保能在“噪声”之上识别真正的“信号”。
实验设计的要素
要消除生物医学实验中潜在的偏倚,减少偶然性,就应对实验对象、处理因素和实验效应这三个实验设计要素,按照对照、重复、随机化和均衡四项原则进行周到的设计与控制[3]。实验对象实验中处理因素所作用的对象称为实验对象。不同性质的实验研究需要选取不同种类的实验对象,一个完整的实验设计中所需实验对象的总数称为样本含量。生物医学试验中考虑动物实验对象时应关注以下几个方面:①动物种属的选择:选择实验动物的种属与品系时,尤其需要注意其背景反应的水平。为了将反应“信号”水平最大化,常常意味着应避免选择那些背景反应水平极低的动物种属或品系,但如果采用过度反应的动物种属或品系也同样会出现问题。动物物种选择中的其他问题,无论是实际问题(寿命、体型、易得性、对动物学特征的了解情况)或是理论问题(生化、生理或解剖结构与人的相似性),都需要从专业的角度认真加以考虑和权衡。②动物的数量:虽然从统计设计角度考虑可得出某项实验所需的动物数(样本含量),但所得出的数值往往很大。因此,虽然样本含量估计是保证结论可靠性(精度和检验效能)的前提,但基于实验的可操作性及经济原则方面的考虑,应结合统计学的计算结果与以往的生物医学研究经验予以确定。③动物的体重与年龄:为确保实验对象的同质性,实验中所使用的动物体重与年龄应尽可能相近;动物体重的标准差不应超出平均值的10%;啮齿类等小动物年龄相差不应超出1周,大动物年龄相差不应超出1个月。④动物的分层:为了准确检测一种处理因素引起的差别,各处理组在可能影响实验结果的其他非处理因素方面应尽可能具有同质性。当存在动物亚系间的差别时,有两种方法可得到更为准确的结论。一是在结果分析阶段将亚系作为一个“分层变量”处理,包括对两个亚系的结果进行单独分析,然后将结果综合,得出处理效应的总结论;二是将亚系作为实验设计的“区组因素”,这种情况下可使对照组与处理组中每个亚系动物数量相等。除以上所讨论的“亚系”之外,其他的非处理因素,如性别、窝别、体重段等也可作为分层变量进行局部控制,并据此进行分层随机化分组。处理因素设计实验研究时,要明确研究中的处理因素和影响实验效应的非处理因素。研究者希望通过对研究设计进行有计划的安排,从而能科学地考察其效应大小的因素称为处理因素或实验因素;研究者往往忽略对评价实验因素作用大小有一定干扰的重要的非处理因素或非实验因素(如动物的窝别、体重等);其他未加控制的许多因素的综合作用统称为实验误差。实验结果是处理因素和非处理因素共同作用而产生的实验效应,因此如何控制和排除非处理因素的干扰,正确显示处理的效应,是实验设计的基本任务。实验效应实验效应是处理因素作用于受试对象的反应和结果,是反映实验因素作用强弱的标志,它通过观察指标(统计学常将指标称为变量)来体现。如果指标选择不当,未能准确反映处理因素的作用,获得的研究结果就缺乏科学性,因此选择好观察指标是关系整个研究成败的重要环节。指标的观察应避免带有偏性或偏倚,要结合专业知识,尽可能多地选用客观性强的指标,在仪器和试剂允许的条件下,应尽可能多选用特异性强、灵敏度高、准确可靠的客观指标。对一些半客观(如尿液pH试纸读数值)或主观指标(行为测量、病理观察),一定要事先规定读取数值的严格标准,只有这样才能准确地分析实验结果,从而提高实验结果的可信度。
实验设计的原则
为了防止结果的偏倚,保证实验结果的准确性和最大化的表达,在进行生物医学实验设计时必须遵循统计学设计的对照、重复、随机化和均衡四个基本原则。生物医学实验中对照组的设置必须具备三个条件:①对等原则,即惟一差别原则,除处理因素外,对照组具备与实验组对等的非处理因素。在相互比较的各组间,除了给予的处理因素不同外,其他方面应与实验组具有一致性,如相同的实验单位来源(动物种属、体重等)和相同的实验条件、操作方式和喂养环境等。②同步原则,对照组与实验组设立之后,在整个研究进程中始终处于同一空间和同一时间。③专设原则,任何一个对照组都是为相应的实验组专门设立的。不得借用文献上的记载或以往结果或其他研究资料作为本研究之对照。
生物医学中常用的实验设计类型
如果需要在同一实验中同时评价几种不同的效应,实验者应该安排能区别各自效应差别的实验设计方法。生物医学中常用的实验设计有以下几项。完全随机设计完全随机设计是生物医学动物实验中最为常用的一种实验设计方法,它是一种单因素有k个水平(k≥2)组的实验设计。即实验设计可设置一个对照或多个剂量组的实验方案。本设计保证每个实验动物都有相同机会接受任何一种处理,而不受实验人员主观倾向的影响。本设计应用了重复和随机化两个原则,因此能使实验结果受非处理因素的影响基本一致,真实反映出实验的处理效应。随机区组设计随机化完全区组设计,简称随机区组设计,又称配伍组设计,是配对设计的扩展,它将几个条件相同的受试者划分在同一个区组或配伍组,然后再按随机的原则,将同一配伍组的受试者随机分配到各实验组。该设计方法的优点是每个区组内的k个实验单位有较好的同质性,比完全随机设计更容易察觉处理间的差别。这种方法须特别注意的是要求区组内实验单位数与处理数相同,实验结果中若有缺失值,统计分析将损失部分信息。拉丁方设计拉丁方设计从横行和直列两个方向进行双重局部控制,使得横行和直列两向皆成区组,是比随机区组设计多一个区组因素的设计。在拉丁方设计中,每一行或每一列都成为一个完全区组,而每一处理在每一行或每一列都只出现一次,也就是说,在拉丁方设计中,实验处理数=横行区组数=直列区组数=实验处理的重复数。析因设计析因实验设计又称全因子实验设计,属于多因素、多水平单效应的设计。它不仅可以检验每一因素各水平之间的效应差异,而且可以检验各因素之间的交互作用。交互作用是指一个因素不同水平间的效应差受另一因素的影响,包括协同交互作用和拮抗交互作用。析因实验主要用于分析交互作用,当因素及水平数过多时,所需的实验对象数、处理组数和实验次数大幅度增加,故一般采用较简单的析因实验。含有较多因素和水平的实验一般采用正交实验设计[5]。
2生物医学动物实验的描述统计学
生物医学实验资料的类型
生物医学实验对实验对象(动物)进行干预后测定的观测指标通常有以下类型:①连续性数据:测定结果表现为有数字大小和单位的数据,统计上称定量资料,如生理、生化指标,体重值,器官重量等。②分类数据:测定结果表现为按某属性划分的定性类别,统计上称为定性资料,具体又可以分为二值资料、多值名义资料和多值有序资料。如某反应为出现或不出现,死亡或未死亡,有畸形或无畸形;病理损害的严重程度(无、轻度、中度、重度)等。
统计描述指标
描述性统计学(或归纳统计学)是对样本观察/测量数据频率分布的定量研究,描述性统计的目的在于:①对测量值或观察值进行归纳浓缩,用统计量、统计图或统计表的形式表现;②估计总体分布的参数。资料的整理与探索对于某一测量指标,一般应从文献资料中了解其分布类型。如果没有判断概率分布的理论基础,应重复以大样本测定,绘制样本的频数分布图(理论上样本量要大于100),并经统计学检验拟合其分布。数据的描述统计量①连续性数据的频数分布:通过对样本资料编制频数分布表或做茎叶图,以确定资料分布的类型、频数分布的集中趋势和离散趋势、估计总体参数,也便于发现离群值。②中心位置的描述统计量:描述数据分布的集中趋势,常用指标为算术均数、中位数、众数、几何均数等。③离散程度的描述统计量:描述数据分布的离散趋势,常用指标为标准差和方差、极差和四分位数间距、变异系数和离散系数等。④统计学图表:统计图包括连续性数据分布的直方图、茎叶图,表示数据中心位置和离散程度的点杆图(做图时表示均数和标准差)和盒须图(做图时表示中位数、极差、四分位数间距),描述构成比数据资料的百分条图、饼图,描述经时变化趋势的线图,以及预测和检验分布类型的概率-概率图(P-P图)等[6]。统计表具有简单、明了、易于理解、便于比较的优点。编制统计表时原则上应当重点突出、层次分明、避免层次过多或结构混乱。一般的统计表应为三线表,表中只有横线,无竖线和斜线。统计表的标目应层次清楚,不宜过于复杂。
3生物医学动物实验的假设检验
生物医学动物实验中最常见的情况是给予不同受试物后进行组间比较,通过统计学中的假设检验,说明受试物的作用。假设检验时应注意以下问题。
检验方法的选用依据
资料的类型和变量的数目不同类型的资料(定量、定性)的组间比较应采用不同的统计检验方法。单变量、多变量的`统计检验方法也各不相同。实验设计类型应该根据实验设计的具体类型选择对应的统计检验方法,以便得到处理组效应的真实结论。检验方法的前提条件选用假设检验方法前,应了解所分析的数据资料是否满足相应检验方法的前提条件,如t检验和方差分析等参数检验方法要求数据满足正态性和方差齐性,2检验要求样本含量大于40且理论频数大于5。
正态性检验及拟合优度检验
统计学假设检验须判定样本的频数分布是否符合某一理论分布,如符合要求就可按此理论分布来进行统计学处理。对正态分布可采用正态性检验,其他分布可用拟合优度检验。通常可通过查阅文献,了解实验参数符合何种理论分布。
方差齐性检验
连续性数据未达到参数法统计分析前提的第二种原因即为方差不齐。一般而言,数值愈大,其固有的变异性也愈大。例如,若某组动物的平均反应值为100,其数值范围可能为80~120;而另一组动物的平均反应值为300,其数值范围可能会扩大至240~360。解决方差不齐的措施是进行数据转换。若数据的标准差与平均值成正比,在统计分析前宜将数据转换为对数值之后再进行分析,据此,不仅数据的变异度与平均值大小无关,同时还可确保其更符合正态分布。若数据变异度增加幅度与平均值的关系不太明显,采用平方根转换则更易使数据的变异度与平均值大小无关。某些数据经对数或平方根转换后可能仍存在方差不齐,此时宜采用非参数检验。
单侧检验与双侧检验
检验假设选择单侧检验或双侧检验,应事先根据专业知识做出选择。一般而言,若研究目的仅须了解是否存在组间差异、实验者无法预测组间变化的方向以及实验者希望获得正负两方面的结果时,应采用双侧检验。若事先可预测组间差异的变化方向,实验者仅对某一方面的重要性感兴趣,实验者仅希望了解与对照组差异或正或负一个方向,则应采用单侧检验。此外,剂量设计预试验中应采用双侧检验,正式试验在了解相关信息后可采用单侧检验。
多重比较及多重性问题
生物医学实验经常在处理组和对照组之间做多个变量的比较。即使不存在真正的实验效应,也有可能纯粹由于偶然性而有一个或多个变量在5%检验水平出现显著性差别。除了上述均数多重比较导致Ⅰ类错误概率增加的多重性问题之外,其他的多重性问题还包括多次的中期分析、关注多个结局、亚组间的多重比较。处理多重性问题的原则包括:①预先计划进行多重比较;②限制比较的次数;③多重比较时采用更严格的界值标准;④多重比较具有生物学方面的依据。
观察值或实验对象的独立性
许多统计检验方法要求比较的观察值或实验对象相互独立,如二项分布的率检验、t检验和方差分析等。但是,有的生物医学实验中观察单位并不独立。例如,生殖和发育研究中就存在窝效应:由于遗传因素、宫内的发育环境和药物的代谢环境相似,与异窝胎仔相比,同窝胎仔之间对毒性效应的反应概率趋于系统,即同窝内数据为聚集性数据,这就是一种常见的非独立数据。在统计学分析时,忽略数据的窝内相关性具有潜在的风险;因同窝母鼠所产k个胎仔的观察值存在共性,其所提供的信息不及k个独立的来自不同母鼠所产胎仔所提供的信息;窝内相关性愈大,其信息量愈少。聚集性数据的均数标准误小于独立的数据,因此,若基于观察值独立的统计分析方法,就会增加犯Ⅰ类错误的概率,即假阳性的风险增加,降低实验的有效性。
历史对照数据的应用
某些情况下,尤其是在发生率较低的情况下,单项研究可能提示处理可影响肿瘤发生率,但无法得出明确的结论。可能想到的分析办法之一是将处理组的数据与来自其他研究的对照组动物相比较。虽然历史对照数据具有重要意义,但值得强调的是,众多原因可导致不同研究之间的变异度大于研究之内的变异度。动物来源、饲料及饲养条件,研究期限,研究中的动物死亡率、读片的病理学家等均可能影响最终的肿瘤发生率。故此,忽视这些差异,将处理组的肿瘤发生率与合并的对照组发生率相比较,可能得出严重错误的结果,并进而明显夸大统计显著性水平。Tarone[4]曾对历史对照组的比率数据分析进行过综述。
假设检验的局限性
首先,假设检验中的P值并未提供有关处理诱发效应大小的直接信息。某一受试物可诱发一定量的、反应的增加,但增加的幅度是否具有统计显著性则取决于研究的规模和数据的变异性。在规模较小的研究中,有可能错失较大、重要的效应,尤其是在检测终点测量精度不高的情况下。相反,在规模较大的研究中,较小、非重要的效应则具有统计显著性。例如,D药与C药相比,降血压效应相差近30mmHg,但因为例数仅10例,假设检验未发现显著性差异(P=);相反,B药与A药相比,降血压效应仅相差,但因为例数达500例,假设检验却发现存在显著性差异(P<)。由此可见,统计学显著性与效应大小无直接相关性。因此,愈来愈多的统计学家主张以处理组与对照组差异值的95%置信区间表述处理的效应。据此,若处理反应的增加值为10个单位(95%置信区间3~17单位),则该区间包含真实差异的几率为95%。若置信区间的下限大于零,则双侧检验的P值小于。其次,假设检验无法消除实验设计或实施不当所带来的影响。虽然前述的分层分析等有助于发现真实的差异,但若实验设计存在偏倚,或实验实施过程中存在偏差或失误,假设检验方法一般也于事无补。因此,在生物医学实验过程中应注重对实验设计或实施过程进行严格的质量控制和质量保证措施,强化GLP规范意识。其三,对统计学分析本身的质量控制和质量保证也是确保研究质量的重要环节。所用统计分析软件包应经过充分的认证,以确保分析结果的准确、可靠性。数据的录入、核对和分析结果的报告与归档,均应制订并严格执行相关的标准操作规程。综上所述,在动物实验研究的多个环节,统计学中的相关理论和方法都能够发挥重要作用。统计学不仅可以保证结果的科学性和可靠性,在很多情况下也可以极大地提高研究效率,节约研究成本。在这里还必须强调,除了实验后期的数据分析以外,在实验方案的制定阶段也需要统计学人员的早期介入,这样有助于避免实验设计出现大的偏差和漏洞,有利于研究目标的顺利实现。
随着计算技术和生物技术的进步,当前生物医学文献正在以前所 未有的速度增长。这些文献中蕴含着最新的研究进展和丰富的生物医学知识,对于生物医学研究者具有重要意义。然而数以千万计的文献使得研究者追踪和整理自己 需要的知识和信息变得越来越困难。文本挖掘技术可以解决这一问题,帮助生物医学研究者提高从文献中获取知识和信息的效率。因此针对生物医学文献的文本挖掘 研究具有重要的应用价值。判别式模型是一类直接利用特征来预测目标变量的发生概率的机器学习模型,本文中主要用到的判别式模型有最大熵模型和条件随机域模 型。相对于产生式模型,判别式模型降低了特征之间的独立性假设的要求,并且与很多文本挖掘任务的需求相一致,因而更有可能取得好的效果。本文主要研究如何 利用判别式模型来解决生物医学文献挖掘中的问题。具体地,我们研究了生物医学文本挖掘中的三个任务:生物医学名实体识别、生物医学实体规范化以及生物医学 语义关系抽取。在这3任务中,第二个任务是第一个任务在语义处理上的延伸,前两个任务是第三个任务的基础。本文的主要内容包含以下4个方面。生物医学名实 体识别的目标是确定一个给定的文本集合内的某一类型的实体的名字的所有实例,它是进行深层次文本挖掘的必要步骤之一。本文在考察了生物医学领域实体识别的 特点和难点,分析了目前已有的生物医学实体识别方法的优缺点的基础上,提出了利用条件随机域模型结合丰富特征集来进行生物医学实体识别的方法。这些特征包 括:构词法特征、上下文特征和句法特征。其中,浅层句法特征是首次被引入到条件随机域模型中,同时用来进行实体的边界检测和类别判断。实验表明,这一特征 可以有效地提高名实体识别的效果。有监督的机器学习方法需要大规模的标注语料。大量的电子文献使得在生物医学领域获取未标记的语料已相当容易,但是对语料 进行标注仍然是一件昂贵的工作。针对在生物医学名实体识别中有监督学习所需的大规模训练语料比较难以获取的问题,本文提出了基于最大熵模型的协同训练的半 监督学习方法。该方法可以利用大量的未标注语料来提高在较少的标注语料的基础上学习到的分类器的名实体识别性能。为了进一步提高半监督学习的效果,本文将 主动学习引入到半监督学习的过程中。实验表明,基于最大熵模型的协同训练方法可以有效地提高初始分类器的识别性能。灵活的生物医学实体命名方式使得生物医 学实体具有严重的歧义。这已成为对生物医学文献进行深层自动文本挖掘的主要障碍之一。生物医学实体规范化的提出就是为了解决这一问题。生物医学实体规范化 就是把生物医学文献中表达同一概念的不同变体映射到统一的概念标识符。本文提出了一种用于生物医学实体规范化的多层歧义消解框架。实体规范化过程中不同阶 段有不同的歧义情形,在本文提出的框架中,针对这些情形采用了有针对性的解决策略,包括:基于词典的实体名字检测,基于机器学习方法的候选选择以及基于知 识的歧义消解。在BioCreAtIvE2006基因名字规范化任务的测试集上的实验表明本文提出的框架可以有效地解决规范化过程中的各种歧义。生物医学 语义关系抽取是生物医学文本挖掘的主要研究内容之一,是从无结构的生物医学文献中抽取出生物医学知识的重要手段。在实际应用中,生物医学语义关系的定义有 宽泛和具体之分。本文将宽泛定义和具体定义的生物医学语义关系抽取分别看作二分类和多分类问题,提出基于最大熵模型的生物医学语义关系抽取的方法。针对不 区分类别的蛋白质相互作用这种宽泛定义的关系抽取,提出了一种基于最大熵的二阶段蛋白质相互作用关系抽取方法。针对多类别的蛋白质相互作用这种具体定义的 关系抽取,提出使用最大熵模型结合词特征的抽取方法,该方法在一个具有10种蛋白质相互作用类别的数据集上取得了的总体精确率。同样的方法应用 到疾病与治疗方式关系抽取任务中,也取得了很好的实验结果。此外,本文还通过理论分析和实验对比,从理论和实践两个方面说明了判别式模型比产生式模型更适 合生物医学语义关系抽取问题。参考文献 [1] 王浩畅,赵铁军. 生物医学文本挖掘技术的研究与进展[J]. 中文信息学报. 2008(03) [2] 于中华,陈蓉,胡俊锋,陈源. 基于加权投票K—近邻法的生物医学缩略语消歧[J]. 中文信息学报. 2008(02) [3] 龙军,殷建平,祝恩,赵文涛. 主动学习研究综述[J]. 计算机研究与发展. 2008(S1)
276 浏览 5 回答
352 浏览 4 回答
287 浏览 3 回答
349 浏览 3 回答
156 浏览 4 回答
166 浏览 3 回答
85 浏览 4 回答
149 浏览 6 回答
336 浏览 6 回答
329 浏览 3 回答
254 浏览 5 回答
221 浏览 3 回答
290 浏览 5 回答
283 浏览 4 回答
248 浏览 4 回答