收藏本站
收藏 | 手机打开
二维码
手机客户端打开本文

自然语言处理在药物专利检索系统中的应用

程晓静  
【摘要】:随着计算机应用的日益普遍,人工智能的迅猛发展,计算机在化学领域的应用也愈来愈受到普遍的关注。特别是在有机化学人工智能方面,出现了日益繁多的有关物质分子结构信息处理的专家系统。物质分子结构的计算机处理,需要一种化学家和计算机都能接受的表达形式来表示分子结构,且要求一种分子只能有唯一的一种结构代码表示。在药物专利中,族性结构是通过结构图形与可变部分的文本描述相结合来表达的,计算机本身无法识别自然语言文字。因此,将专利摘要中的文本部分自动的转化为分子结构代码,对于计算机结构信息检索和匹配具有重要的意义。 本论文采用自然语言处理技术(Natural Language Processing),将药物专利摘要中对族性结构的可变部分进行描述的文本部分,半自动的翻译成规范的、唯一的、能够被计算机识别的代码。并结合输入到计算机中的专利结构图形,生成一个描述族性结构的紧缩拓扑关联表(GSCCT表),以便进行药物专利的结构匹配检索。机器翻译系统基于面向对象技术(OOT),通过句法、语法分析,建立语言模型。并结合机器翻译的需要,提出了新的汉语自动分词算法(MM),使词典库结构简化,极大的提高了机器翻译的准确性和速度。同时,词典库是开放式的,可以随时向库中添加新的词条,充分体现了该系统的学习能力和智能化。 本系统应用于“药物专利信息检索系统”,为进一步生成药物专利化合物结构的计算机表达、存储以及匹配所用。它大大减少人工输入表达式的工作量,并且尽可能地减少差错。 通过测试近二百篇药物专利摘要,系统性能良好,达到了预期的效果。


知网文化
【相似文献】
中国期刊全文数据库 前20条
1 本刊编辑部;;《河北科技大学学报》投稿须知[J];河北科技大学学报;2011年03期
2 ;《石油炼制与化工》征订启事[J];石油学报(石油加工);2011年03期
3 本刊编辑部;;《特种油气藏》被俄罗斯《文摘杂志》收录[J];特种油气藏;2011年03期
4 赵晔;王昌;;基于非精确图匹配的一种工程图检索方法[J];郑州轻工业学院学报(自然科学版);2011年03期
5 ;《铸造设备与工艺》杂志简介[J];铸造设备与工艺;2011年04期
6 ;欢迎订阅2011年《环境科学》[J];环境科学;2011年09期
7 龙国华;卢晓娟;;浅论高校图书馆数字期刊采访[J];四川烹饪高等专科学校学报;2011年04期
8 ;[J];;年期
9 ;[J];;年期
10 ;[J];;年期
11 ;[J];;年期
12 ;[J];;年期
13 ;[J];;年期
14 ;[J];;年期
15 ;[J];;年期
16 ;[J];;年期
17 ;[J];;年期
18 ;[J];;年期
19 ;[J];;年期
20 ;[J];;年期
中国重要会议论文全文数据库 前10条
1 张玥杰;徐智婷;钱晶;张涛;;自然语言处理中专名识别方法的研究[A];中文信息处理前沿进展——中国中文信息学会二十五周年学术会议论文集[C];2006年
2 汪华峰;陈峪;;汉语自然语言理解中词切分中新词问题初探[A];第一届全国语言识别学术报告与展示会论文集[C];1990年
3 吴晨;张全;缪建明;韦向峰;;自然语言语义理解下的信息检索模型[A];第三届学生计算语言学研讨会论文集[C];2006年
4 支流;段慧明;朱学锋;俞士汶;;中文缩略语知识库建设[A];第三届学生计算语言学研讨会论文集[C];2006年
5 白刚;张铮;丁宗尧;朱毅;;中文文本聚类在互联网搜索的研究与应用[A];第三届全国信息检索与内容安全学术会议论文集[C];2007年
6 孙茂松;;汉语自动分词研究及其应用:回顾与展望[A];面向21世纪的科技进步与社会经济发展(上册)[C];1999年
7 刘群;张浩;白硕;;中文信息处理开放平台的设计[A];第一届学生计算语言学研讨会论文集[C];2002年
8 支流;朱学锋;段慧明;俞士汶;;中文缩略语还原技术初探[A];全国第八届计算语言学联合学术会议(JSCL-2005)论文集[C];2005年
9 刘开瑛;由丽萍;;汉语框架语义知识库构建工程[A];中文信息处理前沿进展——中国中文信息学会二十五周年学术会议论文集[C];2006年
10 郑家恒;谭红叶;王兴义;;基于模式匹配的中文专有名词识别[A];民族语言文字信息技术研究——第十一届全国民族语言文字信息学术研讨会论文集[C];2007年
中国博士学位论文全文数据库 前10条
1 卢延鑫;基于自然语言处理技术的循证医学信息提取研究[D];复旦大学;2011年
2 王立欣;翻译标准自动量化方法研究[D];上海外国语大学;2007年
3 李良炎;基于词联接的自然语言处理技术及其应用研究[D];重庆大学;2004年
4 代印唐;基于语义网络的知识协作关键技术研究[D];复旦大学;2009年
5 李莎莎;面向搜索引擎的自然语言处理关键技术研究[D];国防科学技术大学;2011年
6 周雅倩;最大熵方法及其在自然语言处理中的应用[D];复旦大学;2005年
7 易勇;计算机辅助诗词创作中的风格辨析及联语应对研究[D];重庆大学;2005年
8 贺前华;汉语自动分词及机器翻译研究[D];华南理工大学;1993年
9 谢学敏;基于动态流通语料库(DCC)的流行语释义信息自动提取研究[D];北京语言大学;2006年
10 屈刚;英汉双语短语对齐[D];上海交通大学;2007年
中国硕士学位论文全文数据库 前10条
1 程晓静;自然语言处理在药物专利检索系统中的应用[D];大连理工大学;2004年
2 杨辉;汉语新词语发现及其词性标注方法研究[D];复旦大学;2008年
3 唐琦;基于语义分析的句子相似度计算研究[D];华北电力大学(北京);2009年
4 张六四;基于远程教育的智能答疑系统的研究与实现[D];西安电子科技大学;2006年
5 代建英;汉语自动分词系统的研究与实现[D];重庆大学;2005年
6 全昌勤;基于语料库的汉语词义消歧方法研究[D];华中师范大学;2005年
7 张峰;基于自然语言处理的自动文摘系统[D];电子科技大学;2006年
8 丁卓冶;中文命名实体识别的研究[D];大连理工大学;2008年
9 孙继明;基于知网的汉语词义消歧研究[D];国防科学技术大学;2007年
10 孙广庆;基于语义范畴扩展的词义消歧的研究[D];哈尔滨工程大学;2008年
中国重要报纸全文数据库 前10条
1 本报记者 姜靖;张全:给网络装上“电子眼”[N];科技日报;2009年
2 本报记者 祝蕾 见习记者 许凯;李晓戈:努力缩小国内外数字“鸿沟”[N];济南日报;2010年
3 何清 史忠植 王伟;搜索引擎的前沿技术[N];计算机世界;2006年
4 小柯;张全:网络环境“清洁师”[N];广东科技报;2009年
5 金利;东北大学自然语言处理实验室形成特色[N];科技日报;2007年
6 沈建缘;洪小文:时尚科学家[N];经济观察报;2009年
7 记者 刘传书;微软在深圳设实验室[N];科技日报;2006年
8 郑昊;数据挖掘加工海量数据[N];中国计算机报;2007年
9 ;开天辟地第一回[N];计算机世界;2002年
10 刘洁;SAS分析产品链增添“新成员”[N];科技日报;2008年
中国知网广告投放
 快捷付款方式  订购知网充值卡  订购热线  帮助中心
  • 400-819-9993
  • 010-62982499
  • 010-62783978