[发明专利]基于病例库的疾病症状及其权重知识的获取和处理方法在审
申请号: | 201610836533.2 | 申请日: | 2016-09-21 |
公开(公告)号: | CN106372439A | 公开(公告)日: | 2017-02-01 |
发明(设计)人: | 金芝;李戈;陆军 | 申请(专利权)人: | 北京大学 |
主分类号: | G06F19/00 | 分类号: | G06F19/00;G06F17/27 |
代理公司: | 北京万象新悦知识产权代理事务所(普通合伙)11360 | 代理人: | 黄凤茹 |
地址: | 100871*** | 国省代码: | 北京;11 |
权利要求书: | 查看更多 | 说明书: | 查看更多 |
摘要: | 本发明公布了一种基于病例库的疾病症状及其权重知识的获取和处理方法,以互联网上的海量病例库作为信息源,通过对信息源原始数据进行处理,自动获取疾病症状及其权重知识;包括采取正则表达式进行HTML标签匹配,通过网络爬虫策略获取疾病症状原始数据;进行词语相似度计算和同义词识别获取医学词语相似度表和医学词语同义词表;进行分类、TF‑IDF词频统计、无量纲化处理,获取疾病症状及其权重等多个参数,用于整体评价疾病与症状关系。采用本发明提供的技术方案,能够节省大量人力、财力和时间;得出的疾病症状及其权重结果更加合理;适用于导医系统和基于互联网的疾病自我预诊系统等场景。 | ||
搜索关键词: | 基于 病例 疾病 症状 及其 权重 知识 获取 处理 方法 | ||
【主权项】:
一种基于病例库的疾病症状及其权重知识的获取和处理方法,以互联网上的海量病例库作为信息源,通过对信息源原始数据进行处理,自动获取疾病症状及其权重知识;包括如下步骤:1)获取疾病症状原始数据,包括疾病名称和对应的症状信息;2)对原始数据进行词语相似度计算,获取医学词语相似度表;对医学词语相似度表进行同义词人工识别,获取医学词语同义词表;3)对原始数据进行分类和统计处理,获取疾病名称与其症状的对应关系及分布情况;4)获取疾病中各症状的权重;5)进行无量纲化处理;由此获取疾病症状的多个参数,包括:某症状在某疾病中出现的频率、某症状在疾病集中出现的概率、无量纲化处理前某疾病中某症状的权重和无量纲化处理后某疾病中某症状的权重,用于整体评价疾病与症状关系。
下载完整专利技术内容需要扣除积分,VIP会员可以免费下载。
该专利技术资料仅供研究查看技术是否侵权等信息,商用须获得专利权人授权。该专利全部权利属于北京大学,未经北京大学许可,擅自商用是侵权行为。如果您想购买此专利、获得商业授权和技术合作,请联系【客服】
本文链接:http://www.vipzhuanli.com/patent/201610836533.2/,转载请声明来源钻瓜专利网。
- 同类专利
- 专利分类
G06 计算;推算;计数
G06F 电数字数据处理
G06F19-00 专门适用于特定应用的数字计算或数据处理的设备或方法
G06F19-10 .生物信息学,即计算分子生物学中的遗传或蛋白质相关的数据处理方法或系统
G06F19-12 ..用于系统生物学的建模或仿真,例如:概率模型或动态模型,遗传基因管理网络,蛋白质交互作用网络或新陈代谢作用网络
G06F19-14 ..用于发展或进化的,例如:进化的保存区域决定或进化树结构
G06F19-16 ..用于分子结构的,例如:结构排序,结构或功能关系,蛋白质折叠,结构域拓扑,用结构数据的药靶,涉及二维或三维结构的
G06F19-18 ..用于功能性基因组学或蛋白质组学的,例如:基因型–表型关联,不均衡连接,种群遗传学,结合位置鉴定,变异发生,基因型或染色体组的注释,蛋白质相互作用或蛋白质核酸的相互作用
G06F 电数字数据处理
G06F19-00 专门适用于特定应用的数字计算或数据处理的设备或方法
G06F19-10 .生物信息学,即计算分子生物学中的遗传或蛋白质相关的数据处理方法或系统
G06F19-12 ..用于系统生物学的建模或仿真,例如:概率模型或动态模型,遗传基因管理网络,蛋白质交互作用网络或新陈代谢作用网络
G06F19-14 ..用于发展或进化的,例如:进化的保存区域决定或进化树结构
G06F19-16 ..用于分子结构的,例如:结构排序,结构或功能关系,蛋白质折叠,结构域拓扑,用结构数据的药靶,涉及二维或三维结构的
G06F19-18 ..用于功能性基因组学或蛋白质组学的,例如:基因型–表型关联,不均衡连接,种群遗传学,结合位置鉴定,变异发生,基因型或染色体组的注释,蛋白质相互作用或蛋白质核酸的相互作用