Variomes:支持基因组变异筛选的高召回率搜索引擎

devtools/2024/12/22 21:23:27/

《Bioinformatics》2022

Variomes:

https://candy.hesge.ch/Variomes

Source code:

https://github.com/variomes/sibtm-variomes

SynVar:

https://goldorak.hesge.ch/synvar

图片

文章摘要(Abstract)

动机(Motivation):识别和解释临床可操作的基因组变异是一个关键瓶颈。根据ASCO/AMP/CAP实践指南,搜索文献中的证据是必要的,但这项工作既耗时又容易出错。作者开发了一个系统,用于筛选与支持基于证据的决策相关的出版物,并且该系统还能对变异进行优先级排序。

结果(Results):通过三种不同的实验设置评估系统搜索效果:文献筛选、变异优先级排序和将Variomes与LitVar进行比较。结果显示,几乎三分之二的前五篇返回的出版物与临床决策支持相关。该方法能够在前三个结果中识别出81.8%的临床可操作变异。在对803个查询进行测试时,Variomes平均检索到比LitVar多21.3%的文章,并在90%的查询中返回与LitVar相同或更多的结果,从而为搜索有关变异的文献建立了新的基准。

可用性和实现(Availability and implementation):Variomes公开可用,源代码也可在GitHub获取,链接已放在文章开头。

引言(Introduction)

文章讨论了个性化医学的进步,使得能够选择针对特定肿瘤变异的治疗方法。基于肿瘤的分子谱和临床信息,可以更好地确定可能带来有利反应的治疗。

临床专家在生物信息学工具的帮助下,负责确定哪些变异是可操作的,即可能带来更好或更差的预后和治疗反应。

然而,手动筛选科学出版物存在挑战,如出版物数量庞大且不断增长,信息隐藏在非结构化文本中。

材料和方法(Materials and methods)

  • 作者介绍了系统架构,包括使用的科学文献集合、术语标准化、查询处理和排名策略;

  • 这些方法的结合使得Variomes能够高效地检索和排序与基因组变异相关的科学文献,支持临床决策和变体的解释工作;

  • 描述了实验评估设置,包括文献筛选、变异优先级排序和与LitVar的比较。

(1)数据处理:

使用医学术语对文献集合进行预处理,以提高匹配用户信息请求的效率和召回率。预处理包括将文档和注释加载到MongoDB中,并在ElasticSearch中建立索引。

(2)查询处理:

用户查询时,系统自动处理关键词,将其映射到医学术语,并使用专门的变体扩展系统(如SynVar)来扩展遗传变异。

图片

(3)排名策略:

系统采用两步查询系统:首先聚焦于召回率,收集与特定案例相关的大量文档;其次聚焦于精确度,对文档集合进行适当排名。

(4)文献集合的使用:

MEDLINE的摘要、PubMed Central的全文文章和ClinicalTrials.gov的临床试验数据。

(5)变体名称标准化:

由于变体名称在文献中可能以多种形式出现,使用特定的命名实体识别工具来标准化变体名称至关重要。

(6)搜索算法:

系统生成包含三个“必须”子句(针对变体、基因、诊断)的Elasticsearch查询,以及至少一个“应该”子句,以增加灵活性

(7)结果合并:

通过线性组合策略合并不同查询的结果,以提高搜索效果。

(8)性能调优:

使用TREC基准进行直接搜索,通过优化排名函数来调整系统性能,使用R-Prec、P5和infNDCG等指标。

(9)用户界面和API:

提供用户友好的界面和APIs,允许用户检索和操作数据

(10)集成到SVIP平台

Variomes服务集成到了SVIP(Swiss Variant Interpretation Platform)平台,这是一个瑞士的临床验证变体注释的国家存储库。

(11)错误分析与反馈系统:

进行了错误分析,以理解VarChat和LitVar的不同优势,并实现了用户反馈系统,以收集用户评价和改进建议。

结果和讨论(Results and discussion)

系统调整基于五个步骤,包括约束放松策略、命名实体类型密度、人口统计学一致性、预定义关键词的评分以及所有策略的线性组合。

实验设置1(文献筛选)显示,系统在前五篇返回的摘要中,有近三分之二被判断为相关。

实验设置2(变异优先级排序)显示,P5(前五个结果中的精确度)为25%,R-Prec(R-Precision)为71.4%。

实验设置3(与LitVar的比较)显示,Variomes在检索到的文章数量上优于LitVar,并且具有更低的无结果查询比例。

结论(Conclusion)

Variomes是一个有效的工具,用于检索与变异相关的文献,并为检索基因组变异设定了新的标准。该系统特别适用于单核苷酸变异,对于大多数SNV查询,P5都大于80%。

图片

文章整体上提供了一个用于支持基因组变异文献筛选的高召回搜索引擎的设计、实现和评估,旨在提高临床可操作变异的识别和解释效率。


http://www.ppmy.cn/devtools/99357.html

相关文章

Python-Poc编写(4)

一、背景 值守期间遇到产品waf上很多的任意读取文件告警;查看为用友U9产品随机有了该漏洞的验证POC。 二、POC编写 import argparse import requests import sys# 创建poc模块接收参数 def cmd(url):# 创建payliadpayload "/OnLine/UMWebService.asmx?opG…

为BUG编程:头文件不一致导致的coredump

重新安装了一个开发环境,旧代码放上去,安装好各种依赖库,跑起来……不停出错(信号11),头都大了! 同样的代码,放在旧环境,正常啊。 哪里出问题了啊?权限&#…

[CTF夺旗赛] BUUCTF N1BOOK 第二章 web进阶

文章目录 前言[第二章 web进阶]SSRF Training[第二章 web进阶]死亡ping命令[第二章 web进阶]XSS闯关[第二章 web进阶]文件上传 前言 CTF(Capture The Flag)中文一般译作夺旗赛,在网络安全领域中指的是网络安全技术人员之间进行技术竞技的一种…

k8s笔记——资源对象

以下列举的内容都是 Kubernetes 中的对象(Object),这些对象都可以在 YAML 文件中作为一种 API 类型来配置。 PodNodeNamespaceServiceVolumePersistentVolumeDeploymentSecretStatefulSetDaemonSetServiceAccountReplicationControllerRepli…

ProxySQL 读写分离配置

ProxySQL 是一个高性能、高可用的 MySQL 代理软件,旨在提升 MySQL 数据库的可扩展性和性能。它可以在应用程序和 MySQL 服务器之间充当中间层,提供强大的路由、负载均衡和查询优化功能。 ProxySQL 的主要功能: 查询路由: ProxySQ…

《黑神话·悟空》是用什么编程语言开发的?

最近国内出了一款3A大作的游戏,凭借牛b的画面、文化底蕴、剧情,已经吸引了很多人入局,当然小孟也在第一时间尝鲜。 最直接的感受:效果牛b,画面牛b,游戏好玩。但是时间太忙,准备过年的放假的时候…

Linux数据相关第1个服务_备份服务rsync

1、备份服务概述 备份服务:需要使用到脚本,打包备份,定时任务 备份服务:rsyncd 服务,不同主机之间数据传输 特点: rsync是个服务也是命令使用方便,具有多种模式传输数据的时候是增量传输 增量与全量&am…

写一个githubDemo

1.List组件 <template><div class"container"><!-- 展示用户列表 --><div class"row"><divv-show"info.users.length"v-for"(item, index) in info.users":key"item.id"><div class"…