This commit is contained in:
XXAY
2021-09-25 15:03:07 +08:00
parent ad40d66c70
commit 77406e40a3
4 changed files with 137 additions and 3 deletions
+89
View File
@@ -0,0 +1,89 @@
HMMER:
在线使用:https://www.ebi.ac.uk/Tools/hmmer/search/phmmer
下载:http://hmmer.janelia.org/static/binaries/hmmer3.0_windows.zip(将网址放在迅雷网盘进行下载,该文件含有readme.txt可参考使用)
功能:用于搜索同源蛋白序列以及蛋白序列对位排序,比如从序列数据库中,找同源的序列,或者对一个一个新的基因功能进行鉴定,使用hmmer比使用blast有着更高的灵敏度和更高的搜索速度,HMMER的程序如下,注意每个程序都是输出文件在前面,输入文件在后面
phmmer:功能:与Blastp类似,使用一个蛋白质序列搜索蛋白质序列库
格式:phmmer [-options] <query seqfile> <target seqdb>
输入:你要检测的fasta格式的序列和你要搜索的数据库
输出匹配的序列和特征:含有score,Taxonomy,Domain,Download
参数:输入的文件格式为fasta格式,蛋白质序列库常用的包括Reference Proteomes,UniProtKB,SwissProt,PDB,Ensembl,输出格式包括tblout、domtblout等,蛋白质数据库需要下载
jackhmmer:功能:与psiBlast类似,蛋白质序列迭代搜索蛋白质序列库
格式:jackhmmer [-options] <query seqfile> <target seqdb>
输入:你要检测的fasta格式的序列和你要搜索的数据库
输出:匹配的序列及特征,含有score,Taxonomy,Domain,Download
参数:输入的文件格式为fasta格式,蛋白质序列库常用的有Reference Proteomes,UniProtKB,SwissProt,PDB,Ensembl,蛋白质数据库需要下载
hmmalign:功能 多重序列比对
格式: hmmalign [-options] <hmmfile> <seqfile>
输入:输入是fasta文件
输出:Stockholm 格式的多重序列比对文件
参数:输入文件序列格式包括FASTA、EMBL、GenBank、UniProt
输出比对文件格式包括Stockholm、Pfam、A2M、PSIBLAST
hmmbuild:功能:建立参考数据的隐马尔可科夫模型
格式: hmmbuild [-options] <hmmfile output> <alignment file input>
输入:多重序列比对的文件(Stockholm file)
输出:建立的这些多重序列比对的隐马尔可科夫模型
参数:输入文件支持很多生物数据格式如:CLUSTALW, SELEX, GCG MSF
输出文件命名时的后缀为.hmm
hmmscan:使用序列搜索HMM库
格式: hmmscan [-options] <hmm database> <query seqfile>
输入:hmm数据库和查询序列文件
输出:含有Score和Download,hmm数据库所匹配的序列
参数:HMM数据库有Pfam,TIGRFAM,Gene3D,Superfamily,PIRSF,TreeFam
hmmsearch:功能:在数据库中寻找已经建立好的模体)
格式: hmmsearch [options] <query hmmfile> <target seqfile>
输入:建立好的参考数据模型、要搜索的数据库
输出:输出结果
参数:比较序列文件可以是FASTA、EMBL/UniProt、Genbank格式
输出选项:
-o:直接输出结果到文件,不是标准输出
--tblout:tblout格式输出
--domtblout:domtblout格式输出
--pfamtblout:pfamtblout格式输出
输出结果中分为两类,一类是针对序列的(full sequence),另一类是针对domain的(主要基于一条序列存在多个domain)。
结果按照E-values值从小到大排序,形式与blast类似。
其中target name是每个目标序列的名称;
query name是查询序列的名称;
score是比对得分,分值越高说明越相似;
E-value目标序列的期望值(统计意义);
最重要的是E-value值,值越小,越可信,相当于一个统计量。
hmmsim:功能没找到
格式: hmmsim [-options] <hmmfile>
输入:hmm格式的文件
输出:以sequence为名的一行(2.out)
hmmstat:显示HMM数据库的统计信息
格式: hmmstat [-options] <hmmfile>
输入:hmm格式的文件
输出:有idx为名的那一行,含有name,accession,nseq,eff_nseq,M,relent,info,p relE,compKL
输出显示:# hmmstat :: display summary statistics for a profile file
# HMMER 3.0 (March 2010); http://hmmer.org/
# Copyright (C) 2010 Howard Hughes Medical Institute.
# Freely distributed under the GNU General Public License (GPLv3).
# - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - -
#
# idx name accession nseq eff_nseq M relent info p relE compKL
# ---- -------------------- ------------ -------- -------- ------ ------ ------ ------ ------
1 sequence - 1 0.39 172 0.59 0.59 0.51 0.03
hmmconvert:功能:转换HMM格式
格式:hmmconvert [-options] <hmmfile>
输入:hmm格式的文件
输出:hmm格式转换后的文件
hmmemit:功能:从HMM模型中,得到一个模式序列
格式: hmmemit [-options] <hmmfile (single)>
输入:hmm格式的文件
输出:模式序列
输出显示:>sequence-sample1
IQYNNDSKLYLSLTRGVFKSSKVLAQVSKPPGIDTGTIHTTRRKRIVVDSETKSHELLDT
AGDRYFSFDDYLRRATTLVFLFALNRLRHFRKRNTLCEKIMELHGGDNFPNMLVKSEVSD
QISELDSEQCSLKPLGNAYKIPHVLAGNDVSKENDTGVLQLVRTIRQYIVRTGP
hmmfetch:功能:通过名字或者接受号从HMM库中取回一个HMM模型
格式: hmmfetch [options] <hmmfile> <key> (retrieves HMM named <key>)
hmmfetch [options] -f <hmmfile> <keyfile> (retrieves all HMMs in <keyfile>)
hmmfetch [options] --index <hmmfile> (indexes <hmmfile>)
输入:hmm文件和HMM模型的名字或接受号
输出:为这个名字或接受号的HMM模型
hmmpress:格式化HMM数据库,包括压缩和创建索引,以便于hmmscan搜索使用
格式:hmmpress [-options] <hmmfile>
输入:hmm格式的文件
输出:可获得H3F格式的文件,H3I格式的文件,H3M格式的文件,H3P格式的文件
+45
View File
@@ -0,0 +1,45 @@
# blast
## 建立数据库
```shell
makeblastdb -in Arabidopsis_thaliana.TAIR10.dna.toplevel.fa -dbtype nucl -out TAIR10 -parse_seqids
-in # 输入文件
-dbtype # 类型 nucl 核酸 prot 蛋白
-out # 输出文件位置和名字
-parse_seqids #
```
## 比对
```
blastn
```
-query: 检索文件
-query_loc : 指定检索的位置
-strand: 搜索正义链还是反义链,还是都要
out : 输出文件
-remote: 可以用NCBI的远程数据库, 一般与 -db nr
-evalue 科学计数法,比如说1e3,定义期望值阈值。E值表明在随机的情况下,其它序列与
### 比对