Files
Simple_Drawing/file_keep/chart/file/3170120442021135
T
2021-09-24 16:05:56 +08:00

90 lines
5.4 KiB
Plaintext
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
HMMER:
在线使用:https://www.ebi.ac.uk/Tools/hmmer/search/phmmer
下载:http://hmmer.janelia.org/static/binaries/hmmer3.0_windows.zip(将网址放在迅雷网盘进行下载,该文件含有readme.txt可参考使用)
功能:用于搜索同源蛋白序列以及蛋白序列对位排序,比如从序列数据库中,找同源的序列,或者对一个一个新的基因功能进行鉴定,使用hmmer比使用blast有着更高的灵敏度和更高的搜索速度,HMMER的程序如下,注意每个程序都是输出文件在前面,输入文件在后面
phmmer:功能:与Blastp类似,使用一个蛋白质序列搜索蛋白质序列库
格式:phmmer [-options] <query seqfile> <target seqdb>
输入:你要检测的fasta格式的序列和你要搜索的数据库
输出匹配的序列和特征:含有score,Taxonomy,Domain,Download
参数:输入的文件格式为fasta格式,蛋白质序列库常用的包括Reference Proteomes,UniProtKB,SwissProt,PDB,Ensembl,输出格式包括tblout、domtblout等,蛋白质数据库需要下载
jackhmmer:功能:与psiBlast类似,蛋白质序列迭代搜索蛋白质序列库
格式:jackhmmer [-options] <query seqfile> <target seqdb>
输入:你要检测的fasta格式的序列和你要搜索的数据库
输出:匹配的序列及特征,含有score,Taxonomy,Domain,Download
参数:输入的文件格式为fasta格式,蛋白质序列库常用的有Reference Proteomes,UniProtKB,SwissProt,PDB,Ensembl,蛋白质数据库需要下载
hmmalign:功能 多重序列比对
格式: hmmalign [-options] <hmmfile> <seqfile>
输入:输入是fasta文件
输出:Stockholm 格式的多重序列比对文件
参数:输入文件序列格式包括FASTA、EMBL、GenBank、UniProt
输出比对文件格式包括Stockholm、Pfam、A2M、PSIBLAST
hmmbuild:功能:建立参考数据的隐马尔可科夫模型
格式: hmmbuild [-options] <hmmfile output> <alignment file input>
输入:多重序列比对的文件(Stockholm file)
输出:建立的这些多重序列比对的隐马尔可科夫模型
参数:输入文件支持很多生物数据格式如:CLUSTALW, SELEX, GCG MSF
输出文件命名时的后缀为.hmm
hmmscan:使用序列搜索HMM库
格式: hmmscan [-options] <hmm database> <query seqfile>
输入:hmm数据库和查询序列文件
输出:含有Score和Download,hmm数据库所匹配的序列
参数:HMM数据库有Pfam,TIGRFAM,Gene3D,Superfamily,PIRSF,TreeFam
hmmsearch:功能:在数据库中寻找已经建立好的模体)
格式: hmmsearch [options] <query hmmfile> <target seqfile>
输入:建立好的参考数据模型、要搜索的数据库
输出:输出结果
参数:比较序列文件可以是FASTA、EMBL/UniProt、Genbank格式
输出选项:
-o:直接输出结果到文件,不是标准输出
--tblout:tblout格式输出
--domtblout:domtblout格式输出
--pfamtblout:pfamtblout格式输出
输出结果中分为两类,一类是针对序列的(full sequence),另一类是针对domain的(主要基于一条序列存在多个domain)。
结果按照E-values值从小到大排序,形式与blast类似。
其中target name是每个目标序列的名称;
query name是查询序列的名称;
score是比对得分,分值越高说明越相似;
E-value目标序列的期望值(统计意义);
最重要的是E-value值,值越小,越可信,相当于一个统计量。
hmmsim:功能没找到
格式: hmmsim [-options] <hmmfile>
输入:hmm格式的文件
输出:以sequence为名的一行(2.out)
hmmstat:显示HMM数据库的统计信息
格式: hmmstat [-options] <hmmfile>
输入:hmm格式的文件
输出:有idx为名的那一行,含有name,accession,nseq,eff_nseq,M,relent,info,p relE,compKL
输出显示:# hmmstat :: display summary statistics for a profile file
# HMMER 3.0 (March 2010); http://hmmer.org/
# Copyright (C) 2010 Howard Hughes Medical Institute.
# Freely distributed under the GNU General Public License (GPLv3).
# - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - -
#
# idx name accession nseq eff_nseq M relent info p relE compKL
# ---- -------------------- ------------ -------- -------- ------ ------ ------ ------ ------
1 sequence - 1 0.39 172 0.59 0.59 0.51 0.03
hmmconvert:功能:转换HMM格式
格式:hmmconvert [-options] <hmmfile>
输入:hmm格式的文件
输出:hmm格式转换后的文件
hmmemit:功能:从HMM模型中,得到一个模式序列
格式: hmmemit [-options] <hmmfile (single)>
输入:hmm格式的文件
输出:模式序列
输出显示:>sequence-sample1
IQYNNDSKLYLSLTRGVFKSSKVLAQVSKPPGIDTGTIHTTRRKRIVVDSETKSHELLDT
AGDRYFSFDDYLRRATTLVFLFALNRLRHFRKRNTLCEKIMELHGGDNFPNMLVKSEVSD
QISELDSEQCSLKPLGNAYKIPHVLAGNDVSKENDTGVLQLVRTIRQYIVRTGP
hmmfetch:功能:通过名字或者接受号从HMM库中取回一个HMM模型
格式: hmmfetch [options] <hmmfile> <key> (retrieves HMM named <key>)
hmmfetch [options] -f <hmmfile> <keyfile> (retrieves all HMMs in <keyfile>)
hmmfetch [options] --index <hmmfile> (indexes <hmmfile>)
输入:hmm文件和HMM模型的名字或接受号
输出:为这个名字或接受号的HMM模型
hmmpress:格式化HMM数据库,包括压缩和创建索引,以便于hmmscan搜索使用
格式:hmmpress [-options] <hmmfile>
输入:hmm格式的文件
输出:可获得H3F格式的文件,H3I格式的文件,H3M格式的文件,H3P格式的文件