tools
This commit is contained in:
89
file_keep/chart/file/5140330442021126
Normal file
89
file_keep/chart/file/5140330442021126
Normal file
@@ -0,0 +1,89 @@
|
||||
HMMER:
|
||||
在线使用:https://www.ebi.ac.uk/Tools/hmmer/search/phmmer
|
||||
下载:http://hmmer.janelia.org/static/binaries/hmmer3.0_windows.zip(将网址放在迅雷网盘进行下载,该文件含有readme.txt可参考使用)
|
||||
|
||||
功能:用于搜索同源蛋白序列以及蛋白序列对位排序,比如从序列数据库中,找同源的序列,或者对一个一个新的基因功能进行鉴定,使用hmmer比使用blast有着更高的灵敏度和更高的搜索速度,HMMER的程序如下,注意每个程序都是输出文件在前面,输入文件在后面
|
||||
phmmer:功能:与Blastp类似,使用一个蛋白质序列搜索蛋白质序列库
|
||||
格式:phmmer [-options] <query seqfile> <target seqdb>
|
||||
输入:你要检测的fasta格式的序列和你要搜索的数据库
|
||||
输出匹配的序列和特征:含有score,Taxonomy,Domain,Download
|
||||
参数:输入的文件格式为fasta格式,蛋白质序列库常用的包括Reference Proteomes,UniProtKB,SwissProt,PDB,Ensembl,输出格式包括tblout、domtblout等,蛋白质数据库需要下载
|
||||
jackhmmer:功能:与psiBlast类似,蛋白质序列迭代搜索蛋白质序列库
|
||||
格式:jackhmmer [-options] <query seqfile> <target seqdb>
|
||||
输入:你要检测的fasta格式的序列和你要搜索的数据库
|
||||
输出:匹配的序列及特征,含有score,Taxonomy,Domain,Download
|
||||
参数:输入的文件格式为fasta格式,蛋白质序列库常用的有Reference Proteomes,UniProtKB,SwissProt,PDB,Ensembl,蛋白质数据库需要下载
|
||||
hmmalign:功能 多重序列比对
|
||||
格式: hmmalign [-options] <hmmfile> <seqfile>
|
||||
输入:输入是fasta文件
|
||||
输出:Stockholm 格式的多重序列比对文件
|
||||
参数:输入文件序列格式包括FASTA、EMBL、GenBank、UniProt
|
||||
输出比对文件格式包括Stockholm、Pfam、A2M、PSIBLAST
|
||||
hmmbuild:功能:建立参考数据的隐马尔可科夫模型
|
||||
格式: hmmbuild [-options] <hmmfile output> <alignment file input>
|
||||
输入:多重序列比对的文件(Stockholm file)
|
||||
输出:建立的这些多重序列比对的隐马尔可科夫模型
|
||||
参数:输入文件支持很多生物数据格式如:CLUSTALW, SELEX, GCG MSF
|
||||
输出文件命名时的后缀为.hmm
|
||||
hmmscan:使用序列搜索HMM库
|
||||
格式: hmmscan [-options] <hmm database> <query seqfile>
|
||||
输入:hmm数据库和查询序列文件
|
||||
输出:含有Score和Download,hmm数据库所匹配的序列
|
||||
参数:HMM数据库有Pfam,TIGRFAM,Gene3D,Superfamily,PIRSF,TreeFam
|
||||
hmmsearch:功能:在数据库中寻找已经建立好的模体)
|
||||
格式: hmmsearch [options] <query hmmfile> <target seqfile>
|
||||
输入:建立好的参考数据模型、要搜索的数据库
|
||||
输出:输出结果
|
||||
参数:比较序列文件可以是FASTA、EMBL/UniProt、Genbank格式
|
||||
输出选项:
|
||||
-o:直接输出结果到文件,不是标准输出
|
||||
--tblout:tblout格式输出
|
||||
--domtblout:domtblout格式输出
|
||||
--pfamtblout:pfamtblout格式输出
|
||||
输出结果中分为两类,一类是针对序列的(full sequence),另一类是针对domain的(主要基于一条序列存在多个domain)。
|
||||
结果按照E-values值从小到大排序,形式与blast类似。
|
||||
其中target name是每个目标序列的名称;
|
||||
query name是查询序列的名称;
|
||||
score是比对得分,分值越高说明越相似;
|
||||
E-value目标序列的期望值(统计意义);
|
||||
最重要的是E-value值,值越小,越可信,相当于一个统计量。
|
||||
hmmsim:功能没找到
|
||||
格式: hmmsim [-options] <hmmfile>
|
||||
输入:hmm格式的文件
|
||||
输出:以sequence为名的一行(2.out)
|
||||
hmmstat:显示HMM数据库的统计信息
|
||||
格式: hmmstat [-options] <hmmfile>
|
||||
输入:hmm格式的文件
|
||||
输出:有idx为名的那一行,含有name,accession,nseq,eff_nseq,M,relent,info,p relE,compKL
|
||||
输出显示:# hmmstat :: display summary statistics for a profile file
|
||||
# HMMER 3.0 (March 2010); http://hmmer.org/
|
||||
# Copyright (C) 2010 Howard Hughes Medical Institute.
|
||||
# Freely distributed under the GNU General Public License (GPLv3).
|
||||
# - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - -
|
||||
#
|
||||
# idx name accession nseq eff_nseq M relent info p relE compKL
|
||||
# ---- -------------------- ------------ -------- -------- ------ ------ ------ ------ ------
|
||||
1 sequence - 1 0.39 172 0.59 0.59 0.51 0.03
|
||||
hmmconvert:功能:转换HMM格式
|
||||
格式:hmmconvert [-options] <hmmfile>
|
||||
输入:hmm格式的文件
|
||||
输出:hmm格式转换后的文件
|
||||
hmmemit:功能:从HMM模型中,得到一个模式序列
|
||||
格式: hmmemit [-options] <hmmfile (single)>
|
||||
输入:hmm格式的文件
|
||||
输出:模式序列
|
||||
输出显示:>sequence-sample1
|
||||
IQYNNDSKLYLSLTRGVFKSSKVLAQVSKPPGIDTGTIHTTRRKRIVVDSETKSHELLDT
|
||||
AGDRYFSFDDYLRRATTLVFLFALNRLRHFRKRNTLCEKIMELHGGDNFPNMLVKSEVSD
|
||||
QISELDSEQCSLKPLGNAYKIPHVLAGNDVSKENDTGVLQLVRTIRQYIVRTGP
|
||||
hmmfetch:功能:通过名字或者接受号从HMM库中取回一个HMM模型
|
||||
格式: hmmfetch [options] <hmmfile> <key> (retrieves HMM named <key>)
|
||||
hmmfetch [options] -f <hmmfile> <keyfile> (retrieves all HMMs in <keyfile>)
|
||||
hmmfetch [options] --index <hmmfile> (indexes <hmmfile>)
|
||||
输入:hmm文件和HMM模型的名字或接受号
|
||||
输出:为这个名字或接受号的HMM模型
|
||||
hmmpress:格式化HMM数据库,包括压缩和创建索引,以便于hmmscan搜索使用
|
||||
格式:hmmpress [-options] <hmmfile>
|
||||
输入:hmm格式的文件
|
||||
输出:可获得H3F格式的文件,H3I格式的文件,H3M格式的文件,H3P格式的文件
|
||||
|
||||
45
file_keep/chart/file/5140430432021117
Normal file
45
file_keep/chart/file/5140430432021117
Normal file
@@ -0,0 +1,45 @@
|
||||
# blast
|
||||
|
||||
## 建立数据库
|
||||
|
||||
```shell
|
||||
makeblastdb -in Arabidopsis_thaliana.TAIR10.dna.toplevel.fa -dbtype nucl -out TAIR10 -parse_seqids
|
||||
|
||||
-in # 输入文件
|
||||
-dbtype # 类型 nucl 核酸 prot 蛋白
|
||||
-out # 输出文件位置和名字
|
||||
-parse_seqids #
|
||||
```
|
||||
|
||||
## 比对
|
||||
|
||||
```
|
||||
blastn
|
||||
```
|
||||
|
||||
-query: 检索文件
|
||||
|
||||
-query_loc : 指定检索的位置
|
||||
|
||||
-strand: 搜索正义链还是反义链,还是都要
|
||||
|
||||
out : 输出文件
|
||||
|
||||
-remote: 可以用NCBI的远程数据库, 一般与 -db nr
|
||||
|
||||
-evalue 科学计数法,比如说1e3,定义期望值阈值。E值表明在随机的情况下,其它序列与
|
||||
|
||||
|
||||
|
||||
|
||||
|
||||
|
||||
|
||||
|
||||
|
||||
|
||||
|
||||
|
||||
|
||||
### 比对
|
||||
|
||||
Reference in New Issue
Block a user