This commit is contained in:
XXAY
2021-09-25 15:03:07 +08:00
parent ad40d66c70
commit 77406e40a3
4 changed files with 137 additions and 3 deletions

View File

@@ -0,0 +1,89 @@
HMMER
在线使用https://www.ebi.ac.uk/Tools/hmmer/search/phmmer
下载http://hmmer.janelia.org/static/binaries/hmmer3.0_windows.zip将网址放在迅雷网盘进行下载该文件含有readme.txt可参考使用
功能用于搜索同源蛋白序列以及蛋白序列对位排序比如从序列数据库中找同源的序列或者对一个一个新的基因功能进行鉴定使用hmmer比使用blast有着更高的灵敏度和更高的搜索速度HMMER的程序如下注意每个程序都是输出文件在前面输入文件在后面
phmmer:功能与Blastp类似使用一个蛋白质序列搜索蛋白质序列库
格式phmmer [-options] <query seqfile> <target seqdb>
输入你要检测的fasta格式的序列和你要搜索的数据库
输出匹配的序列和特征含有score,Taxonomy,Domain,Download
参数输入的文件格式为fasta格式蛋白质序列库常用的包括Reference Proteomes,UniProtKB,SwissProt,PDB,Ensembl,输出格式包括tblout、domtblout等蛋白质数据库需要下载
jackhmmer:功能与psiBlast类似蛋白质序列迭代搜索蛋白质序列库
格式jackhmmer [-options] <query seqfile> <target seqdb>
输入你要检测的fasta格式的序列和你要搜索的数据库
输出匹配的序列及特征含有score,Taxonomy,Domain,Download
参数输入的文件格式为fasta格式蛋白质序列库常用的有Reference Proteomes,UniProtKB,SwissProt,PDB,Ensembl蛋白质数据库需要下载
hmmalign:功能 多重序列比对
格式: hmmalign [-options] <hmmfile> <seqfile>
输入输入是fasta文件
输出Stockholm 格式的多重序列比对文件
参数输入文件序列格式包括FASTA、EMBL、GenBank、UniProt
输出比对文件格式包括Stockholm、Pfam、A2M、PSIBLAST
hmmbuild:功能:建立参考数据的隐马尔可科夫模型
格式: hmmbuild [-options] <hmmfile output> <alignment file input>
输入多重序列比对的文件Stockholm file
输出:建立的这些多重序列比对的隐马尔可科夫模型
参数输入文件支持很多生物数据格式如CLUSTALW, SELEX, GCG MSF
输出文件命名时的后缀为.hmm
hmmscan:使用序列搜索HMM库
格式: hmmscan [-options] <hmm database> <query seqfile>
输入hmm数据库和查询序列文件
输出含有Score和Downloadhmm数据库所匹配的序列
参数HMM数据库有Pfam,TIGRFAM,Gene3D,Superfamily,PIRSF,TreeFam
hmmsearch:功能:在数据库中寻找已经建立好的模体)
格式: hmmsearch [options] <query hmmfile> <target seqfile>
输入:建立好的参考数据模型、要搜索的数据库
输出:输出结果
参数比较序列文件可以是FASTA、EMBL/UniProt、Genbank格式
输出选项:
-o直接输出结果到文件不是标准输出
--tblouttblout格式输出
--domtbloutdomtblout格式输出
--pfamtbloutpfamtblout格式输出
输出结果中分为两类一类是针对序列的full sequence另一类是针对domain的主要基于一条序列存在多个domain
结果按照E-values值从小到大排序形式与blast类似。
其中target name是每个目标序列的名称
query name是查询序列的名称
score是比对得分分值越高说明越相似
E-value目标序列的期望值统计意义
最重要的是E-value值值越小越可信相当于一个统计量。
hmmsim功能没找到
格式: hmmsim [-options] <hmmfile>
输入hmm格式的文件
输出以sequence为名的一行2.out
hmmstat:显示HMM数据库的统计信息
格式: hmmstat [-options] <hmmfile>
输入hmm格式的文件
输出有idx为名的那一行含有name,accession,nseq,eff_nseq,M,relent,info,p relE,compKL
输出显示:# hmmstat :: display summary statistics for a profile file
# HMMER 3.0 (March 2010); http://hmmer.org/
# Copyright (C) 2010 Howard Hughes Medical Institute.
# Freely distributed under the GNU General Public License (GPLv3).
# - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - -
#
# idx name accession nseq eff_nseq M relent info p relE compKL
# ---- -------------------- ------------ -------- -------- ------ ------ ------ ------ ------
1 sequence - 1 0.39 172 0.59 0.59 0.51 0.03
hmmconvert:功能转换HMM格式
格式hmmconvert [-options] <hmmfile>
输入hmm格式的文件
输出hmm格式转换后的文件
hmmemit:功能从HMM模型中得到一个模式序列
格式: hmmemit [-options] <hmmfile (single)>
输入hmm格式的文件
输出:模式序列
输出显示:>sequence-sample1
IQYNNDSKLYLSLTRGVFKSSKVLAQVSKPPGIDTGTIHTTRRKRIVVDSETKSHELLDT
AGDRYFSFDDYLRRATTLVFLFALNRLRHFRKRNTLCEKIMELHGGDNFPNMLVKSEVSD
QISELDSEQCSLKPLGNAYKIPHVLAGNDVSKENDTGVLQLVRTIRQYIVRTGP
hmmfetch:功能通过名字或者接受号从HMM库中取回一个HMM模型
格式: hmmfetch [options] <hmmfile> <key> (retrieves HMM named <key>)
hmmfetch [options] -f <hmmfile> <keyfile> (retrieves all HMMs in <keyfile>)
hmmfetch [options] --index <hmmfile> (indexes <hmmfile>)
输入hmm文件和HMM模型的名字或接受号
输出为这个名字或接受号的HMM模型
hmmpress:格式化HMM数据库包括压缩和创建索引以便于hmmscan搜索使用
格式hmmpress [-options] <hmmfile>
输入hmm格式的文件
输出可获得H3F格式的文件H3I格式的文件H3M格式的文件H3P格式的文件

View File

@@ -0,0 +1,45 @@
# blast
## 建立数据库
```shell
makeblastdb -in Arabidopsis_thaliana.TAIR10.dna.toplevel.fa -dbtype nucl -out TAIR10 -parse_seqids
-in # 输入文件
-dbtype # 类型 nucl 核酸 prot 蛋白
-out # 输出文件位置和名字
-parse_seqids #
```
## 比对
```
blastn
```
-query: 检索文件
-query_loc : 指定检索的位置
-strand 搜索正义链还是反义链,还是都要
out : 输出文件
-remote 可以用NCBI的远程数据库 一般与 -db nr
-evalue 科学计数法比如说1e3定义期望值阈值。E值表明在随机的情况下其它序列与
### 比对