CDD蛋白质结构域数据库_蛋白质序列数据库的数据库分类

⑴ 我们生物化学讲到蛋白质的内容，想问一下一个名词，什么叫“蛋白质三级结构的数据库”

蛋白质结构可以进行预测。通过已知氨基酸序列，利用计算的手段预测蛋白质的二级结构和空间三维结构。
目前蛋白质结构数据库 PDB中所存储的蛋白质三维结构主要通过X 射线晶体衍射和核磁共振成像技术，蛋白质的结构检测比序列检测要难得多。

⑵ 蛋白质序列数据库的数据库分类

PIR数据库按照数据的性质和注释层次分四个不同部分，分别为PIR1、PIR2、PIR3和PIR4。PIR1中的序列已经验证，注释最为详尽；PIR2中包含尚未确定的冗余序列；PIR3中的序列尚未加以检验，也未加注释; 而PIR4中则包括了其它各种渠道获得的序列，既未验证，也无注释。除了PIR外，另一个重要的蛋白质序列数据库则是SwissProt。该数据库由瑞士日内瓦大学于1986年创建，目前由瑞士生物信息学研究所(Swiss Institute of Bioinformatics，简称SIB)和欧洲生物信息学研究所 EBI共同维护和管理。瑞士生物信息研究所下属的蛋白质分析专家系统(Expert Protein Analysis System,，简称ExPASy)的Web服务器除了开发和维护SwissProt数据库外，也是国际上蛋白质组和蛋白质分子模型研究的中心，为用户提供大量蛋白质信息资源。北京大学生物信息中心设有ExPASy的镜象。PIR和SwissProt是创建最早、使用最为广泛的两个蛋白质数据库。随着各种模式生物基因组计划的进展，DNA序列特别是EST序列大量进入核酸序列数据库。蛋白质序列数据库TrEMBL是从EMBL中的cDNA序列翻译得到的。TrEMBL数据库创建是于1996年[Bairoch, 2000]，意为“Translation of EMBL”。该数据库采用SwissProt数据库格式，包含EMBL数据库中所有编码序列的翻译。TrEMBL数据库分两部分，SP-TrEMBL和 REM-TrEMBL。SP-TrEMBL中的条目最终将归并到SwissProt数据库中。而Rem-TrEMBL则包括其它剩余序列，包括免疫球蛋白、T细胞受体、少于8个氨基酸残基的小肽、合成序列、专利序列等。与TrEMBL类似，GenPept是由GenBank翻译得到的蛋白质序列。由于TrEMBL和GenPept均是由核酸序列通过计算机程序翻译生成，这两个数据库中的序列错误率较大，均有较大的冗余度。另一个常用的蛋白质序列数据库是已知三维结构蛋白质的一级结构序列数据库NRL-3D[Namboodiri, 1990]。该数据库的序列是从三维结构数据库PDB中提取出来。

⑶ 蛋白质数据库的内容

Protein Sequence Databases: Antibodies: Sequence and Structure
BRENDA: Enzyme database
CD Antigens: Database of CD antigens
dbCFC: Cytokine family database
Histons: Histone sequence database
HPRD: Human protein reference database
InterPro: Intergrated documentation 5resources for protein families
iProClass: An integrated protein classification database
KIND: A non-rendant protein sequence database
MHCPEP: Database of MHC binding peptides
MIPS: Munich information centre for protein sequences
PIR: Annotated, and non-rendant protein sequence database
PIR-ALN: Curated database of protein sequence alignments
PIR-NREF: PIR nonrendent reference protein database
PMD: Protein mutant database
PRF: Protein research foundation, Japan
ProClass: Non-rendant protein database
ProtoMap: Hierarchical classification of swissprot proteins
REBASE: Restriction enzyme database
RefSeq: Reference sequence database at NCBI
SwissProt: Curated protein sequence database
SPTR: Comprehensive protein sequence database
Transfac: Transcription factor database
TrEMBL: Annotated translations of EMBL nucleotide sequences
Tumor gene database: Genes with cancer-causing mutations
WD repeats: WD-repeat family of proteins Protein Structure Databases: Cath: Protein structure classification
HIV Protease: HIV protease database 3D structure
PDB: 3-D macromolecular structure data
PSI: Protein structure initiative
S2F: Structure to function project
Scop: Structural Classification of Proteins Protein Domains, Motifs & Signatures: BLOCKS: Multipe aligned segments of conserved protein regions
CCD: Conserved domain database and search service
DOMO: Homologous protein domain families
Pfam: Database of protein domains and HMMs
ProDom: Protein domain database
Prints: Protein motif fingerprint database
Prosite: Database of protein families and domains
SMART: Simple molar architecture research tool
TIGRFAM: Protein families based on HMMs Others: Phospho Site: Database of phosphorylation sites

⑷ 蛋白质三维结构数据库的数据格式

每个PDB文件可能分割成一系列行，由行终止符终止。在记录文件中每行由80列组成。每条PDB记录末尾标志应该是行终止符。PDB文件中每行都是自我识别的。每行的前六列存放记录名称，左对齐空格补足.必须和规定的记录名称一致。PDB文件也可看成是各种记录类型的总和。每个记录类型包括一行或多行又被更深一层分成各字段。以下是PDB文件存储数据格式的一个完整简洁的说明：
标题部分
1 HEADER(分子类，公布日期、ID号)
2 OBSLTE (注明此ID号已改为新号)
3 TITLE(说明实验方法类型)
4 CAVEAT(可能的错误提示)
5 COMPND(化合物分子组成)
6 SOURCE(化合物来源)
7 KEYWDS(关键词)
8 EXPDTA(测定结构所用的实验方法)
9 AUTHOR(结构测定者)
10 REVDAT(修订日期及相关内容)
11 SPRSDE(已撤销或更改的相关记录)
12 JRNL(发表坐标集的文献)
13 REMARK
REMARK 1(有关文献)
REMARK 2(最大分辨率)
REMARK 3(用到的程序和统计方法)
REMARK 4-999
一级结构
1 DBREF (其他序列库的有关记录)
2 SEQADV ( PDB与其他记录的出入)
3 SEQRES (残基序列)
4 MODRES (对标准残基的修饰)
杂因子
1 HET(非标准残基)
2 HETNAM(非标准残基的名称)
3 HETSNY (非标准残基的同义字)
4 FORMOL（非标准残基的化学式）
二级结构
1 HELIX(螺旋)
2 SHEET(折叠片)
3 TURN(转角)
连接注释
1 SSBOND(二硫键)
2 LINK(残基间化学键)
3 HYDBND(氢键)
4 SLTBRG(盐桥)
5 CISPEP(顺式残基)
晶胞特征及坐标变换
1 CRYST1(晶胞参数)
2 ORIGXn(直角－PDB坐标)
3 SCALEn(直角－部分结晶学坐标)
4 MTRIXn(非晶相对称)
5 TVECT(转换因子)
坐标部分
1 MODEL(多亚基时示亚基号)
2 ATOM(标准基团的原子坐标)
3 SIGATM(标准差)
4 ANISOU(温度因子)
5 SIGUIJ(各种温度因素导致的标准差)
6 TER(链末端)
7 HETATM(非标准基团原子坐标)
8 ENDMDL(亚基结束)
连通性部分
CONECT(原子间的连通性有关记录)
簿记
1 MASTER (版权拥有者)
2 END(文件结束)

⑸ 常用的查询蛋白质结构以及序列的数据库主要有哪些

1. PIR和PSD
PIR国际蛋白质序列数据库(PSD)是由蛋白质信息资源(PIR)、慕尼黑蛋白质序列信息中心(MIPS)和日本国际蛋白质序列数据库(JIPID)共同维护的国际上最大的公共蛋白质序列数据库，可在这里下载。这是一个全面的、经过注释的、非冗余的蛋白质序列数据库，其中包括来自几十个完整基因组的蛋白质序列。所有序列数据都经过整理，超过99%的序列已按蛋白质家族分类，一半以上还按蛋白质超家族进行了分类。PSD的注释中还包括对许多序列、结构、基因组和文献数据库的交叉索引，以及数据库内部条目之间的索引，这些内部索引帮助用户在包括复合物、酶－底物相互作用、活化和调控级联和具有共同特征的条目之间方便的检索。每季度都发行一次完整的数据库，每周可以得到更新部分。
PSD数据库有几个辅助数据库，如基于超家族的非冗余库等。PIR提供三类序列搜索服务：基于文本的交互式检索；标准的序列相似性搜索，包括BLAST、FASTA等；结合序列相似性、注释信息和蛋白质家族信息的高级搜索，包括按注释分类的相似性搜索、结构域搜索GeneFIND等。
2. SWISS-PROT
SWISS-PROT是经过注释的蛋白质序列数据库，由欧洲生物信息学研究所(EBI)维护。数据库由蛋白质序列条目构成，每个条目包含蛋白质序列、引用文献信息、分类学信息、注释等，注释中包括蛋白质的功能、转录后修饰、特殊位点和区域、二级结构、四级结构、与其它序列的相似性、序列残缺与疾病的关系、序列变异体和冲突等信息。SWISS-PROT中尽可能减少了冗余序列，并与其它30多个数据建立了交叉引用，其中包括核酸序列库、蛋白质序列库和蛋白质结构库等。
利用序列提取系统(SRS)可以方便地检索SWISS-PROT和其它EBI的数据库。SWISS-PROT只接受直接测序获得的蛋白质序列，序列提交可以在其Web页面上完成。
3. PROSITE
PROSITE数据库收集了生物学有显着意义的蛋白质位点和序列模式，并能根据这些位点和模式快速和可靠地鉴别一个未知功能的蛋白质序列应该属于哪一个蛋白质家族。有的情况下，某个蛋白质与已知功能蛋白质的整体序列相似性很低，但由于功能的需要保留了与功能密切相关的序列模式，这样就可能通过PROSITE的搜索找到隐含的功能motif，因此是序列分析的有效工具。PROSITE中涉及的序列模式包括酶的催化位点、配体结合位点、与金属离子结合的残基、二硫键的半胱氨酸、与小分子或其它蛋白质结合的区域等；除了序列模式之外，PROSITE还包括由多序列比对构建的profile，能更敏感地发现序列与profile的相似性。PROSITE的主页上提供各种相关检索服务。
4. PDB
蛋白质数据仓库(PDB)是国际上唯一的生物大分子结构数据档案库，由美国Brookhaven国家实验室建立。PDB收集的数据来源于X光晶体衍射和核磁共振(NMR)的数据，经过整理和确认后存档而成。目前PDB数据库的维护由结构生物信息学研究合作组织(RCSB)负责。RCSB的主服务器和世界各地的镜像服务器提供数据库的检索和下载服务，以及关于PDB数据文件格式和其它文档的说明，PDB数据还可以从发行的光盘获得。使用Rasmol等软件可以在计算机上按PDB文件显示生物大分子的三维结构。
5. SCOP
蛋白质结构分类(SCOP)数据库详细描述了已知的蛋白质结构之间的关系。分类基于若干层次：家族，描述相近的进化关系；超家族，描述远源的进化关系；折叠子(fold)，描述空间几何结构的关系；折叠类，所有折叠子被归于全α、全β、α/β、α＋β和多结构域等几个大类。SCOP还提供一个非冗余的ASTRAIL序列库，这个库通常被用来评估各种序列比对算法。此外，SCOP还提供一个PDB-ISL中介序列库，通过与这个库中序列的两两比对，可以找到与未知结构序列远缘的已知结构序列。
6. COG
蛋白质直系同源簇(COGs)数据库是对细菌、藻类和真核生物的21个完整基因组的编码蛋白，根据系统进化关系分类构建而成。COG库对于预测单个蛋白质的功能和整个新基因组中蛋白质的功能都很有用。利用COGNITOR程序，可以把某个蛋白质与所有COGs中的蛋白质进行比对，并把它归入适当的COG簇。COG库提供了对COG分类数据的检索和查询，基于Web的COGNITOR服务，系统进化模式的查询服务等。

CDD蛋白质结构域数据库

与CDD蛋白质结构域数据库相关的内容