PDB声明链序列导出
将legacy PDB蛋白SEQRES声明导出为带可逆链标识的FASTA,保留固定列残基来源、明确MODRES映射与未知位置。
- 1添加输入
- 2调整设置
- 3获取结果
工具输入和文件在当前浏览器处理,不会上传。
开始之前
提取指定链声明的序列。SEQRES与实际有坐标的残基可能不同,报告明确保留这一区别。
如何使用
- 打开含SEQRES的ASCII PDB,选择全部或一个精确链字符。
- 对照输入/选中数量,检查未知残基与MODRES映射的来源位置。
- 下载声明链FASTA和完整位置报告。
支持范围与限制
一个ASCII legacy文本文件或粘贴文本,最多10 MiB、200,000行、含空格在内95个可打印ASCII链标识、100,000个残基;完整下载合计最多20 MiB。每条链numRes用四位字段,并须与全部收集残基一致。
严格PDB固定列:每链serial从1递增,count一致,每SEQRES行最多13个填充的三字符槽位。错误分隔、空槽后再填、短代码、超出槽位或数量不符拒绝;不支持核酸profile、mmCIF及非ASCII输入。
映射20种标准氨基酸和ASX/GLX/UNK;唯一chain+残基名MODRES母残基映射生效,冲突拒绝。其他大写字母/数字三字符蛋白残基输出X,并列原名、parent、一基位置、来源行列,不隐藏未知。
选择全部链或一个精确字符,空链用一个空格;所选链不存在则拒绝。FASTA的chain-uXXXX可逆编码原ASCII值,空格为chain-u0020。选链报告仍显示完整输入链/残基总数;无SEQRES明确为no-declared-sequence,不用ATOM补齐。
FASTA、JSON和CSV包含每个选中残基;表格前200行、长单元格2,000字符,报告超过20,000字符时复制明确为预览。这是声明转换,不核验观察坐标,不推测缺失残基或生物事实。
操作示例
示例输入
SEQRES 1 A 21 GLY ILE VAL GLU GLN CYS CYS THR SER ILE CYS SER LEU SEQRES 2 A 21 TYR GLN LEU GLU ASN TYR CYS ASN SEQRES 1 B 3 MSE UNK ALA MODRES 1ABC MSE B 1 MET SELENOMETHIONINE
示例参数
{"secondary":"","params":{"chainMode":"all","chainId":"A","spreadsheetSafe":true}}示例输出
{"format":"legacy-PDB3.3-protein-SEQRES","summary":{"inputLines":4,"inputChains":2,"inputResidues":24,"selectedChains":2,"selectedResidues":24,"unknownResidues":1,"status":"declared-sequences"},"chainEncoding":"FASTA identifier chain-uXXXX encodes the original printable ASCII code point in uppercase hexadecimal; blank is chain-u0020.","chains":[{"chain":"A","chainCode":65,"declaredCount":21,"lastSerial":2,"residues":[{"position":1,"name":"GLY","parent":"GLY","letter":"G","status":"standard","line":1,"column":20},{"position":2,"name":"ILE","parent":"ILE","letter":"I","status":"standard","line":1,"column":24},{"position":3,"name":"VAL","parent":"VAL","letter":"V","status":"standard","line":1,"column":28},{"position":4,"name":"GLU","parent":"GLU","letter":"E","status":"standard","line":1,"column":32},{"position":5,"name":"GLN","parent":"GLN","letter":"Q","status":"standard","line":1,"column":36},{"position":6,"name":"CYS","parent":"CYS","letter":"C","status":"standard","line":1,"column":40},{"position":7,"name":"CYS","parent":"CYS","letter":"C","status":"standard","line":1,"column":44},{"position":8,"name":"THR","parent":"THR","letter":"T","status":"standard","line":1,"column":48},{"position":9,"name":"SER","parent":"SER","letter":"S","status":"standard","line":1,"column":52},{"position":10,"name":"ILE","parent":"ILE","letter":"I","status":"standard","line":1,"column":56},{"position":11,"name":"CYS","parent":"CYS","letter":"C","status":"standard","line":1,"column":60},{"position":12,"name":"SER","parent":"SER","letter":"S","status":"standard","line":1,"column":64},{"position":13,"name":"LEU","parent":"LEU","letter":"L","status":"standard","line":1,"column":68},{"position":14,"name":"TYR","parent":"TYR","letter":"Y","status":"standard","line":2,"column":20},{"position":15,"name":"GLN","parent":"GLN","letter":"Q","status":"standard","line":2,"column":24},{"position":16,"name":"LEU","parent":"LEU","letter":"L","status":"standard","line":2,"column":28},{"position":17,"name":"GLU","parent":"GLU","letter":"E","status":"standard","line":2,"column":32},{"position":18,"name":"ASN","parent":"ASN","letter":"N","status":"standard","line":2,"column":36},{"position":19,"name":"TYR","parent":"TYR","letter":"Y","status":"standard","line":2,"column":40},{"position":20,"name":"CYS","parent":"CYS","letter":"C","status":"standard","line":2,"column":44},{"position":21,"name":"ASN","parent":"ASN","letter":"N","status":"standard","line":2,"column":48}],"sequence":"GIVEQCCTSICSLYQLENYCN"},{"chain":"B","chainCode":66,"declaredCount":3,"lastSerial":1,"residues":[{"position":1,"name":"MSE","parent":"MET","letter":"M","status":"MODRES-mapped","line":3,"column":20},{"position":2,"name":"UNK","parent":"UNK","letter":"X","status":"unknown-residue","line":3,"column":24},{"position":3,"name":"ALA","parent":"ALA","letter":"A","status":"standard","line":3,"column":28}],"sequence":"MXA"}],"modres":[{"line":4,"chain":"B","name":"MSE","parent":"MET"}],"scope":"Declared SEQRES only, no ATOM fallback/observed-residue/biological validation. 20 standard amino acids plus ASX/GLX/UNK; unique MODRES chain+name mapping. Unknown three-character names become X with source positions. Nucleotides/mmCIF unsupported."}出现问题时
检查ASCII legacy PDB固定列、三字符蛋白残基槽、连续serial、恒定且匹配的numRes和无歧义MODRES parent;选择现有链。mmCIF/核酸等不支持数据应由原工具重新导出。
常见问题
为什么与坐标序列不同?
SEQRES表示声明序列;ATOM/HETATM表示坐标观察,可能缺失残基。本工具不会用一种记录补另一种。
空链如何表示?
原字符为ASCII32;选单链时填写一个空格,FASTA用可逆标识chain-u0020。
修饰残基都能转为已知氨基酸吗?
不能。仅使用唯一的明确MODRES parent或已声明标准映射,未知名称仍为X并保留位置;冲突映射拒绝。