Neatbo.

枚举最大遗漏切割深度内的全部肽出现位置

准备一条严格蛋白序列或 FASTA,选择切割规则,保留完整位置、CSV、报告和源原字节。

选择一个蛋白和实际格式

一个物理残基行选择序列格式;首行以 > 开头并含非空标题的一条记录选择 FASTA。格式必须明确选择,文件扩展名不会改变它。所选文件优先于粘贴文本;清除文件选择后才使用文本框。

只使用大写 ASCII ACDEFGHIKLMNPQRSTVWY,最多 20,000 个残基。空格、小写、歧义残基、缺口、终止符和修饰写法均拒绝。FASTA 序列可以分成多个非空残基行,标题之后允许空行;第二个标题使整份输入拒绝,不会只取第一个蛋白。

UTF-8 输入允许一个开头 BOM、LF 和 CRLF,包括混合换行;原件保持这些字节。孤立 CR 和非法 UTF-8 拒绝。完整 FASTA 标题最多 65,536 个 UTF-8 字节,不计 >,不含制表符、控制字符或 BOM。标题和空行都计入 50,000 个物理行的上限。文件最多 1 MiB,文件名最多 512 个 UTF-8 字节。

设置规则和最大深度

作者 K/R 规则在每个 K 或 R 后切割,包括 P 前。Expasy 胰蛋白酶使用 Pyteomics 4.7.5 的规则:通常不在 P 前的 K/R 后切割,但明确保留 WKP 和 MRP 例外。两者都包含末端边界。将所选规则与结果一同保留,其他分析才能复现同一组切割位置。

填写 0–10 的整数上限。上限 1 包括未遗漏的单片段与相邻双片段窗口,不是只取后者。提高上限会增加直到该深度的更长连续窗口。

作者 K/R 规则下的 GRGKA
最大深度包含的肽窗口出现记录数
0GR;GK;A3
1GR;GRGK;GK;GKA;A5
2GR;GRGK;GK;GRGKA;GKA;A6

按出现记录读取坐标

残基坐标从 0 开始,包含 start0,不包含 end0。对 GRGKA,[0,2) 是 GR,[2,5) 是 GKA。missedCleavages 是该窗口实际跳过的内部切割边界数,不是所选最大深度。

cuts0 包含 0、所选规则的全部切割边界和序列长度。出现记录按 end0、start0 排序。不同坐标上的相同序列必须保留:KRK 在深度 0 下,K 分别位于 [0,1) 和 [2,3)。不按唯一序列去重。

GRGKA、作者 K/R、最大深度 1 的完整 CSV
start0,end0,missedCleavages,sequence
0,2,0,GR
0,4,1,GRGK
2,4,0,GK
2,5,1,GKA
4,5,0,A

保留三份完整交付件

屏幕最多预览 4,000 个 Unicode 码点;复制获得完整 result-report.json,包含全部切割边界与每个出现记录。交接分析时下载三份文件,原件标识这些位置所对应的精确来源。

报告保留完整 FASTA 标题,序列格式则为 null;同时记录明确格式、规则、最大深度、源名称、字节数、SHA256、BOM、换行元数据、全部计数、边界、出现记录和导出元数据。CSV 保留每个出现记录的四个字段,不截断序列。原件下载使用固定文件名,原始源名称保留在报告中。

完整下载
文件核查内容
peptides.csv与报告同序的每条 start0、end0、missedCleavages 和完整 sequence
result-report.json源身份、完整标题、规则、cuts0、全部出现记录、计数和导出大小
source-protein.txt / source-protein.fasta实际来源的精确原字节,包括 BOM、标题、空行和换行
  • 运行前确认实际来源、明确格式、切割规则和最大深度;所选文件优先于粘贴文本。
  • 完成后下载三份文件,将 CSV 数据行数(不计表头)与 result-report.json 的 occurrenceCount 核对。
  • 按顺序核对 CSV 与报告中的出现记录,保留不同坐标上的相同序列;将原件与报告中的源身份信息一同保留。

从拒绝中恢复,保留完整枚举

分配出现记录输出前先计算完整计数。保护上限是 200,000,自然可接受计数最高 199,991,深度 10 的首次跨越是 200,002。其他约束下不存在自然产生恰好 200,000 条的合法输入。

1 MiB 输入和合计 32 MiB 下载是保护上限。完整合法源语法的字节上界为 185,540;完整报告、CSV 和原件的保守合计上界为 20,141,739。这些更严格的约束使合法输入和输出无法触达较大上限的恰好值,不代表实测浏览器内存。

10 秒截止时间从读文件和加载之前开始,覆盖 Worker 就绪与计算。取消或超时会终止未完成的处理,不发布部分文件、报告复制内容或迟到结果。可保留同一所选 File 和参数重试;语法错误需修正来源,计数超限需减少蛋白长度或深度。

处理留在浏览器,不上传输入内容或名称。结果枚举理论窗口,不确定肽质量、修饰、实验产量或实际酶切概率。

参考资料

  • Klemens Fröhlich:遗漏切割组合

    已捕获的完整问题、两份答案和全部评论支持蛋白/FASTA 与所选深度内全部窗口的任务;未证明浏览器偏好或作者已完成。

本分类工具使用说明

展开工具,查看操作步骤、可调选项和支持范围,再直接进入工作区。

理论肽序列与出现位置从单蛋白序列或单记录 FASTA 枚举所选遗漏切割深度内的全部理论肽,保留出现位置、完整 CSV、JSON 和源原字节。

为一个蛋白选择切割规则和最大遗漏切割深度。保留每个肽的出现记录,包括不同位置的相同序列,并导出完整报告、CSV 和原件。

操作步骤

  1. 选择序列或单记录 FASTA、切割规则,以及整数的最大遗漏切割深度。
  2. 粘贴蛋白序列,或选择其 UTF-8 原文件。
  3. 枚举后检查源长度、切割边界和完整出现记录数。
  4. 复制完整 JSON 报告或下载 CSV、报告和原件;比较重复肽序列时保留它们的位置。

可调选项

输入格式
蛋白序列 · 单记录 FASTA
切割规则
作者 K/R(含 P 前切割) · Expasy 胰蛋白酶(WKP/MRP 例外)
最大遗漏切割次数
1

0–10 的整数;包含从 0 次到该上限的每个深度。

能力与限制

  • 粘贴一个蛋白或选择一个 UTF-8 文件,最多 1 MiB。所选文件优先于粘贴文本;清除文件选择后才使用文本。文件名必须是非空 Unicode 标量文本,最多 512 个 UTF-8 字节,不含控制字符或 BOM。明确选择格式,扩展名不决定格式。
  • 残基只能使用大写 ASCII 字母 ACDEFGHIKLMNPQRSTVWY,非空序列总长最多 20,000 个残基。小写、空格、缺口、歧义残基、终止符和修饰写法均拒绝,不自动规范化。
  • 序列格式只接受一个物理序列行,可带末尾 LF 或 CRLF。FASTA 只接受一条记录:首行以 > 开头,完整非空标题最多 65,536 个 UTF-8 字节,不计 >;标题不含制表符、控制字符或 BOM。标题之后允许空行,每个非空序列行只能含支持的残基。第二条记录会使整份输入拒绝。
  • 允许一个开头 UTF-8 BOM,并记录其存在。原件保留 LF、CRLF 或两者混合;孤立 CR 拒绝。最多 50,000 个物理行,包括 FASTA 标题和空行。完整标题不会缩成第一个词。
  • 作者 K/R 规则在每个 K 或 R 后切割,包括 P 前。Expasy 胰蛋白酶规则遵循 Pyteomics 4.7.5:通常不在 P 前切割,明确保留 WKP 和 MRP 例外。两者都保留末端边界。这些是理论规则,不预测实验中的实际酶切。
  • 最大遗漏切割深度必须是 0–10 的整数。结果包含实际遗漏数从 0 到所选上限的每个连续切割片段窗口,按 end0、start0 排序;不同位置的相同肽序列分别保留。
  • 残基坐标从 0 开始,包含 start0,不包含 end0。cuts0 保留所有边界,包括 0 和序列长度。分配出现记录输出前先检查完整计数,保护上限为 200,000 条。自然可接受的最大计数是 199,991;深度 10 的首次跨越为 200,002。
  • 下载 peptides.csv、result-report.json 和 source-protein.txt 或 source-protein.fasta。CSV 保留每条 start0、end0、missedCleavages、sequence;报告保留完整标题、源身份、全部切割边界、全部出现记录和导出元数据;原件保持原字节。三份下载合计最多 32 MiB,拒绝时不返回部分结果。
  • 屏幕最多预览 4,000 个 Unicode 码点,复制保留完整 JSON 报告。10 秒截止时间覆盖读文件、加载和 Worker 处理。取消或超时会终止尚未完成的处理,不发布迟到或部分结果。内容和文件名留在当前浏览器。
打开理论肽序列与出现位置 →