Neatbo.

相同肽序列可能来自不同位置

理解遗漏切割枚举为何需要每次出现记录、明确切割规则和源证据,以及序列去重会丢失什么。

最大深度包括较短窗口

Klemens Fröhlich 的问题从 GRGKA 开始,询问允许遗漏切割时可能得到哪些肽。作者后续评论澄清,列表需要包含所选深度以内的所有组合。因此可在连续切割片段上滑动窗口;只跳过交替切割会漏掉合法窗口。

作者 K/R 规则下,GRGKA 有 GR、GK、A 三个未遗漏片段。最大遗漏一次时保留这三条,再增加 GRGK 和 GKA;最大两次时还增加 GRGKA。深度 1 的五行结果是完整的,虽然新增的连接窗口只有两条。

序列与出现记录的身份不同

肽字符串集合回答有哪些不同序列;出现记录表回答每个窗口来自哪里。蛋白重复残基或片段时,两者不同。作者 K/R 规则、深度 0 下,KRK 在 [0,1) 有 K,在 [1,2) 有 R,在 [2,3) 还有一个 K。

两个 K 行都包含证据。保留坐标与实际遗漏数后,下游可以有意识地按序列分组,同时保留每个源区间。枚举时去重会使被删掉的位置无法从剩余行重建。

KRK、作者 K/R、最大深度 0
start0end0missedCleavagessequence
010K
120R
230K

切割规则是结果的一部分

原作者的 K/R 切分包含 P 前切割;Expasy 胰蛋白酶通常不在 P 前切割,但 WKP 和 MRP 是明确例外。对 AKP,作者规则在深度 0 产生 AK 和 P,Expasy 产生完整 AKP。只写胰蛋白酶会隐藏这个影响结果的选择。

报告因此保留明确 profile 和完整 cuts0 数组。坐标从 0 开始,使用不包含终点的半开区间。末端 K 或 R 不会产生空的尾部肽,序列末端只保留一个边界。

两种规则都不估计实验实际观察到什么。窗口枚举不计算肽质量、修饰、浓度、产量或酶切概率。按理论分析目的选择规则,并让这个选择随结果保留。

完整性需要原件和可见拒绝

单记录 FASTA 让坐标对应同一个蛋白。完整标题,包括空格,保留在报告中;原字节文件保留 BOM、空行和换行。第二条记录使整份输入拒绝,避免它消失后第一条结果仍看起来像完整输出。

增加遗漏深度会增加窗口数。分配出现记录输出前先检查完整计数,保护上限为 200,000。深度 10 下,18,186 个切割片段产生 199,991 条;18,187 个片段产生 200,002 条并拒绝。不能把上限描述成可自然达到的恰好 200,000 行示例。

屏幕预览到 4,000 个 Unicode 码点为止,报告复制和 CSV 全部行仍保持完整。拒绝、取消或覆盖读文件、加载、Worker 的 10 秒截止时间均不返回部分或迟到结果。需要他人核查时,一同交付完整报告、CSV 和原件。

  • 将完整 cuts0、所选 profile 和最大深度与每份出现记录表一同保留。
  • 保留不同位置的相同序列;保存源区间后再进行分组。
  • 交接位置前,核对源名称、字节数和 SHA256 是否对应预期原件。
  • 长结果使用完整报告复制或下载核查;屏幕预览不代表全部枚举。

参考资料

  • Klemens Fröhlich:遗漏切割组合

    已捕获完整问题、两份答案和全部评论,包括作者关于包含各深度的澄清;未证明作者已完成、浏览器偏好或市场规模。

本分类工具使用说明

展开工具,查看操作步骤、可调选项和支持范围,再直接进入工作区。

理论肽序列与出现位置从单蛋白序列或单记录 FASTA 枚举所选遗漏切割深度内的全部理论肽,保留出现位置、完整 CSV、JSON 和源原字节。

为一个蛋白选择切割规则和最大遗漏切割深度。保留每个肽的出现记录,包括不同位置的相同序列,并导出完整报告、CSV 和原件。

操作步骤

  1. 选择序列或单记录 FASTA、切割规则,以及整数的最大遗漏切割深度。
  2. 粘贴蛋白序列,或选择其 UTF-8 原文件。
  3. 枚举后检查源长度、切割边界和完整出现记录数。
  4. 复制完整 JSON 报告或下载 CSV、报告和原件;比较重复肽序列时保留它们的位置。

可调选项

输入格式
蛋白序列 · 单记录 FASTA
切割规则
作者 K/R(含 P 前切割) · Expasy 胰蛋白酶(WKP/MRP 例外)
最大遗漏切割次数
1

0–10 的整数;包含从 0 次到该上限的每个深度。

能力与限制

  • 粘贴一个蛋白或选择一个 UTF-8 文件,最多 1 MiB。所选文件优先于粘贴文本;清除文件选择后才使用文本。文件名必须是非空 Unicode 标量文本,最多 512 个 UTF-8 字节,不含控制字符或 BOM。明确选择格式,扩展名不决定格式。
  • 残基只能使用大写 ASCII 字母 ACDEFGHIKLMNPQRSTVWY,非空序列总长最多 20,000 个残基。小写、空格、缺口、歧义残基、终止符和修饰写法均拒绝,不自动规范化。
  • 序列格式只接受一个物理序列行,可带末尾 LF 或 CRLF。FASTA 只接受一条记录:首行以 > 开头,完整非空标题最多 65,536 个 UTF-8 字节,不计 >;标题不含制表符、控制字符或 BOM。标题之后允许空行,每个非空序列行只能含支持的残基。第二条记录会使整份输入拒绝。
  • 允许一个开头 UTF-8 BOM,并记录其存在。原件保留 LF、CRLF 或两者混合;孤立 CR 拒绝。最多 50,000 个物理行,包括 FASTA 标题和空行。完整标题不会缩成第一个词。
  • 作者 K/R 规则在每个 K 或 R 后切割,包括 P 前。Expasy 胰蛋白酶规则遵循 Pyteomics 4.7.5:通常不在 P 前切割,明确保留 WKP 和 MRP 例外。两者都保留末端边界。这些是理论规则,不预测实验中的实际酶切。
  • 最大遗漏切割深度必须是 0–10 的整数。结果包含实际遗漏数从 0 到所选上限的每个连续切割片段窗口,按 end0、start0 排序;不同位置的相同肽序列分别保留。
  • 残基坐标从 0 开始,包含 start0,不包含 end0。cuts0 保留所有边界,包括 0 和序列长度。分配出现记录输出前先检查完整计数,保护上限为 200,000 条。自然可接受的最大计数是 199,991;深度 10 的首次跨越为 200,002。
  • 下载 peptides.csv、result-report.json 和 source-protein.txt 或 source-protein.fasta。CSV 保留每条 start0、end0、missedCleavages、sequence;报告保留完整标题、源身份、全部切割边界、全部出现记录和导出元数据;原件保持原字节。三份下载合计最多 32 MiB,拒绝时不返回部分结果。
  • 屏幕最多预览 4,000 个 Unicode 码点,复制保留完整 JSON 报告。10 秒截止时间覆盖读文件、加载和 Worker 处理。取消或超时会终止尚未完成的处理,不发布迟到或部分结果。内容和文件名留在当前浏览器。
打开理论肽序列与出现位置 →