重叠计数取决于记录与样本顺序
理解相邻端点、重复区间、不透明字段与完整原始源文件的作用。
记录数回答明确的问题
两条嵌套记录可能覆盖同一段碱基,却仍贡献两次重叠。覆盖集合合并会改变所回答的问题;本矩阵保留每条记录的贡献。
重复参考行也完整保留。它们的计数可能相同,但不透明注释或原始位置可能影响下游分析。
chr1 0 1000
chr1 1000 2000
计数列需要来源
更改样本顺序会改变结果列的含义,却不改变参考坐标。无表头矩阵需要配套的有序来源清单;报告中的样本角色、完整名称和 SHA256 使顺序可核验。
空格规范为 TAB 便于阅读,但不等于保留源排版。原始副本保留注释、分隔符、BOM 与换行;遇到争议时应核对这些完整字节。
| 观察项 | 本例结果 | 含义 |
|---|---|---|
| sample-001 重叠记录数 | 参考 [0,1000):2 | [20,50) 与 [30,40) 每条贡献 1;这是矩阵字段。 |
| sample-001 合并覆盖长度 | 参考 [0,1000):30 个碱基 | [30,40) 已包含在 [20,50) 内;矩阵不输出覆盖长度。 |
| sample-002 重叠记录数 | 两条参考行:2、0 | 第二个计数列来自下方两条记录,不由文件名排序决定。 |
| 样本列顺序 | 第二行:1,0;调换后:0,1 | 参考字段保持不变;必须随矩阵保留报告中的有序来源。 |
chr1 20 50
chr1 30 40
chr1 1500 1900
跨度重叠属于有限分析范围
BED 额外列可以描述 block、链方向或注释,本工具将这些字段作为不透明文本。只有当研究问题针对前三列定义的完整跨度时,这种计数才合适;block 或链方向筛选需要对应分析流程。
联合下载上限内的完整结果可用,截断矩阵会造成误解。本工具在分配完整结果前核算矩阵、报告和所有原始文件;超限时修复或拆分输入,并保留每次运行之间的边界。
chr1 68 786
chr1 899 987
- 运行前确认研究问题是完整跨度的重叠记录数;需要覆盖长度、block 展开或链方向筛选时使用对应分析流程。
- 对异常零计数先核对基因组版本和染色体大小写,再检查半开端点;对异常高计数核对嵌套与重复记录是否确实需要分别计数。
- 与他人交换结果时同时保留矩阵、报告和全部源副本;用报告中的顺序、名称和 SHA256 追溯每个计数列。
- 若超限,按样本拆分时每次使用同一份完整参考文件;保留各次报告和样本顺序,再按参考行对应列,不能静默截断输出。
将完整结果与解释一起保留
按 reference.bed、sample-001.bed、sample-002.bed 的角色和顺序运行,得到下方完整矩阵。首行的 2,2 不表示覆盖长度相同;第二行的 1,0 标明两个样本对该跨度的记录计数不同。
chr1 0 1000 2 2
chr1 1000 2000 1 0
参考资料
- 逐参考区间、逐样本计数的原始问题
准入记录保留完整问题与两份回答;不声称原作者已成功、偏好浏览器或需求规模。
本分类工具使用说明
展开工具,查看操作步骤、可调选项和支持范围,再直接进入工作区。
BED 逐样本重叠计数矩阵逐个参考区间统计每份样本中重叠的区间记录;嵌套和重复记录分别计数。保留所有参考字段、样本顺序、完整原始字节与来源报告。
逐个参考区间统计每份样本中重叠的区间记录;嵌套和重复记录分别计数。保留所有参考字段、样本顺序、完整原始字节与来源报告。
操作步骤
- 先选择参考文件,再选择全部样本文件。
- 向上或向下移动样本,确认矩阵计数列的顺序。
- 运行并核对参考/样本记录数与所有下载字节数。
- 完整复制矩阵,或下载矩阵、报告与全部源副本;在分析流程中核对基因组坐标版本一致。
能力与限制
- 明确选择 1 份参考 BED 和按输出列顺序排列的 1–20 份样本 BED。全部原始文件合计最多 4 MiB、100,000 条区间记录。物理空文件拒绝;含空白或注释的非空样本输出零计数;参考文件必须包含区间。
- 每条记录为 3–12 个非空字段,以 ASCII 空格或 TAB 分隔;前三列为染色体、起点、终点,其余字段按不透明文本完整保留。矩阵会规范行首尾 ASCII 分隔符。引号和反斜杠是字面字符;不支持空字段或含内部空白的字段。
- 染色体和源名称最多 512 UTF-8 字节;每个坐标或额外字段最多 65,536 UTF-8 字节。名称须为无 C0/C1/DEL/BOM 控制字符的标量 Unicode。操作系统或文件选择器可能设置更短的文件名上限。
- 坐标只接受 ASCII 十进制整数,满足 0 ≤ start < end ≤ 9007199254740991。拒绝正负号、小数、指数和零宽区间;保留坐标的前导零拼写。染色体标识区分大小写,输入不要求排序。
- 区间为从零开始的半开区间 [start,end),相邻端点不算重叠。每条重复或嵌套样本记录分别计入;参考记录不去重、不排序;末尾计数列严格对应屏幕上的样本顺序。
- 严格 UTF-8,可含一个开头 BOM;允许 LF、CRLF 或混合换行。拒绝单独 CR、错误编码、C0/C1/DEL 控制字符和非开头 BOM。空行、ASCII 空白行及从第零列 # 开始的注释不参与计数,但原始下载完整保留。
- 全部下载合计最多 32 MiB,包含 overlap-matrix.bed、完整 result-report.json 和所有原始源副本。在分配完整计数矩阵、输出文本和序列化报告前核算精确大小;超限时不提供部分矩阵、复制内容或下载。
- 矩阵使用 TAB/LF、无表头,保留每个参考字段,再追加每份样本的整数计数。完整报告保留每个字段与计数、源名称/SHA256/字节数/BOM/换行/物理行数、样本记录数和完整导出元数据。源副本保留所有原始字节。
- 处理在本地 Worker 中进行;10 秒总期限覆盖加载、读取、就绪和计算。取消或超时会终止 Worker,可以用同一批已选文件和顺序重试。屏幕最多预览 4,000 个 Unicode 码点,复制和下载始终完整。
- 按完整坐标跨度计数,不验证 BED 注释语义,不展开 block,不做链方向或重叠比例筛选,也不推断基因组版本。追加计数列可能超过 12 列,其含义是样本计数而非 BED12 注释。文件内容和名称不上传。