Neatbo.

按明确参考与样本角色统计 BED 重叠

准备兼容坐标跨度、保留矩阵列顺序并核验完整来源文件包。

读取前分配角色

先选择参考文件,其逻辑区间按原顺序成为结果行;再选择 1–20 份样本,使用向上/向下移动调整末尾计数列。文件扩展名不会改变角色。

确保文件使用相同基因组版本和兼容的染色体拼写。标识区分大小写,chr1 与 Chr1 不匹配;工具不能识别错误的基因组版本标签。

参考文件 reference.bed:两条结果行
chr1    0   1000
chr1    1000    2000

核对支持的表结构

每条记录包含 3–12 个非空字段,以 ASCII 空格或 TAB 分隔。前三列为染色体/起点/终点,其余字段不解释语义。注释须从第零列 # 开始;源副本保留全部字节、注释和换行。

使用非空半开区间。样本终点与参考起点相同只算相邻,不增加计数;重复及嵌套样本记录分别计数。物理空文件拒绝,非空注释样本产生零列。

输入字段与结果列的对应关系
字段或列本例解释与检查
染色体chr1按原拼写匹配,区分大小写;文件须使用兼容基因组版本。
起点0 / 10000 基、含起点;必须为非负十进制整数。
终点1000 / 2000不含终点且必须大于起点;仅端点相接不重叠。
参考额外字段本例无;可有第 4–12 列保留全部 token,不解释链方向或 block;各行可有不同列数。
末尾样本计数第一行 2, 2;第二行 1, 0按 sample-001、sample-002 顺序;列数与参考额外字段无关。
第一个样本 sample-001.bed:嵌套记录分别计数
chr1    20  50
chr1    30  40
chr1    1500    1900

核对第二个样本和列顺序

将 sample-002.bed 放在 sample-001.bed 后面。它的两条记录都与参考 [0,1000) 重叠,与 [1000,2000) 均不重叠,所以第二个计数列依次为 2、0。

第二个样本 sample-002.bed:第二个计数列
chr1    68  786
chr1    899 987

保留完整交接文件

复制返回完整矩阵,即使屏幕仅预览前 4,000 个码点。下载 overlap-matrix.bed、result-report.json、source-reference.bed 与每份 source-sample-NNN.bed,并核对全部源字节数和 SHA256。

报告保留所有参考字段和计数、按顺序排列的样本角色/名称、记录总数、BOM/换行信息和导出大小/哈希。矩阵没有表头,应将报告一同保留。

全部下载合计最多 32 MiB;拒绝、取消或 10 秒主机总期限均不生成部分结果。修复源文件或缩小任务后重试;取消保留原始 File 选择和样本顺序。

完整 overlap-matrix.bed:TAB 分隔,无表头
chr1	0	1000	2	2
chr1	1000	2000	1	0
  • 先选择 reference.bed,再按 sample-001.bed、sample-002.bed 顺序选择样本;运行前核对角色、基因组版本和染色体拼写。
  • 按本例核对两行计数为 2,2 和 1,0;下载报告,将每个末尾计数列与有序样本来源对应。
  • 若文件被拒绝,检查起点是否小于终点、UTF-8 与换行、3–12 列,以及工具列出的合计输入与完整下载上限;修改源文件后重新选择。
  • 若取消或超时,使用保留的文件与顺序重新运行;仅在新运行成功后复制或下载,并核对所有源副本的字节数和 SHA256。

参考资料

本分类工具使用说明

展开工具,查看操作步骤、可调选项和支持范围,再直接进入工作区。

BED 逐样本重叠计数矩阵逐个参考区间统计每份样本中重叠的区间记录;嵌套和重复记录分别计数。保留所有参考字段、样本顺序、完整原始字节与来源报告。

逐个参考区间统计每份样本中重叠的区间记录;嵌套和重复记录分别计数。保留所有参考字段、样本顺序、完整原始字节与来源报告。

操作步骤

  1. 先选择参考文件,再选择全部样本文件。
  2. 向上或向下移动样本,确认矩阵计数列的顺序。
  3. 运行并核对参考/样本记录数与所有下载字节数。
  4. 完整复制矩阵,或下载矩阵、报告与全部源副本;在分析流程中核对基因组坐标版本一致。

能力与限制

  • 明确选择 1 份参考 BED 和按输出列顺序排列的 1–20 份样本 BED。全部原始文件合计最多 4 MiB、100,000 条区间记录。物理空文件拒绝;含空白或注释的非空样本输出零计数;参考文件必须包含区间。
  • 每条记录为 3–12 个非空字段,以 ASCII 空格或 TAB 分隔;前三列为染色体、起点、终点,其余字段按不透明文本完整保留。矩阵会规范行首尾 ASCII 分隔符。引号和反斜杠是字面字符;不支持空字段或含内部空白的字段。
  • 染色体和源名称最多 512 UTF-8 字节;每个坐标或额外字段最多 65,536 UTF-8 字节。名称须为无 C0/C1/DEL/BOM 控制字符的标量 Unicode。操作系统或文件选择器可能设置更短的文件名上限。
  • 坐标只接受 ASCII 十进制整数,满足 0 ≤ start < end ≤ 9007199254740991。拒绝正负号、小数、指数和零宽区间;保留坐标的前导零拼写。染色体标识区分大小写,输入不要求排序。
  • 区间为从零开始的半开区间 [start,end),相邻端点不算重叠。每条重复或嵌套样本记录分别计入;参考记录不去重、不排序;末尾计数列严格对应屏幕上的样本顺序。
  • 严格 UTF-8,可含一个开头 BOM;允许 LF、CRLF 或混合换行。拒绝单独 CR、错误编码、C0/C1/DEL 控制字符和非开头 BOM。空行、ASCII 空白行及从第零列 # 开始的注释不参与计数,但原始下载完整保留。
  • 全部下载合计最多 32 MiB,包含 overlap-matrix.bed、完整 result-report.json 和所有原始源副本。在分配完整计数矩阵、输出文本和序列化报告前核算精确大小;超限时不提供部分矩阵、复制内容或下载。
  • 矩阵使用 TAB/LF、无表头,保留每个参考字段,再追加每份样本的整数计数。完整报告保留每个字段与计数、源名称/SHA256/字节数/BOM/换行/物理行数、样本记录数和完整导出元数据。源副本保留所有原始字节。
  • 处理在本地 Worker 中进行;10 秒总期限覆盖加载、读取、就绪和计算。取消或超时会终止 Worker,可以用同一批已选文件和顺序重试。屏幕最多预览 4,000 个 Unicode 码点,复制和下载始终完整。
  • 按完整坐标跨度计数,不验证 BED 注释语义,不展开 block,不做链方向或重叠比例筛选,也不推断基因组版本。追加计数列可能超过 12 列,其含义是样本计数而非 BED12 注释。文件内容和名称不上传。
打开BED 逐样本重叠计数矩阵 →