BED 逐样本重叠计数矩阵
逐个参考区间统计每份样本中重叠的区间记录;嵌套和重复记录分别计数。保留所有参考字段、样本顺序、完整原始字节与来源报告。
- 1添加输入
- 2确认后运行
- 3获取结果
工具输入和文件在当前浏览器处理,不会上传。
开始之前
逐个参考区间统计每份样本中重叠的区间记录;嵌套和重复记录分别计数。保留所有参考字段、样本顺序、完整原始字节与来源报告。
如何使用
- 先选择参考文件,再选择全部样本文件。
- 向上或向下移动样本,确认矩阵计数列的顺序。
- 运行并核对参考/样本记录数与所有下载字节数。
- 完整复制矩阵,或下载矩阵、报告与全部源副本;在分析流程中核对基因组坐标版本一致。
支持范围与限制
明确选择 1 份参考 BED 和按输出列顺序排列的 1–20 份样本 BED。全部原始文件合计最多 4 MiB、100,000 条区间记录。物理空文件拒绝;含空白或注释的非空样本输出零计数;参考文件必须包含区间。
每条记录为 3–12 个非空字段,以 ASCII 空格或 TAB 分隔;前三列为染色体、起点、终点,其余字段按不透明文本完整保留。矩阵会规范行首尾 ASCII 分隔符。引号和反斜杠是字面字符;不支持空字段或含内部空白的字段。
染色体和源名称最多 512 UTF-8 字节;每个坐标或额外字段最多 65,536 UTF-8 字节。名称须为无 C0/C1/DEL/BOM 控制字符的标量 Unicode。操作系统或文件选择器可能设置更短的文件名上限。
坐标只接受 ASCII 十进制整数,满足 0 ≤ start < end ≤ 9007199254740991。拒绝正负号、小数、指数和零宽区间;保留坐标的前导零拼写。染色体标识区分大小写,输入不要求排序。
区间为从零开始的半开区间 [start,end),相邻端点不算重叠。每条重复或嵌套样本记录分别计入;参考记录不去重、不排序;末尾计数列严格对应屏幕上的样本顺序。
严格 UTF-8,可含一个开头 BOM;允许 LF、CRLF 或混合换行。拒绝单独 CR、错误编码、C0/C1/DEL 控制字符和非开头 BOM。空行、ASCII 空白行及从第零列 # 开始的注释不参与计数,但原始下载完整保留。
全部下载合计最多 32 MiB,包含 overlap-matrix.bed、完整 result-report.json 和所有原始源副本。在分配完整计数矩阵、输出文本和序列化报告前核算精确大小;超限时不提供部分矩阵、复制内容或下载。
矩阵使用 TAB/LF、无表头,保留每个参考字段,再追加每份样本的整数计数。完整报告保留每个字段与计数、源名称/SHA256/字节数/BOM/换行/物理行数、样本记录数和完整导出元数据。源副本保留所有原始字节。
处理在本地 Worker 中进行;10 秒总期限覆盖加载、读取、就绪和计算。取消或超时会终止 Worker,可以用同一批已选文件和顺序重试。屏幕最多预览 4,000 个 Unicode 码点,复制和下载始终完整。
按完整坐标跨度计数,不验证 BED 注释语义,不展开 block,不做链方向或重叠比例筛选,也不推断基因组版本。追加计数列可能超过 12 列,其含义是样本计数而非 BED12 注释。文件内容和名称不上传。
操作示例
示例输入
参考:chr1 0 1000;chr1 1000 2000。样本 1:[20,50)、[30,40)、[1500,1900)。样本 2:[68,786)、[899,987)。
示例参数
样本 1 在前,样本 2 在后;染色体均为 chr1。
示例输出
chr1 0 1000 2 2 chr1 1000 2000 1 0
出现问题时
保留原始文件。修复被拒绝的源,去除不支持的字段或拆分任务,再在相同角色中选择修复后的文件。拒绝、取消和超时均不生成部分输出;取消保留已选 File 和样本顺序,便于重新运行。
常见问题
重复或嵌套区间只计一次吗?
每条重叠的样本记录分别计一次,包括完全相同的重复记录。这里统计记录数,不统计合并覆盖的碱基数。
矩阵列自带样本名称吗?
矩阵按合同不含表头;请用完整报告中按顺序排列的源角色与名称识别末尾每个计数列。