按明确参考与样本角色统计 BED 重叠
准备兼容坐标跨度、保留矩阵列顺序并核验完整来源文件包。
读取前分配角色
先选择参考文件,其逻辑区间按原顺序成为结果行;再选择 1–20 份样本,使用向上/向下移动调整末尾计数列。文件扩展名不会改变角色。
确保文件使用相同基因组版本和兼容的染色体拼写。标识区分大小写,chr1 与 Chr1 不匹配;工具不能识别错误的基因组版本标签。
chr1 0 1000
chr1 1000 2000
核对支持的表结构
每条记录包含 3–12 个非空字段,以 ASCII 空格或 TAB 分隔。前三列为染色体/起点/终点,其余字段不解释语义。注释须从第零列 # 开始;源副本保留全部字节、注释和换行。
使用非空半开区间。样本终点与参考起点相同只算相邻,不增加计数;重复及嵌套样本记录分别计数。物理空文件拒绝,非空注释样本产生零列。
| 字段或列 | 本例 | 解释与检查 |
|---|---|---|
| 染色体 | chr1 | 按原拼写匹配,区分大小写;文件须使用兼容基因组版本。 |
| 起点 | 0 / 1000 | 0 基、含起点;必须为非负十进制整数。 |
| 终点 | 1000 / 2000 | 不含终点且必须大于起点;仅端点相接不重叠。 |
| 参考额外字段 | 本例无;可有第 4–12 列 | 保留全部 token,不解释链方向或 block;各行可有不同列数。 |
| 末尾样本计数 | 第一行 2, 2;第二行 1, 0 | 按 sample-001、sample-002 顺序;列数与参考额外字段无关。 |
chr1 20 50
chr1 30 40
chr1 1500 1900
核对第二个样本和列顺序
将 sample-002.bed 放在 sample-001.bed 后面。它的两条记录都与参考 [0,1000) 重叠,与 [1000,2000) 均不重叠,所以第二个计数列依次为 2、0。
chr1 68 786
chr1 899 987
保留完整交接文件
复制返回完整矩阵,即使屏幕仅预览前 4,000 个码点。下载 overlap-matrix.bed、result-report.json、source-reference.bed 与每份 source-sample-NNN.bed,并核对全部源字节数和 SHA256。
报告保留所有参考字段和计数、按顺序排列的样本角色/名称、记录总数、BOM/换行信息和导出大小/哈希。矩阵没有表头,应将报告一同保留。
全部下载合计最多 32 MiB;拒绝、取消或 10 秒主机总期限均不生成部分结果。修复源文件或缩小任务后重试;取消保留原始 File 选择和样本顺序。
chr1 0 1000 2 2
chr1 1000 2000 1 0
- 先选择 reference.bed,再按 sample-001.bed、sample-002.bed 顺序选择样本;运行前核对角色、基因组版本和染色体拼写。
- 按本例核对两行计数为 2,2 和 1,0;下载报告,将每个末尾计数列与有序样本来源对应。
- 若文件被拒绝,检查起点是否小于终点、UTF-8 与换行、3–12 列,以及工具列出的合计输入与完整下载上限;修改源文件后重新选择。
- 若取消或超时,使用保留的文件与顺序重新运行;仅在新运行成功后复制或下载,并核对所有源副本的字节数和 SHA256。
参考资料
- 逐参考区间、逐样本计数的原始问题
准入记录保留完整问题与两份回答;不声称原作者已成功、偏好浏览器或需求规模。
本分类工具使用说明
展开工具,查看操作步骤、可调选项和支持范围,再直接进入工作区。
BED 逐样本重叠计数矩阵逐个参考区间统计每份样本中重叠的区间记录;嵌套和重复记录分别计数。保留所有参考字段、样本顺序、完整原始字节与来源报告。
逐个参考区间统计每份样本中重叠的区间记录;嵌套和重复记录分别计数。保留所有参考字段、样本顺序、完整原始字节与来源报告。
操作步骤
- 先选择参考文件,再选择全部样本文件。
- 向上或向下移动样本,确认矩阵计数列的顺序。
- 运行并核对参考/样本记录数与所有下载字节数。
- 完整复制矩阵,或下载矩阵、报告与全部源副本;在分析流程中核对基因组坐标版本一致。
能力与限制
- 明确选择 1 份参考 BED 和按输出列顺序排列的 1–20 份样本 BED。全部原始文件合计最多 4 MiB、100,000 条区间记录。物理空文件拒绝;含空白或注释的非空样本输出零计数;参考文件必须包含区间。
- 每条记录为 3–12 个非空字段,以 ASCII 空格或 TAB 分隔;前三列为染色体、起点、终点,其余字段按不透明文本完整保留。矩阵会规范行首尾 ASCII 分隔符。引号和反斜杠是字面字符;不支持空字段或含内部空白的字段。
- 染色体和源名称最多 512 UTF-8 字节;每个坐标或额外字段最多 65,536 UTF-8 字节。名称须为无 C0/C1/DEL/BOM 控制字符的标量 Unicode。操作系统或文件选择器可能设置更短的文件名上限。
- 坐标只接受 ASCII 十进制整数,满足 0 ≤ start < end ≤ 9007199254740991。拒绝正负号、小数、指数和零宽区间;保留坐标的前导零拼写。染色体标识区分大小写,输入不要求排序。
- 区间为从零开始的半开区间 [start,end),相邻端点不算重叠。每条重复或嵌套样本记录分别计入;参考记录不去重、不排序;末尾计数列严格对应屏幕上的样本顺序。
- 严格 UTF-8,可含一个开头 BOM;允许 LF、CRLF 或混合换行。拒绝单独 CR、错误编码、C0/C1/DEL 控制字符和非开头 BOM。空行、ASCII 空白行及从第零列 # 开始的注释不参与计数,但原始下载完整保留。
- 全部下载合计最多 32 MiB,包含 overlap-matrix.bed、完整 result-report.json 和所有原始源副本。在分配完整计数矩阵、输出文本和序列化报告前核算精确大小;超限时不提供部分矩阵、复制内容或下载。
- 矩阵使用 TAB/LF、无表头,保留每个参考字段,再追加每份样本的整数计数。完整报告保留每个字段与计数、源名称/SHA256/字节数/BOM/换行/物理行数、样本记录数和完整导出元数据。源副本保留所有原始字节。
- 处理在本地 Worker 中进行;10 秒总期限覆盖加载、读取、就绪和计算。取消或超时会终止 Worker,可以用同一批已选文件和顺序重试。屏幕最多预览 4,000 个 Unicode 码点,复制和下载始终完整。
- 按完整坐标跨度计数,不验证 BED 注释语义,不展开 block,不做链方向或重叠比例筛选,也不推断基因组版本。追加计数列可能超过 12 列,其含义是样本计数而非 BED12 注释。文件内容和名称不上传。