保留科研记录与alignment含义
消费派生表格与序列矩阵前,先解释accession缺口、重复书目字段及缺失locus。
扁平表格可能遮住声明丢失
accession不等于显示名称,重复MARC字段不默认是待删重复项,缺失taxon/locus块不是观察到的gap序列。消费派生数据前先检查这些区别。
- 按所选 HMMER 程序核对 query 与 target 的 accession,再按标识符关联表格。
- 保留 MARC 重复字段和子字段的来源顺序;交付时附带任何显式 UTF-8 覆盖状态。
- 为已对齐的 loci 选择并集或交集,再核对存在状态表与分区坐标后交付矩阵。
对照来源检查交付
HMMER核对每个query/target accession与描述,域角色应与所选程序一致;即使CSV导入器转成浮点数,完整JSON仍保留数值token。MARC核对有序indicator/子字段及物理字节跨度,导出须附带UTF-8覆盖状态。
| 观察 | 保留含义 | 下一步 |
|---|---|---|
| 极小 E-value 的原始数值文本 | 原始十进制书写保持不变 | 读取完整报告;不要将导出视为重新计算统计量 |
| MARC 编码为空且使用显式覆盖 | 已知 UTF-8 的用户断言仍未验证 | 检查来源编码;不能称为 MARC8 转换 |
| 填充缺失 locus | 该 taxon 在这份来源 locus 中不存在 | 下游分析前先检查存在状态表 |
保留顺序并解释派生值
Supermatrix并集以声明字符填充部分loci缺失taxon并记录存在状态;交集明确不保留非全部loci共有taxon,两种选择都是任务的一部分并进入完整报告。已有大小写和完整来源header保持不变。
NEXUS charset指向拼接列,不是新推断生物区域。来源顺序与完整分区图可让接收者回溯坐标交付,不计算alignment或系统发育。
预览与独立检查的范围不同
200行面板用于检查当前选项,完整交付在下载文件。公式状CSV文本被保护,未改值以JSON/原件为准。完整输出上限可能拒绝合法输入,应减少实际组合任务,不接受截断结果。
成熟搜索/书目/alignment读取器检查声明表示,可能聚合同名命中、规范空白或移动坐标原点;这些差异单独解释,不用于改写来源字节。本地Worker与实现检查不代替最终生产浏览器验收。
参考资料
- HMMER导出任务
第一人称tblout转DataFrame需求;query accession不能丢失。
- MARC Unicode导出任务
第一人称捷克文字MARC转CSV编码问题;未取得原链接文件。
- 多locus工作流反馈
研究者描述缺失taxon和charset准备问题;其1500-locus速度陈述属于其他软件。
本分类工具使用说明
展开工具,查看操作步骤、可调选项和支持范围,再直接进入工作区。
HMMER命中结果表导出导出HMMER3蛋白结果表的全部命中,保留query/target accession、原数值token、自由文本描述与精确来源字节位置。
明确选择生成程序和表型,读取全部命中,不重新运行HMMER,也不改写统计token。
操作步骤
- 选择tblout/domtblout及实际生成程序,粘贴或选择一份完整文件。
- 核对accession、描述和域坐标角色;零命中与解析错误不同。
- 下载完整report.json、records.csv及original.txt。
可调选项
- 结果表型
- tblout —18个固定字段 · domtblout —22个固定字段
- 生成结果的程序
- hmmscan · hmmsearch · phmmer
能力与限制
- 一份最多10MiB的UTF-8蛋白HMMER3 tblout或domtblout;最多100,000条命中、300,000物理行、每行65,536字节。完整原件+JSON+CSV总计48MiB,各预算同时适用。
- 显式支持hmmscan/hmmsearch/phmmer及18/22字段profile。程序/版本header矛盾、HMMER2/nhmmer、固定字段TAB、Unicode空白标识符、歧义的#前缀target行均为Unsupported。固定字段以ASCII空格分隔;描述内部TAB和Unicode保留。
- 所有数值词法token保留为文本,包括极小E-value;不做float64 score/E-value重算。域坐标保留1-based inclusive,并明确程序对应query/target角色。reported与included域数各自不得超过实际域数,二者不互相排序。
- 完整JSON包含全部命中、注释及UTF-8行/描述字节跨度;original.txt保留BOM和LF/CRLF。CSV为公式状文本添加可识别的前置单引号,JSON/原件底层值不变。
- 表格仅预览前200行,长单元格截取前2,000个UTF-16单位;报告超过20,000单位时复制为精简预览。完整JSON、CSV及原件下载保留全部内容。输出总预算统一计算,超限时不交付部分文件。
MARC记录字段导出将ISO2709原始记录读为完整有序字段/子字段JSON与长表CSV,保留Unicode、重复tag、indicator及目录/值字节位置。
导出书目数据,保留重复字段,不猜测编码;结合原件检查结构与编码诊断。
操作步骤
- 选择一份完整.mrc字节流,明确编码profile。
- 检查记录/字段数、未核实覆盖及记录诊断。
- 下载全部有序字段和原始字节;按值跨度在original.mrc中定位数据。
可调选项
- 编码profile
- 要求leader声明UTF-8 · 已知UTF-8、空leader:未核实覆盖
能力与限制
- 一份最多10MiB的原始文件,最多10,000记录、100,000字段、200,000子字段。完整original.mrc+records.json+fields.csv总计64MiB。十进制框架字段最多9,999字节、记录最多99,999字节;各预算相互约束。
- 声明profile:24字节ASCII leader、12字节目录项、entry map4500、两个indicator和两字节子字段标识。保留数字或单一字母大小写的三字符tag及本地ASCII子字段符号。外层BOM、目录间隙/重叠、未索引数据和错误框架被拒绝。
- leader a表示UTF-8。leader编码为空时,必须明确选择已知UTF-8覆盖,状态仍为未核实。其他编码及MARC8转换为Unsupported。非法UTF-8被拒绝;字段内字面BOM保留。
- 分别记录目录顺序与物理数据顺序,保留全部重复字段/子字段和原值。已知ID/005/顺序问题仅为诊断,不表示完整MARC21书目、tag含义或字符集范围有效;不读MARCXML,也不扁平化为宽表。
- fields.csv包含全部control/subfield值。公式状单元格加前置单引号并标csvLiteralPrefixAdded=1;可结合标志或JSON/原件还原原值,UI表格显示原值。
- 表格仅预览前200行,长单元格截取前2,000个UTF-16单位;报告超过20,000单位时复制为精简预览。完整JSON、CSV及原件下载保留全部内容。输出总预算统一计算,超限时不交付部分文件。
多locus序列矩阵构建按精确taxon ID拼接已对齐DNA FASTA loci,导出完整FASTA/NEXUS supermatrix、locus分区、存在状态与原件。
选择有序的已对齐loci;并集明确填充缺失taxon,交集仅保留共有taxon。拼接已有alignment并生成charset。
操作步骤
- 按需要的顺序选择loci,每份文件须已包含alignment。
- 选择并集/交集和缺失locus字符,检查taxon、列数、填充单元及存在状态行。
- 下载完整concatenated.fasta、concatenated.nex、presence.csv、report.json和全部原件。
可调选项
- taxon集合
- 并集;填充缺失locus · 仅交集
- 缺失locus字符
- ? · - · N
能力与限制
- 最多20文件、总输入10MiB、输出5,000 taxon、500,000总列、10,000,000矩阵单元、100,000来源记录和300,000物理行;每行≤65,536字节、header≤4,096字节。完整派生文件与原件总计≤48MiB。
- 预算同时适用:5,000 taxon ×500,000列超过1,000万单元守卫。来源记录上限受20 loci ×5,000唯一来源taxon约束,不是独立可支持的100,001记录边界。
- 支持UTF-8可选BOM、LF/CRLF、DNA IUPAC字符及?/-。每locus内序列必须等长,ID为大小写敏感的header首token,并在该locus内唯一。完整header、来源跨度、大小写及原件字节保留。
- RNA/protein、注释和序列内部空格为Unsupported。不执行aligner、物种名模糊匹配或系统发育推断。输出taxon按来源文件/记录首次出现排序,文件顺序定义locus列顺序。
- NEXUS导出DNA矩阵与固定locus_ordinal charset,JSON保留完整原文件标签。每个taxon/locus的存在或填充状态均在presence.csv/report.json。公式状CSV taxon标签受保护并加前置单引号,JSON保留未改标签。
- 表格仅预览前200行,长单元格截取前2,000个UTF-16单位;报告超过20,000单位时复制为精简预览。完整JSON、CSV及原件下载保留全部内容。输出总预算统一计算,超限时不交付部分文件。