HMMER、MARC与supermatrix本地工作流
以明确profile、来源跨度与完整下载预算,导出全部搜索命中和书目字段,或拼接已对齐DNA loci。
先明确接收任务
HMMER导出读取已有搜索命中,MARC导出读取书目交换字节,supermatrix构建按taxon拼接已有DNA alignment。即使最终均有表格,所需结构仍不同。
处理前选择实际profile。已选择文件优先于粘贴文本;MARC要求原始文件,supermatrix要求有序文件。扩展名不认证内容,本地处理不执行搜索程序、书目脚本或aligner。
| 任务 | 派生数据 | 保留来源 |
|---|---|---|
| HMMER | report.json + records.csv | original.txt; every line/description span |
| MARC | records.json + fields.csv | original.mrc; every ordered field/subfield/value span |
| Supermatrix | FASTA + NEXUS + presence.csv + report.json | all original loci; full headers and source-record spans |
HMMER:保留accession与程序角色
选择18固定字段tblout或22固定字段domtblout,并明确hmmscan、hmmsearch或phmmer。后面的描述是自由文本,不是另一固定宽度列。1e-400等统计token保持词法文本,工具不舍入。
原生ASCII空格字段profile不支持固定字段TAB、Unicode空白标识符和歧义#前缀target行。描述TAB/Unicode、注释、BOM及LF/CRLF保留。域坐标为原始1-based inclusive;model与sequence角色取决于所选程序,header矛盾不会静默改选项。
MARC:编码与目录顺序是独立事实
leader a声明UTF-8,编码位置为空时可明确选择已知UTF-8覆盖,但仍为未核实;这不转换MARC8或修复未知字节。框架要求24字节ASCII leader、12字节目录项、4500 entry map、两个indicator与两字节子字段标识。
重复tag和子字段保持有序,同时保留目录索引与物理索引,物理重排不会扁平化成另一含义。书目ID/005/顺序诊断可见,但不认证完整书目语义和字符集范围。
Supermatrix:按taxon拼接并呈现缺失locus
每个输入locus须已为等长DNA IUPAC FASTA alignment,大小写敏感首token ID在locus内唯一,完整原header可查。选择并集以?/-/N填充缺失locus,或全部loci交集;不规范化名称或重新对齐。
来源文件顺序定义拼接列,taxon首次出现定义行序。NEXUS包含固定locus_ordinal charset,JSON保留原标签与列范围。存在状态CSV区分present和filled,不把缺失序列当已测序列。
预览结束时使用完整产物
小输入可能扩张为大的完整JSON/CSV/矩阵。各预算同时适用,完整输出总量超限时原子拒绝。预览仅200行,长单元格仅2,000个UTF-16单位,大报告复制为精简预览,不包含每条记录。
| 任务 | 输入/结构 | 完整输出 |
|---|---|---|
| HMMER | 10MiB;100k hits;300k lines;65,536B/line | 48MiB |
| MARC | 10MiB;10k records;100k fields;200k subfields | 64MiB |
| Supermatrix | 20 files/10MiB;5k taxa;500k columns;10M cells;100k source records | 48MiB |
- 原字节与来源跨度一起保存,规范化字符串不能重建框架或BOM。
- MARC CSV明确标记保护性单引号;HMMER/存在状态CSV的保护文本可对照未改写JSON值,不猜原单引号是否合成。
- Supermatrix的5,000×500,000超出1,000万单元预算,文件/taxon/列最大值并非任意同时承诺。
- 用受支持原件取消并同源恢复,错误不提供部分下载。
参考资料
- HMMER导出任务
第一人称tblout转DataFrame需求;query accession不能丢失。
- MARC Unicode导出任务
第一人称捷克文字MARC转CSV编码问题;未取得原链接文件。
- 多locus工作流反馈
研究者描述缺失taxon和charset准备问题;其1500-locus速度陈述属于其他软件。
本分类工具使用说明
展开工具,查看操作步骤、可调选项和支持范围,再直接进入工作区。
HMMER命中结果表导出导出HMMER3蛋白结果表的全部命中,保留query/target accession、原数值token、自由文本描述与精确来源字节位置。
明确选择生成程序和表型,读取全部命中,不重新运行HMMER,也不改写统计token。
操作步骤
- 选择tblout/domtblout及实际生成程序,粘贴或选择一份完整文件。
- 核对accession、描述和域坐标角色;零命中与解析错误不同。
- 下载完整report.json、records.csv及original.txt。
可调选项
- 结果表型
- tblout —18个固定字段 · domtblout —22个固定字段
- 生成结果的程序
- hmmscan · hmmsearch · phmmer
能力与限制
- 一份最多10MiB的UTF-8蛋白HMMER3 tblout或domtblout;最多100,000条命中、300,000物理行、每行65,536字节。完整原件+JSON+CSV总计48MiB,各预算同时适用。
- 显式支持hmmscan/hmmsearch/phmmer及18/22字段profile。程序/版本header矛盾、HMMER2/nhmmer、固定字段TAB、Unicode空白标识符、歧义的#前缀target行均为Unsupported。固定字段以ASCII空格分隔;描述内部TAB和Unicode保留。
- 所有数值词法token保留为文本,包括极小E-value;不做float64 score/E-value重算。域坐标保留1-based inclusive,并明确程序对应query/target角色。reported与included域数各自不得超过实际域数,二者不互相排序。
- 完整JSON包含全部命中、注释及UTF-8行/描述字节跨度;original.txt保留BOM和LF/CRLF。CSV为公式状文本添加可识别的前置单引号,JSON/原件底层值不变。
- 表格仅预览前200行,长单元格截取前2,000个UTF-16单位;报告超过20,000单位时复制为精简预览。完整JSON、CSV及原件下载保留全部内容。输出总预算统一计算,超限时不交付部分文件。
MARC记录字段导出将ISO2709原始记录读为完整有序字段/子字段JSON与长表CSV,保留Unicode、重复tag、indicator及目录/值字节位置。
导出书目数据,保留重复字段,不猜测编码;结合原件检查结构与编码诊断。
操作步骤
- 选择一份完整.mrc字节流,明确编码profile。
- 检查记录/字段数、未核实覆盖及记录诊断。
- 下载全部有序字段和原始字节;按值跨度在original.mrc中定位数据。
可调选项
- 编码profile
- 要求leader声明UTF-8 · 已知UTF-8、空leader:未核实覆盖
能力与限制
- 一份最多10MiB的原始文件,最多10,000记录、100,000字段、200,000子字段。完整original.mrc+records.json+fields.csv总计64MiB。十进制框架字段最多9,999字节、记录最多99,999字节;各预算相互约束。
- 声明profile:24字节ASCII leader、12字节目录项、entry map4500、两个indicator和两字节子字段标识。保留数字或单一字母大小写的三字符tag及本地ASCII子字段符号。外层BOM、目录间隙/重叠、未索引数据和错误框架被拒绝。
- leader a表示UTF-8。leader编码为空时,必须明确选择已知UTF-8覆盖,状态仍为未核实。其他编码及MARC8转换为Unsupported。非法UTF-8被拒绝;字段内字面BOM保留。
- 分别记录目录顺序与物理数据顺序,保留全部重复字段/子字段和原值。已知ID/005/顺序问题仅为诊断,不表示完整MARC21书目、tag含义或字符集范围有效;不读MARCXML,也不扁平化为宽表。
- fields.csv包含全部control/subfield值。公式状单元格加前置单引号并标csvLiteralPrefixAdded=1;可结合标志或JSON/原件还原原值,UI表格显示原值。
- 表格仅预览前200行,长单元格截取前2,000个UTF-16单位;报告超过20,000单位时复制为精简预览。完整JSON、CSV及原件下载保留全部内容。输出总预算统一计算,超限时不交付部分文件。
多locus序列矩阵构建按精确taxon ID拼接已对齐DNA FASTA loci,导出完整FASTA/NEXUS supermatrix、locus分区、存在状态与原件。
选择有序的已对齐loci;并集明确填充缺失taxon,交集仅保留共有taxon。拼接已有alignment并生成charset。
操作步骤
- 按需要的顺序选择loci,每份文件须已包含alignment。
- 选择并集/交集和缺失locus字符,检查taxon、列数、填充单元及存在状态行。
- 下载完整concatenated.fasta、concatenated.nex、presence.csv、report.json和全部原件。
可调选项
- taxon集合
- 并集;填充缺失locus · 仅交集
- 缺失locus字符
- ? · - · N
能力与限制
- 最多20文件、总输入10MiB、输出5,000 taxon、500,000总列、10,000,000矩阵单元、100,000来源记录和300,000物理行;每行≤65,536字节、header≤4,096字节。完整派生文件与原件总计≤48MiB。
- 预算同时适用:5,000 taxon ×500,000列超过1,000万单元守卫。来源记录上限受20 loci ×5,000唯一来源taxon约束,不是独立可支持的100,001记录边界。
- 支持UTF-8可选BOM、LF/CRLF、DNA IUPAC字符及?/-。每locus内序列必须等长,ID为大小写敏感的header首token,并在该locus内唯一。完整header、来源跨度、大小写及原件字节保留。
- RNA/protein、注释和序列内部空格为Unsupported。不执行aligner、物种名模糊匹配或系统发育推断。输出taxon按来源文件/记录首次出现排序,文件顺序定义locus列顺序。
- NEXUS导出DNA矩阵与固定locus_ordinal charset,JSON保留完整原文件标签。每个taxon/locus的存在或填充状态均在presence.csv/report.json。公式状CSV taxon标签受保护并加前置单引号,JSON保留未改标签。
- 表格仅预览前200行,长单元格截取前2,000个UTF-16单位;报告超过20,000单位时复制为精简预览。完整JSON、CSV及原件下载保留全部内容。输出总预算统一计算,超限时不交付部分文件。