从已有对齐生成 DNA 定量 logo
明确输入格式、gap 与高度模型,核对每列完整测量并保存所有 SVG 页、CSV、报告与原件。
从对齐开始,不从图片反推
每行格式的每个非空行是一条序列;FASTA 格式使用以 > 开头的完整记录。可选择一个原文件或粘贴对齐。已选文件优先,即使文本仍显示在输入框;清除文件后才使用文本。
序列必须已经等长。ASCII 空格/tab 移除,小写 ACGT 转为大写;工具不负责对齐或解析模糊碱基。保留原件,以便核对报告中的源字节。
明确高度和 gap 模型
概率模式的每个有效列总高为 1。信息模式固定均匀 ACGT 背景:H = −Σ p log2 p,R = 2 − H,每个碱基高为 p×R;不做小样本校正。
伪计数 a 下,有效列概率为 (count+a)/(effectiveCount+4a),原始计数不变。忽略 gap 允许 - 和 .,不删除列;全 gap 列即使 a 为正,概率、熵、信息量与高度仍为 null。
| 选择 | 含义 | 核对 |
|---|---|---|
| 概率 | 所选伪计数下的观测碱基比例 | 每个有效列总高为 1 |
| 信息 | 以 bits 信息量加权的概率 | 总高等于 R,最多 2 bits |
| 拒绝 gap | 出现 - 或 . 时整次拒绝 | 使用无 gap 输入或明确修改规则 |
| 忽略 gap | Gap 保留位置,但不计入有效数量 | 逐列比较 gapCount 与 effectiveCount |
核对四序列合成示例
以下示例选择信息模式、拒绝 gap、伪计数 0。第 1–3 列分别全为 A、C、G,熵为 0,信息量各为 2 bits;第 4 列有一个 A、一个 G 和两个 T。
第 4 列概率为 A=0.25、C=0、G=0.25、T=0.5;熵为 1.5 bits,R 为 0.5 bits,所以高度为 0.125、0、0.125、0.25。这些测量来自该合成对齐,不是作者实际附件的重现。
ACGT
ACGT
ACGA
ACGG
保存每列和每页
在 report.json 核对序列数、列数和模型,再下载完整交付。列号从 1 开始,columns.csv 每列有四条记录,包含零计数碱基和空列的 null 测量;所有非零字形都使用报告中的定量高度。
SVG 每页最多 500 列。有限预览可能只显示部分结果,应下载全部页。alignment.fasta 保存规范化序列,original.input 保存逐字节源身份;复制返回完整 compact 报告,与 report.json 相同。
| 文件 | 用途 |
|---|---|
| report.json | 全部序列、模型、源哈希、列测量及页数 |
| columns.csv | 全部计数、有效/gap 数、概率、熵、信息量及高度 |
| alignment.fasta | 完整规范化序列记录 |
| logo-NNN.svg | 每个 500 列分页及全部非零字形 |
| original.input | 实际生效源的逐字节原件 |
- 在 report.json 核对序列数、对齐列数,以及明确选择的 gap 规则、伪计数和高度模型。
- 把 columns.csv 的计数与高度同 SVG 对照;数据中保留零计数碱基和全 gap 列的 null 测量。
- 下载所有 logo-NNN.svg 页,并同时保存 columns.csv、report.json、alignment.fasta 与 original.input;预览不能代替完整交付。
- 取消或超时后,用保留的同一原 File/文本及参数重试。需要修正被拒绝的对齐时,应明确修改并另外保留修订后的来源。
保留可复现的源再恢复
输入最多 10 MiB、10,000 条序列、3,000 列、9,999,999 单元,所有上限同时生效;完整文件加报告文本最多 56 MiB。拒绝后修正源,或明确缩小所分析的对齐,再保留新源和模型。
一个 10 秒时限覆盖读文件、加载、计算、结果核对和首次显示。取消或超时不发布部分或迟到结果,可保留相同 File/文本及参数重试。处理只在浏览器中进行,不持久保存源。原提问引用的教材图已有勘误,不应强迫计算结果拟合该图。
参考资料
- NKR:从对齐 DNA 生成 logo
完整提问和评论指出教材图存在勘误。应从实际对齐计算,不能强制拟合那张图。未取得作者实际附件或完成结果。 本页四序列小例为合成数据。
- Logomaker 定量 logo 实现文档
用于核对计数、概率与信息量转换。本工具固定均匀 DNA 背景且不做小样本校正,不声称与其他绘图器默认设置相同。
本分类工具使用说明
展开工具,查看操作步骤、可调选项和支持范围,再直接进入工作区。
DNA 定量 sequence logo从已有对齐计算 ACGT 定量 logo,明确选择概率或信息高度、gap 规则,保留全部列测量与原始字节。
从已有对齐计算 ACGT 定量 logo,明确选择概率或信息高度、gap 规则,保留全部列测量与原始字节。
操作步骤
- 选择每行序列或 FASTA,粘贴已有等长 DNA 对齐,或选择一个原文件。
- 选择概率或信息高度、gap 规则和 0–100 的伪计数。
- 生成 logo,核对列数、有效计数及完整列测量。
- 下载所有 SVG 页、列 CSV、报告、规范化 FASTA 和原件;复制完整报告用于复核。
可调选项
- 输入格式
- 每行一条序列 · 多记录 FASTA
- 字形高度
- 概率(0–1) · 信息(0–2 bits)
- Gap 规则
- 拒绝 - 和 . · 忽略 - 和 .,保留列
- 每碱基伪计数
- 0
0–100 的有限数,分别加入 A/C/G/T;不改变原始计数。
能力与限制
- 粘贴对齐,或选择一个最多 10 MiB 的 UTF-8 文件。已选文件优先于文本;清除文件后才使用粘贴内容。文件名最多 512 UTF-8 字节。输入内容和文件名不上传。
- 选择每个非空行一条序列,或多记录 FASTA。序列中的 ASCII 空格和 tab 会移除,小写 ACGT 转为大写。FASTA 片段拼接,保留完整、非空且唯一的 header,最多 256 UTF-16 单元。接受一个开头 BOM、LF 和 CRLF;拒绝裸 CR 和无效 UTF-8。
- 所有序列必须已经等长,只统计 ACGT。“忽略 gap”让 - 和 . 留在原列,但不计入该列有效数量;“拒绝 gap”会拒绝这些符号。不支持 IUPAC 模糊碱基、RNA、蛋白质或构建序列对齐。
- 最多 10,000 条序列、3,000 列及 9,999,999 个序列×列单元,三个上限同时生效。10,000 条各 1,000 列的序列已超过单元上限。
- 伪计数为 0–100 的有限数,计算概率时给 A/C/G/T 各加一次;原始计数不变。信息模式固定均匀背景:R = 2 − H,高度 = 概率 × R,不做小样本校正。整列都是 gap 时,即使伪计数为正,测量值仍为 null、没有字形。
- 下载 report.json、columns.csv、alignment.fasta、每页 logo-NNN.svg 及 original.input。每个 SVG 最多 500 列,保留每列和所有非零字形。列号从 1 开始,规范化 FASTA 与原始字节各有用途。
- 完整文件加完整报告文本合计最多 56 MiB;超限时整次拒绝,不截短字段。复制保留完整 compact 报告,有限屏幕预览不能代替下载。
- 一个 10 秒时限覆盖源检查、读文件、加载、处理、结果校验及首次显示。取消或超时结束未完成处理,不发布部分结果或迟到结果。保留相同源和参数后可重试。