选择 DNA logo 的概率高度或信息高度
比较频率与 bits、有效计数与空列,让图形尺寸由真实列数据和明确模型决定。
堆叠总高代表的量可以不同
概率展示组成:给定伪计数后,每列 A、C、G、T 各占多少。信息高度还根据相对固定均匀背景的信息量调整组成。模式决定纵轴含义,应和图一同保留。
合成 ACGT/ACGT/ACGA/ACGG 对齐的第 4 列概率为 0.25、0、0.25、0.5。概率模式总高为 1;信息模式总高为 0.5 bits,高度为 0.125、0、0.125、0.25。相对比例相同,总高发生变化。
| 组成 | 概率总高 | 信息总高 |
|---|---|---|
| 所有序列均为同一碱基 | 1 | 2 bits |
| 两种碱基各占一半 | 1 | 1 bit |
| 四种碱基各占四分之一 | 1 | 0 bits |
零高度与缺失观测不同
有效的均匀 ACGT 列熵为 2 bits、信息量为 0,在信息模式下高度是数值零。全 gap 列 effectiveCount 为 0,测量为 null、没有字形,但仍占原来的列位置。
忽略 gap 逐列改变有效数量,不改变对齐宽度。解读高字形前应核对 effectiveCount 和 gapCount;只观测到一个碱基的列仍是很小的样本,本工具不做小样本校正。
伪计数是需要保留的模型选择
伪计数 a 分别加给 A/C/G/T 来求概率。原始计数不变,但概率会向均匀分布移动。0 表示未调整的观测频率,也可以明确输入最多 100 的有限数。
背景固定为每碱基 0.25。不支持非均匀基因组背景、模糊碱基解析、RNA、蛋白质或自动对齐。交付时应保留完整模型和规范化序列,而不只传递图片。
用数据核对图
原学习者问 logo 为何与教材示例不符;完整评论指出示意图的错误。这支持按实际列核算,不能为了像那张图而改计算。未取得作者实际附件或完成结果。
实用步骤是先选择格式和模型,运行完整对齐,核对几个已知列,再把 columns.csv、report.json 和每页 SVG 一起下载。合成示例第 4 列在加入伪计数前必须仍有一个 A、一个 G 和两个 T。
- 比较图形前,记录模式、gap 规则与伪计数。
- 先核对原始计数、effectiveCount、gapCount,再检查字形高度。
- 保存全部分页;屏幕预览另有显示上限。
- 保留规范化 FASTA、逐字节原件及源哈希。
让限制和恢复关系明确
输入上限为 10 MiB、10,000 条序列、3,000 列及 9,999,999 单元;完整交付在 56 MiB 文件加报告文本预算内保留。这些是保护上限,不是浏览器堆内存实测承诺。
取消、超时或输出拒绝不产生部分图片。保留源和参数可重新运行;若缩小所分析对齐,应记录改变。Logo 描述明确数学模型下的输入,不证明生物功能。
参考资料
- NKR:从对齐 DNA 生成 logo
完整提问和评论指出教材图存在勘误。应从实际对齐计算,不能强制拟合那张图。未取得作者实际附件或完成结果。 本页四序列小例为合成数据。
- Logomaker 定量 logo 实现文档
用于核对计数、概率与信息量转换。本工具固定均匀 DNA 背景且不做小样本校正,不声称与其他绘图器默认设置相同。
本分类工具使用说明
展开工具,查看操作步骤、可调选项和支持范围,再直接进入工作区。
DNA 定量 sequence logo从已有对齐计算 ACGT 定量 logo,明确选择概率或信息高度、gap 规则,保留全部列测量与原始字节。
从已有对齐计算 ACGT 定量 logo,明确选择概率或信息高度、gap 规则,保留全部列测量与原始字节。
操作步骤
- 选择每行序列或 FASTA,粘贴已有等长 DNA 对齐,或选择一个原文件。
- 选择概率或信息高度、gap 规则和 0–100 的伪计数。
- 生成 logo,核对列数、有效计数及完整列测量。
- 下载所有 SVG 页、列 CSV、报告、规范化 FASTA 和原件;复制完整报告用于复核。
可调选项
- 输入格式
- 每行一条序列 · 多记录 FASTA
- 字形高度
- 概率(0–1) · 信息(0–2 bits)
- Gap 规则
- 拒绝 - 和 . · 忽略 - 和 .,保留列
- 每碱基伪计数
- 0
0–100 的有限数,分别加入 A/C/G/T;不改变原始计数。
能力与限制
- 粘贴对齐,或选择一个最多 10 MiB 的 UTF-8 文件。已选文件优先于文本;清除文件后才使用粘贴内容。文件名最多 512 UTF-8 字节。输入内容和文件名不上传。
- 选择每个非空行一条序列,或多记录 FASTA。序列中的 ASCII 空格和 tab 会移除,小写 ACGT 转为大写。FASTA 片段拼接,保留完整、非空且唯一的 header,最多 256 UTF-16 单元。接受一个开头 BOM、LF 和 CRLF;拒绝裸 CR 和无效 UTF-8。
- 所有序列必须已经等长,只统计 ACGT。“忽略 gap”让 - 和 . 留在原列,但不计入该列有效数量;“拒绝 gap”会拒绝这些符号。不支持 IUPAC 模糊碱基、RNA、蛋白质或构建序列对齐。
- 最多 10,000 条序列、3,000 列及 9,999,999 个序列×列单元,三个上限同时生效。10,000 条各 1,000 列的序列已超过单元上限。
- 伪计数为 0–100 的有限数,计算概率时给 A/C/G/T 各加一次;原始计数不变。信息模式固定均匀背景:R = 2 − H,高度 = 概率 × R,不做小样本校正。整列都是 gap 时,即使伪计数为正,测量值仍为 null、没有字形。
- 下载 report.json、columns.csv、alignment.fasta、每页 logo-NNN.svg 及 original.input。每个 SVG 最多 500 列,保留每列和所有非零字形。列号从 1 开始,规范化 FASTA 与原始字节各有用途。
- 完整文件加完整报告文本合计最多 56 MiB;超限时整次拒绝,不截短字段。复制保留完整 compact 报告,有限屏幕预览不能代替下载。
- 一个 10 秒时限覆盖源检查、读文件、加载、处理、结果校验及首次显示。取消或超时结束未完成处理,不发布部分结果或迟到结果。保留相同源和参数后可重试。