Neatbo.

选择 DNA logo 的概率高度或信息高度

比较频率与 bits、有效计数与空列,让图形尺寸由真实列数据和明确模型决定。

堆叠总高代表的量可以不同

概率展示组成:给定伪计数后,每列 A、C、G、T 各占多少。信息高度还根据相对固定均匀背景的信息量调整组成。模式决定纵轴含义,应和图一同保留。

合成 ACGT/ACGT/ACGA/ACGG 对齐的第 4 列概率为 0.25、0、0.25、0.5。概率模式总高为 1;信息模式总高为 0.5 bits,高度为 0.125、0、0.125、0.25。相对比例相同,总高发生变化。

伪计数 0 时的有效列
组成概率总高信息总高
所有序列均为同一碱基12 bits
两种碱基各占一半11 bit
四种碱基各占四分之一10 bits

零高度与缺失观测不同

有效的均匀 ACGT 列熵为 2 bits、信息量为 0,在信息模式下高度是数值零。全 gap 列 effectiveCount 为 0,测量为 null、没有字形,但仍占原来的列位置。

忽略 gap 逐列改变有效数量,不改变对齐宽度。解读高字形前应核对 effectiveCount 和 gapCount;只观测到一个碱基的列仍是很小的样本,本工具不做小样本校正。

伪计数是需要保留的模型选择

伪计数 a 分别加给 A/C/G/T 来求概率。原始计数不变,但概率会向均匀分布移动。0 表示未调整的观测频率,也可以明确输入最多 100 的有限数。

背景固定为每碱基 0.25。不支持非均匀基因组背景、模糊碱基解析、RNA、蛋白质或自动对齐。交付时应保留完整模型和规范化序列,而不只传递图片。

用数据核对图

原学习者问 logo 为何与教材示例不符;完整评论指出示意图的错误。这支持按实际列核算,不能为了像那张图而改计算。未取得作者实际附件或完成结果。

实用步骤是先选择格式和模型,运行完整对齐,核对几个已知列,再把 columns.csv、report.json 和每页 SVG 一起下载。合成示例第 4 列在加入伪计数前必须仍有一个 A、一个 G 和两个 T。

  • 比较图形前,记录模式、gap 规则与伪计数。
  • 先核对原始计数、effectiveCount、gapCount,再检查字形高度。
  • 保存全部分页;屏幕预览另有显示上限。
  • 保留规范化 FASTA、逐字节原件及源哈希。

让限制和恢复关系明确

输入上限为 10 MiB、10,000 条序列、3,000 列及 9,999,999 单元;完整交付在 56 MiB 文件加报告文本预算内保留。这些是保护上限,不是浏览器堆内存实测承诺。

取消、超时或输出拒绝不产生部分图片。保留源和参数可重新运行;若缩小所分析对齐,应记录改变。Logo 描述明确数学模型下的输入,不证明生物功能。

参考资料

  • NKR:从对齐 DNA 生成 logo

    完整提问和评论指出教材图存在勘误。应从实际对齐计算,不能强制拟合那张图。未取得作者实际附件或完成结果。 本页四序列小例为合成数据。

  • Logomaker 定量 logo 实现文档

    用于核对计数、概率与信息量转换。本工具固定均匀 DNA 背景且不做小样本校正,不声称与其他绘图器默认设置相同。

本分类工具使用说明

展开工具,查看操作步骤、可调选项和支持范围,再直接进入工作区。

DNA 定量 sequence logo从已有对齐计算 ACGT 定量 logo,明确选择概率或信息高度、gap 规则,保留全部列测量与原始字节。

从已有对齐计算 ACGT 定量 logo,明确选择概率或信息高度、gap 规则,保留全部列测量与原始字节。

操作步骤

  1. 选择每行序列或 FASTA,粘贴已有等长 DNA 对齐,或选择一个原文件。
  2. 选择概率或信息高度、gap 规则和 0–100 的伪计数。
  3. 生成 logo,核对列数、有效计数及完整列测量。
  4. 下载所有 SVG 页、列 CSV、报告、规范化 FASTA 和原件;复制完整报告用于复核。

可调选项

输入格式
每行一条序列 · 多记录 FASTA
字形高度
概率(0–1) · 信息(0–2 bits)
Gap 规则
拒绝 - 和 . · 忽略 - 和 .,保留列
每碱基伪计数
0

0–100 的有限数,分别加入 A/C/G/T;不改变原始计数。

能力与限制

  • 粘贴对齐,或选择一个最多 10 MiB 的 UTF-8 文件。已选文件优先于文本;清除文件后才使用粘贴内容。文件名最多 512 UTF-8 字节。输入内容和文件名不上传。
  • 选择每个非空行一条序列,或多记录 FASTA。序列中的 ASCII 空格和 tab 会移除,小写 ACGT 转为大写。FASTA 片段拼接,保留完整、非空且唯一的 header,最多 256 UTF-16 单元。接受一个开头 BOM、LF 和 CRLF;拒绝裸 CR 和无效 UTF-8。
  • 所有序列必须已经等长,只统计 ACGT。“忽略 gap”让 - 和 . 留在原列,但不计入该列有效数量;“拒绝 gap”会拒绝这些符号。不支持 IUPAC 模糊碱基、RNA、蛋白质或构建序列对齐。
  • 最多 10,000 条序列、3,000 列及 9,999,999 个序列×列单元,三个上限同时生效。10,000 条各 1,000 列的序列已超过单元上限。
  • 伪计数为 0–100 的有限数,计算概率时给 A/C/G/T 各加一次;原始计数不变。信息模式固定均匀背景:R = 2 − H,高度 = 概率 × R,不做小样本校正。整列都是 gap 时,即使伪计数为正,测量值仍为 null、没有字形。
  • 下载 report.json、columns.csv、alignment.fasta、每页 logo-NNN.svg 及 original.input。每个 SVG 最多 500 列,保留每列和所有非零字形。列号从 1 开始,规范化 FASTA 与原始字节各有用途。
  • 完整文件加完整报告文本合计最多 56 MiB;超限时整次拒绝,不截短字段。复制保留完整 compact 报告,有限屏幕预览不能代替下载。
  • 一个 10 秒时限覆盖源检查、读文件、加载、处理、结果校验及首次显示。取消或超时结束未完成处理,不发布部分结果或迟到结果。保留相同源和参数后可重试。
打开DNA 定量 sequence logo →