Neatbo.

从已有对齐生成 DNA 定量 logo

明确输入格式、gap 与高度模型,核对每列完整测量并保存所有 SVG 页、CSV、报告与原件。

从对齐开始,不从图片反推

每行格式的每个非空行是一条序列;FASTA 格式使用以 > 开头的完整记录。可选择一个原文件或粘贴对齐。已选文件优先,即使文本仍显示在输入框;清除文件后才使用文本。

序列必须已经等长。ASCII 空格/tab 移除,小写 ACGT 转为大写;工具不负责对齐或解析模糊碱基。保留原件,以便核对报告中的源字节。

明确高度和 gap 模型

概率模式的每个有效列总高为 1。信息模式固定均匀 ACGT 背景:H = −Σ p log2 p,R = 2 − H,每个碱基高为 p×R;不做小样本校正。

伪计数 a 下,有效列概率为 (count+a)/(effectiveCount+4a),原始计数不变。忽略 gap 允许 - 和 .,不删除列;全 gap 列即使 a 为正,概率、熵、信息量与高度仍为 null。

按实际用途选择
选择含义核对
概率所选伪计数下的观测碱基比例每个有效列总高为 1
信息以 bits 信息量加权的概率总高等于 R,最多 2 bits
拒绝 gap出现 - 或 . 时整次拒绝使用无 gap 输入或明确修改规则
忽略 gapGap 保留位置,但不计入有效数量逐列比较 gapCount 与 effectiveCount

核对四序列合成示例

以下示例选择信息模式、拒绝 gap、伪计数 0。第 1–3 列分别全为 A、C、G,熵为 0,信息量各为 2 bits;第 4 列有一个 A、一个 G 和两个 T。

第 4 列概率为 A=0.25、C=0、G=0.25、T=0.5;熵为 1.5 bits,R 为 0.5 bits,所以高度为 0.125、0、0.125、0.25。这些测量来自该合成对齐,不是作者实际附件的重现。

四条已经对齐的序列
ACGT
ACGT
ACGA
ACGG

保存每列和每页

在 report.json 核对序列数、列数和模型,再下载完整交付。列号从 1 开始,columns.csv 每列有四条记录,包含零计数碱基和空列的 null 测量;所有非零字形都使用报告中的定量高度。

SVG 每页最多 500 列。有限预览可能只显示部分结果,应下载全部页。alignment.fasta 保存规范化序列,original.input 保存逐字节源身份;复制返回完整 compact 报告,与 report.json 相同。

完整交付文件
文件用途
report.json全部序列、模型、源哈希、列测量及页数
columns.csv全部计数、有效/gap 数、概率、熵、信息量及高度
alignment.fasta完整规范化序列记录
logo-NNN.svg每个 500 列分页及全部非零字形
original.input实际生效源的逐字节原件
  • 在 report.json 核对序列数、对齐列数,以及明确选择的 gap 规则、伪计数和高度模型。
  • 把 columns.csv 的计数与高度同 SVG 对照;数据中保留零计数碱基和全 gap 列的 null 测量。
  • 下载所有 logo-NNN.svg 页,并同时保存 columns.csv、report.json、alignment.fasta 与 original.input;预览不能代替完整交付。
  • 取消或超时后,用保留的同一原 File/文本及参数重试。需要修正被拒绝的对齐时,应明确修改并另外保留修订后的来源。

保留可复现的源再恢复

输入最多 10 MiB、10,000 条序列、3,000 列、9,999,999 单元,所有上限同时生效;完整文件加报告文本最多 56 MiB。拒绝后修正源,或明确缩小所分析的对齐,再保留新源和模型。

一个 10 秒时限覆盖读文件、加载、计算、结果核对和首次显示。取消或超时不发布部分或迟到结果,可保留相同 File/文本及参数重试。处理只在浏览器中进行,不持久保存源。原提问引用的教材图已有勘误,不应强迫计算结果拟合该图。

参考资料

  • NKR:从对齐 DNA 生成 logo

    完整提问和评论指出教材图存在勘误。应从实际对齐计算,不能强制拟合那张图。未取得作者实际附件或完成结果。 本页四序列小例为合成数据。

  • Logomaker 定量 logo 实现文档

    用于核对计数、概率与信息量转换。本工具固定均匀 DNA 背景且不做小样本校正,不声称与其他绘图器默认设置相同。

本分类工具使用说明

展开工具,查看操作步骤、可调选项和支持范围,再直接进入工作区。

DNA 定量 sequence logo从已有对齐计算 ACGT 定量 logo,明确选择概率或信息高度、gap 规则,保留全部列测量与原始字节。

从已有对齐计算 ACGT 定量 logo,明确选择概率或信息高度、gap 规则,保留全部列测量与原始字节。

操作步骤

  1. 选择每行序列或 FASTA,粘贴已有等长 DNA 对齐,或选择一个原文件。
  2. 选择概率或信息高度、gap 规则和 0–100 的伪计数。
  3. 生成 logo,核对列数、有效计数及完整列测量。
  4. 下载所有 SVG 页、列 CSV、报告、规范化 FASTA 和原件;复制完整报告用于复核。

可调选项

输入格式
每行一条序列 · 多记录 FASTA
字形高度
概率(0–1) · 信息(0–2 bits)
Gap 规则
拒绝 - 和 . · 忽略 - 和 .,保留列
每碱基伪计数
0

0–100 的有限数,分别加入 A/C/G/T;不改变原始计数。

能力与限制

  • 粘贴对齐,或选择一个最多 10 MiB 的 UTF-8 文件。已选文件优先于文本;清除文件后才使用粘贴内容。文件名最多 512 UTF-8 字节。输入内容和文件名不上传。
  • 选择每个非空行一条序列,或多记录 FASTA。序列中的 ASCII 空格和 tab 会移除,小写 ACGT 转为大写。FASTA 片段拼接,保留完整、非空且唯一的 header,最多 256 UTF-16 单元。接受一个开头 BOM、LF 和 CRLF;拒绝裸 CR 和无效 UTF-8。
  • 所有序列必须已经等长,只统计 ACGT。“忽略 gap”让 - 和 . 留在原列,但不计入该列有效数量;“拒绝 gap”会拒绝这些符号。不支持 IUPAC 模糊碱基、RNA、蛋白质或构建序列对齐。
  • 最多 10,000 条序列、3,000 列及 9,999,999 个序列×列单元,三个上限同时生效。10,000 条各 1,000 列的序列已超过单元上限。
  • 伪计数为 0–100 的有限数,计算概率时给 A/C/G/T 各加一次;原始计数不变。信息模式固定均匀背景:R = 2 − H,高度 = 概率 × R,不做小样本校正。整列都是 gap 时,即使伪计数为正,测量值仍为 null、没有字形。
  • 下载 report.json、columns.csv、alignment.fasta、每页 logo-NNN.svg 及 original.input。每个 SVG 最多 500 列,保留每列和所有非零字形。列号从 1 开始,规范化 FASTA 与原始字节各有用途。
  • 完整文件加完整报告文本合计最多 56 MiB;超限时整次拒绝,不截短字段。复制保留完整 compact 报告,有限屏幕预览不能代替下载。
  • 一个 10 秒时限覆盖源检查、读文件、加载、处理、结果校验及首次显示。取消或超时结束未完成处理,不发布部分结果或迟到结果。保留相同源和参数后可重试。
打开DNA 定量 sequence logo →