零边际会改变卡方检验,却不应改变原表
区分原始表身份与活动自由度,理解小期望频数和数值下溢,避免从聚合计数虚构个体记录。
聚合表已经包含检验需要的频数
公开问题希望避免把数百万计数展开为个体行。可见数据实际上是一份总数 333 的完整 6×2 表,回复建议渐近列联表检验。按表直接计算保留了频数,却不能恢复未公开个体的顺序、协变量或依赖结构。
原始身份和活动自由度承担不同作用
全零行列使相应期望频数为零,因而不能作为有效分类增加自由度;原始标签仍有审核意义。两种形状同时保留可以解释为什么原始 3×3 表的活动自由度为 1,却仍不符合原始 2×2 的 Yates 条件。
| 项目 | 含义 | 需要避免的误读 |
|---|---|---|
| N | 完整整数频数之和 | 不能证明个体独立或重建原始观察 |
| 原始形状 / original shape | 全部源行列的身份 | 排除零边际不改变原始 2×2 条件 |
| 活动 df / active df | (正行数−1)×(正列数−1) | 零总计数和不足两条正边际是未定义 |
| p 与 log p / p and log p | 同一个渐近上尾的两种数值表示 | 浮点下溢不是数学概率等于零 |
| 小期望频数 / small expected | 正期望值小于 5 的单元格提示 | 较小 p 不能消除近似前提限制 |
用逐格报告解释整体统计量
卡方贡献按格相加;Pearson 残差保留偏离方向,标准化残差进一步考虑边际比例。Yates 改变符合条件原表的贡献,并不把残差换成无方向数值。未定义残差保留状态与空值,不能替换为零。
- 保留全部格、原索引和源位置,避免同名标签被合并。
- 渐近方法的解释依赖研究设计;此工具不提供模拟、Fisher 或精确检验。
- 公开 333 表的结果不等同于未提供的私有数百万表结果。
参考资料
- 聚合频数推断的原始讨论
来源公开完整 6×2 表含 333 个观察计数。回复建议渐近表检验,作者没有最终确认;私有数百万计数表未提供。
本分类工具使用说明
展开工具,查看操作步骤、可调选项和支持范围,再直接进入工作区。
列联表独立性推断直接使用聚合频数计算渐近卡方独立性检验,并保留完整期望频数、逐格贡献和两种残差。
用分类频数表核对边际、渐近推断和每个单元格的影响。明确选择当前输入、显著性水平和仅适用于原始 2×2 表的修正。
操作步骤
- 选择当前输入,提供完整带标签频数表。
- 明确输入 alpha,并按原表形状选择修正。
- 核对总计数、活动自由度、小期望频数与未定义状态。
- 保存八份完整文件,结合研究设计解释渐近结果。
可调选项
- 当前输入
- 粘贴完整 CSV · 一份原始 CSV 文件
- 显著性水平 α
- 0.05
必须严格介于 0 与 1 之间。
- 仅对原始 2×2 表使用 Yates 修正
- 默认关闭
能力与限制
- 选择粘贴或文件其中一种当前输入。CSV 必须严格 UTF-8、逗号分隔并带两轴非空标签;数据区允许 1–64 行、1–64 列、最多 4,096 格,原件最多 4 MiB。重复标签按原索引保留,不合并。
- 计数必须是非负整数,总计数 N 不超过 10¹²;alpha 必须是大于 0 且小于 1 的有限数。Yates 只适用于原始 2×2 表,不能因排除零边际而把较大原表当成 2×2。
- 所有原行列和零边际单元格都会保留。检验自由度按正边际计算且不超过 100;总计数为零或正边际不足时,完整报告给出未定义状态。小于 5 的正期望频数提示渐近近似限制。
- 上尾直接在正项与对数域计算。可表示的小 p 值保留其值;确实下溢时保留有限 log p。此工具执行渐近独立性检验,不生成个体记录,也不提供精确、Fisher 或模拟检验。
- 一次操作共享 1,000 万工作量、512 MiB 内存和完整 30 秒期限;期限包含原文件读取、线程启动、计算、完整产物验证、清理及首次发布。全部文件与完整文本合计不超过 32 MiB,紧凑类型数据含原生元数据不超过 8 MiB,两者合计不超过 40 MiB;二进制与传输元数据不超过 64 MiB。任一预算超出即整次失败。
- 下载提供五份完整矩阵、全表报告、设置与原始 CSV。文本和表格预览有界,完整复制与下载不截断。原件、文件名与设置仅在当前浏览器处理。