Neatbo.

零边际会改变卡方检验,却不应改变原表

区分原始表身份与活动自由度,理解小期望频数和数值下溢,避免从聚合计数虚构个体记录。

聚合表已经包含检验需要的频数

公开问题希望避免把数百万计数展开为个体行。可见数据实际上是一份总数 333 的完整 6×2 表,回复建议渐近列联表检验。按表直接计算保留了频数,却不能恢复未公开个体的顺序、协变量或依赖结构。

原始身份和活动自由度承担不同作用

全零行列使相应期望频数为零,因而不能作为有效分类增加自由度;原始标签仍有审核意义。两种形状同时保留可以解释为什么原始 3×3 表的活动自由度为 1,却仍不符合原始 2×2 的 Yates 条件。

相同报告内的不同信息
项目含义需要避免的误读
N完整整数频数之和不能证明个体独立或重建原始观察
原始形状 / original shape全部源行列的身份排除零边际不改变原始 2×2 条件
活动 df / active df(正行数−1)×(正列数−1)零总计数和不足两条正边际是未定义
p 与 log p / p and log p同一个渐近上尾的两种数值表示浮点下溢不是数学概率等于零
小期望频数 / small expected正期望值小于 5 的单元格提示较小 p 不能消除近似前提限制

用逐格报告解释整体统计量

卡方贡献按格相加;Pearson 残差保留偏离方向,标准化残差进一步考虑边际比例。Yates 改变符合条件原表的贡献,并不把残差换成无方向数值。未定义残差保留状态与空值,不能替换为零。

  • 保留全部格、原索引和源位置,避免同名标签被合并。
  • 渐近方法的解释依赖研究设计;此工具不提供模拟、Fisher 或精确检验。
  • 公开 333 表的结果不等同于未提供的私有数百万表结果。

参考资料

  • 聚合频数推断的原始讨论

    来源公开完整 6×2 表含 333 个观察计数。回复建议渐近表检验,作者没有最终确认;私有数百万计数表未提供。

本分类工具使用说明

展开工具,查看操作步骤、可调选项和支持范围,再直接进入工作区。

列联表独立性推断直接使用聚合频数计算渐近卡方独立性检验,并保留完整期望频数、逐格贡献和两种残差。

用分类频数表核对边际、渐近推断和每个单元格的影响。明确选择当前输入、显著性水平和仅适用于原始 2×2 表的修正。

操作步骤

  1. 选择当前输入,提供完整带标签频数表。
  2. 明确输入 alpha,并按原表形状选择修正。
  3. 核对总计数、活动自由度、小期望频数与未定义状态。
  4. 保存八份完整文件,结合研究设计解释渐近结果。

可调选项

当前输入
粘贴完整 CSV · 一份原始 CSV 文件
显著性水平 α
0.05

必须严格介于 0 与 1 之间。

仅对原始 2×2 表使用 Yates 修正
默认关闭

能力与限制

  • 选择粘贴或文件其中一种当前输入。CSV 必须严格 UTF-8、逗号分隔并带两轴非空标签;数据区允许 1–64 行、1–64 列、最多 4,096 格,原件最多 4 MiB。重复标签按原索引保留,不合并。
  • 计数必须是非负整数,总计数 N 不超过 10¹²;alpha 必须是大于 0 且小于 1 的有限数。Yates 只适用于原始 2×2 表,不能因排除零边际而把较大原表当成 2×2。
  • 所有原行列和零边际单元格都会保留。检验自由度按正边际计算且不超过 100;总计数为零或正边际不足时,完整报告给出未定义状态。小于 5 的正期望频数提示渐近近似限制。
  • 上尾直接在正项与对数域计算。可表示的小 p 值保留其值;确实下溢时保留有限 log p。此工具执行渐近独立性检验,不生成个体记录,也不提供精确、Fisher 或模拟检验。
  • 一次操作共享 1,000 万工作量、512 MiB 内存和完整 30 秒期限;期限包含原文件读取、线程启动、计算、完整产物验证、清理及首次发布。全部文件与完整文本合计不超过 32 MiB,紧凑类型数据含原生元数据不超过 8 MiB,两者合计不超过 40 MiB;二进制与传输元数据不超过 64 MiB。任一预算超出即整次失败。
  • 下载提供五份完整矩阵、全表报告、设置与原始 CSV。文本和表格预览有界,完整复制与下载不截断。原件、文件名与设置仅在当前浏览器处理。
打开列联表独立性推断 →