成对 Spearman 必须先筛选同一组有效行
用一个含并列值和缺失值的有限样例说明为何成对筛选会改变秩,并解释重复列名与完整结果的交接。
标签需求来自一个已解决的问题
原作者希望相关矩阵的标签不带数据框名称,并在帖子中重复选择 Age_55_64。保存的讨论显示问题已在 R 中解决;没有原始完整数值输入。本工具保留标签和选择身份,增加 Spearman、有效 N、状态和 SVG,不能声称复现原作者的数值。
删行会改变并列秩的位置
样例第一列是 1,2,2,4,NA,6。与 GDP 配对时,其中一个值 2 的行因 GDP 缺失被排除,剩下 1,2,4,6;其秩是 1,2,3,4。若先对整列排序,两个值 2 的秩会先成为 2.5,随后删行不能纠正这个集合差异。
| 步骤 | 行为 |
|---|---|
| 1 | 按声明的缺失政策筛选有效行。 |
| 2 | 在这个子集内为两个变量分别计算平均并列秩。 |
| 3 | 计算秩的 Pearson 相关,并保留 N 与状态。 |
同名不等于同一物理列
原始标签可以相同,重复选择也可以指向同一物理列。JSON 保留选择序号、物理索引和原表头,让接收方判断来源,而不依赖临时重命名。
- 重复选择仍输出完整行列。
- 每个单元格的有效 N 与状态和系数一起交接。
零相关与无法计算有不同含义
常量列、少于两行有效数据或检测到数值下溢可能没有系数。空值的状态说明原因;零值则是已计算系数。缩放和补偿求和减少溢出风险,但有限二进制数仍有精度边界,原始字符串因此完整保留。
有限预览之后保存全部证据
前10×10个单元格方便检查,完整CSV、JSON、原始文件和带完整标签的SVG用于完整交接。行数、列选择与输出大小须同时满足联合上限。超出联合预算或30秒期限时不会返回部分矩阵;保留原件和设置,缩小任务后再运行。
参考资料
- 原始问题
已读保存的七篇完整公开帖子;作者已在 R 中解决标签问题。没有原始完整数值 CSV,不推断浏览器偏好或市场规模。
- jStat 1.9.6 核心与 MIT 许可
采用平均并列秩和相关语义;为有限范围、实际比较计数及稳定算术作范围内适配,附完整 MIT 许可证。
本分类工具使用说明
展开工具,查看操作步骤、可调选项和支持范围,再直接进入工作区。
列相关矩阵用完整 CSV 计算 Pearson 或 Spearman 相关矩阵,保留原始列名、重复选择、每对有效 N 和状态。
按原表列序号选择经济、社会或其他数值变量。保留原标签和重复选择,计算所有变量对,并通过 N 和状态解释无法计算的单元格。成对删除和整行删除可以得到不同的有效行集合。
操作步骤
- 选择完整 UTF-8 文件,核对分隔符和表头设置。
- 按原表物理列填写序号,选择 Pearson/Spearman、缺失值政策及明确的缺失标记。
- 检查有限预览中的系数、N 和状态,下载完整矩阵、有效 N、状态 JSON、SVG、原件、设置及许可证。
可调选项
- 数值列序号
- 1,2
填写从 1 开始的物理列序号,以逗号分隔;例如 1,2,3,1。重复项保留为不同选择序号。
- 相关方法
- Pearson · Spearman
Spearman 对每对有效行分别计算平均并列秩。
- 缺失值政策
- 成对删除 · 整行删除
成对:每对只用两个变量都有效的行;整行:所有所选物理列都有效的行。
- 输入分隔符
- 逗号 · 分号 · 制表符 · 竖线
- 表头
- 首行是表头 · 没有表头
相同或空表头保持原样;无表头时使用 column_1 等生成标签。
- 缺失值标记
- 按需要填写
每行一个,去除两端空白后区分大小写;空单元格始终视为缺失。
能力与限制
- 仅接受一个非空 UTF-8 CSV/TSV/TXT 文件,最多 20 MiB、50,000 个数据行、2,000,000 个单元格(含存在的表头),每行宽度相同。允许 UTF-8 BOM、引号和引号内换行。
- 选择 1–64 个序号,重复选择保留。所选非缺失值须为有限二进制 64 位数值,可使用十进制或科学记数法;其他文本、无穷值及输入下溢会拒绝整个任务。原始数值字符串和未选列仍完整保留。
- 缺失标记最多 20 个,每个 100 字符,整个输入 2,048 字符。少于两行有效数据或常量列返回空系数和明确状态;算术下溢、精度丢失或非有限中间值也返回明确状态。只有超过 ±1 不多于 32 个 Number.EPSILON 的偏差才校正并记录。
- 这是联合预算:配对行工作最多 100,000,000 次、实际排序比较最多 20,000,000 次;文件加完整文本最多 32 MiB、紧凑类型 JSON 16 MiB、三者合计 48 MiB、二进制加元数据传输 64 MiB、保守估算内存 512 MiB。各轴上限不能作为可同时达到的容量承诺。
- 30 秒绝对截止线涵盖原生文件校验、读取、Worker 加载、计算、完整结果校验、清理及等待后的首次界面发布。失败或取消不发布部分结果。界面只展示前 10×10 个单元格和每个标签前 120 个字符;下载保留全部单元格和完整标签。