计算全部分类审核预算
指定原始 ID、二元标签和分数,选择排序规则并保存完整六份结果。
准备并选择完整输入
使用一行 CSV 表头与完整记录,选择互不重复的列序号。ID 和标签为字符串,分数为有限十进制或指数数词。CSV 引号、BOM、换行、原始分数词和来源序号均保留在证据中。其他列保留在字节一致的原件中,并计入源单元格。
id,label,score
a,1,1
b,0,-0
c,1,0
- 指定两个不同标签;出现其他标签时整份输入拒绝。
- 文件模式处理所选原件,文本模式处理粘贴框。
- 非零十进制下溢、重复 ID 和非法 UTF-8 会报错。
查看每个 K 并保存全部证据
可查看 1 到 N 的任意整数 K。TP 是正类前缀计数,FP=K−TP,FN=P−TP。表格预览较短;完整报告、CSV 和 SVG 保留每个 K,包括同分项与未定义召回率。
| 文件 | 证据 |
|---|---|
| ranked-records.csv | 全部原始记录的排名、原始分数词与位置 |
| budgets.csv | 每个 K、整数计数、数值和精确分母 |
| classification-report.json | 完整记录、全部预算、同分、负零标记和状态 |
| budget-curves.svg | 每个 K 的曲线点及完整精确 JSON 元数据 |
| settings.json | 实际来源信息、SHA-256、冻结参数和本地化曲线标签 |
| source-original.csv | 字节一致的原件,包含未使用列 |
整次操作失败后重试
修改输入或设置会取消运行并清除旧下载。取消或超时后可用同一原件重新运行;格式错误需修正,超出预算则先缩小处理范围。
读取、验证、计算、编码、清理到首次发布共用 120 秒期限;超过限制时不返回残缺曲线。
- 将原件、设置与全部结果一起保存。
- 容量由全部预算共同约束;正式的一百万记录轴不代表已实测的同时最大容量。
参考资料
- 原始逐预算分类问题
已读完整问题、四条评论与六条时间线;只有曲线图,没有作者样本数值。
本分类工具使用说明
展开工具,查看操作步骤、可调选项和支持范围,再直接进入工作区。
分类排名预算曲线对全部带标签分数排序,以精确前缀计数查看每个 top-K 审核预算。
选择正类、分数方向与同分策略,查看固定审核数量怎样改变整个留出集的精确率、召回率和 F1。
操作步骤
- 粘贴完整 CSV 或选择一个文件,再指定当前输入。
- 设置互不重复的 ID、标签与分数列序号,以及正负类标签、方向和同分策略。
- 运行后查看任意 K,并保存六份文件及完整复制报告。
可调选项
- 当前输入
- 粘贴 CSV · 单个 CSV 原件
- 正类标签
- 1
- 负类标签
- 0
- 分数方向
- 高分优先 · 低分优先
- 同分策略
- 原始来源顺序 · ID Unicode 码点顺序
- ID 列(从 1 开始)
- 1
- 标签列(从 1 开始)
- 2
- 分数列(从 1 开始)
- 3
能力与限制
- 严格 UTF-8 CSV,含一行表头和 1–1,000,000 条完整记录;ID 为非空唯一字符串,标签只允许显式指定的两类,分数须为有限十进制数。
- 源文件最多 64 MiB、1,000 万源单元格、1,200 万曲线单元格和 1 亿总工作单位;所有限制共同生效。
- 文件与完整文本合计最多 512 MiB,结构化结果最多 512 MiB,二者合计最多 768 MiB,传输与受控内存各最多 1 GiB。记录数量合规不代表同时满足全部预算。
- 读取、验证、计算、编码、清理到首次发布共用 120 秒期限;超过限制时不返回残缺曲线。
- 同分项仍保留每个 K。没有正类时,每个 K 的召回率未定义、F1=0。预览仅显示前 16 个预算和 4,000 个码点;下载与完整复制保留全部结果。