Neatbo.

文本词频与字符统计

统计词组或 Unicode 码点,并定位指定词语或短语在原文中的出现位置。

浏览器本地处理输入文本 / UTF-8 文件输出JSON / CSV单个文件最多 10 MiB · 最多 1 个
  1. 1添加输入
  2. 2调整设置
  3. 3获取结果

工具输入和文件在当前浏览器处理,不会上传。

输入内容

切换工具时在当前标签页临时保留输入。刷新或关闭后清除,较大的结果可能需要重新生成。

⌘ / Ctrl + Enter 运行

选择统计方式

选择一个统计模式及可选过滤条件;输入仅在本浏览器中处理。

最多 120 个字符;精确匹配、不区分大小写;原文位置最多显示 20 处。

词组统计不区分大小写;可隐藏常见英文功能词,不合并词形变化或短语。

统计来源
0 个字符 · 0 字节
正在准备处理工具…

开始之前

粘贴草稿或读取 UTF-8 文本文件,查看词组或码点频次。词组模式还能输入一段已知短语,查看出现次数和前 20 处原文位置。排名仍按精确词形统计,不判断写作质量。

如何使用

  1. 选择词组或码点;如要定位已知短语,在词组模式填入该短语。
  2. 粘贴文本或选择一个 UTF-8 文件,然后统计频率。
  3. 查看频次排名和短语原文位置,复制匹配排名或下载完整 JSON/CSV 排名。

支持范围与限制

词组频次按 Unicode NFC 规范化后忽略大小写;短语定位按原文不区分大小写精确匹配,空白字符可变化,不合并相关词形。

字符模式统计 Unicode 码点,默认包含空白字符;一个可见符号可能由多个码点组成。

粘贴文本最多 1 MiB;单个 UTF-8 文件最多 10 MiB;最多 50,000 个实际行和 50,000 个不同值。全部在浏览器处理。

操作示例

示例输入

green tools green
示例参数
{}

示例输出

[
  {
    "value": "green",
    "count": "2"
  },
  {
    "value": "tools",
    "count": "1"
  }
]

出现问题时

如果排行为空,请检查输入来源和筛选条件;仅包含标点的文本没有可计数词组。

常见问题

能识别同词根或短语重复吗?

可以输入一个已知短语查看精确出现次数和前 20 处原文位置。工具不会自动发现所有短语,也不会合并词形变化。

为什么常见词排在前面?

默认包含所有词组。可开启“隐藏常见英文功能词”,略过 the、and、to 等固定词表;此筛选不是完整的无意义词识别。

“码点”统计的是什么?

统计 Unicode 码点,不是视觉上的完整字符组合。默认包含空格和换行,可选择隐藏。JSON 保留原值;CSV 增加 U+ 码点列。

搜索会改变下载文件吗?

不会。搜索和“只显示重复项”仅改变页面表格和复制的匹配项;JSON 与 CSV 包含输入筛选后的完整排行。

文本会上传吗?

不会。统计在本浏览器中完成;刷新或关闭标签页前请保存需要的结果。

文档与延伸阅读

相关工具