文本词频与字符统计
统计词组或 Unicode 码点,并定位指定词语或短语在原文中的出现位置。
浏览器本地处理输入文本 / UTF-8 文件输出JSON / CSV单个文件最多 10 MiB · 最多 1 个
- 1添加输入
- 2调整设置
- 3获取结果
工具输入和文件在当前浏览器处理,不会上传。
开始之前
粘贴草稿或读取 UTF-8 文本文件,查看词组或码点频次。词组模式还能输入一段已知短语,查看出现次数和前 20 处原文位置。排名仍按精确词形统计,不判断写作质量。
如何使用
- 选择词组或码点;如要定位已知短语,在词组模式填入该短语。
- 粘贴文本或选择一个 UTF-8 文件,然后统计频率。
- 查看频次排名和短语原文位置,复制匹配排名或下载完整 JSON/CSV 排名。
支持范围与限制
词组频次按 Unicode NFC 规范化后忽略大小写;短语定位按原文不区分大小写精确匹配,空白字符可变化,不合并相关词形。
字符模式统计 Unicode 码点,默认包含空白字符;一个可见符号可能由多个码点组成。
粘贴文本最多 1 MiB;单个 UTF-8 文件最多 10 MiB;最多 50,000 个实际行和 50,000 个不同值。全部在浏览器处理。
操作示例
示例输入
green tools green
示例参数
{}示例输出
[
{
"value": "green",
"count": "2"
},
{
"value": "tools",
"count": "1"
}
]出现问题时
如果排行为空,请检查输入来源和筛选条件;仅包含标点的文本没有可计数词组。
常见问题
能识别同词根或短语重复吗?
可以输入一个已知短语查看精确出现次数和前 20 处原文位置。工具不会自动发现所有短语,也不会合并词形变化。
为什么常见词排在前面?
默认包含所有词组。可开启“隐藏常见英文功能词”,略过 the、and、to 等固定词表;此筛选不是完整的无意义词识别。
“码点”统计的是什么?
统计 Unicode 码点,不是视觉上的完整字符组合。默认包含空格和换行,可选择隐藏。JSON 保留原值;CSV 增加 U+ 码点列。
搜索会改变下载文件吗?
不会。搜索和“只显示重复项”仅改变页面表格和复制的匹配项;JSON 与 CSV 包含输入筛选后的完整排行。
文本会上传吗?
不会。统计在本浏览器中完成;刷新或关闭标签页前请保存需要的结果。