Neatbo.

文本整理手册:编码、逐行编辑与字符检查

学习文本编码转换、去重、排序、逐行编辑和 Unicode 检查。用保留段落与记录边界的方式整理文字,避免误删编号和特殊字符。

按任务选择操作

学习文本编码转换、去重、排序、逐行编辑和 Unicode 检查。用保留段落与记录边界的方式整理文字,避免误删编号和特殊字符。

该用哪个工具?
你要完成的事建议从这里开始
整理名单或编号明确一行是一条记录,再去重或排序
修复中文乱码先按原编码试读,再导出 UTF-8
排查看不见的差异先检查码点,再决定规范化或移除字符

按顺序执行并保留原件

添加行号、前后缀、列表和提取范围统一使用逐行文本编辑。整理后用对比工具检查,尤其是空白或大小写具有含义时。清除不可见字符可能影响标识符与字形,Unicode 标准化也应按兼容要求选择。

操作小样与预期
输入为独立三行 001、002、001。去重应保留首个 001 和 002,是否排序是另一个决定。

区分处理成功与交付通过

对比记录数量并抽查首尾行。频率统计按码点或词组处理,不提供中文语义分词。

完成前检查清单

下面列出本分类各工具的具体步骤、选项和限制。展开需要的工具即可查看,不必按顺序使用全部工具。

  • 对比记录数量并抽查首尾行。频率统计按码点或词组处理,不提供中文语义分词。
  • 下载后重新打开,确认结果与示例和输入语义一致。
  • 超出边界时保留原稿,拆分任务或使用适合规模的处理方式,不通过改扩展名绕过检查。

参考资料

本分类工具使用说明

展开工具,查看操作步骤、可调选项和支持范围,再直接进入工作区。

TXT 编码转 UTF-8选对文字编码,另存一份正常显示的 TXT。

读取 UTF-8、GB18030/GBK 或 Big5,输出 UTF-8。请先检查解码预览并确认;某些错误编码仍能解码,无法可靠自动判断。

操作步骤

  1. 选择本地 .txt 文件,工作副本保留在浏览器中。
  2. 核对“输入编码”、“换行符”,再选择“转换为 UTF-8”。
  3. 查看 UTF-8 TXT 结果,确认无误后使用结果区提供的复制或下载操作。

可调选项

输入编码
UTF-8(严格检查) · GB18030 / GBK · Big5
我已确认解码后的文字没有乱码。
默认关闭
换行符
保持原样 · LF · CRLF
包含 UTF-8 BOM
默认关闭

能力与限制

  • 纯文本文件每份最多 10 MiB、总计 30 MiB;旧编码需确认解码预览可读。
打开TXT 编码转 UTF-8 →
合并 TXT选好顺序,把几份文字接在一起。

按显示顺序连接本地文本,可设置统一或逐文件编码。检查预览后,填写文件之间实际插入的分隔文字。

操作步骤

  1. 选择本地 .txt 文件,并按期望处理的顺序排列,工作副本保留在浏览器中。
  2. 核对“输入编码”、“文件间分隔文字”,再选择“合并文本”。
  3. 查看 TXT 结果,确认无误后使用结果区提供的复制或下载操作。

可调选项

输入编码
UTF-8(严格检查) · GB18030 / GBK · Big5
我已确认解码后的文字没有乱码。
默认关闭
文件间分隔文字

能力与限制

  • 纯文本文件每份最多 10 MiB、总计 30 MiB;旧编码需确认解码预览可读。
打开合并 TXT →
字数统计字数、字符、段落,一眼看清。

分别统计粘贴文本的 Unicode 码点、UTF-16 单元、字素簇、拉丁字母英文单词、汉字、行、段落和 UTF-8 字节。emoji 和中英混排时口径不同;不代表出版社指定的字数。

操作步骤

  1. 在“文本”中粘贴内容,也可以先填入示例试用。
  2. 确认输入后,点击“统计字数”。
  3. 阅读已标注的统计值,可复制单项数字或完整 JSON;再按目标平台的限额口径核对。

能力与限制

  • 粘贴文本最多 1 MiB;处理后请核对结果。
打开字数统计 →
大小写转换把英文大小写改成你需要的样子。

在本地转换粘贴文字大小写。大写/小写遵循 Unicode 映射,标题式、句首式和“姓全大写+名首字母大写”按英文规则处理;姓名与缩写仍需人工核对。

操作步骤

  1. 在“文本”中粘贴内容,也可以先填入示例试用。
  2. 选择小写、大写、英文标题式、英文句首式,或每行一人的“姓全大写+名首字母大写”,再点击“转换大小写”。
  3. 对照原文检查姓名与缩写,随后复制结果或下载 result.txt。

可调选项

大小写规则
小写 · 大写 · 英文单词首字母大写 · 英文句首字母大写 · 英文姓全大写+名首字母大写

能力与限制

  • 粘贴文本最多 1 MiB;处理后请核对结果。
打开大小写转换 →
去除重复行去掉重复内容,保留原来的顺序。

删除整行重复内容,不改变行序。首次出现的行原样保留;忽略大小写或首尾空白只影响比较。

操作步骤

  1. 每行一项粘贴到“文本”,或先载入示例。
  2. 选择比较时是否忽略大小写或首尾空白,再去除重复行。
  3. 核对保留行的顺序,然后复制或下载完整结果。

可调选项

比较时忽略大小写
默认关闭
比较时忽略首尾空白
默认关闭

能力与限制

  • 最多粘贴 1 MiB 文本。本工具比较整行,不按指定列或网址片段去重;使用前请核对结果。
  • 结果中的 CR、LF、CRLF 换行统一为首次检测到的样式;拒绝格式损坏的 Unicode 文本。
打开去除重复行 →
文本行排序按文字或数字,把每一行排好。

把粘贴的文本行按文字或精确十进制数值升序、降序排列。相等值保持原顺序,空行总在最后。

操作步骤

  1. 每行一项粘贴到“文本”,或载入数值示例。
  2. 选择 Unicode 字典序或精确十进制数值,再选择升序或降序。
  3. 排序后核对行序,再复制或下载完整结果。

可调选项

排序依据
Unicode 字典序 · 精确十进制数值
顺序
升序 · 降序

能力与限制

  • 最多粘贴 1 MiB。数值模式要求每个非空行仅含一个有效十进制数,不能带标签或分隔符。
  • 数值指数须在 −1,000,000 至 1,000,000;文字按 UTF-16 单元比较,不采用地区语言排序;拒绝格式损坏的 Unicode 文本。
打开文本行排序 →
清理空格与空行清理多余空格和空行,保留需要的段落。

清理粘贴文本,同时保留有用的行与段落间隔。可去掉行末空格、压缩行内空格与制表符,并决定连续空行保留几行。

操作步骤

  1. 将内容粘贴到“文本”,或载入示例试用。
  2. 选择是否去除行末空格、合并行内空格/制表符,并设置最多连续空行(0 表示全删)。
  3. 核对段落间距,再复制或下载完整结果。

可调选项

去除行末空格
默认开启
合并连续空格和制表符
默认关闭
最多连续空行
1

能力与限制

  • 最多粘贴 1 MiB。本工具不会把换行合并成段落;使用前请核对间距。
  • 行末清理删除制表符与 Unicode 空格分隔字符;行内合并只处理空格和制表符,其余字符保持不变;拒绝格式损坏的 Unicode 文本。混合 CR、LF、CRLF 换行统一为首次检测到的样式。
打开清理空格与空行 →
文本查找替换找出指定内容,再确认要替换的文字。

默认按普通文字查找替换。可选 JavaScript 正则表达式在可终止的 Worker 中执行,并设硬超时;正则替换标记遵循 JavaScript 规则。

操作步骤

  1. 在“文本”中粘贴内容,也可以先填入示例试用。
  2. 核对“查找内容”、“替换为”,再选择“查找并替换”。
  3. 查看 文本 结果,确认无误后使用结果区提供的复制或下载操作。

可调选项

查找内容
按需要填写
替换为
按需要填写
替换全部匹配项
默认开启
区分大小写
默认开启
使用正则表达式
默认关闭
多行锚点
默认关闭

能力与限制

  • 粘贴文本最多 1 MiB;处理后请核对结果。
打开文本查找替换 →
URL Slug 生成把标题整理成适合网址的短文本。

使用 NFKC 规范化并转小写,再以连字符连接字母和数字。默认保留非拉丁文字;仅 ASCII 模式先去除可分解的重音符号,再移除其他非 ASCII 字符,不会把中文转成拼音。

操作步骤

  1. 在“文本”中粘贴内容,也可以先填入示例试用。
  2. 确认输入后,点击“生成 Slug”。
  3. 查看 网址短名称 结果,确认无误后使用结果区提供的复制或下载操作。

可调选项

仅保留 ASCII(é 变为 e;中文字符移除)
默认关闭

能力与限制

  • 粘贴文本最多 1 MiB;处理后请核对结果。
打开URL Slug 生成 →
拆分 TXT按行数或大小,把长文本拆成几份。

按行数或 UTF-8 字节上限拆分,并下载真实 ZIP。字节拆分不会截断 Unicode 码点;连接各部分可还原解码后的原文。

操作步骤

  1. 在“TXT”中粘贴内容,或选择本地文件。
  2. 核对“输入编码”、“拆分依据”、“每份行数/最大字节数”,再选择“拆分文本”。
  3. 下载 ZIP,检查编号 TXT 分片;需要还原解码后原文时,按编号顺序拼接各分片内容。

可调选项

输入编码
UTF-8(严格检查) · GB18030 / GBK · Big5
我已确认解码后的文字没有乱码。
默认关闭
拆分依据
行数 · UTF-8 字节数
每份行数/最大字节数
1000

切换模式会重置为 1000 行或 1,048,576 个 UTF-8 字节。按字节拆分可能切开一行,但不会切开 Unicode 码点。

能力与限制

  • 本地 TXT 文件最多 10 MiB;粘贴文本最多 30 MiB。ZIP 最多包含 1000 份。旧编码需确认解码预览可读。
打开拆分 TXT →
提取邮箱地址从粘贴文本或 UTF-8 文本文件中提取并去重常见邮箱地址。

从通讯录、邮件正文或文本/HTML 源文件中找出邮箱地址。检查不重复名单后,可复制或下载。

操作步骤

  1. 选择「粘贴文本」或「文本文件」。粘贴名单、正文或 HTML 片段,或选择一个 UTF-8 文件。
  2. 决定是否合并仅大小写不同的地址;合并时保留首次出现的拼写。
  3. 执行提取,检查数量和预览,再复制或下载完整的逐行 TXT 名单。

能力与限制

  • 粘贴文本最多 1 MiB,或选择单个不超过 10 MiB 的 UTF-8 文本文件;最多 50,000 行和 50,000 次地址匹配。HTML 与 CSV 按原始文本扫描,不解析字段。
  • 识别常见 ASCII 邮箱地址,@ 前采用点分段形式,@ 后为域名。不覆盖带引号的本地部分或国际化地址;不验证邮箱存在、联系许可或可投递性。
打开提取邮箱地址 →
提取网页链接从文本或 UTF-8 文件提取完整的 HTTP 和 HTTPS 链接,复制或保存名单。

从笔记、日志或源码文字中提取已写出的 HTTP 和 HTTPS 链接。检查后可复制完整名单或下载逐行 TXT;工具不会访问链接。

操作步骤

  1. 选择粘贴文本或单个 UTF-8 文件,提供含链接的内容。
  2. 选择 HTTP、HTTPS 或两者;可填写允许的顶级域名和域名,再决定是否保留重复链接。
  3. 点击“提取链接”,检查前几条,再复制或下载完整名单。

可调选项

协议
HTTP 与 HTTPS · 仅 HTTP · 仅 HTTPS
允许的顶级域名(可留空)
按需要填写

用英文逗号分隔,例如 com,org;留空表示不限。

允许的域名(可留空)
按需要填写

用英文逗号分隔,例如 example.com;也包含子域名,留空表示不限。

能力与限制

  • 可粘贴最多 1 MiB,或选一个最多 10 MiB 的 UTF-8 文本文件;本地最多处理 50,000 行、50,000 个匹配链接。
  • 只扫描已写出的完整 HTTP/HTTPS 链接;不补全 HTML 相对 href 或富文本中隐藏的链接,也不打开或检查网页是否可访问。
打开提取网页链接 →
逐行文本编辑换行、添加或删除行号、添加前后缀、生成列表与提取行,集中处理一份文本。

在一个工作台完成逐行文本处理:按段落重排或合并断行、添加或删除行号、添加前后缀、生成 Markdown 列表,或提取指定行范围。选择任务后核对结果,再复制或下载。

操作步骤

  1. 选择任务。提取行范围时,可按行号或静态文件快照中的起止文本标记选择。
  2. 粘贴文本,或选择一个 UTF-8 文本文件。
  3. 运行任务,核对结果和行数后复制或下载。

可调选项

处理任务
换行整理 · 添加行号 · 删除行号 · 添加前后缀 · 生成列表 · 提取行范围
每行字符数
80
处理方式
自动换行 · 合并断行
范围选择方式
按行号 · 按文本标记
起始行号
1
分隔符
.
前缀
item-
后缀
按需要填写
列表样式
无序列表 · 有序列表 · 任务清单
结束行(可留空)
按需要填写
起始文本
按需要填写

包含此精确文本的首行会纳入结果。

结束文本(可留空)
按需要填写

纳入起始行之后首个包含此文本的行;留空则提取到末尾。

能力与限制

  • 换行整理会先合并段落内的断行,空行作为段落分隔;长单词不会拆开。
  • 编号、前后缀和列表会保留末尾换行,但不会因此多出一项。提取的行范围不带末尾换行;列表中的空行保持为空行。
  • 粘贴文本最多 1 MiB,或选择一个最多 10 MiB 的 UTF-8 文件,均不超过 50,000 个物理行。完整结果最多 20 MiB;所有参数值共用 2 MiB 预算。拒绝文本或当前使用的字面文本参数中格式损坏的 Unicode。
  • 换行宽度按 Unicode 码点计数,并非显示列宽或组合字符簇。文件按严格 UTF-8 解码并去掉开头的 BOM;结果使用 LF 换行。
打开逐行文本编辑 →
文本词频与字符统计统计词组或 Unicode 码点,并定位指定词语或短语在原文中的出现位置。

粘贴草稿或读取 UTF-8 文本文件,查看词组或码点频次。词组模式还能输入一段已知短语,查看出现次数和前 20 处原文位置。排名仍按精确词形统计,不判断写作质量。

操作步骤

  1. 选择词组或码点;如要定位已知短语,在词组模式填入该短语。
  2. 粘贴文本或选择一个 UTF-8 文件,然后统计频率。
  3. 查看频次排名和短语原文位置,复制匹配排名或下载完整 JSON/CSV 排名。

可调选项

处理任务
词组 · 字符
隐藏常见英文功能词
默认关闭
包含空格与换行
默认开启
查找原文词语或短语(可选)
按需要填写

最多 120 个字符;精确匹配、不区分大小写;原文位置最多显示 20 处。

能力与限制

  • 词组频次按 Unicode NFC 规范化后忽略大小写;短语定位按原文不区分大小写精确匹配,空白字符可变化,不合并相关词形。
  • 字符模式统计 Unicode 码点,默认包含空白字符;一个可见符号可能由多个码点组成。
  • 粘贴文本最多 1 MiB;单个 UTF-8 文件最多 10 MiB;最多 50,000 个实际行和 50,000 个不同值。全部在浏览器处理。
打开文本词频与字符统计 →
比较两个列表找出两份列表的共同项、A 或 B 独有项及合并结果。

逐行比较两份纯文本列表,查看 A 独有、共有、B 独有项目。预览显示每项在原列表中首次出现的行号,便于返回原文查找。

操作步骤

  1. 粘贴列表 A 或选取 UTF-8 文件,再粘贴列表 B;每行一项。
  2. 选择输出分组,并决定是否忽略大小写及行首尾空格。
  3. 查看三组结果及首次原文行号,复制完整分组或下载所选 TXT。

可调选项

下载 / 预览分组
共同项 · A 和 B 都有 · 仅 A · B 中没有 · 仅 B · A 中没有 · 两边独有 · 仅 A + 仅 B · 并集 · 所有不同项
忽略字母大小写
默认开启
忽略每项首尾空格
默认开启

能力与限制

  • 每份列表粘贴最多 1 MiB;A 可选一个 UTF-8 文件(最多 10 MiB);每份最多 50,000 行。
  • 空行和重复项会跳过;只比较完整文本行,不解析 CSV 列、Excel 工作簿或近似名称,也不会在原表内高亮。
  • 所有处理在本浏览器完成,无需账户或上传。
打开比较两个列表 →
Unicode 文本规范化将文本规范化为 NFC、NFD、NFKC 或 NFKD,并可比较两段文本规范化后是否相同。

外观相同的文本可能使用不同的 Unicode 码点。粘贴文本或选择一个 UTF-8 文件,并可选填第二段文本;查看所选形式下的变化与两段文本是否相同,再复制或下载结果。

操作步骤

  1. 粘贴文本或选择一个 UTF-8 文件;如要比较两个文件名或字符串,在第二输入框粘贴另一段文本。
  2. 规范等价场景选择 NFC 或 NFD;只有确定要折叠兼容字符时才选择 NFKC/NFKD。
  3. 运行后查看首处码点变化,以及两段文本规范化前后的比较结果;复制或下载第一段规范化后的 TXT。

可调选项

规范化形式
NFC · 组合(一般文本) · NFD · 分解 · NFKC · 兼容折叠后组合 · NFKD · 兼容折叠后分解

能力与限制

  • 粘贴文本和可选的第二段文本各限 1 MiB;单个 UTF-8 文件限 10 MiB 和 50,000 行。输入仅在此浏览器处理。
  • NFKC/NFKD 可能替换兼容字符并丢失区别;如拼写、符号或格式有意义,请保留原文。
  • 规范化不会去重音、转写文字、删除不可见字符,也不会检查视觉混淆字符。
打开Unicode 文本规范化 →
清理指定的隐藏字符找出零宽空格等指定码点,只删除或替换你选择的类型。

检查粘贴文本或 UTF-8 文件中的隐藏字符。默认仅删除零宽空格;其他字符需主动选择。使用结果前先核对各字符数量和原文位置。

操作步骤

  1. 粘贴文本,或选择一个 UTF-8 文本文件。
  2. 明确选择要删除的隐藏字符;也可选择把不换行空格替换为普通空格。
  3. 运行后查看各字符数量及原文中的前几个位置,再复制或下载清理后的 TXT。

可调选项

删除零宽空格 · U+200B
默认开启
删除词连接符 · U+2060
默认关闭
删除 FEFF 字符 · U+FEFF
默认关闭
删除 ZWNJ / ZWJ · U+200C / U+200D
默认关闭
将不换行空格替换为普通空格 · U+00A0
默认关闭
删除从左到右标记 · U+200E
默认关闭

能力与限制

  • 只检查列出的七种码点;本工具不是通用 Unicode 清理器。
  • U+200E 会影响文字方向;ZWJ/ZWNJ 可能影响文字连写和 Emoji。删除前请核对原文。
  • 粘贴文本最多 1 MiB;单个 UTF-8 文本文件最多 10 MiB、50,000 个物理行。文件开头的 BOM 可能在 UTF-8 解码时被消耗。
打开清理指定的隐藏字符 →
Unicode 字符检查逐个查看 Unicode 码点、正式名称或控制字符别名、UTF-8 字节及原文位置。

粘贴文本或选择一个 UTF-8 文件,找出显示文字背后的准确码点。可按码点、名称或字节搜索全部结果,并导出完整 JSON 或 CSV。

操作步骤

  1. 粘贴文本或选择一个 UTF-8 文本文件。
  2. 运行后按码点、Unicode 名称或 UTF-8 字节搜索完整结果,核对原文行列位置。
  3. 将匹配行复制为 JSON,或复制完整 JSON;也可下载完整的 JSON 或 CSV 报告。

能力与限制

  • 每次最多检查 10,000 个 Unicode 码点。粘贴文本最多 1 MiB;单个 UTF-8 .txt/.md 文件最多 10 MiB、50,000 个物理行。
  • 名称来自 Unicode 18.0.0。控制字符显示 Unicode 别名;私用和未分配码点没有正式名称。文件开头的 BOM 可能在 UTF-8 解码时被消耗。
  • 每行表示一个码点,并非完整的可见字素簇,也不判断视觉混淆字符是否等价。输入仅在本浏览器处理。
打开Unicode 字符检查 →

本文相关工具

TXT 编码转 UTF-8 →选对文字编码,另存一份正常显示的 TXT。合并 TXT →选好顺序,把几份文字接在一起。字数统计 →字数、字符、段落,一眼看清。大小写转换 →把英文大小写改成你需要的样子。去除重复行 →去掉重复内容,保留原来的顺序。文本行排序 →按文字或数字,把每一行排好。清理空格与空行 →清理多余空格和空行,保留需要的段落。文本查找替换 →找出指定内容,再确认要替换的文字。URL Slug 生成 →把标题整理成适合网址的短文本。拆分 TXT →按行数或大小,把长文本拆成几份。提取邮箱地址 →从粘贴文本或 UTF-8 文本文件中提取并去重常见邮箱地址。提取网页链接 →从文本或 UTF-8 文件提取完整的 HTTP 和 HTTPS 链接,复制或保存名单。逐行文本编辑 →换行、添加或删除行号、添加前后缀、生成列表与提取行,集中处理一份文本。文本词频与字符统计 →统计词组或 Unicode 码点,并定位指定词语或短语在原文中的出现位置。比较两个列表 →找出两份列表的共同项、A 或 B 独有项及合并结果。Unicode 文本规范化 →将文本规范化为 NFC、NFD、NFKC 或 NFKD,并可比较两段文本规范化后是否相同。清理指定的隐藏字符 →找出零宽空格等指定码点,只删除或替换你选择的类型。Unicode 字符检查 →逐个查看 Unicode 码点、正式名称或控制字符别名、UTF-8 字节及原文位置。