TXT、Markdown、Word 与 EPUB:文本整理和发布选择
从一份章节稿出发,整理编码、空行、标题和列表,再比较 Markdown、Word 与 EPUB 的交付方式及阅读器复核要点。
例子:把排障记录整理成客户文档
客服团队要把长篇纯文本排障记录整理成客户文档。源文件同时包含自动折行的段落、带编号的命令和有先后顺序的恢复步骤。删除全部数字或对所有行排序,表面上更整齐,却会破坏含义。第一步应判断哪些结构是正文,哪些只是导出时的痕迹。
清理前分清段落、列表和命令
保留原件,选择包含标题、列表、URL 和代码的代表性片段。任何清理前先确认编码;只有换行不代表独立记录时,才合并断行。通过逐行编辑增加前缀或编号,随后比较处理前后片段,再把同样参数用于全文。
按接收方的用途选择输出格式
根据接收方下一步动作选择格式:Markdown 方便维护文本源,Word 便于协作编辑,PDF 用于相对固定的交付,EPUB 则需要面向连续阅读的章节与导航。格式转换不会让这些用途变得相同。复杂表格或嵌入对象应单独试验,不能假定所有导出器都会保留。
输入为独立三行 001、002、001。去重应保留首个 001 和 002,是否排序是另一个决定。在目标编辑器或阅读器里复核
在目标应用验收:点击链接、检查列表层级,并确认复制出来的命令仍与原文一致。EPUB 检查目录,PDF 检查分页,Word 检查是否仍可编辑。把原始来源与处理决策一起保留,避免下一次修改要从导出文件反推原结构。
| 不能单凭 | 应该补查 |
|---|---|
| 没有乱码 | 检查字符规范化是否改变预期字符 |
| 标题看起来正确 | 确认标题层级和目录链接 |
| EPUB可以打开 | 检查章节边界、封面和正文顺序 |
- 保留原编码副本,先用包含特殊符号的小段试转。
- 抽查第一章、末章、列表及空段落。
- 在实际接收方使用的阅读器中检查一次。
参考资料
- 文本整理:保留含义与记录边界
相关格式和处理规则的参考。
- Markdown 跨格式发布流程
相关格式和处理规则的参考。
- EPUB 制作与阅读检查
相关格式和处理规则的参考。
本文相关工具
TXT 编码转 UTF-8 →选对文字编码,另存一份正常显示的 TXT。合并 TXT →选好顺序,把几份文字接在一起。字数统计 →字数、字符、段落,一眼看清。大小写转换 →把英文大小写改成你需要的样子。去除重复行 →去掉重复内容,保留原来的顺序。文本行排序 →按文字或数字,把每一行排好。清理空格与空行 →清理多余空格和空行,保留需要的段落。文本查找替换 →找出指定内容,再确认要替换的文字。URL Slug 生成 →把标题整理成适合网址的短文本。拆分 TXT →按行数或大小,把长文本拆成几份。Markdown 转 Word →保留标题和表格,继续用 Word 编辑。Markdown 转 HTML →把 Markdown 整理成可打开的 HTML 文档。Markdown 预览 →输入 Markdown,预览支持的排版效果。HTML 转 Markdown →粘贴 HTML,把主要内容整理成 Markdown。Markdown 转 PDF →预览排版后,用浏览器打印或另存为 PDF。Word 转 Markdown →把 Word 正文、链接和嵌入图片转入 Markdown。TXT 转 EPUB →给文字加上封面和目录,读着更舒服。打开 EPUB →在浏览器打开本地 EPUB,检查章节内容。EPUB 转 TXT →按阅读顺序,把电子书里的文字提取出来。编辑 EPUB 信息 →调整书名、作者或封面,再保存电子书。提取邮箱地址 →从粘贴文本或 UTF-8 文本文件中提取并去重常见邮箱地址。提取网页链接 →从文本或 UTF-8 文件提取完整的 HTTP 和 HTTPS 链接,复制或保存名单。逐行文本编辑 →换行、添加或删除行号、添加前后缀、生成列表与提取行,集中处理一份文本。文本词频与字符统计 →统计词组或 Unicode 码点,并定位指定词语或短语在原文中的出现位置。比较两个列表 →找出两份列表的共同项、A 或 B 独有项及合并结果。Unicode 文本规范化 →将文本规范化为 NFC、NFD、NFKC 或 NFKD,并可比较两段文本规范化后是否相同。清理指定的隐藏字符 →找出零宽空格等指定码点,只删除或替换你选择的类型。Unicode 字符检查 →逐个查看 Unicode 码点、正式名称或控制字符别名、UTF-8 字节及原文位置。