Neatbo.

按明确撇号策略核对原始词表

准备完整 TXT 或 JSON 词表,选择生效策略,逐行审阅并保留整套导出文件。

先确认原件格式

TXT 的每行都是一个独立词项,末尾换行会留下空词。JSON 必须只有一个顶层字符串数组;保留重复词、空词、空白与原始转义词元。数值或布尔值不会被转成词。第一处 UTF-8 BOM 作为签名保留在原件,不计入第一原词。

此单块只含合法原词 JSON。另将 ["","","-0"] 粘贴到白名单,两个格式都选 JSON,策略选原生字典。
["hello","aren’t","aren't","  hello  ","zzz21stzzz","-0","","hello"]
  • 选择一份完整 UTF-8 文件或粘贴词表,并为原词与可选白名单分别选择 TXT 行或 JSON 字符串数组。
  • 选择生效撇号策略;白名单按原词逐字符且区分大小写匹配,空字符串只覆盖精确空词。

选择可复现的策略

“原生字典”可能转换弯撇号,所以不是原词字面相等。“保留原撇号”也不会关闭 trim 或大小写。设置文件记录全部三种定义和当前策略,不能只凭正确/错误列推断发生了什么。

撇号策略
策略实际查询
native-dictionary-policy原生 trim、ICONV、大小写、词缀与复合规则
tool-curly-policy仅先把 U+2019 转成 U+0027,再运行原生规则
original-apostrophe-policy关闭本次 ICONV;仍使用原生 trim、大小写、词缀与复合规则

逐行审阅,再保存整套结果

完整表格包含 26 列;序号、来源位置和 rawToken 能区别重复词。转换与每次实际候选尝试来自同一次 correct 查询;白名单行则不进行字典查询,null 与 false 的含义不同。页面样例完整结果与独立读回已核对,界面和原生 Worker 操作尚待验收。

结果包用途
文件用途
spelling-results.csv / spelling-report.json完整行、轨迹与预算快照
words-original.* / whitelist-original.*字节原件,白名单原件仅启用时存在
dictionary-en-US.aff / .dic / whitelist-active.json实际字典和全部白名单分组
spelling-settings.json / *LICENSE.txt固定参数、源哈希和三份完整许可证

上限、署名与失败恢复

原词与白名单合计 4 MiB UTF-8;原词最多 100,000 行,白名单独立最多 100,000 项;每词最多 128 个 Unicode 码点。

固定 AFF 与 DIC 合计最多 8 MiB;最多 100,000 次词核对;加载、展开、白名单、查询与序列化共同受 100,000,000 个可观测计费单元约束。

全部 10/11 个文件加独立完整复制文本合计最多 64 MiB;持有的来源、字典、记录、序列化、克隆、Blob 与界面表示共同受 768 MiB 保守预分配约束。

60 秒绝对期限从捕获输入开始,覆盖读取、模块载入、字典初始化、核对、编码、完整校验、清理与首次发布;不使用预展开字典绕过期限。

正则内部 VM 步数、原生容器内存估算、联合上限容量、完整 Hunspell 等价、原生 Worker 与跨引擎验收仍待核验。原问题的私有词表和环境没有公开;这不是语法认证。

词典包含UKACD、SCOWL、WordNet、VarCon及Ispell版权声明,完整条件见随附许可证文档。

使用相同来源和设置重新核对

  • 输入或策略改变立即使旧结果失效;不要混用上一轮下载。
  • 原始问题的私有词表未公开,本工具不会推断其完整语料正确性。

参考资料

本分类工具使用说明

展开工具,查看操作步骤、可调选项和支持范围,再直接进入工作区。

原始词表拼写核对按明确的撇号策略核对全部英语原词,保留完整查询轨迹与白名单依据。

为固定 en_US 字典选择三种撇号策略之一。重复词、空白、空词和 JSON 原始词元均保留独立序号与来源位置;精确原词白名单可以覆盖一个词的状态,但不会修改字典。

操作步骤

  1. 选择一份完整 UTF-8 文件或粘贴词表,并为原词与可选白名单分别选择 TXT 行或 JSON 字符串数组。
  2. 选择生效撇号策略;白名单按原词逐字符且区分大小写匹配,空字符串只覆盖精确空词。
  3. 运行后逐页阅读全部 26 列、实际转换与查询轨迹;通过完整文件阅读入口检查原件、设置、字典和全部许可证。
  4. 复制完整报告与文件清单,并保存全部 10 个文件;启用白名单时额外保存白名单原件,共 11 个文件。

可调选项

待核对词来源
本地文件 · 粘贴完整文本
词列表格式
TXT:每行一个词 · JSON:字符串数组
撇号策略
词典策略:包含词典原生弯撇号转换 · 仅在查词副本中将U+2019转换为直撇号 · 保留原撇号;禁用词典输入转换
原词精确白名单
不使用白名单 · 本地文件 · 粘贴完整文本
词列表格式
TXT:每行一个词 · JSON:字符串数组

能力与限制

  • 原词与白名单合计 4 MiB UTF-8;原词最多 100,000 行,白名单独立最多 100,000 项;每词最多 128 个 Unicode 码点。
  • 固定 AFF 与 DIC 合计最多 8 MiB;最多 100,000 次词核对;加载、展开、白名单、查询与序列化共同受 100,000,000 个可观测计费单元约束。
  • 全部 10/11 个文件加独立完整复制文本合计最多 64 MiB;持有的来源、字典、记录、序列化、克隆、Blob 与界面表示共同受 768 MiB 保守预分配约束。
  • 60 秒绝对期限从捕获输入开始,覆盖读取、模块载入、字典初始化、核对、编码、完整校验、清理与首次发布;不使用预展开字典绕过期限。
  • TXT 保留 CRLF、CR、LF 和末尾空行;JSON 仅接受完整字符串数组;不修复非法 UTF-8 或孤立代理项。字符串 "-0" 保持文本,数值 -0 词项被拒绝。
  • 正则内部 VM 步数、原生容器内存估算、联合上限容量、完整 Hunspell 等价、原生 Worker 与跨引擎验收仍待核验。原问题的私有词表和环境没有公开;这不是语法认证。
打开原始词表拼写核对 →