按明确撇号策略核对原始词表
准备完整 TXT 或 JSON 词表,选择生效策略,逐行审阅并保留整套导出文件。
先确认原件格式
TXT 的每行都是一个独立词项,末尾换行会留下空词。JSON 必须只有一个顶层字符串数组;保留重复词、空词、空白与原始转义词元。数值或布尔值不会被转成词。第一处 UTF-8 BOM 作为签名保留在原件,不计入第一原词。
["hello","aren’t","aren't"," hello ","zzz21stzzz","-0","","hello"]- 选择一份完整 UTF-8 文件或粘贴词表,并为原词与可选白名单分别选择 TXT 行或 JSON 字符串数组。
- 选择生效撇号策略;白名单按原词逐字符且区分大小写匹配,空字符串只覆盖精确空词。
选择可复现的策略
“原生字典”可能转换弯撇号,所以不是原词字面相等。“保留原撇号”也不会关闭 trim 或大小写。设置文件记录全部三种定义和当前策略,不能只凭正确/错误列推断发生了什么。
| 策略 | 实际查询 |
|---|---|
| native-dictionary-policy | 原生 trim、ICONV、大小写、词缀与复合规则 |
| tool-curly-policy | 仅先把 U+2019 转成 U+0027,再运行原生规则 |
| original-apostrophe-policy | 关闭本次 ICONV;仍使用原生 trim、大小写、词缀与复合规则 |
逐行审阅,再保存整套结果
完整表格包含 26 列;序号、来源位置和 rawToken 能区别重复词。转换与每次实际候选尝试来自同一次 correct 查询;白名单行则不进行字典查询,null 与 false 的含义不同。页面样例完整结果与独立读回已核对,界面和原生 Worker 操作尚待验收。
| 文件 | 用途 |
|---|---|
| spelling-results.csv / spelling-report.json | 完整行、轨迹与预算快照 |
| words-original.* / whitelist-original.* | 字节原件,白名单原件仅启用时存在 |
| dictionary-en-US.aff / .dic / whitelist-active.json | 实际字典和全部白名单分组 |
| spelling-settings.json / *LICENSE.txt | 固定参数、源哈希和三份完整许可证 |
上限、署名与失败恢复
原词与白名单合计 4 MiB UTF-8;原词最多 100,000 行,白名单独立最多 100,000 项;每词最多 128 个 Unicode 码点。
固定 AFF 与 DIC 合计最多 8 MiB;最多 100,000 次词核对;加载、展开、白名单、查询与序列化共同受 100,000,000 个可观测计费单元约束。
全部 10/11 个文件加独立完整复制文本合计最多 64 MiB;持有的来源、字典、记录、序列化、克隆、Blob 与界面表示共同受 768 MiB 保守预分配约束。
60 秒绝对期限从捕获输入开始,覆盖读取、模块载入、字典初始化、核对、编码、完整校验、清理与首次发布;不使用预展开字典绕过期限。
正则内部 VM 步数、原生容器内存估算、联合上限容量、完整 Hunspell 等价、原生 Worker 与跨引擎验收仍待核验。原问题的私有词表和环境没有公开;这不是语法认证。
词典包含UKACD、SCOWL、WordNet、VarCon及Ispell版权声明,完整条件见随附许可证文档。
使用相同来源和设置重新核对
- 输入或策略改变立即使旧结果失效;不要混用上一轮下载。
- 原始问题的私有词表未公开,本工具不会推断其完整语料正确性。
参考资料
- nspell 2.1.5 source
固定原始成熟字典核对分支;本工具标记预算观察与整词锚定改动。
- dictionary-en source and full licenses
固定 dictionary-en 4.0.0;导出保留完整上游许可与署名,链接当前分支不代替固定版本。
本分类工具使用说明
展开工具,查看操作步骤、可调选项和支持范围,再直接进入工作区。
原始词表拼写核对按明确的撇号策略核对全部英语原词,保留完整查询轨迹与白名单依据。
为固定 en_US 字典选择三种撇号策略之一。重复词、空白、空词和 JSON 原始词元均保留独立序号与来源位置;精确原词白名单可以覆盖一个词的状态,但不会修改字典。
操作步骤
- 选择一份完整 UTF-8 文件或粘贴词表,并为原词与可选白名单分别选择 TXT 行或 JSON 字符串数组。
- 选择生效撇号策略;白名单按原词逐字符且区分大小写匹配,空字符串只覆盖精确空词。
- 运行后逐页阅读全部 26 列、实际转换与查询轨迹;通过完整文件阅读入口检查原件、设置、字典和全部许可证。
- 复制完整报告与文件清单,并保存全部 10 个文件;启用白名单时额外保存白名单原件,共 11 个文件。
可调选项
- 待核对词来源
- 本地文件 · 粘贴完整文本
- 词列表格式
- TXT:每行一个词 · JSON:字符串数组
- 撇号策略
- 词典策略:包含词典原生弯撇号转换 · 仅在查词副本中将U+2019转换为直撇号 · 保留原撇号;禁用词典输入转换
- 原词精确白名单
- 不使用白名单 · 本地文件 · 粘贴完整文本
- 词列表格式
- TXT:每行一个词 · JSON:字符串数组
能力与限制
- 原词与白名单合计 4 MiB UTF-8;原词最多 100,000 行,白名单独立最多 100,000 项;每词最多 128 个 Unicode 码点。
- 固定 AFF 与 DIC 合计最多 8 MiB;最多 100,000 次词核对;加载、展开、白名单、查询与序列化共同受 100,000,000 个可观测计费单元约束。
- 全部 10/11 个文件加独立完整复制文本合计最多 64 MiB;持有的来源、字典、记录、序列化、克隆、Blob 与界面表示共同受 768 MiB 保守预分配约束。
- 60 秒绝对期限从捕获输入开始,覆盖读取、模块载入、字典初始化、核对、编码、完整校验、清理与首次发布;不使用预展开字典绕过期限。
- TXT 保留 CRLF、CR、LF 和末尾空行;JSON 仅接受完整字符串数组;不修复非法 UTF-8 或孤立代理项。字符串 "-0" 保持文本,数值 -0 词项被拒绝。
- 正则内部 VM 步数、原生容器内存估算、联合上限容量、完整 Hunspell 等价、原生 Worker 与跨引擎验收仍待核验。原问题的私有词表和环境没有公开;这不是语法认证。