PDF 书签、审阅标注与附件:交付操作指南
检查并替换页面书签,清理受支持的审阅标注,或提取内嵌文件。重新打开下载结果,分别核对文档的各个层。
选择需要处理的文档层
书签指向页面,标注承载审阅标记,内嵌附件保存其他文件。提取页面或导出正文不能代替这些任务。
| 任务 | 输入 | 需要检查的结果 |
|---|---|---|
| 创建导航 | PDF 与标题/页码 JSON | PDF 书签树与书签报告 |
| 清理审阅标记 | 带标注的 PDF | PDF 与逐页标注数量 |
| 恢复内嵌文件 | 带附件的 PDF | 原始解码内容、ZIP 与文件名映射 |
写入可逐项核对的导航
先检查现有书签和页数。替换模式接收包含 title 与从 1 开始 page 的扁平 JSON 数组。下面的样例在三页文档中指向开头和最后一页。替换会移除整个活动旧书签树,包括嵌套项目。
下载 PDF,在阅读器的书签面板中逐项点击。检查模式会标出无法解析的命名或外部目标;写入只支持直接页面目标。检测到签名或 XFA 的文件不能编辑。
[{"title":"开头","page":1},{"title":"附录","page":3}]先检查,再清理审阅标记
检查模式先统计受支持的审阅类型及关联弹出标注,不修改文档。清理模式移除这些活动标注,保留超链接、表单控件与页面正文。Redact 标注保留;清理评论不执行涂黑脱敏。
对照原件检查逐页报告,再重新打开结果,确认预期批注消失且链接、字段值与正文仍可使用。旧对象可能仍存在于文件中,因此这项操作不能证明敏感数据已经移除。
恢复附件的实际字节
选择包含标准内嵌文件名称树或 FileAttachment 标注的 PDF。工作台在限额内解码未过滤或单一 FlateDecode 数据流,不下载外部文件引用。
通过 JSON 映射关联原始文件名与安全下载名,再打开单个文件或 ZIP。不同原始名称可能需要不同安全名称。不支持的过滤方式使整次运行报错,避免交付看似完整的部分提取。
完成交付前的核对
- 保留输入 PDF,编辑后核对页数。
- 在 PDF 阅读器中点击每个新书签。
- 清理审阅标记后检查保留的链接与表单值。
- 对照 ZIP 核对附件数量、字节数与文件名映射。
- 签名、加密或不支持的文档使用适合的处理器,并保留原始字节。
参考资料
- PDF Association — ISO 32000
PDF 核心格式参考;工具正文说明本站实际支持的本地处理子集。
本分类工具使用说明
展开工具,查看操作步骤、可调选项和支持范围,再直接进入工作区。
PDF 书签工作台检查 PDF 书签,用标题与页码替换书签,或清空活动书签树。
建立随 PDF 文件分发的命名导航。先检查已有书签,再用标题与从 1 开始的页码组成 JSON 列表,明确替换整棵书签树。
操作步骤
- 上传 PDF,先检查现有书签的标题与页目标。
- 选择“替换书签”,输入 JSON 数组,例如 [{"title":"开始","page":1}];每个页目标都从 1 开始计数。
- 下载 PDF 后用阅读器重新打开书签,核对标题与跳转页。若只需去掉导航,选择“清空书签”。
可调选项
- 书签任务
- 检查书签 · 替换书签 · 清空书签
检查不修改 PDF;替换使用 JSON 列表;清空移除整棵活动书签树。
能力与限制
- 单份未加密 PDF,最多 30 MiB、300 页。替换模式接受 1–1,000 个扁平书签;标题支持 Unicode,最多 200 个字符。页码必须是文档范围内的整数。
- 写入仅支持直接页目标。替换会覆盖已有嵌套书签;检查时会标明无法解析的命名或外部目标。编辑会拒绝检测到的数字签名与 XFA。清空仅移除活动导航,不承诺取证意义的旧对象删除。
清除 PDF 审阅标注移除受支持的审阅批注与标记,同时保留超链接、表单控件和页面正文。
分享清洁阅读副本之前,先检查审阅标注层。移除遵循明确的审阅类型白名单,关联弹出批注跟随父标注删除,超链接与表单控件保留。
操作步骤
- 上传 PDF 并选择“检查标注”,查看每页将移除和保留的条目数。
- 核对超链接、表单字段和其他标注类型将被保留后,选择“移除审阅标注”。
- 下载清洁 PDF 并重新打开,核对链接、表单值和页面外观;若仍需审阅历史,请保留原件。
可调选项
- 标注任务
- 检查标注 · 移除审阅标注
检查列出移除与保留类型;移除仅处理明确支持的审阅类型和关联弹出批注。
能力与限制
- 单份未加密 PDF,最多 30 MiB、300 页、20,000 个标注条目。支持 Text、FreeText、Line、Square、Circle、Polygon、PolyLine、Highlight、Underline、Squiggly、StrikeOut、Stamp、Caret、Ink;关联 Popup 跟随被移除的父标注。
- 保留 Link、Widget、Redact 和其他未支持类型。已写入页面正文的涂画不变。只移除活动标注,不提供取证意义的数据删除或安全遮盖。移除会拒绝检测到的数字签名与 XFA。
提取 PDF 内嵌附件从 PDF 附件结构恢复内嵌文件,下载原始解码内容并取得文件名映射。
恢复保存在 PDF 内的发票 XML、文档或其他附件。列表记录原始名称、安全下载名称、大小与位置;可在本地逐件下载或取得 ZIP。
操作步骤
- 上传 PDF,提取标准结构中的内嵌文件附件。
- 查看原始名称与下载名称的映射、解码大小和附件位置;外部引用只列出,不下载目标。
- 逐件下载或取得 ZIP,并用自己的应用检查实际文件格式。若 PDF 没有支持的附件条目,则得到空报告。
能力与限制
- 单份未加密 PDF,最多 30 MiB、300 页;最多 100 个文件规格,单个解码附件最多 10 MiB,总计 30 MiB。支持标准 EmbeddedFiles NameTree 和页面 FileAttachment 标注中的 Filespec EF 内嵌流。
- 仅支持无过滤器或单个 FlateDecode,且不含 DecodeParms。外部文件引用只报告,不抓取。提取的是文件附件而非页面图片;不会打开或执行附件。危险名称和重名会修正,并提供明确映射。