PDF 审阅批注与回复导出
完整导出 PDF 原始审阅文字、作者、原日期、几何位置和回复关系,提供 JSON、CSV 与 Markdown。
- 1添加输入
- 2确认后运行
- 3获取结果
工具输入和文件在当前浏览器处理,不会上传。
开始之前
只读实际审阅注释,不修改 PDF。保留多行纯文本 Contents、原作者/日期声明与回复关系。缺少 Contents 保留为 null;富文本只标记存在,不执行、不猜测正文。不会对高亮图形或扁平页面文字做 OCR。
如何使用
- 选择本地审阅 PDF。
- 查看正文、缺失文字标记与回复状态。
- 下载完整 JSON、带引号的 CSV 和纯文字 Markdown,供任务系统整理。
支持范围与限制
单个未签名、未加密 PDF,30MiB、500 页以内;20 万对象、深度 64、1 万注释、提取字符串 16MiB、单个 PDF 名称 4096 字节;JSON/CSV/Markdown 合计 20MiB。 对象/交叉引用流解码合计 80MiB;支持无滤镜/Flate/LZW/ASCII85/ASCIIHex/RunLength,最多四层、仅 Predictor=1(LZW EarlyChange=0/1)。合法 #hex 名称大小写都正确解析,不因此漏记录。
支持 Text、FreeText、Highlight、Underline、StrikeOut、Squiggly、Ink、Stamp、Caret、Line、Square、Circle、Polygon、PolyLine、Redact;精确计数排除 Link、Widget、Popup。其他子类型导致整份导出失败。
Rect/QuadPoints 是原始 PDF 坐标,不是显示坐标。重复身份/名称、冲突的所属页面、非法几何和回复循环导致失败;悬空回复保留并标记。页面预览 200 行、每格 2000 个 UTF16 字符,下载不因此截断。
操作示例
示例输入
三页文件含 17 条支持的审阅记录、11 个 Link、一个 Widget、一个 Popup,含多行回复和悬空回复。
示例参数
{}示例输出
17 条完整审阅记录,一个仅富文本的不支持记录、一个悬空回复;排除角色分别为 11/1/1。
出现问题时
在完整 PDF 编辑器修正不支持子类型、冲突名称/所属或回复循环,再重试整个文件。失败/取消不产生部分导出,保留原审阅 PDF。
常见问题
没有 Contents 的高亮能提取被标记句子吗?
不能。它仍是缺少纯文字的记录。只有 RC 富文本会标记为不支持的文字,扁平注释与页面图形也不恢复。