把本地审阅与阅读记录整理为可核对清单
保留声明目标、原批注与整条阅读记录,让完整导出可以回查来源。
从已经存在的证据出发
PDF 阅读器可能忽略链接而不展示目标,导师评论可能有多行正文,Kindle 日志可能在重读段落后再次保存摘录。每个任务都需要实际来源结构和明确交付。
| 来源 | 保留 | 不推测 |
|---|---|---|
| PDF Link | 页、原矩形、声明动作与目标状态 | 网络可达或安全 |
| 审阅注释 | 原 Contents、作者、原日期、IRT | 缺失的高亮正文或仅富文本正文 |
| MyClippings | 原书题、范围、原日期、多行正文、序号 | 作者拆分、时区或最新重叠摘录 |
缺少目标仍是有用的一行
保留无目标 Link 或陌生阅读器动作,比只列成功网址更能解释原文件。完整输出说明文件写了什么,Launch 文件名保持静态文字,JavaScript 声明明确不支持。证明声明存在不需要网络查询。
名称树按原始 PDF 字节排序,解码后文字顺序可能不同;库的便捷索引也可能在名称树与旧 Dests 同时存在时遗漏旧目标。完整导出读取两处来源并拒绝矛盾重复,不依赖这个便捷视图。
审阅线程需要原文与缺失状态
保留评论内换行,并按来源身份分隔记录。无法找到父注释的回复保持悬空,只有富文本的注释也不能伪装成看起来为空的成功评论:缺少 Contents 与不支持富文本标记必须跟随记录。
Link、Widget、Popup 有不同角色,单独计数能解释注释总数为什么大于审阅记录数。Redact 在这里是审阅记录,本导出既不应用涂黑,也不证明内容已擦除。
精确重复与重叠摘录含义不同
完全相同的整条日志可以共用保留 ID,同时保留全部来源序号。重叠位置的两段文字可能不同且都有价值,应分别保留,不猜哪个是最新版本。行尾、空白或原日期不同也不能精确合并。
书题是原字符串,括号可能是作者说明,也可能就是标题的一部分;分组排序不虚构拆分。日期同样是原文字,本地整理不必猜时区才能保留它。
- 来源文件顺序有意义时,使用来源排序。
- 按明确数字范围查看每个原书题的记录。
- 移除完全重复时,保留下载的来源映射。
- 保留原文件,整理产物不是 Kindle 回导格式。
核对完整交付
有界表格让 10 万条日志可用,同时不假装预览完整。完整文件保留全部记录与原序号;CSV 防护公式式文字,JSON 与纯文字 Markdown 保留原文。
独立读回实际 500 页/1 万条 PDF,以及另行 10 万条、10MiB 日志向量,检查完整产物。失败或取消没有部分成功导出;修正来源结构重跑,再核对完整文件后分享。
参考资料
- 真实任务:查看点击无反应的 PDF 链接原目标
2026-10-07 已读原提问正文;写入目标不代表网络可达。
- 真实任务:导出多行 PDF 审阅批注到任务系统
2026-10-07 已读原正文;需要分隔实际评论而不破坏评论内的换行。
- 真实任务:备份本地笔记、高亮与书签
2026-10-07 已读原正文及 MyClippings 本地复制回答;账号同步和回导不属于本工作流。
本分类工具使用说明
展开工具,查看操作步骤、可调选项和支持范围,再直接进入工作区。
PDF 点击链接目标清单读取真实 PDF Link 注释、声明动作和命名目标,导出完整本地 JSON 与 CSV。
检查实际可点击注释,保留缺失、悬空和明确不支持的目标。URI、JavaScript 与启动动作只作为静态文字,不打开、不执行、不请求、不修复。矩形使用原始 PDF 点坐标,不是旋转后的屏幕坐标。
操作步骤
- 选择本地 PDF。
- 查看目标状态与原始页面矩形。
- 下载完整 JSON/CSV,再决定如何调查声明的目标。
能力与限制
- 单个未签名、未加密 PDF,不超过 30MiB、500 页;解析对象 20 万、深度 64、注释及命名目标各 1 万、名称树节点 1000、提取字符串 16MiB、每个 PDF 名称 4096 字节;完整 JSON/CSV 合计 20MiB。 对象/交叉引用流解码合计 80MiB;支持无滤镜/Flate/LZW/ASCII85/ASCIIHex/RunLength,最多四层、仅 Predictor=1(LZW EarlyChange=0/1)。合法 #hex 名称大小写都正确解析,不因此漏记录。
- 按原始字节排序与 Limits 解析直接目标、旧 Dests 和完整 Names/Dests 树。首版声明 URI、GoTo、GoToR、Launch、Named 及 Next;其他动作保留原类型与声明并标记不支持。循环、冲突的页面所属、重复名称、损坏树或非法 URI 类型导致整份失败。
- 页面仅预览前 200 行,每格 2000 个 UTF16 字符;完整下载保留全部目标。写入 URI 不代表网址可达或安全,不统计 Link 注释之外的文字网址。
PDF 审阅批注与回复导出完整导出 PDF 原始审阅文字、作者、原日期、几何位置和回复关系,提供 JSON、CSV 与 Markdown。
只读实际审阅注释,不修改 PDF。保留多行纯文本 Contents、原作者/日期声明与回复关系。缺少 Contents 保留为 null;富文本只标记存在,不执行、不猜测正文。不会对高亮图形或扁平页面文字做 OCR。
操作步骤
- 选择本地审阅 PDF。
- 查看正文、缺失文字标记与回复状态。
- 下载完整 JSON、带引号的 CSV 和纯文字 Markdown,供任务系统整理。
能力与限制
- 单个未签名、未加密 PDF,30MiB、500 页以内;20 万对象、深度 64、1 万注释、提取字符串 16MiB、单个 PDF 名称 4096 字节;JSON/CSV/Markdown 合计 20MiB。 对象/交叉引用流解码合计 80MiB;支持无滤镜/Flate/LZW/ASCII85/ASCIIHex/RunLength,最多四层、仅 Predictor=1(LZW EarlyChange=0/1)。合法 #hex 名称大小写都正确解析,不因此漏记录。
- 支持 Text、FreeText、Highlight、Underline、StrikeOut、Squiggly、Ink、Stamp、Caret、Line、Square、Circle、Polygon、PolyLine、Redact;精确计数排除 Link、Widget、Popup。其他子类型导致整份导出失败。
- Rect/QuadPoints 是原始 PDF 坐标,不是显示坐标。重复身份/名称、冲突的所属页面、非法几何和回复循环导致失败;悬空回复保留并标记。页面预览 200 行、每格 2000 个 UTF16 字符,下载不因此截断。
Kindle 本地摘录本整理按原始书题与明确位置整理完整英文 MyClippings 记录,保留多行笔记和整条重复的来源映射。
选择已从设备复制的 UTF8 MyClippings.txt。解析 Highlight、Note 与 Bookmark 元数据,保留页码/位置范围和原始 Added on 日期文字,不猜时区。按原书题分组,可选移除完全相同的整条记录;重叠或不同摘录始终独立保留。
操作步骤
- 从设备复制自己的 MyClippings.txt 后选择。
- 选择明确范围排序或来源顺序,以及可选整条精确去重。
- 下载完整分组 JSON、CSV 与纯文字 Markdown,保留原日志。
可调选项
- 排序
- 明确位置/页码范围 · 每本书的来源顺序
- 移除整条完全相同的重复记录
- 默认开启
能力与限制
- 单个 UTF8 文件,10MiB、10 万条完整记录以内;JSON/CSV/Markdown 合计 40MiB。仅支持英文元数据,不支持语言/类型、损坏或逆序范围、重复声明、非法 UTF8 或缺少分隔线都会带来源位置整份拒绝。
- 独立一行 ========== 是保留的记录分隔线。报告原 BOM 与 CRLF/LF,保留正文内部行尾和 Unicode。整条精确去重包含原元数据与行尾,保留每条原始记录到保留记录的映射,不猜书题/作者拆分。
- 页面只预览前 200 条、每格 2000 个 UTF16 字符,下载完整内容。CSV 防护公式式文本,JSON/Markdown 保留原文字。不访问设备/账号、不云同步、不回导 Kindle、不恢复缺失日志;空日志和空 Bookmark 正文有效。