检查本地 PDF 链接、批注与阅读笔记
读取实际 PDF 声明和完整英文 Kindle 记录,明确来源、支持范围并提供完整导出。
选择能回答实际任务的结构
点击无反应的 PDF 区域需要实际 Link 声明;审阅报告需要原注释文字与回复关系;设备日志需要完整阅读记录。三者有不同输入和交付,可见网址、页面正文和按行去重不能替代底层结构。
| 工具 | 任务 | 交付 |
|---|---|---|
| T294 | PDF 链接点击无反应 | 页/矩形与完整目标、动作 JSON/CSV |
| T295 | 把审阅意见整理为任务 | 原文、作者、原日期与回复 JSON/CSV/Markdown |
| T296 | 备份设备本地阅读笔记 | 原书题分组与来源到保留记录 JSON/CSV/Markdown |
读取目标,不打开它
T294 扫描真实 Link 注释,按原始名称字节、Limits 与唯一页面引用解析直接页目标、旧 Dests 和完整 Names/Dests 树。URI、GoTo、GoToR、Launch、Named 和串联 Next 都有明确状态;其他动作保留原类型、声明并标为不支持。不会执行、打开或请求动作、URI 或脚本。
已验证三页来源含 11 个 Link、两个命名目标;内部目标解析到第 1–3 页,缺少目标或名称的记录保留状态,JavaScript 仍是不支持的声明。CSV 带引号保存完整结构目标,屏幕上 2000 字符只是预览。
- 写入 URI 不证明安全、网络可达,也不能确定阅读器为何忽略它。
- 没有 Link 注释的文字网址不增加点击链接计数。
- 矩形是原始 PDF 点坐标,不是旋转、裁剪后的屏幕位置。
- 非法 URI 类型、冲突所属、重复原名称、错误名称树排序/Limits 或循环会让整份清单失败。
保留审阅原文与线程含义
T295 导出原始纯文字 Contents、作者、M/CreationDate 原字符串、Rect/QuadPoints 和 IRT 回复关系,不重新解释日期时区。缺少 Contents 用 JSON null 表示;RC 只标记存在,仅富文本的文字明确不支持。Markdown 使用纯文字围栏,原文含 HTML 或反引号也不作为页面执行。
已验证来源有 17 条支持记录、11 个 Link、一个 Widget 和一个 Popup,保留多行回复、仅富文本记录与悬空回复。三种排除角色分别计数,样本实际覆盖全部白名单类型,包括 Redact;导出 Redact 注释不会应用涂黑。
- 支持 Text、FreeText、Highlight、Underline、StrikeOut、Squiggly、Ink、Stamp、Caret、Line、Square、Circle、Polygon、PolyLine、Redact。
- 其他子类型、复用注释身份、重复 NM、冲突 P 所属、非法几何或回复循环导致整份拒绝。
- 缺少或不属于已列注释的回复对象保留悬空状态,不虚构父记录。
- 只读已有纯文字,不重建扁平审阅标记,不 OCR 被高亮句子,不执行富 HTML。
整理整条摘录,不按行拆散
T296 接受已复制的 UTF8 MyClippings.txt,英文 Highlight、Note、Bookmark 元数据。完整块包括原书题、正整数页码/位置范围、原 Added on 文字、正文及独立一行 ==========。该行是保留分隔符。报告 BOM 与 CRLF/LF,正文内部行尾与 Unicode 保持原样。
六条 BOM/CRLF 记录精确去重后保留五条,空 Bookmark 有效;位置 40–45、42–47 的两段摘录都保留。整条相等包括书题、元数据、正文与行尾;同位置但正文、日期或空白不同不会覆盖,所有来源序号映射到保留 ID。按原书题字符串分组,不猜作者拆分。
| 选项 | 含义 |
|---|---|
| location | 每个原书题内按位置起点,否则按页起点,原序号打破相同值 |
| source | 每个原书题内保留来源顺序 |
| deduplicate=true | 保留一条完全相同的来源块及全部原序号 |
| deduplicate=false | 保留每条来源记录,包括完全重复 |
下载完整原文,按错误修复
表格最多 200 条,每格 2000 个 UTF16 字符,本地复制是有界处理摘要。完整下载保留全部 JSON、带引号 CSV 行与纯文字 Markdown 正文。CSV 为公式式文本添加单引号防护,JSON 和 Markdown 保存原文。日期保持源字符串,不猜时区。
生产检查实际使用 500 页、1 万个 Link 与 1 万条审阅记录的 PDF,另有 10 万条摘录日志和精确 10MiB 单条笔记。独立 pypdf/标准库读取器检查全部来源记录、引用、目标、回复、CSV 格与 Markdown 原文。核心真实进度取消后,同输入完整恢复;浏览器交互验收由主控另行维护。
- 每个 PDF:30MiB、500 页、20 万解析对象、深度 64、1 万注释、提取字符串 16MiB、单名称 4096 字节;T294 另有 1 万命名目标、1000 名称树节点。链接的 JSON/CSV 或批注的 JSON/CSV/Markdown 合计 20MiB。 对象/交叉引用流解码合计 80MiB;支持无滤镜/Flate/LZW/ASCII85/ASCIIHex/RunLength,最多四层、仅 Predictor=1(LZW EarlyChange=0/1)。合法 #hex 名称大小写都正确解析,不因此漏记录。
- 摘录:单个 10MiB UTF8 日志、10 万条完整记录,三个完整产物合计 40MiB。输入与输出上限同时成立,重复元数据很多时较短输入仍可能触及产物上限。
- 空日志、没有对应记录的 PDF 有效输出空清单。不支持语言/类型、坏 UTF8、逆序/重复范围或缺分隔线,会带来源位置拒绝日志。
- 失败或取消没有部分成功报告;修正提示结构后重试,原文件不变。
- 不访问设备/账号、不请求网址、不云同步、不回导 Kindle、不恢复缺失日志、不修复源链接、不删除批注。
参考资料
- 真实任务:查看点击无反应的 PDF 链接原目标
2026-10-07 已读原提问正文;写入目标不代表网络可达。
- 真实任务:导出多行 PDF 审阅批注到任务系统
2026-10-07 已读原正文;需要分隔实际评论而不破坏评论内的换行。
- 真实任务:备份本地笔记、高亮与书签
2026-10-07 已读原正文及 MyClippings 本地复制回答;账号同步和回导不属于本工作流。
本分类工具使用说明
展开工具,查看操作步骤、可调选项和支持范围,再直接进入工作区。
PDF 点击链接目标清单读取真实 PDF Link 注释、声明动作和命名目标,导出完整本地 JSON 与 CSV。
检查实际可点击注释,保留缺失、悬空和明确不支持的目标。URI、JavaScript 与启动动作只作为静态文字,不打开、不执行、不请求、不修复。矩形使用原始 PDF 点坐标,不是旋转后的屏幕坐标。
操作步骤
- 选择本地 PDF。
- 查看目标状态与原始页面矩形。
- 下载完整 JSON/CSV,再决定如何调查声明的目标。
能力与限制
- 单个未签名、未加密 PDF,不超过 30MiB、500 页;解析对象 20 万、深度 64、注释及命名目标各 1 万、名称树节点 1000、提取字符串 16MiB、每个 PDF 名称 4096 字节;完整 JSON/CSV 合计 20MiB。 对象/交叉引用流解码合计 80MiB;支持无滤镜/Flate/LZW/ASCII85/ASCIIHex/RunLength,最多四层、仅 Predictor=1(LZW EarlyChange=0/1)。合法 #hex 名称大小写都正确解析,不因此漏记录。
- 按原始字节排序与 Limits 解析直接目标、旧 Dests 和完整 Names/Dests 树。首版声明 URI、GoTo、GoToR、Launch、Named 及 Next;其他动作保留原类型与声明并标记不支持。循环、冲突的页面所属、重复名称、损坏树或非法 URI 类型导致整份失败。
- 页面仅预览前 200 行,每格 2000 个 UTF16 字符;完整下载保留全部目标。写入 URI 不代表网址可达或安全,不统计 Link 注释之外的文字网址。
PDF 审阅批注与回复导出完整导出 PDF 原始审阅文字、作者、原日期、几何位置和回复关系,提供 JSON、CSV 与 Markdown。
只读实际审阅注释,不修改 PDF。保留多行纯文本 Contents、原作者/日期声明与回复关系。缺少 Contents 保留为 null;富文本只标记存在,不执行、不猜测正文。不会对高亮图形或扁平页面文字做 OCR。
操作步骤
- 选择本地审阅 PDF。
- 查看正文、缺失文字标记与回复状态。
- 下载完整 JSON、带引号的 CSV 和纯文字 Markdown,供任务系统整理。
能力与限制
- 单个未签名、未加密 PDF,30MiB、500 页以内;20 万对象、深度 64、1 万注释、提取字符串 16MiB、单个 PDF 名称 4096 字节;JSON/CSV/Markdown 合计 20MiB。 对象/交叉引用流解码合计 80MiB;支持无滤镜/Flate/LZW/ASCII85/ASCIIHex/RunLength,最多四层、仅 Predictor=1(LZW EarlyChange=0/1)。合法 #hex 名称大小写都正确解析,不因此漏记录。
- 支持 Text、FreeText、Highlight、Underline、StrikeOut、Squiggly、Ink、Stamp、Caret、Line、Square、Circle、Polygon、PolyLine、Redact;精确计数排除 Link、Widget、Popup。其他子类型导致整份导出失败。
- Rect/QuadPoints 是原始 PDF 坐标,不是显示坐标。重复身份/名称、冲突的所属页面、非法几何和回复循环导致失败;悬空回复保留并标记。页面预览 200 行、每格 2000 个 UTF16 字符,下载不因此截断。
Kindle 本地摘录本整理按原始书题与明确位置整理完整英文 MyClippings 记录,保留多行笔记和整条重复的来源映射。
选择已从设备复制的 UTF8 MyClippings.txt。解析 Highlight、Note 与 Bookmark 元数据,保留页码/位置范围和原始 Added on 日期文字,不猜时区。按原书题分组,可选移除完全相同的整条记录;重叠或不同摘录始终独立保留。
操作步骤
- 从设备复制自己的 MyClippings.txt 后选择。
- 选择明确范围排序或来源顺序,以及可选整条精确去重。
- 下载完整分组 JSON、CSV 与纯文字 Markdown,保留原日志。
可调选项
- 排序
- 明确位置/页码范围 · 每本书的来源顺序
- 移除整条完全相同的重复记录
- 默认开启
能力与限制
- 单个 UTF8 文件,10MiB、10 万条完整记录以内;JSON/CSV/Markdown 合计 40MiB。仅支持英文元数据,不支持语言/类型、损坏或逆序范围、重复声明、非法 UTF8 或缺少分隔线都会带来源位置整份拒绝。
- 独立一行 ========== 是保留的记录分隔线。报告原 BOM 与 CRLF/LF,保留正文内部行尾和 Unicode。整条精确去重包含原元数据与行尾,保留每条原始记录到保留记录的映射,不猜书题/作者拆分。
- 页面只预览前 200 条、每格 2000 个 UTF16 字符,下载完整内容。CSV 防护公式式文本,JSON/Markdown 保留原文字。不访问设备/账号、不云同步、不回导 Kindle、不恢复缺失日志;空日志和空 Bookmark 正文有效。