Neatbo.

检查本地 PDF 链接、批注与阅读笔记

读取实际 PDF 声明和完整英文 Kindle 记录,明确来源、支持范围并提供完整导出。

选择能回答实际任务的结构

点击无反应的 PDF 区域需要实际 Link 声明;审阅报告需要原注释文字与回复关系;设备日志需要完整阅读记录。三者有不同输入和交付,可见网址、页面正文和按行去重不能替代底层结构。

实际输入与完整输出
工具任务交付
T294PDF 链接点击无反应页/矩形与完整目标、动作 JSON/CSV
T295把审阅意见整理为任务原文、作者、原日期与回复 JSON/CSV/Markdown
T296备份设备本地阅读笔记原书题分组与来源到保留记录 JSON/CSV/Markdown

读取目标,不打开它

T294 扫描真实 Link 注释,按原始名称字节、Limits 与唯一页面引用解析直接页目标、旧 Dests 和完整 Names/Dests 树。URI、GoTo、GoToR、Launch、Named 和串联 Next 都有明确状态;其他动作保留原类型、声明并标为不支持。不会执行、打开或请求动作、URI 或脚本。

已验证三页来源含 11 个 Link、两个命名目标;内部目标解析到第 1–3 页,缺少目标或名称的记录保留状态,JavaScript 仍是不支持的声明。CSV 带引号保存完整结构目标,屏幕上 2000 字符只是预览。

  • 写入 URI 不证明安全、网络可达,也不能确定阅读器为何忽略它。
  • 没有 Link 注释的文字网址不增加点击链接计数。
  • 矩形是原始 PDF 点坐标,不是旋转、裁剪后的屏幕位置。
  • 非法 URI 类型、冲突所属、重复原名称、错误名称树排序/Limits 或循环会让整份清单失败。

保留审阅原文与线程含义

T295 导出原始纯文字 Contents、作者、M/CreationDate 原字符串、Rect/QuadPoints 和 IRT 回复关系,不重新解释日期时区。缺少 Contents 用 JSON null 表示;RC 只标记存在,仅富文本的文字明确不支持。Markdown 使用纯文字围栏,原文含 HTML 或反引号也不作为页面执行。

已验证来源有 17 条支持记录、11 个 Link、一个 Widget 和一个 Popup,保留多行回复、仅富文本记录与悬空回复。三种排除角色分别计数,样本实际覆盖全部白名单类型,包括 Redact;导出 Redact 注释不会应用涂黑。

  • 支持 Text、FreeText、Highlight、Underline、StrikeOut、Squiggly、Ink、Stamp、Caret、Line、Square、Circle、Polygon、PolyLine、Redact。
  • 其他子类型、复用注释身份、重复 NM、冲突 P 所属、非法几何或回复循环导致整份拒绝。
  • 缺少或不属于已列注释的回复对象保留悬空状态,不虚构父记录。
  • 只读已有纯文字,不重建扁平审阅标记,不 OCR 被高亮句子,不执行富 HTML。

整理整条摘录,不按行拆散

T296 接受已复制的 UTF8 MyClippings.txt,英文 Highlight、Note、Bookmark 元数据。完整块包括原书题、正整数页码/位置范围、原 Added on 文字、正文及独立一行 ==========。该行是保留分隔符。报告 BOM 与 CRLF/LF,正文内部行尾与 Unicode 保持原样。

六条 BOM/CRLF 记录精确去重后保留五条,空 Bookmark 有效;位置 40–45、42–47 的两段摘录都保留。整条相等包括书题、元数据、正文与行尾;同位置但正文、日期或空白不同不会覆盖,所有来源序号映射到保留 ID。按原书题字符串分组,不猜作者拆分。

两种明确排序
选项含义
location每个原书题内按位置起点,否则按页起点,原序号打破相同值
source每个原书题内保留来源顺序
deduplicate=true保留一条完全相同的来源块及全部原序号
deduplicate=false保留每条来源记录,包括完全重复

下载完整原文,按错误修复

表格最多 200 条,每格 2000 个 UTF16 字符,本地复制是有界处理摘要。完整下载保留全部 JSON、带引号 CSV 行与纯文字 Markdown 正文。CSV 为公式式文本添加单引号防护,JSON 和 Markdown 保存原文。日期保持源字符串,不猜时区。

生产检查实际使用 500 页、1 万个 Link 与 1 万条审阅记录的 PDF,另有 10 万条摘录日志和精确 10MiB 单条笔记。独立 pypdf/标准库读取器检查全部来源记录、引用、目标、回复、CSV 格与 Markdown 原文。核心真实进度取消后,同输入完整恢复;浏览器交互验收由主控另行维护。

  • 每个 PDF:30MiB、500 页、20 万解析对象、深度 64、1 万注释、提取字符串 16MiB、单名称 4096 字节;T294 另有 1 万命名目标、1000 名称树节点。链接的 JSON/CSV 或批注的 JSON/CSV/Markdown 合计 20MiB。 对象/交叉引用流解码合计 80MiB;支持无滤镜/Flate/LZW/ASCII85/ASCIIHex/RunLength,最多四层、仅 Predictor=1(LZW EarlyChange=0/1)。合法 #hex 名称大小写都正确解析,不因此漏记录。
  • 摘录:单个 10MiB UTF8 日志、10 万条完整记录,三个完整产物合计 40MiB。输入与输出上限同时成立,重复元数据很多时较短输入仍可能触及产物上限。
  • 空日志、没有对应记录的 PDF 有效输出空清单。不支持语言/类型、坏 UTF8、逆序/重复范围或缺分隔线,会带来源位置拒绝日志。
  • 失败或取消没有部分成功报告;修正提示结构后重试,原文件不变。
  • 不访问设备/账号、不请求网址、不云同步、不回导 Kindle、不恢复缺失日志、不修复源链接、不删除批注。

参考资料

本分类工具使用说明

展开工具,查看操作步骤、可调选项和支持范围,再直接进入工作区。

PDF 点击链接目标清单读取真实 PDF Link 注释、声明动作和命名目标,导出完整本地 JSON 与 CSV。

检查实际可点击注释,保留缺失、悬空和明确不支持的目标。URI、JavaScript 与启动动作只作为静态文字,不打开、不执行、不请求、不修复。矩形使用原始 PDF 点坐标,不是旋转后的屏幕坐标。

操作步骤

  1. 选择本地 PDF。
  2. 查看目标状态与原始页面矩形。
  3. 下载完整 JSON/CSV,再决定如何调查声明的目标。

能力与限制

  • 单个未签名、未加密 PDF,不超过 30MiB、500 页;解析对象 20 万、深度 64、注释及命名目标各 1 万、名称树节点 1000、提取字符串 16MiB、每个 PDF 名称 4096 字节;完整 JSON/CSV 合计 20MiB。 对象/交叉引用流解码合计 80MiB;支持无滤镜/Flate/LZW/ASCII85/ASCIIHex/RunLength,最多四层、仅 Predictor=1(LZW EarlyChange=0/1)。合法 #hex 名称大小写都正确解析,不因此漏记录。
  • 按原始字节排序与 Limits 解析直接目标、旧 Dests 和完整 Names/Dests 树。首版声明 URI、GoTo、GoToR、Launch、Named 及 Next;其他动作保留原类型与声明并标记不支持。循环、冲突的页面所属、重复名称、损坏树或非法 URI 类型导致整份失败。
  • 页面仅预览前 200 行,每格 2000 个 UTF16 字符;完整下载保留全部目标。写入 URI 不代表网址可达或安全,不统计 Link 注释之外的文字网址。
打开PDF 点击链接目标清单 →
PDF 审阅批注与回复导出完整导出 PDF 原始审阅文字、作者、原日期、几何位置和回复关系,提供 JSON、CSV 与 Markdown。

只读实际审阅注释,不修改 PDF。保留多行纯文本 Contents、原作者/日期声明与回复关系。缺少 Contents 保留为 null;富文本只标记存在,不执行、不猜测正文。不会对高亮图形或扁平页面文字做 OCR。

操作步骤

  1. 选择本地审阅 PDF。
  2. 查看正文、缺失文字标记与回复状态。
  3. 下载完整 JSON、带引号的 CSV 和纯文字 Markdown,供任务系统整理。

能力与限制

  • 单个未签名、未加密 PDF,30MiB、500 页以内;20 万对象、深度 64、1 万注释、提取字符串 16MiB、单个 PDF 名称 4096 字节;JSON/CSV/Markdown 合计 20MiB。 对象/交叉引用流解码合计 80MiB;支持无滤镜/Flate/LZW/ASCII85/ASCIIHex/RunLength,最多四层、仅 Predictor=1(LZW EarlyChange=0/1)。合法 #hex 名称大小写都正确解析,不因此漏记录。
  • 支持 Text、FreeText、Highlight、Underline、StrikeOut、Squiggly、Ink、Stamp、Caret、Line、Square、Circle、Polygon、PolyLine、Redact;精确计数排除 Link、Widget、Popup。其他子类型导致整份导出失败。
  • Rect/QuadPoints 是原始 PDF 坐标,不是显示坐标。重复身份/名称、冲突的所属页面、非法几何和回复循环导致失败;悬空回复保留并标记。页面预览 200 行、每格 2000 个 UTF16 字符,下载不因此截断。
打开PDF 审阅批注与回复导出 →
Kindle 本地摘录本整理按原始书题与明确位置整理完整英文 MyClippings 记录,保留多行笔记和整条重复的来源映射。

选择已从设备复制的 UTF8 MyClippings.txt。解析 Highlight、Note 与 Bookmark 元数据,保留页码/位置范围和原始 Added on 日期文字,不猜时区。按原书题分组,可选移除完全相同的整条记录;重叠或不同摘录始终独立保留。

操作步骤

  1. 从设备复制自己的 MyClippings.txt 后选择。
  2. 选择明确范围排序或来源顺序,以及可选整条精确去重。
  3. 下载完整分组 JSON、CSV 与纯文字 Markdown,保留原日志。

可调选项

排序
明确位置/页码范围 · 每本书的来源顺序
移除整条完全相同的重复记录
默认开启

能力与限制

  • 单个 UTF8 文件,10MiB、10 万条完整记录以内;JSON/CSV/Markdown 合计 40MiB。仅支持英文元数据,不支持语言/类型、损坏或逆序范围、重复声明、非法 UTF8 或缺少分隔线都会带来源位置整份拒绝。
  • 独立一行 ========== 是保留的记录分隔线。报告原 BOM 与 CRLF/LF,保留正文内部行尾和 Unicode。整条精确去重包含原元数据与行尾,保留每条原始记录到保留记录的映射,不猜书题/作者拆分。
  • 页面只预览前 200 条、每格 2000 个 UTF16 字符,下载完整内容。CSV 防护公式式文本,JSON/Markdown 保留原文字。不访问设备/账号、不云同步、不回导 Kindle、不恢复缺失日志;空日志和空 Bookmark 正文有效。
打开Kindle 本地摘录本整理 →

本文相关工具

PDF 点击链接目标清单 →读取真实 PDF Link 注释、声明动作和命名目标,导出完整本地 JSON 与 CSV。PDF 审阅批注与回复导出 →完整导出 PDF 原始审阅文字、作者、原日期、几何位置和回复关系,提供 JSON、CSV 与 Markdown。Kindle 本地摘录本整理 →按原始书题与明确位置整理完整英文 MyClippings 记录,保留多行笔记和整条重复的来源映射。