提取 PDF 内嵌附件
从 PDF 附件结构恢复内嵌文件,下载原始解码内容并取得文件名映射。
浏览器本地处理输入PDF输出附件 / ZIP / 报告单个文件最多 30 MiB · 最多 1 个
- 1添加输入
- 2确认后运行
- 3获取结果
工具输入和文件在当前浏览器处理,不会上传。
开始之前
恢复保存在 PDF 内的发票 XML、文档或其他附件。列表记录原始名称、安全下载名称、大小与位置;可在本地逐件下载或取得 ZIP。
如何使用
- 上传 PDF,提取标准结构中的内嵌文件附件。
- 查看原始名称与下载名称的映射、解码大小和附件位置;外部引用只列出,不下载目标。
- 逐件下载或取得 ZIP,并用自己的应用检查实际文件格式。若 PDF 没有支持的附件条目,则得到空报告。
支持范围与限制
单份未加密 PDF,最多 30 MiB、300 页;最多 100 个文件规格,单个解码附件最多 10 MiB,总计 30 MiB。支持标准 EmbeddedFiles NameTree 和页面 FileAttachment 标注中的 Filespec EF 内嵌流。
仅支持无过滤器或单个 FlateDecode,且不含 DecodeParms。外部文件引用只报告,不抓取。提取的是文件附件而非页面图片;不会打开或执行附件。危险名称和重名会修正,并提供明确映射。
操作示例
示例输入
PDF 包含 52 字节 UTF-8 发票 XML、空文本附件、5 字节二进制附件及一个外部文件引用。
示例参数
{}示例输出
三个附件共 57 字节,另有 ZIP 和名称/位置 JSON 映射;外部文件不被抓取。
出现问题时
使用包含标准内嵌附件的未加密 PDF。不支持编码、预测器、损坏附件树或超出解码容量会拒绝处理;报告为空时,确认 PDF 真正内嵌了文件,而非仅链接到外部文件。
常见问题
可以恢复 PDF 发票内的 XML 吗?
可以,前提是 XML 以标准内嵌文件结构和受支持流编码保存;提取字节就是 PDF 内保存的解码内容。
为什么下载文件名不同?
目录路径、危险字符、保留文件名和重名会修正为适合本地下载的名称;JSON 报告保留原始名称并列出准确输出名。
会下载外部附件或运行脚本吗?
不会。外部引用只作为报告条目;内嵌文件直接供下载,不打开或执行。页面图片不属于本工具任务。