Neatbo.

PDF 提取文字

提取 PDF 中可选中的文字,方便整理。

浏览器本地处理输入有文本层的 PDF输出TXT单个文件最多 30 MiB · 最多 1 个
  1. 1添加输入
  2. 2调整设置
  3. 3获取结果

工具输入和文件在当前浏览器处理,不会上传。

输入内容

切换工具时在当前标签页临时保留输入。刷新或关闭后清除,较大的结果可能需要重新生成。

⌘ / Ctrl + Enter 运行

或将文件拖到这里

文件留在当前设备,原始文件不会被覆盖。

.pdf

单个文件最多 30 MiB · 最多 1 个

    处理选项

    先填写标记为必填的选项,其余可保留默认值。

    正在准备处理工具…

    开始之前

    将 PDF 中可选取的文字保存为 UTF-8 TXT。可按需要选择页码与顺序;没有文字层的扫描页会提示,不执行 OCR。

    如何使用

    1. 选择本地 .pdf 文件,工作副本保留在浏览器中。
    2. 在预览中选页,或按所需顺序输入页码,然后选择“提取文字”。
    3. 查看文字预览和缺少文字的页码,再复制或下载 TXT。

    支持范围与限制

    未加密 PDF 每份最多 30 MiB、300 页;请保留原件。

    操作示例

    示例输入

    three-pages.pdf
    示例参数
    {}

    示例输出

    Independent PDF page 1
    
    Page marker: PAGE-1
    
    Independent PDF page 2
    
    Page marker: PAGE-2
    
    Independent PDF page 3
    
    Page marker: PAGE-3

    出现问题时

    请使用带有可选取文字的未加密 PDF。非法页码范围会被拒绝;如果所选页面全是无文字层扫描件,此工具无法生成 TXT,请另用 OCR。提取后核对复杂排版。

    常见问题

    我的文件会上传吗?

    不会。文件和工具输入在当前浏览器处理;站内切换可在同一标签页暂存工作状态。刷新或关闭标签页后无法恢复,请及时下载需要保留的结果。

    需要检查结果的哪些方面?

    核对词间空格、换行及阅读顺序,特别是多栏和表格。没有可选取文字的页会列出;扫描页需在其他工具做 OCR。

    文档与延伸阅读

    相关工具