跳转至

08 辅助功能

在本文中,主要介绍一些辅助功能,你可以在下面这里找到这些功能:

光标定位

这个功能的设置主要在于你往下滑动,需要寻找一个具体的内容,可能往下走了几页或者十几页,然后想要回到之前光标在的位置,又得找老半天,这个功能就可以帮助你快速定位到之前的位置。

选中格数

有的时候你选中了表格的一些区域,然后想看下选中了多少个单元格,这个功能就可以帮助你实现。具体效果如图:

辅助面板

快速选取

在面板中,你可以通过点击的方式快速选择文档中的一级标题等段落,目前支持的有:

  • 标题层级类:一级标题,二级标题,三级标题,四级标题,正文
  • 表格图片类:表名,表格,图名,图片

另外还可以选择列表段落,方便你快速根据选中的文本区域设置样式,注意如果你本来就选择了一段文本,那么选取识别的范围也限于你选中的文本区域,不选的话就是在全文匹配符合条件的区域。

快速定位

  • 上表/下表:快速定位到上一张表格或下一张表格
  • 上图/下图:快速定位到上一张图片或下一张图片
  • 上公式/下公式:快速定位到上一个公式或下一个公式

公式转换

在这一小节下,放了四个按钮,从左到右分别是:

  • WD公式:选中文本区域后,此功能可以帮你批量把WD公式转换为 $...$ 包裹的latex代码块
  • 上下及执行按钮:选中上一处代码块,下一处代码块以及从光标开始依次将所有的代码块转换为word公式

如果你需要将mathtype和word内置编辑器的格式进行互转,这里一个关键的点就是用latex公式做桥接,比如我们有word公式区域,首先选中这块区域,点击WD公式按钮,就可以将word公式转换为 $...$ 包裹的latex代码块。

然后我们选中需要转换为mathtype公式的区域,按快捷键 alt+= 就可以快速转换为 mathtype公式,对照效果如下:

如果你需要转换mathtype公式为word公式,选取需要转换的区域,按快捷键 alt+= 就可以快速转换为 latex 格式,然后我们将光标定位到第一个 $...$ 之前,点击 ⟳ 按钮,工具就可以从前往后帮你依次把代码段转换为word公式,如下:

PDF处理

一、PDF转XML

此功能可以帮你快速批量将若干个PDF文件转换为XML的格式,界面设计很简洁,如下图所示:

在顶部设置好输入文件夹和输出文件夹后,根据自己的需要设置一下转换选项,以下是详细解释:

  • 输出结构:决定 XML 的组织方式:详细 / 按行 / 整页纯文本
  • 合并被切碎的文字片段:把 PDF 里被拆开绘制的文字按行拼回完整词组,只在 详细 模式下有效
  • 缩进易读:是否给 XML 加换行和缩进
  • 是否保留子文件夹结构:是否保留子文件夹结构,输出目录是否复刻输入目录的层级
  • 覆盖同名文件:目标 XML 已存在时是覆盖还是跳过

设置好之后点击一键转换就可以在日志区查看转换进度,在输出文件夹中拿到结果了。

二、XML转PDF

此功能可以将XML文件转换为PDF文件,提供了若干种转换方式,界面设计很简洁,如下图所示:

在顶部设置好输入文件夹和输出文件夹后,根据自己的需要设置一下转换选项,以下是详细解释:

  • 排版方式:一共提供五种排版方式,可以根据需要选择
    • 自动识别:数电发票走发票版式,本工具导出且带坐标的走坐标还原,其余走结构树
    • 坐标还原:按原始坐标逐块摆放文字,最接近原PDF
    • 流式文本:按阅读顺序逐行排版,不保留位置
    • XML结构树:按节点层级缩进排版,适合看任意XML
    • 数电发票版式:Elnvoice全电发票XML排成购销方、明细、价税合计的发票样式
  • 结构树带上属性:勾上时每个节点名后面跟着它的属性(写成 属性名=值 的形式),勾掉只输出节点名和节点文本值

其他几个复选框应该都比较好理解,就不展开说明,在列表中可以看到待转换的文件,设置好后点击 一键转换 即可,日志区可以看到处理进度。

三、导出PDF

这个选项卡下,有着比word导出PDF更加强大和丰富的功能,通过界面来介绍一下,主要分为四个界面,分别是 当前文档、批量WORD、混合导出、导出选项,其中批量WORD界面和混合导出界面的区别在于,后者除了word文件外还支持其他格式,例如PPT,Excel等,看一个详细图:

  • 当前文档页:在该页可以设置导出的范围(所有页面、选中区域,当前页面,页码范围),同时可以设置导出的路径和文件名。
  • 批量WORD页和混合导出页:两页的布局基本一致,以混合导出页为例,可以选择一个文件夹,然后点击 导入文件 按钮,就可以加载该文件夹下的所有文件,如果还有子文件夹,可以勾选包含子文件夹。
    • 增加删除:主要区域右侧有 添加文件,移除所选,删除列表 按钮,分别用于添加,移除单个文件和清空整个文件列表。
    • 文件排序:这个主要是为了 合并导出 成一个PDF文件的时候用的,通过 上移,下移,置顶,置底,按时间排序,按文件名排序 等按钮可以很方便地调整文件的顺序。
    • 设置页码:选中单个文件的时候,可以指定该文件导出的页码范围,例如通过 1-3,5 的形式指定该文档第1-3页和第5页,注意是英文逗号,文件的选取可以通过ctrl点选也可以通过shift连选
    • 导出选项:可以每个文件单独导出一份文件,也可以多个文件合并成一个PDF,自行选择
  • 导出选项页:在该页可以设置输出质量,以及一些规范和标准,其中EXCEL文件导出的范围可以指定是 整个工作簿 或 仅活动工作表,如果你的EXCEL文件没有设置打印预览,建议把 缩放为一页宽 选项勾选上,这样可以帮忙将内容控制在单页的A4宽度内,同一个表不会被拆分到多页上

四、提取PDF字段

如果你的PDF中,有表单,有需要批量提取的字段,都可以通过此功能提取出来,组织成一个表格,方便你后续的分析,整体界面效果如下:

可以通过点击左上角的 添加文件或者 添加文件夹 按钮来批量导入PDF文件,PDF文件进来后会根据我们预设的字段先进行一遍解析并罗列到左侧列表里,同时我们可以点击 移除 或者 清空 按钮来删除或清空已导入的文件。

顶部是模板设置区,可以自己另存模板(模板的作用主要是为了方便后续的批量提取,直接选择就行,不用每次都设置),支持将当前界面的设置保存(比如框选区域,字段名称,预设等),可以另存为或者删除不需要的模板。

中间是PDF展示区,可以通过 +/- 按钮缩放比例(也可通过滚轮调节),通过 < 和 > 按钮切换不同页面,通过ctrl+鼠标拖动移动显示位置,同时如果你勾选了 勾选区域 这个复选框,就可以在下方的PDF页面框选字段区域了

当然在那之前,我们首先要设置好字段列表,如下图:

在字段列表设置界面,我们可以添加、删除、移动字段,第一列是是否启用(启用即识别),第二列是字段名称,第三列是提取方式,第四列是候选项,对于后面两个有必要说明一下:

提取方式:

  • 区域取字:如果本地PDF是矢量文件(CAD直接导出的,WORD导出的PDF),从PDF中能读出文字,那么用这个模式
  • 区域交给AI:纯图片的PDF,会转成图片让AI识别,这种情况需要大模型兜底

候选项:如果你清晰知道每个字段都有哪些可能的值,可以在这里填入,如果识别出来不在你的候选项之内,可以通过 选项 页面进行设置,这个后面我们会讲到

设置好字段后,其实就可以直接到PDF里去框选区域了,选中某个字段框选区域后,点击 把框选写入所选规则 即可将当前框选区域的文本写入到该字段中,也可以通过 清除所选规则的区域 删除已设置的区域

如果有些字段没有识别完整,你可以通过 提取结果 页面下方的三个按钮来补充,说明如下:

  • 重提本页 — 纯本机,不联网、不花钱。按「字段规则」页现在的框选和候选项,把这一页从头解析一遍,覆盖右边表格里的所有值。
  • 整页交给AI — 把整页渲染成一张图发给视觉模型,一次把所有字段问出来。关键行为是它只补没识别出来的空格子
  • 框选交给AI — 只把你框的那一小块发过去,认完写进结果表格里当前选中的那一行字段

设置好区域和规则后(可以先存一个模板方便下次用),就可以点击 开始提取 按钮来提取字段了,提取进度会实时显示在左下角的进度条,提取完成后可以通过右下角的 插入到文档,复制表格,导出CSV,导出EXCEL 和 复制为文本清单 这几种不同的方式导出。

最后,在选项页面可以设置一些导出相关的参数,比如第一列是否保留文件名,文件名是否加后缀以及视觉模型的配置

同时在页面上你也可以看到,如果取不到值,有 似然匹配(挑一个最像的)和 保留原值(高亮显示,待你定夺)两种方式,你可以根据自己的需求选择,以上图为例,最后我们提取完成后,点击 插入到文档 按钮,得到的效果如下:

一句话概括流程:设置字段→框选区域→开始提取→导出结果,即可完成PDF字段的提取。