我有一个pdf
包含表单字段的文件,需要将数据导出到AUTOMATICALLYxml
文件中.这是我为测试创建的示例表单的屏幕:
注意:通过单击手动使用Acrobat Professional 手动导出它Tools > Form > Export Form Data
,最后选择xml扩展名进行文件输出.这是我手动导出时得到的结果:
John Doe
但是,我需要自动化它,例如使用python脚本,Java实现或一些命令行工具.我可以使用哪些库或工具将表单字段数据导出到xml
?该工具或库应该是开源的,我可以将它集成到我的工作流程中.
我已经尝试过python pdfminer
库,它帮助我导出pdf文件的静态部分(比如Static form header
,First name:
和Last name:
):但是如何导出表单字段数据(在我的情况下是表单字段的内容first_name
和last_name
)?
编辑:随意下载sample.pdf文件在这里.
怎么样的Apache PDFBox的?它是开源的,可以满足您的需求,因为该网站说"从PDF表单中提取表单数据或预填充PDF表单".
编辑:查看PrintFields示例.