热门标签 | HotTags
当前位置:  开发笔记 > 运维 > 正文

Windows下Java调用OCR进行图片识别

这篇文章主要为大家详细介绍了Windows下Java调用OCR进行图片识别,通过Tesseract-OCR对图片进行识别,具有一定的参考价值,感兴趣的小伙伴们可以参考一下

使用Java语言,通过Tesseract-OCR对图片进行识别。

1.Tesseract-OCR

下载windows版本并安装。

2.程序如下:

a.ImageIOHelper类

package OCR;
 
import java.awt.image.BufferedImage;
import java.io.File;
import java.io.IOException;
import java.util.Iterator;
import java.util.Locale;
 
import javax.imageio.IIOImage;
import javax.imageio.ImageIO;
import javax.imageio.ImageReader;
import javax.imageio.ImageWriteParam;
import javax.imageio.ImageWriter;
import javax.imageio.metadata.IIOMetadata;
import javax.imageio.stream.ImageInputStream;
import javax.imageio.stream.ImageOutputStream;
 
import com.sun.media.imageio.plugins.tiff.TIFFImageWriteParam;
 
public class ImageIOHelper {
 /**
 * 图片文件转换为tif格式
 * @param imageFile 文件路径
 * @param imageFormat 文件扩展名
 * @return
 */
 public static File createImage(File imageFile, String imageFormat) {
 File tempFile = null;
 try {
  Iterator readers = ImageIO.getImageReadersByFormatName(imageFormat);
  ImageReader reader = readers.next();
 
  ImageInputStream iis = ImageIO.createImageInputStream(imageFile);
  reader.setInput(iis);
  //Read the stream metadata
  IIOMetadata streamMetadata = reader.getStreamMetadata();
  
  //Set up the writeParam
  TIFFImageWriteParam tiffWriteParam = new TIFFImageWriteParam(Locale.CHINESE);
  tiffWriteParam.setCompressionMode(ImageWriteParam.MODE_DISABLED);
  
  //Get tif writer and set output to file
  Iterator writers = ImageIO.getImageWritersByFormatName("tiff");
  ImageWriter writer = writers.next();
  
  BufferedImage bi = reader.read(0);
  IIOImage image = new IIOImage(bi,null,reader.getImageMetadata(0));
  tempFile = tempImageFile(imageFile);
  ImageOutputStream ios = ImageIO.createImageOutputStream(tempFile);
  writer.setOutput(ios);
  writer.write(streamMetadata, image, tiffWriteParam);
  ios.close();
  
  writer.dispose();
  reader.dispose();
  
 } catch (IOException e) {
  e.printStackTrace();
 }
 return tempFile;
 }
 
 private static File tempImageFile(File imageFile) {
 String path = imageFile.getPath();
 StringBuffer strB = new StringBuffer(path);
 strB.insert(path.lastIndexOf('.'),0);
 return new File(strB.toString().replaceFirst("(&#63;<=//.)(//w+)$", "tif"));
 }
 
}

b.OCR核心类

package OCR;
 
import java.io.BufferedReader;
import java.io.File;
import java.io.FileInputStream;
import java.io.InputStreamReader;
import java.util.ArrayList;
import java.util.List;
 
import org.jdesktop.swingx.util.OS;
 
public class OCR {
 private final String LANG_OPTION = "-l"; //英文字母小写l,并非数字1
 private final String EOL = System.getProperty("line.separator");
 private String tessPath = "C://Program Files//Tesseract-OCR";
 //private String tessPath = new File("tesseract").getAbsolutePath();
 
 public String recognizeText(File imageFile,String imageFormat)throws Exception{
 File tempImage = ImageIOHelper.createImage(imageFile,imageFormat);
 File outputFile = new File(imageFile.getParentFile(),"output");
 StringBuffer strB = new StringBuffer();
 List cmd = new ArrayList();
 if(OS.isWindowsXP()){
  cmd.add(tessPath+"//tesseract");
 }else if(OS.isLinux()){
  cmd.add("tesseract");
 }else{
  cmd.add(tessPath+"//tesseract");
 }
 cmd.add("");
 cmd.add(outputFile.getName());
 //cmd.add(LANG_OPTION);
 //cmd.add("chi_sim");
 //cmd.add("eng");
 
 ProcessBuilder pb = new ProcessBuilder();
 pb.directory(imageFile.getParentFile());
 
 cmd.set(1, tempImage.getName());
 pb.command(cmd);
 pb.redirectErrorStream(true);
 
 Process process = pb.start();
 //tesseract.exe 1.jpg 1 -l chi_sim
 int w = process.waitFor();
 
 //删除临时正在工作文件
 tempImage.delete();
 
 if(w==0){
  BufferedReader in = new BufferedReader(new InputStreamReader(new FileInputStream(outputFile.getAbsolutePath()+".txt"),"UTF-8"));
  
  String str;
  while((str = in.readLine())!=null){
  strB.append(str).append(EOL);
  }
  in.close();
 }else{
  String msg;
  switch(w){
  case 1:
   msg = "Errors accessing files.There may be spaces in your image's filename.";
   break;
  case 29:
   msg = "Cannot recongnize the image or its selected region.";
   break;
  case 31:
   msg = "Unsupported image format.";
   break;
  default:
   msg = "Errors occurred.";
  }
  tempImage.delete();
  //throw new RuntimeException(msg);
 }
 new File(outputFile.getAbsolutePath()+".txt").delete();
 return strB.toString();
 }
}

c.main

package OCR;
import java.io.File;
import java.io.IOException;
 
public class TestOcr {
 
 /**
 * @param args
 */
 public static void main(String[] args) {
 //输入图片地址
 String path = "d://test//test.bmp";  
    try {  
      String valCode = new OCR().recognizeText(new File(path), "bmp");  
      System.out.println(valCode);  
    } catch (IOException e) {  
      e.printStackTrace();  
    } catch (Exception e) {
  e.printStackTrace();
 }  
 }
 
}

以上就是本文的全部内容,希望对大家的学习有所帮助,也希望大家多多支持。


推荐阅读
  • 本文内容为asp.net微信公众平台开发的目录汇总,包括数据库设计、多层架构框架搭建和入口实现、微信消息封装及反射赋值、关注事件、用户记录、回复文本消息、图文消息、服务搭建(接入)、自定义菜单等。同时提供了示例代码和相关的后台管理功能。内容涵盖了多个方面,适合综合运用。 ... [详细]
  • Skywalking系列博客1安装单机版 Skywalking的快速安装方法
    本文介绍了如何快速安装单机版的Skywalking,包括下载、环境需求和端口检查等步骤。同时提供了百度盘下载地址和查询端口是否被占用的命令。 ... [详细]
  • 基于layUI的图片上传前预览功能的2种实现方式
    本文介绍了基于layUI的图片上传前预览功能的两种实现方式:一种是使用blob+FileReader,另一种是使用layUI自带的参数。通过选择文件后点击文件名,在页面中间弹窗内预览图片。其中,layUI自带的参数实现了图片预览功能。该功能依赖于layUI的上传模块,并使用了blob和FileReader来读取本地文件并获取图像的base64编码。点击文件名时会执行See()函数。摘要长度为169字。 ... [详细]
  • HDU 2372 El Dorado(DP)的最长上升子序列长度求解方法
    本文介绍了解决HDU 2372 El Dorado问题的一种动态规划方法,通过循环k的方式求解最长上升子序列的长度。具体实现过程包括初始化dp数组、读取数列、计算最长上升子序列长度等步骤。 ... [详细]
  • 本文讨论了Alink回归预测的不完善问题,指出目前主要针对Python做案例,对其他语言支持不足。同时介绍了pom.xml文件的基本结构和使用方法,以及Maven的相关知识。最后,对Alink回归预测的未来发展提出了期待。 ... [详细]
  • 本文介绍了在Hibernate配置lazy=false时无法加载数据的问题,通过采用OpenSessionInView模式和修改数据库服务器版本解决了该问题。详细描述了问题的出现和解决过程,包括运行环境和数据库的配置信息。 ... [详细]
  • 本文讨论了如何优化解决hdu 1003 java题目的动态规划方法,通过分析加法规则和最大和的性质,提出了一种优化的思路。具体方法是,当从1加到n为负时,即sum(1,n)sum(n,s),可以继续加法计算。同时,还考虑了两种特殊情况:都是负数的情况和有0的情况。最后,通过使用Scanner类来获取输入数据。 ... [详细]
  • Metasploit攻击渗透实践
    本文介绍了Metasploit攻击渗透实践的内容和要求,包括主动攻击、针对浏览器和客户端的攻击,以及成功应用辅助模块的实践过程。其中涉及使用Hydra在不知道密码的情况下攻击metsploit2靶机获取密码,以及攻击浏览器中的tomcat服务的具体步骤。同时还讲解了爆破密码的方法和设置攻击目标主机的相关参数。 ... [详细]
  • 本文介绍了OC学习笔记中的@property和@synthesize,包括属性的定义和合成的使用方法。通过示例代码详细讲解了@property和@synthesize的作用和用法。 ... [详细]
  • Mac OS 升级到11.2.2 Eclipse打不开了,报错Failed to create the Java Virtual Machine
    本文介绍了在Mac OS升级到11.2.2版本后,使用Eclipse打开时出现报错Failed to create the Java Virtual Machine的问题,并提供了解决方法。 ... [详细]
  • 本文讲述了作者通过点火测试男友的性格和承受能力,以考验婚姻问题。作者故意不安慰男友并再次点火,观察他的反应。这个行为是善意的玩人,旨在了解男友的性格和避免婚姻问题。 ... [详细]
  • 学习SLAM的女生,很酷
    本文介绍了学习SLAM的女生的故事,她们选择SLAM作为研究方向,面临各种学习挑战,但坚持不懈,最终获得成功。文章鼓励未来想走科研道路的女生勇敢追求自己的梦想,同时提到了一位正在英国攻读硕士学位的女生与SLAM结缘的经历。 ... [详细]
  • 近年来,大数据成为互联网世界的新宠儿,被列入阿里巴巴、谷歌等公司的战略规划中,也在政府报告中频繁提及。据《大数据人才报告》显示,目前全国大数据人才仅46万,未来3-5年将出现高达150万的人才缺口。根据领英报告,数据剖析人才供应指数最低,且跳槽速度最快。中国商业结合会数据剖析专业委员会统计显示,未来中国基础性数据剖析人才缺口将高达1400万。目前BAT企业中,60%以上的招聘职位都是针对大数据人才的。 ... [详细]
  • 本文介绍了数据库的存储结构及其重要性,强调了关系数据库范例中将逻辑存储与物理存储分开的必要性。通过逻辑结构和物理结构的分离,可以实现对物理存储的重新组织和数据库的迁移,而应用程序不会察觉到任何更改。文章还展示了Oracle数据库的逻辑结构和物理结构,并介绍了表空间的概念和作用。 ... [详细]
  • Linux重启网络命令实例及关机和重启示例教程
    本文介绍了Linux系统中重启网络命令的实例,以及使用不同方式关机和重启系统的示例教程。包括使用图形界面和控制台访问系统的方法,以及使用shutdown命令进行系统关机和重启的句法和用法。 ... [详细]
author-avatar
U友50054453
这个家伙很懒,什么也没留下!
PHP1.CN | 中国最专业的PHP中文社区 | DevBox开发工具箱 | json解析格式化 |PHP资讯 | PHP教程 | 数据库技术 | 服务器技术 | 前端开发技术 | PHP框架 | 开发工具 | 在线工具
Copyright © 1998 - 2020 PHP1.CN. All Rights Reserved | 京公网安备 11010802041100号 | 京ICP备19059560号-4 | PHP1.CN 第一PHP社区 版权所有