Tesseract-OCR ---样本训练

357 阅读 0 评论 236 点赞

我是靠谱客的博主魁梧唇膏，这篇文章主要介绍Tesseract-OCR ---样本训练，现在分享给大家，希望可以做个参考。

1.下载工具jTessBoxEditor，这个工具是用来训练样本用的，由于该工具是用JAVA开发的，需要安装JAVA虚拟机才能运行。
2.获取样本图像。
3.合并样本图像。运行jTessBoxEditor工具，在点击菜单栏中Tools—>Merge TIFF。在弹出的对话框中选择样本图像（按Shift选择多张），合并成num.font.exp0.tif文件。
4.生成Box File文件。打开命令行，执行命令（执行命令前先将CMD目录位置定位到num.font.exp0.tif所在文件夹）：

tesseract.exe num.font.exp0.tif num.font.exp0 batch.nochop makebox

生成的BOX文件为num.font.exp0.box，BOX文件为Tessercat识别出的文字和其坐标。
注：Make Box File的命令格式为：

tesseract [lang].[fontname].exp[num].tif [lang].[fontname].exp[num] batch.nochop makebox

其中lang为语言名称，fontname为字体名称，num为序号，可以随便定义。
5.文字校正。运行jTessBoxEditor工具，打开num.font.exp0.tif文件（必须将上一步生成的.box和.tif样本文件放在同一目录），如下图所示。可以看出有些字符识别的不正确，可以通过该工具手动对每张图片中识别错误的字符进行校正。校正完成后保存即可。
这里写图片描述
6.定义字体特征文件。Tesseract-OCR3.01以上的版本在训练之前需要创建一个名称为font_properties的字体特征文件。
font_properties不含有BOM头，文件内容格式如下：

<fontname> <italic> <bold> <fixed> <serif> <fraktur>

其中fontname为字体名称，必须与[lang].[fontname].exp[num].box中的名称保持一致。、、、、的取值为1或0，表示字体是否具有这些属性。
这里在样本图片所在目录下创建一个名称为font_properties的文件（没有.txt等文件类型），用记事本打开，输入以下下内容：

font 0 0 0 0 0

这里全取值为0，表示字体不是粗体、斜体等等。
7.生成语言文件。在样本图片所在目录下创建一个批处理文件，输入如下内容。


    rem 执行改批处理前先要目录下创建font_properties文件  

    echo Run Tesseract for Training..  
    tesseract.exe num.font.exp0.tif num.font.exp0 nobatch box.train  

    echo Compute the Character Set..  
    unicharset_extractor.exe num.font.exp0.box  
    mftraining -F font_properties -U unicharset -O num.unicharset num.font.exp0.tr  

    echo Clustering..  
    cntraining.exe num.font.exp0.tr  

    echo Rename Files..  
    rename normproto num.normproto  
    rename inttemp num.inttemp  
    rename pffmtable num.pffmtable  
    rename shapetable num.shapetable   

    echo Create Tessdata..  
    combine_tessdata.exe num.