[发明专利]一种提高版式文档中字符识别率的方法和系统有效
申请号: | 201310450972.6 | 申请日: | 2013-09-25 |
公开(公告)号: | CN104463153B | 公开(公告)日: | 2018-09-04 |
发明(设计)人: | 董宁;耿蕾蕾 | 申请(专利权)人: | 北大方正集团有限公司;北京方正阿帕比技术有限公司 |
主分类号: | G06K9/03 | 分类号: | G06K9/03 |
代理公司: | 北京三聚阳光知识产权代理有限公司 11250 | 代理人: | 寇海侠 |
地址: | 100871 北京市*** | 国省代码: | 北京;11 |
权利要求书: | 查看更多 | 说明书: | 查看更多 |
摘要: | 本发明是一种提高版式文档中字符识别率的方法和系统,将所述版式文档中同一个预定字符所对应的字符原始编码与字符标准编码进行比对得到编码比对结果,将多个所述编码比对结果进行概率统计得到概率值,将所述概率值与阈值进行比对,若超过阈值,则所述版式文档显示所述字符原始编码对照通用标准字符编码库得到的字符;否则,所述版式文档显示OCR识别后的字符。本发明通过概率统计的方法,来选择显示所述字符原始编码对照通用标准字符编码库得到的字符或者所述版式文档显示OCR识别后的字符,因此有效提高了字符识别的正确率。 | ||
搜索关键词: | 一种 提高 版式 文档 字符 识别率 方法 系统 | ||
【主权项】:
1.一种提高版式文档中字符识别率的方法,其特征在于,包括如下步骤:提取所述版式文档中的每个预定字符的字形位图;提取所述版式文档中的每个所述预定字符的字符原始编码;对所述字形位图进行OCR识别后得到识别后字符;对所述识别后字符对照通用标准字符编码库得到字符通用标准编码,其中,所述字符通用标准编码为国标GB2312;将所述版式文档中同一个预定字符所对应的字符原始编码与字符通用标准编码进行比较得到编码相同或者编码不同的编码比对结果;将多个所述预定字符所对应的所述编码比对结果进行概率统计得到所述预定字符采用字符通用标准编码的概率值;将所述概率值与阈值进行比对,若超过阈值,则所述预定字符按照其所述字符原始编码对照通用标准字符编码库所得到的字符并显示;否则,直接显示该所述预定字符通过OCR识别出的字符。
下载完整专利技术内容需要扣除积分,VIP会员可以免费下载。
该专利技术资料仅供研究查看技术是否侵权等信息,商用须获得专利权人授权。该专利全部权利属于北大方正集团有限公司;北京方正阿帕比技术有限公司,未经北大方正集团有限公司;北京方正阿帕比技术有限公司许可,擅自商用是侵权行为。如果您想购买此专利、获得商业授权和技术合作,请联系【客服】
本文链接:http://www.vipzhuanli.com/patent/201310450972.6/,转载请声明来源钻瓜专利网。