多语种文本图像中的文字语种辨识方法的研究

来源 :中文信息学报 | 被引量 : 0次 | 上传用户：fl908720

【摘要】

：

本文针对汉字、朝鲜文字和英文单词混合的文本图像提出了基于主成分分析技术以文字为单位进行文种辨识的方法。首先,通过主成分分析方法构造特征空间,并且把分割的文字映射到

【作者】

：

朴明姬崔荣一

【机构】

：

延边大学计算机科学与技术学院智能信息处理研究室

【出处】

：

中文信息学报

【发表日期】

：

2017年2期

【关键词】

：

文种辨识主成分分析相对熵欧式距离文字分割 script identification principal component analysis re

【基金项目】

：

吉林省科技发展计划项目（20140101186JC）, 国家语委2015年度科研立项项目（教语信司函[2015]21号）

下载到本地 , 更方便阅读

下载此文赞助VIP

声明 : 本文档内容版权归属内容提供方 , 如果您对本文有版权争议 , 可与客服联系进行内容授权或下架

论文部分内容阅读

本文针对汉字、朝鲜文字和英文单词混合的文本图像提出了基于主成分分析技术以文字为单位进行文种辨识的方法。首先,通过主成分分析方法构造特征空间,并且把分割的文字映射到此空间得到重构图像;其次,计算原图像和重构图像的水平和垂直方向直方图的相对熵;最后,根据原图像和重构图像之间的欧式距离和相对熵来判别文字语种。实验表明,本文提出的方法在没有分割错误的情况下,能获得99.78%的识别准确率,有效地解决了在汉、朝、英三种文字混合构成的文档图像中文种辨识问题。

其他文献

藏文Web网络环境下的搜索策略研究

该文分析了藏文Web网络的度分布和最大废优先搜索算法存在的问题,提出了搜索效率更高的二分度搜索算法和双遍历器的二分度与最大度同步搜索算法.根梧社区划分原理,设计和构建

期刊

藏文Web网络度分布最大度链路双遍历器社区划分Tibetan Web networks degree distribution maximum d

“教—学—做”一体化教学模式在高校计算机教学中的应用研究——以锦州师范高等专科学校为例

研究将＂教—学—做＂一体化教学模式应用于计算机教学的必要性,给出了具体的三模块实训体系实现方案.利用＂教—学—做＂一体化教学模式教学使学生学到的理论知识与实际操作紧密连接

期刊

“教—学—做”一体化教学模式模块实训method of teaching-learning-doingmoduletraining

多语种文本图像中的文字语种辨识方法的研究

其他学术论文