-
0 引言
-
古书画作为中国古代文化的一种重要表现形式,所记载的文字不仅能体现古人的精神文化生活,还能记录重要的历史事件[1]。古书画中的文字信息对还原真实历史、了解不同时期特有文化有着重要价值。然而,由于环境及人为因素的影响,古书画中的文字受到不同程度的劣化,依靠人眼难以辨认,给文物保护和考古带来困难。因此,古书画中文字提取与识别是一项十分重要的工作。
-
在文字提取方面的研究有:赵标[2]将碑文分为楷体和草书,使用子块自适应分割及融合技术,对碑文图像进行增强和提取;酆格斐等[3]为了辅助甲骨学研究,构造了基于形态学变换的特征提取系统,较好地提取出了甲骨文的笔画形态和字形特征;Devi等[4]针对石刻图像光照不均匀、文字与背景相似等问题,采用高斯函数和双边滤波相结合的方法,有效区分出了背景石刻图像的前景特征;周新光等[5]利用最小噪声分离(minimum noise fraction,MNF)变换对光谱数据进行处理,提升了模糊印章的可辨识度。
-
在文字识别方面的研究有:Guo等[6]提出一种基于多特征和主成分分析相结合的纳西象形文字识别方法;Narang等[7]提出一种基于统计特征提取技术的手写体梵文古籍识别系统;李文英等[8]设计了基于两个阶段特征映射的深度学习模型,用于辅助考古文字研究;Han等[9]在卷积神经网络的基础上提出了562个常用藏文字识别的方法。
-
针对古书画中褪色文字,本工作提出一种基于光谱增强指数与LeNet-5相结合的提取与识别方法。通过构建字迹增强指数进行文字提取,利用卷积神经网络自动化识别褪色文字,为解读古书画文字提供参考。
-
1 研究对象与数据获取
-
1.1 研究对象
-
选用清代画家张士保(1805—1878)所作《论道图》。受湿度、温度、光照等自然环境以及人为保存等因素的影响,该画出现了较为严重的老化和褪色,其中墨线勾勒的轮廓变得模糊,部分区域文字褪色严重,可辨认程度不高[10]。以《论道图》左上角褪色文字比较集中的区域为具体研究对象(如图1a中红色框所示)。
-
图1 《论道图》画心及其局部褪色文字高光谱影像
-
Fig.1 Painting of Lun Dao Tu and hyperspectral image of its partially fading text
-
1.2 数据获取
-
采集数据的地面成像光谱仪型号为THEMIS-VNIR/400H,其光谱范围为400~1 000nm,光谱分辨率为2.8nm,图像空间尺寸为1 392×1 000像素,具有1 040个波段,采样间隔为0.6nm,使用两个卤素灯作为照明光源。采集的流程主要包括:现场勘察→制定拍摄方案→安装仪器→仪器调焦→影像获取→检查数据→补拍数据。采集的数据包括标准反射板数据、暗电流数据和研究区域高光谱图像。
-
2 研究方法
-
基于光谱增强指数与LeNet-5的古书画褪色文字提取与识别框架[11]如图2所示。
-
图2 研究技术路线
-
Fig.2 Overall scheme
-
2.1 数据预处理
-
在数据采集过程中,数据会受到环境光和仪器暗电流噪声的影响。可采用反射率校正来减少这类噪声,校正公式为:
-
式中,R为反射率;R raw为采集的高光谱数据;R dark为暗电流数据;R white为标准反射板数据,标准反射板的反射率为99%。
-
MNF变换[12]是高光谱数据处理中常见的降维降噪方法,其本质上是两次层叠的主成分变换。第一次变换用于分离和重新调节数据中的噪声,使得变换后的噪声数据只有最小的方差且没有波段间的相关。第二次是对噪声白化数据的标准主成分变换,从而实现高光谱数据降维与降噪。
-
为了进一步降低噪声,使用MNF正逆变换进行降噪。在获取的1 040个波段中,人为选择51~990波段(405.79~1 000.79nm)进行MNF变换,将数据中的噪声与信息分离,然后选择前几个MNF波段进行MNF逆变换,恢复高光谱数据维度,进一步降低噪声。
-
2.2 字迹光谱特征分析
-
高光谱影像波段数多,不同的波段组合运算能够得到不同研究对象的增强指数[13]。为得到较好的字迹增强效果,需要统计数据中字迹及其背景的反射光谱随波长的变化规律,找到最合适的波段进行组合运算并建立字迹指数。此处采用差值、比值和归一化运算来构建古书画褪色文字的字迹增强指数。
-
差值字迹增强指数(I dw)利用两波段之差来增强字迹和背景的差异,如式(2)。比值字迹增强指数(I rw)利用两波段之比来增强字迹和背景的差异,如式(3)。
-
式中,b1为高光谱数据中近红外波段(780~1 000nm)的均值;b2为高光谱数据中蓝色波段(430~470nm)的均值。
-
归一化运算是将绝对值转化为相对值来简化计算的有效方法[14]。本工作提出古书画褪色文字归一化字迹增强指数(Indw)表达式,如式(4)。
-
式中,b1为高光谱数据中近红外波段(780~1 000nm)的均值;b2为高光谱数据中蓝色波段(430~470nm)的均值。常数c的计算公式如式(5)。
-
式中,e1为高光谱数据棕色背景中近红外波段(780~1 000nm)的均值;e2为高光谱数据棕色背景中蓝色波段(430~470nm)的均值。
-
2.3 LeNet-5文字识别
-
本实验在LeNet-5卷积神经网络的基础上进行,早先由Lecun等[15]根据手写数字识别的工作,提出了LeNet的网络结构,并取得了较好的结果,后来又经过不断的尝试和优化,提出了LeNet-5网络,并在手写数字支票的识别任务上得到了很好的应用。手写汉字的识别与数字的识别任务相同,为了适应手写汉字的识别,在LeNet-5网络结构基础上增加了卷积层、池化层、卷积核的数量,并在全连接层之后加入Dropout层来防止卷积神经网络过度拟合。改进网络结构如图3所示。
-
图3 网络结示意图
-
Fig.3 Structure of LeNet-5
-
3 褪色文字提取
-
3.1 特征波段选择
-
对《论道图》高光谱影像进行MNF变换后,如图4所示,其前6个分量集中了数据95%以上的信息。因此,选取前6个分量进行MNF逆变换,这样既保留了原始光谱信息,又明显降低了噪声对光谱的影响。
-
图4 MNF特征值
-
Fig.4 Eigenvalue curve of MNF
-
由于《论道图》褪色严重,其高光谱合成真彩色影像难以区分字迹、白色背景以及棕色背景这3类不同区域,所以对其进行拉伸变换,前后对比如图5所示。
-
利用ENVI软件中的光谱收集器,获取字迹、白色背景以及棕色背景在不同位置的光谱曲线,每种类别分别获取了30个位置的光谱曲线(图6)。其中,橘黄色点是字迹区域,紫色点是白色背景,蓝色点是棕色背景。对各类别的30条光谱曲线进行平均,得到各自对应的平均光谱曲线(图7)。
-
图5 拉伸变换对比图
-
Fig.5 Stretch transformation comparison
-
图6 不同类别样本点位置
-
Fig.6 Sample points of different categories
-
图7中可见:在蓝色波段(430~470nm),3条光谱曲线反射率都较低,光谱变化特征不明显;在绿色波段(500~560nm),字迹和棕色背景区域反射率的增长幅度仍较慢,白色背景区域反射率开始升高;在红色波段(620~760nm),字迹区域光谱反射率变化较小,背景区域的反射率明显升高;在近红外波段(780~1 000nm),字迹区域反射率增长幅度仍然较缓,而背景的光谱曲线迅速上升,反射率明显高于字迹区域。字迹和白、棕色背景的反射率在蓝色波段差异较小,在近红外波段差异最大。因此,选择近红外波段(780~1 000nm)和蓝色波段(430~470nm)构建字迹增强指数。
-
3.2 构建字迹增强指数
-
通过分析字迹和背景区域的光谱曲线变化,选择近红外波段(780~1 000nm)和蓝色波段(430~470nm)作为构建增强指数的两个参数。由于近红外和蓝色包含的波段较多,所以先进行波段抽稀,每10个波段选1个,再进行平均,用于指数的建立。运算公式为:
-
图7 不同类别的平均光谱曲线
-
Fig.7 Average spectral curves of different categories
-
式(6)、(7)中,b1为数据中近红外波段(780~1 000nm)的均值;b2为数据中蓝色波段(430~470nm)的均值;bi为近红外波段包含的i个图像;bx为蓝色波段包含的x个图像;n和m分别为近红外波段和蓝色波段的个数(其中,n为369,m为68)。通过表1和公式(5)计算出常数c的值为12.793。将得到的b1、b2和c带入式(2)(3)和(4)中,得到字迹增强图(图8)。
-
图8 三个字迹增强指数运算结果图
-
Fig.8 Images enhanced by three handwriting indexes
-
从视觉效果看,归一化字迹增强指数运算结果的字迹颜色更暗,背景颜色更亮,两者的对比更加明显,结果较其他两个指数的运算结果更好。因此,选用归一化字迹增强指数进行后续文字信息提取。
-
3.3 方法对比
-
图9是常用特征提取方法与归一化字迹指数提取法的对比图。图9a为主成分分析(principal components analysis,PCA)字迹提取结果,从视觉角度分析,字迹与背景对比度低,背景中的折痕有过分的增强。图9b为MNF变换第一波段字迹提取结果,字迹颜色很淡,图像整体较为模糊。图9c为连续最大角凸锥法(sequential maximum angle convex cone,SMACC)字迹提取结果,针对于“滑”、“须”、“役”、“手”这几个字增强效果不明显,图像整体噪声过大。图9d为归一化字迹增强指数提取结果,可以看出字迹与背景区分度较高,整幅图像的背景纯净均匀、字迹清晰,基本达到理想的提取效果。
-
图9 增强方法对比图
-
Fig.9 Comparison of enhancement methods
-
3.4 密度分割提取
-
利用密度分割[16]将增强后的图像通过阈值分为两类,使得分割后的图像更有助于目视判读。其中字迹设置为黑色,背景设置为白色,理论上字迹的取值应在0以下,背景取值在0以上,考虑到环境光等因素的影响,通过实验得到,当阈值为-0.000 4时取得最好的分割效果。对图8c进行密度分割提取的结果如图10c所示。
-
图10 视觉比对
-
Fig.10 Visual comparison
-
3.5 视觉比对
-
从视觉上看,图10所示的结果表明,所提出的古书画褪色文字归一化字迹增强指数,可用于褪色书画中字迹的增强。使用归一化字迹增强指数,可以突出显示古书画中模糊的字迹以增加其可读性,为后续古书画的保护工作提供参考。
-
4 褪色文字识别
-
4.1 数据集预处理
-
训练所用数据集采用中科院自动化所收集的手写汉字样本CASIA-HWDB 1.1[17]。其中包含了汉字国标码(GB 2312—80)中统计的一级汉字,涵盖了常用的汉字,是手写汉字识别中常用的数据集。样本由多名书写者完成,风格各异。为了满足卷积神经网络的结构,需要将文字二值图像的尺寸统一再进行输入,并采用增加图像噪声和改变亮度的方法对数据集进行扩充。
-
对密度分割提取的文字进行裁剪,得到完整的文字共24个。裁剪后的待识别文字较宽,有些笔画未连接,而训练数据集字体较细,且笔画连接完整,可能会影响识别结果。因此,依次对待识别文字进行腐蚀、膨胀、开运算和闭运算4种形态学变换。得到的形态学变换后的文字如图11所示。
-
图11 形态学变换后的文字
-
Fig.11 Handwriting after morphological transformation
-
4.2 实验环境
-
实验在TensorFlow框架上配置,使用的开发语言是Python,编译器是PyCharm。首先,在网络中加入了Adam优化器,降低计算并使模型收敛更快,并在全连接层后加入了Dropout层,增加网络的泛化能力以避免过度拟合。
-
其中网络的第一层为输入层,图像通道数为1,负责输入形态学变换后的文字图像。在卷积层C1中,定义了64个卷积核,卷积核的大小为5×5,移动的步长为1,用于获取形态学变换后的文字图像的特征。S2池化层使用最大池化的方法对图像进行降维,下采样窗口为2×2,保有原来的特征同时将图像大小调整为30×30。卷积层C3定义了128个3×3的卷积核,再一次获取形态学变换后文字图像的特征,经过池化层S4后特征图像降维至14×14。卷积层C5利用256个5×5的卷积核进行运算,输出图像在池化层S6再次进行降维,最后与全连接层F7的512个神经元相连,通过第二个全连接层F8的输出。最后输出的结果使用Softmax分类器对图像进行类别预测,得到识别的结果。
-
4.3 文字识别
-
学习率是决定LeNet-5网络准确率和收敛速度的一个重要因素,分别设为0.02、0.002、0.000 2进行实验,选择效果较好的学习率作为实验的最终结果。其中,学习率为0.02的模型运行4 000次仍然无法较好地实现收敛,学习率为0.002和0.000 2时能够在运行4 000次后收敛。学习率为0.002和0.000 2的损失值和精度如图12所示,从图中可以看出,随着训练次数的不断增加,学习率为0.002和0.000 2的两个模型逐渐开始收敛,当学习率为0.002时,卷积神经网络的收敛速度相对更快,准确率更高。因此,选择0.002作为网络的学习率。
-
图12 不同学习率的损失值和准确率图
-
Fig.12 Loss and accuracy maps of different learning rates
-
将古书画表面文字的二值图输入训练好的LeNet-5进行识别后得到结果,如表2所示:第一列为待识别图像,第二列为人工辨认结果(视为正确结果,用于LeNet-5的识别率),第三、四、五列为每个文字图像输出结果(分别为排名前三的识别文字结果和对应的可能性)。其中,能够正确识别的文字有17个(识别率为70.8%):在识别结果①中,能够正确识别的文字有11个;在识别结果②中,能够正确识别的文字有4个;在识别结果③中,能够正确识别的文字有2个。第15个字和第24个字由于书写风格不同而较难区分,经过专家的仔细辨认是“不”和“属”字,利用卷积神经网络仍能正确识别,可能性分别是35.65%和84.72%,具有较好的效果。而“滑”“须”“识”“役”“以”“空”“大”识别错误,可能造成识别结果错误的原因有两个:1)“滑”“大”文字笔划的缺失较为严重、笔划未连接,导致识别结果较差;2)“须”“识”“役”“以”是用繁体字进行书写的,而“空”可能是由于作者的书写风格导致字体与实验所用的数据集不匹配,均导致识别结果不准确。总之,利用卷积神经网络识别古书画中的文字是有效的。
-
5 结论
-
利用高光谱图谱合一、信息丰富的优势,提出了一种光谱增强指数与LeNet-5结合的褪色文字提取与识别方法。构建光谱增强指数,实现褪色文字提取。结合优化的LeNet-5卷积神经网络,实现褪色文字识别。以清代画作《论道图》褪色文字为研究实例,文字识别率为70.8%。可见,光谱增强指数方法能够有效增强高光谱影像中褪色文字,与优化的LeNet-5网络结合可以实现大部分褪色文字的自动识别。然而,由于古书画文字的多样性和训练数据集的缺乏,字迹识别精度还有提高空间,这将是今后继续研究的方向。
-
参考文献
-
[1] 马琳娜,马生涛,张加万,等.秦始皇帝陵出土二号青铜马车彩绘夔龙纹复原方法研究[J].文物保护与考古科学,2021,33(1):17-25.MA Linna,MA Shengtao,ZHANG Jiawan,et al.Research on the method for restoration of the Kuilong pattern on the No.2 Qin bronze chariot excavated from the Emperor Qinshihuang’s Mausoleum Site[J].Sciences of Conservation and Archaeology,2021,33(1):17-25.
-
[2] 赵标.基于数字图像的古碑文边界轮廓提取方法的研究与应用[D].长春:长春理工大学,2010.ZHAO Biao.Research and application of the edge extraction about archaic epigraph image based on the digital image[D].Changchun:Changchun University of Science and Technology,2010.
-
[3] 酆格斐,顾绍通,杨亦鸣.基于数学形态学的甲骨拓片字形特征提取方法[J].中文信息学报,2013,27(2):79-85.FENG Gefei,GU Shaotong,YANG Yiming.Feature extraction method of oracle bone inscriptions based on mathematical morphology[J].Journal of Chinese Information Processing,2013,27(2):79-85.
-
[4] DEVI K D,MAHESWARI P U.Digital acquisition and character extraction from stone inscription images using modified fuzzy entropy-based adaptive thresholding[J].Soft Computing,2019,23:2611-2626.
-
[5] 周新光,沈骅,吴来明.高光谱图像系统应用于模糊印章的提取研究[J].文物保护与考古科学,2020,32(1):56-60.ZHOU Xinguang,SHEN Hua,WU Laiming.Application of hyperspectral image system to the extraction of blurred seals[J].Sciences of Conservation and Archaeology,2020,32(1):56-60.
-
[6] GUO H,ZHAO J,TAO R,et al.Naxi pictographs character recognition based on principal component analysis and multiple features[J].Advanced Science Letters,2012,7(1):286-291.
-
[7] NARANG S,JINDAL M K,KUMAR M.Devanagari ancient documents recognition using statistical feature extraction techniques[J].Sadhana,2019,44(141):1-8.
-
[8] 李文英,曹斌,曹春水,等.一种基于深度学习的青铜器铭文识别方法[J].自动化学报.2018,44(11):2023-2030.LI Wenying,CAO Bin,CAO Chunshui,et al.A deep learning based method for bronze inscription recognition[J].Acta Automatica Sinica,2018,44(11):2023-2030.
-
[9] HAN Y,HAO Y,WANG W.Research on the character recognition of Tibetan ancient document based on CNN[J].Journal of Physics:Conference Series,2019,1237(3):032052.
-
[10] 武望婷,张陈锋,高爱东,等.基于高光谱技术对一幅清代画信息提取研究[J].文物保护与考古科学,2017,29(4):45-52.WU Wangting,ZHANG Chenfeng,GAO Aidong,et al.Hyperspectral study of a Qing Dynasty painting[J].Sciences of Conservation and Archaeology,2017,29(4):45-52.
-
[11] 杨雪韵.基于光谱成像的褪色文字信息提取和识别研究[D].北京:北京建筑大学,2020.YANG Xueyun.Study on extraction and recognition of fading words based on spectral imaging[D].Beijing:Beijing University of Civil Engineering and Architecture,2020.
-
[12] GREEN A A,BERMAN M,SWITZER P,et al.A transformation for ordering multispectral data in terms of image quality with implications for noise removal[J].IEEE Transactions on Geoscience and Remote Sensing,1988,26(1):65-74.
-
[13] 张艳超.基于遥感影像水体提取方法研究——以青海湖为例[D].西安:西北大学,2016.ZHANG Yanchao.Research on the method of water body extraction based on remote sensing image—the case of Qinghai Lake[D].Xi’an:Northwest University,2016.
-
[14] WU T,YUAN B,WANG S,et al.A normalized difference spectral recognition index for azurite pigment[J].Applied Spectroscopy,2020,74(5):571-582.
-
[15] LECUN Y,BOTTOU L,BENGIO Y,et al.Gradient-based learning applied to document recognition[J].Proceedings of the IEEE,1998,86(11):2278-2324.
-
[16] 吴德文,张远飞,朱谷昌.遥感图像岩石信息提取的最优密度分割方法[J].国土资源遥感,2002(4):51-54,66.WU Dewen,ZHANG Yuanfei,ZHU Guchang.The best density separation method for extracting rock information from remote sensing image[J].Remote Sensing for Land & Resources,2002(4):51-54,66.
-
[17] LIU Chenglin,YIN Fei,WANG Dahan,et al.CASIA online and offline Chinese handwriting databases[C]//IEEE Computer Society.2011 International Conference on Document Analysis and Recognition.Beijing:IEEE,2011:37-41.
-
摘要
古书画中所记载的文字是了解历史的珍贵资料,对褪色文字进行提取和识别是挖掘和展示历史价值的基础。本工作首次提出基于光谱增强指数与LeNet-5相结合的古书画褪色文字提取与识别方法:利用高光谱成像无损检测、光谱范围广等优点,获取古书画的高光谱数据,分析文字与背景的光谱特征,构建字迹增强指数,实现古书画中褪色文字的增强;构建LeNet-5卷积神经网络,利用手写汉字集进行训练,对密度分割后的字迹图像进行自动识别。以清代画家张士保所作《论道图》中部分褪色文字为例进行了验证,文字识别的正确率为70.8%。结果表明,本工作所提出方法可有效提高古书画褪色文字提取与识别的智能化程度。
Abstract
Characters recorded in ancient calligraphy and painting works are precious historical information, and the extraction and recognition of faded characters is the basis for the excavation and display of historical value. This paper proposes for the first time a method for the automatic extraction and recognition of characters of faded texts in ancient calligraphy and painting works based on the combination of the spectral enhancement index and LeNet-5: utilizing the advantages of nondestructive hyperspectral-imaging detection and a wide spectral range to acquire hyperspectral data from ancient calligraphy and painting works, analyze the spectral characteristics of texts and backgrounds and construct handwriting enhancement indexes, so as to realize the enhancement of faded texts in ancient calligraphy and painting works; constructing the LeNet-5 convolution neural network which uses a handwritten Chinese character set for training to automatically recognize the binary image of the extracted text. Finally, some faded characters in the painting, Lun Dao Tu, by Zhang Shibao (1805—1878), a famous artist in the Qing Dynasty, were used as examples to verify the proposed approach. The accuracy of character recognition is 70.8%. The results show that the method proposed in this paper can effectively improve the intelligentization of extraction and recognition of faded characters in ancient calligraphy and painting works.
Keywords
Hyperspectral ; Faded text ; Handwriting enhancement index ; LeNet-5 ; Character recognition
沪公网安备 31010102005301号