欧式家谱识别与格式化处理
一、什么是欧式家谱
欧式家谱是一种常见的家谱编排体例,通常以五世为一个编排单元依次排列,在版面表现上多为五行或六行的表格形式,结构规整但与传统古籍排版差异较大。
以下为欧式家谱的样例图像:



二、为什么需要专门的版面识别
传统的 OCR 引擎按照古籍的常规阅读顺序(如从上到下、从右到左)进行文字识别和排序。但在欧式家谱中,表格结构的阅读顺序与普通古籍截然不同——同一行的文字分散在不同的表格单元格中,若按传统顺序识别,结果会出现严重的顺序错乱,无法直接使用。
为此,我们在看典古籍 OCR 引擎中新增了"欧式家谱"版面识别算法,能够:
- 准确提取图像中的表格版面信息
- 将属于同一行的文本进行合并处理
- 按照图像中原有的表格行结构还原文字顺序,防止错乱
三、测试效果
我们在大量欧式家谱图像上进行了测试,该算法在大多数场景下表现良好。由于欧式家谱的格式变体较多,目前可能仍有部分特殊版式暂未覆盖,如果您遇到识别效果不佳的情况,欢迎反馈给我们,我们将持续优化迭代。
以下是部分测试结果,供参考:
测试图像一:


测试图像二:


测试图像三:

测试图像四:

测试图像五:

注意:目前版面识别算法不通用,启用【欧式家谱】版面识别后,在常规图像中可能会出现识别错乱的问题,请仅在符合欧式家谱样式的图像上开启该功能。
四、如何使用
【欧式家谱】版面识别已同步上线看典古籍平台的以下三个功能版块:
1. 古籍数字化
在 古籍数字化 页面中,PDF 识别、单图识别、多图识别均已支持。在"版面识别设置"下拉框中选择"欧式家谱"即可。

2. 古籍校对
在 古籍校对 页面中,创建校对任务时,在弹窗的"版面识别设置"选项中选择"欧式家谱"即可。

3. OCR API
调用 OCR API 接口时,将 det_layout 字段的值设置为 oushi_ocr 即可。详见 API 文档。
样例图像取自网络,如有侵权请联系我们删除。