创建:{{task.created_on}}
校对:{{task.update_on}}
校对:—
校对模式:{{ task.proof_type || '句校' }}
{{task.error}}
数字化古籍,精准校对,一站搞定!
古籍校对平台是看典古籍推出的智能化OCR校对工具,旨在帮助研究者、编辑和古籍爱好者高效完成古籍文字的数字化校对工作。平台集成了看典古籍OCR引擎,能够自动识别古籍扫描件中的文字,并将识别结果转化为可编辑的文本,供您逐页、逐行、逐字核对和修正。
校对完成后,平台支持将成果导出为Word、TXT、JSON、双层PDF等多种格式,满足学术研究、出版印刷、数据挖掘等不同场景的需求。
平台提供两种校对模式,适用于不同精度的校对需求。创建任务时需要选择其中一种,创建后不可更改。
核心理念:以"行"为单位进行校对,整行文字显示在文本编辑器中,直接修改即可。效率优先,适合快速通校。
核心理念:以"字"为单位进行校对,每个字都有独立的边界框和坐标信息。追求精度,适合学术出版级别的精细校对。
点击"立即创建任务"按钮,在弹出的窗口中完成以下设置:
支持两种文件类型:PDF(单个文件,自动转为图像)、图像文件(可一次选择多张JPG/PNG等图片)。点击或拖放文件到上传区域即可。
为您的校对任务取一个便于识别的名称,方便后续在任务列表中查找和管理。
句校 文本行级别校对,效率优先。
字校 单字级别精细校对,精度优先。创建后不可更改,请根据需求谨慎选择。
选择古籍文字的排版方向:自动(系统判断)、竖排(从上到下、从右到左)、横排(从左到右)。选错方向会严重影响识别结果的正确顺序,请根据古籍实际情况选择。
识别版本:推荐使用"OCR v2最新版本"以获得最佳识别效果。
版面识别:"只识别正文"仅提取正文内容;"内容全识别"会识别包括眉批、脚注在内的所有文字;"欧式家谱"专为家谱体例优化;"不识别版面"按图像原始布局识别。
自动插入空格:根据字间距自动插入分隔空格,适合需要分词处理的场景。
文字排序方向:横排可选左→右或右→左,竖排可选上→下或下→上。
创建任务后,每个任务会以卡片形式显示在任务列表中。卡片上包含任务的核心信息:
卡片顶部显示任务第一页的缩略图,右上角有校对类型标签(句校 绿色 / 字校 橙色)。
识别进度(第一条):显示OCR文件识别进度。完成后为绿色,进行中为黄色。识别是自动进行的,上传后系统会在后台逐页识别。
校对进度(第二条):显示人工校对进度。完成后为绿色,进行中为蓝色。每校对完一页,进度会自动更新。
校对(蓝色):进入校对界面继续工作。会跳转到上次离开的页面。
导出:打开展出窗口,选择导出格式。
删除(红色圆形):删除该任务,需要二次确认。
取消识别(红色,仅识别中可见):终止正在进行的OCR识别。
顶部工具栏支持按任务名称搜索,以及按创建时间或校对时间排序(升序/降序)。顶部统计栏显示任务总数、总页数、已识别/已校对数量,以及今日和本期的使用量统计。
卡片左边框颜色表示任务状态:
绿色 — 校对完成
浅棕色 — 校对进行中
红色 — 存在错误(需检查文件或重新创建)
校对完成后,点击任务卡片上的"导出"按钮,选择需要的导出格式。部分格式支持"合并句子"选项(自动合并分行文字为连续段落)。
支持横排和竖排两种版式导出,适合进一步编辑排版和打印。
合并TXT:所有页的文字合并为一个文件;分页TXT:每页单独一个文件,打包为ZIP下载。
导出包含每个字的文本内容、位置坐标、置信度等元数据的结构化数据,方便程序化处理和分析。
上层为古籍原始图像,下层为校对后的文字层。文字可搜索、可选择、可复制,兼顾阅读体验和保真度。分页PDF每页独立,打包为ZIP。
导出任务中的所有图像文件,打包为ZIP下载。