{{ tasks_data.length }} 任务| {{ totalPages }} 总页| {{ totalRecPages }} 已识别| {{ totalProofed }} 已校对 {{used_count.today_used_count}} 今日用| {{used_count.today_available_count}} 今日剩| {{used_count.thirty_days_used_count}} 本期用| {{used_count.thirty_days_available_count}} 本期剩 | 区间{{used_count.date_start}}~{{used_count.date_end}} · 重置{{used_count.reset_date_full}}
创建↓ 创建↑ 校对↓ 校对↑
没有匹配的任务

智能化古籍校对平台

数字化古籍,精准校对,一站搞定!

平台简介 — 什么是看典古籍校对平台?

古籍校对平台是看典古籍推出的智能化OCR校对工具,旨在帮助研究者、编辑和古籍爱好者高效完成古籍文字的数字化校对工作。平台集成了看典古籍OCR引擎,能够自动识别古籍扫描件中的文字,并将识别结果转化为可编辑的文本,供您逐页、逐行、逐字核对和修正。

校对完成后,平台支持将成果导出为Word、TXT、JSON、双层PDF等多种格式,满足学术研究、出版印刷、数据挖掘等不同场景的需求。

1上传古籍PDF / 图像文件
2自动OCR智能识别文字
3人工校对逐页逐字核对修正
4导出成果Word / TXT / PDF / JSON
两种校对模式 — 句校 vs 字校

平台提供两种校对模式,适用于不同精度的校对需求。创建任务时需要选择其中一种,创建后不可更改。

句校模式 文本行级别校对

核心理念:以"行"为单位进行校对,整行文字显示在文本编辑器中,直接修改即可。效率优先,适合快速通校。

主要功能
  • 文本编辑器直接修改:与普通文本编辑器类似,所见即所得。
  • 图像对照:左侧显示古籍原图,右侧显示识别的文字,对照查看。
  • 框选重新识别:在图像上鼠标左键拖拽框选区域,即时OCR识别框中文字,结果可插入编辑器。
  • 合并分行:将选中的多行文字合并为一段,适合处理因排版造成的错误断行。
  • 横排/竖排切换:根据古籍排版方向切换编辑器的文字显示模式。
  • 查找替换:在当前页文本中查找并替换指定内容。
  • 竖排/横排重新识别:按指定排版方向对整页重新OCR识别(会覆盖原有文字)。
  • 翻页自动保存:开启后,切换页面时自动保存编辑内容。
适合场景
  • 文字质量较好、错误较少的古籍
  • 需要快速通读校对的场景
  • 只需要导出TXT/Word文本的场景
  • 不需要逐字定位坐标的场景
字校模式 单字级别精细校对

核心理念:以"字"为单位进行校对,每个字都有独立的边界框和坐标信息。追求精度,适合学术出版级别的精细校对。

主要功能
  • 标记行:在古籍图像上手动框出每行文字的区域,精确控制OCR识别范围。
  • 校对行:逐行显示图像,每个字独立标注,支持点击修改和候选字替换。
  • 对照模式:左右分屏,原图与文字叠层对照查看,支持点击原位修改。
  • 行/字排序:手动调整行与字的阅读顺序,处理古籍复杂的排版。
  • 批量校对:按字形将相同字归为一组,统一查看和修改,大幅提高效率。
  • 疑难字处理:标记存疑的字,集中抽取后附带原图截图进行辨认。
  • 导出双层PDF:生成图文叠加的双层PDF,上层为原始图像,下层为校对后的文字。
  • 导出JSON(含坐标):每个字的位置坐标、置信度等完整数据。
适合场景
  • 古籍质量较差、需要精细调整的场景
  • 学术出版、需要精校的研究项目
  • 需要导出双层PDF或JSON坐标数据的场景
  • 文字排版复杂(竖排、不规则排列)的古籍
如何选择? 如果您的古籍文字清晰、排版规整,主要需要导出文本阅读,推荐句校模式(效率高)。如果您需要精校出版、导出双层PDF、需要每个字的坐标数据,请选择字校模式(精度高)。
创建任务 — 从零开始一次校对

点击"立即创建任务"按钮,在弹出的窗口中完成以下设置:

1
上传文件

支持两种文件类型:PDF(单个文件,自动转为图像)、图像文件(可一次选择多张JPG/PNG等图片)。点击或拖放文件到上传区域即可。

2
填写任务名称

为您的校对任务取一个便于识别的名称,方便后续在任务列表中查找和管理。

3
选择校对模式

句校 文本行级别校对,效率优先。
字校 单字级别精细校对,精度优先。创建后不可更改,请根据需求谨慎选择。

4
设置排版方向

选择古籍文字的排版方向:自动(系统判断)、竖排(从上到下、从右到左)、横排(从左到右)。选错方向会严重影响识别结果的正确顺序,请根据古籍实际情况选择。

5
高级选项(OCR v2版本)

识别版本:推荐使用"OCR v2最新版本"以获得最佳识别效果。
版面识别:"只识别正文"仅提取正文内容;"内容全识别"会识别包括眉批、脚注在内的所有文字;"欧式家谱"专为家谱体例优化;"不识别版面"按图像原始布局识别。
自动插入空格:根据字间距自动插入分隔空格,适合需要分词处理的场景。
文字排序方向:横排可选左→右或右→左,竖排可选上→下或下→上。

任务管理 — 跟踪和管理校对进度

创建任务后,每个任务会以卡片形式显示在任务列表中。卡片上包含任务的核心信息:

封面图 + 校对类型标签

卡片顶部显示任务第一页的缩略图,右上角有校对类型标签(句校 绿色 / 字校 橙色)。

双进度条

识别进度(第一条):显示OCR文件识别进度。完成后为绿色,进行中为黄色。识别是自动进行的,上传后系统会在后台逐页识别。
校对进度(第二条):显示人工校对进度。完成后为绿色,进行中为蓝色。每校对完一页,进度会自动更新。

任务操作按钮

校对(蓝色):进入校对界面继续工作。会跳转到上次离开的页面。
导出:打开展出窗口,选择导出格式。
删除(红色圆形):删除该任务,需要二次确认。
取消识别(红色,仅识别中可见):终止正在进行的OCR识别。

搜索与排序

顶部工具栏支持按任务名称搜索,以及按创建时间或校对时间排序(升序/降序)。顶部统计栏显示任务总数、总页数、已识别/已校对数量,以及今日和本期的使用量统计。

卡片状态标识

卡片左边框颜色表示任务状态:

绿色 — 校对完成

浅棕色 — 校对进行中

红色 — 存在错误(需检查文件或重新创建)

导出功能 — 多格式输出校对成果

校对完成后,点击任务卡片上的"导出"按钮,选择需要的导出格式。部分格式支持"合并句子"选项(自动合并分行文字为连续段落)。

Word 文档

支持横排竖排两种版式导出,适合进一步编辑排版和打印。

TXT 文本

合并TXT:所有页的文字合并为一个文件;分页TXT:每页单独一个文件,打包为ZIP下载。

JSON 数据 (仅字校模式)

导出包含每个字的文本内容、位置坐标、置信度等元数据的结构化数据,方便程序化处理和分析。

双层 PDF (仅字校模式)

上层为古籍原始图像,下层为校对后的文字层。文字可搜索、可选择、可复制,兼顾阅读体验和保真度。分页PDF每页独立,打包为ZIP。

原始图像

导出任务中的所有图像文件,打包为ZIP下载。

常见问题
上传文件有什么限制?
支持 PDF(自动转换为图像)以及 JPG/PNG/WebP 等常见图像格式。PDF转图像的尺寸可在创建时设置(默认值已适合大多数场景)。
创建任务后多久可以开始校对?
上传完成后,系统会立即开始后台OCR识别。您可以关闭页面等待,也可以留在任务列表页观察进度条变化。识别速度取决于页数和服务器负载,通常在几分钟到十几分钟内完成。识别完成后任务卡片上会出现"校对"按钮。
校对模式和排版方向可以更改吗?
校对模式(句校/字校)创建后无法更改,请提前确认需求。排版方向(竖排/横排)可以在校对页面中使用"重新识别"功能调整,但会覆盖原有文字数据,请谨慎操作。
数据安全吗?文件会保存多久?
平台采用加密传输,您的文件和数据由看典古籍安全保存。任务和校对数据长期保存,不会自动删除。建议重要成果及时导出到本地备份。
使用量和费用说明
顶部统计栏显示您今日和本期的使用量。平台为注册用户提供免费的识别和校对额度。如果用量不足,请联系管理员或等待下个计费周期自动重置。
Loading...
Bootstrap Check
Bootstrap