工具目录 / OCR4all
OCR4all
从古籍扫描到可校读全文
为何收录
将预处理、版面分析、识别和校正串为面向历史文献的流程。
输入材料
历史文献扫描件
输出结果
可修订的识别文本
适用范围与限制
需要本地部署;复杂竖排需验证适用性。
站内基础能力
这些能力覆盖部分基础任务,不表示完整重制原软件。
- 扫描图像整理
旋转书页、调节灰度与二值阈值,下载处理后的图片。 1 MB、600 万像素以内;只执行指定处理,不自动判断歪斜和版面。
- 本地图像文字识别
在当前应用识别简体、繁体及英文印刷文字,再进入校读。 使用本地 Tesseract;图像 1 MB、600 万像素以内。手写、异体字和复杂竖排需要人工核对,不训练新模型。

