古文与版本
按研究方向整理的站内工具与方法。
- 古籍版本对照
并排放入两个版本,查看差异与校勘记草稿。
- 繁简与用字整理
保留原文,转换繁简或整理行首行尾空白。
- 关键词上下文
把每个关键词放回原句,检查自己的判断。
- 多版本逐行校读
以首版本为基准对齐增删行,并列多个版本整理异文。
- TEI / XML 结构检查
检查 XML 良构性与文献元素,提取正文供继续分析。
- 原文实体与主题标注
按自定词表标注人物、地点或主题,导出可回溯的原文位置。
- IIIF 馆藏清单读取
离线解析 IIIF v2 / v3 清单中的书页标签和图像地址。
- 扫描图像整理
裁切书页、去除白边、反色,或调节灰度与二值阈值,再送入本地 OCR。
- 书页区域标注
给上传书页指定矩形区域,导出标注图与区域 JSON。
- 本地图像文字识别
在当前应用识别简体、繁体及英文印刷文字,再进入校读。
- PDF 文字层提取
按页码范围提取本地 PDF,连续文字或近似保留版面,衔接校勘与标注。
- 最短编辑逐位对齐
将两段文字或空格分词结果进行全局对齐,显示插入、删除和替换。
- 本地典籍与辞书查询
检索已入库诗文、经典与字词,并以原文页继续阅读。
- CollateX
让多个抄本逐词对齐,找出异文
- TRAViz
把版本差异画成一条条分叉
- Stemmaweb
讨论抄本之间的谱系关系
- TEI Publisher
把编码过的古籍做成数字版本
- EVT
将书页影像与释文并排出版
- EditionCrafter
让读者在手稿图像与转写间切换
- Recogito
给史料中的人物和地点做标注
- FromThePage
组织多人逐页转写档案
- eScriptorium
训练适合自己手稿的识别流程
- Kraken
识别历史印刷品与手写文本
- OCR4all
从古籍扫描到可校读全文
- OCR-D
让历史印刷 OCR 流程可复现
- LAREX
圈出古书中正文、插图和边注
- ScanTailor Advanced
把歪斜、双页扫描整理干净
- OCRmyPDF
给扫描 PDF 增加可搜索的文字层
- Calamari OCR
用多个模型提高行级文字识别
- Mirador
在同一屏对照不同馆藏的书页
- Universal Viewer
给数字馆藏添加通用阅读器
- Annotorious
把注释精确落在图像的某个区域
- TIFY
轻量浏览 IIIF 古籍影像
- Ugarit
把原文和译文逐词对应起来
- Alpheios
阅读古典语言时查形态和词义
- CLTK
处理古典语言的词形与文本
- 漢籍リポジトリ Kanripo
查找可追踪修订的汉籍文本
- Coptic SCRIPTORIUM
研究带语言标注的科普特语文献
- SuttaCentral
对照早期佛典的平行经文和译本
- Perseus Digital Library
从古希腊罗马原典追到词典解释
- TEI Garage
转换数字版本的文档格式

