工具目录 / CLTK
CLTK
处理古典语言的词形与文本
为何收录
为历史语言提供自然语言处理组件,覆盖通用现代模型薄弱的语种。
输入材料
历史语言语料
输出结果
分词、词形等分析数据
适用范围与限制
Python 库;不同语言能力与模型许可需分别确认。
站内基础能力
这些能力覆盖部分基础任务,不表示完整重制原软件。
- 字词频与词云
选择单字、双字或现代分词,观察重复出现的线索。 高频不等于重要;现代分词需抽查。
- 关键词上下文
把每个关键词放回原句,检查自己的判断。 字面检索不自动匹配别名或同义词。
- 连续词组发现
统计连续 2—5 个计数单位的重复组合,发现惯用表达。 按句段边界计数,单字保留虚词;组合不等于词语或语义单位。
- 关键词搭配观察
统计关键词前后窗口的邻接字,检查反复出现的搭配。 按字面窗口计数,不证明语义或因果关系。

