文本与关系
按研究方向整理的站内工具与方法。
- 字词频与词云
选择单字、双字或现代分词,观察重复出现的线索。
- 两组材料用词比较
统一计数口径,比较两组材料的每万单位频率。
- 词语共现网络
查看词语在限定窗口内共同出现的次数。
- 人物关系画板
每行输入一条关系,生成可拖动的人物网络。
- 表格清洗与转换
整理CSV、JSON等材料,预览、去重并导出。
- 连续词组发现
统计连续 2—5 个计数单位的重复组合,发现惯用表达。
- 词汇丰富度观察
计算类型标记比、单现词与句段数量,比较材料组成。
- RIS / BibTeX 书目整理
从书目记录提取作者、题名、年份和来源。
- 资料表字段检查
逐列查看空值、唯一值和样例,定位数据整理问题。
- 关键词搭配观察
统计关键词前后窗口的邻接字,检查反复出现的搭配。
- 文本相似度矩阵
用字符频次的余弦相似度比较多份文献。
- 文献集合交集
比较多个名单或文献集合的共同条目与独有条目。
- 人物网络度数与分组
计算无向关系网的邻居数和连通分量。
- 分组计数与汇总
按字段分组,计算记录数及选定数值列总和。
- 人名地名归并候选
按繁简、全半角和标点生成同写候选组,保留所有原写法。
- 书目合著网络
从 RIS / BibTeX 署名生成可查看的合著边与权重。
- Voyant Tools
把词频、语境和分布放在一起读
- AntConc
检查词语搭配和关键词语境
- LancsBox
观察语料中的搭配网络
- TXM
把文本计量和原文阅读结合
- IRaMuTeQ
对访谈材料做词汇分类与相似性分析
- Lexos
比较不同文本的词汇距离
- stylo
用文体特征比较作者与作品
- Antelope
在不同 NLP 库之间选择同类方法
- GROBID
从学术 PDF 抽出标题、引文和参考文献
- CERMINE
把论文 PDF 转成可分析的元数据
- OpenRefine
归并资料表里写法不一的人名地名
- VisiData
用键盘快速巡视大张资料表
- Frictionless
检查共享资料表有没有结构错误
- Datasette
把整理好的数据库变成可检索资料站
- sqlite-utils
把零散 CSV 和 JSON 汇进研究数据库
- QualCoder
给访谈文字、图片和录音做人工编码
- Taguette
用轻量标签整理访谈摘录
- RQDA
用 R 和 SQLite 保存质性研究编码
- CATMA
在文本中协作标记并比较解读
- INCEpTION
为人名、关系与语义建立可审校标注
- doccano
给文本分类和命名实体打标签
- brat
在原文上看见实体和关系标注
- Gephi
探索人物网络的社群与桥梁
- Palladio
让人物、地点和时间表互相筛选
- The Vistorian
从关系表进入多种网络读法
- RAWGraphs
为研究材料制作非常规统计图
- UpSet.js
看清多个文献集合的交集
- CorText Manager
追踪研究主题和知识网络的变化
- bibliometrix
分析一个领域的作者与引用关系
- ScientoPy
观察书目数据中的主题增长

