关于开源古籍
开源古籍是一个把古籍数字化全链路公开出来的项目:从扫描图片,到预处理、版面与字符识别、人工校对, 到索引与知识关联、排版还原,再到开放发布,每一段的代码与数据都公开在 GitHub 上。
在做什么
目前同时推进三件事:
- 古籍目录索引:汇集历代目录学著录与公开馆藏书目,做一部尽量准确完整、 可供程序直接调用的在线古籍目录,收录作品、版本、丛编与相关人物。
- 整理本与全文:把古籍原文整理成结构化文本,收录已校勘的整理本与全文, 与目录索引共用同一套编号互相关联。
- 图片初步数字化:用自研 OCR 与版面分析模型,让机器先做第一遍识别, 再靠人工校对把工作量压缩到"只看差异"。
数据来源与许可
索引数据来自历代目录学著录、公开馆藏书目,以及各类可获取的古籍扫描与文本资源; 具体来源在每条索引自己的资源字段里逐条标注,可以顺着链接查到出处。 各开源仓库的许可以仓库内的 LICENSE 文件为准:整理本与全文所在的 book-text 仓用 CC0 1.0 Universal;图片数字化引擎 open-guji-cv 仓用 Apache License 2.0;古籍目录索引 book-index、book-index-draft 两仓 目前未在仓库根目录声明许可文件。
内容真源在 GitHub
本站呈现的内容不是最终事实来源——GitHub 上的数据仓库才是,本站只是这些数据的一个展示端。 随时可以去仓库里核对原始数据、看改动历史,或者直接提交修改:
- 古籍目录索引:book-index(正式)/book-index-draft(草稿)
- 整理本与全文:book-text
- 图片数字化引擎:open-guji-cv
- 更多仓库见组织主页:github.com/open-guji
怎么参与
- 用页面上的反馈按钮:发现错误、缺失资源或有建议,随手提交,可以在反馈页看到处理进展。
- 想深度参与整理、校对或开发:提交反馈时选「想参与/联系」类型,留下联系方式,我们会联系你。
- 也可以直接去上面的 GitHub 仓库提 Issue 或 PR。