Skip to content

Latest commit

 

History

History
25 lines (17 loc) · 1.45 KB

File metadata and controls

25 lines (17 loc) · 1.45 KB

프로젝트 개요

이 프로젝트는 한국학중앙연구원 한국학 디지털 아카이브의 고도서 본문을 한문 원문 중심으로 보존하고, 한글 번역·독음·의미 요약을 함께 제공해 고문헌 접근성을 높이기 위한 작업입니다.

핵심 원칙은 “한문 원문을 canonical 데이터로 유지하고, 번역 결과는 검증 가능한 파생 레이어로 둔다”입니다. 번역문만 남기면 이체자, 인명, 관직명, 지명, 문헌명 검증이 어려워지므로, 공개 Markdown에서도 원문과 출처 URL을 함께 제공합니다.

목표

  • 한문 원문과 한글 번역을 함께 열람할 수 있게 정리합니다.
  • 기사 ID와 출처 URL을 유지해 원문 검증과 재수집이 가능하게 합니다.
  • 책별·본문 묶음별 Markdown 구조를 제공해 GitHub와 검색엔진에서 발견 가능성을 높입니다.
  • 향후 FTS 색인, 엔티티 색인, 지식 그래프 구축의 기반 자료로 사용합니다.

현재 공개 데이터

  • 공개 책 수: 362건
  • 공개 기사 수: 69839건
  • 번역 모델: MiniMax-M2.7
  • 스냅샷 생성 시각: 2026-08-27T04:27:06+09:00 KST

사용 예

  1. 책별 Markdown 목록에서 책을 선택합니다.
  2. 책 디렉터리의 README.md에서 해제와 본문 묶음을 확인합니다.
  3. part-001.md 같은 본문 묶음 파일에서 한글 번역 -> 독음 -> 의미 -> 원문 -> 출처 순서로 검토합니다.