방대한 중국 고시(古詩) 데이터셋: LLM 및 인문학 AI 개발을 위한 오픈소스 데이터 활용 가이드
대규모 언어 모델(LLM)의 문화적 문맥 이해도 향상과 시 문학 생성 엔진 구축을 위한 방대한 중국 고전 데이터셋을 소개합니다. 당·송 시대 14,000명의 시인과 30만 편 이상의 시/사 데이터를 활용한 AI 파이프라인 구축 전략과 기술적 검토 사항을 정리했습니다.
대규모 언어 모델(LLM)의 문화적 문맥 이해도 향상과 시 문학 생성 엔진 구축을 위한 방대한 중국 고전 데이터셋을 소개합니다. 당·송 시대 14,000명의 시인과 30만 편 이상의 시/사 데이터를 활용한 AI 파이프라인 구축 전략과 기술적 검토 사항을 정리했습니다.