설명
1. 데이터 개요
이 데이터는 인공지능(AI)이 생성한 한국어 문장의 사실 여부를 검증할 수 있도록 만든 자료입니다.문장을 작은 의미 단위(단일 사실, Atomic Fact)로 분해하고, 각 사실이 참인지 거짓인지 구분할 수 있도록 정답 라벨과 평가 코드를 함께 제공합니다. 이를 통해 다양한 언어모델의 사실성 생성·판단 능력을 쉽게 비교·평가할 수 있습니다.
2. 주요 특징
- 문장 분해 데이터 제공: 한국어 생성 문장을 단일 사실 단위로 나눈 결과 포함
- 정답 라벨 포함: 각 단일 사실의 진위 여부(참/거짓) 제공
- 범용 활용 가능: 특정 모델에 제한되지 않고, GPT·Gemini·LLaMa 등 다양한 모델에 적용 가능
- 평가 코드 제공: 사용자가 데이터를 내려받아 바로 실험을 재현할 수 있도록 Python 코드 포함
3. 데이터 예시
- 원문 문장: “홍인한은 조선 후기의 문인이자 정치가이다.”
- 분해된 단일 사실:
홍인한은 조선 후기의 사람이다.
홍인한은 문인이다.
홍인한은 정치가이다.
정답 라벨: [참, 참, 참]
4. 데이터 구성
- 생성 문서 데이터 (AI가 생성한 문장)
- 단일 사실 데이터 (문장을 분해한 작은 의미 단위)
- 정답 라벨 데이터 (참/거짓)
- 평가 코드 (Python 기반, 재현 가능)