ㅁ 소개 : 어린이 교육용 방송 영상(EBS, KBS)으로부터 수집한 어린이 교육 방송 영상을 활용하여, 어린이 음성/맥락 인식률 향상을 위한 방송 음성 및 자연어 처리 학습용 데이터셋을 구축 ㅁ 구축목적 : 현재까지 음성인식 학습용 데이터와 STT 모델은 성인 음성 위주이며, 공개된 어린이 음성의 경우 단편적인 내용을 다루는 짧은 문장 위주로 구성된 한계가 존재하므로, 최근 SOTA 모델에 부합하도록 풍부한 내용의 긴 문장과 맥락인식 정보를 포함하는 어린이 음성 데이터 구축 필요 ㅁ 원본 데이터 URL: https://www.aihub.or.kr/aihubdata/data/view.do?searchKeyword=%EA%B3%A0%EC%96%91%EC%8B%9C&aihubDataSe=data&dataSetSn=71502
매체유형
텍스트
확장자
JSON
전체 행
1
키워드
AI,인공지능,아동,발달,자막
데이터 한계
AI허브에서 다운로드 받은 데이터로 학습하여 만들어진 AI모델과 서비스는 자유롭게 배포, 활용 가능. AI허브 데이터를 활용해 개발한 모델을 영리적으로 판매, 활용하는 행위는 제한하지 않으나 AI허브 데이터를 사용하였음을 명시하여야 함. 다만, NIA 및 구축기업과 사전 협의한 경우를 제외하고 데이터를 재가공하여 배포하는 행위는 원칙적으로 불가.
공간범위
시간범위
제공형태
전자기록매체 저장 제공
다운로드(바로가기)
57
등록일
2025-08-16
수정일
2026-06-16
기타 유의사항
- 본 데이터는 샘플데이터로 원본 데이터는 AI허브(https://www.aihub.or.kr/)를 통해 로그인 후 다운로드 가능합니다. - JSON 파일은 VSCode 등 해당 파일을 확인할 수 있는 소프트웨어를 이용해주시기 바랍니다.