과학기술정보통신부는 ’26.8.27.(목) 「독자 AI 파운데이션 모델」 프로젝트로 확보한 AI 학습용 데이터 29종을 본격 개방한다고 밝혔다.
- 이번에 개방된 데이터는 5개 정예팀이 1차 단계평가 과정에서 구축한 약 3,544만건, 약 1.56조 토큰(추정) 규모로, 대규모 사전학습·멀티모달·레드티밍 등 다양한 유형의 고품질 데이터임.
- 각 팀은 자체 개발 전략에 따라 영상, 텍스트, 음성 등 특화된 데이터를 구축하였으며 품질 및 안전성 검증을 거쳐 AI 허브 누리집에 개방함.
- 이번 데이터는 대한민국 국민이라면 누구나 AI허브를 통해 무료로 활용할 수 있으며, 일부 데이터는 별도 신청 절차를 통해 이용 가능함.
- 과학기술정보통신부는 「독자 AI 파운데이션 모델」의 고도화와 추가 데이터 개방을 지속 추진할 계획임.
<붙임>
1. 정예팀별 데이터 구축·활용 현황 및 개방(안)
2. AI 허브 개방 내용(안)