ai 이미지 학습 데이터셋 구축 현황
정부 주도로 구축된 대규모 AI 학습 데이터셋의 공개 현황과 그 규모를 소개합니다. 이미지, 영상, 음성 등 다양한 형태의 데이터가 어떤 방식으로 학습에 활용되는지, 그리고 연구자와 기업이 어떻게 접근할 수 있는지 정보를 제공합니다.
광고
최근 인공지능(AI) 기술의 발전과 함께 'AI 이미지 학습'에 사용되는 데이터셋의 중요성이 크게 부각되고 있습니다. AI 모델의 성능은 학습 데이터의 규모와 질에 크게 좌우되기 때문에, 어떤 종류의 데이터를 어떻게 구축하고 공개하는지에 대한 관심이 높습니다. 특히 이미지 데이터 외에도 영상, 음성 등 다양한 형태의 멀티모달 데이터가 AI 학습의 핵심 요소로 작용하고 있습니다.
이 글에서는 정부 주도 하에 국내 주요 기업 및 연구기관들이 구축한 대규모 AI 학습 데이터의 현황에 대해 안내합니다. 과학기술정보통신부와 한국지능정보사회진흥원(NIA)을 통해 공개되는 데이터의 종류와 규모를 확인할 수 있습니다. 네이버클라우드, 업스테이지, SK텔레콤, NC AI, LG AI연구원 등 참여 기관들이 어떤 데이터를 확보했으며, 이러한 데이터들이 AI의 영상 이해나 모델 학습에 어떻게 활용될 수 있는지 구체적인 내용을 중심으로 살펴보겠습니다.
#AI 파운데이션 모델 개발을 위한 대규모 데이터셋 구축
정부가 독자 인공지능(AI) 파운데이션 모델 프로젝트에 참여한 5개 정예팀이 개발 과정에서 확보한 대규모 AI 학습 데이터를 공개합니다 [1]. 과학기술정보통신부와 한국지능정보사회진흥원(NIA)은 네이버클라우드, 업스테이지, SK텔레콤, NC AI, LG AI연구원이 1차 단계평가 과정에서 구축한 29종의 데이터를 AI허브 누리집을 통해 공개한다고 밝혔습니다 [1]. 공개되는 데이터는 약 3천544만 건, 추정 1.56조 토큰 규모입니다 [1]. 이 정도 규모는 이론적으로 700억∼800억 개 파라미터 수준의 대형 AI 모델 학습에 활용 가능한 규모입니다 [1].
공개되는 데이터에는 다음과 같은 내용이 포함됩니다.
- 데이터 종류: 대규모 사전학습 데이터부터 시작하여, 영상·음성 등 멀티모달 데이터, 그리고 AI 안전성 확보를 위한 레드티밍 데이터까지 포함됩니다 [1].
- 참여사별 구축 내용:
- 네이버클라우드: 공개 영상 234만 건과 방송 영상 52만 건, 영상 클립을 기반으로 한 텍스트 1천550만 건, 음성 질의응답 1천200만 건을 구축했습니다 [1]. 이 중 영상 장면을 문장 단위로 설명하는 캡션 등이 포함되어 AI의 영상 이해와 이미지 생성 모델 학습에 활용 가능합니다 [1].
- 업스테이지: 1조 토큰 규모의 사전학습 데이터와 50만 건의 사후학습 데이터를 마련했으며, 사후학습 데이터에는 추론·판단·실행 등이 포함되어 AI 에이전트 개발에 활용할 수 있습니다 [1].
- SK텔레콤: 수학·과학·법률 등 전문 분야의 고난도 다단계 추론 데이터와 음성·이미지 기반 사후학습 데이터, 그리고 국내 법령과 한국 사회의 보편적 가치관을 반영한 한국형 레드티밍 데이터 약 1만 건을 구축했습니다 [1].
- NC AI: 제조 분야 기술문서와 민원 상담 음성 등 실제 산업 현장 데이터를 활용하여 긴 문맥 이해, 단계별 추론, 멀티턴 대화, 질의응답, 멀티모달리티 등 AI 핵심 역량 관련 데이터 7종을 구축했습니다 [1].
- LG AI연구원: 국내 가정환경에 특화한 피지컬 AI용 멀티모달 데이터셋을 마련하기 위해 실제 50개 가정에서 50종 이상의 가사 활동을 촬영하여 17만 개 이상의 영상 클립을 만들고 객체·분할·자세·맥락 정보 등을 다층적으로 라벨링했습니다 [1].
이러한 공개 데이터는 AI허브의 '독자AI모델 데이터' 항목에서 국내 기업, 연구자, 학생 등 누구나 무료로 이용할 수 있습니다 [1]. 다만, 일부 데이터는 안전한 온라인 환경에서 활용할 수 있는 '안심존'을 통해 별도 신청이 필요합니다 [1].
관련 글: AI로 영어 공부하기: 회화·작문·단어를 혼자서 끝내는 방법

광고
#학습에 활용되는 데이터의 종류와 구성 요소
네이버클라우드는 공개 영상 234만건과 방송 영상 52만건을 구축하였으며, 영상 클립을 기반으로 한 텍스트 1천550만건과 음성 질의응답 1천200만건이 포함되어 있습니다 [1]. 이러한 데이터에는 영상 장면을 문장 단위로 설명하는 캡션 등이 포함되어 있어 AI의 영상 이해와 이미지 생성 모델 학습에 활용될 수 있습니다 [1]. 업스테이지는 1조 토큰 규모의 사전학습 데이터와 50만건의 사후학습 데이터를 마련하였으며, 사후학습 데이터에는 추론·판단·실행 등이 포함되어 AI 에이전트 개발에 활용될 수 있습니다 [1]. SK텔레콤은 수학·과학·법률 등 전문 분야의 고난도 다단계 추론 데이터 외에도 음성·이미지 기반 사후학습 데이터, 그리고 국내 법령과 한국 사회의 보편적 가치관을 반영한 한국형 레드티밍 데이터 약 1만건을 구축하였습니다 [1]. NC AI는 제조 분야 기술문서와 민원 상담 음성 등 실제 산업 현장 데이터를 활용하여 다음과 같은 데이터 7종을 구축하였습니다 [1]:
- 긴 문맥 이해 [1]
- 단계별 추론 [1]
- 멀티턴 대화 [1]
- 질의응답 [1]
- 멀티모달리티 [1] LG AI연구원은 국내 가정환경에 특화한 피지컬 AI용 멀티모달 데이터셋을 마련하였습니다 [1]. 이 데이터는 실제 50개 가정에서 50종 이상의 가사 활동을 촬영하여 17만개 이상의 영상 클립을 만들고, 객체·분할·자세·맥락 정보 등을 다층적으로 라벨링한 것이 포함됩니다 [1].
관련 글: 멀티모달 AI란? 보고 듣고 말하는 인공지능의 시대
#AI 학습 데이터의 규모와 공개 범위
정부가 독자 인공지능(AI) 파운데이션 모델 프로젝트에 참여한 5개 정예팀이 개발 과정에서 확보한 대규모 AI 학습 데이터를 공개합니다 [1]. 과학기술정보통신부와 한국지능정보사회진흥원(NIA)은 네이버클라우드, 업스테이지, SK텔레콤, NC AI, LG AI연구원이 1차 단계평가 과정에서 구축한 29종의 데이터를 AI허브 누리집을 통해 공개한다고 밝혔습니다 [1]. 이 공개 데이터는 약 3천544만 건, 추정 1.56조 토큰 규모입니다 [1]. 이는 이론적으로 700억∼800억개 파라미터 수준의 대형 AI 모델 학습에 활용 가능한 규모입니다 [1]. 공개되는 데이터에는 대규모 사전학습 데이터 외에도 영상·음성 등 멀티모달 데이터와 AI 안전성 확보를 위한 레드티밍 데이터가 포함됩니다 [1].
참여사별로 구축된 데이터의 특징은 다음과 같습니다.
- 네이버클라우드는 공개 영상 234만 건과 방송 영상 52만 건, 영상 클립 기반 텍스트 1천550만 건, 음성 질의응답 1천200만 건을 구축했으며, 영상 장면을 문장 단위로 설명하는 캡션 등이 포함되어 있어 AI의 영상 이해와 이미지 생성 모델 학습에 활용될 수 있습니다 [1].
- 업스테이지는 1조 토큰 규모의 사전학습 데이터와 50만 건의 사후학습 데이터를 마련했으며, 사후학습 데이터에는 추론·판단·실행 등이 포함되어 AI 에이전트 개발에 활용될 수 있습니다 [1].
- SK텔레콤은 수학·과학·법률 등 전문 분야의 고난도 다단계 추론 데이터와 음성·이미지 기반 사후학습 데이터, 그리고 국내 법령과 한국 사회의 보편적 가치관을 반영한 한국형 레드티밍 데이터 약 1만 건을 구축했습니다 [1].
- NC AI는 제조 분야 기술문서와 민원 상담 음성 등 실제 산업 현장 데이터를 활용하여 긴 문맥 이해, 단계별 추론, 멀티턴 대화, 질의응답, 멀티모달리티 등 AI 핵심 역량과 관련된 데이터 7종을 구축했습니다 [1].
- LG AI연구원은 국내 가정환경에 특화한 피지컬 AI용 멀티모달 데이터셋을 마련했으며, 실제 50개 가정에서 50종 이상의 가사 활동을 촬영하여 17만 개 이상의 영상 클립을 만들고 객체·분할·자세·맥락 정보 등을 다층적으로 라벨링했습니다 [1].
이번 공개를 위해 NIA와 한국정보통신기술협회(TTA)는 데이터 품질과 개인정보·유해성 여부 등을 검증했으며, 라이선스 제약이 있는 데이터는 제외되었습니다 [1]. 사업 참여 조건에 따라 구축·가공 예산으로 확보한 데이터의 50% 이상을 공개해야 하지만, LG AI연구원을 제외한 나머지 참여사들은 검증을 거친 데이터를 모두 공개하기로 했습니다 [1]. 공개된 데이터는 AI허브의 '독자AI모델 데이터' 항목에서 국내 기업과 연구자, 학생 등 누구나 무료로 이용할 수 있으며, 일부 데이터는 '안심존'을 통해 별도 신청해야 합니다 [1].

#데이터셋을 통한 AI 모델 학습 활용 사례
네이버클라우드는 공개된 데이터 중 영상 클립을 기반으로 한 텍스트 데이터와 음성 질의응답 데이터가 마련되어 있어, 영상 장면을 문장 단위로 설명하는 캡션 등이 AI의 영상 이해와 이미지 생성 모델 학습에 활용될 수 있습니다 [1]. 업스테이지가 마련한 사후학습 데이터에는 추론, 판단, 실행 등이 포함되어 있어 AI 에이전트 개발에 활용될 수 있습니다 [1]. SK텔레콤은 수학, 과학, 법률 등 전문 분야의 고난도 다단계 추론 데이터 외에도 음성 및 이미지 기반의 사후학습 데이터와 국내 법령 및 한국 사회의 보편적 가치관을 반영한 한국형 레드티밍 데이터를 구축하였습니다 [1]. NC AI는 제조 분야 기술문서와 민원 상담 음성 등 실제 산업 현장 데이터를 활용하여 긴 문맥 이해, 단계별 추론, 멀티턴 대화, 질의응답, 멀티모달리티 등 AI 핵심 역량과 관련된 데이터 7종을 구축하였습니다 [1]. LG AI연구원은 국내 가정환경에 특화한 피지컬 AI용 멀티모달 데이터셋을 준비했으며, 실제 가정에서 촬영한 영상 클립에 객체, 분할, 자세, 맥락 정보 등을 다층적으로 라벨링하였습니다 [1].
광고
#데이터 품질 검증 및 접근 방법
공개되는 데이터는 NIA와 한국정보통신기술협회(TTA)의 검증을 거쳤으며, 이 과정에서 데이터의 품질과 개인정보 및 유해성 여부 등이 검증되었습니다 [1]. 데이터 품질 검증을 거치는 과정에서 라이선스 제약이 있는 데이터는 제외되었습니다 [1].
공개 데이터는 AI허브의 '독자AI모델 데이터' 항목에서 국내 기업, 연구자, 학생 등 누구나 무료로 이용할 수 있습니다 [1]. 다만, 일부 데이터는 안전한 온라인 환경에서 활용할 수 있도록 별도의 신청을 통해 '안심존'을 이용해야 합니다 [1].
참여 기업들의 데이터 공개 의무와 관련하여, 사업 참여 조건에 따라 구축·가공 예산으로 확보한 데이터의 50% 이상을 공개해야 하는 조건이 있었습니다 [1]. 하지만 LG AI연구원을 제외한 나머지 참여사들은 검증을 거친 데이터를 모두 공개하기로 했습니다 [1].
과학기술정보통신부는 2차 단계평가 과정에서 구축된 데이터에 대해서도 품질검증 등을 거쳐 개방할 예정입니다 [1].
#한눈에 보는 비교
| 참여사 | 구축 데이터 종류 | 데이터 규모/특징 | 출처 |
|---|---|---|---|
| 네이버클라우드 | 영상, 텍스트, 음성 | 공개 영상 234만건 등 [1] | [1] |
| 업스테이지 | 사전학습, 사후학습 | 1조 토큰 규모 사전학습 [1] | [1] |
| SK텔레콤 | 추론, 사후학습, 레드티밍 | 전문 분야 추론 데이터 등 [1] | [1] |
| NC AI | 산업 현장 데이터 | 핵심 역량 관련 데이터 7종 [1] | [1] |
| LG AI연구원 | 피지컬 AI 멀티모달 | 50개 가정 50종 이상 활동 촬영 [1] | [1] |
#정리
정부 주도로 진행된 독자 인공지능(AI) 파운데이션 모델 프로젝트에 참여한 5개 정예팀이 개발 과정에서 확보한 대규모 AI 학습 데이터가 공개되었습니다 [1]. 과학기술정보통신부와 한국지능정보사회진흥원(NIA)은 네이버클라우드, 업스테이지, SK텔레콤, NC AI, LG AI연구원이 구축한 29종의 데이터를 AI허브 누리집을 통해 공개합니다 [1]. 공개되는 데이터는 약 3천544만 건, 추정 1.56조 토큰 규모이며, 대규모 사전학습 데이터 외에도 영상·음성 기반 데이터, AI 안전성 확보를 위한 레드티밍 데이터 등이 포함되어 AI의 영상 이해나 이미지 생성 모델 학습 등에 활용될 수 있습니다 [1]. 공개 데이터는 AI허브의 '독자AI모델 데이터' 항목에서 국내 기업, 연구자, 학생 등 누구나 무료로 이용할 수 있으며, 일부 데이터는 '안심존'을 통해 별도 신청이 필요합니다 [1]. 더불어, 과기정통부는 2차 단계평가 과정에서 구축된 데이터에 대해서도 품질검증 등을 거쳐 개방할 예정입니다 [1]. 이용에 관한 자세한 사항은 AI허브 누리집을 통해 확인하시기 바랍니다 [1].
관련 글: 2026년 주목할 AI 트렌드 7가지: 에이전트부터 온디바이스까지
#참고 자료
- AI픽 독파모 5개팀 AI 학습데이터 푼다…1.56조 토큰 공개 — 연합뉴스 (2026-08-27)
이 글은 위 참고 자료를 바탕으로 정리했습니다. 제품 사양·서비스 정책은 바뀔 수 있으니 최신 내용은 공식 안내에서 확인해 주세요.
이 글이 도움이 되었다면 공유해 주세요 🙂
자주 묻는 질문
공개되는 AI 학습 데이터는 어디서 확인할 수 있나요?
해당 데이터는 AI허브의 '독자AI모델 데이터' 항목에서 확인하실 수 있습니다.
데이터를 이용하는 비용이나 조건이 있나요?
공개 데이터는 국내 기업, 연구자, 학생 등 누구나 무료로 이용할 수 있습니다. 다만, 일부 데이터는 '안심존'을 통해 별도 신청이 필요합니다.
각 참여 기관별로 어떤 데이터를 구축했나요?
네이버클라우드는 영상 및 음성 질의응답 데이터를, 업스테이지는 사전학습 데이터와 사후학습 데이터를, SK텔레콤은 전문 추론 및 레드티밍 데이터를 구축했습니다.
광고
글쓴이
OPENBLOG 편집팀
글은 AI 도구로 초안을 작성합니다. 2026년 10월 1일부터 새 글은 운영자가 공공기관·공식 자료로 사실관계를 확인하고 승인한 뒤 발행하는 것이 기본 절차입니다. 닥터쓰리 건강 연재는 운영자 설정에 따라 AI 출처 대조와 자동 품질 검사 후 별도 승인 없이 발행하며 “자동 검사”로 표시합니다. 그 이전에 발행된 글은 순서대로 다시 검토하고 있습니다. 검수를 마친 글에는 검수자와 날짜를 표시합니다.
AI 도구로 초안을 작성했습니다. 검수: 자동 검수 · 2026년 10월 4일
가격·운영시간·제도·서비스 조건처럼 바뀔 수 있는 정보는 이용 전에 공식 홈페이지 등 공식 채널에서 다시 확인해 주세요.
이 글의 저작권은 OPENBLOG에 있습니다. 개인적·비상업적 용도의 링크 공유는 자유이며, 무단 전재·복제·재배포는 금합니다.



