LAION의 Big Video Dataset은 CommonCrawl에서 찾은 13억개 영상 URL 가운데 8000만개 영상을 내려받아 1000만시간 분량으로 구성했습니다. 여기서 자동 영상 및 음성 설명이 붙은 5500만개 클립과 정지 이미지 3억장을 추출했고, 이 데이터로 학습한 모델은 InternVid 기반 비교 모델보다 영상-텍스트 벤치마크가 최대 2.1%포인트 높았습니다. 데이터와 코드는 연구용으로 공개됐지만 대부분 YouTube와 영어 콘텐츠이고 저작권자 권리를 지켜야 한다는 조건이 붙습니다.
Tech로 돌아가기
Tech
LAION이 1000만시간 규모의 공개 영상 데이터셋을 내놨습니다
영상, 음성, 텍스트를 함께 학습하는 연구 기반이 크게 열렸지만 연구용 조건과 저작권 검토가 필수입니다.