LAION выпустил открытый видео-датасет BVD объемом 10 миллионов часов
Некоммерческая организация LAION представила один из крупнейших открытых видео-датасетов для обучения ИИ, содержащий 10 миллионов часов видеоматериалов. Его выпуск стал возможен благодаря судебному решению, разрешившему сбор защищенного авторским правом контента для некоммерческих исследований.
Некоммерческая организация LAION выпустила Big Video Dataset (BVD) - крупный открытый набор видео для обучения ИИ. В нем 10 миллионов часов видео, 80 миллионов отдельных роликов и 55 миллионов автоматически описанных клипов. LAION заявляет, что из датасета удалены материалы, связанные с сексуальным насилием над детьми.
Созданию BVD помогло решение суда Гамбурга 2024 года. Оно разрешает собирать контент, защищенный авторским правом, для некоммерческих исследований. Это дает научным организациям легальный доступ к обширным материалам для развития ИИ.
Технически BVD уже показал себя хорошо. Модели, обученные на нем, превзошли результаты на эталонном датасете InternVid, улучшив показатели до 2.1 процентного пункта. Такой объем данных дает исследователям мощный ресурс для создания мультимодальных систем.
Выпуск BVD снижает барьер для разработки видео-моделей. Раньше доступ к большим наборам данных был у крупных коммерческих компаний. Академические группы и стартапы часто испытывали дефицит. Открытый датасет такого масштаба позволяет большему числу команд по всему миру работать над созданием продвинутых ИИ.
Акцент LAION на очистке данных от вредоносного контента - ответ на критику в адрес открытых датасетов. Установление нового стандарта может подтолкнуть других распространителей к более строгой модерации. Это снизит риски создания предвзятых или вредоносных моделей. Решение суда 2024 года создало важный юридический прецедент, который может ускорить развитие открытых исследований в области машинного обучения, особенно в Европе. Технический успех моделей, обученных на BVD, демонстрирует практическую ценность такого масштабного и тщательно подготовленного ресурса. Основная задача теперь - обеспечить ответственное и эффективное использование этого массива данных научным сообществом, избегая дублирования усилий и сосредотачиваясь на решении сложных задач, таких как понимание контекста и причинно-следственных связей в видео.


