Сбер запустил нейросети Kandinsky WM, предназначенные для обучения роботов и беспилотных аппаратов

Сбер анонсировал новое семейство генеративных моделей Kandinsky WM 1.0 для создания видео, которое соответствует физическим законам — эти технологии необходимы разработчикам роботов и беспилотных транспортных средств.

Сбер представил новое семейство генеративных моделей

Kandinsky 5.0Источник: Сбер

 WM 1.0, которые предназначены для синтеза видео, соответствующего физическим законам. Эта разработка ориентирована на задачи Physical AI — систем искусственного интеллекта, способных воспринимать реальный мир, понимать его динамику и управлять физическими устройствами. Код и веса моделей доступны на Hugging Face под лицензией MIT и предоставляются бесплатно.

В основе Kandinsky WM лежит нейросеть Kandinsky 5.0 Video Lite, дообученная на нескольких миллионах реальных видеозаписей: данных с камер роботов, беспилотных автомобилей и промышленных объектов. Для автомобильных сценариев использовалось обучение с подкреплением — специальные модели оценивали видео по сохранению формы объектов, геометрии и естественности движений, а на основе этой обратной связи Kandinsky WM научился генерировать более правдоподобные кадры.

Каждое видео длится около пяти секунд и фиксирует одно действие: манипуляцию с предметом, дорожную ситуацию или этап производственного процесса. Именно такие «кирпичики» необходимы для обучения автономных систем — особенно в тех случаях, когда реальные съемки невозможны или опасны: ДТП, сложные погодные условия, отказы оборудования.

Ключевая проблема, которую решают модели, — нехватка данных. Автомобиль с камерами и датчиками накапливает около 5000 часов записей в год, тогда как современным моделям Physical AI требуется миллионы часов. Ян Лекун, лауреат премии Тьюринга, подчеркивал, что четырехлетний ребенок только через зрение получает больше информации, чем содержится во всех текстах, на которых обучены крупнейшие языковые модели. Синтетическое видео призвано устранить этот разрыв.

«Наши модели обучаются на видео реального мира и позволяют “прожить” виртуально те сценарии, которые опасно или невозможно воспроизвести. Это шаг к моделям мира — системам, которые понимают физическую реальность, предсказывают, что произойдет дальше, и могут действовать в ней самостоятельно», — говорит Денис Димитров, CTO Kandinsky и управляющий директор по исследованию данных Сбера.

Модели уже используются Центром робототехники Сбера для тренировки собственных роботов, а также институтом AIRI — в дорожном симуляторе. Целевая аудитория разработки — компании в области беспилотного транспорта, производители манипуляторов и промышленных роботов, команды, внедряющие компьютерное зрение на производствах и складах, а также университеты и стартапы. Технические детали о разработке команда опубликовала на Хабре.

Фото: hi-tech.mail.ru

Оцените статью
Dfiles.ru