Нейросеть Kandinsky будут использовать для обучения роботов законам физики

Модель станет полноценным помощником для разработчиков беспилотных такси, роботов и промышленных систем.
Редакция сайта
Редакция сайта
Нейросеть Kandinsky будут использовать для обучения роботов законам физики
Архивы пресс-службы

Сбер выпустил семейство генеративных моделей Kandinsky WM 1.0. Они обучены генерировать видео, более точно соответствующие законам физики и пригодные для обучения систем Physical AI.

РЕКЛАМА – ПРОДОЛЖЕНИЕ НИЖЕ

В основе моделей — Kandinsky 5.0 Video Lite, дополнительно обученная на видео с камер роботов, беспилотных автомобилей и записях промышленных процессов. Эти данные пригодятся там, где реальные съемки невозможны или сильно затруднены: они могут генерировать видео редких, сложных или опасных сценариев для тренировки роботов и беспилотного транспорта. 

Код и веса нейросетей опубликованы под лицензией MIT – и доступны всем разработчикам мира бесплатно.
робот-курьер
Magnific
Продолжение ниже Продолжение

Почему так сложно обучать Physical AI

Physical AI или физический ИИ — класс систем искусственного интеллекта, которые способны воспринимать физический мир, понимают его динамику и могут управлять реальными устройствами. В отличие от языковых моделей, для физического ИИ просто нет открытых обучающих данных в достаточном масштабе. Собирать такие данные очень сложно и дорого: нужны устройства, датчики, операторы, контролируемая среда. Автомобиль с камерами и датчиками накапливает порядка 5000 часов записей в год, тогда как современным моделям нужны миллионы часов. А многие редкие и сложные сценарии, например, ДТП, экстремальную погоду, отказы оборудования — вообще нельзя воспроизвести вживую.

РЕКЛАМА – ПРОДОЛЖЕНИЕ НИЖЕ

По оценке Яна Лекуна, лауреата премии Тьюринга и одного из «отцов» глубокого обучения, четырехлетний ребенок только через зрение получает больше информации, чем содержится во всех текстах, на которых обучены крупнейшие языковые модели. Поэтому следующий рубеж физического ИИ — обучение на видео, а синтетические данные становятся ключевым способом закрыть разрыв в объемах.

РЕКЛАМА – ПРОДОЛЖЕНИЕ НИЖЕ
обучение роботов
Magnific

Создаваемые моделями Kandinsky WM видео длятся около 5 секунд и отражают отдельные действия: манипуляции с предметами (взял, положил, разрезал), дорожные ситуации (перестроение, проезд перекрёстка), этапы производственных процессов — базовые «кирпичики», из которых складывается обучение автономных систем. Это первое поколение нейросетей на пути к полноценным моделям мира– системам, способным моделировать развитие сцены во времени и служить симуляторами для обучения и тестирования роботов. Кроме генерации данных, такие нейросети могут выступать основой для систем управления: выученная при генерации видео физическая интуиция, переносится в модели действий роботов.

РЕКЛАМА – ПРОДОЛЖЕНИЕ НИЖЕ

Как обучали Kandinsky WM 

Базовые модели генерации видео иногда нарушают простые физические законы: объекты деформируются, перспектива искажается, движения выглядят неестественно. Чтобы повысить физическую достоверность, команда дообучила нейросеть на нескольких миллионах реальных видеосцен — автомобили, роботы, промышленные процессы, сложные движения объектов. Отдельные направления, например автомобильные сцены, дополнительно улучшили с помощью обучения с подкреплением: специальные модели оценивали ролики на предмет сохранения формы объектов, геометрии и естественности движения. На основе этой обратной связи Kandinsky учился создавать более физически правдоподобные видео.

РЕКЛАМА – ПРОДОЛЖЕНИЕ НИЖЕ
Magnific
РЕКЛАМА – ПРОДОЛЖЕНИЕ НИЖЕ

Кому будут полезны новые модели

Такие модели пригодятся разработчикам беспилотного транспорта, от легковых автомобилей до грузовиков и роботакси, компаниям в сфере промышленной автоматизации: производителям манипуляторов, промышленных, сервисных и антропоморфных роботов, командам, внедряющим компьютерное зрение на производствах и складах. Не меньше они полезны исследователям, университетам и стартапам, которых важно экономить ресурсы при сборе обучающих данных. 

Модели уже применяет Центр робототехники Сбера для обучения собственных роботов, а также институт AIRI в своем дорожном симуляторе.

Загружаем