AgenticFocus — пайплайн переработки любого видео от первого лица в датасет для обучения гуманоидных роботов
A new pipeline called AgenticFocus turns first-person videos into training data for humanoid robots. The project tackles the shortage of data for physical AI models. While text data is plentiful, video-action datasets are hard to come by, so this tool aims to fill that gap.
<img src="https://habrastorage.org/getpro/habr/upload_files/51c/cf6/3da/51ccf63dacfd574e6aaff679e4fa8430.jpeg" /><p>Развитие Physical AI сегодня уткнулось в отсутствие достаточного количества данных. Если для обучения VLM мы могли взять огромный объем текстовой информации, который годами копился в интернете, то VLA и world‑action-модели кормить практически нечем, создавать новые датасеты для обучения этих моделей оказалось чуть ли не сложнее, чем разработать конструкцию робота. Хотя люди сняли и выложили в открытый доступ огромное количество видео от первого лица, где руками делают что угодно — готовят, собирают, крутят, хватают, но использовать их в таком виде пока невозможно.</p><p>Я Артём Лыков, руководитель R&D-направления Physical AI в MWS, и сегодня я расскажу вам о том, с какими проблемами сталкивается отрасль, и о том, как мы разработали и протестировали AgenticFocus — пайплайн, который берет любое FPV-видео и превращает его в полноценный датасет для обучения гуманоидных роботов тонкой моторике. Ключевая идея AgenticFocus — разделить видеоряд на несколько полноценных слоев информации — фон, объекты и кинематику конкретного робота.</p> <a href="https://habr.com/ru/articles/1077094/?utm_source=habrahabr&utm_medium=rss&utm_campaign=1077094#habracut">Читать далее</a>
Read full article →