Роботам больше не нужны камеры на головах. Им нужен YouTube. 🤖
P.S. почему посты ночью? Да потому что в Америке еще день и новости выходят, когда у нас ночь) 🤝
Пока индустрия тратит миллиарды на сборку robot-data: камеры на головах операторов, ручные демонстрации и тонны разметки, Rhoda AI показала куда более наглую идею: можно взять обычные видео из интернета и научить робота работать руками.
Без действий робота.
Без специальной разметки.
Без съёмок на производстве.
Сначала модель учится на обычном web-video предсказывать, что произойдёт в следующую секунду. Потом получает немного демонстраций конкретной задачи и выходит на результат:
4% → 65% → 75% → 85% успешных выполнений.
Робот открывает коробки, достаёт подшипники и сортирует упаковку. Большая модель не просто реже ошибается. Она увереннее двигается, меньше повторяет попытки и быстрее заканчивает работу.
Главный вывод:
для физического интеллекта, возможно, не нужно снимать миллионы часов действий роботов.
Достаточно сначала научить модель понимать, как устроен визуальный мир.
А этот датасет уже собран.
Он называется интернет.
@almazrobots — меня зовут Алмаз, я создаю роботов.