Репост из: Мысли Рвачева
🤖 Varun Nair нарисовал "пирамиду данных для робототехники" - неплохая карта того, чем на самом деле кормят современные VLA-модели.
В основе любой embodied AI лежит один компромисс: fidelity против scalability. Чем ближе данные к реальному роботу, тем меньше их можно собрать, чем их больше - тем дальше они от того, что робот должен делать руками.
Пирамида из пяти слоев, сверху вниз - от дорогого и точного к дешевому и массовому:
- Teleoperation - человек напрямую управляет тем самым роботом, час оператора дает час данных один к одному. Так собран DROID (Stanford, Berkeley, TRI и еще 13 институтов) - 76 тысяч траекторий, 350 часов, 18 одинаковых Franka Panda с Oculus Quest на трех континентах.
- Hand-held grippers в стиле UMI - человек держит в руке сам захват робота без манипулятора, GoPro снимает происходящее, а навык потом переносится на любое железо. DexCap делает то же самое перчатками с motion capture.
- Simulation - неограниченное число прогонов, но плата за это - sim-to-real gap: физика и рендер в симуляции немного лгут, и навык, отточенный в Isaac Lab или ManiSkill, на реальном роботе иногда рассыпается.
- Egocentric video - Ego4D и Ego-Exo4D сняты на человеческие руки от первого лица, действия не записаны роботом, а восстановлены из видео.
- Random internet video & text - вроде HowTo100M: миллион роликов с YouTube, веб-масштаб, но ни тела, ни действий робота там нет.
Индустрия делает ставки на разные слои. Figure AI и 1X строят собственный флот роботов, чтобы владеть данными целиком. Tesla в 2025 году отказалась от mocap-костюмов для телеоперации в пользу камер на шлеме и рюкзаке - ставка на то, что научить можно и на обычном видео. Physical Intelligence и Skild AI (оценка около $14 млрд после раунда в январе 2026) собирают одну универсальную модель поверх смеси всех пяти слоев сразу. Стартап XDOF в 2026 году поднял $70 млн под инфраструктуру именно для верхних, теле-операционных слоев и выпустил ABC-130K - крупнейший открытый датасет телеоперации, 130 тысяч демонстраций.
https://x.com/_varunnair/status/2081619067535065103
#ai@rvnikita_blog #robotics@rvnikita_blog #vla@rvnikita_blog #varun_nair@rvnikita_blog
—————————
Мысли Рвачева
—————————
В основе любой embodied AI лежит один компромисс: fidelity против scalability. Чем ближе данные к реальному роботу, тем меньше их можно собрать, чем их больше - тем дальше они от того, что робот должен делать руками.
Пирамида из пяти слоев, сверху вниз - от дорогого и точного к дешевому и массовому:
- Teleoperation - человек напрямую управляет тем самым роботом, час оператора дает час данных один к одному. Так собран DROID (Stanford, Berkeley, TRI и еще 13 институтов) - 76 тысяч траекторий, 350 часов, 18 одинаковых Franka Panda с Oculus Quest на трех континентах.
- Hand-held grippers в стиле UMI - человек держит в руке сам захват робота без манипулятора, GoPro снимает происходящее, а навык потом переносится на любое железо. DexCap делает то же самое перчатками с motion capture.
- Simulation - неограниченное число прогонов, но плата за это - sim-to-real gap: физика и рендер в симуляции немного лгут, и навык, отточенный в Isaac Lab или ManiSkill, на реальном роботе иногда рассыпается.
- Egocentric video - Ego4D и Ego-Exo4D сняты на человеческие руки от первого лица, действия не записаны роботом, а восстановлены из видео.
- Random internet video & text - вроде HowTo100M: миллион роликов с YouTube, веб-масштаб, но ни тела, ни действий робота там нет.
Индустрия делает ставки на разные слои. Figure AI и 1X строят собственный флот роботов, чтобы владеть данными целиком. Tesla в 2025 году отказалась от mocap-костюмов для телеоперации в пользу камер на шлеме и рюкзаке - ставка на то, что научить можно и на обычном видео. Physical Intelligence и Skild AI (оценка около $14 млрд после раунда в январе 2026) собирают одну универсальную модель поверх смеси всех пяти слоев сразу. Стартап XDOF в 2026 году поднял $70 млн под инфраструктуру именно для верхних, теле-операционных слоев и выпустил ABC-130K - крупнейший открытый датасет телеоперации, 130 тысяч демонстраций.
https://x.com/_varunnair/status/2081619067535065103
#ai@rvnikita_blog #robotics@rvnikita_blog #vla@rvnikita_blog #varun_nair@rvnikita_blog
—————————
Мысли Рвачева
—————————