Репост из: RnD ML Team
🤟 DeepMind SL2T: мультиязычная модель перевода жестового языка в текст
📌 TL;DR
DeepMind представила SL2T — модель перевода жестового языка в текст, которая работает на потребительских устройствах (Pixel 11, Gboard, Live Transcribe). Ключевые особенности: приватность через pose-ландмарки (не сырое видео), обучение на 100K+ часов данных по 50+ жестовым языкам, и прямой перевод landmarks → text без промежуточных глоссов. На бенчмарке FLEURS-ASL модель достигает 70 BLEURT (zero-shot), значительно обгоняя предыдущие SOTA (около 50).
🧠 Зачем?
Большинство систем распознавания жестового языка до сих пор в стадии RnD-исследований: либо они требуют разметку глоссов (искусственных текстовых представлений жестов), либо работали только с одним языком и обрабатывали сырое видео, что по мнению авторов создает риск безопасности (спорный поинт).
Можно ли создать единую модель, которая (1) масштабируется на десятки жестовых языков, (2) работает в реальном времени на устройстве, (3) защищает приватность пользователей и (4) не требует промежуточных аннотаций? Ответ — да.
🗂️ Как устроена SL2T
Пайплайн обработки:
Ключевые выводы:
1) Мультиязычность улучшает качество на 50+ языках, помогает модели выявлять общие структуры, что улучшает метрики даже на редких языках;
2) Отказ от глоссов: прямой перевод позволяет модели учиться на нелинейных аспектах жестового языка (мимика, пространственные отношения), которые глоссы не передают;
3) Качество растёт с объёмом данных — нет искусственного потолка из-за ограниченного словаря глоссов.
🧪 Ограничения и открытые вопросы
— Покрытие языков: пока только американский ЖЯ в продуктах; остальные 50+ языков — в исследовательской фазе
— Бенчмарки обычно собраны на чистых данных; реальная вариативность (освещение, ракурсы, скорость жестов) могут сильно влиять на качество
— Не-мануальные компоненты: хотя модель теоретически способна их учитывать, но тема не изучена достаточно хорошо
— Культурная адаптация: жестовые языки тесно связаны с культурным контекстом. А как модель адаптируется к региональным вариациям внутри одного языка? Проблема диалектов остается открытой.
🔗Ссылка: Google DeepMind Blog, 2026
#signlanguage
📌 TL;DR
DeepMind представила SL2T — модель перевода жестового языка в текст, которая работает на потребительских устройствах (Pixel 11, Gboard, Live Transcribe). Ключевые особенности: приватность через pose-ландмарки (не сырое видео), обучение на 100K+ часов данных по 50+ жестовым языкам, и прямой перевод landmarks → text без промежуточных глоссов. На бенчмарке FLEURS-ASL модель достигает 70 BLEURT (zero-shot), значительно обгоняя предыдущие SOTA (около 50).
🧠 Зачем?
Большинство систем распознавания жестового языка до сих пор в стадии RnD-исследований: либо они требуют разметку глоссов (искусственных текстовых представлений жестов), либо работали только с одним языком и обрабатывали сырое видео, что по мнению авторов создает риск безопасности (спорный поинт).
Можно ли создать единую модель, которая (1) масштабируется на десятки жестовых языков, (2) работает в реальном времени на устройстве, (3) защищает приватность пользователей и (4) не требует промежуточных аннотаций? Ответ — да.
🗂️ Как устроена SL2T
Пайплайн обработки:
[Камера] → MediaPipe Holistic (on-device) → Pose landmarks (x, y coords) → [Server] → SL2T Model → Text
Ключевые выводы:
1) Мультиязычность улучшает качество на 50+ языках, помогает модели выявлять общие структуры, что улучшает метрики даже на редких языках;
2) Отказ от глоссов: прямой перевод позволяет модели учиться на нелинейных аспектах жестового языка (мимика, пространственные отношения), которые глоссы не передают;
3) Качество растёт с объёмом данных — нет искусственного потолка из-за ограниченного словаря глоссов.
🧪 Ограничения и открытые вопросы
— Покрытие языков: пока только американский ЖЯ в продуктах; остальные 50+ языков — в исследовательской фазе
— Бенчмарки обычно собраны на чистых данных; реальная вариативность (освещение, ракурсы, скорость жестов) могут сильно влиять на качество
— Не-мануальные компоненты: хотя модель теоретически способна их учитывать, но тема не изучена достаточно хорошо
— Культурная адаптация: жестовые языки тесно связаны с культурным контекстом. А как модель адаптируется к региональным вариациям внутри одного языка? Проблема диалектов остается открытой.
🔗Ссылка: Google DeepMind Blog, 2026
#signlanguage