← к ленте

DeepMind представила SL2T: мультиязычную модель перевода жестового языка в текст

D@datastorieslanguagesAI-инженер
2 нед

Google DeepMind анонсировала SL2T — модель для перевода жестового языка в текст, работающую на устройствах и поддерживающую более 50 языков.

Технология делает общение доступнее для людей с нарушениями слуха, позволяя переводить жесты в текст прямо на смартфоне.

  • Позволяет использовать жестовый язык для общения с обычными приложениями без необходимости в переводчике.
  • Обеспечивает приватность, обрабатывая только координаты движений, а не видеопоток.
  • Масштабируемость модели на 50+ языков открывает доступ к технологии пользователям по всему миру.
🤟 DeepMind SL2T: мультиязычная модель перевода жестового языка в текст 📌 TL;DR DeepMind представила SL2T — модель перевода жестового языка в текст, которая работает на потребительских устройствах (Pixel 11, Gboard, Live Transcribe). Ключевые особенности: приватность через pose-ландмарки (не сырое видео), обучение на 100K+ часов данных по 50+ жестовым языкам, и прямой перевод landmarks → text без промежуточных глоссов. На бенчмарке FLEURS-ASL модель достигает 70 BLEURT (zero-shot), значительно обгоняя предыдущие SOTA (около 50). 🧠 Зачем? Большинство систем распознавания жестового языка до сих пор в стадии RnD-исследований: либо они требуют разметку глоссов (искусственных текстовых представлений жестов), либо работали только с одним языком и обрабатывали сырое видео, что по мнению авторов создает риск безопасности (спорный поинт). Можно ли создать единую модель, которая (1) масштабируется на десятки жестовых языков, (2) работает в реальном времени на устройстве, (3) защищает приватность пользователей и (4) не требует промежуточных аннотаций? Ответ — да. 🗂️ Как устроена SL2T Пайплайн обработки:
[Камера] → MediaPipe Holistic (on-device) → Pose landmarks (x, y coords) → [Server] → SL2T Model → Text
Ключевые выводы: 1) Мультиязычность улучшает качество на 50+ языках, помогает модели выявлять общие структуры, что улучшает метрики даже на редких языках; 2) Отказ от глоссов: прямой перевод позволяет модели учиться на нелинейных аспектах жестового языка (мимика, пространственные отношения), которые глоссы не передают; 3) Качество растёт с объёмом данных — нет искусственного потолка из-за ограниченного словаря глоссов. 🧪 Ограничения и открытые вопросы — Покрытие языков: пока только американский ЖЯ в продуктах; остальные 50+ языков — в исследовательской фазе — Бенчмарки обычно собраны на чистых данных; реальная вариативность (освещение, ракурсы, скорость жестов) могут сильно влиять на качество — Не-мануальные компоненты: хотя модель теоретически способна их учитывать, но тема не изучена достаточно хорошо — Культурная адаптация: жестовые языки тесно связаны с культурным контекстом. А как модель адаптируется к региональным вариациям внутри одного языка? Проблема диалектов остается открытой. 🔗Ссылка: Google DeepMind Blog, 2026 #signlanguage

Кратко (AI)

Google DeepMind представила модель SL2T, способную переводить жестовый язык в текст в реальном времени на потребительских устройствах. Модель использует pose-ландмарки вместо видео для обеспечения приватности и поддерживает более 50 жестовых языков, демонстрируя высокую точность на бенчмарке FLEURS-ASL.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖