ИИ учится читать жесты: как переводчик языка жестов попадает в телефоны
Модели распознавания языка жестов выходят из лабораторий в приложения на смартфонах. Разбираем, что уже работает на устройстве, где точность проседает и почему сообщество глухих пока осторожно.

Перевод языка жестов в текст долго оставался витриной научных конференций: демо на сцене, датасет из тысячи роликов, точность «в идеальных условиях». Сейчас часть этой техники переехала в приложения, которые запускаются прямо на смартфоне, без отправки видео на сервер. Google в 2020 году выпустил пайплайн распознавания рук для фреймворка MediaPipe, который отслеживает 21 точку кисти в реальном времени на мобильном процессоре. На этой основе выросли десятки экспериментов и коммерческих приложений, обещающих переводить жесты в текст и обратно.
Но между «камера видит руку» и «человек понял собеседника» лежит пропасть. Язык жестов — это не алфавит из букв, показанных пальцами. Это грамматика с мимикой, положением корпуса, скоростью и пространством перед говорящим. И именно здесь ИИ пока спотыкается.
Что уже умеет техника на устройстве
Ключевой сдвиг последних лет — распознавание работает на самом телефоне, а не в облаке. Это важно по трём причинам: задержка падает до десятков миллисекунд, видео с руками и лицом не улетает на чужой сервер, и приложение работает без интернета.
MediaPipe Hands отслеживает ладонь по ключевым точкам — фалангам, суставам, кончикам пальцев. Поверх этого скелета обучают классификатор, который сопоставляет конфигурацию руки с жестом. Для дактиля* — показа отдельных букв — такой подход даёт неплохой результат: набор поз конечен, движения относительно статичны.
Сложнее с полноценными знаками. Один жест в американском ASL или русском РЖЯ может отличаться от другого только направлением движения или выражением лица. Модели приходится анализировать не кадр, а последовательность кадров, и подключать распознавание позы тела и мимики — а это уже другой вес и другая нагрузка на процессор.
Распознать букву, показанную пальцами, и понять фразу на языке жестов — задачи разной сложности. Первую телефон решает сегодня, вторую — пока с оговорками.
Где точность проседает
Разработчики, которые честно публикуют метрики, называют несколько узких мест:
- Освещение и фон. Модель, обученная на студийных роликах, теряет руки на пёстром фоне или в полумраке.
- Скорость и слитность. В живой речи жесты сливаются, как слова в беглом разговоре. Датасеты чаще состоят из изолированных знаков, показанных по одному.
- Мимика и грамматика. Вопрос, отрицание, условие в жестовых языках задаются лицом и бровями. Классификатор рук их не видит.
- Региональные варианты. У РЖЯ, как и у ASL, есть диалекты. Модель, натренированная на одном корпусе, хуже понимает носителей из другого региона.
Отдельная проблема — данные. Крупных размеченных датасетов языка жестов на порядки меньше, чем текста или обычного видео. Разметка требует носителей языка, а не разметчиков-фрилансеров, и стоит дорого.
Кто и что предлагает
Ниже — обзор типов решений, а не рейтинг: цифры точности сильно зависят от условий теста, поэтому относитесь к рекламным «99%» скептически.
| Тип решения | Что делает | Ограничение |
|---|---|---|
| Распознавание дактиля | Переводит показанные пальцами буквы в текст | Только алфавит, не связная речь |
| Распознавание изолированных знаков | Определяет отдельные слова-жесты из словаря | Плохо работает на слитной речи |
| Аватар-синтез (текст → жест) | Показывает 3D-персонажа, «проговаривающего» текст жестами | Механичность, потеря мимики и естественности |
| Видеосвязь с сурдопереводчиком | Соединяет с живым человеком-переводчиком | Не ИИ, зависит от доступности оператора и платы |
Стоит развести две вещи. Технологические гиганты вкладываются в инструменты для разработчиков — тот же MediaPipe бесплатен и открыт. А готовые приложения-переводчики чаще делают небольшие команды, и качество у них очень разное.
Почему сообщество глухих осторожно
Организации глухих регулярно предупреждают: автоматический переводчик, который выдаёт «примерно правильный» результат в юридической, медицинской или экстренной ситуации, опаснее его отсутствия. Ошибка в переводе «не давать препарат» и «давать препарат» стоит жизни, а не оценки в отзыве.
Второй аргумент — язык жестов создан глухими и для глухих. Проекты, где систему проектируют слышащие инженеры без плотного участия носителей, воспроизводят чужое представление о языке. Отсюда требование: разработка совместно с сообществом, а не «для» него.
Третий момент — приватность. Видео рук и лица — это биометрия. Обработка на устройстве снимает часть рисков, но как только приложение начинает «дообучаться на ваших данных», стоит читать политику конфиденциальности внимательно.
Как оценить приложение перед установкой
- Проверьте, работает ли распознавание офлайн. Если нет — ваше видео уходит на сервер.
- Уточните, что именно оно переводит: дактиль, отдельные знаки или связную речь. Обещание «полного перевода» на смартфоне пока звучит преувеличенно.
- Найдите, участвовали ли в разработке носители языка или профильные организации.
- Прочитайте раздел о данных: хранится ли видео, используется ли для обучения, можно ли это отключить.
- Не полагайтесь на ИИ-перевод в медицине, суде и любых ситуациях с высокой ценой ошибки — там нужен аттестованный сурдопереводчик.
Реалистичная картина на сегодня такая: ИИ хорошо помогает учить жесты, распознаёт алфавит и простые знаки, ускоряет работу переводчиков. Заменить живого сурдопереводчика в ответственном разговоре он пока не может — и честные разработчики это признают. Прогресс идёт, но измеряется он не процентами в пресс-релизе, а тем, доверяют ли инструменту сами глухие пользователи.
* Дактиль (дактилология) — способ показывать слова по буквам с помощью пальцевой азбуки. Используется для имён, терминов и слов, у которых нет отдельного жеста.
Prompt-инженер: Идеальные запросы для Midjourney, ChatGPT и других моделей.
Спросить за 15 ₽Источники: MediaPipe Hands — документация Google, Google AI Blog: On-Device, Real-Time Hand Tracking with MediaPipe
Частые вопросы
Может ли приложение полностью заменить сурдопереводчика?
Работает ли распознавание жестов без интернета?
Отправляется ли видео с моими руками и лицом на чужой сервер?
Почему ИИ хуже понимает язык жестов, чем обычную речь?
Что такое аватар-синтез и чем он ограничен?
Стоит ли доверять заявленной точности 99%?
Материал носит информационный характер и подготовлен редакцией «Агентуры». Он не является офертой, рекламой или индивидуальной консультацией. Упомянутые продукты, компании и торговые знаки принадлежат их правообладателям. Перед принятием решений, влекущих юридические или финансовые последствия, обратитесь к профильному специалисту.