Новая технология Google превращает жесты в текст без использования клавиатуры

Google разработала модель перевода жестового языка в текст, которая позволяет пользователям вводить информацию с помощью жестов вместо набора текста. Технология получила название sign-language-to-text, или SL2T, и обучалась на более чем 100 000 часах данных, охватывающих свыше 50 жестовых языков.
Первоначально технология будет поддерживать американский жестовый язык ASL на смартфонах Pixel 11. Она станет основой новых функций в Gboard и Live Transcribe, позволяющих жестами выполнять поиск в интернете, писать сообщения и документы, а также взаимодействовать с ИИ Gemini. В Live Transcribe пользователь сможет также отвечать жестами во время разговора.
Перевод жестового языка сложнее обычного распознавания речи, поскольку жестовые языки имеют собственную грамматику и словарный состав. Смысл одновременно передаётся движениями рук, выражением лица, положением головы, рук и корпуса. Поэтому SL2T объединяет компьютерное зрение и машинный перевод, преобразуя движения человека в структурированное представление, которое затем переводится в текст.
Для обработки система использует модель MediaPipe Holistic, определяющую координаты ключевых точек тела, лица и рук. В перевод передаются не исходные видеозаписи, а только геометрические данные о движениях. Оригинальное видео после этого может быть сразу удалено, что уменьшает объём визуальной информации, покидающей устройство.
SL2T переводит последовательность таких координат непосредственно в текст и не использует промежуточные «глоссы» — упрощённые обозначения отдельных жестов, распространённые в исследованиях жестовых языков. По данным Google, это позволяет лучше учитывать пространственные отношения и невербальные элементы жестовой речи.
Для обучения использовались данные более чем на 50 языках, причём около четверти всей выборки составлял американский жестовый язык. Разнообразие языков, диалектов и уровня владения помогло модели учитывать общие особенности разных жестовых языков.
На тесте FLEURS-ASL Google получила показатель 70 BLEURT при проверке на данных, которые не использовались для дополнительного обучения модели, заявив, что этот результат значительно превосходит ранее опубликованные показатели. Разработчики также проверили работу системы в условиях, близких к повседневному использованию.
Модель рассчитана на перевод в реальном времени, а не на обработку заранее записанного видео. При разработке особое внимание уделялось снижению задержки, предотвращению появления выдуманного текста в моменты, когда человек не жестикулирует, а также распознаванию жестов левой рукой и одной рукой.
Распознавание одноручных жестов особенно важно для смартфонов, поскольку пользователь может держать устройство одной рукой и одновременно общаться жестами другой.
В разработке участвовали глухие пользователи и профильные организации. Они помогали собирать данные, тестировать систему и оценивать её работу. Google также привлекла экспертов из сообщества глухих и консультативный комитет, представляющий соответствующие организации.
На первом этапе SL2T будет переводить американский жестовый язык на английский в Gboard и Live Transcribe на Pixel 11. Google планирует расширить поддержку технологии на другие устройства и жестовые языки.
В дальнейшем разработчики рассматривают возможность применения модели не только для перевода жестового языка в текст, но и для генерации жестов и других задач, связанных с взаимодействием человека и компьютера.