Google представила новую модель распознавания речи
Модель умеет разделять говорящих, ставить временные метки и переключаться между языками прямо во время разговора.
Главное отличие новой системы заключается в том, что она автоматически очищает речь. Модель убирает слова-паразиты вроде «э-э», учитывает исправления говорящего на ходу и может сразу выдавать оформленный текст. Google продвигает её прежде всего как основу для голосовых агентов, а не просто как сервис для расшифровки диктофонных записей.
На многоязычном тесте FLEURS компания заявляет об ошибке распознавания около 5 %. Время до окончательной транскрипции, по данным Artificial Analysis, сократилось примерно на 70% по сравнению с предыдущим решением Chirp 3. Впрочем, это тестовые показатели. Реальное качество в условиях шумной кухни, на производстве или на совещании с плохими микрофонами может сильно отличаться.
Голосовые интерфейсы десятилетиями уступали клавиатуре по простой причине: человеку приходилось говорить так, чтобы его понял компьютер. Теперь подход меняется. Система сама начинает разбираться в паузах, оговорках и исправлениях. Если голос действительно станет надежным входным каналом для агентов, это окажется важнее очередной функции для диктовки сообщений.