Главное Авторские колонки Пресс-релизы Промо Вакансии Вопросы
Выбор редакции:
375 0 В избр. Сохранено
Авторизуйтесь
Вход с паролем

Google представила новую модель распознавания речи

Компания Google выпустила модель Gemini 3.5 Transcribe для преобразования речи в текст. Она работает как с заранее записанным аудио, так и в режиме реального времени с задержкой менее секунды.

Модель умеет разделять говорящих, ставить временные метки и переключаться между языками прямо во время разговора.

Главное отличие новой системы заключается в том, что она автоматически очищает речь. Модель убирает слова-паразиты вроде «э-э», учитывает исправления говорящего на ходу и может сразу выдавать оформленный текст. Google продвигает её прежде всего как основу для голосовых агентов, а не просто как сервис для расшифровки диктофонных записей.

На многоязычном тесте FLEURS компания заявляет об ошибке распознавания около 5 %. Время до окончательной транскрипции, по данным Artificial Analysis, сократилось примерно на 70% по сравнению с предыдущим решением Chirp 3. Впрочем, это тестовые показатели. Реальное качество в условиях шумной кухни, на производстве или на совещании с плохими микрофонами может сильно отличаться.

Голосовые интерфейсы десятилетиями уступали клавиатуре по простой причине: человеку приходилось говорить так, чтобы его понял компьютер. Теперь подход меняется. Система сама начинает разбираться в паузах, оговорках и исправлениях. Если голос действительно станет надежным входным каналом для агентов, это окажется важнее очередной функции для диктовки сообщений.

0
В избр. Сохранено
Авторизуйтесь
Вход с паролем
Комментарии
Выбрать файл
Не пропустите публикацию!
Spark_news
Новости от Спарка
Блог проекта
Расскажите историю о создании или развитии проекта, поиске команды, проблемах и решениях
Написать
Личный блог
Продвигайте свои услуги или личный бренд через интересные кейсы и статьи
Написать

Spark использует cookie-файлы. С их помощью мы улучшаем работу нашего сайта и ваше взаимодействие с ним.