Распознавание речи
Распознавание речи — направление компьютерной лингвистики, занимающееся методами и технологиями перевода устной речи в текст или другие интерпретируемые формы[1]. Функционал современных систем расширяется за счёт процессов понимания естественного языка (NLU) для распознавания намерений и эмоций[2][3].
Применениями распознавания речи являются голосовой пользовательский интерфейс, при котором пользователь общается с устройством голосом, а система «слушает» и обрабатывает аудиосигнал. Распространённые голосовые приложения включают интерпретацию команд при вызовах и маршрутизации звонков, автоматизации дома, управлении авионикой, то есть прямой голосовой ввод. Среди задач повышения производительности — поиск по аудиозаписям, создание расшифровок (транскрипций) и диктовка.
Технологии распознавания речи также применяются для анализа характеристик говорящего, например, с целью определения родного языка посредством алгоритмов оценки произношения[4].. Современный этап развития технологий характеризуется переходом к «контекстуальной эре», при которой системы переходят от распознавания изолированных слов к их пониманию с учётом контекста разговора[5].
История
Технологии распознавания речи формировались десятилетиями, и их развитие было ускорено с появлением глубокого обучения и массовым использованием больших данных. Прогресс отражается в росте научных публикаций[6] и росте внедряемости систем[7].
Ключевые вехи развития — увеличение размера словарей, повышение точности для незнакомых говорящих, а также скорость обработки.
До 1970 года
- 1952 — исследователи Bell Labs Стивен Балашек, Р. Биддалф и К. Х. Дэвис создали Audrey для распознавания цифр от одного диктора. Система анализировала форманты в спектре мощности каждой реплики.
- 1960 — Гуннар Фант предложил и опубликовал модель источника-фильтра для производства речи.
- 1962 — «Shoebox» компании IBM (на 16 слов) был представлен на Всемирной выставке.
- 1966 — предложена линейная предиктивная кодировка, метод сжатия речевых сигналов (Фумитада Итакура, Нагоя; Сюдзо Сайто, Ниппон Телеграф энд Телефон)[8].
- 1969 — финансирование в Bell Labs было прекращено после критики главного инженера Джона Р. Пирса[9].
Радж Редди был первым, кто начал исследования непрерывного распознавания речи (студент Стэнфорда, 1960-е гг.). Предыдущие системы требовали пауз между словами.
В этот же период советские учёные разработали алгоритм динамическое программирование времени и реализовали распознаватель с 200-словным словарём[10].
1970–1990 годы
- 1971 — проект DARPA (Speech Understanding Research), задача — минимум 1000 слов в словаре. Участвовали BBN, IBM, Carnegie Mellon, Stanford Research Institute[11].
- 1976 — первая конференция ICASSP.
В 1970-х Леонард Баум и другие заложили основы скрытых марковских моделей (HMM), а с 1980-х HMM стали стандартом для распознавания речи[12]. К середине 1980-х группа Фредерика Йелинека (IBM) реализовала САПР для текста (Tangora, 20 тысяч слов)[13].
- 1982 — компания Dragon Systems (James и Janet Baker).
- 1984 — ноутбук Apricot Portable с поддержкой распознавания до 4096 слов[14].
- 1987 — система от Kurzweil Applied Intelligence.
- 1990 — Dragon Dictate (первый массовый продукт для диктовки).
В начале 1990-х системы достигли уровня, позволяющего работать со словарём больше среднего человеческого запаса слов. В эти годы появились Sphinx-II (CMU), системы Apple и Microsoft, рыночные продукты Nuance, Siri и др.
2000-е годы
В 2000-х DARPA курировало программы EARS (2002) и GALE (2005). В 2007 году Google запустила сервис GOOG-411. В это же время методы глубокого обучения радикально снизили ошибки распознавания речи.
2010-е годы
К началу 2010-х произошёл прорыв в создании «спикер-независимых» систем для непрерывной речи. В 2017 году Microsoft достигла точности, сопоставимой с ручной транскрипцией профессионалами[15].
2020-е годы
В сентябре 2022 года компания OpenAI выпустила систему автоматического распознавания речи Whisper[16]. Благодаря открытому исходному коду и мультиязычности (поддержке 99 языков) модель стала новым индустриальным стандартом, позволив запускать качественное распознавание локально[17].
В 2025–2026 годах произошёл переход к потоковому распознаванию в реальном времени и интеграции систем распознавания с большими языковыми моделями (LLM). Доминирующей стала архитектура, объединяющая энкодер и LLM-декодер, что позволило перейти от простого акустического отображения к семантически осмысленной генерации текста. В этот период также начали активно применяться методы контекстуального анализа с учётом истории разговора и многозадачные модели, способные определять эмоции непосредственно в процессе распознавания[18].
Модели, методы и алгоритмы
В основе большинства современных систем лежат акустическая модель и языковая модель, обычно реализуемые через скрытые марковские модели (HMM), искусственные нейронные сети и методы глубокого обучения. При этом классическое разделение на независимые акустическую и языковую модели постепенно вытесняется сквозными (end-to-end) архитектурами и большими речевыми языковыми моделями (Speech LLM)[19][20].
Скрытые марковские модели
Скрытые марковские модели (HMM) — статистические модели для представления цепей звуковых признаков речи, позволяющие учитывать вероятности переходов между состояниями (например, фонемами или словами). Модель обучается автоматически по большим массивам размеченных данных. На каждом шаге анализируются векторные спектральные признаки (цепстральные коэффициенты).
Для повышения точности используют: контекстную зависимость фонем, нормализацию цепстральных признаков, нормализацию длины речевого тракта, адаптацию (VTLN, MLLR), дельта- и дельта-дельта коэффициенты, дискриминативное обучение (MMI, MCE, MPE).
Алгоритм динамического программирования времени (DTW)
DTW — метод выравнивания последовательностей, использовавшийся для распознавания речи до появления HMM. Позволял сопоставлять «растянутые» или «сжатые» по времени шаблоны произнесения.
Искусственные нейронные сети
Нейросети используются для классификации фонем[21], изолированных слов, а также для многозадачной эволюционной оптимизации распознавания[22], аудиовизуального распознавания и адаптации к говорящему. С 2010-х преобладают глубокие нейросети, LSTM, трансформеры. Ключевой идеей глубокого обучения стало отказ от ручной генерации признаков — сетевые архитектуры автоматически извлекают сложные паттерны из аудиоданных
Обучение сквозным образом (end-to-end)
С 2014 года стремительно развиваются сквозные (end-to-end) архитектуры. Первая такая модель — CTC, позднее появились архитектуры на основе внимания (attention), позволяющие обучать систему сразу «с нуля», без разделения на отдельные фазы по обучению фонетики, акустики, языка. Эволюция сквозных архитектур привела к созданию моделей для потоковой (streaming) обработки аудио в реальном времени. К ключевым решениям относятся RNN-Transducer (RNN-T), обеспечивающий инкрементальную обработку без ожидания будущего контекста, Streaming Transformers, использующие каузальное внимание для работы с низкой задержкой, и Conformer Transducer, объединяющий свёрточные слои с механизмом самовнимания для повышения точности[23].[24] Современные системы, такие как GPT-4o, реализуют сквозную обработку в реальном времени с помощью единой мультимодальной нейросети, напрямую анализирующей аудиосигнал. Подобные архитектуры обеспечивают минимальную задержку отклика (около 232 миллисекунд) и используют семантический VAD (Voice Activity Detection), который анализирует контекст и динамически адаптирует время ожидания конца фразы[25].[26]
Большие языковые и генеративные модели
В области больших речевых языковых моделей (Speech LLMs) применяются два основных архитектурных подхода для прямого преобразования речи. Дискретное моделирование последовательностей преобразует аудиосигнал в дискретные токены, позволяя модели обрабатывать речь в рамках стандартной токенизированной парадигмы (например, VALL-E, SpeechGPT, AudioPaLM). Непрерывное моделирование проецирует акустические признаки в непрерывные векторы эмбеддингов, которые напрямую подаются в LLM, что сохраняет акустические детали и повышает точность распознавания (например, Pengi, SALMONN)[27]. Интеграция LLM в процесс декодирования речи включает ряд специализированных методов. Спекулятивное и самоспекулятивное декодирование применяется для снижения задержки авторегрессионного вывода и устранения предвзятости языковой модели. Поверхностное слияние (shallow fusion) и рескоринг используются для выбора наилучшей гипотезы из нескольких кандидатов, что особенно актуально для малоресурсных языков. Среди других подходов выделяются гибридное декодирование с итеративным слиянием, декодирование с условием на промпты и LLM-коррекция ошибок в первичных транскрипциях[28].[29] Для обработки длинных аудиопоследовательностей применяются архитектуры на базе State Space Models (SSM), такие как Mamba. За счёт линейной вычислительной сложности они эффективно улавливают глобальные временные зависимости, избегая проблем с экспоненциальным ростом потребления памяти, свойственных механизму самовнимания в классических трансформерах. В системах распознавания речи активно используются гибридные модели (например, ConMamba), которые объединяют слои SSM с конволюционными модулями или слоями внимания, комбинируя вычислительную эффективность с высокой точностью[30].[31]
Мультимодальные архитектуры
В 2026 году стандартом для распознавания речи в шумных условиях стали мультимодальные архитектуры, объединяющие аудиоданные с видеопотоком (чтение по губам) с использованием механизмов кросс-модального внимания[32].
Применения
- Голосовой пользовательский интерфейс — управление устройствами голосом (в т.ч. автомобили, умные дома, авиация).
- Оценка произношения — автоматическая проверка правильности произношения в образовательных и речевотерапевтических системах.
- Радиология, медицина — создание и обработка диктовок для электронной медицинской документации.
- Военная техника — управление авионикой, радиосвязью, автопилотом через голос в самолётах, вертолётах и диспетчерских системах.
- Для людей с ограничениями — создание субтитров, навигация по интерфейсу для слабовидящих и маломобильных пользователей, поддержка альтернативного текстового ввода. Примером служит приложение «Яндекс Разговор» для людей с нарушениями слуха и речи, получившее функцию распознавания в офлайн-режиме и рост числа пользователей до более чем 230 тысяч в 2025 году[33].[34]
- Телефония — автоматические контакт-центры и IVR.
- Автоматическое субтитрование, эмоциональный анализ речи, робототехника, безопасность, транскрипция, виртуальный ассистент.
- Строительная отрасль — документирование без помощи рук (устное логирование прогресса без остановки работы) и контроль безопасности (голосовое информирование об инцидентах в реальном времени)[35].
Производительность
Точность работы систем распознавания речи оценивается метриками WER (word error rate), временем задержки, а также успешностью выполнения команд. Для оценки голосовых интерфейсов реального времени применяются современные метрики: Task Success Rate (успешность выполнения задачи), целевое значение которой составляет более 85 %, и воспринимаемая задержка (Perceived Latency) со стандартом менее 300–400 мс[36][37].
Факторы, влияющие на точность
- Размер и сложность словаря;
- Спикер-зависимость/независимость системы;
- Тип речи — изолированные слова, дискретная (с паузами), сплошная непрерывная речь;
- Жанр: речь по подготовленному/спонтанному тексту;
- Зашумлённость, помехи, условия записи;
- Огрехи произношения, диалекты, акценты.
Формула WER:
где — число замен, — удалений, — вставок, — число слов в эталоне.
Для снижения WER и компенсации факторов сложности применяются современные методы. В частности, для борьбы с зашумлённостью используются нейронные подавители шума, а для работы с сильными акцентами и редкими диалектами — мультиязычные модели и специализированные LoRA-адаптеры[38].
Минимизация задержек
Для минимизации задержек в сквозных (E2E) системах распознавания речи без значительной потери точности применяются различные методы:
- FastEmit — метод регуляризации на уровне последовательности, который поощряет раннюю выдачу текстовых токенов вместо пустых. Применение этого подхода позволяет снизить задержку на 150–300 мс[39].[40].
- Self-alignment — метод, использующий собственное выравнивание текущей модели для поиска направления с меньшей задержкой путём мягкого смещения путей выравнивания влево. Он обеспечивает оптимальный компромисс между точностью и скоростью выдачи результата[41]..
Безопасность
Распознавание речи может использоваться для атак — например, команда «Алекса» с ТВ-ролика может активировать устройства в чужих помещениях. Также возможны атаки через ультразвук, имитирующий команды, и внедрение незаметных человеку искажений в аудиопоток[42]. Наибольшую опасность для систем голосового управления и верификации представляют технологии клонирования голоса в реальном времени (дипфейки). Злоумышленники способны генерировать синтетическую речь с минимальной задержкой, что позволяет использовать её для обхода систем биометрической аутентификации и в атаках с применением социальной инженерии (например, звонки от лица руководителей или родственников)[43]. Для защиты от подобных угроз применяются современные методы обнаружения спуфинга (liveness detection), позволяющие отличить живой голос от записанного или синтезированного. К ним относятся детекция поп-шума (анализ низкочастотной энергии от выдыхаемого воздуха), анализ специфических спектральных артефактов, оставляемых системами генерации речи, а также оценка распределения мощности сигнала в слышимом диапазоне[44][45].
Программное обеспечение
- CMU Sphinx (набор инструментов, версия 5.1.0)[46];
- HTK и сопутствующая документация;
- Kaldi (legacy)[47];
- Common Voice[48] и производные (Coqui STT — закрытый проект)[49];
- Gboard (на Android);
- Распознавание речи в Microsoft Windows[50];
- Массово доступные коммерческие облачные API.
- Современные open-source решения: OpenAI Whisper, SpeechBrain, NVIDIA Canary-Qwen[49][47];
- Коммерческие модели: gpt-4o-transcribe, Deepgram Nova-3, AssemblyAI Universal-3.5[51][52].
Примечания
- ↑ What Is Speech Recognition? | IBM (англ.). www.ibm.com (28 сентября 2021). Дата обращения: 27 августа 2026.
- ↑ Распознавание речи (Speech Recognition). Ultralytics. Дата обращения: 27 августа 2026.
- ↑ Intent Recognition: что это такое и как работает. Chaitex. Дата обращения: 27 августа 2026.
- ↑ P. Nguyen. Automatic classification of speaker characteristics // International Conference on Communications and Electronics 2010. — 2010. — P. 147–152. — ISBN 978-1-4244-7055-6. — doi:10.1109/ICCE.2010.5670700.
- ↑ What is ASR? AssemblyAI Blog. Дата обращения: 27 августа 2026.
- ↑ Alharbi, Sadeen; Alrazgan, Muna; Alrashed, Alanoud; Alnomasi, Turkiayh; Almojel, Raghad; Alharbi, Rimah; Alharbi, Saja; Alturki, Sahar; Alshehri, Fatimah; Almojil, Maha (2021). “Automatic Speech Recognition: Systematic Literature Review”. IEEE Access. 9: 131858—131876. DOI:10.1109/ACCESS.2021.3112535. ISSN 2169-3536.
- ↑ Li, Suo. Overview and Analysis of Speech Recognition // 2022 IEEE International Conference on Advances in Electrical Engineering and Computer Applications (AEECA) / Suo Li, Jinchi You, Xin Zhang. — август 2022. — P. 391–395. — ISBN 978-1-6654-8090-1. — doi:10.1109/AEECA55500.2022.9919050.
- ↑ Gray, Robert M. (2010). “A History of Realtime Digital Speech on Packet Networks: Part II of Linear Predictive Coding and the Internet Protocol”. Found. Trends Signal Process. 3 (4): 203—303. DOI:10.1561/2000000036. ISSN 1932-8346. Архивировано из оригинала
|archive-url=требует|url=(справка на английском) 9 октября 2022. Дата обращения 2026-08-27. Используется устаревший параметр|url-status=(справка);|access-date=требует|url=(справка) - ↑ Pierce, John R. (1969). “Whither speech recognition?”. Journal of the Acoustical Society of America. 46 (48): 1049—1051. DOI:10.1121/1.1911801.
- ↑ Benesty, Jacob. Springer Handbook of Speech Processing / Jacob Benesty, M. M. Sondhi, Yiteng Huang. — Springer Science & Business Media, 2008. — ISBN 978-3-540-49125-5.
- ↑ Blechman, R. O.; Blechman, Nicholas (23 июня 2008). “Hello, Hal”. The New Yorker. Архивировано из оригинала 20 января 2015. Дата обращения 2026-08-27.
- ↑ First-Hand:The Hidden Markov Model – Engineering and Technology History Wiki. ethw.org (12 января 2015). Дата обращения: 27 августа 2026. Архивировано 3 апреля 2018 года.
- ↑ Pioneering Speech Recognition (7 марта 2012). Дата обращения: 18 января 2015. Архивировано 19 февраля 2015 года.
- ↑ ACT/Apricot - Apricot history. actapricot.org. Дата обращения: 27 августа 2026. Архивировано 21 декабря 2016 года.
- ↑ Microsoft researchers achieve new conversational speech recognition milestone. Microsoft (21 августа 2017). Дата обращения: 27 августа 2026. Архивировано 9 сентября 2024 года.
- ↑ Whisper: A general-purpose speech recognition model. OpenAI (21 сентября 2022). Дата обращения: 27 августа 2026.
- ↑ Как работает OpenAI Whisper? OpenWhispr. Дата обращения: 27 августа 2026.
- ↑ ASR Deep Dive: 2025-2026 Trends. Ruoqijin Blog. Дата обращения: 27 августа 2026.
- ↑ Automatic Speech Recognition (ASR): How Speech-to-Text Models Work. Gladia. Дата обращения: 27 августа 2026.
- ↑ Как работает ASR: от HMM до LLM. Amvera. Дата обращения: 27 августа 2026.
- ↑ Waibel, A.; Hanazawa, T.; Hinton, G.; Shikano, K.; Lang, K. J. (1989). “Phoneme recognition using time-delay neural networks”. IEEE Transactions on Acoustics, Speech, and Signal Processing. 37 (3): 328—339. DOI:10.1109/29.21701. S2CID 9563026.
- ↑ Bird, Jordan J.; Wanner, Elizabeth; Ekárt, Anikó; Faria, Diego R. (2020). “Optimisation of phonetic aware speech recognition through multi-objective evolutionary algorithms” (PDF). Expert Systems with Applications. 153. DOI:10.1016/j.eswa.2020.113402. ISSN 0957-4174. S2CID 216472225. Архивировано из оригинала (PDF) 9 сентября 2024. Дата обращения 2026-08-27. Используется устаревший параметр
|url-status=(справка) - ↑ Streaming ASR: RNN-T, Conformer, and Beyond. Arun Baby. Дата обращения: 27 августа 2026.
- ↑ Transformer-Transducer: End-to-End Speech Recognition with Fast and Flexible Decoding. Microsoft Research (август 2021). Дата обращения: 27 августа 2026.
- ↑ Hello GPT-4o. OpenAI. Дата обращения: 27 августа 2026.
- ↑ Real-time speech transcription with GPT-4o Transcribe and GPT-4o Mini Transcribe. Microsoft Tech Community. Дата обращения: 27 августа 2026.
- ↑ Speech LLMs: Discrete vs Continuous Sequence Modeling. arXiv (18 октября 2024). Дата обращения: 27 августа 2026.
- ↑ LLM-based Automatic Speech Recognition (ASR). Emergent Mind. Дата обращения: 27 августа 2026.
- ↑ Prompt-Based ASR with Speech LLMs. Emergent Mind. Дата обращения: 27 августа 2026.
- ↑ ConMamba: Convolutional Mamba for Long-Form ASR. UPC Commons. Дата обращения: 27 августа 2026.
- ↑ Samba-ASR: State Space Models for ASR. AlphaXiv (2 января 2025). Дата обращения: 27 августа 2026.
- ↑ AV-CLIP: Кросс-модальное контрастивное обучение. AlphaXiv (август 2026). Дата обращения: 27 августа 2026.
- ↑ В 2025 году приложением «Яндекс Разговор» воспользовались более 1,3 млн раз. Rozetked. Дата обращения: 27 августа 2026.
- ↑ Яндекс обновил «Разговор»: теперь с офлайн-режимом и поддержкой английского. Яндекс (2 июля 2026). Дата обращения: 27 августа 2026.
- ↑ Speech Recognition Technology Is Reshaping Construction in 2026. Colony Construction. Дата обращения: 27 августа 2026.
- ↑ Voice AI Platform Comparison 2026: Benchmarks. Coval AI. Дата обращения: 27 августа 2026.
- ↑ Voice Agent Evaluation Metrics Guide. Hamming AI. Дата обращения: 27 августа 2026.
- ↑ Современные методы компенсации факторов сложности в ASR. Forasoft. Дата обращения: 27 августа 2026.
- ↑ FastEmit: Low-Latency Speech Recognition with Sequence-Level Regularization. ar5iv.labs.arxiv.org (21 октября 2020). Дата обращения: 27 августа 2026.
- ↑ FastEmit: Low-Latency Speech Recognition with Sequence-Level Regularization. alphaxiv.org (23 ноября 2020). Дата обращения: 27 августа 2026.
- ↑ Overview of End-to-End Automatic Speech Recognition. Microsoft Research (май 2022). Дата обращения: 27 августа 2026.
- ↑ Listen Up: Your AI Assistant Goes Crazy For NPR Too, NPR (6 марта 2016). Архивировано 23 июля 2017. Дата обращения: 27 августа 2026.
- ↑ Человеческий фактор в социальной инженерии: новые сценарии атак через нейросетевые дипфейки голоса. APNI.ru. Дата обращения: 27 августа 2026.
- ↑ Detection of Replay Attacks Using Pop Noise. ISCA Interspeech 2015. Дата обращения: 27 августа 2026.
- ↑ Voice Liveness Detection Systems: Challenges and Solutions. Antispoofing.org. Дата обращения: 27 августа 2026.
- ↑ CMU Sphinx. cmusphinx.github.io. Дата обращения: 27 августа 2026.
- ↑ 1 2 Best Open Source Speech to Text Models. gladia.io. Gladia. Дата обращения: 27 августа 2026.
- ↑ Common Voice by Mozilla. voice.mozilla.org. Дата обращения: 9 ноября 2019. Архивировано 27 февраля 2020 года.
- ↑ 1 2 Top Open Source STT Options for Voice Applications. assemblyai.com. AssemblyAI. Дата обращения: 27 августа 2026.
- ↑ Use voice recognition in Windows. Дата обращения: 27 августа 2026. Архивировано 9 апреля 2025 года.
- ↑ Best Speech to Text Providers in 2026. coval.ai. Дата обращения: 27 августа 2026.
- ↑ Best Speech to Text Models. retellai.com. Дата обращения: 27 августа 2026.
Литература
- Fundamentals of Speech Recognition (Лоуренс Рабинер, 1993)
- Statistical Methods for Speech Recognition (Фредерик Йелинек)
- Spoken Language Processing (Сюэдонг Хуанг и др., 2001)
- Computer Speech (Манфред Шредер, 2004)
- Speech Processing: A Dynamic and Optimization-Oriented Approach (Ли Денг и Дуг О'Шонесси, 2003)
- Speech and Language Processing (Джурафски и Мартин, 2008)
- The Voice in the Machine (Роберто Пьерачини, 2012)
- Automatic Speech Recognition: A Deep Learning Approach (D. Yu, L. Deng, 2014)