BC/NW 2025 № 1 (42):13.3
. РАЗВИТИЕ
СОВРЕМЕННЫХ СИСТЕМ ТРАНСКРИБАЦИИ АУДИО- И ВИДЕО КОНТЕНТА
Баруздин М.М.,
Раскатова М.В.
Современные технологии автоматической
транскрибации аудио- и видеоконтента активно внедряются в различные отрасли и
становятся важным инструментом для обработки информации. Они значительно
ускоряют создание текстовых версий медиаматериалов, что упрощает анализ данных,
поиск и интеграцию информации.
Однако процесс автоматической транскрибации
остаётся сложной задачей. Процесс сопровождается рядом проблем [1], которые
ограничивают точность и надёжность систем.
Для преодоления этих трудностей активно
усовершенствуются современные алгоритмы и архитектуры, которые повышают
точность и гибкость обработки речи.
Благодаря использованию инновационных
подходов, таких как глубокое обучение и гибридные модели, становится возможным
не только повышать качество распознавания речи, но и оптимизировать системы для
специфических задач и условий.
В рамках настоящего исследования были
изучены основные этапы эволю-
ции технологий Speech-to-Text (STT),
начиная с традиционных методов на базе скрытых марковских моделей (HMM) [2] и
завершая современными решениями на основе нейронных сетей. Рассмотрены архитектуры
и возможности популярных open-source решений, а также проведён их сравнительный
анализ обработки выдвинутых проблем.
Результаты исследования демонстрируют, что
применение современных алгоритмов и подходов в системах автоматического распознавания
речи (ASR) значительно улучшает обработку аудиоданных. Однако эффективность их
применения зависит от специфики задачи, качества данных и требований к модели.
Литература
1.
Галунов В.И., Соловьев А.Н. Современные проблемы в области распознавания речи
// Информационные технологии и вычислительные системы. — 2004. — №
2. — С. 41–45.
2.
Маковкин К.А. Гибрибные модели — Скрытые марковские модели / Многослойный
персептрон — и их применение в системах распознавания речи. Обзор // Речевые
технологии. 2012. Выпуск 3. С. 58–83.