Speech enhancement, или улучшение речи, относится к группе технологий искусственного интеллекта, которые повышают разборчивость голосового сигнала в сложных акустических условиях. Речь идет не только об удалении фонового шума, но и о подавлении эха, восстановлении искаженных фрагментов, отделении голоса от музыки, уличного гула, клавиатуры, ветра или других говорящих. Эта область стала особенно заметной из-за роста видеосвязи, голосовых ассистентов, подкастов, колл-центров и систем распознавания речи. Классические методы обработки звука долго опирались на спектральные фильтры, статистические модели шума и алгоритмы эхоподавления. Они хорошо работали в предсказуемых сценариях, например при постоянном шуме кондиционера или слабом гуле помещения. Проблемы начинались там, где шум был переменным, голос перекрывался другими источниками, а микрофон записывал звук с искажениями. Нейросетевые модели расширили возможности speech enhancement, потому что научились учитывать контекст, структуру речи и вероятные характеристики человеческого голоса. Современные системы используют разные архитектуры: сверточные сети, рекуррентные модели, трансформеры, диффузионные подходы и гибридные решения. Одни работают со спектрограммой, другие обрабатывают аудио прямо во временной области. Важную роль играют обучающие наборы данных, где чистая речь смешивается с шумами разных типов. Чем разнообразнее такие данные, тем устойчивее модель в реальных условиях. Однако идеального универсального решения пока нет: алгоритм, хорошо справляющийся с шумом метро, может хуже обрабатывать реверберацию в большом помещении. Speech enhancement тесно связан с автоматическим распознаванием речи. Для ASR-систем качество входного сигнала напрямую влияет на точность расшифровки. Улучшение речи помогает голосовым ботам, диктовке, субтитрам и аналитике звонков работать стабильнее. В колл-центрах такие технологии повышают качество записей и упрощают последующую обработку диалогов. В мобильных устройствах они используются для звонков, видеоконференций и записи голосовых сообщений. Отдельное направление связано с приватностью и вычислительными ограничениями. Обработка звука может выполняться в облаке или локально на устройстве. Облачные модели обычно мощнее, но требуют передачи аудио на сервер. Локальные решения важны для смартфонов, ноутбуков, слуховых аппаратов и корпоративных систем, где задержка и защита данных имеют критическое значение. Поэтому разработчики ищут баланс между качеством, скоростью, энергопотреблением и размером модели. Главные ограничения speech enhancement связаны с артефактами. При агрессивном шумоподавлении голос может звучать металлически, терять естественность или отдельные согласные. Если модель ошибочно принимает часть речи за шум, разборчивость падает. Поэтому оценка качества включает не только численные метрики, но и субъективное восприятие слушателями.