Меньше шума, больше смысла: опыт SESAME для Speech Enhancement

newsare.net · world

<img src="https://habrastorage.org/getpro/habr/upload_files/efb/4c3/c39/efb4c3c399f1b80201df63a35e37a0ea.jpg" /><p>Привет, Хабр! Мы — Александр Забурдаев, Ксения Золина, Даниил Марценюк, Илья Трофименко, Илья Кулешов — студенты мастерской по сервисам и платформам ИИ в Инженерно-математической школе НИУ ВШЭ и VK. Хотим поделиться опытом, который мы накопили, пытаясь перестать кормить весь речевой сигнал одной и той же нейросети целиком, и дать разным экспертам разбираться с разными типами шума.&nbsp;</p><p>Речь пойдёт о задаче улучшения качества речи (Speech Enhancement, SE) и о том, как получилось интегрировать в неё разреженную смесь экспертов (sparse Mixture of Experts, MoE). Это архитектура, которая в языковых моделях уже стала стандартом, а в обработке аудио до сих пор не прижилась.</p><p>Модель мы назвали SESAME — Speech Enhancement with Sparse Adaptive Mixture of Experts. Она построена на базе MP-SENet. В ней стандартные полносвязные блоки внутри трансформера заменены на разреженный MoE-модуль. Код проекта доступен на <a href="https://github.com/nullpath-ml/SESAME">GitHub</a>.</p><p>Зачем вообще понадобилась очередная модель шумоподавления, когда их и так десятки — расскажем ниже. А заодно разберём, какие трюки из мира LLM в аудио работают, а какие нет (например, Expert Choice) — и почему.</p> <a href="https://habr.com/ru/articles/1077722/?utm_source=habrahabr&amp;utm_medium=rss&amp;utm_campaign=1077722#habracut">Читать далее</a>

Read full article →