ИИ раскрывает, как мозг выделяет голос в шуме
Исследователи создали искусственную нейронную сеть, которая имитирует способность человека выделять отдельный голос в шумной обстановке. Эта модель помогает понять механизмы слухового внимания и может способствовать развитию более эффективных слуховых имплантов.
Cursus
Обучение искусственной нейронной сети выделять определённые звуковые характеристики позволило исследователям выявить биологические механизмы, лежащие в основе способности человека сосредотачиваться на одном разговоре в шумной обстановке.
Изучение феномена "коктейльной вечеринки"
На протяжении десятилетий нейробиологи исследовали так называемую "проблему коктейльной вечеринки" — способность мозга человека избирательно выделять один голос среди множества фоновых шумов. Было известно, что мозг достигает этого, усиливая активность нейронов, реагирующих на определённые аудиопризнаки. Однако до недавнего времени не существовало вычислительной модели, подтверждающей, что этот механизм достаточен для работы в реальных условиях.
Разработка искусственной нейронной сети
Группа исследователей из Массачусетского технологического института создала искусственную нейронную сеть, имитирующую способность человеческого слуха выделять отдельные голоса. В опубликованном в журнале Nature Human Behavior исследовании показано, что мозг применяет стратегию, известную как мультипликативное усиление признаков. Это означает, что при прослушивании целевого голоса мозг усиливает нейронные сигналы, связанные с уникальными характеристиками этого голоса, например, с его высотой, одновременно снижая громкость конкурирующих звуков.
Проверка модели
Для проверки этой гипотезы искусственной модели предоставили короткую аудиоподсказку с определённым голосом, а затем — шумовую смесь перекрывающихся голосов. Модель успешно выделяла целевой голос на фоне других, демонстрируя результаты, сопоставимые с человеческими в различных условиях. Кроме того, система воспроизводила типичные ошибки человеческого слуха, например, трудности с различением двух голосов с похожей высотой.
Преимущества новой модели
Ранее существовавшие модели не обладали способностью, присущей человеку: они не могли нацеливаться на конкретный объект или звук и строить свой отклик, исходя из выбранного объекта. Это ограничивало их эффективность.
Влияние пространственного расположения
Модель также позволила быстро проверить влияние пространственного расположения источников звука на восприятие. Система предсказала, что различать голоса значительно проще, если говорящие расположены по горизонтали, а не по вертикали. Этот феномен был впоследствии подтверждён экспериментами с участием людей.
Перспективы применения
Исследователи считают, что разработанная модель может способствовать созданию более совершенных кохлеарных имплантов, которые позволят людям эффективнее концентрировать внимание в шумных условиях.
