Логотип AILINCOM AILINCOM
Силиконовый воротник превращает беззвучную речь в голос
The neckband is made of soft silicone and combines a miniature camera and motion sensors with an AI model trained on the wearer's own voice
Ingenium

Ingenium

23 апр. 2026 г.
Основная категория
Технологии и инженерия · Искусственный интеллект
Дополнительные
Цифровые технологии и ИТ · Искусственный интеллектЦифровые технологии и ИТ · Интернет вещей

Силиконовый воротник превращает беззвучную речь в голос

Силиконовый воротник превращает беззвучную речь в голос

Южнокорейские исследователи создали силиконовый воротник, который фиксирует движения шеи при беззвучном произнесении слов и с помощью ИИ преобразует их в речь, максимально похожую на голос пользователя. Технология может применяться в медицине и в условиях сильного шума, где обычные микрофоны неэффективны.

IngeniumСиликоновый воротник превращает беззвучную речь в голос

Исследователи из Университета науки и технологий POSTECH в Южной Корее разработали силиконовый воротник, способный фиксировать мельчайшие движения шеи при беззвучном произнесении слов и преобразовывать их в речь, воспроизводимую голосом пользователя для передачи слушателю.

Принцип работы устройства

Устройство основано на том, что формирование слов сопровождается характерными движениями мышц и кожи шеи, создающими уникальные паттерны для каждого слога. Ранее для фиксации этих сигналов применялись электромиография (ЭМГ) и электроэнцефалография (ЭЭГ), однако такие методы требовали громоздкого оборудования и были неудобны вне лабораторных условий.

Команда POSTECH использовала иной подход: воротник сочетает мягкий силикон, миниатюрную камеру и датчики движения, работающие совместно с искусственным интеллектом, обученным на голосе пользователя. Многовекторный сенсор отслеживает степень и направление деформации кожи при артикуляции, что позволяет получить подробную картину работы рта и горла. Маркеры, нанесённые на силиконовый воротник, позволяют камере измерять эти деформации в реальном времени.

Алгоритм корректирует небольшие различия в положении устройства при каждом надевании, обеспечивая стабильность показаний. Полученные паттерны деформации поступают в ИИ-модель, которая определяет произнесённое слово.

Тестирование и эффективность

В ходе испытаний система обучалась на словах фонетического алфавита НАТО, специально разработанного для разборчивости в сложных условиях. При работе с 26 словами точность распознавания составила 85,8%. После распознавания слово по беспроводной связи отправляется на сервер, где с помощью персонализированной модели преобразования текста в речь синтезируется аудиофайл, максимально приближённый к реальному голосу пользователя. Для обучения голосовой модели требуется менее 10 минут записей.

Система показала устойчивость к сильным помехам: при уровне шума около 90 дБ (сравнимо со строительной площадкой) сохранялось отношение сигнал/шум до 33,75 дБ, что превышает показатели коммерческих ЭМГ-систем в аналогичных условиях.

Ограничения и перспективы

Текущая версия устройства работает только с фиксированным словарём из 26 заранее заданных слов, свободная речь невозможна. Точность может снижаться до 39,72% при движении пользователя или активных поворотах головы. Дальнейшие планы включают расширение словаря, тестирование на большем числе пользователей и улучшение компенсации движений тела.

Возможные применения

Технология может использоваться не только в медицине, например, для пациентов после ларингэктомии, но и в условиях, где обычные микрофоны неэффективны или недоступны: на промышленных объектах, в службах экстренного реагирования, авиации, морских операциях и военных сценариях. Система была протестирована не только при белом шуме, но и во время демонстрации газового ружья, где присутствовали шум и вибрация.

Сравнение с другими разработками

Ранее аналогичные подходы тестировались в лабораториях, например, в Кембриджском университете, где также использовались воротники с датчиками для обнаружения вибраций горла при беззвучном произнесении слов. Прототип Кембриджа достигал точности декодирования речи 95,25% и не ограничивался конкретным словарём. В недавних исследованиях их система также определяла эмоциональное состояние пользователя. Особенностью разработки POSTECH является применение искусственного интеллекта для воссоздания индивидуального голоса пользователя.

#искусственный_интеллект#деформация#медицина#датчики#шумоустойчивость#силикон
0 —

Комментарии (0)

Горячее

Qnap анонсировала новые NAS для видеопроизводства

2 окт. 2026 г.02.10.2026 · 0 реакций

Tesla открыла кредитные линии на $30 млрд

2 окт. 2026 г.02.10.2026 · 0 реакций

Авиаперевозки растут, но новые правила усложняют рынок

1 окт. 2026 г.01.10.2026 · 0 реакций
Рекомендуемое
Облачные вычисления

Qnap анонсировала новые NAS для видеопроизводства

Qnap представила три новые NAS-системы, ориентированные на задачи видеопроизводства и оснащённые портами USB4 для высокой скорости передачи данных. Устройства поддерживают различные режимы подключения и рассчитаны на использование жёстких дисков и SSD большой ёмкости.

Финансовый анализ

Tesla открыла кредитные линии на $30 млрд

Tesla открыла кредитные линии на 30 миллиардов долларов для финансирования крупных инвестиций на фоне снижения прибыли и роста капитальных затрат. Новое соглашение расширяет финансовые возможности компании в условиях давления на бизнес.

Транспортная логистика

Авиаперевозки растут, но новые правила усложняют рынок

Авиаперевозки становятся всё более важной частью логистики, особенно на фоне нестабильности морских перевозок. Однако новые правила оформления авианакладных создают дополнительные сложности и риски для участников рынка.