Исходный размер 1140x1600

Форма голоса: эволюция синтезаторов речи и как на них реагирует мозг.

Данный проект является учебной работой студента Школы дизайна или исследовательской работой преподавателя Школы дизайна. Данный проект не является коммерческим и служит образовательным целям

Содержание

— Концепция — Из живого голоса в цифровой — Первые имитации человеческого голоса — Формантный и конкатенативный синтезы — Нейросети — Заключение

Концепция

Голос человека является одним из наиболее информативно насыщенных акустических сигналов, с которыми работает человеческая слуховая система. Помимо вербального содержания, он несёт в себе и другие аспекты речи — эмоциональное состояние, физиологические характеристики, намерения и идентичность. Способность воспринимать человеческую речь неосознанно формировалась эволюционно, что поспособствовало ей укорениться в нашей нервной системе.

big
Исходный размер 2960x1510

Спектрограмма человеческого голоса в ПО «iZotope RX 11».

Последние десятилетия люди стараются разрабатывают различные методы, каким образом можно этот голос «синтезировать» — создать его эмуляцию исключительно аппаратным способом. Некоторые голоса создаются с полного нуля, для некоторых же используются уж сделанные записи голоса человека.

Использование TTS системы Google Translate
1 мин

Подобные технологии сегодня окружают нас практически ежедневно: умные колонки и голосовые ассистенты, озвучка текстов в онлайн-переводчиках, помощь незрячим, и так далее. Мы уже научились с ними жить и можем четко определить, где и какой голос нас окружает. Более того, некоторые инструменты намеренно избегают излишнего реализма, и обращают свою искусственность в пользу. Но как именно человек определяет, настоящий ли перед ним человеческий голос, и голос ли вообще?

post

Первые шаги в сторону различимости человеческого голоса сделали телефонные компании. Эксперименты под руководством ученого Харви Флетчера показали, что разборчивость речи сосредоточена в узкой полосе частот — от 300 до 3400 Гц. Всё, что выходит за эти границы, вносит вклад в тембр и «живость» голоса, но не в его разборчивость для речи. Значит, именно это можно было безболезненно отрезать. Эта полоса и стала стандартом телефонной передачи.

Подобные решения были сделаны, прежде всего, ради экономии. Данный порог демонстрирует лишь удовлетворительное значение для того, чтобы отчетливо распознавать речь и её характерные черты. Впоследствии, с такой же целью, будет попытка заменить человеческий голос синтезированным во время радио-переговоров. Но всё-таки для того чтобы потреблять информацию на постоянной основе, как это происходит в наше время, нужен более качественные источники аудиальных сигналов, а для этого нужна деконструкция речи и полное понимание того, как она устроена — именно так и произошла эволюция от первых синтезаторов речи до нейросетевых инструментов.

Исходный размер 760x611

Демонстрация устройства «Voder»

Но где предел, когда мы начинаем чувствовать себя дискомфортно от прослушивания речи? Данная работа посвящена тому, как человек идентифицирует искусственный голос от настоящего, и какие подсознательные мыслительные процессы за этим стоят. Разберу путь от первых попыток машинного и электронного воспроизведения человеческого голоса до современных нейросетевых структур, способных воссоздать его настолько близко, насколько пока позволяет технологический прогресс.

Из живого голоса в цифровой

Первыми, кто всерьёз занялся проблемой передачи звукового сигнала на расстояние, стали телефонные компании. Как и в любом другом бизнесе, их основной «товар», то есть успешно проведённый звонок — неизбежно сталкивался с определённым процентом брака. Именно с проблемой неудачных и неразборчивых переговоров компании и пытались бороться.

Исходный размер 1608x1784

Александр Грэм Белл читает лекцию в Сейлеме, штат Массачусетс (сверху), в то время как его друзья в кабинете в Бостоне слушают лекцию по телефону, 12 февраля 1877 года.

post

Среди них особое место заняла американская Bell Telephone Company, основанная Александром Беллом в 1877 году — спустя год после того, как он запатентовал первый телефон. Компания росла стремительно и к началу XX века превратилась в телекоммуникационную монополию, слившись с дочерней AT&T. Для решения подобных инженерных задач в 1925 году было учреждено отдельное научное подразделение — Bell Laboratories. Именно оно на протяжении следующих десятилетий стало главным местом, где рождались фундаментальные технологии обработки звука.

Исходный размер 1024x767

Исследователи Уиллард Бойл (слева) и Джордж Смит в лаборатории Bell Labs в Мюррей-Хилл, штат Нью-Джерси, 1974 год

Звуковой сигнал по телефонным линиям в те годы передавался аналоговым способом, то есть непрерывными электрическими колебаниями. Главными проблемами данного способа были в ограничении количества одновременных звонков, и том, что на сверхдальних расстояниях качество принимаемого сигнала очень сильно деградировало. Происходило это из-за того, что сигнал на дальние расстояния нужно усиливать, а вместе с тем усиливается и фоновый шум, который мешал диалогу.

Исходный размер 708x531

Первый трансатлантический телефонный кабель, завершённый в 1956 году, в месте, где он уходил на мелководье у берегов Ньюфаундленда.

post

Решением этих проблем стал метод PCM — Puls-Code-Modulation, или же импульсно-кодовая модуляция. Британский инженер Алек Ривс сформулировал концепцию в 1937 году, работая во французской телефонной компании. Независимо от него исследователи Bell Labs — Клод Шеннон, Бернард Оливер и Джон Пирс — развили теорию и опубликовали совместную работу «The Philosophy of PCM» в 1948 году. Принцип действует следующим образом — непрерывный сигнал с помощью АЦП (аналого-цифрового преобразователя) дробится на равные промежутки, округляется до ближайшего целого числа, чтобы эти числа добирались до абонентов без потерь.

Исходный размер 603x250

Принцип работы PCM для записи синусоидальной волны

Однако можно было пустить ещё большее количество одновременных звонков, если сжать сигнал — выбросить из него всё лишнее, оставив лишь то, что делает голос узнаваемым. Как уже писалось выше, подобным исследованием занялся физик Харви Флетчер, который выделил частотный диапазон для разборчивой речи во время телефонного разговора — от 300 до 3400 Гц.

Исходный размер 1796x534

Наглядное представление диапазона частот от 300 до 3000 Гц.

Демонстрация телефонного разговора с урезанными частотами
1 мин

Первые имитации человеческого голоса

Исследуя человеческий голос и его разборчивость, в 1939 году инженеры Bell Labs представили устройство под названием VODER (сокр. Voice Operating Demonstrator) — первый электронный синтезатор речи. В нём не было никаких предзаписанных звуков, вместо этого оператор управлял им вручную с помощью клавиатуры и педалей, словно на обычном синтезаторе. Звук, имитирующий речь, формировался из двух составляющих: шума и тонального сигнала. И если первый служил для того чтобы имитировать дыхание и шипящие, то второй формировал гласные звуки.

Loading...
post

Результат звучал механически и жутковато — тембр не менялся в течении одного слога или даже фонемы. Такая речь человеком подсознательно не воспринимается за настоящую. Различить слова, конечно, абсолютно реально, но вместе с тем появляется и ощущение тревоги. В поп-культуре подобному феномену приписывают название Uncanny Valley, или же «Зловещая Долина». Такое понятие ввёл робототехник Масахиро Мори, опубликовав работу 不気味の谷現象 (bukimi no tani genshō). Эффект заключается в том, что при определенном уровне антропоморфности робота, от них в голове появляется жуткий дискомфорт. Если приводить параллели с левым графиком, то в сфере психоакустики подобно промышленному роботу выступает обычный синтезатор, который воспроизводит ноты. VODER же подпадает под категорию «зомби», пытаясь походить на человека, но исключив всякую эмоциональность.

С подобной проблемой будут сталкиваться и многие последующие проекты, но на момент 1939 года это был настоящий прорыв. Инструмент умел воспроизводить не только едва различимые слова, но и интонационные выделения. Параллельно с этим в той же Bell Labs разрабатывался прибор с противоположной задачей — Vocoder (сокр. Voice Coder).

Исходный размер 2364x1707

Вокодер HY-2 — военное устройство эпохи Вьетнамской войны.

Форма голоса: эволюция синтезаторов речи и как на них реагирует мозг.
Проект создан 28.05.2026