Содержание
— Концепция — Из живого голоса в цифровой — Первые имитации человеческого голоса — Формантный и конкатенативный синтезы — Нейросети — Заключение
Концепция
Голос человека является одним из наиболее информативно насыщенных акустических сигналов, с которыми работает человеческая слуховая система. Помимо вербального содержания, он несёт в себе и другие аспекты речи — эмоциональное состояние, физиологические характеристики, намерения и идентичность. Способность воспринимать человеческую речь неосознанно формировалась эволюционно, что поспособствовало ей укорениться в нашей нервной системе.

Спектрограмма человеческого голоса в ПО «iZotope RX 11».
Последние десятилетия люди стараются разрабатывают различные методы, каким образом можно этот голос «синтезировать» — создать его эмуляцию исключительно аппаратным способом. Некоторые голоса создаются с полного нуля, для некоторых же используются уж сделанные записи голоса человека.
Подобные технологии сегодня окружают нас практически ежедневно: умные колонки и голосовые ассистенты, озвучка текстов в онлайн-переводчиках, помощь незрячим, и так далее. Мы уже научились с ними жить и можем четко определить, где и какой голос нас окружает. Более того, некоторые инструменты намеренно избегают излишнего реализма, и обращают свою искусственность в пользу. Но как именно человек определяет, настоящий ли перед ним человеческий голос, и голос ли вообще?

Первые шаги в сторону различимости человеческого голоса сделали телефонные компании. Эксперименты под руководством ученого Харви Флетчера показали, что разборчивость речи сосредоточена в узкой полосе частот — от 300 до 3400 Гц. Всё, что выходит за эти границы, вносит вклад в тембр и «живость» голоса, но не в его разборчивость для речи. Значит, именно это можно было безболезненно отрезать. Эта полоса и стала стандартом телефонной передачи.
Подобные решения были сделаны, прежде всего, ради экономии. Данный порог демонстрирует лишь удовлетворительное значение для того, чтобы отчетливо распознавать речь и её характерные черты. Впоследствии, с такой же целью, будет попытка заменить человеческий голос синтезированным во время радио-переговоров. Но всё-таки для того чтобы потреблять информацию на постоянной основе, как это происходит в наше время, нужен более качественные источники аудиальных сигналов, а для этого нужна деконструкция речи и полное понимание того, как она устроена — именно так и произошла эволюция от первых синтезаторов речи до нейросетевых инструментов.
Демонстрация устройства «Voder»
Но где предел, когда мы начинаем чувствовать себя дискомфортно от прослушивания речи? Данная работа посвящена тому, как человек идентифицирует искусственный голос от настоящего, и какие подсознательные мыслительные процессы за этим стоят. Разберу путь от первых попыток машинного и электронного воспроизведения человеческого голоса до современных нейросетевых структур, способных воссоздать его настолько близко, насколько пока позволяет технологический прогресс.
Из живого голоса в цифровой
Первыми, кто всерьёз занялся проблемой передачи звукового сигнала на расстояние, стали телефонные компании. Как и в любом другом бизнесе, их основной «товар», то есть успешно проведённый звонок — неизбежно сталкивался с определённым процентом брака. Именно с проблемой неудачных и неразборчивых переговоров компании и пытались бороться.
Александр Грэм Белл читает лекцию в Сейлеме, штат Массачусетс (сверху), в то время как его друзья в кабинете в Бостоне слушают лекцию по телефону, 12 февраля 1877 года.

Среди них особое место заняла американская Bell Telephone Company, основанная Александром Беллом в 1877 году — спустя год после того, как он запатентовал первый телефон. Компания росла стремительно и к началу XX века превратилась в телекоммуникационную монополию, слившись с дочерней AT&T. Для решения подобных инженерных задач в 1925 году было учреждено отдельное научное подразделение — Bell Laboratories. Именно оно на протяжении следующих десятилетий стало главным местом, где рождались фундаментальные технологии обработки звука.
Исследователи Уиллард Бойл (слева) и Джордж Смит в лаборатории Bell Labs в Мюррей-Хилл, штат Нью-Джерси, 1974 год
Звуковой сигнал по телефонным линиям в те годы передавался аналоговым способом, то есть непрерывными электрическими колебаниями. Главными проблемами данного способа были в ограничении количества одновременных звонков, и том, что на сверхдальних расстояниях качество принимаемого сигнала очень сильно деградировало. Происходило это из-за того, что сигнал на дальние расстояния нужно усиливать, а вместе с тем усиливается и фоновый шум, который мешал диалогу.
Первый трансатлантический телефонный кабель, завершённый в 1956 году, в месте, где он уходил на мелководье у берегов Ньюфаундленда.

Решением этих проблем стал метод PCM — Puls-Code-Modulation, или же импульсно-кодовая модуляция. Британский инженер Алек Ривс сформулировал концепцию в 1937 году, работая во французской телефонной компании. Независимо от него исследователи Bell Labs — Клод Шеннон, Бернард Оливер и Джон Пирс — развили теорию и опубликовали совместную работу «The Philosophy of PCM» в 1948 году. Принцип действует следующим образом — непрерывный сигнал с помощью АЦП (аналого-цифрового преобразователя) дробится на равные промежутки, округляется до ближайшего целого числа, чтобы эти числа добирались до абонентов без потерь.
Принцип работы PCM для записи синусоидальной волны
Однако можно было пустить ещё большее количество одновременных звонков, если сжать сигнал — выбросить из него всё лишнее, оставив лишь то, что делает голос узнаваемым. Как уже писалось выше, подобным исследованием занялся физик Харви Флетчер, который выделил частотный диапазон для разборчивой речи во время телефонного разговора — от 300 до 3400 Гц.
Наглядное представление диапазона частот от 300 до 3000 Гц.
Первые имитации человеческого голоса
Исследуя человеческий голос и его разборчивость, в 1939 году инженеры Bell Labs представили устройство под названием VODER (сокр. Voice Operating Demonstrator) — первый электронный синтезатор речи. В нём не было никаких предзаписанных звуков, вместо этого оператор управлял им вручную с помощью клавиатуры и педалей, словно на обычном синтезаторе. Звук, имитирующий речь, формировался из двух составляющих: шума и тонального сигнала. И если первый служил для того чтобы имитировать дыхание и шипящие, то второй формировал гласные звуки.

Результат звучал механически и жутковато — тембр не менялся в течении одного слога или даже фонемы. Такая речь человеком подсознательно не воспринимается за настоящую. Различить слова, конечно, абсолютно реально, но вместе с тем появляется и ощущение тревоги. В поп-культуре подобному феномену приписывают название Uncanny Valley, или же «Зловещая Долина». Такое понятие ввёл робототехник Масахиро Мори, опубликовав работу 不気味の谷現象 (bukimi no tani genshō). Эффект заключается в том, что при определенном уровне антропоморфности робота, от них в голове появляется жуткий дискомфорт. Если приводить параллели с левым графиком, то в сфере психоакустики подобно промышленному роботу выступает обычный синтезатор, который воспроизводит ноты. VODER же подпадает под категорию «зомби», пытаясь походить на человека, но исключив всякую эмоциональность.
С подобной проблемой будут сталкиваться и многие последующие проекты, но на момент 1939 года это был настоящий прорыв. Инструмент умел воспроизводить не только едва различимые слова, но и интонационные выделения. Параллельно с этим в той же Bell Labs разрабатывался прибор с противоположной задачей — Vocoder (сокр. Voice Coder).
Вокодер HY-2 — военное устройство эпохи Вьетнамской войны.




