Как компьютеры говорят голосами людей — от первых синтезаторов до ИИ, который копирует вас за секунды
Как компьютеры научились говорить голосами людей: от роботизированного «Привет» до ИИ-копии за секунду
Когда вы разговариваете с Siri или Алисой, они отвечают голосами, которые звучат почти по-человечески. Но как компьютеры, смартфоны и приложения вообще умеют говорить? Они используют технологию, которая называется «синтез речи» (text-to-speech). Когда вы говорите, ваши лёгкие проталкивают воздух через голосовые связки в горле, они вибрируют и создают звук. Мозг управляет ртом, языком и губами, чтобы придать этому звуку форму слов. Компьютер имитирует этот процесс: он посылает электрические сигналы крошечному динамику, который быстро вибрирует, создавая звуковые волны. Программное обеспечение управляет сигналами, чтобы формировать звук в речь.
Когда компьютер хочет сказать «Привет, как дела?», он разбивает слова на мельчайшие звуковые частицы — фонемы. Фонемы — это строительные блоки речи, например звуки «ш», «и» и «п», из которых складывается «шип». Программа создаёт фонемы и группирует их в правильном порядке, чтобы получились слова. Человеческий мозг и рот делают то же самое.
Роботизированная речь: от кузнечных мехов до синтезаторов
Ещё в XVIII веке изобретатели пытались создать машины, работающие как лёгкие и горло. Они использовали меха (большие надувные мешки, которые сжимал человек), чтобы проталкивать воздух через трубы, свистки и кожаные трубки. Звуки, которые получались, были писклявыми, странными и жутковатыми. Первые электронные речевые машины — синтезаторы — появились в 1930-х. Одна из самых известных, Voder, дебютировала на Всемирной выставке в Нью-Йорке в 1939 году. Она выглядела как орган: оператор нажимал кнопки, клавиши и педали, чтобы выжать из неё фразы вроде «Доброе утро!». В 1960-х компьютеры начали собирать речь из фонем — но звучало это жёстко и роботизированно, как «Здрав-ствуй-те-я-ком-пью-тер».
От спектрограмм к машинному обучению
Старые голоса были роботизированными и «рваными», потому что программы сшивали короткие звуки, извлечённые из записей. Эти карты — спектрограммы — выглядели как графики с пиками и впадинами, показывающими силу каждого тона в каждый момент времени. Программы складывали эти карты как пазл и превращали обратно в звук. Метод работал, но звучал неестественно. Сегодняшние компьютеры используют машинное обучение — разновидность искусственного интеллекта. Инженеры дают ИИ-программе много часов записей реальных людей. Программа анализирует всё: дыхание, смех, изменение высоты голоса при волнении. Это позволяет компьютеру формировать фонемы в слова и предложения так же тонко, как это делают люди.
Дипфейки голоса: когда технология становится оружием
Современный ИИ может послушать ваш голос всего несколько секунд, выучить его и скопировать так, чтобы он звучал именно как вы. Он может говорить фразы, которых вы никогда не произносили, голосом, который звучит как ваш. Это помогает миллионам людей: в навигаторах, для чтения новостей незрячим, для озвучивания текста. Но эту же технологию используют мошенники — создают поддельные голоса, чтобы выдавать себя за родственников, коллег или знаменитостей. Учёные работают над инструментами, которые могут отличить настоящий голос от поддельного, чтобы остановить мошенников.
Ключевые факты
- Фонемы: мельчайшие звуковые единицы, из которых строится речь
- Первый синтезатор: Voder (1939, Всемирная выставка в Нью-Йорке)
- Метод 1960-х: соединение фонем из спектрограмм (звучало роботизированно)
- Современный подход: машинное обучение на тысячах часов человеческой речи
- ИИ-клонирование: несколько секунд записи — и голос скопирован
- Риск: аудио-дипфейки — поддельные голоса для мошенничества
- Решение: разрабатываются инструменты для выявления синтетических голосов
Сравнение: старая vs новая технология синтеза речи
| Аспект | Классический синтез (1960–2000) | Современный ИИ-синтез (2020–н.в.) |
|---|---|---|
| Метод | Сшивание заранее записанных фонем (спектрограммы) | Машинное обучение на больших данных человеческой речи |
| Качество речи | Роботизированное, «рваное» | Естественное, с интонациями, дыханием, эмоциями |
| Адаптация к голосу | Только заранее записанный набор звуков | Может скопировать голос конкретного человека за секунды |
| Сложность | Ручная настройка параметров | Автоматическое обучение на данных |
| Риски | Минимальные (звучит нереалистично) | Высокие (аудио-дипфейки, мошенничество) |
Итог: Компьютеры научились говорить не потому, что у них есть голосовые связки, — они научились имитировать то, как мы дышим, смеёмся и удивляемся. Сегодняшний синтез речи — это не просто слова. Это эмоции, паузы, характер. Но с этой силой пришла и новая опасность: поддельные голоса, которые звучат как настоящие. Теперь, когда Siri отвечает вам, спросите себя: не говорит ли она голосом, который научился быть слишком человечным?
ДРУГИЕ СТАТЬИ
13.08.2026
Много друзей или несколько близких? Исследование говорит: это ложный выбор
Между семьёй, работой, домашними делами и прочими обязанностями люди часто чувствуют, что у них остаётся очень мало времени на друзей — не говоря уже о том, чтобы заводить новых. Поскольку время — ограниченный ресурс, часто считается, что приходится выбирать: либо несколько эмоционально близких друзей, либо много друзей, в которых вы меньше вкладываетесь. Но наше новое исследование, опубликованное в журнале Evolution and Human Behavior, показывает: на самом деле люди не выбирают
11.08.2026
Первая мРНК-вакцина от гриппа одобрена в США. Что дальше?
Вакцины надёжно и недорого защищают людей от болезней уже много веков. Но до пандемии COVID-19 разработка вакцин оставалась долгим и сложным процессом. Для каждого кандидата приходилось создавать индивидуальные производственные линии, а знания, полученные для одной вакцины, часто не помогали в создании другой. МРНК-вакцины от COVID изменили подход к разработке вакцин. А 5 августа 2026 года Управление по санитарному надзору за качеством пищевых продуктов и медикаментов США (FDA) одобрило ещё од
07.08.2026
Водители такси реже умирают от Альцгеймера: как навигация защищает мозг
Таксисты и водители скорой помощи реже, чем работники почти любой другой профессии, умирают от болезни Альцгеймера. Таков неожиданный результат исследования 2024 года, в котором изучались свидетельства о смерти почти 9 миллионов человек в США. Эти выводы меня поразили, потому что эти две профессии используют то же, что и моя работа: карты. Я провёл более двух десятилетий, глядя на карты. Не на бумажные, а на цифровые, с множеством слоёв: границы наводнений, наложенные на ква
04.08.2026
Тираннозавр за $50 млн: когда окаменелость становится трофеем, наука проигрывает
14 июля 2026 года «Гас» — один из самых полных скелетов тираннозавра рекса — ушёл с молотка за $50,1 млн. Покупатель остался неизвестным. Аукцион Sothebys установил рекорд для самого дорогого ископаемого в истории. Ещё один динозавр пополнил рынок предметов роскоши — напоминание о том, что даже глубочайшая история Земли может быть продана тому, кто больше заплатит.
Для палеонтологов окаменелость — не трофей и не произведение искусства. Это уникальный научный архив. Ис
ПИШИТЕ
Техническая поддержка проекта ВсеТут