Операция выполнена!
Закрыть

Как компьютеры говорят голосами людей — от первых синтезаторов до ИИ, который копирует вас за секунды

17.08.2026 | Наука | ВСЕТУТ | |

Как компьютеры научились говорить голосами людей: от роботизированного «Привет» до ИИ-копии за секунду

Когда вы разговариваете с Siri или Алисой, они отвечают голосами, которые звучат почти по-человечески. Но как компьютеры, смартфоны и приложения вообще умеют говорить? Они используют технологию, которая называется «синтез речи» (text-to-speech). Когда вы говорите, ваши лёгкие проталкивают воздух через голосовые связки в горле, они вибрируют и создают звук. Мозг управляет ртом, языком и губами, чтобы придать этому звуку форму слов. Компьютер имитирует этот процесс: он посылает электрические сигналы крошечному динамику, который быстро вибрирует, создавая звуковые волны. Программное обеспечение управляет сигналами, чтобы формировать звук в речь.
Когда компьютер хочет сказать «Привет, как дела?», он разбивает слова на мельчайшие звуковые частицы — фонемы. Фонемы — это строительные блоки речи, например звуки «ш», «и» и «п», из которых складывается «шип». Программа создаёт фонемы и группирует их в правильном порядке, чтобы получились слова. Человеческий мозг и рот делают то же самое.

Роботизированная речь: от кузнечных мехов до синтезаторов

Ещё в XVIII веке изобретатели пытались создать машины, работающие как лёгкие и горло. Они использовали меха (большие надувные мешки, которые сжимал человек), чтобы проталкивать воздух через трубы, свистки и кожаные трубки. Звуки, которые получались, были писклявыми, странными и жутковатыми. Первые электронные речевые машины — синтезаторы — появились в 1930-х. Одна из самых известных, Voder, дебютировала на Всемирной выставке в Нью-Йорке в 1939 году. Она выглядела как орган: оператор нажимал кнопки, клавиши и педали, чтобы выжать из неё фразы вроде «Доброе утро!». В 1960-х компьютеры начали собирать речь из фонем — но звучало это жёстко и роботизированно, как «Здрав-ствуй-те-я-ком-пью-тер».

От спектрограмм к машинному обучению

Старые голоса были роботизированными и «рваными», потому что программы сшивали короткие звуки, извлечённые из записей. Эти карты — спектрограммы — выглядели как графики с пиками и впадинами, показывающими силу каждого тона в каждый момент времени. Программы складывали эти карты как пазл и превращали обратно в звук. Метод работал, но звучал неестественно. Сегодняшние компьютеры используют машинное обучение — разновидность искусственного интеллекта. Инженеры дают ИИ-программе много часов записей реальных людей. Программа анализирует всё: дыхание, смех, изменение высоты голоса при волнении. Это позволяет компьютеру формировать фонемы в слова и предложения так же тонко, как это делают люди.

Дипфейки голоса: когда технология становится оружием

Современный ИИ может послушать ваш голос всего несколько секунд, выучить его и скопировать так, чтобы он звучал именно как вы. Он может говорить фразы, которых вы никогда не произносили, голосом, который звучит как ваш. Это помогает миллионам людей: в навигаторах, для чтения новостей незрячим, для озвучивания текста. Но эту же технологию используют мошенники — создают поддельные голоса, чтобы выдавать себя за родственников, коллег или знаменитостей. Учёные работают над инструментами, которые могут отличить настоящий голос от поддельного, чтобы остановить мошенников.

Ключевые факты

  • Фонемы: мельчайшие звуковые единицы, из которых строится речь
  • Первый синтезатор: Voder (1939, Всемирная выставка в Нью-Йорке)
  • Метод 1960-х: соединение фонем из спектрограмм (звучало роботизированно)
  • Современный подход: машинное обучение на тысячах часов человеческой речи
  • ИИ-клонирование: несколько секунд записи — и голос скопирован
  • Риск: аудио-дипфейки — поддельные голоса для мошенничества
  • Решение: разрабатываются инструменты для выявления синтетических голосов

Сравнение: старая vs новая технология синтеза речи

Аспект Классический синтез (1960–2000) Современный ИИ-синтез (2020–н.в.)
Метод Сшивание заранее записанных фонем (спектрограммы) Машинное обучение на больших данных человеческой речи
Качество речи Роботизированное, «рваное» Естественное, с интонациями, дыханием, эмоциями
Адаптация к голосу Только заранее записанный набор звуков Может скопировать голос конкретного человека за секунды
Сложность Ручная настройка параметров Автоматическое обучение на данных
Риски Минимальные (звучит нереалистично) Высокие (аудио-дипфейки, мошенничество)
Итог: Компьютеры научились говорить не потому, что у них есть голосовые связки, — они научились имитировать то, как мы дышим, смеёмся и удивляемся. Сегодняшний синтез речи — это не просто слова. Это эмоции, паузы, характер. Но с этой силой пришла и новая опасность: поддельные голоса, которые звучат как настоящие. Теперь, когда Siri отвечает вам, спросите себя: не говорит ли она голосом, который научился быть слишком человечным?

ДРУГИЕ СТАТЬИ
13.08.2026
Много друзей или несколько близких? Исследование говорит: это ложный выбор Между семьёй, работой, домашними делами и прочими обязанностями люди часто чувствуют, что у них остаётся очень мало времени на друзей — не говоря уже о том, чтобы заводить новых. Поскольку время — ограниченный ресурс, часто считается, что приходится выбирать: либо несколько эмоционально близких друзей, либо много друзей, в которых вы меньше вкладываетесь. Но наше новое исследование, опубликованное в журнале Evolution and Human Behavior, показывает: на самом деле люди не выбирают
11.08.2026
Первая мРНК-вакцина от гриппа одобрена в США. Что дальше? Вакцины надёжно и недорого защищают людей от болезней уже много веков. Но до пандемии COVID-19 разработка вакцин оставалась долгим и сложным процессом. Для каждого кандидата приходилось создавать индивидуальные производственные линии, а знания, полученные для одной вакцины, часто не помогали в создании другой. МРНК-вакцины от COVID изменили подход к разработке вакцин. А 5 августа 2026 года Управление по санитарному надзору за качеством пищевых продуктов и медикаментов США (FDA) одобрило ещё од
07.08.2026
Водители такси реже умирают от Альцгеймера: как навигация защищает мозг Таксисты и водители скорой помощи реже, чем работники почти любой другой профессии, умирают от болезни Альцгеймера. Таков неожиданный результат исследования 2024 года, в котором изучались свидетельства о смерти почти 9 миллионов человек в США. Эти выводы меня поразили, потому что эти две профессии используют то же, что и моя работа: карты. Я провёл более двух десятилетий, глядя на карты. Не на бумажные, а на цифровые, с множеством слоёв: границы наводнений, наложенные на ква
04.08.2026
Тираннозавр за $50 млн: когда окаменелость становится трофеем, наука проигрывает 14 июля 2026 года «Гас» — один из самых полных скелетов тираннозавра рекса — ушёл с молотка за $50,1 млн. Покупатель остался неизвестным. Аукцион Sothebys установил рекорд для самого дорогого ископаемого в истории. Ещё один динозавр пополнил рынок предметов роскоши — напоминание о том, что даже глубочайшая история Земли может быть продана тому, кто больше заплатит. Для палеонтологов окаменелость — не трофей и не произведение искусства. Это уникальный научный архив. Ис
ПИШИТЕ

Техническая поддержка проекта ВсеТут

info@vsetut.pro