Операция выполнена!
Закрыть

Как компьютеры говорят голосами людей — от первых синтезаторов до ИИ, который копирует вас за секунды

17.08.2026 | Наука | ВСЕТУТ | |

Как компьютеры научились говорить голосами людей: от роботизированного «Привет» до ИИ-копии за секунду

Когда вы разговариваете с Siri или Алисой, они отвечают голосами, которые звучат почти по-человечески. Но как компьютеры, смартфоны и приложения вообще умеют говорить? Они используют технологию, которая называется «синтез речи» (text-to-speech). Когда вы говорите, ваши лёгкие проталкивают воздух через голосовые связки в горле, они вибрируют и создают звук. Мозг управляет ртом, языком и губами, чтобы придать этому звуку форму слов. Компьютер имитирует этот процесс: он посылает электрические сигналы крошечному динамику, который быстро вибрирует, создавая звуковые волны. Программное обеспечение управляет сигналами, чтобы формировать звук в речь.
Когда компьютер хочет сказать «Привет, как дела?», он разбивает слова на мельчайшие звуковые частицы — фонемы. Фонемы — это строительные блоки речи, например звуки «ш», «и» и «п», из которых складывается «шип». Программа создаёт фонемы и группирует их в правильном порядке, чтобы получились слова. Человеческий мозг и рот делают то же самое.

Роботизированная речь: от кузнечных мехов до синтезаторов

Ещё в XVIII веке изобретатели пытались создать машины, работающие как лёгкие и горло. Они использовали меха (большие надувные мешки, которые сжимал человек), чтобы проталкивать воздух через трубы, свистки и кожаные трубки. Звуки, которые получались, были писклявыми, странными и жутковатыми. Первые электронные речевые машины — синтезаторы — появились в 1930-х. Одна из самых известных, Voder, дебютировала на Всемирной выставке в Нью-Йорке в 1939 году. Она выглядела как орган: оператор нажимал кнопки, клавиши и педали, чтобы выжать из неё фразы вроде «Доброе утро!». В 1960-х компьютеры начали собирать речь из фонем — но звучало это жёстко и роботизированно, как «Здрав-ствуй-те-я-ком-пью-тер».

От спектрограмм к машинному обучению

Старые голоса были роботизированными и «рваными», потому что программы сшивали короткие звуки, извлечённые из записей. Эти карты — спектрограммы — выглядели как графики с пиками и впадинами, показывающими силу каждого тона в каждый момент времени. Программы складывали эти карты как пазл и превращали обратно в звук. Метод работал, но звучал неестественно. Сегодняшние компьютеры используют машинное обучение — разновидность искусственного интеллекта. Инженеры дают ИИ-программе много часов записей реальных людей. Программа анализирует всё: дыхание, смех, изменение высоты голоса при волнении. Это позволяет компьютеру формировать фонемы в слова и предложения так же тонко, как это делают люди.

Дипфейки голоса: когда технология становится оружием

Современный ИИ может послушать ваш голос всего несколько секунд, выучить его и скопировать так, чтобы он звучал именно как вы. Он может говорить фразы, которых вы никогда не произносили, голосом, который звучит как ваш. Это помогает миллионам людей: в навигаторах, для чтения новостей незрячим, для озвучивания текста. Но эту же технологию используют мошенники — создают поддельные голоса, чтобы выдавать себя за родственников, коллег или знаменитостей. Учёные работают над инструментами, которые могут отличить настоящий голос от поддельного, чтобы остановить мошенников.

Ключевые факты

  • Фонемы: мельчайшие звуковые единицы, из которых строится речь
  • Первый синтезатор: Voder (1939, Всемирная выставка в Нью-Йорке)
  • Метод 1960-х: соединение фонем из спектрограмм (звучало роботизированно)
  • Современный подход: машинное обучение на тысячах часов человеческой речи
  • ИИ-клонирование: несколько секунд записи — и голос скопирован
  • Риск: аудио-дипфейки — поддельные голоса для мошенничества
  • Решение: разрабатываются инструменты для выявления синтетических голосов

Сравнение: старая vs новая технология синтеза речи

Аспект Классический синтез (1960–2000) Современный ИИ-синтез (2020–н.в.)
Метод Сшивание заранее записанных фонем (спектрограммы) Машинное обучение на больших данных человеческой речи
Качество речи Роботизированное, «рваное» Естественное, с интонациями, дыханием, эмоциями
Адаптация к голосу Только заранее записанный набор звуков Может скопировать голос конкретного человека за секунды
Сложность Ручная настройка параметров Автоматическое обучение на данных
Риски Минимальные (звучит нереалистично) Высокие (аудио-дипфейки, мошенничество)
Итог: Компьютеры научились говорить не потому, что у них есть голосовые связки, — они научились имитировать то, как мы дышим, смеёмся и удивляемся. Сегодняшний синтез речи — это не просто слова. Это эмоции, паузы, характер. Но с этой силой пришла и новая опасность: поддельные голоса, которые звучат как настоящие. Теперь, когда Siri отвечает вам, спросите себя: не говорит ли она голосом, который научился быть слишком человечным?

ДРУГИЕ СТАТЬИ
24.09.2026
Чем выше процент жира, тем меньше точность: умные часы ошибаются в подсчёте калорий Умные часы стали популярным способом мониторинга здоровья и фитнеса. Около 100 миллионов — почти 4 из 10 — взрослых американцев владеют умными часами. По всему миру, по оценкам рынка, около 560 миллионов пользователей. Однако растущее число исследований показывает, что один из самых используемых показателей — количество сожжённых калорий — часто неточен. Я специалист по науке о физических упражнениях, изучаю поведение, связанное с физической активностью, и ин
22.09.2026
Как понять, можно ли доверять ответу ИИ на ваш вопрос Недавно я ввёл простой вопрос в поиск Google: «Сколько экранного времени — это слишком много для подростков?» Вместо ссылок, как Google делал много лет, я получил ответ, сгенерированный ИИ. Агент назвал число, затем усложнил ответ, отметив, что качество и баланс времени могут значить больше, чем количество часов, и что «слишком много» может зависеть от сна, физической активности, школьных нагрузок и настроения подростка. Я попробовал другой запрос: «Стоит ли мне принимать аспирин ежедневно?» На э
17.09.2026
Как гусеницы «слышат» без ушей: вибрации в безэховой камере раскрывают секрет В тихом летнем саду гусеница сидит на ветке, безмятежно жуя листья. Мгновение спустя она замирает. Она чувствует опасность — и как раз вовремя. Сзади приближается оса, оценивая добычу. Гусеницы табачного бражника не выглядят так, будто у них есть уши, но они способны чувствовать хищников, таких как осы. Как гусеница узнаёт о приближении осы? Учёные ещё не до конца понимают, как работают органы чувств этой гусеницы, но мы — часть команды биологов и инженеров, которые
15.09.2026
Марсоходы дают учёным взгляд с поверхности Красной планеты — загляните в центр управления NASA Свет загорается, когда я вхожу в Центр управления марсоходами в Лаборатории реактивного движения NASA в Пасадене, Калифорния, в 7:30 утра. Я первый, кто пришёл, хотя уже чувствую, что опаздываю. Где-то ночью по земному времени марсоход Curiosity завершил свой день на Марсе и передал последние изображения и измерения на орбитальный аппарат, пролетающий над ним. Орбитальный аппарат ретранслировал данные на Землю, где они теперь ждут на серверах здесь и в партн
ПИШИТЕ

Техническая поддержка проекта ВсеТут

info@vsetut.pro