← Блог

Гайд · синтез речи

Как озвучить текст нейросетью: подробный гайд

7 мин

Как озвучить текст нейросетью и получить живое, естественное звучание? Принято считать, что эмоционально прочитать текст может только диктор, а удел нейросетей и TTS-сервисов — роботизированные голоса, которые годятся максимум для чат-ботов или голосовых помощников. Покажем, что это не так: нейросетью можно достойно озвучить и рекламу, и подкаст, и ИИ-персонажа, и даже аудиокнигу. Пройдём весь путь — от текста до озвучки — на этом примере:

«Знаешь, что в твоём телефоне вычислительной мощности больше, чем во всём НАСА в 1969 году? Тогда компьютеры, отправившие людей на Луну, занимали целые комнаты, а памяти в них было в тысячи раз меньше, чем в одной твоей фотографии. Легендарный бортовой компьютер «Аполлона» был слабее простого калькулятора. А ты носишь в кармане устройство, которое обгоняет всю технику той эпохи вместе взятую, — и чаще всего смотришь на нём видео с котами. Подпишись — тут только самое удивительное!»

1Подготовка текста

Загрузить текст в интерфейс можно двумя способами: вставить в окно редактора или из файла TXT, DOCX или PDF. Для лучшего качества озвучки можно писать цифры прописью, чтобы нейросеть не путалась в падежах и склонениях, и проставлять ударения.

Главное: знаки препинания — это интонация. Точка даёт паузу и понижение тона, запятая — короткую задержку, восклицательный знак — эмоцию. А авторазметка поправит текст там, где он может быть неоднозначным для озвучки.

После этого ваш текст готов к озвучиванию.

2Выбор модели

Выбор модели очень индивидуален и зависит от ваших целей, бюджета и личных предпочтений. Для массовой или черновой озвучки подойдут бюджетные модели. Но если важны качество и гибкая настройка голоса, стоит попробовать семейства Google Gemini и ElevenLabs: большой выбор голосов, которые можно гибко настроить — добавить или убавить эмоций и выразительности, изменить скорость речи. Сравнить голоса и модели можно в каталоге моделей синтеза речи.

Кроме работы с голосом, у этих моделей свой язык разметки: можно вставлять паузы разной длительности, добавлять звуки — например, вздох или покашливание, — или озвучить фразу шёпотом. У ElevenLabs эмоции можно передавать точечно, прямо в тексте, а в Gemini голос и подачу можно описать промптом в свободной форме.

ElevenLabs — ползунки
Gemini — эмоции промптом

Самые частые эмоции и звуки собраны прямо под текстом — вставляются в один клик:

Эмоции
РадостноГрустноЗлоУдивлённоВзволнованноСаркастичноЛюбопытно
Звуки
СмехСмешокВздохШёпотАх!Откашливание

3Настройка голоса

В каждой модели есть набор голосов — все можно послушать, нажав «Выбрать голос». Выберем Charlotte у ElevenLabs и посмотрим, как его настроить. У голоса несколько параметров: стабильность, сходство с голосом и экспрессия. Чтобы понять, на что влияет каждый, нажмите «Как звучат?» — там есть превью для каждого параметра и каждого его значения.

«Как звучат?» — превью каждого параметра и его значения

Вот эта озвучка — Charlotte, где все параметры по нулям и без какой-либо разметки. А вторая — с подобранными настройками и размеченным текстом. Разница слышна сразу:

Размеченный текст и подобранные настройки Charlotte
Charlotte: до и после настройки
#t0yusulElevenLabs v3Charlottev3параметры по нулям, без разметки
00:00
#cmm185zElevenLabs v3Charlottev3настройки + разметка текста
00:00

4Работа с фрагментами

А теперь попробуем модель Gemini с голосом Aoede. Захотелось поэкспериментировать с эмоциональностью отдельных кусков текста, поэтому разобьём его на фрагменты. Так можно точечно играть с настройками и эмоциями голоса на одной части текста — например, добавить сарказма во второй фрагмент и переозвучить только его.

Главное: перегенерируй только изменённый фрагмент — не тратишь токены на то, что уже получилось хорошо. Изменённый, но ещё не озвученный фрагмент подсвечивается — сразу видно, что переделать.

Один фрагмент помечен «изменён · не озвучен»

5Сравниваем модели

Один и тот же текст мы озвучили несколькими моделями — от бюджетной до самой выразительной. Послушайте и сравните, как звучит каждая:

Результаты озвучки
#r050wx8Yandex SpeechKitSTDбюджетная модель
00:00
#5l9oy7fGemini 3.1 TTSAoedeHDголос описан промптом в свободной форме
00:00
#rif4lxgElevenLabs v3Alicev3разметка эмоций и пауз в тексте
00:00

Частые вопросы

Можно ли озвучить текст нейросетью бесплатно?

Да. Можно вставить текст, выбрать голос и послушать результат без оплаты. Полноценная озвучка и скачивание аудио — по тарифам.

Какая нейросеть лучше озвучивает русский текст?

Зависит от задачи: для черновой и массовой озвучки хватает бюджетного Yandex SpeechKit, а для выразительного звучания с эмоциями лучше подойдут Google Gemini и ElevenLabs.

Как сделать, чтобы озвучка звучала реалистично?

Приведите текст в порядок — расставьте пунктуацию и ударения, числа напишите прописью. Затем подберите настройки голоса и разметьте эмоции тегами, а длинный текст разбейте на фрагменты.

Можно ли исправить одну фразу, не переозвучивая весь текст?

Да. Разбейте текст на фрагменты и перегенерируйте только нужный — токены на удачные части не тратятся.

Актуальные цены и пакеты токенов — на странице тарифов.

Надеемся, статья была для вас полезна. Хорошей вам работы с озвучкой!