Google выпустила Gemini 3.8 с реалистичной речью и функцией голосового клонирования

Google выпустила новинки — модели Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS, которые способны генерировать естественное звучание речи. Эти технологии позволяют создавать голоса с нуля, управляя их эмоциями, темпом и стилем. Модели уже доступны разработчикам через Gemini API и Google AI Studio, как сообщается на blog.google.

Gemini 3.8 Flash TTS нацелена на разработку персонажей и сложные аудиосценарии. Пользователи могут описать желаемый голос, его акцент и характеристики более чем на 100 языках и диалектах. Кроме того, Google предоставляет доступ к библиотеке из свыше 2000 готовых голосов.

Еще одна важная функция — воссоздание голоса на основе 30-секундного аудиофрагмента. Google уточняет, что для этого требуется согласие владельца голоса. Сгенерированный аудио также получает невидимый водяной знак SynthID для идентификации контента, созданного искусственным интеллектом.

Эти модели позволяют точечно управлять озвучкой, добавляя указания по эмоциям, паузам, темпу и интонации, а также звукам, таким как смех или вздохи. Gemini 3.8 Flash TTS поддерживает сцены с двумя собеседниками и сохраняет качество голосов при создании длинных записей.

Gemini 3.8 Flash-Lite TTS предназначена для массового создания аудио, включая дубляж, подкасты и голосовых ИИ-агентов. Обе модели доступны разработчикам через Google AI Studio и Gemini API, а Flash TTS также интегрируется с Gemini Notebook. Google планирует применять эту технологию для аудиоконтента, локализации и голосовых сервисов.

- Реклама -