big

VoiceShift — это медиа, посвященное современной ИИ озвучке. В нем можно сравнивать разные варианты голосов, слушать примеры и участвовать в небольших экспериментах.

Сейчас ИИ уже может достаточно хорошо озвучивать тексты и персонажей.
Но не каждый сгенерированный голос звучит естественно и подходит под конкретную ситуацию.

Поэтому мне стало интересно исследовать не только качество генерации голоса, но и то, как этот голос воспринимает обычный слушатель.

Основной вопрос проекта:
Что делает искусственный голос убедительным?

Цель проекта

Цель медиа состоит в том, чтобы показать возможности ИИ озвучки через простые примеры и реакции пользователей. Я хочу сделать проект, где человек не просто читает статьи про нейросети, а может сам слушать и сравнивать разные варианты. Так можно показать, насколько сильно на восприятие влияют интонация, паузы, скорость речи и эмоциональная подача. Еще одна задача проекта состоит в том, чтобы собирать мнение большой аудитории. Ответы пользователей можно использовать для создания новых публикаций и следующих экспериментов.

Тематика

Основная тема медиа это ИИ озвучка.
Дополнительные темы: голосовой дизайн, дубляж, озвучка игр, озвучка анимации, создание персонажей, эмоции в речи.
Медиа не будет строиться только вокруг новостей про новые нейросети.Главный интерес находится именно в использовании голоса.Например, можно взять одну короткую фразу и создать несколько вариантов ее озвучки. После этого пользователи смогут выбрать тот вариант, который кажется им самым естественным или подходящим.

Как работает медиа

Сначала редакция выбирает небольшой текст или диалог. После этого создается несколько вариантов ИИ озвучки. Например, одна фраза может быть произнесена спокойно, испуганно или агрессивно.Пользователь слушает все варианты и выбирает тот, который подходит лучше. После голосования ответы пользователей собираются в общую статистику. Дальше на основе этой статистики появляется новый материал с результатами.

Формат публикаций

Один из основных форматов это сравнение нескольких голосов.
Например:
Вариант A
Вариант B
Вариант C

Пользователь может ответить: Какой голос звучит естественнее? Какой больше подходит персонажу? Какую эмоцию он передает?
После голосования можно показать результат.
Например:
12 процентов выбрали вариант A
66 процента выбрали вариант B
18 процентов выбрали вариант C

После этого в публикации объясняется, чем эти варианты отличались друг от друга. Таким образом пользователь сначала формирует свое мнение и только потом получает объяснение.

Направления контента

Первое направление: эмоции. Здесь можно исследовать, насколько хорошо ИИ передает разные эмоциональные состояния. Например, одна фраза создается с эмоциями:
страх или злость.
радость или усталость.
негодование или спокойствие.
Пользователь должен определить эмоцию только по голосу. Потом ему показывается правильный вариант.
Второе направление: персонажи.
Здесь голос подбирается под конкретного героя.
Сначала пользователю показывается изображение персонажа. Потом предлагается несколько голосов.
Так можно проверить, какой вариант большая часть аудитории считает наиболее подходящим.Третье направление: человек или ИИ.
Пользователю дают несколько голосовых записей. Некоторые записи сделаны человеком, а другие созданы ИИ. Пользователь должен попытаться определить разницу. После этого можно разобрать, какие особенности чаще всего помогают определить искусственный голос.

Четвертое направление: одна фраза
Здесь исследуется, как небольшие изменения полностью меняют смысл.
Например: «Все нормально». И: «Все… нормально».
Текст почти одинаковый, но из-за паузы ощущается по другому. Можно изменять: скорость, паузы, громкость, ударения, дыхание, интонацию.Пятое направление: неподходящий голос
Здесь специально создается голос, который не соответствует внешности персонажа. Например, большой страшный персонаж может говорить очень тихо и спокойно. Пользователи решают, делает ли такой контраст персонажа интереснее или наоборот мешает его восприятию.

Пользовательский контент

Часть материалов могут создавать сами пользователи. Они могут присылать небольшие тексты, персонажей или игровые диалоги. Редакция выбирает некоторые из них и делает несколько вариантов озвучки. После этого остальные подписчики участвуют в голосовании. Так появляется постоянный источник новых публикаций. Контент создается не только редакцией, но и самой аудиторией.

Продукт

Внутри медиа существует отдельный продукт под названием VoiceMAP.

Это сервис для тестирования разных вариантов ИИ озвучки.

Пользователь может загрузить текст или сцену и получить несколько вариантов голоса. После этого другие люди оценивают их. Сервис может собирать результаты по нескольким параметрам: естественность, эмоция, соответствие персонажу, доверие к голосу, запоминаемость.

Площадки и аудитория

Основной площадкой проекта может быть Telegram.
Там удобно публиковать короткие аудио, проводить голосования и собирать реакции. Дополнительно можно использовать ВКонтакте, короткие видео и отдельный сайт с архивом экспериментов.Основная аудитория проекта: люди, которые интересуются ИИ, разработчики игр, авторы анимации, начинающие актеры озвучки, саунд дизайнеры, обычные пользователи, которым интересно сравнивать голоса.

УТП

Проект отличается от обычных медиа об искусственном интеллекте тем, что не концентрируется только на технологиях и новостях.
Проект исследует, как человек воспринимает ИИ озвучку в реальных ситуациях.
Пользователь слушает разные варианты голосов, сравнивает эмоции, интонацию, паузы и соответствие персонажу.
Ответы аудитории собираются в статистику и становятся основой новых материалов.
Главное отличие проекта в том, что ИИ голос оценивается не только по техническому качеству, но и по тому, насколько живым, естественным и убедительным он кажется человеку.