Детский голос ИИ: что есть в наборе и чем заменить
Скажем сразу то, за чем обычно приходят: отдельного детского тембра в наборе озвучки нет. Пятнадцать голосов приложения — взрослые, восемь мужских и семь женских, и ни один не заявлен как голос ребёнка. Ускорить взрослый голос тоже нельзя: в форме задаются только текст и выбор тембра.
Послушать голоса набораРезультат за минуту · Есть бесплатные шаблоны
Это не значит, что задача не решается, — просто решается она не там, где ищут. Ниже: какие три голоса звучат ближе всего к детской речи, где ребёнок говорит в кадре по-настоящему, как озвучить текст от лица ребёнка на его же фотографии и по какой формуле считается цена.
Три голоса, которые ближе всего
В женской половине набора есть тембры с высокой подачей: Hope описан как девчачий и эмоциональный, Emma — как милый и задорный, Brittney — как молодёжный блогерский. Детской речи это не даёт, но даёт то, за чем обычно и приходят: лёгкую быструю интонацию без дикторской весомости. Семплы можно послушать в приложении до регистрации.
Где ребёнок говорит в кадре
Настоящая детская речь звучит там, где звук рождается вместе с картинкой, — в мультшаблонах. «Маша и Медведь», «Щенячий патруль» и «Смешарики» поздравляют ребёнка с днём рождения, и голоса героев приходят из самого ролика, а не выбираются списком. Такой вертикальный ролик собирает модель VEO Omni: восьмисекундный проход в 720p стоит двенадцать звёзд.
Текст от лица ребёнка на его фото
Есть обходной путь: «Говорящая голова» берёт снимок ребёнка и заставляет его произнести ваш текст с губами в такт. Голос всё равно выбирается из тех же пятнадцати, но на детском лице высокий женский тембр читается заметно уместнее, чем в чистом аудио. Тариф другой: две звезды за каждую секунду озвучки, потолок двадцать секунд, текст до трёхсот знаков.
Формула цены в озвучке текста
Приложение считает секунды, а не слова: пять секунд готового аудио стоят звезду, неполная пятёрка округляется вверх, и дешевле звезды не бывает даже реплика из двух слов. Длительность оценивается по тексту с темпом около пятнадцати знаков в секунду, то есть короткая фраза в семьдесят знаков уходит в один ярус. Верхний предел ввода — две тысячи знаков, это примерно двадцать семь звёзд.
Готовые шаблоны
Частые вопросы
Можно загрузить запись голоса своего ребёнка и получить такой тембр?
В озвучке текста нет: там работает закрытый список из пятнадцати пресетов, своё аудио на вход не принимается. Клонирование голоса по записи живёт в музыкальном приложении и предназначено для пения, а не для чтения текста.
Почему нельзя просто поднять тон взрослого голоса?
Параметров тона и скорости в форме нет — передаются только текст и идентификатор тембра. Это сделано намеренно: поднятый тон даёт узнаваемый мультяшный писк, который звучит хуже, чем ровный высокий женский голос.
Какой текст лучше читается высоким голосом?
Короткий и с простым синтаксисом: одна мысль в предложении, минимум причастных оборотов. Длинная официальная фраза в быстром лёгком тембре звучит неестественно, и это слышно с первых секунд.







