ВИДЦИ

Standard

Бърз край до край ТТС с естествено слово

Very Fast Скорост
Good Качество
Не. Клониране
10 Езици

За ВИДЦИ

VITS (Вariacional Inference с adversarial learning for end-to-end Text-to-Speak) е бързо, крайно-конечно неврален TTS модел, който генерира естествено-звукова реч. Тя съчетава вариационни автокодери с адверсариално обучение за ефикасен синтез. VITS е отлично за партидна обработка и приложения, изискващи както качество, така и скорост.

Ключови характеристики

Бърза синтезация

Край на край архитектура за бързото построяване на речта.

Пакетна обработка

Ефективно обработване на няколко текстове едновременно.

Естествена реч

VAE+GAN обучението произвежда естествена прозодия и ритъм.

Многоговорител

Един модел поддържа няколко гласове.

Ефективно

Нисък отпечатък от памет с добро изпълнение.

Отваряне на източник

MIT лицензиран за всяка употреба.

Случаи на употреба

Създаване на пакетно звуково устройство Е-учебни платформи Читатели на новини Автоматизирани обявления ИВР системи Съдържание с високо съдържание на volume

ВИДЦИ Voices

View All 109
LJSpeech (English Female)
EN
VCTK Speaker 225 (English Female)
EN
VCTK Speaker 226 (English Male)
EN
VCTK Speaker 227 (English Male)
EN
VCTK Speaker 228 (English Female)
EN
VCTK Speaker 229
EN
VCTK Speaker 230
EN
VCTK Speaker 231
EN
VCTK Speaker 232
EN
VCTK Speaker 233
EN
VCTK Speaker 234
EN
VCTK Speaker 236
EN

Как да използвате ВИДЦИ

  1. 1

    Запишете се безплатно или опитайте демото

    Създавайте безплатен акаунт TextToSpeechAI за да получите стартер кредити, или използвайте демото на страницата, за да чуете VITS преди да се регистрира.

  2. 2

    Изберете глас или говорител на VITS

    Преглед на гласовата библиотека и изберете глас, маркиран с значката VITS. Библиотеката с многоизказватели VITS, включително настройката на VCTK, ви позволява да изберете от много различни гласове.

  3. 3

    Въведете вашия текст

    Въведете или вметнете текста, който искате да се говори в редактора. VITS се справя добре с дълги пасажи и е идеален за партидно и високо обемно съдържание.

  4. 4

    Създаване на звука

    Кликнете върху генериране, за да синтезирате речта с VITS. Тъй като VITS е много бързо и стандартно-тир (10 кредита на 1000 символа), резултатите се връщат бързо с ниска цена.

  5. 5

    Изтеглете или използвайте API

    Изтеглете завършения звук като MP3, WAV или OGG, или се обадите на същия VITS глас чрез TextToSpeechAI REST API, за да автоматизирате поколението си в собствената програма.

ВИДЦИ АПИ

Генериране на речна програма с помощта на TextToSpeechAI REST API.

curl -X POST "https://api.texttospeechai.com/v1/generate/" \
  -H "Authorization: Bearer YOUR_API_TOKEN" \
  -H "Content-Type: application/json" \
  -d '{
    "text": "VITS осигурява бързо, естествено говорене за високообемни приложения.",
    "voice": "vits-ljspeech"
  }'

Често задавани въпроси

VITS (Вariacional Inference с adversarial learning за крайно-то-крайно Текст-то-говорене) е край-то-краен неврален TTS модел, който съчетава вариационен автокодер с адверсални GAN обучение. Той генерира естествено-звучаща реч в един проход, което го прави бързо и ефективно. Можете да опитате VITS безплатно на TextToSpeechAI.

Да, VITS е отворен източник по лиценза на МИТ, така че той подкрепя пълното търговско използване без ограничения. Той се използва широко в търговски продукти и услуги. На TextToSpeechAI, ВИТС струва 10 кредита на 1000 символа на стандартния ниво.

TextToSpeechAI предлага голям многоговорител VTS библиотека, включително VCTK гласов набор с десетки различни английски говорители. Един единствен модел VTS може да приеме много оратори, така че можете да изберете от много различни гласове без да превключвате двигатели.

Поддръжката на VITS зависи от обучения модел. Обикновените модели на VITS обхващат английски, китайски, японски, корейски, немски, френски и други основни езици, с многоизказвателска англиска покритие от VCTK данни.

VITS е много бързо, генерирайки реч в реално време или по-бързо в GPU. Нейната крайна архитектура избягва многократните етапи на обработка на други модели, затова VITS е добре подходящ за партиден и високо обем синтез.

Не, VITS не подкрепя клонирането на гласа. Използва предварително обучени многоизказвачи модели вместо да копира целевия глас от проба. За клониране на гласа на TextToSpeechAI, използвайте F5-TTS или GPT-SoviTS вместо това.

VITS произвежда добро качество на звука с естествена прозодия и ритъм. Въпреки че не е на нивото на StyleTTS 2 или Tortoise, той предлага отлично качество за своята скорост, особено за преработка на партиди.

VITS е паметно ефективен, обикновено се нуждае от само няколко GB от VRAM (около 4GB). Той работи удобно на потребителски GPUs, а на TextToSpeechAI всички излъчвания се случват на нашите сървъри, така че не се нуждаете от хардуер от собствена.

VITS и Piper са и бързи, лицензирани от MIT Standard-tier двигатели на TextToSpeechAI. Piper е най-лекият и най-бързият вариант, докато VITS предлага голяма многоизказвателна библиотека (включително VCTK) с малко по-естествена прозодия. Нито поддържа клониране на гласа.

VITS е стандартен двигател, който струва 10 кредита на 1000 символа. Това е най-ниският ни ценовия чин благодарение на ефикасния, бърз характер на модела VITS.

VITS генерира звук на 22050Hz натурално. През TextToSpeechAI можете да поискате MP3, WAV или OGG, с автоматична конверсия, обработена за вас.

Регистрирайте се на TextToSpeechAI, за да получите безплатни за начало кредити, след това изберете глас на VITS, впишете вашия текст и генерирате звук. Можете също така да използвате демото, за да чуете VITS преди създаването на сметка, и достъп до VITS чрез нашия REST API след като се регистрирате.

Technical Specs

  • Generation Speed Very Fast
  • Output Quality Good
  • Voice Cloning Not Supported
  • Languages 10
  • GPU VRAM 1-2GB
  • Credits/1000 chars 10

Try ВИДЦИ Now

Generate your first audio free. No credit card required.

Start Free