VITS

Standard

Rýchly end-to-end TTS s prirodzenou rečou

Very Fast Rýchlosť
Good Kvalita
Nie Klonovanie
1 Jazyky

O nás VITS

-efficient, and low-cost TTS model that generates natural-sounding speech. It combines variational autoencoders with adversarial learning for efficient synthesis. VITS is excellent for batch processing and applications requiring high-efficiency, low-cost, and low-cost TTS models that generate natural-sounding speech. It combines variational autoencoders with

Kľúčové vlastnosti produktu

Rýchla syntéza

Komplexná architektúra pre rýchle generovanie reči.

Dávkové spracovanie

Efektívne spracovanie viacerých textov súčasne.

Prirodzená reč

VAE + GAN tréning produkuje prirodzenú prosódiu a rytmus.

Multi- reproduktorový systém

Jeden model podporuje viacero hlasov reproduktorov.

Efektívny

Nízka spotreba pamäte s dobrým výkonom.

Open source softvér

MIT licencovaný pre akýkoľvek prípad použitia.

Prípady použitia

Batch Audio generácie Platformy pre e-learning Čítačky správ Automatizované oznámenia Systémy IVR Obsah s vysokým objemom

VITS Voices

View All 109
LJSpeech (English Female)
EN
VCTK Speaker 225 (English Female)
EN
VCTK Speaker 226 (English Male)
EN
VCTK Speaker 227 (English Male)
EN
VCTK Speaker 228 (English Female)
EN
VCTK Speaker 229
EN
VCTK Speaker 230
EN
VCTK Speaker 231
EN
VCTK Speaker 232
EN
VCTK Speaker 233
EN
VCTK Speaker 234
EN
VCTK Speaker 236
EN

Ako používať VITS

  1. 1

    Zaregistrujte sa zdarma

    Vytvorte si bezplatný TextToSpeechAI účet na získanie štartovacích kreditov.

  2. 2

    Vyberte si hlas alebo reproduktor VITS

    Prehľadávajte knižnicu hlasov a vyberte si hlas označený odznakom VITS.Knižnica VITS pre viacero reproduktorov vrátane súpravy reproduktorov VCTK vám umožňuje vybrať si z mnohých rôznych hlasov.

  3. 3

    Zadajte svoj text

    VITS zvláda dlhé pasáže a je ideálny pre dávkový a veľkoobjemový obsah, ktorý je potrebné preložiť do jazyka, ktorý je pre vás najvhodnejší.

  4. 4

    Generovanie zvuku

    Keďže VITS je veľmi rýchly a štandardný (10 kreditov za 1000 znakov), výsledky sa vrátia rýchlo a za nízku cenu.

  5. 5

    Stiahnite si alebo použite API

    Stiahnite si hotový zvuk ako MP3, WAV alebo OGG, alebo volať rovnaký VITS hlas cez TextToSpeechAI REST API automatizovať generovanie vo vašej vlastnej aplikácii.

VITS API

Generujte reč programovo pomocou rozhrania REST API TextToSpeechAI.

curl -X POST "https://api.texttospeechai.com/v1/generate/" \
  -H "Authorization: Bearer YOUR_API_TOKEN" \
  -H "Content-Type: application/json" \
  -d '{
    "text": "Technológia VITS poskytuje rýchlu a prirodzenú reč pre aplikácie s vysokým objemom.",
    "voice": "vits-ljspeech"
  }'

Často kladené otázky

VITS (Variational Inference with adversarial learning for end-to-end Text-to-Speech) je neurálny model TTS, ktorý kombinuje variačný autoenkóder s konkurenčným tréningom GAN. Generuje prirodzene znejúcu reč v jednom prechode, čo je rýchle a efektívne. Môžete si vyskúšať VITS zadarmo na TextToSpeechAI.

Áno, VITS je open source pod MIT licenciou, takže podporuje plné komerčné využitie bez obmedzení, je široko používaný v komerčných produktoch a službách. Na TextToSpeechAI, VITS stojí 10 kreditov za 1000 znakov na štandardnej úrovni.

TextToSpeechAI ponúka veľkú knižnicu VITS pre viacero reproduktorov, vrátane hlasovej sady VCTK s desiatkami rôznych anglických reproduktorov.Jeden model VITS môže hostiť mnoho reproduktorov, takže si môžete vybrať z mnohých rôznych hlasov bez prepínania motorov.

Hlasy VITS na TextToSpeechAI sú anglické, čerpané z LJSpeech a VCTK reproduktorov, pre iné jazyky použite Piper alebo Bark hlasy.

VITS je veľmi rýchly, generuje reč v reálnom čase alebo rýchlejšie na GPU, jeho end-to-end architektúra sa vyhýba viacnásobným fázam spracovania iných modelov, preto je VITS vhodný pre dávkovú a veľkoobjemovú syntézu.

VITS nepodporuje klonovanie hlasu, pretože namiesto kopírovania cieľového hlasu zo vzorky používa vopred natrénované modely viacerých reproduktorov. Na klonovanie hlasu použite nástroj Clone Voice, ktorý spúšťa Chatterbox.

VITS produkuje kvalitný zvuk s prirodzenou prozódiou a rytmom, aj keď nie je na úrovni StyleTTS 2 alebo Tortoise, ponúka vynikajúcu kvalitu pre svoju rýchlosť, najmä pre dávkové spracovanie.

VITS je pamäťovo úsporný, typicky potrebuje len niekoľko GB VRAM (okolo 4GB), pohodlne beží na spotrebiteľských GPU a na TextToSpeechAI sa všetko vykresľovanie deje na našich serveroch, takže nepotrebujete žiadny vlastný hardvér.

VITS a Piper sú rýchle, MIT-licencované stroje na TextToSpeechAI. Piper je najľahšia možnosť a stojí 1 kredit za 1000 znakov, zatiaľ čo VITS (10 kreditov za 1000 znakov) ponúka veľkú knižnicu pre viacerých reproduktorov (vrátane VCTK) s trochu prirodzenejšou prozódiou. Ani jeden z nich nepodporuje klonovanie hlasu.

VITS je štandardný engine, ktorý stojí 10 kreditov za 1000 znakov, len Piper, ktorý stojí 1 kredit za 1000 znakov, stojí menej.

VITS generuje audio pri 22050Hz natívne, cez TextToSpeechAI môžete požiadať MP3, WAV alebo OGG formáty, s automatickou konverziou spracované pre vás.

Zaregistrujte sa na TextToSpeechAI získať bezplatné kredity, potom si vybrať VITS hlas, zadajte text a generovať zvuk.Môžete tiež pristupovať VITS cez naše REST API po registrácii.

Technical Specs

  • Generation Speed Very Fast
  • Output Quality Good
  • Voice Cloning Not Supported
  • Languages 1
  • GPU VRAM 1-2GB
  • Credits/1000 chars 10

Try VITS Now

Generate your first audio free. No credit card required.

Start Free