VITS

Standard

Rychlé ukončení TTS s přírodním projevem

Very Fast Rychlost
Good Kvalita
Ne. Klonování
10 Jazyky

O aplikaci VITS

VITS (Variational Inference with adversarial learning for end-to-end Text-to-Speech) je rychlý, konečný neurální TTS model, který vytváří přirozený zvuk řeči. Spojuje variace autoenkodéry s adversarial školením pro efektivní syntézu. VITS je vynikající pro dávkové zpracování a aplikace vyžadující jak kvalitu, tak rychlost.

Klíčové vlastnosti

Rychlá syntéza

Konec-konec architektura pro rychlé vytváření řeči.

Zpracování šarže

Efektivně zpracováváme více textů současně.

Přírodní mluva

Výcvik VAE+GAN vytváří přírodní prosodu a rytmus.

Víceproudový reproduktor

Jeden model podporuje více hlasových mluvčích.

Efektivní

Nízká paměťová stopa s dobrým výkonem.

Otevřít zdroj

MIT je držitelem licence pro případ jakéhokoliv použití.

Pouzdra na použití

Generace hlasitosti E-Učení platformy Čtečky novinek Automatická oznámení Systémy IVR Vysoký obsah volumu

VITS Voices

View All 109
LJSpeech (English Female)
EN
VCTK Speaker 225 (English Female)
EN
VCTK Speaker 226 (English Male)
EN
VCTK Speaker 227 (English Male)
EN
VCTK Speaker 228 (English Female)
EN
VCTK Speaker 229
EN
VCTK Speaker 230
EN
VCTK Speaker 231
EN
VCTK Speaker 232
EN
VCTK Speaker 233
EN
VCTK Speaker 234
EN
VCTK Speaker 236
EN

Jak se používá VITS

  1. 1

    Zaregistrujte se zdarma nebo vyzkoušejte demo

    Vytvořte si zdarma TextToSpeechAI účet pro získání startovní kredity, nebo použijte on-page demo slyšet VITS před přihlášením.

  2. 2

    Vyberte VITS hlas nebo reproduktor

    Prohlédněte si hlasovou knihovnu a zvolte hlas označený odznakem VITS. Multi-speaker VITS knihovna, včetně VCTK reproduktor set, vám umožní vybrat z mnoha různých hlasů.

  3. 3

    Zadejte svůj text

    Zadejte nebo vložte text, který chcete do editoru mluvit. VITS dobře zvládá dlouhé pasáže a je ideální pro dávkové a velkoobjemové obsahy.

  4. 4

    Generovat zvuk

    Klikněte na tlačítko generovat syntetizovat řeč s VITS. Protože VITS je velmi rychlé a Standard-tier (10 kreditů na 1000 znaků), výsledky se rychle vrátí za nízké náklady.

  5. 5

    Stáhnout nebo použít API

    Stáhněte si hotový zvuk jako MP3, WAV, nebo OGG, nebo volejte stejný VITS hlas přes TextToSpeechAI REST API automatizovat generaci ve své vlastní aplikaci.

VITS API

Generovat řeč programově pomocí TextToSpeechAI REST API.

curl -X POST "https://api.texttospeechai.com/v1/generate/" \
  -H "Authorization: Bearer YOUR_API_TOKEN" \
  -H "Content-Type: application/json" \
  -d '{
    "text": "VITS přináší rychlou, přirozenou řeč pro velkoobjemové aplikace.",
    "voice": "vits-ljspeech"
  }'

Často kladené otázky

VITS (Variational Inference with adversarial learning for end-to-end Text-to-Speech) je model koncového nervu TTS, který kombinuje variační autoenkodér s adversarial GAN školení. Vytváří přirozený zvuk řeči v jednom průchodu, který dělá to rychle a efektivně. Můžete vyzkoušet VITS zdarma na TextToSpeechAI.

Ano, VITS je otevřený zdroj pod licencí MIT, takže podporuje úplné komerční využití bez omezení. Je široce používán v komerčních produktech a službách. Na TextToSpeechAI, VITS stojí 10 kreditů na 1000 znaků na standardní úrovni.

TextToSpeechAI nabízí velkou multi-reproduktorovou VITS knihovnu, včetně hlasové VCTK sady s desítkami různých anglických reproduktorů. Jeden model VITS může hostit mnoho reproduktorů, takže si můžete vybrat z mnoha různých hlasů bez spínání motorů.

Podpora VITS závisí na vyškoleném modelu. Společné modely VITS pokrývají angličtinu, čínštinu, japonštinu, korejštinu, němčinu, francouzštinu a další hlavní jazyky, s vícepropagačním anglickým pokrytím z VCTK datového souboru.

VITS je velmi rychlý, generuje řeč v reálném čase nebo rychleji na GPU. Jeho konečná architektura se vyhýbá několika fázím zpracování jiných modelů, a proto je VITS vhodný pro dávkové a velkoobjemové syntézy.

Ne, VITS nepodporuje klonování hlasu. Používá předtrénované multi-reproduktory modely spíše než kopírování cílového hlasu ze vzorku. Pro klonování hlasu na TextToSpeechAI, použijte F5-TTS nebo GPT-SoviTS místo.

VITS produkuje kvalitní zvuk s přírodním prosodiem a rytmem. I když není na úrovni StyletTS 2 nebo Tortoise, nabízí vynikající kvalitu pro svou rychlost, zejména pro zpracování šarží.

VITS je paměťově efektivní, obvykle potřebuje jen několik GB VRAM (kolem 4GB). Je pohodlně provozován na spotřebitelských GPU a na TextToSpeechAI se na našich serverech odehrává všechna renderování, takže nepotřebujete žádný vlastní hardware.

VITS i Piper jsou rychlé, MIT-licencované standardní motory na TextToSpeechAI. Piper je nejlehčí a nejrychlejší varianta, zatímco VITS nabízí velkou multi-reproduktor knihovny (včetně VCTK) s mírně přirozenější prosodie. Ani podporuje klonování hlasu.

VITS je motor typu Standard-tier, který stojí 10 kreditů na 1000 znaků. To je naše nejnižší úroveň cen díky efektivní, rychlé povaze modelu VITS.

VITS generuje zvuk na 22050Hz nativně. Přes TextToSpeechAI můžete požádat MP3, WAV, nebo OGG formáty, s automatickou konverzi zvládnuté pro vás.

Zaregistrujte se na TextToSpeechAI získat zdarma starter kreditů, pak vyberte VITS hlas, zadejte svůj text a generovat zvuk. Můžete také použít demo slyšet VITS před vytvořením účtu, a přístup VITS prostřednictvím našeho REST API, jakmile se zaregistrujete.

Technical Specs

  • Generation Speed Very Fast
  • Output Quality Good
  • Voice Cloning Not Supported
  • Languages 10
  • GPU VRAM 1-2GB
  • Credits/1000 chars 10

Try VITS Now

Generate your first audio free. No credit card required.

Start Free